it's free*.ai

Verzeichnis · geprüft 2 Sep 2026

KI-Modelle auf dem eigenen Rechner ausführen

Keine Ratengrenze, kein Schlüssel, nichts verlässt das Gerät — die einzige Obergrenze ist Ihre Hardware. Das sind die Laufzeiten, die man kennen sollte, von einer Ein-Zeilen-CLI bis zum Server, den die Produktion tatsächlich nutzt.

Wählen Sie nach Form statt nach Benchmark: Ollama, wenn Sie in einer Minute startklar sein wollen, LM Studio, wenn Sie kein Terminal anfassen wollen, MLX auf einem M-Series-Mac, vLLM, wenn Sie für andere ausliefern.

Ollama

CLI + Server

Ein Befehl, und das Modell läuft auf deinem Rechner. Keine Limits, keine Quotas.

localhost:11434/v1

LM Studio

Desktop-App

Ollama mit GUI: finden, laden und lokal chatten.

localhost:1234/v1

llama.cpp

Engine

Die Engine, auf der fast alles andere läuft. Pures C++, keine Abhängigkeiten.

localhost:8080/v1

Jan

Desktop-App

Open-Source-ChatGPT-Alternative, die zu 100 % offline funktioniert.

localhost:1337/v1

GPT4All

Desktop-App

Lokal mit deinen Dokumenten chatten — nichts verlässt den Laptop.

Local RAG

vLLM

Inference-Server

Der Serving-Stack der Produktion. PagedAttention und Continuous Batching auf deiner eigenen GPU.

localhost:8000/v1

MLX

Apple Silicon

Apples Array-Framework. Auf einem M-Series-Mac der schnellste Weg zu lokalen Modellen.

localhost:8080/v1

llamafile

Einzelne Binärdatei

Eine Datei ist Modell und Laufzeit zugleich. Herunterladen, chmod +x, starten. Keine Installation.

localhost:8080/v1

KoboldCpp

Einzelne Binärdatei

Eine einzelne Binärdatei um llama.cpp, abgestimmt auf lange Texte und kreatives Schreiben.

GGUF

Fragen dazu

Wie viel RAM brauche ich?

Ein 7B-Modell mit 4-Bit-Quantisierung passt in etwa 5 GB, 8 GB RAM reichen also bequem. 70B-Modelle wollen 40 GB oder mehr. Can I Run AI bewertet Ihren konkreten Rechner.

Ist ein lokales Modell so gut wie eine kostenlose API?

Meist nicht. Die Modelle zu Hause sind kleiner als die, die NVIDIA oder Groq gratis anbieten. Lokal gewinnt bei Privatsphäre, Offline-Nutzung und gar keinen Limits.

Andere Einteilungen