Apps, die Modelle auf Ihrem eigenen Computer ausführen: unterstützte Systeme, Speicherbedarf, GPU-Unterstützung und Download aus unserem Katalog.
Aktualisiert
Ollama
Open Source
Führt offene Modelle auf dem eigenen Rechner aus, per Kommandozeile oder kleiner Desktop-App, und stellt sie über eine lokale, OpenAI-kompatible API bereit. Open-Source unter MIT.
Systeme
Windows, macOS, Linux
GPU
Optional: CUDA, ROCm, Vulkan, Metal
OpenAI-kompatible API
ja
Lizenz
MIT
GitHub-Sterne
181.947
LM Studio
Kostenlos
Desktop-App zum Suchen, Herunterladen und Chatten mit lokalen Modellen, mit eingebautem API-Server für Entwickler. Kostenlos nutzbar, aber nicht quelloffen.
Systeme
Windows, macOS, Linux
Min. RAM
16 GB
GPU
Optional: 4 GB+ VRAM, Apple Silicon
OpenAI-kompatible API
ja
Lizenz
Proprietary
Jan
Open Source
Quelloffener Chat im Stil von ChatGPT, der Modelle offline ausführt und im selben Fenster zu Cloud-APIs wechseln kann. Nebenbei startet Jan einen lokalen OpenAI-kompatiblen Server.
Systeme
Windows, macOS, Linux
Min. RAM
8 GB
GPU
Optional: NVIDIA, AMD, Intel Arc, Metal
OpenAI-kompatible API
ja
Lizenz
Apache-2.0
GitHub-Sterne
44.717
GPT4All
Open Source
Die Open-Source-App von Nomic für lokale Modelle auf CPU oder GPU, bekannt für LocalDocs, das Fragen zu eigenen Dateien beantwortet. Seit Februar 2025 erscheinen kaum neue Versionen.
Systeme
Windows, macOS, Linux
Min. RAM
8 GB
GPU
Optional: Vulkan, Apple M-series
OpenAI-kompatible API
ja
Lizenz
MIT
GitHub-Sterne
77.386
AnythingLLM
Open Source
Quelloffener Arbeitsbereich für alles in einem, als Desktop-App oder in Docker: Dokumente, Agenten, lokale und Cloud-Modelle. Geeignet für vertrauliche Arbeit mit eigenen Dateien.
Systeme
Windows, macOS, Linux
Min. RAM
16 GB
GPU
Optional: CUDA, ROCm, Vulkan, NPU
Lizenz
MIT
GitHub-Sterne
66.618
Open WebUI
Open Source
Selbst gehostete Weboberfläche für Ollama und OpenAI-kompatible APIs, installiert per Docker oder pip; mehrere Personen nutzen einen Server bequem im Browser.
Systeme
Windows, macOS, Linux
GPU
Not needed: uses Ollama or an API
OpenAI-kompatible API
ja
Lizenz
Open WebUI License
GitHub-Sterne
153.609
llama.cpp
Open Source
Quelloffene C/C++-Engine für GGUF-Modelle auf CPU und GPU, mit Kommandozeilen-Werkzeugen und einem OpenAI-kompatiblen Server. Viele lokale KI-Apps bauen darauf auf.
Systeme
Windows, macOS, Linux
GPU
Optional: CUDA, ROCm, Vulkan, SYCL, Metal
OpenAI-kompatible API
ja
Lizenz
MIT
GitHub-Sterne
129.950
KoboldCpp
Open Source
Programm in einer einzigen Datei auf Basis von llama.cpp, mit Weboberfläche für Chat und Geschichten sowie KoboldAI- und OpenAI-kompatiblen APIs – geschätzt für Fiktion und Rollenspiel.
Systeme
Windows, macOS, Linux
GPU
Optional: CUDA, Vulkan, hipBLAS, Metal
OpenAI-kompatible API
ja
Lizenz
AGPL-3.0
GitHub-Sterne
11.908
Modelle auf dem eigenen Rechner
Eine lokale LLM-App lädt ein Modell mit offenen Gewichten herunter und führt es auf Ihrem PC oder Laptop aus. Eingaben verlassen den Rechner nicht, es gibt keine Token-Rechnung, und nach dem Download funktioniert alles offline. Hier sind solche Programme versammelt: Desktop-Apps (Ollama, LM Studio, Jan, GPT4All, AnythingLLM), eine Weboberfläche für den Heimserver (Open WebUI) und Engines für alle, die volle Kontrolle wollen (llama.cpp, KoboldCpp).
Was auf den Karten steht
unterstützte Systeme, Mindest-Arbeitsspeicher und GPU-Unterstützung;
die Lizenz und bei Open-Source-Projekten die GitHub-Sterne, wöchentlich aktualisiert;
eine Download-Schaltfläche, wenn die App in unserem Katalog ist – bei diesen Installern wurde die digitale Signatur geprüft.
Die passende App finden
Nur ein Chatfenster? LM Studio und Jan bringen einen Modellkatalog mit.
Eine lokale API für eigene Werkzeuge? Ollama und llama.cpp stellen eine bereit, viele andere Apps docken daran an.
Fragen zu eigenen Dokumenten? Darauf sind AnythingLLM und GPT4All ausgelegt.
Ein Rechner für mehrere Personen? Open WebUI läuft im Browser auf Basis von Ollama.
Der Speicher entscheidet
Die App ist kostenlos, das Modell ein eigener Download mit eigener Größe und Lizenz. Es muss in den Arbeitsspeicher passen – oder in den Videospeicher, wenn die Grafikkarte rechnen soll –, ein größeres Modell braucht also einen stärkeren Rechner. Ohne passende GPU laufen Modelle auf dem Prozessor, das geht, dauert aber länger. Die Karten geben die Angaben der Hersteller wieder; eine bestimmte Geschwindigkeit oder Antwortqualität versprechen wir nicht, denn beides hängt von Modell und Hardware ab.
Wenn lokal nicht reicht
Die stärksten Modelle werden nicht mit offenen Gewichten veröffentlicht und laufen nur in der Cloud. Brauchen Sie diese, sehen Sie bei den API-Anbietern oder den KI-Apps nach. Einige lokale Apps, darunter Jan und AnythingLLM, binden neben lokalen Modellen auch eine Cloud-API an.