Zum Inhalt springen
fedi.software

Lokale LLM-Apps

Apps, die Modelle auf Ihrem eigenen Computer ausführen: unterstützte Systeme, Speicherbedarf, GPU-Unterstützung und Download aus unserem Katalog.

Aktualisiert

Ollama

Open Source

Führt offene Modelle auf dem eigenen Rechner aus, per Kommandozeile oder kleiner Desktop-App, und stellt sie über eine lokale, OpenAI-kompatible API bereit. Open-Source unter MIT.

Systeme
Windows, macOS, Linux
GPU
Optional: CUDA, ROCm, Vulkan, Metal
OpenAI-kompatible API
ja
Lizenz
MIT
GitHub-Sterne
181.947

LM Studio

Kostenlos

Desktop-App zum Suchen, Herunterladen und Chatten mit lokalen Modellen, mit eingebautem API-Server für Entwickler. Kostenlos nutzbar, aber nicht quelloffen.

Systeme
Windows, macOS, Linux
Min. RAM
16 GB
GPU
Optional: 4 GB+ VRAM, Apple Silicon
OpenAI-kompatible API
ja
Lizenz
Proprietary

Jan

Open Source

Quelloffener Chat im Stil von ChatGPT, der Modelle offline ausführt und im selben Fenster zu Cloud-APIs wechseln kann. Nebenbei startet Jan einen lokalen OpenAI-kompatiblen Server.

Systeme
Windows, macOS, Linux
Min. RAM
8 GB
GPU
Optional: NVIDIA, AMD, Intel Arc, Metal
OpenAI-kompatible API
ja
Lizenz
Apache-2.0
GitHub-Sterne
44.717

GPT4All

Open Source

Die Open-Source-App von Nomic für lokale Modelle auf CPU oder GPU, bekannt für LocalDocs, das Fragen zu eigenen Dateien beantwortet. Seit Februar 2025 erscheinen kaum neue Versionen.

Systeme
Windows, macOS, Linux
Min. RAM
8 GB
GPU
Optional: Vulkan, Apple M-series
OpenAI-kompatible API
ja
Lizenz
MIT
GitHub-Sterne
77.386

AnythingLLM

Open Source

Quelloffener Arbeitsbereich für alles in einem, als Desktop-App oder in Docker: Dokumente, Agenten, lokale und Cloud-Modelle. Geeignet für vertrauliche Arbeit mit eigenen Dateien.

Systeme
Windows, macOS, Linux
Min. RAM
16 GB
GPU
Optional: CUDA, ROCm, Vulkan, NPU
Lizenz
MIT
GitHub-Sterne
66.618

Open WebUI

Open Source

Selbst gehostete Weboberfläche für Ollama und OpenAI-kompatible APIs, installiert per Docker oder pip; mehrere Personen nutzen einen Server bequem im Browser.

Systeme
Windows, macOS, Linux
GPU
Not needed: uses Ollama or an API
OpenAI-kompatible API
ja
Lizenz
Open WebUI License
GitHub-Sterne
153.609

llama.cpp

Open Source

Quelloffene C/C++-Engine für GGUF-Modelle auf CPU und GPU, mit Kommandozeilen-Werkzeugen und einem OpenAI-kompatiblen Server. Viele lokale KI-Apps bauen darauf auf.

Systeme
Windows, macOS, Linux
GPU
Optional: CUDA, ROCm, Vulkan, SYCL, Metal
OpenAI-kompatible API
ja
Lizenz
MIT
GitHub-Sterne
129.950

KoboldCpp

Open Source

Programm in einer einzigen Datei auf Basis von llama.cpp, mit Weboberfläche für Chat und Geschichten sowie KoboldAI- und OpenAI-kompatiblen APIs – geschätzt für Fiktion und Rollenspiel.

Systeme
Windows, macOS, Linux
GPU
Optional: CUDA, Vulkan, hipBLAS, Metal
OpenAI-kompatible API
ja
Lizenz
AGPL-3.0
GitHub-Sterne
11.908

Modelle auf dem eigenen Rechner

Eine lokale LLM-App lädt ein Modell mit offenen Gewichten herunter und führt es auf Ihrem PC oder Laptop aus. Eingaben verlassen den Rechner nicht, es gibt keine Token-Rechnung, und nach dem Download funktioniert alles offline. Hier sind solche Programme versammelt: Desktop-Apps (Ollama, LM Studio, Jan, GPT4All, AnythingLLM), eine Weboberfläche für den Heimserver (Open WebUI) und Engines für alle, die volle Kontrolle wollen (llama.cpp, KoboldCpp).

Was auf den Karten steht

  • unterstützte Systeme, Mindest-Arbeitsspeicher und GPU-Unterstützung;
  • die Lizenz und bei Open-Source-Projekten die GitHub-Sterne, wöchentlich aktualisiert;
  • eine Download-Schaltfläche, wenn die App in unserem Katalog ist – bei diesen Installern wurde die digitale Signatur geprüft.

Die passende App finden

  1. Nur ein Chatfenster? LM Studio und Jan bringen einen Modellkatalog mit.
  2. Eine lokale API für eigene Werkzeuge? Ollama und llama.cpp stellen eine bereit, viele andere Apps docken daran an.
  3. Fragen zu eigenen Dokumenten? Darauf sind AnythingLLM und GPT4All ausgelegt.
  4. Ein Rechner für mehrere Personen? Open WebUI läuft im Browser auf Basis von Ollama.

Der Speicher entscheidet

Die App ist kostenlos, das Modell ein eigener Download mit eigener Größe und Lizenz. Es muss in den Arbeitsspeicher passen – oder in den Videospeicher, wenn die Grafikkarte rechnen soll –, ein größeres Modell braucht also einen stärkeren Rechner. Ohne passende GPU laufen Modelle auf dem Prozessor, das geht, dauert aber länger. Die Karten geben die Angaben der Hersteller wieder; eine bestimmte Geschwindigkeit oder Antwortqualität versprechen wir nicht, denn beides hängt von Modell und Hardware ab.

Wenn lokal nicht reicht

Die stärksten Modelle werden nicht mit offenen Gewichten veröffentlicht und laufen nur in der Cloud. Brauchen Sie diese, sehen Sie bei den API-Anbietern oder den KI-Apps nach. Einige lokale Apps, darunter Jan und AnythingLLM, binden neben lokalen Modellen auch eine Cloud-API an.