Ir para o conteúdo
fedi.software

Apps de LLM local

Apps que rodam modelos no seu próprio computador: sistemas suportados, memória necessária, suporte a GPU e download pelo nosso catálogo.

Atualizado

Ollama

Código aberto

O Ollama roda modelos de pesos abertos no próprio computador, pela linha de comando e por um app de desktop, e disponibiliza uma API HTTP local compatível com a OpenAI. De código aberto, sob licença MIT.

Sistemas
Windows, macOS, Linux
GPU
Optional: CUDA, ROCm, Vulkan, Metal
API compatível com OpenAI
sim
Licença
MIT
Estrelas no GitHub
181.947

LM Studio

Grátis

O LM Studio é um aplicativo de desktop para encontrar, baixar e conversar com modelos locais, com servidor de API local. É gratuito, mas não de código aberto, e dispensa a linha de comando.

Sistemas
Windows, macOS, Linux
RAM mín.
16 GB
GPU
Optional: 4 GB+ VRAM, Apple Silicon
API compatível com OpenAI
sim
Licença
Proprietary

Jan

Código aberto

O Jan é um chat de desktop de código aberto, sob Apache-2.0, que roda modelos offline e também se conecta a APIs na nuvem. Funciona como um app no estilo ChatGPT privado, no seu computador.

Sistemas
Windows, macOS, Linux
RAM mín.
8 GB
GPU
Optional: NVIDIA, AMD, Intel Arc, Metal
API compatível com OpenAI
sim
Licença
Apache-2.0
Estrelas no GitHub
44.717

GPT4All

Código aberto

O GPT4All é um app de desktop de código aberto da Nomic para modelos locais em CPU ou GPU, com o LocalDocs para conversar sobre seus próprios arquivos. Lançamentos novos têm sido raros desde o início de dois mil e vinte e cinco.

Sistemas
Windows, macOS, Linux
RAM mín.
8 GB
GPU
Optional: Vulkan, Apple M-series
API compatível com OpenAI
sim
Licença
MIT
Estrelas no GitHub
77.386

AnythingLLM

Código aberto

O AnythingLLM é um aplicativo de código aberto, para desktop ou Docker, que junta chat com documentos, agentes e modelos locais ou na nuvem num espaço de trabalho privado.

Sistemas
Windows, macOS, Linux
RAM mín.
16 GB
GPU
Optional: CUDA, ROCm, Vulkan, NPU
Licença
MIT
Estrelas no GitHub
66.618

Open WebUI

Código aberto

O Open WebUI é uma interface web auto-hospedada para o Ollama e APIs compatíveis com a OpenAI, instalada por Docker ou pip e com suporte a vários usuários. Serve como chat compartilhado para modelos locais num servidor.

Sistemas
Windows, macOS, Linux
GPU
Not needed: uses Ollama or an API
API compatível com OpenAI
sim
Licença
Open WebUI License
Estrelas no GitHub
153.609

llama.cpp

Código aberto

O llama.cpp é um motor de inferência de código aberto, em C e C++, para modelos GGUF em CPU e GPU, com ferramentas de linha de comando e servidor compatível com a OpenAI. Muitos apps locais são construídos sobre ele.

Sistemas
Windows, macOS, Linux
GPU
Optional: CUDA, ROCm, Vulkan, SYCL, Metal
API compatível com OpenAI
sim
Licença
MIT
Estrelas no GitHub
129.950

KoboldCpp

Código aberto

O KoboldCpp é um programa de arquivo único baseado no llama.cpp, com interface web para chat e escrita de histórias e APIs compatíveis com KoboldAI e OpenAI. Popular para role-play e ficção com modelos locais.

Sistemas
Windows, macOS, Linux
GPU
Optional: CUDA, Vulkan, hipBLAS, Metal
API compatível com OpenAI
sim
Licença
AGPL-3.0
Estrelas no GitHub
11.908

IA rodando no seu próprio computador

Esta página reúne aplicativos que rodam modelos de linguagem direto no PC, sem mandar as perguntas para a nuvem. Cada cartão mostra os sistemas suportados, a RAM mínima, o suporte a GPU, a licença e as estrelas no GitHub. Quando o app está no nosso catálogo, há o botão “Baixar”, que leva ao instalador oficial, conferido quanto à assinatura digital válida.

Três tipos de ferramenta

  • Apps de desktop: Ollama, LM Studio, Jan, GPT4All e AnythingLLM — instalou, escolheu um modelo, conversou.
  • Interface web: o Open WebUI, que dá uma tela de chat no navegador para modelos rodando na sua máquina ou num servidor.
  • Motores: llama.cpp e KoboldCpp, a base técnica que outros programas usam e que também pode ser usada diretamente.

O app é grátis; o modelo é outra coisa

Os aplicativos são gratuitos, mas o modelo é um download separado, com a sua própria licença e o seu próprio tamanho. Leia a licença do modelo antes de usá-lo em trabalho comercial.

A memória decide

A RAM, ou a memória da placa de vídeo, define quais modelos rodam. Um modelo maior precisa de mais memória. Sem GPU, os modelos rodam no processador, de forma mais lenta. Comece com um modelo pequeno, veja como o seu computador se comporta e só depois tente algo maior. Velocidade e qualidade dependem do modelo e do hardware, e esta página não promete nenhuma das duas.

Por que rodar localmente

Rodar localmente significa que as perguntas ficam no computador. É útil para documentos sensíveis, para trabalhar sem internet e para quem quer testar modelos de pesos abertos sem pagar por chamada. Se o seu PC não tiver memória suficiente, uma alternativa é contratar uma VPS para IA ou usar os modelos com API gratuita.