Hoppa till innehållet
fedi.software

Typer av AI-modeller: karta och ordlista

LLM eller VLM, öppna vikter eller öppen källkod, base, instruct, reasoning, destillerad, MoE, GGUF och kvantisering — vad orden i modellnamn betyder, med levande exempel.

Grupp Vad det betyder Exempel
LLMlarge language model · text model Modelltyp A model that reads and writes text: chat, writing, code, analysis. Everything else in this glossary is a flavour or a packaging of it.
VLMVL · vision-language · multimodal Modelltyp An LLM that also takes images (screenshots, photos, documents) as input. Locally it usually needs a second file — the vision projector (mmproj) — next to the GGUF weights.
Open weightsopen model · downloadable weights Öppenhet The weights can be downloaded and run on your own hardware, under any licence — some (Llama, Gemma) limit commercial use or require accepting terms first. Training data and code usually stay closed.
Open Source AIOSAID · OSI definition Öppenhet The stricter OSI definition (OSAID 1.0): weights plus the training code and enough information about the data to rebuild the model, all under open licences. Few models qualify; Apache-2.0 or MIT weights alone are open weights, not necessarily open source. —
Proprietary (API only)closed · API model Öppenhet No weights at all: the model runs only on the vendor's servers through an app or a paid API. It cannot be run locally. —
Basepretrained · -Base Variant The raw pretrained model: it continues text but does not follow instructions. A starting point for fine-tuning, not for chatting. —
Instruct-it · -Chat · -Instruct Variant The base model tuned to follow instructions and hold a dialogue. This is the version you want for a local chat; Google marks it -it, others -Instruct or -Chat.
ReasoningThinking · R1 · -Thinking Variant Trained to write out a chain of thought before the answer. Better at maths, code and logic, but spends many more tokens — and so more time — per reply.
Coder-Coder · code model Variant Further trained on source code: completion, refactoring, agentic coding in the IDE. General chat quality may be lower than the sibling instruct model.
Distill-Distill · R1-Distill-Qwen Variant A smaller model taught on the answers of a bigger one. DeepSeek-R1-Distill-Qwen-32B is a Qwen 32B that imitates R1 — not R1 itself, and far weaker than the 671B original. —
Abliterated / uncensoreduncensored · abliterated · heretic Inga säkerhetsfilter Variant A community modification with the refusal behaviour removed from the weights. It answers anything, including harmful requests, often with lower quality and no safety guarantees. For personal and research use only; you are responsible for how you use it. —
Densedense model Arkitektur Every parameter works on every token. Speed is set by the full size: a 70B dense model reads all 70B weights from memory for each generated token.
MoEmixture of experts Arkitektur The layers are split into many experts and a router picks a few of them per token. All experts must sit in memory (VRAM + RAM), but each token touches only the active part — so a big MoE runs much faster than a dense model of the same size, and the experts can be offloaded to system RAM.
Active parameters (-A3B)-A3B · -A22B · active Arkitektur In MoE names the suffix gives the parameters used per token: Qwen3-30B-A3B has 30B in total and 3B active. Memory follows the total, speed follows the active number.
Safetensors (BF16)safetensors · BF16 · FP16 Filformat The original release format on Hugging Face, usually 16 bits per weight: about 2 GB per billion parameters. Used by vLLM, Transformers and as the source for every quantisation. —
GGUF.gguf · llama.cpp Filformat A single-file format of llama.cpp with the weights already quantised. Runs on CPU, GPU or both at once; LM Studio, Ollama and Jan use it. Big models come split into parts (-00001-of-00003). —
AWQ / GPTQ / EXL2-3AWQ · GPTQ · EXL2 · EXL3 Filformat Quantised formats for GPU-only servers (vLLM, ExLlama, TGI). Fast when the whole model fits in VRAM; no offload to system RAM. —
MLXmlx-community Filformat Apple's framework and weight format for M-series Macs, using the unified memory. Often a little faster on a Mac than GGUF of the same size. —
Q4_K_M and other K-quantsQ4_K_M · Q5_K_M · Q6_K · Q8_0 Kvantisering GGUF quant names: the number is roughly the bits per weight, K marks the k-quant method, S/M/L the mix inside. Q4_K_M (≈4.8 bits) is the usual sweet spot; Q8_0 is almost lossless; below Q3 quality drops noticeably. —
IQ quants and Unsloth Dynamic (UD)IQ2_XXS · IQ3_K · UD-Q2_K_XL Kvantisering Newer low-bit GGUF methods: IQ (importance-matrix) quants and Unsloth Dynamic keep the sensitive layers at higher precision, so 2–3-bit files of huge models stay usable.
FP8 / MXFP4 / NVFP4FP8 · MXFP4 · NVFP4 Kvantisering Low-precision floating-point formats with hardware support in recent GPUs. gpt-oss ships natively in MXFP4 (≈4.25 bits per weight), which is why gpt-oss-120b fits in about 65 GB.

Modeller markerade ”inga säkerhetsfilter” (uncensored / abliterated) listas endast för personligt bruk och forskning: de har inga säkerhetsbegränsningar, och ansvaret för användningen ligger hos användaren.

Uppdaterad · Källor: fedi.software (CC BY 4.0), Open Source Initiative (OSAID 1.0)

Bädda in på din webbplats

Klistra in koden där infografiken ska visas: den uppdaterar sig själv. Gratis att använda — behåll källänken.

JSON Våra data: CC BY 4.0 med länk till källan; tredjepartsdata behåller källans licens.

Ett modellnamn i delar

Namnen på öppna modeller kan se ut som kryptisk kod, men de läses bit för bit. Först kommer familjen och den totala storleken. Är det en MoE-modell följer de aktiva parametrarna, till exempel -A3B. Sedan kommer varianten, ofta -Instruct eller -it, och sist filformatet och kvantiseringen för själva nedladdningen. Ordlistan delar upp begreppen i sex grupper – ”Modelltyp”, ”Öppenhet”, ”Variant”, ”Arkitektur”, ”Filformat” och ”Kvantisering” – med levande exempel vid varje term. Ett klick på ett exempel öppnar modellen i modelljämförelsen.

Grupperna i korthet

  • Modelltyp: en LLM arbetar med text, en VLM kan även läsa bilder.
  • Öppenhet: öppna vikter, OSI:s strängare Open Source AI Definition 1.0 eller slutna modeller som bara nås via en app eller ett API.
  • Variant: base, Instruct, reasoning, coder, destillerad samt communityversioner där vägrandet har tagits bort.
  • Arkitektur: tät modell eller MoE, där bara en del av parametrarna arbetar per token.
  • Filformat: Safetensors, GGUF, rena GPU-format som AWQ, GPTQ och EXL, och MLX för Mac.
  • Kvantisering: K-kvanter som Q4_K_M, IQ- och Unsloth Dynamic-filer, FP8 och MXFP4.

Från begrepp till val

För en lokal chattassistent är ordningen ganska given. Ta en Instruct- eller reasoning-variant, aldrig en basmodell. Titta sedan på hur mycket minne du har och välj en kvant som ryms: Q4_K_M är den vanliga balansen mellan storlek och kvalitet, Q8_0 är nästan förlustfri och under Q3 blir svaren märkbart sämre. Lämna plats för den kontext du behöver och bedöm hastigheten sist. Grafiken vilken öppen modell passar din hårdvara gör uträkningen för kända modeller.

Två vanliga missförstånd

Öppna vikter (open weights) är inte samma sak som öppen källkod. Du får ladda ner filen, men licensen kan begränsa kommersiell användning eller kräva att du godkänner villkor, och träningsdatan är oftast stängd. En destillerad modell missförstås också ofta: det är en mindre modell som tränats på svaren från en större, inte den stora modellen själv, och den är tydligt svagare.

Om abliterated och uncensored

Det är communityns ändringar av öppna modeller där vägrandet har tagits bort. Vi tar med begreppet eftersom det förekommer i många modellnamn, inte för att rekommendera sådana modeller. De är endast avsedda för personligt bruk och forskning, och ansvaret för hur de används ligger hos användaren.