К содержимому
fedi.software

Типы нейросетей: схема и глоссарий

LLM или VLM, открытые веса или открытый код, base, instruct, reasoning, дистилляция, MoE, GGUF и кванты — что значат слова в названиях моделей, с живыми примерами.

Группа Что значит Примеры
LLMlarge language model · text model Тип модели Модель, которая читает и пишет текст: чат, тексты, код, анализ. Всё остальное в этом глоссарии — её разновидности или способы упаковки.
VLMVL · vision-language · multimodal Тип модели LLM, которая принимает на вход ещё и картинки (скриншоты, фото, документы). Локально рядом с GGUF-весами обычно нужен второй файл — проектор зрения (mmproj).
Open weightsopen model · downloadable weights Открытость Веса можно скачать и запустить на своём железе — под любой лицензией: некоторые (Llama, Gemma) ограничивают коммерческое использование или требуют принять условия. Данные и код обучения обычно закрыты.
Open Source AIOSAID · OSI definition Открытость Более строгое определение OSI (OSAID 1.0): веса плюс код обучения и достаточно сведений о данных, чтобы воспроизвести модель, — всё под открытыми лицензиями. Подходят немногие модели; веса под Apache-2.0 или MIT сами по себе — это open weights, не обязательно open source. —
Proprietary (API only)closed · API model Открытость Весов нет вовсе: модель работает только на серверах вендора — через приложение или платный API. Локально её не запустить. —
Basepretrained · -Base Вариант «Сырая» предобученная модель: продолжает текст, но не выполняет инструкции. Основа для дообучения, а не для чата. —
Instruct-it · -Chat · -Instruct Вариант Базовая модель, дообученная выполнять инструкции и вести диалог. Именно её берут для локального чата; у Google суффикс -it, у других -Instruct или -Chat.
ReasoningThinking · R1 · -Thinking Вариант Обучена сначала расписывать ход рассуждений, потом отвечать. Сильнее в математике, коде и логике, но тратит гораздо больше токенов — а значит и времени — на ответ.
Coder-Coder · code model Вариант Дообучена на исходном коде: автодополнение, рефакторинг, агентная работа в IDE. В обычном чате может уступать «родной» instruct-модели.
Distill-Distill · R1-Distill-Qwen Вариант Меньшая модель, обученная на ответах большой. DeepSeek-R1-Distill-Qwen-32B — это Qwen 32B, подражающий R1, а не сам R1, и он заметно слабее оригинала на 671B. —
Abliterated / uncensoreduncensored · abliterated · heretic Без защитных фильтров Вариант Модификация от сообщества, у которой из весов убрано поведение отказа. Отвечает на что угодно, в том числе на вредные запросы, часто с худшим качеством и без гарантий безопасности. Только для личного и исследовательского использования; ответственность за применение — на вас. —
Densedense model Архитектура Каждый параметр участвует в каждом токене. Скорость определяет полный размер: плотная 70B-модель читает из памяти все 70B весов на каждый сгенерированный токен.
MoEmixture of experts Архитектура Слои разбиты на много «экспертов», роутер выбирает несколько на каждый токен. В памяти (VRAM + RAM) должны лежать все эксперты, но каждый токен задействует только активную часть — поэтому большая MoE работает намного быстрее плотной модели того же размера, а экспертов можно вынести в обычную RAM.
Active parameters (-A3B)-A3B · -A22B · active Архитектура В названиях MoE суффикс показывает параметры, работающие на токен: у Qwen3-30B-A3B всего 30B, активных 3B. Память считается по полному числу, скорость — по активному.
Safetensors (BF16)safetensors · BF16 · FP16 Формат файлов Исходный формат релиза на Hugging Face, обычно 16 бит на вес — около 2 ГБ на миллиард параметров. Его используют vLLM и Transformers, из него делают все квантования. —
GGUF.gguf · llama.cpp Формат файлов Однофайловый формат llama.cpp с уже квантованными весами. Работает на CPU, GPU или на обоих сразу; его используют LM Studio, Ollama и Jan. Большие модели разбиты на части (-00001-of-00003). —
AWQ / GPTQ / EXL2-3AWQ · GPTQ · EXL2 · EXL3 Формат файлов Квантованные форматы для запуска только на GPU (vLLM, ExLlama, TGI). Быстрые, если модель целиком влезает в VRAM; выгрузки в RAM нет. —
MLXmlx-community Формат файлов Фреймворк и формат весов Apple для Mac на M-чипах с общей памятью. На Mac часто чуть быстрее GGUF того же размера. —
Q4_K_M and other K-quantsQ4_K_M · Q5_K_M · Q6_K · Q8_0 Квантование Имена GGUF-квантов: число — примерно бит на вес, K — метод k-quant, S/M/L — состав смеси. Q4_K_M (≈4,8 бита) — обычный баланс; Q8_0 почти без потерь; ниже Q3 качество заметно падает. —
IQ quants and Unsloth Dynamic (UD)IQ2_XXS · IQ3_K · UD-Q2_K_XL Квантование Новые низкобитные методы GGUF: IQ-кванты (с матрицей важности) и Unsloth Dynamic оставляют чувствительные слои в большей точности, поэтому 2–3-битные файлы огромных моделей остаются пригодными.
FP8 / MXFP4 / NVFP4FP8 · MXFP4 · NVFP4 Квантование Низкоточные форматы с плавающей точкой, которые новые GPU поддерживают аппаратно. gpt-oss выпущены сразу в MXFP4 (≈4,25 бита на вес), поэтому gpt-oss-120b занимает около 65 ГБ.

Модели с пометкой «без защитных фильтров» (uncensored / abliterated) приведены только для личных и исследовательских целей: у них нет ограничений безопасности, ответственность за использование лежит на пользователе.

Обновлено · Источники: fedi.software (CC BY 4.0), Open Source Initiative (OSAID 1.0)

Вставить на свой сайт

Вставьте этот код туда, где должна быть инфографика, — она будет обновляться сама. Бесплатно, при условии сохранения ссылки на источник.

JSON Наши данные — CC BY 4.0 со ссылкой на источник; сторонние данные сохраняют лицензию своего источника.

Зачем этот глоссарий

Название вроде «Qwen3-30B-A3B-Instruct-GGUF Q4_K_M» выглядит как шифр, хотя на деле это пять решений подряд: семейство и общий размер, активные параметры (у MoE), вариант, формат файла и квант. Схема выше раскладывает такие слова на шесть групп — тип модели, открытость, вариант, архитектура, формат файла и квантование — и у каждого термина показывает живые примеры. Клик по примеру открывает модель в сравнении.

Как выбрать модель для локального чата

  1. Вариант. Берите Instruct (у Google он помечен -it) или модель с рассуждениями. Базовая модель просто продолжает текст и инструкциям не следует.
  2. Память. Посмотрите, сколько у вас видеопамяти или общей памяти, — от этого зависит, какой размер вообще доступен.
  3. Квант. Q4_K_M — привычный баланс размера и качества, Q8_0 почти без потерь, а ниже Q3 ответы заметно портятся.
  4. Контекст. Оставьте запас под длину разговора или документа: контекст тоже занимает память.
  5. Скорость. Только теперь решайте, устраивает ли темп. Плотная модель читает все веса на каждый токен, а MoE — лишь активную часть.

Эту арифметику для известных моделей уже проделывает схема какая модель влезет в ваше железо.

Где чаще всего путаются

Открытые веса — ещё не открытый код. Файл можно скачать, но лицензия может ограничивать коммерческое использование или требовать принять условия, а обучающие данные обычно остаются закрытыми. Более строгое определение Open Source AI от OSI требует открыть ещё и код обучения, и сведения о данных. Вторая частая ошибка касается дистиллированных моделей: это меньшая модель, обученная на ответах большой, а не сама большая модель, и она заметно слабее.

С форматами проще. GGUF — один файл для llama.cpp и программ на его основе, работает на CPU, GPU или на обоих сразу. AWQ, GPTQ и EXL рассчитаны на серверы только с видеокартами, MLX — на Mac с чипами серии M.

Abliterated и uncensored

Так называют сборки сообщества, из весов которых убрано поведение отказа. Термин есть в глоссарии, потому что часто встречается в названиях, но мы такие модели не рекомендуем. Они предназначены только для личных и исследовательских целей, и ответственность за их использование лежит на пользователе.