Модели для разных задач

Рекомендации по выбору моделей в зависимости от ваших задач и доступного ресурса.

🇬🇧 English version: models.md


← Локальные модели · Каталог →


Содержание

  1. Быстрый выбор по задачам
  2. По объёму RAM
  3. Ключевые возможности моделей
  4. Модели для программирования
  5. Чат-модели
  6. Модели для рассуждений
  7. Модели для 8 GB
  8. Что дальше

Что влияет на выбор модели

При выборе модели учитывайте:

  1. Задача - программирование, чат, анализ текста, работа с изображениями
  2. Доступная VRAM/RAM - сколько памяти у вас есть для модели
  3. Требуемое качество - нужен ли вам максимум качества или достаточно “достаточно хорошего”
  4. Скорость работы - важна ли быстрая реакция или можно подождать

1. Быстрый выбор по задачам

Задача Рекомендуемая модель Требуется RAM Команда Ollama
Чат, общие вопросы Qwen 3.5 9B 8-16 GB ollama run qwen3.5:9b
Программирование Qwen 2.5 Coder 7B 8-16 GB ollama run qwen2.5-coder:7b
Автодополнение кода (FIM) CodeGemma 2B 4-8 GB ollama run codegemma:2b
Рассуждения DeepSeek R1 Distill 7B 8-16 GB ollama run deepseek-r1:7b
Математика Phi-4-mini (3.8B) 4-8 GB ollama run phi4-mini
Работа с изображениями Llama 3.2 Vision 11B 8-16 GB ollama run llama3.2-vision:11b
Русский язык Qwen 3.5 9B 8-16 GB ollama run qwen3.5:9b
RAG эмбеддинги nomic-embed-text 4 GB ollama run nomic-embed-text

2. По объёму RAM

Ваша RAM Лучшая модель Примерная скорость
8 GB Phi-4-mini (3.8B), Qwen 3.5 4B 25-35 tok/s
16 GB Qwen 2.5 Coder 7B, Qwen 3.5 9B 15-25 tok/s
24 GB Qwen3.6-27B (Q4), Gemma 4 26B MoE 18-28 tok/s
32 GB Llama 3.1 70B (Q3) 20-40 tok/s
48 GB Llama 3.3 70B (Q4) 10-20 tok/s
64 GB Gemma 4 31B (Q8) 8-15 tok/s
128 GB DeepSeek-V4-Flash, Qwen3.5-397B 15-30 tok/s

3. Ключевые возможности моделей

4. Модели для программирования

Сравнение кодинг-моделей

Модель Размер Контекст FIM HumanEval Лучше всего для
Qwen 2.5 Coder 7B 4.7 GB 128K ✅ 82% Общее кодинг, мульти-файл
Qwen 2.5 Coder 1.5B 1.1 GB 32K ✅ 45% Быстрое автодополнение, 8GB Mac
CodeGemma 2B 1.5 GB 8K ✅ 50% Автодополнение, мало RAM
Phi-4-mini (3.8B) 2.5 GB 128K ❌ 74% Математика + кодинг, мало RAM
Yi-Coder 9B 6 GB 128K ✅ 70% Длинный контекст кодинг

5. Чат-модели

Модель Размер Контекст Сильные стороны
Qwen 3.5 4B 3.4 GB 256K Быстрая, мультиязычная, оптимально для 8GB
Qwen 3.5 9B 6 GB 256K Лучшее качество для 16GB Mac
Llama 3.3 8B 4.9 GB 128K Сильный английский, рассуждения
Gemma 3 9B 6 GB 128K Оптимизирована под Apple Silicon
Phi-4-mini (3.8B) 2.5 GB 128K Потрясающая для своего размера, математика

6. Модели для рассуждений

Сравнение reasoning-моделей

Модель Размер Лучше всего для
DeepSeek R1 Distill 7B 4.5 GB В 2-3x лучше рассуждения чем vanilla 7B
DeepSeek R1 Distill 14B 9 GB Сложный анализ, влезает в 16GB
Phi-4-reasoning (14B) 9 GB Код + рассуждения
QwQ-32B 20 GB Математика, логика (нужно 24GB)

Важно: Reasoning-модели медленнее (они «думают» перед ответом), но дают лучше результат на сложных задачах. Не подходят для реального времени.

7. Модели для 8 GB

Для Mac с 8GB RAM или CPU-only инференса:

Модель RAM (Q4) Скорость (tok/s) Лучше всего для
Phi-4-mini (3.8B) 2.5 GB 28 Кодинг, математика
Qwen 3.5 4B 2.8 GB 22-26 Универсальный чат
Llama 3.2 3B 2.0 GB 30-40 Быстрый чат
CodeGemma 2B 1.5 GB 35+ Автодополнение кода
Qwen 2.5 Coder 1.5B 1.1 GB 40+ Быстрое кодинг

Модели для MacBook Air M1 16GB (референс)

Ниже таблица с моделями, которые хорошо работают на 16GB унифицированной памяти M1/M2 чипов.

Задача Модель Размер Квантизация Скорость (токен/сек) HuggingFace / Ollama
Повседневный чат Qwen 3.5 9B 6.6 GB Q4_K_M 10–13 HF / Ollama
Максимальная скорость Qwen 3.5 4B 3.4 GB Q4_K_M 28–35 HF / Ollama
Кодинг Qwen 2.5 Coder 7B 4.7 GB Q4_K_M 22–25 HF / Ollama
Письмо/контент Llama 3.3 8B 4.9 GB Q4_K_M 14–18 HF / Ollama
Математика/reasoning Phi-4 Mini 2.3 GB Q4_K_M 25–30 HF / Ollama
Мультимодальная (зрение) Gemma 4 E4B 2.5 GB Q4_K_M 30–38 HF / Ollama
Tool calling / агенты LFM2.5 8B-A1B 5.5 GB Q4_K_M 35–45 HF
Длинный контекст Qwen 3.5 9B 6.6 GB Q4_K_M 10–13 HF / Ollama

Как подобрать модель под ваш объем памяти

Формула расчета

Память модели ≈ (Параметры в млрд) × (Байт на параметр) + KV cache + накладные расходы

Примеры расчета для разных объемов RAM

Доступно RAM Пример модели Расчет
4-6 GB (своп возможен) Qwen 2.5 1.5B Q4_K_M (~1.1 GB) 1.5B × 0.55 ≈ 0.8 GB + KV (~0.3GB) ≈ 1.1-1.4 GB
8 GB Qwen 2.5 3B Q4_K_M (~2.0 GB) 3B × 0.55 ≈ 1.65 GB + KV (~0.3GB) ≈ 2.0 GB
16 GB Qwen 3.5 9B Q4_K_M (~7.0 GB) 9B × 0.55 ≈ 4.95 GB + KV (~1.0GB) + overhead ≈ 7.0 GB
24 GB Llama 3 14B Q4_K_M (~8.7 GB) 14B × 0.55 ≈ 7.7 GB + KV (~1.5GB) ≈ 9.2 GB
32 GB Mixtral 8x7B Q4_K_M (~24 GB MoE) Эффективно ~6B активных параметров × 0.55 ≈ 3.3 GB + KV (~2GB) ≈ 8-10 GB эффективно
48+ GB Llama 3 70B Q3_K_M (~39 GB) 70B × 0.41 ≈ 28.7 GB + KV (~8GB) ≈ 36-40 GB

Рекомендации по объемам

RAM Лучший выбор Альтернатива
4-6 GB TinyLlama 1.1B, Phi-2 2.7B, Qwen 1.5-1.8B Для чата и простых задач
8 GB Qwen 2.5 3B, Phi-3 Mini 3.8B, Mistral 7B Баланс скорости и качества
16 GB Qwen 3.5 9B, Llama 3.1 8B, Qwen 2.5 Coder 7B Универсальный выбор
24-32 GB Llama 3 14B, Mixtral 8x7B, Command R Для сложных задач и агентов
48+ GB Llama 3 70B, Mixtral 8x22B Для максимального качества и сложных рассуждений

Специализированные модели

Для работы с изображениями (vision)

Для длинного контекста

Как читать названия моделей

Пример: Qwen 2.5 Coder 7B Instruct Q4_K_M

Основные типы квантизации (GGUF)

ТипБит/весКачествоРазмерКогда использовать
Q2_K~2Очень низкоеОчень маленькоеТолько при критической нехватке памяти
Q3_K_S/M~3-3.5Низкое-среднееМаленькоеОграниченные ресурсы
Q4_04.0УдовлетворительноеСреднееКогда нужна предсказуемость
Q4_K_S/M~4.3-4.8Хорошее-отличноеСреднееБаланс качества и размера
Q5_05.0Очень хорошееБольше среднегоКогда есть немного лишней памяти
Q5_K_S/M~5.3-5.5ОтличноеБольше среднегоВысокое качество при умеренном размере
Q6_K~6.0ВысокоеБольшоеДля кода и критических задач
Q8_08.0Почти как FP16БольшоеКогда памяти достаточно и нужно максимум качества
F1616.0МаксимумОчень большоеДля экспериментов и сравнения baseline

Совет по выбору квантизации: Для большинства задач начните с Q4_K_M - это обычно лучший баланс качества, размера и скорости. Если нужно больше качества и есть память - переходите на Q5_K_M или Q6_K. Если критична скорость или очень мало памяти - рассмотрите Q3_K_M или Q2_K.

Специфические рекомендации по железу

Apple Silicon (M1/M2/M3/M4)

NVIDIA GPU

AMD GPU

CPU только

Где брать модели

Ollama библиотека

Самый простой способ для начала:

ollama pull qwen3:8b
ollama run qwen3:8b

Доступные модели можно посмотреть на ollama.com/library

Hugging Face

Для более продвинутых пользователей:

Основные коллекции на HF

Следите за обновлениями

Мир LLM моделей меняется очень быстро. Рекомендуется:

  1. Следить за релизами от основных лабораторий (Meta, Mistral, Qwen, Microsoft, Google)
  2. Проверять обновления в любимых репозиториях на HuggingFace каждые 2-4 недели
  3. Участвовать в сообществах r/LocalLLaMA и соответствующих Discords

8. Что дальше

Если хотите Переходите
Полный каталог всех моделей с характеристиками catalog.md
Понять, сколько памяти нужно для выбранной модели memory-and-context.md
Настроить Ollama под свою задачу advanced-setup.md
Запустить модель, если ещё не running-models.md
Вернуться к выбору сценария README.md

В разделе: getting-started · running-models · models · catalog · quantization · memory-and-context · tools · advanced-setup · troubleshooting · apple-silicon
Связанные разделы: Нулевой уровень · AI-агенты · Use Cases
Навигация: ← Локальные модели · ↑ На главную · 🇬🇧 English