Модели для разных задач
Рекомендации по выбору моделей в зависимости от ваших задач и доступного ресурса.
🇬🇧 English version: models.md
← Локальные модели · Каталог →
Содержание
- Быстрый выбор по задачам
- По объёму RAM
- Ключевые возможности моделей
- Модели для программирования
- Чат-модели
- Модели для рассуждений
- Модели для 8 GB
- Что дальше
Что влияет на выбор модели
При выборе модели учитывайте:
- Задача - программирование, чат, анализ текста, работа с изображениями
- Доступная VRAM/RAM - сколько памяти у вас есть для модели
- Требуемое качество - нужен ли вам максимум качества или достаточно “достаточно хорошего”
- Скорость работы - важна ли быстрая реакция или можно подождать
1. Быстрый выбор по задачам
| Задача | Рекомендуемая модель | Требуется RAM | Команда Ollama |
|---|---|---|---|
| Чат, общие вопросы | Qwen 3.5 9B | 8-16 GB | ollama run qwen3.5:9b |
| Программирование | Qwen 2.5 Coder 7B | 8-16 GB | ollama run qwen2.5-coder:7b |
| Автодополнение кода (FIM) | CodeGemma 2B | 4-8 GB | ollama run codegemma:2b |
| Рассуждения | DeepSeek R1 Distill 7B | 8-16 GB | ollama run deepseek-r1:7b |
| Математика | Phi-4-mini (3.8B) | 4-8 GB | ollama run phi4-mini |
| Работа с изображениями | Llama 3.2 Vision 11B | 8-16 GB | ollama run llama3.2-vision:11b |
| Русский язык | Qwen 3.5 9B | 8-16 GB | ollama run qwen3.5:9b |
| RAG эмбеддинги | nomic-embed-text | 4 GB | ollama run nomic-embed-text |
2. По объёму RAM
| Ваша RAM | Лучшая модель | Примерная скорость |
|---|---|---|
| 8 GB | Phi-4-mini (3.8B), Qwen 3.5 4B | 25-35 tok/s |
| 16 GB |
Qwen 2.5 Coder 7B, Qwen 3.5 9B | 15-25 tok/s |
| 24 GB | Qwen3.6-27B (Q4), Gemma 4 26B MoE | 18-28 tok/s |
| 32 GB | Llama 3.1 70B (Q3) | 20-40 tok/s |
| 48 GB | Llama 3.3 70B (Q4) | 10-20 tok/s |
| 64 GB | Gemma 4 31B (Q8) | 8-15 tok/s |
| 128 GB | DeepSeek-V4-Flash, Qwen3.5-397B | 15-30 tok/s |
3. Ключевые возможности моделей
- FIM (Fill-in-the-Middle) — требуется для автодополнения кода в IDE. Есть у Qwen Coder.
- Tool calling — требуется для AI-агентов. Есть у Qwen 3.5+, Llama 3.1+
- Длинный контекст — 128K+ для работы с большими кодовыми базами. Qwen 3.5 поддерживает 256K
- Мультимодальность — модели с камерой для понимания изображений (Llama 3.2 Vision, Gemma 4)
4. Модели для программирования
- Qwen 2.5 Coder 7B - лучший баланс качества и скорости
- DeepSeek Coder V2 Lite (16B MoE, ~2.4B активных) - если есть больше ресурсов
- Stable Code 3B - очень быстрый для автодополнения
- CodeLlama 7B/13B - хорошая альтернатива с большой экосистемой
Сравнение кодинг-моделей
| Модель | Размер | Контекст | FIM | HumanEval | Лучше всего для |
|---|---|---|---|---|---|
| Qwen 2.5 Coder 7B | 4.7 GB | 128K | ✅ | 82% | Общее кодинг, мульти-файл |
| Qwen 2.5 Coder 1.5B | 1.1 GB | 32K | ✅ | 45% | Быстрое автодополнение, 8GB Mac |
| CodeGemma 2B | 1.5 GB | 8K | ✅ | 50% | Автодополнение, мало RAM |
| Phi-4-mini (3.8B) | 2.5 GB | 128K | ❌ | 74% | Математика + кодинг, мало RAM |
| Yi-Coder 9B | 6 GB | 128K | ✅ | 70% | Длинный контекст кодинг |
5. Чат-модели
| Модель | Размер | Контекст | Сильные стороны |
|---|---|---|---|
| Qwen 3.5 4B | 3.4 GB | 256K | Быстрая, мультиязычная, оптимально для 8GB |
| Qwen 3.5 9B | 6 GB | 256K | Лучшее качество для 16GB Mac |
| Llama 3.3 8B | 4.9 GB | 128K | Сильный английский, рассуждения |
| Gemma 3 9B | 6 GB | 128K | Оптимизирована под Apple Silicon |
| Phi-4-mini (3.8B) | 2.5 GB | 128K | Потрясающая для своего размера, математика |
6. Модели для рассуждений
- Phi-4 Mini (3.8B) - удивительно сильный для своего размера
- Phi-4 (14B) - если есть ресурсы, превосходен в логике
- Qwen 2.5 Math серии - специально заточена на математические задачи
- DeepSeek Math 7B/7B-Instruct - сильная математическая модель
Сравнение reasoning-моделей
| Модель | Размер | Лучше всего для |
|---|---|---|
| DeepSeek R1 Distill 7B | 4.5 GB | В 2-3x лучше рассуждения чем vanilla 7B |
| DeepSeek R1 Distill 14B | 9 GB | Сложный анализ, влезает в 16GB |
| Phi-4-reasoning (14B) | 9 GB | Код + рассуждения |
| QwQ-32B | 20 GB | Математика, логика (нужно 24GB) |
Важно: Reasoning-модели медленнее (они «думают» перед ответом), но дают лучше результат на сложных задачах. Не подходят для реального времени.
7. Модели для 8 GB
Для Mac с 8GB RAM или CPU-only инференса:
| Модель | RAM (Q4) | Скорость (tok/s) | Лучше всего для |
|---|---|---|---|
| Phi-4-mini (3.8B) | 2.5 GB | 28 | Кодинг, математика |
| Qwen 3.5 4B | 2.8 GB | 22-26 | Универсальный чат |
| Llama 3.2 3B | 2.0 GB | 30-40 | Быстрый чат |
| CodeGemma 2B | 1.5 GB | 35+ | Автодополнение кода |
| Qwen 2.5 Coder 1.5B | 1.1 GB | 40+ | Быстрое кодинг |
Модели для MacBook Air M1 16GB (референс)
Ниже таблица с моделями, которые хорошо работают на 16GB унифицированной памяти M1/M2 чипов.
| Задача | Модель | Размер | Квантизация | Скорость (токен/сек) | HuggingFace / Ollama |
|---|---|---|---|---|---|
| Повседневный чат | Qwen 3.5 9B | 6.6 GB | Q4_K_M | 10–13 | HF / Ollama |
| Максимальная скорость | Qwen 3.5 4B | 3.4 GB | Q4_K_M | 28–35 | HF / Ollama |
| Кодинг | Qwen 2.5 Coder 7B | 4.7 GB | Q4_K_M | 22–25 | HF / Ollama |
| Письмо/контент | Llama 3.3 8B | 4.9 GB | Q4_K_M | 14–18 | HF / Ollama |
| Математика/reasoning | Phi-4 Mini | 2.3 GB | Q4_K_M | 25–30 | HF / Ollama |
| Мультимодальная (зрение) | Gemma 4 E4B | 2.5 GB | Q4_K_M | 30–38 | HF / Ollama |
| Tool calling / агенты | LFM2.5 8B-A1B | 5.5 GB | Q4_K_M | 35–45 | HF |
| Длинный контекст | Qwen 3.5 9B | 6.6 GB | Q4_K_M | 10–13 | HF / Ollama |
Как подобрать модель под ваш объем памяти
Формула расчета
Память модели ≈ (Параметры в млрд) × (Байт на параметр) + KV cache + накладные расходы
Примеры расчета для разных объемов RAM
| Доступно RAM | Пример модели | Расчет |
|---|---|---|
| 4-6 GB (своп возможен) | Qwen 2.5 1.5B Q4_K_M (~1.1 GB) | 1.5B × 0.55 ≈ 0.8 GB + KV (~0.3GB) ≈ 1.1-1.4 GB |
| 8 GB | Qwen 2.5 3B Q4_K_M (~2.0 GB) | 3B × 0.55 ≈ 1.65 GB + KV (~0.3GB) ≈ 2.0 GB |
| 16 GB | Qwen 3.5 9B Q4_K_M (~7.0 GB) | 9B × 0.55 ≈ 4.95 GB + KV (~1.0GB) + overhead ≈ 7.0 GB |
| 24 GB | Llama 3 14B Q4_K_M (~8.7 GB) | 14B × 0.55 ≈ 7.7 GB + KV (~1.5GB) ≈ 9.2 GB |
| 32 GB | Mixtral 8x7B Q4_K_M (~24 GB MoE) | Эффективно ~6B активных параметров × 0.55 ≈ 3.3 GB + KV (~2GB) ≈ 8-10 GB эффективно |
| 48+ GB | Llama 3 70B Q3_K_M (~39 GB) | 70B × 0.41 ≈ 28.7 GB + KV (~8GB) ≈ 36-40 GB |
Рекомендации по объемам
| RAM | Лучший выбор | Альтернатива |
|---|---|---|
| 4-6 GB | TinyLlama 1.1B, Phi-2 2.7B, Qwen 1.5-1.8B | Для чата и простых задач |
| 8 GB | Qwen 2.5 3B, Phi-3 Mini 3.8B, Mistral 7B | Баланс скорости и качества |
| 16 GB | Qwen 3.5 9B, Llama 3.1 8B, Qwen 2.5 Coder 7B | Универсальный выбор |
| 24-32 GB | Llama 3 14B, Mixtral 8x7B, Command R | Для сложных задач и агентов |
| 48+ GB | Llama 3 70B, Mixtral 8x22B | Для максимального качества и сложных рассуждений |
Специализированные модели
Для работы с изображениями (vision)
- Gemma 4 (4B) - отличный баланс размер/качество
- Llama 3.2 Vision (11B/90B) - если нужен максимум качества
- Pixtral (12B) - от Mistral, хорошие мультимуодальные способности
- InternVL2 (2B/4B/8B) - серия с отличным качеством для своего размера
Для длинного контекста
- Qwen 3.5 серии (8B/14B/32B) - до 32K токенов контекста
- Yi серии (6B/9B/34B) - до 200K токенов у некоторых вариантов
- GLM-4 (9B) - до 128K токенов
- Phi-3-mini-128k - специальная версия с 128K контекстом
Как читать названия моделей
Пример: Qwen 2.5 Coder 7B Instruct Q4_K_M
- Qwen 2.5 - семейство и версия модели
- Coder - специализация (можно пропустить для общей модели)
- 7B - количество параметров (7 миллиардов)
- Instruct - версия, настроенная на выполнение инструкций (vs базовая)
- Q4_K_M - тип квантизации (см. ниже)
Основные типы квантизации (GGUF)
| Тип | Бит/вес | Качество | Размер | Когда использовать |
|---|---|---|---|---|
| Q2_K | ~2 | Очень низкое | Очень маленькое | Только при критической нехватке памяти |
| Q3_K_S/M | ~3-3.5 | Низкое-среднее | Маленькое | Ограниченные ресурсы |
| Q4_0 | 4.0 | Удовлетворительное | Среднее | Когда нужна предсказуемость |
| Q4_K_S/M | ~4.3-4.8 | Хорошее-отличное | Среднее | Баланс качества и размера |
| Q5_0 | 5.0 | Очень хорошее | Больше среднего | Когда есть немного лишней памяти |
| Q5_K_S/M | ~5.3-5.5 | Отличное | Больше среднего | Высокое качество при умеренном размере |
| Q6_K | ~6.0 | Высокое | Большое | Для кода и критических задач |
| Q8_0 | 8.0 | Почти как FP16 | Большое | Когда памяти достаточно и нужно максимум качества |
| F16 | 16.0 | Максимум | Очень большое | Для экспериментов и сравнения baseline |
Совет по выбору квантизации: Для большинства задач начните с Q4_K_M - это обычно лучший баланс качества, размера и скорости. Если нужно больше качества и есть память - переходите на Q5_K_M или Q6_K. Если критична скорость или очень мало памяти - рассмотрите Q3_K_M или Q2_K.
Специфические рекомендации по железу
Apple Silicon (M1/M2/M3/M4)
- Лучше всего работают модели в формате GGUF
- Через Ollama или LM Studio (автоматически использует Metal)
- Для максимальной скорости - mlx-lm (формат MLX)
- Избегайте больших контекстных окон (>16K) на M1/M2 из-за ограниченной пропускной способности памяти
NVIDIA GPU
- Лучше всего работают через llama.cpp с CUDA или через текстовые инференс фреймворки
- Форматы GGUF и GPTQ работают хорошо
- Обращайте внимание на объем VRAM (не путать с системной RAM)
- Для 8GB VRAM: модели до 7B Q4/Q5 комфортно
- Для 12GB VRAM: до 13B Q4/Q5
- Для 16GB VRAM: до 20-24B Q4
- Для 24GB+ VRAM: можно пробовать 30-70B модели с соответствующей квантизацией
AMD GPU
- Поддержка через ROCm (ограниченная)
- Лучше использовать через llama.cpp или текстовые фреймворки с CPU fallback
- Аналогичные рекомендации по объему памяти как для NVIDIA
CPU только
- Ограничьтесь моделями до 3-4B для приемлемой скорости
- Используйте агрессивную квантизацию (Q2_K/Q3_K)
- Ожидайте скорость 1-5 токенов/секунду на современных процессорах
- Лучше всего подходят для экспериментов и легких задач
Где брать модели
Ollama библиотека
Самый простой способ для начала:
ollama pull qwen3:8b
ollama run qwen3:8b
Доступные модели можно посмотреть на ollama.com/library
Hugging Face
Для более продвинутых пользователей:
- Ищите модели с суффиксом
.ggufв названии (готово для llama.cpp) - Или берите оригинальные модели и конвертируйте сами через
llama.cpp/convert_hf_to_gguf.py - Популярные организации:
Qwen,meta-llama,microsoft,google,NousResearch,TheBloke,lmstudio-community
Основные коллекции на HF
- TheBloke - почти все популярные модели в разных квантизациях GGUF
- lmstudio-community - оптимизированные для LM Studio
- unsloth - модели, оптимизированные для быстрого fine-tuning
- ** abitanti** - экспериментальные и специализированные модели
Следите за обновлениями
Мир LLM моделей меняется очень быстро. Рекомендуется:
- Следить за релизами от основных лабораторий (Meta, Mistral, Qwen, Microsoft, Google)
- Проверять обновления в любимых репозиториях на HuggingFace каждые 2-4 недели
- Участвовать в сообществах r/LocalLLaMA и соответствующих Discords
8. Что дальше
| Если хотите | Переходите |
|---|---|
| Полный каталог всех моделей с характеристиками | catalog.md |
| Понять, сколько памяти нужно для выбранной модели | memory-and-context.md |
| Настроить Ollama под свою задачу | advanced-setup.md |
| Запустить модель, если ещё не | running-models.md |
| Вернуться к выбору сценария | README.md |
В разделе: getting-started · running-models · models · catalog · quantization · memory-and-context · tools · advanced-setup · troubleshooting · apple-silicon
Связанные разделы: Нулевой уровень · AI-агенты · Use Cases
Навигация: ← Локальные модели · ↑ На главную · 🇬🇧 English