Какое нужно железо для локального AI
Разрушаем мифы: от 5-летнего ноутбука до専сервера.
← Облако или локально · Установка на Windows → · 🇬🇧 English
Содержание
- Главное, что нужно понять
- Три уровня железа
- Mac: модели и чипы
- Windows и Linux: CPU vs GPU
- Квантование: как запустить модель на слабом ПК
- Мой компьютер тянет? — чеклист
- Что дальше
1. Главное, что нужно понять
Для локального AI важна память, а не процессор.
- Модель занимает место в оперативной памяти (RAM) или в памяти видеокарты (VRAM)
- Скорость ответа зависит от процессора/GPU
- Возможность запустить модель вообще — от объёма памяти
Аналогия: представьте, что модель — это огромная книга. Память — это размер вашего стола. Если книга не помещается на стол — вы её не откроете. Чем больше стол — тем более толстую книгу вы можете читать. Скорость чтения зависит от того, насколько быстро вы переворачиваете страницы (процессор).
Сколько памяти нужно разным моделям:
| Модель | Размер (Q4_K_M) | Минимум RAM |
|---|---|---|
| Qwen 3.5 4B | ~3.5 GB | 8 GB |
| Qwen 2.5 Coder 7B | ~4.5 GB | 8-16 GB |
| Llama 3.1 8B | ~5.5 GB | 16 GB |
| Qwen 3.5 14B | ~9 GB | 16-32 GB |
| Qwen 3 Coder 30B | ~18 GB | 32-48 GB |
| Llama 3 70B | ~40 GB | 64 GB+ |
Q4_K_M — формат модели, сжатый до ~4 бит на параметр. Подробнее в
../local-models/quantization.ru.md.
2. Три уровня железа
Начальный: 8 GB RAM, любой процессор
Что можно запускать: модели до 3B параметров (Qwen 2.5 1.5B, Phi-3-mini, Gemma 2B).
Реальность: медленно (~5-15 токенов/сек на CPU), но работает. Подходит для простого чата, базового автодополнения кода.
┌─────────────────────────────────────┐
│ 8 GB RAM / CPU-only │
│ │
│ Qwen 2.5 1.5B → 🟢 быстро │
│ Phi-3-mini → 🟢 быстро │
│ Qwen 2.5 7B → 🔴 не влезает │
│ Llama 3.1 8B → 🔴 не влезает │
└─────────────────────────────────────┘
Комфортный: 16 GB RAM, Apple Silicon или entry GPU
Что можно запускать: модели до 7-9B (Qwen 3.5 7B, Llama 3.1 8B, Qwen 2.5 Coder 7B).
Это золотая середина. На MacBook Air M1/M2/M3 16 GB — полноценный рабочий процесс: чат, кодинг с AI, простые агенты. На Windows с RTX 3060/4060 — ещё быстрее.
┌─────────────────────────────────────┐
│ 16 GB RAM / M1-M4 / RTX 3060 │
│ │
│ Qwen 3.5 4B → 🟢 28-35 t/s │
│ Qwen 3.5 7B → 🟢 18-25 t/s │
│ Llama 3.1 8B → 🟢 15-20 t/s │
│ Qwen 2.5 Coder 7B → 🟢 22-25 t/s │
│ DeepSeek-R1 7B → 🟡 10-15 t/s │
└─────────────────────────────────────┘
Мощный: 32 GB+ RAM, RTX 3090/4090 или Mac с 48 GB+
Что можно запускать: модели 14-30B (Qwen 3 Coder 30B, DeepSeek-R1 14B, Qwen 3.5 14B).
Реальность: замена GPT-4 для большинства задач. Кодинг, рефакторинг, агенты — всё работает отлично.
┌─────────────────────────────────────┐
│ 32-64 GB / RTX 3090/4090 / M3 Max │
│ │
│ Qwen 3.5 14B → 🟢 18-25 t/s │
│ Qwen 3 Coder 30B → 🟢 15-20 t/s │
│ DeepSeek-R1 14B → 🟡 12-18 t/s │
│ DeepSeek-R1 32B → 🟡 8-12 t/s │
└─────────────────────────────────────┘
3. Mac: модели и чипы
Apple Silicon (M1, M2, M3, M4) — лучшая платформа для локального AI на сегодня. Почему:
- Unified Memory — GPU и CPU используют одну и ту же память. Весь объём RAM доступен модели. На Mac с 64 GB можно запускать модели 70B, что на PC потребовало бы RTX 4090 за $2000
- MLX — фреймворк от Apple для эффективного запуска моделей (иногда в 2 раза быстрее Ollama)
- Энергоэффективность — MacBook может работать с моделью от батареи, PC с GPU потребляет 300-450W
Скорость в токенах/сек (Q4_K_M)
| Чип | 7-8B | 14B | 30B | 70B |
|---|---|---|---|---|
| M1 8 GB | 12-14 | |||
| M1 16 GB | 18-24 | 11-12 | ||
| M2 16 GB | 22-28 | 12-14 | ||
| M3 16 GB | 22-33 | 12-15 | ||
| M4 16 GB | 25-35 | 14-17 | ||
| M3 Max 128 GB | 65-75 | 40-45 | 25-30 | 10-14 |
| M4 Max 128 GB | 75-95 | 45-55 | 30-40 | 15-22 |
Подробные бенчмарки: ../local-models/benchmarks/apple-silicon.ru.md
Intel Mac: не поддерживается LM Studio, медленно работает в Ollama. Если у вас Intel Mac — рассмотрите обновление или используйте облачные модели.
4. Windows и Linux: CPU vs GPU
Без дискретной видеокарты (только CPU)
CPU-инференс работает, но медленнее. Для моделей до 7B — вполне юзабельно:
| CPU | Модель | t/s |
|---|---|---|
| Intel i5 / Ryzen 5 | 1-3B | 10-20 |
| Intel i7 / Ryzen 7 | 7B | 5-10 |
| Intel i9 / Ryzen 9 | 7B | 8-15 |
Совет: используйте Q4 квантование и маленькие модели (до 3B) на CPU.
С видеокартой (GPU)
| GPU | VRAM | Модели | t/s на 7B |
|---|---|---|---|
| RTX 3060 | 12 GB | до 14B Q4 | 30-40 |
| RTX 4060 | 8 GB | до 7B Q4 | 30-40 |
| RTX 3090 | 24 GB | до 30B Q4 | 50-70 |
| RTX 4090 | 24 GB | до 30B Q8 | 80-120 |
| 2× RTX 3090 | 48 GB | до 70B Q4 | 20+ |
5. Квантование: как запустить модель на слабом ПК
Квантование — это сжатие модели. Представьте, что вы берёте фотографию в высоком разрешении и сохраняете её как JPEG. Качество чуть падает, но размер уменьшается в 2-4 раза.
В мире моделей:
- FP16 (оригинал) — 100% качества, 2 байта на параметр
- Q8_0 — 99% качества, 1 байт на параметр
- Q4_K_M — 95-97% качества, 0.5 байта на параметр
рекомендуемый
- Q3_K — 90% качества, 0.375 байта на параметр
- Q2_K — 85% качества, 0.25 байта на параметр (не рекомендую для кода)
Что это значит для вас: модель 7B в Q4_K_M занимает ~4.5 GB вместо ~14 GB. И это почти так же умно.
Подробнее: ../local-models/quantization.ru.md
6. Мой компьютер тянет? — чеклист
У меня Mac на Apple Silicon
Отлично. Установите Ollama →
../local-models/getting-started.ru.md
У меня 16+ GB RAM
Отлично, золотая середина. Работайте с моделями 7-9B.
У меня 8 GB RAM
Можно, но придётся выбирать маленькие модели (1-3B). Начните с Phi-3-mini или Qwen 2.5 1.5B.
У меня есть GPU с 8+ GB VRAM
Отлично. Используйте Ollama с CUDA — будет быстро.
У меня старый ноутбук (5+ лет, Intel)
Можно, но модели только 1-3B и медленно. Рекомендую временно использовать облачные сервисы или купить MacBook Air M1 б/у ($500-700).
Я не знаю, что у меня
# Mac: откройте терминал и введите
system_profiler SPHardwareDataType | grep -E "Chip|Memory"
# Windows: откройте PowerShell
Get-ComputerInfo | Select-Object CsProcessors, CsTotalPhysicalMemory
# Linux: откройте терминал
lscpu | grep "Model name"
free -h | grep "Mem"
7. Что дальше
| Если хотите | Переходите |
|---|---|
| Установить Ollama на Mac | ../local-models/getting-started.ru.md |
| Установить на Windows | setup-windows.ru.md |
| Установить на Linux | setup-linux.ru.md |
| Разобраться в квантовании | ../local-models/quantization.ru.md |
| Посмотреть бенчмарки Mac | ../local-models/benchmarks/apple-silicon.ru.md |
| Вернуться к навигации | README.ru.md |
В разделе: what-is-ai · how-models-work · cloud-vs-local · hardware-guide · glossary · faq · learning-path · setup-windows · setup-linux
Связанные разделы: Локальные модели · AI-агенты · Use Cases
Навигация: ← Нулевой уровень · ↑ На главную · 🇬🇧 English