Какое нужно железо для локального AI

Разрушаем мифы: от 5-летнего ноутбука до専сервера.

← Облако или локально · Установка на Windows → · 🇬🇧 English


Содержание

  1. Главное, что нужно понять
  2. Три уровня железа
  3. Mac: модели и чипы
  4. Windows и Linux: CPU vs GPU
  5. Квантование: как запустить модель на слабом ПК
  6. Мой компьютер тянет? — чеклист
  7. Что дальше

1. Главное, что нужно понять

Для локального AI важна память, а не процессор.

Аналогия: представьте, что модель — это огромная книга. Память — это размер вашего стола. Если книга не помещается на стол — вы её не откроете. Чем больше стол — тем более толстую книгу вы можете читать. Скорость чтения зависит от того, насколько быстро вы переворачиваете страницы (процессор).

Сколько памяти нужно разным моделям:

Модель Размер (Q4_K_M) Минимум RAM
Qwen 3.5 4B ~3.5 GB 8 GB
Qwen 2.5 Coder 7B ~4.5 GB 8-16 GB
Llama 3.1 8B ~5.5 GB 16 GB
Qwen 3.5 14B ~9 GB 16-32 GB
Qwen 3 Coder 30B ~18 GB 32-48 GB
Llama 3 70B ~40 GB 64 GB+

Q4_K_M — формат модели, сжатый до ~4 бит на параметр. Подробнее в ../local-models/quantization.ru.md.


2. Три уровня железа

Начальный: 8 GB RAM, любой процессор

Что можно запускать: модели до 3B параметров (Qwen 2.5 1.5B, Phi-3-mini, Gemma 2B).

Реальность: медленно (~5-15 токенов/сек на CPU), но работает. Подходит для простого чата, базового автодополнения кода.

┌─────────────────────────────────────┐
│ 8 GB RAM / CPU-only                 │
│                                     │
│  Qwen 2.5 1.5B  →  🟢 быстро        │
│  Phi-3-mini      →  🟢 быстро        │
│  Qwen 2.5 7B     →  🔴 не влезает   │
│  Llama 3.1 8B    →  🔴 не влезает   │
└─────────────────────────────────────┘

Комфортный: 16 GB RAM, Apple Silicon или entry GPU

Что можно запускать: модели до 7-9B (Qwen 3.5 7B, Llama 3.1 8B, Qwen 2.5 Coder 7B).

Это золотая середина. На MacBook Air M1/M2/M3 16 GB — полноценный рабочий процесс: чат, кодинг с AI, простые агенты. На Windows с RTX 3060/4060 — ещё быстрее.

┌─────────────────────────────────────┐
│ 16 GB RAM / M1-M4 / RTX 3060        │
│                                     │
│  Qwen 3.5 4B       →  🟢 28-35 t/s │
│  Qwen 3.5 7B       →  🟢 18-25 t/s │
│  Llama 3.1 8B      →  🟢 15-20 t/s │
│  Qwen 2.5 Coder 7B →  🟢 22-25 t/s │
│  DeepSeek-R1 7B    →  🟡 10-15 t/s │
└─────────────────────────────────────┘

Мощный: 32 GB+ RAM, RTX 3090/4090 или Mac с 48 GB+

Что можно запускать: модели 14-30B (Qwen 3 Coder 30B, DeepSeek-R1 14B, Qwen 3.5 14B).

Реальность: замена GPT-4 для большинства задач. Кодинг, рефакторинг, агенты — всё работает отлично.

┌─────────────────────────────────────┐
│ 32-64 GB / RTX 3090/4090 / M3 Max   │
│                                     │
│  Qwen 3.5 14B      →  🟢 18-25 t/s │
│  Qwen 3 Coder 30B  →  🟢 15-20 t/s │
│  DeepSeek-R1 14B   →  🟡 12-18 t/s │
│  DeepSeek-R1 32B   →  🟡 8-12 t/s  │
└─────────────────────────────────────┘

3. Mac: модели и чипы

Apple Silicon (M1, M2, M3, M4) — лучшая платформа для локального AI на сегодня. Почему:

Скорость в токенах/сек (Q4_K_M)

Чип 7-8B 14B 30B 70B
M1 8 GB 12-14
M1 16 GB 18-24 11-12
M2 16 GB 22-28 12-14
M3 16 GB 22-33 12-15
M4 16 GB 25-35 14-17
M3 Max 128 GB 65-75 40-45 25-30 10-14
M4 Max 128 GB 75-95 45-55 30-40 15-22

Подробные бенчмарки: ../local-models/benchmarks/apple-silicon.ru.md

Intel Mac: не поддерживается LM Studio, медленно работает в Ollama. Если у вас Intel Mac — рассмотрите обновление или используйте облачные модели.


4. Windows и Linux: CPU vs GPU

Без дискретной видеокарты (только CPU)

CPU-инференс работает, но медленнее. Для моделей до 7B — вполне юзабельно:

CPU Модель t/s
Intel i5 / Ryzen 5 1-3B 10-20
Intel i7 / Ryzen 7 7B 5-10
Intel i9 / Ryzen 9 7B 8-15

Совет: используйте Q4 квантование и маленькие модели (до 3B) на CPU.

С видеокартой (GPU)

GPU VRAM Модели t/s на 7B
RTX 3060 12 GB до 14B Q4 30-40
RTX 4060 8 GB до 7B Q4 30-40
RTX 3090 24 GB до 30B Q4 50-70
RTX 4090 24 GB до 30B Q8 80-120
2× RTX 3090 48 GB до 70B Q4 20+

5. Квантование: как запустить модель на слабом ПК

Квантование — это сжатие модели. Представьте, что вы берёте фотографию в высоком разрешении и сохраняете её как JPEG. Качество чуть падает, но размер уменьшается в 2-4 раза.

В мире моделей:

Что это значит для вас: модель 7B в Q4_K_M занимает ~4.5 GB вместо ~14 GB. И это почти так же умно.

Подробнее: ../local-models/quantization.ru.md


6. Мой компьютер тянет? — чеклист

У меня Mac на Apple Silicon

Отлично. Установите Ollama → ../local-models/getting-started.ru.md

У меня 16+ GB RAM

Отлично, золотая середина. Работайте с моделями 7-9B.

У меня 8 GB RAM

Можно, но придётся выбирать маленькие модели (1-3B). Начните с Phi-3-mini или Qwen 2.5 1.5B.

У меня есть GPU с 8+ GB VRAM

Отлично. Используйте Ollama с CUDA — будет быстро.

У меня старый ноутбук (5+ лет, Intel)

Можно, но модели только 1-3B и медленно. Рекомендую временно использовать облачные сервисы или купить MacBook Air M1 б/у ($500-700).

Я не знаю, что у меня

# Mac: откройте терминал и введите
system_profiler SPHardwareDataType | grep -E "Chip|Memory"

# Windows: откройте PowerShell
Get-ComputerInfo | Select-Object CsProcessors, CsTotalPhysicalMemory

# Linux: откройте терминал
lscpu | grep "Model name"
free -h | grep "Mem"

7. Что дальше

Если хотите Переходите
Установить Ollama на Mac ../local-models/getting-started.ru.md
Установить на Windows setup-windows.ru.md
Установить на Linux setup-linux.ru.md
Разобраться в квантовании ../local-models/quantization.ru.md
Посмотреть бенчмарки Mac ../local-models/benchmarks/apple-silicon.ru.md
Вернуться к навигации README.ru.md

В разделе: what-is-ai · how-models-work · cloud-vs-local · hardware-guide · glossary · faq · learning-path · setup-windows · setup-linux
Связанные разделы: Локальные модели · AI-агенты · Use Cases
Навигация: ← Нулевой уровень · ↑ На главную · 🇬🇧 English