Бенчмарки Apple Silicon
Реальные замеры скорости генерации на Q4_K_M.
← Локальные модели · Инструменты и сравнение движков
🇬🇧 English version: apple-silicon.md
Сводная таблица производительности
Источники: MLJourney, CraftRigs, MacYou, LLMCheck.
| Чип | 8B tok/s | 14B tok/s | 27–30B tok/s | 70B tok/s |
|---|---|---|---|---|
| M1 8 GB | 12–14 | |||
| M1 16 GB | 18–24 | 11–12 | ||
| M2 16 GB | 22–28 | 12–14 | ||
| M2 Pro 32 GB | 30–38 | 18–20 | — | |
| M2 Max 64 GB | 50–65 | 30–35 | — | 10–12 |
| M3 16 GB | 22–33 | 12–15 | ||
| M3 Pro 36 GB | 35–39 | 20–22 | 12–15 | |
| M3 Max 128 GB | 65–75 | 40–45 | 25–30 | 10–14 |
| M4 16 GB | 25–35 | 14–17 | ||
| M4 Pro 48 GB | 38–50 | 22–26 | 18–25 | 7–11 |
| M4 Max 64 GB | 65–85 | 40–50 | 28–35 | 12–18 |
| M4 Max 128 GB | 75–95 | 45–55 | 30–40 | 15–22 |
| M4 Ultra 192 GB | 100–140 | 60–80 | 40–60 | 25–35 |
= не влезает в RAM / постоянный swap (0.4–2.2 tok/s).
Все цифры — генерация, не prefill. Prefill обычно в 10–30× быстрее.
Для NVIDIA/Windows/Linux производительность будет существенно выше (RTX 4090 выдаёт 80–120 tok/s на 8B).
Скорость по задачам (M1 16 GB, Q4_K_M)
| Задача | Модель | tok/s | Примечание |
|---|---|---|---|
| Автодополнение (FIM) | Qwen 2.5 Coder 1.5B | 30+ | |
| Основной кодер | Qwen 2.5 Coder 7B | 22–25 | |
| Быстрый чат | Qwen 3.5 4B | 28–35 | |
| Сбалансированный чат | Qwen 3.5 9B | 10–13 | |
| Reasoning | DeepSeek R1 Distill 14B | 8–10 |
Быстро ·
Нормально ·
Медленно
MLX vs Ollama vs llama.cpp
M4 Pro 24 GB, Qwen3-Coder-30B MoE (источник: asiai.dev):
| Метрика | LM Studio (MLX) | Ollama (llama.cpp) | Разница |
|---|---|---|---|
| Throughput | 102 tok/s | 70 tok/s | +46% |
| TTFT | 291 ms | 175 ms | Ollama быстрее |
| GPU Power | 12.4 W | 15.4 W | -20% |
| Process Memory | 21.4 GB | 41.6 GB | -49% |
M5 Max 128 GB, Llama 3.1 70B Q4 (источник: CraftRigs):
| Движок | tok/s |
|---|---|
| MLX | 18 |
| llama.cpp Metal | 14 |
| Ollama | 12 |
Ollama 0.19+ с MLX backend
С марта 2026 Ollama умеет автоматически переключаться на MLX backend на Mac с 32 GB+ RAM:
- Qwen 3.5-35B-A3B: 58 → 112 tok/s на M5 Max (+93%)
- Пока работает не со всеми моделями (Qwen — да, Llama/Mistral — пока нет)
Подробнее — в tools.md.
Что дальше
| Если хотите | Переходите |
|---|---|
| Выбрать модель под свой Mac | models.ru.md |
| Сравнить инструменты для максимальной скорости | tools.ru.md |
| Понять, сколько памяти нужно | memory-and-context.ru.md |
| Вернуться к навигации | README.ru.md |
В разделе: getting-started · running-models · models · catalog · quantization · memory-and-context · tools · advanced-setup · troubleshooting · apple-silicon
Связанные разделы: Нулевой уровень · AI-агенты · Use Cases
Навигация: ← Локальные модели · ↑ На главную · 🇬🇧 English