Бенчмарки Apple Silicon

Реальные замеры скорости генерации на Q4_K_M.

← Локальные модели · Инструменты и сравнение движков

🇬🇧 English version: apple-silicon.md


Сводная таблица производительности

Источники: MLJourney, CraftRigs, MacYou, LLMCheck.

Чип 8B tok/s 14B tok/s 27–30B tok/s 70B tok/s
M1 8 GB 12–14
M1 16 GB 18–24 11–12
M2 16 GB 22–28 12–14
M2 Pro 32 GB 30–38 18–20 —
M2 Max 64 GB 50–65 30–35 — 10–12
M3 16 GB 22–33 12–15
M3 Pro 36 GB 35–39 20–22 12–15
M3 Max 128 GB 65–75 40–45 25–30 10–14
M4 16 GB 25–35 14–17
M4 Pro 48 GB 38–50 22–26 18–25 7–11
M4 Max 64 GB 65–85 40–50 28–35 12–18
M4 Max 128 GB 75–95 45–55 30–40 15–22
M4 Ultra 192 GB 100–140 60–80 40–60 25–35

= не влезает в RAM / постоянный swap (0.4–2.2 tok/s).
Все цифры — генерация, не prefill. Prefill обычно в 10–30× быстрее.
Для NVIDIA/Windows/Linux производительность будет существенно выше (RTX 4090 выдаёт 80–120 tok/s на 8B).


Скорость по задачам (M1 16 GB, Q4_K_M)

Задача Модель tok/s Примечание
Автодополнение (FIM) Qwen 2.5 Coder 1.5B 30+
Основной кодер Qwen 2.5 Coder 7B 22–25
Быстрый чат Qwen 3.5 4B 28–35
Сбалансированный чат Qwen 3.5 9B 10–13
Reasoning DeepSeek R1 Distill 14B 8–10

Быстро · Нормально · Медленно


MLX vs Ollama vs llama.cpp

M4 Pro 24 GB, Qwen3-Coder-30B MoE (источник: asiai.dev):

Метрика LM Studio (MLX) Ollama (llama.cpp) Разница
Throughput 102 tok/s 70 tok/s +46%
TTFT 291 ms 175 ms Ollama быстрее
GPU Power 12.4 W 15.4 W -20%
Process Memory 21.4 GB 41.6 GB -49%

M5 Max 128 GB, Llama 3.1 70B Q4 (источник: CraftRigs):

Движок tok/s
MLX 18
llama.cpp Metal 14
Ollama 12

Ollama 0.19+ с MLX backend

С марта 2026 Ollama умеет автоматически переключаться на MLX backend на Mac с 32 GB+ RAM:

Подробнее — в tools.md.


Что дальше

Если хотите Переходите
Выбрать модель под свой Mac models.ru.md
Сравнить инструменты для максимальной скорости tools.ru.md
Понять, сколько памяти нужно memory-and-context.ru.md
Вернуться к навигации README.ru.md

В разделе: getting-started · running-models · models · catalog · quantization · memory-and-context · tools · advanced-setup · troubleshooting · apple-silicon
Связанные разделы: Нулевой уровень · AI-агенты · Use Cases
Навигация: ← Локальные модели · ↑ На главную · 🇬🇧 English