Как работают нейросети (объяснение без формул)
Внутреннее устройство LLM — на аналогиях, без единой формулы.
← Что такое AI · Облако или локально → · 🇬🇧 English
Содержание
- Нейросеть — это конвейер предсказаний
- Токены: из чего модель собирает текст
- Внимание (Attention): как модель связывает слова
- Трансформер: архитектура, которая всё изменила
- Контекстное окно: что модель «помнит»
- Температура и креативность
- Почему модели ошибаются (галлюцинации)
- Что дальше
1. Нейросеть — это конвейер предсказаний
Самое важное, что нужно понять о современных языковых моделях:
LLM — это «умный автодополнитель».
Она не «думает», не «понимает», не имеет сознания. Она делает одну простую вещь: получает последовательность слов и предсказывает следующее слово. Снова и снова, слово за словом.
Вход: «Столица Франции — это...» → Модель вычисляет → «Париж»
Теперь вход: «Столица Франции — это Париж. Он известен...» → Модель вычисляет → «своей»
И так далее, пока не получится целый текст.
Аналогия: представьте автодополнение в смартфоне, которое предсказывает следующее слово. LLM — то же самое, но обученное на невообразимо большем объёме текстов и с миллиардами «нейронов».
2. Токены: из чего модель собирает текст
Модель работает не со словами, а с токенами.
Токен — это кусочек текста, обычно 2-4 символа. Слово может быть одним токеном, а может разбиваться на несколько.
Аналогия: токены — это кубики LEGO. Из них можно собрать что угодно: слово «дом», предложение, целую книгу. Модель оперирует кубиками, а не готовыми словами.
Пример (как модель видит текст):
«Привет, как дела?» → [При) (вет) (,) (как) ( дела) (?)]
Почему это важно:
- У модели есть лимит на количество токенов за раз — это контекстное окно
- Чем больше токенов в запросе, тем дольше модель обрабатывает
- Русский язык требует больше токенов на слово, чем английский (русские слова длиннее)
Сколько это в реальности:
- 1 токен ≈ 0.7 слова для русского (примерно 3-4 символа)
- 1000 токенов ≈ 700 русских слов (примерно страница текста)
- Модель с контекстом 8K токенов ≈ 5000 слов (несколько страниц)
- Модель с контекстом 128K токенов ≈ 90 000 слов (целая книга)
3. Внимание (Attention): как модель связывает слова
Главный механизм, который делает современные LLM умными — это Self-Attention (самовнимание).
Проблема
Посмотрите на предложение:
«The animal didn’t cross the street because it was too tired.»
К кому относится слово it — к животному (animal) или к улице (street)? Человек сразу понимает: tired (устало) может быть животное, а не улица.
Ранние модели с этим не справлялись. Self-attention решил эту проблему.
Как это работает (аналогия)
Аналогия с картотекой: У модели есть «картотека» всех слов в предложении. Для каждого слова она ищет в этой картотеке «папки», которые помогут понять это слово.
- Запрос (Query) — стикер с темой, что мы ищем
- Ключи (Keys) — подписи на папках
- Значения (Values) — содержимое папок
Модель сопоставляет запрос с ключами, определяет, какие папки важнее всего, и смешивает их содержимое. В результате слово «it» получает информацию от слова «animal», а не от «street».
Аналогия с прожектором: Представьте, что модель водит прожектором по словам предложения. Для каждого слова она подсвечивает другие слова, которые помогают его понять. Для слова «it» прожектор светит на «animal». Для слова «перевёл» — на «программист» и «код».
Благодаря вниманию модель понимает контекст: знает, что ice cream — это мороженое, а не «лёд + крем», и что в слове «ключ» она говорит о двери, а не о роднике.
4. Трансформер: архитектура, которая всё изменила
В 2017 году Google опубликовала статью «Attention Is All You Need» (Внимание — всё, что вам нужно), в которой предложила архитектуру Трансформер.
До трансформеров модели обрабатывали текст последовательно (слово за словом), что было медленно и неэффективно. Трансформер обрабатывает все слова сразу, параллельно.
Упрощённая схема
Вход: «Кот на коврике»
↓
Каждое слово превращается в числа (эмбеддинги)
↓
Слой внимания: все слова «смотрят» на все слова
↓
Нейросеть делает выводы на основе этих связей
↓
Снова слой внимания → снова выводы (6-96 раз подряд)
↓
Выход: наиболее вероятное следующее слово
Каждый слой делает модель немного «умнее». В маленьких моделях 6-12 слоёв, в больших — 60-96.
Важно: все современные языковые модели (GPT, Llama, Qwen, DeepSeek, Mistral) — это трансформеры. Разница — в количестве слоёв, параметров и данных для обучения.
5. Контекстное окно: что модель «помнит»
Контекстное окно — это количество токенов, которое модель может обработать за один раз.
Аналогия: это размер рабочего стола модели. Все инструменты и документы, которые помещаются на стол — модель видит. Что не поместилось — модель «забыла».
Почему это важно
Когда вы общаетесь с моделью, весь диалог (ваши вопросы + ответы модели) должен помещаться в контекстное окно. Если диалог слишком длинный — модель забудет начало разговора.
Практические последствия:
| Размер окна | Сколько текста | Для чего достаточно |
|---|---|---|
| 2K (2000 токенов) | ~1400 слов | Простой вопрос-ответ |
| 4K | ~2800 слов | Небольшой диалог |
| 8K | ~5600 слов | Средний документ |
| 32K | ~22000 слов | Кодовая база, большая статья |
| 128K | ~90000 слов | Роман «Война и мир» (частично) |
| 1M+ | ~700000 слов | Вся кодовая база проекта |
На практике: для локального запуска модели с 8K контекстом — это норма. Для кодинга с Aider нужно минимум 16-32K. Чем больше контекст, тем больше памяти нужно модели.
6. Температура и креативность
Температура — это параметр, который управляет «креативностью» модели.
Аналогия: представьте, что модель выбирает следующее слово на рулетке. При температуре 0 рулетка всегда останавливается на самом вероятном секторе. Чем выше температура, тем чаще рулетка выбирает менее вероятные варианты.
| Температура | Поведение | Когда использовать |
|---|---|---|
| 0 | Консервативно, всегда выбирает самое вероятное слово | Факты, перевод, суммаризация |
| 0.3–0.5 | Немного разнообразия | Код, деловая переписка |
| 0.7–0.9 | Творчески | Письмо, мозговой штурм |
| 1.0+ | Хаотично, может «улететь в космос» | Поэзия, генерация идей |
Для кодинга рекомендуется температура 0.1–0.3 — вы хотите предсказуемый, корректный код, а не творчество.
7. Почему модели ошибаются (галлюцинации)
Галлюцинация — когда модель уверенно выдаёт неверный факт.
Причины
-
Модель не знает границ своих знаний. Она не может сказать «я не знаю» — она всегда выдаёт наиболее вероятное продолжение. Если вопрос про то, чего нет в обучении, она всё равно ответит — но ответ может быть неверным.
-
Модель не «помнит» факты. Она не хранит базу данных. Она предсказывает слова на основе статистических закономерностей. Иногда статистика даёт сбой.
-
Модель путает похожие концепции. Если Африка и Америка часто упоминались рядом в обучении, модель может перепутать факты о них.
Как бороться
- Всегда проверяйте факты, особенно важные
- Используйте RAG (поиск по своим документам) — тогда модель отвечает на основе ваших данных
- Понижайте температуру (0 → минимум галлюцинаций)
- Давайте модели инструменты: если она может «посмотреть в интернет» или «выполнить код», ошибок меньше
8. Что дальше
| Если хотите | Переходите |
|---|---|
| Выбрать: облако или локально | cloud-vs-local.ru.md |
| Проверить, какое нужно железо | hardware-guide.ru.md |
| Установить Ollama и запустить модель | ../local-models/getting-started.ru.md |
| Посмотреть словарь терминов | glossary.ru.md |
| Вернуться к навигации | README.ru.md |
В разделе: what-is-ai · how-models-work · cloud-vs-local · hardware-guide · glossary · faq · learning-path · setup-windows · setup-linux
Связанные разделы: Локальные модели · AI-агенты · Use Cases
Навигация: ← Нулевой уровень · ↑ На главную · 🇬🇧 English