Как работают нейросети (объяснение без формул)

Внутреннее устройство LLM — на аналогиях, без единой формулы.

← Что такое AI · Облако или локально → · 🇬🇧 English


Содержание

  1. Нейросеть — это конвейер предсказаний
  2. Токены: из чего модель собирает текст
  3. Внимание (Attention): как модель связывает слова
  4. Трансформер: архитектура, которая всё изменила
  5. Контекстное окно: что модель «помнит»
  6. Температура и креативность
  7. Почему модели ошибаются (галлюцинации)
  8. Что дальше

1. Нейросеть — это конвейер предсказаний

Самое важное, что нужно понять о современных языковых моделях:

LLM — это «умный автодополнитель».

Она не «думает», не «понимает», не имеет сознания. Она делает одну простую вещь: получает последовательность слов и предсказывает следующее слово. Снова и снова, слово за словом.

Вход: «Столица Франции — это...»  →  Модель вычисляет  →  «Париж»
Теперь вход: «Столица Франции — это Париж. Он известен...»  →  Модель вычисляет  →  «своей»
И так далее, пока не получится целый текст.

Аналогия: представьте автодополнение в смартфоне, которое предсказывает следующее слово. LLM — то же самое, но обученное на невообразимо большем объёме текстов и с миллиардами «нейронов».


2. Токены: из чего модель собирает текст

Модель работает не со словами, а с токенами.

Токен — это кусочек текста, обычно 2-4 символа. Слово может быть одним токеном, а может разбиваться на несколько.

Аналогия: токены — это кубики LEGO. Из них можно собрать что угодно: слово «дом», предложение, целую книгу. Модель оперирует кубиками, а не готовыми словами.

Пример (как модель видит текст):

«Привет, как дела?» → [При) (вет) (,) (как) ( дела) (?)]

Почему это важно:

Сколько это в реальности:


3. Внимание (Attention): как модель связывает слова

Главный механизм, который делает современные LLM умными — это Self-Attention (самовнимание).

Проблема

Посмотрите на предложение:

«The animal didn’t cross the street because it was too tired.»

К кому относится слово it — к животному (animal) или к улице (street)? Человек сразу понимает: tired (устало) может быть животное, а не улица.

Ранние модели с этим не справлялись. Self-attention решил эту проблему.

Как это работает (аналогия)

Аналогия с картотекой: У модели есть «картотека» всех слов в предложении. Для каждого слова она ищет в этой картотеке «папки», которые помогут понять это слово.

  • Запрос (Query) — стикер с темой, что мы ищем
  • Ключи (Keys) — подписи на папках
  • Значения (Values) — содержимое папок

Модель сопоставляет запрос с ключами, определяет, какие папки важнее всего, и смешивает их содержимое. В результате слово «it» получает информацию от слова «animal», а не от «street».

Аналогия с прожектором: Представьте, что модель водит прожектором по словам предложения. Для каждого слова она подсвечивает другие слова, которые помогают его понять. Для слова «it» прожектор светит на «animal». Для слова «перевёл» — на «программист» и «код».

Благодаря вниманию модель понимает контекст: знает, что ice cream — это мороженое, а не «лёд + крем», и что в слове «ключ» она говорит о двери, а не о роднике.


4. Трансформер: архитектура, которая всё изменила

В 2017 году Google опубликовала статью «Attention Is All You Need» (Внимание — всё, что вам нужно), в которой предложила архитектуру Трансформер.

До трансформеров модели обрабатывали текст последовательно (слово за словом), что было медленно и неэффективно. Трансформер обрабатывает все слова сразу, параллельно.

Упрощённая схема

Вход: «Кот на коврике»
         ↓
Каждое слово превращается в числа (эмбеддинги)
         ↓
Слой внимания: все слова «смотрят» на все слова
         ↓
Нейросеть делает выводы на основе этих связей
         ↓
Снова слой внимания → снова выводы (6-96 раз подряд)
         ↓
Выход: наиболее вероятное следующее слово

Каждый слой делает модель немного «умнее». В маленьких моделях 6-12 слоёв, в больших — 60-96.

Важно: все современные языковые модели (GPT, Llama, Qwen, DeepSeek, Mistral) — это трансформеры. Разница — в количестве слоёв, параметров и данных для обучения.


5. Контекстное окно: что модель «помнит»

Контекстное окно — это количество токенов, которое модель может обработать за один раз.

Аналогия: это размер рабочего стола модели. Все инструменты и документы, которые помещаются на стол — модель видит. Что не поместилось — модель «забыла».

Почему это важно

Когда вы общаетесь с моделью, весь диалог (ваши вопросы + ответы модели) должен помещаться в контекстное окно. Если диалог слишком длинный — модель забудет начало разговора.

Практические последствия:

Размер окна Сколько текста Для чего достаточно
2K (2000 токенов) ~1400 слов Простой вопрос-ответ
4K ~2800 слов Небольшой диалог
8K ~5600 слов Средний документ
32K ~22000 слов Кодовая база, большая статья
128K ~90000 слов Роман «Война и мир» (частично)
1M+ ~700000 слов Вся кодовая база проекта

На практике: для локального запуска модели с 8K контекстом — это норма. Для кодинга с Aider нужно минимум 16-32K. Чем больше контекст, тем больше памяти нужно модели.


6. Температура и креативность

Температура — это параметр, который управляет «креативностью» модели.

Аналогия: представьте, что модель выбирает следующее слово на рулетке. При температуре 0 рулетка всегда останавливается на самом вероятном секторе. Чем выше температура, тем чаще рулетка выбирает менее вероятные варианты.

Температура Поведение Когда использовать
0 Консервативно, всегда выбирает самое вероятное слово Факты, перевод, суммаризация
0.3–0.5 Немного разнообразия Код, деловая переписка
0.7–0.9 Творчески Письмо, мозговой штурм
1.0+ Хаотично, может «улететь в космос» Поэзия, генерация идей

Для кодинга рекомендуется температура 0.1–0.3 — вы хотите предсказуемый, корректный код, а не творчество.


7. Почему модели ошибаются (галлюцинации)

Галлюцинация — когда модель уверенно выдаёт неверный факт.

Причины

  1. Модель не знает границ своих знаний. Она не может сказать «я не знаю» — она всегда выдаёт наиболее вероятное продолжение. Если вопрос про то, чего нет в обучении, она всё равно ответит — но ответ может быть неверным.

  2. Модель не «помнит» факты. Она не хранит базу данных. Она предсказывает слова на основе статистических закономерностей. Иногда статистика даёт сбой.

  3. Модель путает похожие концепции. Если Африка и Америка часто упоминались рядом в обучении, модель может перепутать факты о них.

Как бороться


8. Что дальше

Если хотите Переходите
Выбрать: облако или локально cloud-vs-local.ru.md
Проверить, какое нужно железо hardware-guide.ru.md
Установить Ollama и запустить модель ../local-models/getting-started.ru.md
Посмотреть словарь терминов glossary.ru.md
Вернуться к навигации README.ru.md

В разделе: what-is-ai · how-models-work · cloud-vs-local · hardware-guide · glossary · faq · learning-path · setup-windows · setup-linux
Связанные разделы: Локальные модели · AI-агенты · Use Cases
Навигация: ← Нулевой уровень · ↑ На главную · 🇬🇧 English