Библиотека·AI·Что происходит после Enter
Как работает AI / 01

Что происходит после Enter

Как языковая модель собирает ответ — и почему то же самое делал человек с книгой в 1948 году.

Вы спрашиваете: «Почему листья осенью желтеют?» Через секунду перед вами связное объяснение.

Кажется, что где-то в огромной памяти лежал готовый абзац и его нашли. Не лежал. Модель не достаёт готовый ответ — она продолжает текст. Этого текста не существовало нигде — ни в модели, ни в интернете — до того, как вы нажали Enter. Он собрался у вас на глазах, по одному кусочку, и каждый кусочек выбирался с оглядкой на все предыдущие.

Механизм у этого простой настолько, что первую его версию собрали вручную семьдесят восемь лет назад.

Человек с книгой

В 1948 году Клод Шеннон занимался вопросом, далёким от искусственного интеллекта: насколько язык предсказуем. Он строил лестницу приближений к английскому — от чистого шума к чему-то похожему на речь, — и на каждой следующей ступени машина знала о языке чуть больше.

Первая ступень: двадцать шесть букв и пробел, все равновероятны.

XFOML RXKHRJFFJUJ ZLPWCFWKCYJ FFJEYVKCQSGHYD QPAAMKBZAACIBZLHJQD

Вторая: те же буквы, но каждая выпадает с той частотой, с какой встречается в английских текстах — E часто, W редко.

OCRO HLI RGWR NMIELWIS EU LL NBNESEBYA TH EEI ALHENHTTPA OOBTTVA NAH BRL

Дальше — по нарастающей. Буква зависит от предыдущей. Потом от двух предыдущих. Потом Шеннон бросил буквы и перешёл на слова: сначала слова просто по частотам, вразнобой. И наконец шестая ступень, где каждое следующее слово выбирается по тому, как часто оно встречается после предыдущего.

Пройдите лестницу целиком:

Приближения к английскому · Шеннон, 1948

Верхние ступени Шеннон строил руками: открывал книгу на случайной странице, находил нужное слово, листал вперёд до его следующей встречи, выписывал соседа. И так сотни раз.

Что он заметил

Машина на шестой ступени помнит одно предыдущее слово. Ровно одно.

А смысл держится дальше. Шеннон отмечает, что связные куски выходят длиннее, чем учтённый при построении диапазон, и указывает на конкретный отрезок из десяти слов — «attack on an English writer that the character of this», — про который пишет, что он «вполне правдоподобен».

Десять слов подряд, которые не стыдно вставить в живое предложение. От машины, помнящей одно слово.

Чтобы породить структуру, не нужно её понимать. Достаточно знать, что обычно идёт следом.

Что здесь на самом деле произошло

Полезно разобрать, почему это работает, — потому что ровно та же логика работает сегодня.

Возьмём вторую ступень, где буквы просто выпадают со своими частотами. Куски между пробелами получаются похожими на слова по длине — и вот почему.

Пробел для машины — такой же символ, как буквы, и попадается он часто: в английском тексте это примерно каждый пятый-шестой знак. Машина ставит его наугад, как и всё остальное, но с этой частотой. Значит между двумя пробелами само собой оказывается четыре-пять символов. Ровно столько же, сколько в среднем английском слове.

Слов здесь при этом нет ни одного, и машина по-прежнему понятия не имеет, что это такое. Похожа только длина, и она получилась сама собой — из частоты одного-единственного символа.

Дальше по лестнице происходит то же самое, только тоньше: с каждой ступенью машина угадывает всё более крупную структуру, ничего о ней не зная. На третьей появляются правдоподобные буквосочетания, на четвёртой из статистики начинают выпадать настоящие слова, которых туда никто не клал.

Где эта лестница заканчивается — с числами

У подъёма есть предел, и он ближе, чем кажется. Чтобы знать, что идёт после пяти конкретных букв, надо было встретить эти пять букв в тексте. Возможных сочетаний становится больше с каждой ступенью, а текст не растёт — и модель всё чаще имеет на сочетание единственный запомненный пример.

Мы построили модели разных порядков на первых главах «Евгения Онегина» и проверили их на конце поэмы, которого они не видели. Числа — неопределённость следующей буквы в битах: чем меньше, тем увереннее предсказание.

ПамятьНа знакомом текстеНа новом тексте
ничего4,394,37
1 буква3,553,58
2 буквы2,843,36
3 буквы1,913,66
4 буквы1,044,22
5 букв0,494,55

На знакомом тексте всё выглядит прекрасно: чем длиннее память, тем увереннее предсказание. На незнакомом лестница разворачивается уже после второй ступени — модель с памятью в пять букв предсказывает хуже, чем модель, не помнящая ничего.

Она не выучила язык. Она выучила конкретный текст наизусть.

Это и есть стена, в которую упёрся подход целиком. Не в «сложных словах» дело — с ними как раз всё в порядке, модель их копирует. Дело в том, что запоминание не превращается в понимание, сколько его ни наращивай.

1948год публикации
27символов алфавита
6ступеней лестницы
10слов подряд без сбоя

Семьдесят восемь лет спустя

Тут легко сделать неверный вывод — что современные модели просто взяли ту же лестницу и удлинили память. Это не так: удлинение памяти само по себе делает только хуже.

Изменился не размер памяти, а способ хранить знание о языке.

Шеннон считал. Он буквально держал таблицу: после этого слова столько-то раз шло вот это. Современная модель ничего не считает и никаких таблиц не хранит. У неё есть несколько сотен миллиардов настроенных чисел — параметров, — и в них язык не записан примерами, а сжат до закономерностей. Поэтому она справляется с сочетанием, которого никогда не видела: она не ищет его в таблице, а выводит по тому, на что оно похоже.

Как это сжатие получается — тема отдельного разговора. Но для сегодняшнего важно другое: действие на каждом шаге осталось шенноновским. Посмотреть на всё, что уже написано, и выбрать, что идёт дальше.

Механизм так и называется — авторегрессионная генерация: текст пишется слева направо по кусочку, и каждый следующий кусочек зависит от всего предыдущего. Из этого одного предложения выводится почти всё, что вас в этих системах удивляет.

Соберите сами

Шеннону на каждую ступень уходили дни ручного счёта. Вот та же лестница на русском — по тексту «Евгения Онегина». Выберите, сколько букв машина помнит, и нажмите.

Машина Шеннона · корпус: Пушкин, «Евгений Онегин», гл. 1–2
Нажмите «Сгенерировать».

Ничего — чистый шум. Частоты — куски правдоподобной длины. Дальше проступают русские сочетания, потом настоящие слова, которых туда никто не клал. На «одном слове» вы стоите ровно там же, где Шеннон в 1948-м, только счёт занял миллисекунду вместо недели.

Один шаг, изнутри

Ваш вопрос сначала режется на токены. Токен и слово — не одно и то же: частое короткое слово занимает один токен целиком, длинное или редкое разваливается на несколько. Важная деталь: режется по частоте, а не по смыслу. Граница может пройти посреди корня, и никакого «приставка — корень — окончание» там нет, хотя интуитивно хочется думать именно так.

Русскому здесь не повезло: словари токенизаторов набирались в основном на английском, и та же мысль по-русски занимает заметно больше токенов, чем по-английски. Вы платите за это скоростью, деньгами и местом в контекстном окне.

Дальше модель делает одно-единственное действие и повторяет его.

Допустим, написано: «Осенью листья желтеют, потому что». Модель не выбирает между «правильно» и «неправильно» — она получает вероятности по всем токенам словаря сразу. Сколько-то приходится на начало слова «хлорофилл», сколько-то на «в», сколько-то на «деревья», и дальше по убыванию через десятки тысяч вариантов.

И вот тут — место, которое объясняет самую бытовую странность.

Самый вероятный вариант берётся не всегда. Из распределения тянут случайно, с оглядкой на вероятности: у частого варианта больше шансов, но и редкий может выпасть. Именно поэтому один и тот же вопрос, заданный дважды, даёт похожие, но не одинаковые ответы. Это не сбой и не настроение — это устройство. У разброса есть ручка, температура: выкрутить вниз — ответы станут предсказуемее и суше, вверх — неожиданнее и рискованнее. Ручка эта у разработчиков, в API; в чате её нет, а у новых моделей Claude её убрали и из API (проверено по документации в сентябре 2026 года).

Кусочек выбран, дописывается в конец, и весь расчёт повторяется заново — уже вместе с ним. Потом ещё раз. Абзац, который вы читаете, — сотня-другая таких шагов. А если включён режим размышления, то тысячи: модель сначала пишет черновик рассуждения, иногда в разы длиннее ответа, и только потом сам ответ. Черновик собирается тем же способом, просто вам его обычно не показывают.

Откуда модель знает эти вероятности — вопрос следующего разговора. Пока важно, что они посчитаны заранее и от вашего вопроса не меняются.

Почему выбор получается осмысленным

Шеннон смотрел на одно предыдущее слово. Современная модель на каждом шаге смотрит на весь доступный ей текст — и, что важнее, взвешивает, какие его места сейчас существеннее прочих.

В вопросе «Почему листья осенью желтеют?» одновременно значимы «листья», «осенью» и «желтеют»: по одному слову смысл не восстановить. Этим занимается механизм внимания — часть устройства под названием трансформер. Он на каждом шаге заново решает, к каким кускам текста присматриваться, а какие сейчас не важны.

Откуда берутся уверенные ошибки

Здесь же слабое место, и оно встроено в механизм.

В самом шаге нет отдельной проверки «а это правда?». Есть оценка правдоподобия продолжения. Гладкая, уверенная и совершенно неверная фраза собирается ровно тем же способом, что и правильная, — и, что неприятнее, иногда просто потому, что при случайном выборе вытянуло не тот вариант.

Это называют галлюцинацией.

Просьба «не выдумывай» немного помогает. Она попадает в тот же текст, который модель продолжает, и сдвигает выбор в сторону осторожных формулировок — «по-видимому», «точно сказать нельзя». Выдумок становится меньше.

Но проверять факты модель от этого не начинает: ей нечем. Сверяться не с чем — снаружи ничего не открывается, внутри лежат не факты, а закономерности языка. Поэтому просьба снижает частоту, но не даёт гарантии, и полагаться на неё нельзя.

Работает другое: дать материал и попросить не выходить за его пределы. Приложите документ, вставьте цитату, дайте ссылку на источник. Тогда продолжать текст можно по нему — и придумывать просто не приходится.

Заметьте, что и у Шеннона фраза про английского писателя звучит безупречно, не означая ничего. Правдоподобие и правда разошлись ещё в 1948 году.

Что из этого следует практически

Раз каждый шаг зависит от всего написанного, вы не столько задаёте вопрос, сколько задаёте начало. И всё, что попало в окно чата — формулировка, прошлые сообщения, приложенный файл, — не пояснения к вопросу, а часть того самого текста, который модель продолжит.

Отсюда понятно, почему «магические промпты» работают хуже, чем обещают. Дело не в заклинании, а в том, сколько полезного вы положили в начало: задачу, исходные данные, аудиторию, ограничения.

Проверьте сами. Попросите объяснить пожелтение листьев восьмилетнему ребёнку, потом студенту-биологу, потом скептику, который требует доказательств. Ответы разойдутся сильно — при том, что модель между попытками не изменилась и ничему не научилась. Изменилось начало.

А если зададите один и тот же вопрос дважды, ответы тоже разойдутся — но чуть-чуть. Это уже не про контекст, а про ту самую случайность в выборе. Разница между этими двумя опытами и есть разница между тем, чем вы управляете, и тем, чем не управляете.

И одна оговорка

Всё описанное — про саму языковую модель. Помощник, которым вы пользуетесь, — это она плюс системные инструкции, история диалога, а иногда поиск, память и инструменты. Он и историю подаёт не целиком: обрезает, пересказывает, подтягивает выборочно.

Языковая модель и готовый AI-помощник — не одно и то же. Половина неоправданных ожиданий растёт именно из этой путаницы.

С этой развилки и пойдём дальше. В следующем материале — вопрос, который отсюда напрашивается: если на каждом шаге всё так просто, откуда берётся способность объяснять, переводить и писать код.

Откуда что взято
01
Все шесть приближений к английскому, описание процедуры с перелистыванием книги и замечание про десять слов — из раздела 3 «The Series of Approximations to English».
1948 · Bell System Technical Journal · сверено посимвольно
02
А. С. Пушкин. «Евгений Онегин», главы 1–2
Корпус для машины и для расчётов: 32 608 знаков в современной орфографии, только буквы и пробелы. Тот же текст, в котором Андрей Марков считал буквы в 1913 году.
Общественное достояние · источник: Викитека, ПСС 1977
03
Собственный расчёт
Таблица в развороте: модели построены на первых главах, проверены на конце поэмы, которого не видели. Числа характеризуют этот корпус, а не русский язык в целом.
Воспроизводится на корпусе выше
STOA · ветка «Как работает AI» · материал 01