Контекстное окно нейросети: что это простыми словами
Контекстное окно — это «оперативная память» нейросети в рамках одного диалога: сколько текста она способна одновременно удерживать в уме. Всё, что выходит за пределы окна, для модели как будто перестаёт существовать. Измеряется окно в токенах.
Простыми словами
Представьте рабочий стол, на который помещается ограниченное число листов. Пока разговор короткий — все листы на столе, модель видит всё. Когда листов становится слишком много, старые падают со стола: модель перестаёт их учитывать. Именно поэтому в длинном диалоге нейросеть может «забыть» деталь, о которой вы говорили в самом начале.
В контекст входит всё: ваш запрос, вся история переписки в этом чате и ответы модели. Чем длиннее разговор — тем ближе к краю окна.
Сколько это в привычных мерках. Токены в уме считать неудобно, поэтому переводите их в страницы: по формуле из статьи о токенах число русских символов делится на два. Страница обычного текста — это около 1800 знаков, то есть примерно 900 токенов; договор на десять страниц — порядка девяти тысяч. Отсюда видно, почему «скину нейросети всю переписку за месяц» упирается в окно быстрее, чем кажется.
Что происходит при переполнении
Когда окно заполняется, поведение модели меняется:
- Забывание начала. Старые сообщения «выталкиваются», модель их больше не видит.
- Снижение качества. Ближе к пределу модель чаще путается и начинает галлюцинировать.
- «Слепая зона» середины. Модель обычно лучше помнит начало и конец диалога, а середина длинного разговора теряется первой.
Важно: контекст — это НЕ долговременная память. Новый чат всегда начинается с чистого листа, прошлый разговор модель не помнит.
С чем путают контекстное окно
Три разных ограничения ощущаются одинаково — «нейросеть стала работать хуже», — но причина и действие у каждого свои:
- Контекстное окно. Признак: помнит недавнее, забыла начало разговора. Что это: предел на один диалог. Что делать: попросить резюме и продолжить в новом чате.
- Длина одного ответа. Признак: ответ обрывается на полуслове. Что это: предел на объём одного сообщения, а не на весь разговор. Что делать: написать «продолжай».
- Лимит подписки. Признак: сервис пишет, что лимит исчерпан, и предлагает подождать или перейти на тариф выше. Что это: расход токенов за период, а не за один разговор. Что делать: дождаться сброса лимита или сменить тариф.
Признак сразу говорит, какое из трёх ограничений вы поймали — и какое действие сработает.
Как с этим работать
- Важные инструкции ставьте в начало запроса или повторяйте ближе к концу.
- Не превращайте один чат в свалку тем — под новую тему открывайте новый диалог.
- Если разговор стал огромным, попросите модель сделать резюме и начните новый чат с этой выжимкой.
- Не грузите весь документ, если вопрос по одному разделу — так в окне остаётся больше места.
Сколько контекста у конкретных моделей
Размер окна у моделей сильно различается и растёт с новыми поколениями — актуальные цифры держим в карточках (проверяем по вендору, датируем):
- карточки Claude, ChatGPT, Gemini — размер окна и цена;
- лучшие нейросети — если задача упирается в длину документа, выбирайте по размеру окна.