Указатель нейросетей

Контекстное окно нейросети: что это простыми словами

Обновлено: · выход данных: .md

Контекстное окно — это «оперативная память» нейросети в рамках одного диалога: сколько текста она способна одновременно удерживать в уме. Всё, что выходит за пределы окна, для модели как будто перестаёт существовать. Измеряется окно в токенах.

Простыми словами

Представьте рабочий стол, на который помещается ограниченное число листов. Пока разговор короткий — все листы на столе, модель видит всё. Когда листов становится слишком много, старые падают со стола: модель перестаёт их учитывать. Именно поэтому в длинном диалоге нейросеть может «забыть» деталь, о которой вы говорили в самом начале.

В контекст входит всё: ваш запрос, вся история переписки в этом чате и ответы модели. Чем длиннее разговор — тем ближе к краю окна.

Сколько это в привычных мерках. Токены в уме считать неудобно, поэтому переводите их в страницы: по формуле из статьи о токенах число русских символов делится на два. Страница обычного текста — это около 1800 знаков, то есть примерно 900 токенов; договор на десять страниц — порядка девяти тысяч. Отсюда видно, почему «скину нейросети всю переписку за месяц» упирается в окно быстрее, чем кажется.

  1. Ваш текущий запросто, что вы спросили только что
  2. История перепискивсе прошлые сообщения этого чата
  3. Ответы моделивсё, что она уже написала вам в ответ
Все три слоя делят один объём — место тратит не только ваш вопрос

Что происходит при переполнении

Когда окно заполняется, поведение модели меняется:

  • Забывание начала. Старые сообщения «выталкиваются», модель их больше не видит.
  • Снижение качества. Ближе к пределу модель чаще путается и начинает галлюцинировать.
  • «Слепая зона» середины. Модель обычно лучше помнит начало и конец диалога, а середина длинного разговора теряется первой.

Важно: контекст — это НЕ долговременная память. Новый чат всегда начинается с чистого листа, прошлый разговор модель не помнит.

С чем путают контекстное окно

Три разных ограничения ощущаются одинаково — «нейросеть стала работать хуже», — но причина и действие у каждого свои:

  • Контекстное окно. Признак: помнит недавнее, забыла начало разговора. Что это: предел на один диалог. Что делать: попросить резюме и продолжить в новом чате.
  • Длина одного ответа. Признак: ответ обрывается на полуслове. Что это: предел на объём одного сообщения, а не на весь разговор. Что делать: написать «продолжай».
  • Лимит подписки. Признак: сервис пишет, что лимит исчерпан, и предлагает подождать или перейти на тариф выше. Что это: расход токенов за период, а не за один разговор. Что делать: дождаться сброса лимита или сменить тариф.

Признак сразу говорит, какое из трёх ограничений вы поймали — и какое действие сработает.

Как с этим работать

  • Важные инструкции ставьте в начало запроса или повторяйте ближе к концу.
  • Не превращайте один чат в свалку тем — под новую тему открывайте новый диалог.
  • Если разговор стал огромным, попросите модель сделать резюме и начните новый чат с этой выжимкой.
  • Не грузите весь документ, если вопрос по одному разделу — так в окне остаётся больше места.

Сколько контекста у конкретных моделей

Размер окна у моделей сильно различается и растёт с новыми поколениями — актуальные цифры держим в карточках (проверяем по вендору, датируем):

Нашли неточность? Напишите нам — поправим и обновим страницу. Ответ придёт в Телеграме.

Частые вопросы

Что такое контекстное окно простыми словами?

Оперативная память модели в одном диалоге: сколько текста она держит в уме одновременно.

Почему нейросеть забывает начало разговора?

Диалог перестал помещаться в окно — старые сообщения вытолкнулись, и модель их больше не видит.

В чём измеряется контекст?

В токенах. На русском текст занимает их примерно вдвое больше, чем на английском.

Как обойти ограничение контекста?

Резюмировать длинный диалог и начать новый чат с выжимкой, или взять модель с окном побольше.

Остаются ли мои запросы в памяти нейросети?

Смотря что называть памятью. Сама модель между чатами ничего не помнит: новый диалог начинается с пустого контекстного окна. Но у многих сервисов есть отдельная функция памяти — она сохраняет выбранные факты о вас и подставляет их в новые чаты; её можно посмотреть и выключить в настройках. А история переписки хранится на серверах сервиса по его правилам, пока вы её не удалите. Поэтому личные данные в чат с нейросетью лучше не писать.

Чем контекстное окно отличается от лимита подписки?

Окно — про один диалог: сколько текста модель держит в уме одновременно. Лимит подписки — про период: сколько вы успеете потратить до сброса, а период у сервисов разный — от нескольких часов до месяца. Упереться можно в каждое по отдельности: окно лечится новым чатом с резюме, лимит — ожиданием сброса или тарифом выше.

Другие термины словаря

Весь словарь