Stateinik

Concept

Контекстное окно

Максимальный объём текста в токенах, который модель удерживает за один запрос: системный промпт, история диалога, подтянутые файлы и место под ответ.

Что попадает в окно

Окно считается целиком на каждый запрос. Внутрь помещаются системный промпт, вся история переписки, содержимое подтянутых файлов, результаты вызова инструментов и место под ответ модели. Когда один баг обсуждают полчаса, история растёт, а свободного места остаётся всё меньше.

Почему это болит на практике

Ассистент начинает терять детали из начала диалога: путает имя переменной, заново предлагает решение, которое уже отвергли, ссылается на файл, переименованный двадцать сообщений назад. Формально лимит не превышен, но качество ответов проседает задолго до потолка.

Второй эффект денежный. Каждый запрос заново отправляет весь накопленный контекст, и он оплачивается снова, если провайдер не кэширует префикс. Длинный тред дорожает с каждым шагом.

Что с этим делают

  • Чистят историю: начинают новую сессию, когда задача сменилась.
  • Сжимают: просят модель подытожить обсуждение и продолжают с саммари.
  • Подтягивают только нужные куски кода вместо целых директорий. Этим занимается RAG.
  • Считают расход заранее, в токенах.

Объём окна у разных моделей отличается, и цифры меняются от релиза к релизу. Значение имеет смысл смотреть в документации той версии, которую вы вызываете, а не в статье годовой давности.

Отдельная история - AI-агент, который сам вызывает инструменты. Его контекст растёт быстрее диалогового: в окно попадают ещё и логи выполнения.

Related concepts