Скилловик

Практическая статья

Что такое контекстное окно языковой модели

Контекстное окно - это рабочий объём информации, доступный модели при подготовке текущего ответа. История, инструкции и содержимое файлов делят ограниченный ввод, а правила модели и API определяют запас под ответ.

Ограниченное контекстное окно заполняется инструкциями, документами и результатами инструментов

Что такое контекстное окно простыми словами?

Контекстное окно - это ограниченный объём информации, который языковая модель может учитывать при создании текущего ответа. Его обычно измеряют в токенах. В окно попадают инструкции, запрос, история диалога, прочитанные материалы, описания и результаты инструментов, а также генерируемый ответ.

Удобная аналогия - рабочий стол. Из материалов текущей задачи модель может напрямую учитывать то, что приложение включило в активный контекст; при этом её общие способности и знания формируются обучением. Сведения из внешней памяти начинают влиять на ответ после того, как приложение вернуло их в текущий ввод.

Что занимает контекстное окно?

Контекстное окно делят системные и проектные инструкции, сообщения пользователя и ассистента, фрагменты документов, изображения после обработки, определения инструментов, аргументы и результаты вызовов. Часть доступного объёма может быть зарезервирована под будущий ответ.

СлойПримерПочему объём растёт
ИнструкцииРоль, правила, AGENTS.md или SKILL.mdЗанимают окно, если клиент добавляет их в запрос или агент подгружает по ходу работы
ДиалогЗапросы, ответы и уточненияИстория накапливается с каждым ходом
МатериалыДокументы, код, изображения и найденные фрагментыПриложение переводит содержимое в представление для модели
ИнструментыСхемы, аргументы и результаты инструментовДлинные списки загруженных инструментов и большие результаты занимают новый ввод
ОтветТекст или структурированный выводУ вывода есть отдельный максимум; в зависимости от API он также занимает часть общего контекстного бюджета

Например, длинный документ, история обсуждения и ожидаемый ответ делят доступный лимит. Загрузка документа целиком оставляет меньше места для истории и ответа, чем выбор нескольких релевантных фрагментов.

Если термин Agent Skills пока незнаком, начните с материала что такое Agent Skills.

Для Agent Skills эти слои и способ измерения подробно разобраны в статье как навыки расходуют контекст и токены.

Почему размер считают в токенах, а не в словах?

Модель обрабатывает не слова и символы напрямую, а токены - части текста и другие элементы входа. Один и тот же объём в знаках может дать разное число токенов в зависимости от языка, формата и токенизатора. Поэтому пересчёт окна в страницы или слова остаётся приблизительным.

Код, таблицы, JSON, длинные идентификаторы и русский текст могут разбиваться иначе, чем простой английский абзац. Практический лимит проверяют по данным об использовании токенов в выбранном API или по индикатору конкретного клиента, а не по универсальной формуле символов.

Чем контекстное окно отличается от памяти и лимита ответа?

Контекстное окно задаёт предельный объём информации, доступной модели на текущем шаге. Память сохраняет сведения между шагами или сессиями во внешнем хранилище. Максимальный вывод ограничивает длину одного ответа. Эти три величины связаны, но не взаимозаменяемы.

ПонятиеЧто ограничиваетКогда влияет
Контекстное окноАктивные инструкции, историю, материалы и выводПри каждом обращении к модели
ПамятьСохранение фактов или файлов вне текущего окнаПосле поиска и возврата нужного фрагмента в контекст
Максимальный выводДлину одного ответа моделиВо время генерации ответа

Поэтому функция памяти не отменяет лимит окна. Она помогает хранить больше сведений вне модели, но приложению всё равно нужно выбрать нужные фрагменты и поместить их в ограниченный активный ввод.

Что происходит, когда контекстное окно переполняется?

Единого поведения нет. Приложение может обрезать старые сообщения или сжать историю, а API может отклонить слишком большой запрос. Конкретная политика зависит от продукта, модели и настроек.

  1. Обрезка

    Старые блоки исключаются из следующего запроса. Вместе с ними могут исчезнуть ранняя цель, запрет или важная деталь.

  2. Компактация

    Полная история заменяется более коротким резюме. Это освобождает место, но при сжатии могут потеряться важные детали.

  3. Ошибка

    Запрос отклоняется, пока приложение не сократит ввод или не изменит настройки.

Почему контекстное окно особенно важно для ИИ-агента?

Агент накапливает планы, результаты инструментов, документы и промежуточные решения. Большой лог или широкий каталог заранее загруженных инструментов расходует окно и может вытеснить полезные условия раньше, чем закончится задача. Тогда агент рискует повторить действие, потерять ограничение или выбрать следующий шаг по неполному состоянию.

  • Обрезка старой истории может убрать раннюю цель или запрет, после чего агент продолжит работу с неполными условиями.
  • Удаление результата инструмента до фиксации состояния может привести к повторному действию.
  • Большой лог и длинный список загруженных инструментов усложняют поиск нужного факта и выбор следующего шага.

Минимальную архитектуру и точки контроля смотрите в руководстве как создать ИИ-агента с нуля.

Как управлять контекстом в длинной задаче?

Передавайте модели только нужные источники, ограничивайте результаты инструментов, фиксируйте состояние задачи отдельно и проверяйте, что компактация сохраняет цель, решения, запреты и незавершённые шаги. Большое окно полезно, но не заменяет отбор и структуру информации.

  1. Сократите постоянный слой

    Оставьте в базовых инструкциях правила, которые действительно нужны на каждом шаге.

  2. Загружайте материалы по требованию

    Ищите и передавайте релевантные фрагменты вместо полной базы или длинного документа.

  3. Ограничьте вывод инструментов

    Возвращайте необходимые поля, диапазоны строк и краткие диагностические результаты.

  4. Храните состояние вне чата

    Записывайте выполненные действия, нужные идентификаторы, решения и следующий шаг в проверяемый артефакт. Не переносите туда секреты и лишние персональные данные; ограничьте доступ и срок хранения.

  5. Тестируйте длинный сценарий

    Проверяйте не только первый ответ, но и качество после нескольких вызовов и компактации.

Когда основная инструкция стала слишком большой, используйте практический разбор как разделить большой SKILL.md.

Для оценки результата используйте парный тест из статьи как оценить эффективность Agent Skill.

Как выбрать подходящий размер контекстного окна?

Исходите из самого длинного реального шага, а не из максимального числа в карточке модели. Соберите типичный набор инструкций, истории, документов и результатов инструментов, оставьте резерв под ответ и прогоните пограничные сценарии. Сравнивайте качество, задержку и стоимость на одной задаче.

Если нужные факты не помещаются, сначала улучшите поиск, разбиение документов и формат результатов. Переходите к модели с большим окном, если после отбора материалов ей всё ещё не хватает нескольких связанных частей задачи одновременно.

Если договор и связанная переписка нужны модели одновременно, большое окно может быть оправдано. Если для ответа требуется один пункт договора, сначала настройте поиск по фрагментам.

Контекстное окно - это количество токенов в одном сообщении?

Обычно нет. В бюджет входят последнее сообщение пользователя, системные инструкции, переданная история, материалы, инструменты и место под ответ. Поэтому короткий запрос может выполняться на уже сильно заполненном контексте.

При сравнении моделей проверяйте отдельно размер контекстного окна (context window), максимальную длину ответа и правила продукта при переполнении. Название одного лимита без этих условий может вводить в заблуждение.

Как узнать размер контекстного окна конкретной модели?

Проверьте карточку модели в официальной документации поставщика и убедитесь, что указаны отдельно размер контекстного окна и максимальная длина ответа. Затем сверьте правила конкретного API или приложения: доступный ввод может зависеть от зарезервированного вывода, служебных инструкций и подключённых инструментов.

Не переносите лимит модели из одного продукта в другой только из-за совпадающего названия. Клиент может использовать другую версию, собственное сжатие истории или дополнительные системные данные.

Видит ли нейросеть весь предыдущий диалог?

Только если приложение передало историю в текущем запросе и она поместилась в доступный контекст. Старые сообщения могут быть исключены, сокращены или заменены резюме. Поэтому важные решения и ограничения в длинной задаче лучше фиксировать в отдельном проверяемом состоянии.

Сам факт существования сообщения в интерфейсе чата не доказывает, что его полный текст отправляется модели на каждом следующем шаге.

Попадают ли файлы и изображения в контекстное окно?

Да, если приложение передало модели содержимое файла или его обработанное представление. Текст, код и изображения разные модели учитывают по-разному. Содержимое файла не становится автоматически доступным модели во всех будущих запросах, но срок хранения и возможное использование данных определяются политикой поставщика и настройками продукта.

Для длинных документов обычно полезнее поиск и выбор релевантных фрагментов, чем загрузка всего материала в каждый запрос.

Подобрать навыки для ИИ-агента

Источники

  1. Context windowsAnthropic; проверено
  2. Managing context with toolsAnthropic; проверено
  3. CompactionAnthropic; проверено
  4. Memory toolAnthropic; проверено
  5. Long contextGoogle AI for Developers; проверено
  6. TokensGoogle AI for Developers; проверено
  7. ModelsOpenAI API; проверено
  8. Realtime APIOpenAI API; проверено