Контекстное окно
Что такое контекстное окно, чем заявляемый провайдерами LLM размер отличается от эффективного, и как управлять им на практике.
Дата составления: 2026-08-29
Статус: 💡 Актуально
Суть
Контекстное окно — это весь объем информации, который нейросеть видит и учитывает в текущем чате: ваши сообщения, ответы модели, загруженные файлы. За пределами контекста для модели ничего не существует.
Формальный размер и эффективный размер
Разработчики публикуют максимальный размер контекстного окна в токенах. Например, 200 000 токенов — это примерно 400 страниц текста. На первый взгляд кажется достаточным для любых задач.
Проблема в том, что модели не обрабатывают весь контекст с одинаковым качеством. Чем больше информации — тем выше вероятность, что часть из нее будет упущена. Из-за этой особенности появился отдельный термин: эффективное контекстное окно — реальный объем, при котором качество ответа нейросети остается приемлемым. Оно значительно меньше формального и определяется только опытным путем.
На практике это означает, что если загрузить несколько судебных решений — модель отлично их резюмирует. Если загрузить несколько десятков — часть проигнорирует, часть обработает поверхностно, и вы получите мозаичный результат.
У этой деградации есть отдельное название — протухание контекста (context rot). Суть в том, что качество падает не в момент исчерпания заявленного разработчиком окна, а сильно раньше и иногда внезапно: ответы вдруг начинают противоречить тому, о чем договаривались, или игнорировать часть требований. Ориентироваться на цифру из анонса модели поэтому бессмысленно.
Помните, что размер контекстного окна, который публикует разработчик — маркетинговая характеристика. Планируйте с расчетом на эффективный размер, который в 2–4 раза меньше.
Как нейросеть читает длинный контекст
Исследования показывают устойчивую закономерность: лучше всего запоминается начало (первые ~20% контекста) и конец (последние ~20%). Середина теряется значительно чаще.
Это объясняет несколько практических паттернов:
Договоренности, которые вы зафиксировали в начале длинного чата, рискуют «потеряться» к его середине.
Если важная инструкция или ограничение должны работать всю сессию — продублируйте их ближе к концу текущего сообщения.
Самое критичное для ответа — помещайте в конце промпта, а не в начале.
Как управлять контекстом на практике
Начинайте новый чат на каждую отдельную задачу. Накопленная история предыдущих обсуждений не помогает — она занимает место и ухудшает качество ответов на новые вопросы.
Давайте «брифинг» в начале каждого нового чата. Нейросеть не помнит предыдущий сеанс — нужно кратко напомнить контекст: кто вы, в чем задача, что уже сделано. Завершая длинный чат, попросите нейросеть сумиировать беседу, чтобы быстрее забрифовать модель в новом чате.
Дробите большие документы. Если нужно обработать много текста — не грузите все сразу. Разбейте на смысловые части и работайте с каждой отдельно.
Используйте инструменты, заточенные под работу с документами. NotebookLM от Google создан специально для анализа больших объемов текста: загружаете файлы, и нейросеть работает только с ними, не выходя за пределы вашего хранилища. Хороший выбор, когда нужно обработать много материала без риска, что модель «потеряет» часть в середине.
Не полагайтесь на память модели в длинном диалоге. Если сессия затянулась и модель начинает предлагать решения, противоречащие тому, о чем договаривались ранее — это признак «протухания» контекста. Начните новый чат с брифингом.
Форматы файлов и расход токенов
Не все файлы одинаково «дешевы» для контекстного окна. Один и тот же текст в разных форматах займет разное количество токенов — иногда с разницей в 2, 3 и более раз.
Почему так происходит. Когда вы загружаете файл в чат, нейросеть не «открывает» его как Word или Acrobat — она конвертирует содержимое в текст. Форматы вроде .docx и .pdf несут в себе служебную разметку: стили, метаданные, XML-структуру. Часть этого «мусора» попадает в контекст и съедает токены, не неся полезной информации. Особенно это заметно у таблиц и сложной верстки — они могут раздуть объем в несколько раз.
Самые экономичные форматы — .txt и .md (Markdown) для текстов и .csv для таблиц. Это чистые тексты без скрытой разметки. Markdown позволяет сохранить минимальную структуру — заголовки, списки, выделение — практически без накладных расходов. .csv с помощью разделителей (запятая либо точка с запятой) и переноса строк имитирует деление текста на ячейки в таблице.
Как переводить документы в экономичный формат:
Текстовые документы → откройте, скопируйте содержимое в текстовый редактор (Блокнот, TextEdit), сохраните как
.txt. Форматирование теряется, содержание остается.Если нужна структура → сохраните как
.md(инструменты конвертации — ниже).Таблицы Excel → экспортируйте как
.csvчерез меню Excel.
Для конвейерной одновременной обработки большого количества документов удобнее «навайбкодить» программу — для этой задачи подойдет и статичная HTML-страница.
Простое правило: если вы загружаете файл ради его содержания, а не ради оформления — переведите в текстовый формат. Сэкономленные токены лучше потратить на собственно работу, а не на парсинг верстки.
Инструменты конвертации в Markdown
С помощью онлайн-конвертеров, созданных участниками сообщества Нейросети | ilovedocs, собранных на странице вайб-кодинговых проектов участников;
MarkItDown от Microsoft переводит в
.mdпочти любой формат: PDF, Word, Excel, PowerPoint, картинки, аудиофайлы, HTML-страницы, CSV, JSON, ZIP-архивы и видео с YouTube;Участник сообщества Нейросети | ilovedocs Ян Стригов создал два скилла для сультиагентных систем — обертки для MarkItDown:
mark-the-stuff-down — без OCR. Конвертирует DOCX, PDF с текстовым слоем, XLSX, XLS, PPTX, RTF, HTML, EPUB; лимит 50 МБ на файл, поддерживает пакетную параллельную обработку;
mark-all-the-stuff-down — то же плюс распознавание сканов и изображений (PNG, JPG, TIFF, BMP, WEBP, сканированные PDF). Языковые пакеты tesseract для русского и английского встроены — ничего устанавливать отдельно не нужно.
Второй скилл особенно полезен для пользователей Claude Cowork: в стандартной поставке агент умеет распознавать текст только на английском, добавить русский OCR самостоятельно нельзя — среда закрыта. Скилл закрывает этот пробел «из коробки».
Инструменты сервисов для работы с контекстом
Кроме ручных приемов, у самих сервисов есть встроенные механизмы. Их четыре, и экономят они контекст по-разному.
Ветвление чата (branching) — создание копии диалога от выбранного сообщения. Дальше основная и новая ветки живут отдельно: побочный вопрос не оседает в основном чате, а точка, до которой вы дошли, не теряется перед рискованным запросом. Есть в Google AI Studio и ChatGPT, с весны 2026 года — в приложении Gemini.
Важно понимать, что именно экономится. Ответвление наследует всю историю до точки ветвления, поэтому уже набранный контекст не уменьшается: из наполовину заполненного чата получатся две наполовину заполненные ветки. Экономия в том, что основная ветка не засоряется побочными обсуждениями. Новый чат под новую задачу ветвление не заменяет.
Цитирование фрагмента ответа. В ChatGPT можно выделить кусок ответа и прикрепить его к следующему сообщению цитатой. Модель точно понимает, о каком месте идет речь, а вам не нужно копировать фрагмент вручную.
Проекты — папки с общей инструкцией и файлами, которые подставляются в каждый новый чат внутри проекта. Способ не повторять брифинг руками. У Claude и ChatGPT память проекта отделена от общей, поэтому рабочий проект не подмешивается в посторонние чаты.
Автосжатие (compaction). Claude при подходе к лимиту сам суммирует раннюю часть диалога и продолжает работать с выжимкой. Чат не обрывается, но детали теряются, и решает, что сохранить, модель, а не вы. Если детали важны — не доводите до автосжатия: попросите резюме сами и откройте новый чат.
Память между чатами — не инструмент экономии. Она избавляет от повторного представления, но добавляет токены в каждый новый чат и может подтянуть лишнее из посторонних обсуждений. Для разовой задачи чистый чат полезнее.
Сервис | Что есть встроенного |
ChatGPT | Ветвление, цитирование фрагмента ответа, проекты с отдельной памятью, память между чатами |
Claude (чат) | Проекты с отдельной памятью, автосжатие длинных диалогов, память и поиск по прошлым чатам. |
Google AI Studio | Ветвление, отдельное поле системной инструкции, редактирование и удаление отдельных реплик. |
DeepSeek | Ничего из перечисленного: ни ветвления, ни проектов, ни памяти между чатами. Остаются ручные приемы — новый чат на задачу и брифинг |
Qwen | Память между чатами. Ветвления и проектов в интерфейсе нет |
Контекст в агентных средах
В агентных средах — Claude Code, Cowork, Codex и других — сессия длится дольше, а контекст наполняется не только вашими сообщениями, но и результатами вызовов инструментов, содержимым прочитанных файлов и рассуждениями самого агента. Поэтому там появились приемы, которых нет в обычном чате.
Долгое время выбор был только между двумя крайностями: /clear — «очистить все», начать сессию заново, потеряв договоренности, — и /compact — «сжать все», свернуть переписку в резюме, потеряв детали. Между ними появились более точные инструменты (команды приводятся в написании Claude Code, в других харнессах названия свои):
Побочный вопрос, не попадающий в историю — команда
/btw. Ответ появляется в закрываемом окне и не оседает в основной переписке. Полезно, когда по ходу работы нужно что-то быстро проверить — то, что вы бы загуглили в соседней вкладке, — но этот обмен не должен влиять на дальнейшую задачу;Выборочное сжатие — команда
/rewindс выбором контрольной точки и вариантами Summarize from here (сжать все после нее) и Summarize up to here (сжать все до нее). Так можно свернуть длинный хвост отладки, оставив нетронутыми ранние договоренности, — или наоборот, выбросить шум подготовки и сохранить недавнее состояние;Сжатие с фокусом — та же команда
/compact, но с указанием, что именно нужно сохранить, а что можно выбросить:/compact Focus on the API changes, drop debugging history. Вы знаете, что понадобится на следующем шаге, а модель нет, поэтому направленное сжатие обычно точнее автоматического;Правила сжатия в файле проекта. Указания «что при сжатии сохранять всегда» прописываются один раз в навигационном файле, а не задаются каждый раз руками.
Практическое правило: /clear — это признание, что вы слишком долго ждали. Чем раньше применяется любой из предыдущих инструментов, тем дешевле обходится сессия.
Не полагайтесь на автосжатие вслепую. На длинных задачах суммаризация ненадежно сохраняет ключевые решения: свернуть слишком агрессивно — значит потерять деталь, важность которой станет понятна через час работы. Если сжимаете — говорите, что именно нужно сохранить.
Отдельно стоит помнить: все перечисленное управляет контекстом внутри сессии. Все, что должно пережить ее окончание, нужно выносить наружу — в файлы и рабочую папку. Об этом — в статье Память агента.
Связанные статьи
Что такое LLM — токены и принцип работы модели
Память агента — что остается после окончания сессии и как это организовать
Ограничения и галлюцинации — как ограниченность контекста влияет на качество ответов
NotebookLM — сервис для работы с большими массивами документов по технологии RAG
Вайб-кодинговые проекты участников — в списке есть инструменты конвертации, созданные участниками сообщества
Claude Cowork — агентная среда, в которой скиллы конвертации в Markdown особенно эффективны
Дополнительные материалы
Книга «Юристы и нейросети: руководство к действию» — приобретайте на OZON | Читай-город | Буквоед
Разбор скиллов конвертации в Markdown с примерами и инструкцией установки — Ян Стригов
Четыре инструмента Anthropic для работы с контекстом между
/clearи/compact — подробный разбор Яна Стригова с примерами команд и разбором антипаттерна «сессия-кухонная-раковина»Claude Code Best Practices — первоисточник Anthropic: рекомендации по управлению контекстом в длинных сессиях
Теги: #концепция #новичок #знакомство-с-нейросетями