Контекстное окно
Что такое контекстное окно, чем заявляемый провайдерами LLM размер отличается от эффективного, и как управлять им на практике.
Дата составления: 2026-08-01
Статус: 💡 Актуально
Суть
Контекстное окно — это весь объем информации, который нейросеть видит и учитывает в текущем чате: ваши сообщения, ответы модели, загруженные файлы. За пределами контекста для модели ничего не существует.
Формальный размер и эффективный размер
Разработчики публикуют максимальный размер контекстного окна в токенах. Например, 200 000 токенов — это примерно 400 страниц текста. На первый взгляд кажется достаточным для любых задач.
Проблема в том, что модели не обрабатывают весь контекст с одинаковым качеством. Чем больше информации — тем выше вероятность, что часть из нее будет упущена. Из-за этой особенности появился отдельный термин: эффективное контекстное окно — реальный объем, при котором качество ответа нейросети остается приемлемым. Оно значительно меньше формального и определяется только опытным путем.
На практике это означает, что если загрузить несколько судебных решений — модель отлично их резюмирует. Если загрузить несколько десятков — часть проигнорирует, часть обработает поверхностно, и вы получите мозаичный результат.
Помните, что размер контекстного окна, который публикует разработчик — маркетинговая характеристика. Планируйте с расчетом на эффективный размер, который в 2–4 раза меньше.
Как нейросеть читает длинный контекст
Исследования показывают устойчивую закономерность: лучше всего запоминается начало (первые ~20% контекста) и конец (последние ~20%). Середина теряется значительно чаще.
Это объясняет несколько практических паттернов:
Договоренности, которые вы зафиксировали в начале длинного чата, рискуют «потеряться» к его середине.
Если важная инструкция или ограничение должны работать всю сессию — продублируйте их ближе к концу текущего сообщения.
Самое критичное для ответа — помещайте в конце промпта, а не в начале.
Как управлять контекстом на практике
Начинайте новый чат на каждую отдельную задачу. Накопленная история предыдущих обсуждений не помогает — она занимает место и ухудшает качество ответов на новые вопросы.
Давайте «брифинг» в начале каждого нового чата. Нейросеть не помнит предыдущий сеанс — нужно кратко напомнить контекст: кто вы, в чем задача, что уже сделано. Завершая длинный чат, попросите нейросеть сумиировать беседу, чтобы быстрее забрифовать модель в новом чате.
Дробите большие документы. Если нужно обработать много текста — не грузите все сразу. Разбейте на смысловые части и работайте с каждой отдельно.
Используйте инструменты, заточенные под работу с документами. NotebookLM от Google создан специально для анализа больших объемов текста: загружаете файлы, и нейросеть работает только с ними, не выходя за пределы вашего хранилища. Хороший выбор, когда нужно обработать много материала без риска, что модель «потеряет» часть в середине.
Не полагайтесь на память модели в длинном диалоге. Если сессия затянулась и модель начинает предлагать решения, противоречащие тому, о чем договаривались ранее — это признак «протухания» контекста. Начните новый чат с брифингом.
Форматы файлов и расход токенов
Не все файлы одинаково «дешевы» для контекстного окна. Один и тот же текст в разных форматах займет разное количество токенов — иногда с разницей в 2, 3 и более раз.
Почему так происходит. Когда вы загружаете файл в чат, нейросеть не «открывает» его как Word или Acrobat — она конвертирует содержимое в текст. Форматы вроде .docx и .pdf несут в себе служебную разметку: стили, метаданные, XML-структуру. Часть этого «мусора» попадает в контекст и съедает токены, не неся полезной информации. Особенно это заметно у таблиц и сложной верстки — они могут раздуть объем в несколько раз.
Самые экономичные форматы — .txt и .md (Markdown) для текстов и .csv для таблиц. Это чистые тексты без скрытой разметки. Markdown позволяет сохранить минимальную структуру — заголовки, списки, выделение — практически без накладных расходов. .csv с помощью разделителей (запятая либо точка с запятой) и переноса строк имитирует деление текста на ячейки в таблице.
Как переводить документы в экономичный формат:
Текстовые документы → откройте, скопируйте содержимое в текстовый редактор (Блокнот, TextEdit), сохраните как
.txt. Форматирование теряется, содержание остается.Если нужна структура → сохраните как
.md(инструменты конвертации — ниже).Таблицы Excel → экспортируйте как
.csvчерез меню Excel.
Для конвейерной одновременной обработки большого количества документов удобнее «навайбкодить» программу — для этой задачи подойдет и статичная HTML-страница.
Простое правило: если вы загружаете файл ради его содержания, а не ради оформления — переведите в текстовый формат. Сэкономленные токены лучше потратить на собственно работу, а не на парсинг верстки.
Инструменты конвертации в Markdown
С помощью онлайн-конвертеров, созданных участниками сообщества Нейросети | ilovedocs, собранных на странице вайб-кодинговых проектов участников;
MarkItDown от Microsoft переводит в
.mdпочти любой формат: PDF, Word, Excel, PowerPoint, картинки, аудиофайлы, HTML-страницы, CSV, JSON, ZIP-архивы и видео с YouTube;Участник сообщества Нейросети | ilovedocs Ян Стригов создал два скилла для сультиагентных систем — обертки для MarkItDown:
mark-the-stuff-down — без OCR. Конвертирует DOCX, PDF с текстовым слоем, XLSX, XLS, PPTX, RTF, HTML, EPUB; лимит 50 МБ на файл, поддерживает пакетную параллельную обработку;
mark-all-the-stuff-down — то же плюс распознавание сканов и изображений (PNG, JPG, TIFF, BMP, WEBP, сканированные PDF). Языковые пакеты tesseract для русского и английского встроены — ничего устанавливать отдельно не нужно.
Второй скилл особенно полезен для пользователей Claude Cowork: в стандартной поставке агент умеет распознавать текст только на английском, добавить русский OCR самостоятельно нельзя — среда закрыта. Скилл закрывает этот пробел «из коробки».
Инструменты сервисов для работы с контекстом
Кроме ручных приемов, у самих сервисов есть встроенные механизмы. Их четыре, и экономят они контекст по-разному.
Ветвление чата (branching) — создание копии диалога от выбранного сообщения. Дальше основная и новая ветки живут отдельно: побочный вопрос не оседает в основном чате, а точка, до которой вы дошли, не теряется перед рискованным запросом. Есть в Google AI Studio и ChatGPT, с весны 2026 года — в приложении Gemini.
Важно понимать, что именно экономится. Ответвление наследует всю историю до точки ветвления, поэтому уже набранный контекст не уменьшается: из наполовину заполненного чата получатся две наполовину заполненные ветки. Экономия в том, что основная ветка не засоряется побочными обсуждениями. Новый чат под новую задачу ветвление не заменяет.
Цитирование фрагмента ответа. В ChatGPT можно выделить кусок ответа и прикрепить его к следующему сообщению цитатой. Модель точно понимает, о каком месте идет речь, а вам не нужно копировать фрагмент вручную.
Проекты — папки с общей инструкцией и файлами, которые подставляются в каждый новый чат внутри проекта. Способ не повторять брифинг руками. У Claude и ChatGPT память проекта отделена от общей, поэтому рабочий проект не подмешивается в посторонние чаты.
Автосжатие (compaction). Claude при подходе к лимиту сам суммирует раннюю часть диалога и продолжает работать с выжимкой. Чат не обрывается, но детали теряются, и решает, что сохранить, модель, а не вы. Если детали важны — не доводите до автосжатия: попросите резюме сами и откройте новый чат.
Память между чатами — не инструмент экономии. Она избавляет от повторного представления, но добавляет токены в каждый новый чат и может подтянуть лишнее из посторонних обсуждений. Для разовой задачи чистый чат полезнее.
Сервис | Что есть встроенного |
ChatGPT | Ветвление, цитирование фрагмента ответа, проекты с отдельной памятью, память между чатами |
Claude (чат) | Проекты с отдельной памятью, автосжатие длинных диалогов, память и поиск по прошлым чатам. |
Google AI Studio | Ветвление, отдельное поле системной инструкции, редактирование и удаление отдельных реплик. |
DeepSeek | Ничего из перечисленного: ни ветвления, ни проектов, ни памяти между чатами. Остаются ручные приемы — новый чат на задачу и брифинг |
Qwen | Память между чатами. Ветвления и проектов в интерфейсе нет |
Связанные статьи
Что такое LLM — токены и принцип работы модели
Ограничения и галлюцинации — как ограниченность контекста влияет на качество ответов
NotebookLM — сервис для работы с большими массивами документов по технологии RAG
Вайб-кодинговые проекты участников — в списке есть инструменты конвертации, созданные участниками сообщества
Фронтенд и бэкенд — как выбрать подход при вайб-кодинге программ для обработки файлов
Скиллы и плагины — для понимания, что именно создал Ян Стригов
Claude Cowork — агентная среда, в которой скиллы конвертации в Markdown особенно эффективны
Дополнительные материалы
Книга «Юристы и нейросети: руководство к действию» — приобретайте на OZON | Читай-город | Буквоед
Разбор скиллов конвертации в Markdown с примерами и инструкцией установки — Ян Стригов
Теги: #концепция #новичок #знакомство-с-нейросетями