ИИ и офисные форматы файлов
Как устроены файлы .docx, .doc и .pdf, как с ними работает нейросеть, почему в готовом документе съезжает верстка и как этого избежать.
Дата составления: 2026-10-03
Статус: 💡 Актуально
Суть
Нейросеть работает с текстом. Все, что лежит за пределами текста, — шрифты, отступы, автонумерация, сноски, колонтитулы — ей приходится создавать обходным путем: писать код, который соберет файл. Отсюда большинство проблем с оформлением.
Главный практический вывод: подготовку текста и сборку файла лучше разделять. Чем меньше модель занимается версткой сама, тем аккуратнее результат. Способы сборки аккуратного файла и внесения правок в режиме рецензирования — в статье Генерация документов и редлайн.
Как устроены файлы Word и PDF
.docx
Файл .docx — это архив, внутри которого лежит набор файлов XML по стандарту Office Open XML. Текст документа, стили, нумерация, сноски, комментарии и правки рецензирования хранятся в разных частях архива и связаны между собой ссылками. О самом формате XML — в статье Форматы данных и API.
Когда вы загружаете .docx в чат, сервис извлекает из него текст и отдает модели. Часть разметки при этом теряется, часть попадает в контекст и тратит токены. Чтобы выдать файл, модель пишет и запускает программу на Python или JavaScript, которая строит документ с помощью библиотеки (например, python-docx). Это занимает время и тратит токены, а возможности библиотек ограничены: ни одна из них не покрывает формат целиком.
В python-docx, например, нет готовых средств для правок рецензирования: их приходится вписывать в XML напрямую (как это делают агенты — в статье Генерация документов и редлайн). Поэтому простой документ получается хорошо, а сложная верстка с многоуровневой нумерацией, таблицами и колонтитулами часто ломается.
.doc
Старый формат Word, который был основным до 2007 года. Юристы встречают его до сих пор: в .doc приходят типовые договоры контрагентов, формы из справочных систем, документы из архивов.
Внутри .doc нет ни архива, ни XML. Это двоичный файл, устройство которого гораздо сложнее и хуже поддерживается современными инструментами. Отсюда практические следствия:
Часть сервисов и конвертеров
.docне принимает. Например, MarkItDown, на котором построены многие конвертеры в Markdown, с этим форматом не работает.Агенты обычно сначала конвертируют
.docв.docxи только потом работают с файлом. Для этого в среде агента должен быть установлен LibreOffice или сам Word.Правки рецензирования, сноски и сложная нумерация при конвертации могут пострадать.
Проще всего сразу пересохранить файл в Word: «Сохранить как» → «Документ Word (.docx)». После этого стоит пролистать документ и проверить нумерацию и таблицы.
.pdf
Формат .pdf создан для того, чтобы документ одинаково выглядел на любом устройстве и на бумаге. Поэтому в файле записано, где на странице стоит каждый символ, линия и картинка. Сведений о том, что перед нами абзац, заголовок или таблица, в обычном .pdf нет. Программа, которая извлекает текст, восстанавливает структуру по расположению символов и часто ошибается: колонки склеиваются, строки таблицы рассыпаются, колонтитулы и сноски попадают в середину текста.
Для модели важно, есть ли в .pdf текстовый слой.
.pdf с текстовым слоем получается при сохранении из Word или другой программы. Текст из него извлекается напрямую, с оговорками о структуре выше. Некоторые сервисы дополнительно передают модели изображения страниц, и тогда она видит таблицы и схемы так же, как человек.
Скан — это картинка страницы без текста. Его нужно распознать: это делает сама модель или отдельный инструмент до загрузки. Распознавание ошибается, и ошибки бывают содержательными: в распознанном тексте появляются условия договора, которых не было в оригинале. Перед работой с таким текстом ключевые места сверяют со сканом.
Объем. Большие файлы надежнее резать на части. Сервисы принимают разные форматы и объемы, и их поведение меняется: один и тот же файл один сервис обработает, а другой отклонит.
.pdf на выходе. Создать .pdf агент может так же, как .docx: он пишет код, который собирает файл с помощью библиотеки. Для документов со сложным оформлением чаще идут другим путем: текст готовят в Markdown, HTML или Word и затем конвертируют.
Инструменты. Для пакетной конвертации и простого распознавания участники сообщества используют PDF24. Библиотека Docling переводит .pdf, изображения и офисные файлы в Markdown с сохранением заголовков и таблиц. Сканы она распознает сама, работает локально и подключается к агентам как MCP-сервер. Конвертеры в Markdown, сделанные участниками сообщества, собраны в статье Контекстное окно.
Частые задачи
Перенос таблицы из чата в Word. При обычном копировании таблица сливается в сплошной текст. Варианты:
Перевести ответ в режим холста (Canvas) и скачать документ оттуда;
В Gemini — экспортировать в Google Документы и сохранить как
.docx;Выделить таблицу в ответе мышью, скопировать сочетанием клавиш Ctrl+C (на Mac — Cmd+C) и вставить в Word. Кнопка «Копировать» под ответом в части сервисов копирует текст в разметке Markdown, и тогда в Word вместо таблицы попадают строки с вертикальными чертами.
Нумерация и сноски. Для механических операций действует правило: если задачу можно решить без языковой модели, ее решают без модели. Пронумеровать абзацы или пункты надежнее алгоритмом, чем генерацией. Для автонумерации пунктов есть скилл Евгения Вихрова. С большими объемами сносок справляется агент: кейс Михаила Тевса об оформлении сносок диссертации по ГОСТу с проверкой каждой цитаты по источнику описан в статье Claude Cowork.
Опись и приложения. Собрать приложения в один .pdf, пронумеровать их и сделать опись с гиперссылками может агент. Если материалы существуют только как сканы, их сначала распознают — см. раздел о .pdf выше.
Связанные статьи
Генерация документов и редлайн — как получить аккуратный файл и внести правки в режиме рецензирования
Шаблоны и типовые документы — верстка в шаблоне и подстановка данных
Материалы дела — распознавание сканов и подготовка исходников
Форматы данных и API — что такое XML и другие форматы данных
MCP-серверы — как подключить агенту внешние инструменты
Теги: #составление-документов #docx #pdf #форматы-файлов