ИИ и офисные форматы файлов

Как устроены файлы .docx, .doc и .pdf, как с ними работает нейросеть, почему в готовом документе съезжает верстка и как этого избежать.

Дата составления: 2026-10-03
Статус: 💡 Актуально


Суть

Нейросеть работает с текстом. Все, что лежит за пределами текста, — шрифты, отступы, автонумерация, сноски, колонтитулы — ей приходится создавать обходным путем: писать код, который соберет файл. Отсюда большинство проблем с оформлением.

Главный практический вывод: подготовку текста и сборку файла лучше разделять. Чем меньше модель занимается версткой сама, тем аккуратнее результат. Способы сборки аккуратного файла и внесения правок в режиме рецензирования — в статье Генерация документов и редлайн.


Как устроены файлы Word и PDF

.docx

Файл .docx — это архив, внутри которого лежит набор файлов XML по стандарту Office Open XML. Текст документа, стили, нумерация, сноски, комментарии и правки рецензирования хранятся в разных частях архива и связаны между собой ссылками. О самом формате XML — в статье Форматы данных и API.

Когда вы загружаете .docx в чат, сервис извлекает из него текст и отдает модели. Часть разметки при этом теряется, часть попадает в контекст и тратит токены. Чтобы выдать файл, модель пишет и запускает программу на Python или JavaScript, которая строит документ с помощью библиотеки (например, python-docx). Это занимает время и тратит токены, а возможности библиотек ограничены: ни одна из них не покрывает формат целиком.

В python-docx, например, нет готовых средств для правок рецензирования: их приходится вписывать в XML напрямую (как это делают агенты — в статье Генерация документов и редлайн). Поэтому простой документ получается хорошо, а сложная верстка с многоуровневой нумерацией, таблицами и колонтитулами часто ломается.

.doc

Старый формат Word, который был основным до 2007 года. Юристы встречают его до сих пор: в .doc приходят типовые договоры контрагентов, формы из справочных систем, документы из архивов.

Внутри .doc нет ни архива, ни XML. Это двоичный файл, устройство которого гораздо сложнее и хуже поддерживается современными инструментами. Отсюда практические следствия:

  • Часть сервисов и конвертеров .doc не принимает. Например, MarkItDown, на котором построены многие конвертеры в Markdown, с этим форматом не работает.

  • Агенты обычно сначала конвертируют .doc в .docx и только потом работают с файлом. Для этого в среде агента должен быть установлен LibreOffice или сам Word.

  • Правки рецензирования, сноски и сложная нумерация при конвертации могут пострадать.

Проще всего сразу пересохранить файл в Word: «Сохранить как» → «Документ Word (.docx)». После этого стоит пролистать документ и проверить нумерацию и таблицы.

.pdf

Формат .pdf создан для того, чтобы документ одинаково выглядел на любом устройстве и на бумаге. Поэтому в файле записано, где на странице стоит каждый символ, линия и картинка. Сведений о том, что перед нами абзац, заголовок или таблица, в обычном .pdf нет. Программа, которая извлекает текст, восстанавливает структуру по расположению символов и часто ошибается: колонки склеиваются, строки таблицы рассыпаются, колонтитулы и сноски попадают в середину текста.

Для модели важно, есть ли в .pdf текстовый слой.

.pdf с текстовым слоем получается при сохранении из Word или другой программы. Текст из него извлекается напрямую, с оговорками о структуре выше. Некоторые сервисы дополнительно передают модели изображения страниц, и тогда она видит таблицы и схемы так же, как человек.

Скан — это картинка страницы без текста. Его нужно распознать: это делает сама модель или отдельный инструмент до загрузки. Распознавание ошибается, и ошибки бывают содержательными: в распознанном тексте появляются условия договора, которых не было в оригинале. Перед работой с таким текстом ключевые места сверяют со сканом.

Объем. Большие файлы надежнее резать на части. Сервисы принимают разные форматы и объемы, и их поведение меняется: один и тот же файл один сервис обработает, а другой отклонит.

.pdf на выходе. Создать .pdf агент может так же, как .docx: он пишет код, который собирает файл с помощью библиотеки. Для документов со сложным оформлением чаще идут другим путем: текст готовят в Markdown, HTML или Word и затем конвертируют.

Инструменты. Для пакетной конвертации и простого распознавания участники сообщества используют PDF24. Библиотека Docling переводит .pdf, изображения и офисные файлы в Markdown с сохранением заголовков и таблиц. Сканы она распознает сама, работает локально и подключается к агентам как MCP-сервер. Конвертеры в Markdown, сделанные участниками сообщества, собраны в статье Контекстное окно.


Частые задачи

Перенос таблицы из чата в Word. При обычном копировании таблица сливается в сплошной текст. Варианты:

  • Перевести ответ в режим холста (Canvas) и скачать документ оттуда;

  • В Gemini — экспортировать в Google Документы и сохранить как .docx;

  • Выделить таблицу в ответе мышью, скопировать сочетанием клавиш Ctrl+C (на Mac — Cmd+C) и вставить в Word. Кнопка «Копировать» под ответом в части сервисов копирует текст в разметке Markdown, и тогда в Word вместо таблицы попадают строки с вертикальными чертами.

Нумерация и сноски. Для механических операций действует правило: если задачу можно решить без языковой модели, ее решают без модели. Пронумеровать абзацы или пункты надежнее алгоритмом, чем генерацией. Для автонумерации пунктов есть скилл Евгения Вихрова. С большими объемами сносок справляется агент: кейс Михаила Тевса об оформлении сносок диссертации по ГОСТу с проверкой каждой цитаты по источнику описан в статье Claude Cowork.

Опись и приложения. Собрать приложения в один .pdf, пронумеровать их и сделать опись с гиперссылками может агент. Если материалы существуют только как сканы, их сначала распознают — см. раздел о .pdf выше.


Связанные статьи


Теги: #составление-документов #docx #pdf #форматы-файлов