Локальные решения для расшифровки
Когда данные не должны покидать ваш компьютер — адвокатская тайна, чувствительные переговоры, закрытый контур. Какие модели распознавания речи и диаризации работают с русским языком и какие готовые инструменты можно поставить, не собирая пайплайн с нуля.
Дата составления: 2026-08-01
Статус: 💡 Актуально
Из чего состоит локальная расшифровка
Внутри это всегда два компонента: модель распознавания речи (ASR — Automatic Speech Recognition) и модель диаризации (разделение говорящих). ASR превращает звук в текст, диаризация говорит, кто из спикеров что произнес. Можно использовать только ASR (если текст нужен без меток), но для разговоров двух и более человек диаризация делает результат пригодным к чтению.
Локальное решение можно собирать тремя путями: взять готовое приложение, написать свой пайплайн (см. Вайб-кодинг) или донастроить готовую библиотеку. Ниже — модели и инструменты, которые имеет смысл рассматривать в каждом из этих путей.
Модели распознавания речи с поддержкой русского
Модель | Разработчик | Особенности | Лицензия |
SberDevices | Заточена под русский язык; в публичных бенчмарках — лучший результат для русского среди открытых моделей | MIT | |
OpenAI | Индустриальный стандарт, универсальная многоязычная модель; много готовых инструментов поверх | MIT | |
Alibaba Cloud | Свежая (январь 2026), 30 языков включая русский; хорошо держит шум и музыку | Apache 2.0 | |
NVIDIA | Легкая и быстрая, 25 европейских языков включая русский; хорошо работает на слабом железе | CC-BY-4.0 | |
AlphaCephei | Легкая офлайн-модель, запускается на ПК, ноутбуке и даже телефоне; есть вариант small для слабого железа | Apache 2.0 |
Для диаризации (разделения спикеров) стандартом стала PyAnnote — открытая библиотека на основе моделей глубокого обучения. Альтернатива — инструменты из фреймворка NVIDIA NeMo.
Как запускать модели: окружение под каждую или один движок. Обычно каждая модель ставится отдельно — со своим Python-окружением и версиями библиотек. Это и есть та часть работы, из-за которой локальная расшифровка кажется сложнее, чем она есть. Появляются решения, которые ее убирают: audio.cpp — один движок, в который уже встроены распознавание речи, диаризация, определение речи и пауз и другие аудио-задачи, с общей командной строкой и локальным сервером; ставить окружение под каждую модель не нужно.
Данный проект пока на ранней стадии и рассчитан на тех, кто собирает свой пайплайн, а не ищет готовое приложение. Русский поддерживает только мультиязычный Qwen3-ASR — GigaAM-v3 в наборе нет, поэтому для русскоязычных записей это пока компромисс по качеству. Но направление показательное: локальные инструменты становятся проще в установке.
Готовые инструменты поверх локальных моделей
Чтобы использовать локальные модели, не обязательно собирать пайплайн с нуля — Ян Стригов, участник сообщества Нейросети | ilovedocs, представил два готовых решения.
Стенограф — десктопное приложение для расшифровки длинных записей через API Google Gemini (нужен собственный ключ из AI Studio):
Автоматически делит файл на сегменты, отправляет каждый в Gemini, сшивает результаты в единый документ со сквозными таймкодами;
Два режима диаризации: универсальный (Спикер 1, Спикер 2, автоматическое определение имен) и судебное заседание (Судья, Истец, Ответчик и т. д.);
Экспорт в TXT, SRT, Markdown;
Есть чекпоинты — если процесс прервался, продолжит с того же места.
Стек: Rust + TypeScript + Tauri, установщики для Windows и macOS, лицензия MIT. Подробнее — в анонсе автора в Telegram.
Telegram-бот для расшифровки — распознавание и диаризация выполняются на вашем оборудовании: бот принимает аудиофайл в Telegram, скачивает его к себе, распознает речь моделью GigaAM v3, разделяет реплики через PyAnnote и возвращает текстовую расшифровку в нескольких форматах. Разворачивается локально: Windows, желательно видеокарта NVIDIA с 12+ ГБ памяти, можно и на CPU (без onnxruntime-gpu). Лицензия MIT, документация с пошаговой инструкцией в репозитории. Подробнее — в анонсе автора в Telegram.
Нюанс: аудиофайл и результат идут через сервера Telegram — мессенджер хранит их в своем облаке, шифрование между клиентом и серверами Telegram есть, но не end-to-end. Для задач, где важна адвокатская тайна или конфиденциальные переговоры, этого может быть недостаточно — тогда лучше собрать собственный конвейер с теми же моделями, минуя Telegram, или использовать расшифровку строго внутри доверенного контура.
Локальные инструменты в облаке
Участница сообщества Нейросети | ilovedocs Полина Рождественская предложила подход, позволяющий бесплатно использовать локальную open-source нейросеть без установки на собственное устройство: запуск ноутбука с моделью Whisper в Google Colab.
Что такое Google Colab. Google Colaboratory — бесплатная облачная среда от Google для запуска Python-кода прямо в браузере, без установки чего-либо на свой компьютер. Colab предоставляет виртуальную машину с GPU — достаточно мощную для запуска Whisper. Рабочий документ называется ноутбук (notebook, файл в формате .ipynb) — набор последовательных ячеек с кодом и текстом, которые запускаются по порядку.
Как это работает с Whisper. При первом запуске ноутбук устанавливает модель Whisper на виртуальную машину Google и загружает ваш аудиофайл. Расшифровка выполняется там же — данные уходят на серверы Google, но не в сторонние сервисы транскрибации; модель работает внутри вашей сессии.
Ноутбук для запуска:
Как запустить:
Открыть Google Colab (нужен Google-аккаунт).
Загрузить ноутбук: «Файл» → «Загрузить блокнот» → выбрать
.ipynb-файл.Подключить среду выполнения: кнопка «Подключить» в правом верхнем углу.
Запускать ячейки по порядку — кнопкой ▶ слева от каждой или через «Среда выполнения» → «Выполнить всё».
Загрузить аудиофайл в указанную ячейкой папку и дождаться результата.
Доработка под себя. Ноутбук — это код, и его можно адаптировать вайб-кодингом: попросить LLM подключить другую модель, добавить диаризацию или изменить формат вывода. Так, Ян Стригов поделился двумя вариациями ноутбуков для расшифровки с диаризацией собеседников — один на GigaAM-v3 от Сбера, другой на Whisper.
Кейсы участников сообщества
Два кейса ниже — работающие примеры того, что локальная расшифровка — реализуемый рабочий инструмент юриста. Эти два кейса по-разному отвечают на одну и ту же проблему: границы фрагментов, на которых распознавание ошибается чаще всего.
Локальный конвейер для расшифровки судебных заседаний
Семен собрал у себя на Mac Mini M4 Pro автоматический пайплайн для расшифровки аудиозаписей судебных заседаний: запись → локальная модель GigaAM-v3 → готовый текст с диаризацией → сведение результата языковой моделью. Первые версии пайплайна использовали Whisper-large-v3, но автор вернулся к GigaAM-v3 как более качественной для русского языка.
Запись распознается дважды. Первый проход длинными отрезками, второй — короткими окнами примерно по 7 секунд с наслаиванием: с 1-й по 7-ю секунду, затем с 4-й по 11-ю и так далее. Стык отрезков — самое уязвимое место распознавания, и перекрывающиеся окна дают вторую версию именно тех мест, где на границе что-то осталось неразобранным.
Две расшифровки сводит модель. Обе версии автоматически уходят в Claude через терминал в неинтерактивном режиме (флаг -p) и сливаются в одну с учетом контекста записи. Неинтерактивный режим позволяет встроить Claude в конвейер без необходимости вручную копировать текст в чат.
По оценке автора, итоговая расшифровка совпадает с оригиналом по смысловой точности примерно на 98%.
Памятка по стабильной локальной транскрибации
Кейс Александра Зверева. Описан 3 июля 2026
Александр настроил локальный процесс транскрибации с диаризацией, которым управляет агент: в этой схеме не перегружается ни агент, ни компьютер, а на выходе получается готовый документ.
Тяжелое считается локально, наружу отдаются только ссылки. Аудиофайлы и полные тексты не должны идти через чат, MCP-сервер или туннель — это самая частая причина сбоев. Агент оперирует локальными путями, идентификатором задачи и ее статусом, а тексты читает точечно и ограниченными фрагментами. Все списки файлов и объемы чтения имеют явные лимиты.
Один тяжелый процесс за раз. Распознавание речи и диаризация ресурсоемки: даже если интерфейс принимает несколько файлов, обрабатывать их нужно последовательно, через очередь с блокировкой, а не параллельно.
Диаризация строится на аудио, а не на тексте. Сегмент распознавания речи не равен реплике: в него могут попасть две реплики разных людей, короткая перебивка или одновременная речь. Поэтому сначала выполняется аудио-сегментация и кластеризация голосов по коротким окнам и только потом текст привязывается ко времени и разрезается на сменах говорящего.
Имена присваиваются только по доказательным якорям. Надежные основания — самопредставление, явное обращение с ответом, список участников с подтвержденными репликами, правка пользователя.
Очистка не превращает стенограмму в протокол. Агенту разрешено убрать мусор распознавания, нормализовать термины по глоссарию, пометить сомнительное как «[возможно: ...]» и «[неразборчиво 00:00:00]».
Старые расшифровки — вспомогательный источник. Прежняя стенограмма годится для имен, таймкодов, глоссария и проверки спорных мест, но не заменяет свежее распознавание, и факт ее использования нужно фиксировать в метаданных.
Результат — готовые файлы, а не набор фрагментов. Задача считается выполненной, когда собраны единая стенограмма (и протокол, если он нужен), указаны источники, перечислены предупреждения о качестве и явно помечены неподтвержденные говорящие.
Связанные статьи
Расшифровка аудио — общий обзор и сравнение подходов
Расшифровка в чате в LLM — Google AI Studio и обзор других чат-ботов
Готовые сервисы и облачные API — MyMeet, Таймлист, Yandex SpeechKit и другие
Анонимизация данных — если задача — защитить ПД, локальная модель часто избыточна; иногда достаточно обезличить и работать с облаком
Вайб-кодинг — если хочется собрать свой инструмент поверх локальной модели
MCP-серверы — как агент подключается к локальным файлам и запускает задачи на вашем компьютере
Вайб-кодинговые проекты — проекты участников сообщества, включая Стенограф и бот расшифровки
Теги: #инструменты #аудио #транскрипция #локальное #диаризация