Whisper, TTS и голосовой ИИ: обзор технологий распознавания и синтеза речи
Обзор голосовых ИИ-технологий: распознавание речи Whisper, синтез речи ElevenLabs, OpenAI TTS. Практическое применение и сравнение.
Проверено 20 июля 2026 года. Голосовой ИИ — это не одна модель, а цепочка обработки речи. VAD определяет границы реплики, STT превращает звук в текст, языковая модель готовит ответ, TTS озвучивает его. Для встреч и субтитров достаточно STT. Для диалога придётся отдельно измерять задержку, ошибки распознавания, качество голоса и поведение системы при перебивании.

Из чего состоит голосовой стек
| Этап | Вход и выход | Что измерять |
|---|---|---|
| VAD | Аудиопоток → границы реплик | Пропущенные слова, ложные срабатывания |
| STT / ASR | Аудио → текст | Ошибки на именах, числах, терминах и шуме |
| Diarization | Аудио → сегменты по говорящим | Смешение спикеров |
| LLM | Текст и контекст → ответ | Полезность, фактические ошибки, время до первого токена |
| TTS | Текст → речь | Разборчивость, произношение, время до первого звука |
Whisper относится к STT. В официальной model card перечислены девять вариантов и две задачи: транскрибация на исходном языке и перевод речи на английский. Число параметров само по себе не говорит, какая версия лучше для вашего аудио. Нужна проверка на записях с теми же микрофонами, шумом, акцентами и словарём.
Как выбирать STT
Для офлайн-обработки важны поддерживаемое железо, лицензия, пакетный режим и возможность хранить аудио внутри контура. Для облачного STT добавляются регион обработки, политика хранения и стоимость фактического объёма. Не переносите чужой WER в свой проект: даже одна и та же модель по-разному ошибается на студийной записи и звонке с компрессией.
Минимальный тест содержит 30–50 коротких фрагментов: чистая речь, шум, числа, фамилии, названия продуктов и смена языка. Сначала подготовьте эталон вручную. Затем считайте ошибки отдельно по критическим сущностям, а не только одним средним процентом.
Как выбирать TTS
У синтеза речи другой набор рисков. Проверяйте произношение имён, чисел, сокращений и ударений, а также правила использования голосов. Для диалога важно потоковое воспроизведение: пользователь должен услышать начало ответа, не дожидаясь генерации всего файла. Для озвучки статей важнее стабильность тембра и возможность повторить результат.
Облачный сервис снимает заботу об инференсе, но передаёт текст поставщику. Self-hosted TTS оставляет данные внутри контура, зато команда отвечает за модели, очередь, обновления и мониторинг.
Облако или собственный контур
| Условие | Разумный старт |
|---|---|
| Быстрый прототип на несекретных данных | Облачные STT и TTS с журналом фактических затрат |
| Записи содержат персональные или внутренние данные | Self-hosted обработка либо поставщик с подходящими условиями хранения |
| Пакетная расшифровка архива | Оптимизировать пропускную способность и повторный запуск |
| Живой диалог | Потоковая архитектура, VAD и отдельный latency budget |
Воспроизводимый офлайн-тест
- Зафиксируйте модель, версию библиотеки, устройство и тип вычислений.
- Возьмите один и тот же набор WAV-файлов без изменения громкости между прогонами.
- Запишите длительность аудио, время обработки и пиковую память.
- Отдельно отметьте ошибки на именах, числах и терминах.
- Повторите тест после обновления модели или рантайма.
Такая карточка полезнее универсальной таблицы «модель X быстрее модели Y»: результат можно повторить на вашем железе и сравнить после обновления.
Частые вопросы
Whisper умеет синтезировать речь?
Нет. Whisper распознаёт речь и может переводить её на английский. Для озвучки нужен отдельный TTS.
Нужна ли diarization для субтитров?
Не всегда. Она нужна, если важно подписать реплики разных людей. Для одной дорожки с одним спикером можно обойтись без неё.
Какая модель Whisper лучшая для русского?
Та, которая проходит ваш тест по качеству и укладывается в доступное железо. Model card не даёт универсального рейтинга для всех русскоязычных записей.
Можно ли построить полностью офлайн-стек?
Да, если локально работают STT, LLM и TTS. Проверьте лицензии, память, задержку и качество на реальном устройстве.
Источники и дата проверки
- OpenAI Whisper model card.
- Официальный репозиторий Whisper.
- Официальная карточка TTS-1.
- Официальный репозиторий Silero Models.