Whisper, TTS и голосовой ИИ: обзор технологий распознавания и синтеза речи

Обзор голосовых ИИ-технологий: распознавание речи Whisper, синтез речи ElevenLabs, OpenAI TTS. Практическое применение и сравнение.

Голосовой ИИ: Whisper STT, TTS и синтез речи — обзор технологий

Проверено 20 июля 2026 года. Голосовой ИИ — это не одна модель, а цепочка обработки речи. VAD определяет границы реплики, STT превращает звук в текст, языковая модель готовит ответ, TTS озвучивает его. Для встреч и субтитров достаточно STT. Для диалога придётся отдельно измерять задержку, ошибки распознавания, качество голоса и поведение системы при перебивании.

Официальная model card Whisper в репозитории OpenAI
Model card Whisper описывает задачи, размеры моделей и ограничения. Источник: OpenAI на GitHub.

Из чего состоит голосовой стек

ЭтапВход и выходЧто измерять
VADАудиопоток → границы репликПропущенные слова, ложные срабатывания
STT / ASRАудио → текстОшибки на именах, числах, терминах и шуме
DiarizationАудио → сегменты по говорящимСмешение спикеров
LLMТекст и контекст → ответПолезность, фактические ошибки, время до первого токена
TTSТекст → речьРазборчивость, произношение, время до первого звука

Whisper относится к STT. В официальной model card перечислены девять вариантов и две задачи: транскрибация на исходном языке и перевод речи на английский. Число параметров само по себе не говорит, какая версия лучше для вашего аудио. Нужна проверка на записях с теми же микрофонами, шумом, акцентами и словарём.

Как выбирать STT

Для офлайн-обработки важны поддерживаемое железо, лицензия, пакетный режим и возможность хранить аудио внутри контура. Для облачного STT добавляются регион обработки, политика хранения и стоимость фактического объёма. Не переносите чужой WER в свой проект: даже одна и та же модель по-разному ошибается на студийной записи и звонке с компрессией.

Минимальный тест содержит 30–50 коротких фрагментов: чистая речь, шум, числа, фамилии, названия продуктов и смена языка. Сначала подготовьте эталон вручную. Затем считайте ошибки отдельно по критическим сущностям, а не только одним средним процентом.

Как выбирать TTS

У синтеза речи другой набор рисков. Проверяйте произношение имён, чисел, сокращений и ударений, а также правила использования голосов. Для диалога важно потоковое воспроизведение: пользователь должен услышать начало ответа, не дожидаясь генерации всего файла. Для озвучки статей важнее стабильность тембра и возможность повторить результат.

Облачный сервис снимает заботу об инференсе, но передаёт текст поставщику. Self-hosted TTS оставляет данные внутри контура, зато команда отвечает за модели, очередь, обновления и мониторинг.

Облако или собственный контур

УсловиеРазумный старт
Быстрый прототип на несекретных данныхОблачные STT и TTS с журналом фактических затрат
Записи содержат персональные или внутренние данныеSelf-hosted обработка либо поставщик с подходящими условиями хранения
Пакетная расшифровка архиваОптимизировать пропускную способность и повторный запуск
Живой диалогПотоковая архитектура, VAD и отдельный latency budget

Воспроизводимый офлайн-тест

  1. Зафиксируйте модель, версию библиотеки, устройство и тип вычислений.
  2. Возьмите один и тот же набор WAV-файлов без изменения громкости между прогонами.
  3. Запишите длительность аудио, время обработки и пиковую память.
  4. Отдельно отметьте ошибки на именах, числах и терминах.
  5. Повторите тест после обновления модели или рантайма.

Такая карточка полезнее универсальной таблицы «модель X быстрее модели Y»: результат можно повторить на вашем железе и сравнить после обновления.

Частые вопросы

Whisper умеет синтезировать речь?

Нет. Whisper распознаёт речь и может переводить её на английский. Для озвучки нужен отдельный TTS.

Нужна ли diarization для субтитров?

Не всегда. Она нужна, если важно подписать реплики разных людей. Для одной дорожки с одним спикером можно обойтись без неё.

Какая модель Whisper лучшая для русского?

Та, которая проходит ваш тест по качеству и укладывается в доступное железо. Model card не даёт универсального рейтинга для всех русскоязычных записей.

Можно ли построить полностью офлайн-стек?

Да, если локально работают STT, LLM и TTS. Проверьте лицензии, память, задержку и качество на реальном устройстве.

Источники и дата проверки

Связанные материалы

Сохранённые ссылки эксперимента

Telegram-канал @toolarium