Whisper vs Яндекс SpeechKit vs SaluteSpeech — три имени, которые чаще всего всплывают при выборе модели распознавания русской речи в 2026 году. OpenAI Whisper стал де-факто стандартом open-source STT, SpeechKit — корпоративным выбором экосистемы Яндекса, SaluteSpeech — ответом Сбера для голосовых ассистентов и call-центров. Но «лучше для русского» — не абсолютный рейтинг: всё зависит от сценария, качества записи, требований к 152-ФЗ и бюджета. Разберём архитектуру, сильные и слабые стороны каждой модели и когда достаточно AI Instant в SlovoMol от 2 ₽/мин, а когда нужен Human edit за 75 ₽/мин.
Краткий обзор трёх платформ
OpenAI Whisper — мультиязычная модель с открытыми весами. Обучена на сотнях тысяч часов аудио из интернета. Поддерживает русский, но не оптимизирована исключительно под него. Доступна через API OpenAI, self-hosted развёртывание (Whisper.cpp, faster-whisper) и встроена во множество сторонних сервисов.
Яндекс SpeechKit — облачный STT от Яндекса с акцентом на русский и казахский. Предлагает синхронное и потоковое распознавание, адаптацию под домен (general, maps, queries), интеграцию с Yandex Cloud. Данные обрабатываются на инфраструктуре Яндекса в РФ.
SaluteSpeech — платформа Сбера для распознавания и синтеза речи. Ориентирована на банковский и корпоративный сектор, поддерживает потоковый режим, телефонию, голосовых ассистентов GigaChat. Русский — приоритетный язык обучения.
Сравнительная таблица для русского языка
| Критерий | Whisper (large-v3) | Яндекс SpeechKit | SaluteSpeech |
|---|---|---|---|
| Оптимизация под RU | Универсальная, не RU-first | Высокая, нативный русский | Высокая, корпоративный RU |
| Чистая студийная запись | 95%+ WER на хорошем аудио | 95%+ на телефонии и студии | 95%+ на call-центрах |
| Шум, улица, эхо | Устойчив, но «галлюцинирует» | Хорошо с телефонией | Настроен под банковские звонки |
| Диаризация (спикеры) | Через сторонние модули | Отдельный API | Поддерживается |
| Self-hosted / on-prem | Да (open weights) | Облако Yandex Cloud | Облако / корпоративный контур |
| 152-ФЗ из коробки | Зависит от развёртывания | Да, серверы в РФ | Да, инфраструктура Сбера |
| Модель оплаты | API-токены / GPU-сервер | ₽/секунда в Yandex Cloud | Корпоративный договор |
Whisper: когда выбирают и где проигрывает
Whisper популярен у разработчиков и энтузиастов: модель бесплатна для self-host, работает офлайн, поддерживает 90+ языков. Для подкаста одного ведущего в тихой комнате large-v3 выдаёт отличный черновик. Whisper хорошо справляется с английскими вставками в русской речи — типичный сценарий IT-подкастов и конференций.
Слабые места на русском:
- омонимы и созвучия («налог» / «нalog», «косвенный» / «косvenный»);
- редкие фамилии, топонимы, бренды — особенно региональные;
- «галлюцинации» — модель может дописать слова, которых не было, на шумной записи;
- пунктуация не всегда соответствует русской типографике;
- при self-host нужны GPU, DevOps и обновление моделей.
- потоковое распознавание в реальном времени;
- адаптация словаря под домен (медицина, юриспруденция — через custom vocabulary);
- прозрачный биллинг в рублях через Yandex Cloud;
- данные на серверах в РФ — проще согласовать с 152-ФЗ.
- привязка к облаку Яндекса и его тарифам;
- для качественной транскрибации длинных записей (лекции, интервью) может потребоваться постобработка;
- нет «готового кабинета» для журналиста — нужна разработка или сторонний сервис поверх API.
- нужен единый контракт с крупным российским провайдером;
- важна связка STT + NLU + чат-бот;
- записи — телефонные звонки клиентов с персональными данными.
- Оцените запись. Студия, один спикер → любая модель справится. Телефон, улица, 4+ спикера → нужна RU-оптимизированная модель + вычитка.
- Проверьте 152-ФЗ. Есть ПДн → только РФ-инфраструктура. Self-host Whisper, SpeechKit, SaluteSpeech или SlovoMol — да. OpenAI API — риск.
- Посчитайте TCO. Whisper «бесплатен», но GPU, администрирование и время разработчика стоят денег. SpeechKit/SaluteSpeech — ₽/сек + интеграция. SlovoMol — от 2 ₽/мин без DevOps.
- Определите формат результата. Нужны SRT, DOCX, PDF с таймкодами? Готовый сервис быстрее, чем скрипт поверх API.
- Заложите Human edit для материалов с юридическими или репутационными рисками.
Для бизнеса Whisper через публичный API OpenAI создаёт риск трансграничной передачи персональных данных — критично для записей с ФИО, телефонами, медициной.
Яндекс SpeechKit: корпоративный стандарт
SpeechKit — логичный выбор, если компания уже в экосистеме Яндекса: Yandex Cloud, Yandex 360, интеграция с CRM через API. Модель обучена на русской телефонии, навигаторе, поисковых запросах — хорошо понимает разговорный русский, сокращения, числа в контексте адресов и заказов.
Плюсы:
Минусы:
SaluteSpeech: банковский и enterprise-контур
SaluteSpeech позиционируется как enterprise-решение Сбера. Сильные стороны — телефония, call-центры, голосовые биометрии, интеграция с GigaChat для post-processing. Модель хорошо распознаёт русскую речь в условиях телефонного канала (8 кГц, сжатие), что актуально для расшифровки звонков в CRM.
SaluteSpeech выигрывает, когда:
Для фрилансера, журналиста или малого бизнеса порог входа выше: корпоративные тарифы, длительное согласование, необходимость API-интеграции.
Какая модель лучше для конкретных задач
Подкасты и YouTube
Whisper large-v3 или fine-tuned RU-модели на его базе — часто лучший баланс качества и стоимости при self-host. В облаке без DevOps удобнее сервис с готовым пайплайном — AI Instant в SlovoMol от 2 ₽/мин, экспорт TXT/SRT/DOCX/PDF.
Расшифровка звонков в CRM
SpeechKit и SaluteSpeech заточены под телефонию. Для amoCRM и Битрикс24 без собственной разработки проще использовать сервис с API и локальной обработкой — см. документацию API SlovoMol.
Медицина, юриспруденция, суды
Ни одна модель «из коробки» не даёт дословной точности для стенограммы. AI — черновик, Human edit 75 ₽/мин — проверка терминов, имён, цифр. Локальная обработка без зарубежного облака обязательна по 152-ФЗ.
Лекции и вебинары
Whisper и SpeechKit сопоставимы на чистом аудио. Разница — в пунктуации, таймкодах и удобстве экспорта. SlovoMol объединяет распознавание и выгрузку в рабочие форматы через личный кабинет.
152-ФЗ и выбор модели: не только WER
Word Error Rate (процент ошибок) — не единственный критерий. Запись совещания с именами сотрудников — персональные данные. Отправка файла в публичный API OpenAI — трансграничная передача. Self-hosted Whisper на сервере в РФ решает проблему географии, но не снимает необходимость договора поручения обработки, если сервисом пользуется третья сторона.
SlovoMol обрабатывает аудио на локальной инфраструктуре без передачи записей сторонним облачным STT. Вы получаете результат AI Instant или Human edit в контуре, ориентированном на российские требования к персональным данным — без необходимости разворачивать Whisper самостоятельно и без привязки к Yandex Cloud или Сберу.
Whisper vs SpeechKit vs SaluteSpeech: практический алгоритм выбора
Часто задаваемые вопросы
Whisper large-v3 точнее SpeechKit на русском подкасте?
На чистой студийной записи разница минимальна — 1–3% WER. На телефонных звонках SpeechKit обычно точнее. На записи с сильным акцентом или заимствованиями Whisper иногда лучше улавливает английские термины, но хуже с русскими фамилиями.
Можно ли использовать Whisper в компании с 152-ФЗ?
Да, при self-host на серверах в РФ и оформлении документов как оператора/обработчика. Публичный API OpenAI для записей с ПДн — не рекомендуется без правовых оснований для трансграничной передачи.
SaluteSpeech доступен физлицам?
Основной фокус — B2B и корпоративные клиенты. Для разовых задач (интервью, лекция) проще загрузить файл в кабинет SlovoMol и получить текст за минуты.
Как протестировать качество без оплаты?
SlovoMol даёт 10 бесплатных минут AI Instant — загрузите репрезентативный фрагмент вашей записи в кабинет и сравните с результатом другой модели на том же аудио.
Нужен ли Human edit после любой из моделей?
Для личных заметок и SEO-черновиков — нет. Для публикации цитат, судебных материалов, медицинских протоколов — да, независимо от того, Whisper это, SpeechKit или SaluteSpeech.
Итог: нет универсального победителя
Whisper vs Яндекс SpeechKit vs SaluteSpeech — три инструмента для разных задач. Whisper — для разработчиков и мультиязычных проектов с собственной инфраструктурой. SpeechKit — для экосистемы Яндекса и потокового STT. SaluteSpeech — для enterprise-телефонии и банков. Для большинства прикладных задач — расшифровка интервью, звонков, лекций, видео — рациональнее сервис, который уже объединил RU-модель, локальную обработку по 152-ФЗ и экспорт в TXT/SRT/DOCX/PDF. Попробуйте AI Instant от 2 ₽/мин на slovomol.com — 10 бесплатных минут хватит, чтобы сравнить качество на вашем аудио без развёртывания GPU и корпоративных договоров.