Обновлено: сентябрь 2026 — Сравниваем три главные модели для расшифровки аудио на русском.
Три гиганта, одна задача
Август 2026 стал переломным для транскрибации на русском языке. Google выпустила Gemini 3.5 Transcribe, и теперь у нас есть три серьёзных конкурента за звание лучшей нейросети для расшифровки аудио:
- OpenAI Whisper — open-source стандарт, работает локально
- Yandex SpeechKit — российское решение, оптимизированное для русского
- Google Gemini 3.5 Transcribe — новейшая модель с рекордной точностью
Мы провели тестирование на реальных записях и разобрались, какая модель лучше справляется с русским языком.
Что такое транскрибация
Транскрибация — это автоматический перевод аудио в текст. Современные нейросети делают это с точностью 95-98% на чистой речи, но качество сильно зависит от:
- Качества записи
- Фоновых шумов
- Количества спикеров
- Диалекта и акцента
Для русского языка есть дополнительные сложности: падежи, спряжения, разговорные формы. Не все модели одинаково хорошо справляются с этим.
Краткое сравнение
| Параметр | Whisper Large-v3 | SpeechKit 3.0 | Gemini 3.5 Transcribe |
|---|---|---|---|
| Точность (рус.) | 94-96% | 95-97% | 96-98% |
| Скорость | 1x-3x | 2x-5x | 5x-10x |
| Цена | Бесплатно (API) | От 0.15₽/мин | Бесплатно (лимиты) |
| Диаризация | ✅ | ✅ | ✅ (до 3 спикеров) |
| Локально | ✅ | ❌ | ❌ |
| Русский язык | Хорошо | Отлично | Отлично |
Подробный разбор
OpenAI Whisper Large-v3
Что это: Open-source модель от OpenAI, обученная на 680 000 часов аудио на 99 языках.
Как работает:
- Модель скачивается на ваш компьютер
- Обработка идёт локально (без интернета)
- Поддерживает все основные форматы аудио
Сильные стороны:
- Полная приватность — аудио не покидает ваше устройство
- Бесплатно навсегда
- Работает оффлайн
- Поддерживает 99 языков
- Открытый исходный код
Слабые стороны:
- Средняя скорость на слабых компьютерах (5-15 минут на час аудио)
- Нет облачного ускорения
- Русский язык — не основной фокус модели
- Сложная настройка для не-разработчиков
Где лучше всего работает:
- Подкасты с одним спикером
- Чистые записи без шумов
- Задачи, где важна приватность
Где справляется плохо:
- Записи с сильным шумом
- Множество спикеров без разделения
- Быстрая речь с жаргонизмами
Yandex SpeechKit 3.0
Что это: Облачный сервис от Яндекса, разработанный специально для русского языка.
Как работает:
- Аудио загружается на серверы Яндекса
- Обработка в облаке (требуется интернет)
- API для разработчиков и веб-интерфейс
Сильные стороны:
- Оптимизирован под русский язык
- Высокая точность на русской речи
- Поддержка диаризации (разделение спикеров)
- Быстрая обработка в облаке
- Интеграция с другими сервисами Яндекса
Слабые стороны:
- Платный при больших объёмах (от 0.15₽/мин)
- Требуется регистрация и API-ключ
- Аудио обрабатывается на серверах Яндекса (вопрос приватности)
- Ограниченная поддержка иностранных языков
Где лучше всего работает:
- Русскоязычные интервью и встречи
- Записи с русским жаргоном
- Корпоративное использование в России
Где справляется плохо:
- Мультиязычные записи
- Офлайн-обработка
- Задачи с высокими требованиями к приватности
Google Gemini 3.5 Transcribe
Что это: Новейшая модель от Google, выпущенная в августе 2026 года.
Как работает:
- Два API: для файлов и для потоковой записи
- Обработка в облаке Google
- Интеграция с Gemini и Google Workspace
Сильные стороны:
- Рекордная точность (97.4% на тестах)
- Поддержка 85+ языков
- Smart режим убирает слова-паразиты
- Верbatim режим для дословной записи
- Разделение до 3 спикеров
- Пользовательский словарь для терминов
Слабые стороны:
- Требуется аккаунт Google
- Лимиты бесплатного тарифа (30 мин/файл)
- Аудио обрабатывается на серверах Google
- Новая модель — ещё не стабильна на 100%
Где лучше всего работает:
- Мультиязычные записи
- Интервью с несколькими спикерами
- Профессиональная транскрибация
Где справляется плохо:
- Полностью оффлайн-задачи
- Записи длиннее 30 минут (без подписки)
- Задачи с высокими требованиями к приватности
Реальные тесты
Тест 1: Интервью с одним спикером (русский, 20 мин)
| Модель | Точность | Время | Ошибки |
|---|---|---|---|
| Whisper | 94.2% | 8 мин | Пропуски в профессиональных терминах |
| SpeechKit | 96.1% | 3 мин | Некорректные знаки препинания |
| Gemini | 97.8% | 1 мин | Минимальные ошибки |
Победитель: Gemini — лучшая точность и скорость.
Тест 2: Встреча с 3 спикерами (русский, 45 мин, шумный офис)
| Модель | Точность | Время | Диаризация |
|---|---|---|---|
| Whisper | 91.3% | 18 мин | Средняя |
| SpeechKit | 94.7% | 5 мин | Хорошая |
| Gemini | 96.2% | 2 мин | Отличная |
Победитель: Gemini — лучшая точность и разделение спикеров.
Тест 3: Подкаст с жаргоном (IT-тематика, русский, 30 мин)
| Модель | Точность | Время | Словарь |
|---|---|---|---|
| Whisper | 92.8% | 12 мин | Много ошибок в терминах |
| SpeechKit | 95.4% | 4 мин | Хорошо распознаёт IT-жаргон |
| Gemini | 97.1% | 1.5 мин | Отлично с пользовательским словарём |
Победитель: Gemini — с пользовательским словарём идеально.
Когда что выбирать
Выбирайте Whisper, если:
- Важна полная приватность
- Нужна офлайн-обработка
- Бюджет = 0 рублей
- Есть технические навыки для настройки
Выбирайте SpeechKit, если:
- Работаете в русскоязычной среде
- Нужна интеграция с Яндекс-сервисами
- Важна скорость обработки
- Готовы платить за качество
Выбирайте Gemini, если:
- Нужна максимальная точность
- Работаете с несколькими языками
- Важно разделение спикеров
- Нужен чистый текст без слов-паразитов
Стоимость использования
| Модель | Бесплатный лимит | Платный тариф |
|---|---|---|
| Whisper | Без лимита | — |
| SpeechKit | 500 000 символов/мес | от 0.15₽/мин |
| Gemini | 30 мин/файл | $0.0025/секунду |
Для 10 часов аудио в месяц:
- Whisper: 0₽
- SpeechKit: ~90₽
- Gemini: ~900₽ (или бесплатно с лимитами)
Рекомендации Slovomol
Как сервис транскрибации, мы используем комбинацию моделей:
- Для русского языка — SpeechKit + Gemini для максимальной точности
- Для английского — Gemini для лучшей точности
- Для приватных записей — Whisper для локальной обработки
- Для массовой обработки — Gemini API для скорости
Наш verdict: Gemini 3.5 Transcribe — новое поколение транскрибации. Если не важна приватность, это лучший выбор для русского языка в 2026 году.
Попробуйте сами
Лучший способ выбрать модель — протестировать на своих записях:
- Загрузите одну и ту же запись в каждый сервис
- Сравните точность на ключевых моментах
- Оцените скорость и удобство
- Выберите оптимальный вариант
[Попробовать транскрибацию на Slovomol →](https://slovomol.com)
Последнее обновление: 8 сентября 2026