Блог

Speech-to-Text API: как подключить распознавание речи

Разработчику, который впервые подключает Speech-to-Text API, важно понимать не только синтаксис запросов, но и архитектуру: как передаётся аудио, как возвращается текст, где хранятся записи и какие ограничения накладывает закон о персональных данных. В этой статье разберём типовые сценарии интеграции распознавания речи — от загрузки аудиофайла до webhook с готовой расшифровкой — и покажем, как подключить SlovoMol API для русскоязычных проектов: speech-to-text на русском, распознавание речи из файла и целых архивов записей с обработкой на локальной инфраструктуре.

Что такое Speech-to-Text API и когда он нужен

Speech-to-Text (STT) — программный интерфейс, который принимает аудио или поток звука и возвращает текст. В отличие от ручной загрузки файла в браузере, API позволяет встроить распознавание в CRM, колл-центр, образовательную платформу, мобильное приложение или внутренний портал компании.

Типичные задачи разработчика:

  • автоматическая расшифровка записей звонков после завершения разговора;
  • транскрибация голосовых заметок из мобильного приложения;
  • подготовка субтитров для видеоплатформы по расписанию;
  • создание протоколов совещаний из записи Zoom или TrueConf;
  • пакетная обработка архива подкастов или лекций.

Без API каждый файл пришлось бы загружать вручную. С API процесс становится частью бизнес-логики: пользователь нажимает «Сохранить», а через минуты получает текст в интерфейсе или на почту.

Архитектура интеграции: синхронный и асинхронный режимы

Большинство сервисов распознавания речи работают асинхронно: вы отправляете файл, получаете идентификатор задачи, затем опрашиваете статус или ждёте webhook. Синхронный режим подходит для коротких фрагментов (до 30–60 секунд), но для часовых записей асинхронность — стандарт.

Типовой процесс

  1. Аутентификация — API-ключ или OAuth-токен в заголовке запроса.
  2. Загрузка аудио — multipart/form-data или presigned URL в объектное хранилище.
  3. Создание задачи — POST с параметрами: язык, формат ответа, диаризация, таймкоды.
  4. Ожидание — polling GET /tasks/{id} или callback на ваш endpoint.
  5. Получение результата — JSON с текстом, сегментами, спикерами; или ссылка на TXT/SRT/DOCX.

При проектировании закладывайте повторные попытки с экспоненциальной задержкой, ключи идемпотентности для повторных отправок и очередь задач на стороне вашего backend — сервис распознавания не гарантирует мгновенный ответ на файлы длиннее нескольких минут.

Ключевые параметры API при интеграции

Параметр Зачем нужен Пример значения
language Язык распознавания ru-RU
diarization Разделение по спикерам true для интервью и фокус-групп
timestamps Таймкоды к словам или фразам word / segment
output_format Формат выдачи json, txt, srt, docx
callback_url Webhook при готовности https://your-app.ru/stt/done

Для русской речи проверяйте, обучена ли модель на разговорной лексике и смешанных терминах. Зарубежные API часто хорошо работают с английским, но теряют окончания и имена в русскоязычных записях.

Speech-to-Text на русском: чек-лист перед интеграцией

Русская речь капризнее английской: падежные окончания, редкие фамилии, смешение русского и английского в бизнес-лексике. Прежде чем выбрать API распознавания речи, прогоните тесты на собственном материале:

  • качество именно распознавания русской речи — не демо на английском подкасте;
  • поддержка диаризации и таймкодов в ответе API;
  • варианты выдачи: JSON с сегментами, TXT, SRT, DOCX;
  • лимиты на размер и длительность файла, rate limit для production;
  • программное удаление записи и результата после выдачи.

Отдельно считайте экономику: в потоке звонков стоимость минуты решает всё. У SlovoMol AI-расшифровка тарифицируется от 2 ₽/мин, ручная расшифровка с вычиткой — 75 ₽/мин; прайс — на странице тарифов. Готовый сценарий «телефония → CRM» разобран в статье «Расшифровка звонков и речевая аналитика в CRM».

152-ФЗ и выбор провайдера распознавания речи для разработчика

Если через ваш сервис проходят записи звонков с клиентами, интервью HR или медицинские консультации, аудио содержит персональные данные. Оператор (ваша компания) обязан обеспечить законность обработки по 152-ФЗ, включая локализацию баз на территории РФ и договор с обработчиком.

Интеграция с зарубежным облачным распознаванием речи часто означает трансграничную передачу ПДн — это отдельный слой соответствия требованиям: согласия, уведомления, оценка рисков. SlovoMol обрабатывает аудио на локальной инфраструктуре без передачи в сторонние облачные сервисы распознавания, что упрощает согласование с юридическим отделом и ответственным за защиту данных.

Чек-лист для backend-разработчика

  • Где физически обрабатывается файл и сколько времени хранится.
  • Есть ли шифрование при передаче (TLS) и at rest.
  • Можно ли удалить запись и результат по API после выдачи.
  • Есть ли SLA и лимиты rate limit для production.
  • Документированы ли коды ошибок и формат webhook.

Как подключить SlovoMol API

Документация доступна на slovomol.com/api-docs/. Общая схема интеграции:

  1. Зарегистрируйтесь и получите API-ключ в личном кабинете.
  2. Отправьте аудиофайл (MP3, WAV, M4A, MP4 и другие поддерживаемые форматы) через endpoint загрузки.
  3. Укажите режим обработки: AI-расшифровка (от 2 ₽/мин, первые 10 минут бесплатны) или ручная расшифровка (75 ₽/мин с вычиткой человеком).
  4. Запросите нужный формат результата: TXT, SRT, DOCX или PDF.
  5. Обработайте ответ: сохраните в БД, отправьте пользователю, сгенерируйте протокол.

Для тестирования достаточно curl или Postman; для production — очередь задач (Redis, RabbitMQ) и отдельный worker, который не блокирует основной поток приложения.

Пример сценария: расшифровка звонка в CRM

После завершения звонка телефония сохраняет MP3 на ваш сервер. Backend создаёт задачу SlovoMol API, передаёт URL или бинарный файл. По webhook приходит JSON с текстом и разметкой спикеров. CRM прикрепляет расшифровку к карточке клиента; менеджер видит саммари без прослушивания 40 минут записи.

Обработка ошибок и мониторинг

Надёжная интеграция предусматривает:

  • Таймауты — не ждите ответ бесконечно; ставьте лимит и переводите задачу в статус «отложено».
  • Логирование — request_id от провайдера сохраняйте для поддержки.
  • Fallback — при недоступности API уведомляйте администратора, не теряйте файл.
  • Валидация аудио — проверяйте кодек, sample rate и длительность до отправки.

Шум, музыка и наложение голосов снижают точность любого распознавания речи — на этапе загрузки можно отклонять файлы с битрейтом ниже порога или предупреждать пользователя.

Сравнение подходов: свой Whisper vs готовый API

Критерий Самостоятельный деплой модели SlovoMol API
Время до production Недели (GPU, DevOps, fine-tune) Часы (ключ + документация)
152-ФЗ и локализация На вашей ответственности Локальная обработка из коробки
Ручная расшифровка Отдельный процесс 75 ₽/мин через тот же API/кабинет
Форматы экспорта Пишете сами TXT, SRT, DOCX, PDF
Масштабирование Покупка и обслуживание GPU Оплата за минуты (от 2 ₽/мин AI-расшифровка)

Для MVP и корпоративных интеграций готовый API обычно выгоднее: вы фокусируетесь на продукте, а не на инфраструктуре распознавания.

Безопасность API-ключей

Никогда не встраивайте секретный ключ во frontend или мобильное приложение — его извлекут из bundle за минуты. Правильная схема: клиент → ваш backend → SlovoMol API. Ротируйте ключи при утечке, ограничивайте IP whitelist там, где провайдер это поддерживает, и храните ключи в secrets manager, а не в репозитории.

FAQ

Чем Speech-to-Text API отличается от загрузки через сайт?

API автоматизирует процесс: ваш сервер отправляет файлы программно, получает результат по webhook или polling. Веб-интерфейс удобен для разовых задач, API — для продуктов и интеграций.

Где посмотреть документацию SlovoMol API?

На странице slovomol.com/api-docs/. Там описаны endpoints, аутентификация и форматы ответа.

Сколько стоит расшифровка через API?

AI-расшифровка — от 2 ₽/мин, первые 10 минут бесплатны. Ручная расшифровка с вычиткой — 75 ₽/мин. Точная сумма зависит от длительности файла и выбранного режима; прайс — на странице тарифов.

Поддерживает ли API диаризацию и таймкоды?

Да, результат можно получить с разметкой спикеров и временными метками — в JSON или в виде SRT для субтитров. Как дальше работать с таймкодами и форматом SRT — в статье «Таймкоды в расшифровке и работа с SRT».

Безопасно ли передавать корпоративные записи через API?

SlovoMol выполняет распознавание на локальном оборудовании в соответствии с требованиями 152-ФЗ, без передачи аудио в сторонние облачные сервисы распознавания. Для B2B запросите документы для отдела контроля соответствия.

Какие форматы можно скачать после обработки?

TXT, SRT, DOCX и PDF — удобно для архива, монтажа и публикации на сайте.

Готовы встроить распознавание речи в свой продукт? Изучите документацию SlovoMol API, протестируйте на 10 бесплатных минутах AI-расшифровки или управляйте заказами через личный кабинет.

← К блогу