Блог

Форматы аудио и качество распознавания речи: WAV, FLAC, MP3

Форматы аудио и качество распознавания — тема, которую игнорируют до первой «кашей» расшифровки: загрузили MP3 64 kbps с телефонной записи и удивились, что STT путает «пятнадцать» и «пятьдесят». Модель распознавания важна, но входной сигнал определяет потолок точности. WAV, FLAC, MP3, AAC, OGG — каждый формат несёт компромисс между размером файла и сохранностью речевых частот. Разберём, как битрейт, частота дискретизации и кодек влияют на WER, что загружать в SlovoMol для лучшего AI Instant от 2 ₽/мин и когда улучшение записи выгоднее Human edit 75 ₽/мин.

Что слышит модель: от микрофона до байтов

Цепочка сигнала:

  1. Акустическая волна → микрофон → АЦП (analog-to-digital).
  2. Частота дискретизации (sample rate) — сколько раз в секунду измеряется амплитуда.
  3. Битовая глубина (bit depth) — точность каждого измерения.
  4. Кодек — сжатие (lossless или lossy).
  5. Битрейт — сколько kbps уходит на секунду аудио после сжатия.

STT-модели обучены преимущественно на 16 kHz mono PCM — телефония и подкасты. Загрузка «как есть» из профессионального рекордера 48 kHz stereo безопасна: сервис даунsample’ит. Опасно обратное — upsampling плохого MP3 не вернёт потерянные частоты.

WAV и FLAC: максимум для распознавания

WAV (PCM) — несжатый формат, стандарт forensics и студий. Плюсы для STT:

  • нет артефактов lossy-кодека;
  • предсказуемое качество при повторной обработке;
  • совместимость со всеми STT-сервисами.

FLAC — сжатие без потерь: файл в 2 раза меньше WAV, звук идентичен после декодирования. Для загрузки в кабинет SlovoMol FLAC и WAV эквивалентны по качеству распознавания — выбирайте FLAC, если лимит размера файла или канал upload медленный.

Минусы: объём. Час mono 16 kHz 16-bit ≈ 115 MB WAV. Для длинных записей учитывайте время upload; API (документация) может быть удобнее для bulk.

MP3 и AAC: где проходит граница приемлемости

Lossy-кодеки отбрасывают частоты, считающиеся «не слышимыми». Речь концентрируется в 300 Hz–4 kHz, но согласные и фрикативные («с», «ш», «ф») страдают при агрессивном сжатии — STT путает похожие слова.

Битрейт MP3 (speech mono) Ожидаемое качество STT Типичный источник
320 kbps Близко к WAV для чистой речи Студийный экспорт подкаста
128 kbps Хорошо для 1–2 спикеров Стандарт подкаст-платформ
64 kbps Заметные ошибки на согласных Голосовые WhatsApp, старые диктофоны
32 kbps и ниже Плохо — «каша», галлюцинации Телефония без HD-голоса

AAC (M4A в iPhone Voice Memos) при том же kbps часто чуть лучше MP3 — Apple по умолчанию пишет AAC. Для SlovoMol загрузка M4A с iPhone обычно даёт рабочий результат; для критичных материалов экспортируйте lossless из приложения диктофона, если поддерживается.

Частота дискретизации: 8, 16, 44.1, 48 kHz

Sample rate Контекст STT
8 kHz Телефония G.711 Достаточно для звонков; WER выше студии
16 kHz Стандарт большинства STT Оптимальный target
44.1 / 48 kHz Рекордеры, видео Избыточно, но не вредно — downsample автоматически

Не конвертируйте 8 kHz → 48 kHz «для качества» — интерполяция не добавит информации. Лучше улучшить источник: HD-голос VoIP, запись с микрофона, а не с динамика телефона.

Stereo vs mono, битовая глубина

Mono — один канал, типично для речи. Stereo с двумя спикерами по каналам (интервью L/R) — идеал для разделения голосов: STT может распознать спикеров без отдельной модели разделения спикеров.

16-bit vs 24-bit — для речи 16-bit достаточно; 24-bit важен для музыкального продакшена, не для STT. Перегруз (clipping) при записи на 16-bit необратима — следите за уровнем на рекордере.

Как формат влияет на стоимость расшифровки

SlovoMol тарифицирует минуты аудио, не мегабайты: AI Instant от 2 ₽/мин, Human edit 75 ₽/мин. WAV 500 MB и MP3 30 MB одной записи стоят одинаково по времени. Экономия на MP3 — в upload, не в цене минуты.

Экономическая логика:

  • если MP3 128 kbps даёт приемлемый WER — не тратьте время на конвертацию;
  • если MP3 64 kbps «сыпется» — перезапись или Human edit дешевле бесконечных переделок промптов;
  • 10 бесплатных минут AI Instant — A/B тест: один фрагмент в MP3 и тот же в WAV.

Практика загрузки в кабинет SlovoMol

  1. Проверьте свойства файла — ПКМ → свойства / ffprobe / MediaInfo: codec, kbps, Hz, channels.
  2. Не перекодируйте без нужды — лишний lossy generation (MP3→MP3) ухудшает звук.
  3. Обрежьте тишину — меньше минут к оплате (Audacity, ffmpeg).
  4. Нормализация — выровнять громкость −3 dB peak; тихая запись ≠ лучше для STT.
  5. Выберите экспорт — TXT для анализа, SRT для субтитров, DOCX/PDF для отчёта.

Видео (MP4, MKV) — сервис извлекает аудиодорожку; качество STT = качество аудио внутри контейнера, не разрешение видео 4K.

Типичные источники и рекомендации

Источник Обычный формат Рекомендация
Zoom / Teams запись M4A/AAC или MP4 Загружать как есть; включите «отдельная запись на спикера» если доступно
Диктофон Olympus MP3 128 kbps Переключите на WAV в настройках
iPhone Voice Memos M4A AAC Достаточно для заметок; для интервью — внешний мик
Telegram голосовые OGG Opus ~48 kbps Рабочий черновик; не для цитат
АТС / CRM звонок MP3 8 kHz mono Норма для аналитики; Human edit для споров
Подкаст RSS MP3 128–192 kbps Обычно отлично для AI Instant

152-ФЗ и хранение исходников

Формат файла не влияет на compliance, но lossy-архивы с ПДн всё равно персональные данные. Загрузка в SlovoMol — обработка на локальной инфраструктуре без передачи аудио сторонним облачным STT. После экспорта TXT/DOCX удалите исходник из сервиса, если политика компании требует минимизации — формат экспорта для архива выбирайте DOCX/PDF с шифрованием на вашей стороне.

Когда улучшать запись, а когда заказывать Human edit

  • Перекодировать MP3 32 kbps в WAV — бесполезно. Нужна повторная запись или Human edit.
  • Записать в FLAC с петлички — лучшее вложение в качество STT.
  • Шум улицы — формат не спасёт; denoise (осторожно) или Human edit.
  • Термины и имена — формат идеален, но модель ошибается → Human edit 75 ₽/мин.

Часто задаваемые вопросы

Какой формат лучше загрузить в SlovoMol?

FLAC или WAV — максимум качества; MP3 128 kbps и выше — практичный компромисс. Главное — качество исходной записи, не контейнер.

Есть ли лимит размера файла?

Уточняйте актуальные лимиты в кабинете. Для очень длинных lossless-файлов используйте FLAC или API для стабильной загрузки.

Конвертация через онлайн-конвертер безопасна для 152-ФЗ?

Сторонний «free online converter» часто грузит файл на серверы за рубежом — риск для ПДн. Конвертируйте локально (ffmpeg, Audacity) или загружайте оригинал в SlovoMol.

Влияет ли формат на скорость AI Instant?

Незначительно; декодирование FLAC быстро. Основное время — модель STT, не парсинг заголовка файла.

OGG Opus из Telegram распознаётся?

Да, как рабочий черновик. Для публикации цитат — запишите в лучшем качестве или закажите Human edit.

Итог: формат — не магия, но фундамент

Форматы аудио и качество распознавания связаны напрямую: WAV/FLAC сохраняют детали речи, MP3/AAC при низком битрейте экономят место ценой WER. Перед оплатой полного файла протестируйте фрагмент в кабинете SlovoMol — 10 бесплатных минут AI Instant от 2 ₽/мин покажут, хватит ли вашего MP3 или пора инвестировать в запись заново. Экспорт TXT/SRT/DOCX/PDF и Human edit 75 ₽/мин закрывают оставшийся зазор, когда технически идеальный WAV всё равно содержит сложные имена и шумную улицу.

← К блогу