Форматы аудио и качество распознавания — тема, которую игнорируют до первой «кашей» расшифровки: загрузили MP3 64 kbps с телефонной записи и удивились, что STT путает «пятнадцать» и «пятьдесят». Модель распознавания важна, но входной сигнал определяет потолок точности. WAV, FLAC, MP3, AAC, OGG — каждый формат несёт компромисс между размером файла и сохранностью речевых частот. Разберём, как битрейт, частота дискретизации и кодек влияют на WER, что загружать в SlovoMol для лучшего AI Instant от 2 ₽/мин и когда улучшение записи выгоднее Human edit 75 ₽/мин.
Что слышит модель: от микрофона до байтов
Цепочка сигнала:
- Акустическая волна → микрофон → АЦП (analog-to-digital).
- Частота дискретизации (sample rate) — сколько раз в секунду измеряется амплитуда.
- Битовая глубина (bit depth) — точность каждого измерения.
- Кодек — сжатие (lossless или lossy).
- Битрейт — сколько kbps уходит на секунду аудио после сжатия.
STT-модели обучены преимущественно на 16 kHz mono PCM — телефония и подкасты. Загрузка «как есть» из профессионального рекордера 48 kHz stereo безопасна: сервис даунsample’ит. Опасно обратное — upsampling плохого MP3 не вернёт потерянные частоты.
WAV и FLAC: максимум для распознавания
WAV (PCM) — несжатый формат, стандарт forensics и студий. Плюсы для STT:
- нет артефактов lossy-кодека;
- предсказуемое качество при повторной обработке;
- совместимость со всеми STT-сервисами.
FLAC — сжатие без потерь: файл в 2 раза меньше WAV, звук идентичен после декодирования. Для загрузки в кабинет SlovoMol FLAC и WAV эквивалентны по качеству распознавания — выбирайте FLAC, если лимит размера файла или канал upload медленный.
Минусы: объём. Час mono 16 kHz 16-bit ≈ 115 MB WAV. Для длинных записей учитывайте время upload; API (документация) может быть удобнее для bulk.
MP3 и AAC: где проходит граница приемлемости
Lossy-кодеки отбрасывают частоты, считающиеся «не слышимыми». Речь концентрируется в 300 Hz–4 kHz, но согласные и фрикативные («с», «ш», «ф») страдают при агрессивном сжатии — STT путает похожие слова.
| Битрейт MP3 (speech mono) | Ожидаемое качество STT | Типичный источник |
|---|---|---|
| 320 kbps | Близко к WAV для чистой речи | Студийный экспорт подкаста |
| 128 kbps | Хорошо для 1–2 спикеров | Стандарт подкаст-платформ |
| 64 kbps | Заметные ошибки на согласных | Голосовые WhatsApp, старые диктофоны |
| 32 kbps и ниже | Плохо — «каша», галлюцинации | Телефония без HD-голоса |
AAC (M4A в iPhone Voice Memos) при том же kbps часто чуть лучше MP3 — Apple по умолчанию пишет AAC. Для SlovoMol загрузка M4A с iPhone обычно даёт рабочий результат; для критичных материалов экспортируйте lossless из приложения диктофона, если поддерживается.
Частота дискретизации: 8, 16, 44.1, 48 kHz
| Sample rate | Контекст | STT |
|---|---|---|
| 8 kHz | Телефония G.711 | Достаточно для звонков; WER выше студии |
| 16 kHz | Стандарт большинства STT | Оптимальный target |
| 44.1 / 48 kHz | Рекордеры, видео | Избыточно, но не вредно — downsample автоматически |
Не конвертируйте 8 kHz → 48 kHz «для качества» — интерполяция не добавит информации. Лучше улучшить источник: HD-голос VoIP, запись с микрофона, а не с динамика телефона.
Stereo vs mono, битовая глубина
Mono — один канал, типично для речи. Stereo с двумя спикерами по каналам (интервью L/R) — идеал для разделения голосов: STT может распознать спикеров без отдельной модели разделения спикеров.
16-bit vs 24-bit — для речи 16-bit достаточно; 24-bit важен для музыкального продакшена, не для STT. Перегруз (clipping) при записи на 16-bit необратима — следите за уровнем на рекордере.
Как формат влияет на стоимость расшифровки
SlovoMol тарифицирует минуты аудио, не мегабайты: AI Instant от 2 ₽/мин, Human edit 75 ₽/мин. WAV 500 MB и MP3 30 MB одной записи стоят одинаково по времени. Экономия на MP3 — в upload, не в цене минуты.
Экономическая логика:
- если MP3 128 kbps даёт приемлемый WER — не тратьте время на конвертацию;
- если MP3 64 kbps «сыпется» — перезапись или Human edit дешевле бесконечных переделок промптов;
- 10 бесплатных минут AI Instant — A/B тест: один фрагмент в MP3 и тот же в WAV.
Практика загрузки в кабинет SlovoMol
- Проверьте свойства файла — ПКМ → свойства / ffprobe / MediaInfo: codec, kbps, Hz, channels.
- Не перекодируйте без нужды — лишний lossy generation (MP3→MP3) ухудшает звук.
- Обрежьте тишину — меньше минут к оплате (Audacity, ffmpeg).
- Нормализация — выровнять громкость −3 dB peak; тихая запись ≠ лучше для STT.
- Выберите экспорт — TXT для анализа, SRT для субтитров, DOCX/PDF для отчёта.
Видео (MP4, MKV) — сервис извлекает аудиодорожку; качество STT = качество аудио внутри контейнера, не разрешение видео 4K.
Типичные источники и рекомендации
| Источник | Обычный формат | Рекомендация |
|---|---|---|
| Zoom / Teams запись | M4A/AAC или MP4 | Загружать как есть; включите «отдельная запись на спикера» если доступно |
| Диктофон Olympus | MP3 128 kbps | Переключите на WAV в настройках |
| iPhone Voice Memos | M4A AAC | Достаточно для заметок; для интервью — внешний мик |
| Telegram голосовые | OGG Opus ~48 kbps | Рабочий черновик; не для цитат |
| АТС / CRM звонок | MP3 8 kHz mono | Норма для аналитики; Human edit для споров |
| Подкаст RSS | MP3 128–192 kbps | Обычно отлично для AI Instant |
152-ФЗ и хранение исходников
Формат файла не влияет на compliance, но lossy-архивы с ПДн всё равно персональные данные. Загрузка в SlovoMol — обработка на локальной инфраструктуре без передачи аудио сторонним облачным STT. После экспорта TXT/DOCX удалите исходник из сервиса, если политика компании требует минимизации — формат экспорта для архива выбирайте DOCX/PDF с шифрованием на вашей стороне.
Когда улучшать запись, а когда заказывать Human edit
- Перекодировать MP3 32 kbps в WAV — бесполезно. Нужна повторная запись или Human edit.
- Записать в FLAC с петлички — лучшее вложение в качество STT.
- Шум улицы — формат не спасёт; denoise (осторожно) или Human edit.
- Термины и имена — формат идеален, но модель ошибается → Human edit 75 ₽/мин.
Часто задаваемые вопросы
Какой формат лучше загрузить в SlovoMol?
FLAC или WAV — максимум качества; MP3 128 kbps и выше — практичный компромисс. Главное — качество исходной записи, не контейнер.
Есть ли лимит размера файла?
Уточняйте актуальные лимиты в кабинете. Для очень длинных lossless-файлов используйте FLAC или API для стабильной загрузки.
Конвертация через онлайн-конвертер безопасна для 152-ФЗ?
Сторонний «free online converter» часто грузит файл на серверы за рубежом — риск для ПДн. Конвертируйте локально (ffmpeg, Audacity) или загружайте оригинал в SlovoMol.
Влияет ли формат на скорость AI Instant?
Незначительно; декодирование FLAC быстро. Основное время — модель STT, не парсинг заголовка файла.
OGG Opus из Telegram распознаётся?
Да, как рабочий черновик. Для публикации цитат — запишите в лучшем качестве или закажите Human edit.
Итог: формат — не магия, но фундамент
Форматы аудио и качество распознавания связаны напрямую: WAV/FLAC сохраняют детали речи, MP3/AAC при низком битрейте экономят место ценой WER. Перед оплатой полного файла протестируйте фрагмент в кабинете SlovoMol — 10 бесплатных минут AI Instant от 2 ₽/мин покажут, хватит ли вашего MP3 или пора инвестировать в запись заново. Экспорт TXT/SRT/DOCX/PDF и Human edit 75 ₽/мин закрывают оставшийся зазор, когда технически идеальный WAV всё равно содержит сложные имена и шумную улицу.