← Блог Инструкция

Как преобразовать аудио в текст с помощью ИИ

· · 6 минут чтения
Аудио в текст: звуковая волна от микрофона превращается в строки документа на ноутбуке

Коротко. Чтобы преобразовать аудио в текст, нужны два шага: распознавание речи и обработка расшифровки. Первый делает модель распознавания вроде Whisper, второй — языковая модель, которая убирает мусор, делит текст по спикерам и собирает конспект. Разбираем, чем сделать транскрибацию аудио в текст, от чего зависит точность и как превратить сырую расшифровку в полезный документ.

Как работает транскрибация аудио в текст

Модель распознавания слушает запись короткими отрезками и подбирает наиболее вероятные слова. Современные модели обучены на сотнях тысяч часов речи, поэтому сами расставляют знаки препинания и неплохо справляются с русским языком.

Но у распознавания есть предел. Оно записывает то, что услышало, а не то, что человек имел в виду. В расшифровке остаются «ну», «вот», оборванные фразы, повторы и ошибки в редких словах. Разметку «кто говорит» большинство распознавателей сами не делают: для этого нужен отдельный алгоритм диаризации. Поэтому хорошая расшифровка — почти всегда связка «распознаватель плюс языковая модель».

Чем расшифровать аудио: сравнение способов

СпособДля чегоПлюсыМинусы
Whisper на своём компьютереДлинные записи, конфиденциальные встречиБесплатно, файл никуда не уходитНужен мощный ПК и время на настройку
Онлайн-сервисы транскрибацииИнтервью, лекции, подкастыЗагрузил файл — получил текст, часто со спикерамиБесплатно только несколько минут, дальше подписка
Расшифровка голосовых в мессенджереКороткие голосовые сообщенияВ один клик прямо в чатеТолько для сообщений, часто за платную подписку
Диктовка в УмкеНадиктовать мысль или задачу до двух минутИз России без VPN, текст сразу уходит любой моделиФайлы с аудио не принимает — только запись с микрофона
Языковая модель в УмкеОбработка готовой расшифровкиКонспект, протокол, перевод, чистка текстаСама запись должна быть уже в текстовом виде

Если нужно расшифровать часовую встречу, начните с Whisper или специализированного сервиса. Если хочется просто говорить вместо того чтобы печатать, хватит диктовки — о ней подробно в статье «Голосовой чат с ИИ онлайн».

Пошагово: расшифровка аудио в текст

  1. Подготовьте файл. Подходят MP3, M4A, WAV, OGG. Видео конвертировать не обязательно — большинство инструментов вытаскивают звук сами. Очень длинную запись удобнее резать на части по 20–30 минут.
  2. Распознайте речь. Открытая модель Whisper работает локально; для русского выбирайте версии large или turbo — маленькие модели заметно чаще ошибаются.
  3. Задайте язык явно. Автоопределение на смешанной речи иногда переключается на английский и «переводит» фразы вместо записи.
  4. Отдайте текст языковой модели. Вставьте расшифровку в чат или приложите файлом .txt или .docx и опишите, какой документ нужен на выходе.
  5. Сверьте спорные места с записью. Цифры, фамилии, названия компаний и термины проверяйте на слух — именно здесь ошибки опаснее всего.

Превратите расшифровку в документ

Приложите текст записи — модель соберёт конспект, протокол или перевод. Из России, без VPN и подписки.

Открыть Умку →

Как повысить точность распознавания

  • Записывайте ближе к источнику. Телефон в центре стола на совещании слышит всех одинаково плохо. Петличка или отдельный микрофон у каждого спикера дают кратный выигрыш.
  • Убирайте фоновую музыку. Шум кондиционера распознаватель переносит легко, а музыку со словами — нет.
  • Дайте словарь. Whisper принимает начальную подсказку: перечислите в ней имена участников и термины, и они будут распознаваться точнее.
  • Не сжимайте звук сильнее нужного. Голосовое сообщение, трижды пересланное через разные мессенджеры, теряет согласные.
  • Перебивания разводите по времени. Когда говорят одновременно двое, любая модель склеивает их фразы.

Что делать с текстом после расшифровки

Сырая расшифровка часового разговора — это восемь-девять тысяч слов, которые никто не будет читать. Её ценность раскрывается после обработки. Промпты, которые хорошо работают:

  • «Это расшифровка совещания. Убери слова-паразиты и повторы, разбей на абзацы, смысл и формулировки участников не меняй».
  • «Раздели текст по репликам. Участники: Анна — менеджер, Олег — разработчик. Если не уверен, чья реплика, пометь [?]».
  • «Составь протокол встречи: принятые решения, задачи с ответственными и сроками, открытые вопросы. Ничего не добавляй от себя».
  • «Сделай конспект лекции для подготовки к экзамену: ключевые определения, формулы, примеры, пять вопросов для самопроверки».

Главное правило — запрещайте модели додумывать. Фраза «ничего не добавляй от себя» заметно снижает число выдуманных деталей. Длинные расшифровки лучше обрабатывать по частям: так модель не пропускает середину.

Субтитры, таймкоды и приватность

Если расшифровка нужна для субтитров или чтобы быстро находить место в записи, сохраняйте результат распознавания в формате SRT или VTT — Whisper и большинство сервисов умеют выдавать текст с метками времени. Языковая модель может аккуратно отредактировать такие субтитры, но придумать таймкоды, которых нет в исходнике, она не способна: попросите её сохранять метки без изменений.

С записями, где звучат персональные данные, — медицинские консультации, собеседования, внутренние совещания — осторожнее. Их надёжнее распознавать локально, а в облачную модель отправлять уже обезличенный текст с заменой имён на условные.

Перевод аудио в текст на другом языке

Под запросом «перевод аудио в текст» часто имеют в виду иностранную запись, которую нужно прочитать по-русски. Надёжнее делать это в два этапа: сначала расшифровать речь на языке оригинала, затем перевести текст языковой моделью. Так вы сможете проверить спорное место по оригиналу, а перевод получится литературным, а не подстрочным. Как выбрать модель под перевод, мы разбирали в статье «Переводчик ИИ». Обратная задача — превратить текст в речь — описана в материале «ИИ-озвучка».

Сколько стоит обработать расшифровку в Умке

Подписки нет, списание идёт за каждый запрос. Распознавание диктовки стоит как короткий запрос. По фактическим списаниям за последние три месяца ответ быстрой модели обходится примерно в 1 токен, подробный ответ умной модели — около 33 токенов; длинная расшифровка на входе стоит дороже, итог виден в истории списаний. Бесплатных моделей в каталоге 8. Минимальный пакет — 290 ₽ за 725 токенов: это около 21 ответа умной модели, примерно 13 ₽ за ответ. После регистрации начисляется бесплатный баланс без карты, остаток токенов не сгорает.

Частые вопросы

Как перевести аудио в текст бесплатно?

Бесплатно и без ограничений по длине — открытой моделью Whisper на своём компьютере. Онлайн-сервисы транскрибации обычно дают бесплатно несколько минут в день. Для обработки готовой расшифровки в Умке есть 8 бесплатных моделей и стартовый баланс после регистрации.

Можно ли загрузить аудиофайл в Умку?

Нет, чат Умки принимает изображения и документы, но не аудиофайлы. Голосом можно надиктовать запрос длиной до двух минут. Для записей встреч и лекций сначала получите текст в сервисе транскрибации, затем приложите его в чат для обработки.

Может ли нейросеть разделить расшифровку по спикерам?

Сам распознаватель обычно этого не делает, нужна отдельная диаризация. Языковая модель может разметить реплики по смыслу, если назвать участников и их роли, но спорные места стоит проверить по записи.

Насколько точна транскрибация аудио в текст?

На чистой записи одного спикера крупные модели распознавания ошибаются редко. Точность падает из-за шума, музыки, перебиваний, сильного сжатия и редких терминов. Цифры, имена и названия всегда сверяйте с записью.

Из записи — в готовый протокол

Сотни моделей в одном окне: чистка, конспект и перевод расшифровок. Оплата рублями, без VPN.

Открыть Умку →