Whisper: как распознать речь с помощью ИИ
Коротко. Whisper — модель распознавания речи от OpenAI, выложенная в открытый доступ. Она превращает аудио в текст примерно на сотне языков, включая русский, и работает как на сервере, так и на обычном ноутбуке. Главное, что стоит понимать до запуска: версий у неё несколько и они сильно различаются по требованиям, а сырая расшифровка — это ещё не готовый документ.
Что такое Whisper
Whisper — это ASR-модель, то есть система автоматического распознавания речи. OpenAI представила её в сентябре 2022 года и, в отличие от своих языковых моделей, отдала веса всем желающим под свободной лицензией MIT. Обучали её на сотнях тысяч часов разноязычного аудио, собранного из интернета, — отсюда главное отличие от старых движков распознавания: Whisper заметно устойчивее к шуму, акцентам и бытовой записи на телефон.
Что модель делает: переводит речь в текст, сама определяет язык записи, расставляет таймкоды по сегментам и умеет сразу переводить услышанное на английский. Чего не делает: не отличает говорящих друг от друга, не расставляет абзацы по смыслу и не приводит текст в вид, пригодный для отправки коллегам. Это работа следующего этапа.
Версии и что выбрать
Whisper существует в нескольких размерах — от крошечного до большого. Чем крупнее модель, тем выше точность и тем больше нужно памяти и времени.
| Версия | Размер | Что нужно для запуска | Когда брать |
|---|---|---|---|
| tiny | ~39 млн параметров | Любой ноутбук, запускается даже на телефоне | Черновик, поиск нужного места в записи |
| base | ~74 млн | Любой ноутбук | Короткие чистые записи одного голоса |
| small | ~244 млн | Ноутбук с запасом оперативной памяти | Рабочий минимум для русского языка |
| medium | ~769 млн | Желательна видеокарта | Интервью, лекции, созвоны |
| large | ~1,5 млрд | Видеокарта с хорошим запасом памяти | Шумные записи, термины, максимум качества |
Практический совет: на русском не стоит начинать с tiny и base — они экономят минуты, но добавляют часы вычитки. Разумная отправная точка — small, а если запись важная и шумная, сразу берите старшую версию. Существуют и ускоренные сборки старшей модели, которые дают почти то же качество заметно быстрее.
Превратите расшифровку в документ
Принесите готовый текст в чат — и получите протокол, саммари или статью. При регистрации 60 токенов, карта не нужна.
Открыть Умку →Три способа запустить
Локально на своём компьютере. Самый дешёвый вариант: модель скачивается один раз и дальше работает без интернета и без оплаты за минуты. Кроме официальной реализации есть переписанные версии, которые считают заметно быстрее и спокойно живут на процессоре без видеокарты. Исходники и веса лежат в репозитории OpenAI. Минус один — придётся разобраться с установкой.
Через API OpenAI. Разбираться не нужно, но платить придётся за каждую минуту аудио, есть ограничение на размер файла, и запрос уходит за границу — из России это упирается в оплату зарубежной картой.
Готовым сервисом. Десятки приложений для транскрибации используют Whisper внутри, просто не пишут об этом на первом экране. Вы загружаете файл и получаете текст. Удобно, но вы не управляете версией модели и отдаёте запись третьей стороне — для конфиденциальных созвонов это решающий минус.
Сравнение этих подходов с другими способами перевода записи в текст — в разборе «Как преобразовать аудио в текст с помощью ИИ».
Насколько точен русский
На чистой записи одного говорящего старшие версии Whisper дают текст, который остаётся слегка вычитать. Дальше начинаются честные оговорки.
- Наложение реплик. Когда двое говорят одновременно, модель выбирает один голос и теряет второй.
- Термины и фамилии. Узкая лексика заменяется похожими по звучанию обычными словами — это главный источник правок в деловых расшифровках.
- Тишина и шум. У Whisper есть известная особенность: на пустых участках он иногда дописывает фразы, которых в записи не было, — обрывки титров, благодарности, случайные предложения. Поэтому длинные паузы лучше вырезать заранее, а расшифровку просматривать, а не отправлять вслепую.
- Пунктуация. Знаки модель ставит, но по интонации, а не по смыслу, и в длинных предложениях ошибается.
Самый дешёвый способ поднять качество — не менять модель, а улучшить запись: микрофон ближе к говорящему, по возможности отдельная дорожка на каждого участника, тихая комната.
Что делать с расшифровкой
Whisper заканчивает работу там, где начинается ваша: на руках оказывается сплошное полотно текста без структуры. Превратить его в документ — задача языковой модели, и вот здесь Умка пригодится.
Сразу честная оговорка: чат Умки принимает изображения и документы, но не аудиофайлы. Сам файл расшифровать она не сможет — расшифровку нужно получить Whisper или сервисом на его основе. А вот дальше с текстом можно делать что угодно: собрать протокол с решениями и ответственными, выжать саммари на десять строк, разбить по темам и спикерам, вычистить слова-паразиты, сделать из интервью статью или перевести на другой язык. Обратная задача — озвучить готовый текст голосом — разобрана в статье про ИИ-озвучку.
Сколько стоит обработка
Локальный Whisper бесплатен — вы платите только временем своего компьютера. Платной остаётся обработка расшифровки, и в Умке она считается по факту, без подписки: ответ умной модели — 33 токена, быстрый ответ — 1 токен. Цена запроса видна до отправки.
Пакеты пополнения: 290 ₽ — 725 токенов, 690 ₽ — 1 811, 1 490 ₽ — 4 172, 3 900 ₽ — 11 700. Минимальный пакет — это примерно 22 ответа умной модели, то есть два десятка полноценных разборов расшифровки, или 725 быстрых ответов на мелкие правки. Токен на нём стоит 40 копеек, на максимальном — 33, а остаток не сгорает в конце месяца.
Проверить сценарий можно без оплаты: при регистрации дают 60 токенов и не просят карту, а 8 моделей из 363 работают бесплатно. Одной расшифровки созвона хватит, чтобы понять, устраивает ли вас результат.
Вывод
Whisper закрыл вопрос доступной транскрибации: открытые веса, хороший русский, запуск на своём железе без оплаты за минуты. Выбирайте версию по важности записи, не гонитесь за скоростью на длинных интервью и помните про две слабые точки — наложение голосов и выдуманные фразы на тишине. А сырую расшифровку закладывайте в языковую модель: именно там полотно текста превращается в протокол, саммари или статью.
300+ нейросетей в одном окне
Текст, картинки, видео и музыка — за рубли, без VPN и зарубежных карт, оплата по факту использования.
Попробовать бесплатно →Частые вопросы
Whisper бесплатный?
Сама модель — да: OpenAI выложила веса Whisper в открытый доступ под лицензией MIT, их можно скачать и запускать у себя без ограничений и без оплаты. Деньги берут только за чужие мощности: за обращение к API OpenAI или за сторонний сервис, внутри которого крутится тот же Whisper.
Насколько хорошо Whisper понимает русский?
Русский входит в число языков, на которых модель показывает хорошие результаты. На чистой записи одного говорящего старшие версии дают текст, который остаётся только слегка вычитать. Точность падает на шуме, при наложении реплик, на сильном акценте и на узких терминах и фамилиях — их модель заменяет похожими по звучанию словами.
Можно ли загрузить аудиофайл в Умку?
Нет, чат Умки принимает изображения и документы, но не аудиофайлы. Расшифровку нужно получить отдельно — локальным Whisper или сервисом на его основе, — а уже готовый текст принести в Умку, чтобы собрать из него протокол, саммари, статью или перевод.
Умеет ли Whisper различать говорящих?
Из коробки нет. Whisper переводит речь в текст и расставляет таймкоды по сегментам, но не помечает, кто именно говорит. Разделение по голосам делают отдельными инструментами поверх Whisper, а в простом случае — вручную по расшифровке или с помощью языковой модели, если реплики различимы по смыслу.