← Блог Новости

Gemini 3.8 Flash TTS: Google выпустил озвучку с 2000 голосов

· · 5 минут чтения
Звуковая волна выходит из речевого облачка и распадается на множество голосов

Коротко. 23 сентября 2026 года Google представил две новые модели озвучки — Gemini 3.8 Flash TTS и Gemini 3.8 Flash-Lite TTS — и назвал их самыми выразительными моделями генерации звука в своей линейке. Главное изменение не в качестве звука, а в подходе: голос теперь не выбирают из списка, а описывают словами. Библиотека при этом выросла с тридцати голосов до двух с лишним тысяч и покрывает больше ста языков и диалектов.

Что именно выпустили

Моделей две, и они делят работу по цене. Полная Flash TTS сделана под то, что Google называет «глубокой творческой режиссурой»: проработка персонажа, тонкая настройка подачи, длинные сцены. Более дешёвая Flash-Lite TTS рассчитана на поток — дубляж, голосовые ассистенты, озвучка больших объёмов текста, где важнее цена за минуту, чем актёрская игра.

Оба варианта раскатали сразу: они доступны в Google AI Studio и через Gemini API, а также появились в Gemini Notebook и Google Vids. Корпоративный доступ через Gemini Enterprise API обещан позже.

Голос по описанию вместо списка

Раньше работа с озвучкой выглядела так: открываете выпадающий список, слушаете десяток предустановленных голосов и выбираете наименее неподходящий. Gemini 3.8 разворачивает эту логику. Вы описываете текстом, кто говорит: роль, акцент, характер звучания, темп. Полученный голос сохраняется и потом используется повторно — то есть у проекта может быть свой постоянный диктор, которого нет ни у кого другого.

Отдельно расширили готовую библиотеку: тридцать исходных голосов превратились в 2000+ вариантов. Причём набор специально сделали регионально разнообразным — мексиканский испанский, квебекский французский, шотландский английский. Всего заявлено больше ста языков и диалектов.

ВозможностьFlash TTSFlash-Lite TTS
Основной сценарийперсонажи, игры, аудиокниги, подкастыдубляж, голосовые агенты, большие объёмы
Голос по описаниюда, с тонкой режиссурой подачида
Приоритетвыразительностьцена и скорость

Копия голоса — с проверкой согласия

Самая обсуждаемая функция: модель воссоздаёт голос по записи примерно в тридцать секунд. Но Google выстроил вокруг этого процедуру. Нужна отдельная запись, где владелец голоса вслух даёт согласие, и система сверяет, что этот голос совпадает с образцом, — только после этого голос создаётся. На готовый звук наносится водяной знак SynthID.

И ограничение, о котором стоит знать заранее: копирование голоса недоступно в ЕЭЗ, Великобритании, Швейцарии, Индии, а также в штатах Иллинойс и Техас. Причина юридическая — в этих юрисдикциях действуют строгие нормы о биометрии и голосовых данных.

По качеству Google ссылается на внешние замеры: обе модели заняли первое место в Voice Design Benchmark и Voice Quality Index от Hume AI и вышли в верх таблицы Voice Arena сразу по нескольким языкам. Это независимые рейтинги, но формулировка «первое место» в аудио всегда чуть условна: оценка выразительности субъективнее, чем оценка решения математической задачи.

Как озвучить текст из России

Честно: самой Gemini 3.8 TTS в Умке нет — на момент выхода статьи она работает только через Google AI Studio и Gemini API, а это зарубежная карта для оплаты и, как правило, VPN для доступа. Про то, как устроен доступ к остальной линейке, мы разбирали отдельно: что умеет Gemini 3.8 Flash.

Если задача практическая — получить звуковой файл с прочитанным текстом, — в Умке для этого есть свой инструмент «Озвучка текста». Он читает текст готовым мужским или женским голосом, скорость настраивается, на выходе файл, который можно скачать и подставить в видео. Списание идёт за тысячу знаков, точная сумма показывается до запуска. Подробный разбор сценариев — в материале ИИ-озвучка текста, а если нужно не прочитать текст, а переделать уже записанный голос, смотрите как изменить голос нейросетью.

Озвучить текст без VPN и зарубежной карты

Готовые голоса, настройка скорости, файл на выходе. Оплата рублями, подписки нет. При регистрации 60 токенов.

Открыть Умку →

Сколько стоит в Умке

Озвучка считается по объёму текста, а не по токенам за ответ, поэтому цену удобнее смотреть перед запуском. Для ориентира — как устроена сетка вообще: стартовый пакет стоит 290 ₽ и даёт 725 токенов, то есть токен выходит в 40 копеек. Ответ быстрой модели — 1 токен, ответ умной — 33 токена (около 13 рублей), генерация картинки — 35 токенов (примерно 14 рублей). На стартовый пакет приходится около 21 ответа умной модели или порядка 20 картинок.

Крупные пакеты дешевле в пересчёте на токен: 690 ₽ за 1 811 токенов, 1 490 ₽ за 4 172 и 3 900 ₽ за 11 700. Подписки нет, остаток не сгорает, списывается только за конкретный запрос. Всего в сервисе 367 моделей, из них 8 работают бесплатно — на них удобно прогонять черновики, прежде чем тратить баланс.

Коротко

Gemini 3.8 Flash TTS — заметный шаг не столько в качестве синтеза речи, сколько в управляемости: голос стал таким же объектом промпта, как картинка. Две тысячи готовых вариантов и сотня языков закрывают почти любой бытовой сценарий, а клонирование по тридцати секундам Google предусмотрительно обвязал проверкой согласия и водяным знаком — иначе функция превратилась бы в инструмент для подделок. Из России модель напрямую недоступна; если нужен просто озвученный файл на русском, задача решается инструментом озвучки в Умке за рубли и без VPN.

Источники: анонс в блоге Google, AI News.

300+ нейросетей в одном окне

Текст, картинки, видео и озвучка в одном чате. За рубли, без подписки и зарубежных карт.

Попробовать бесплатно →

Частые вопросы

Что такое Gemini 3.8 Flash TTS?

Это модель Google для озвучки текста, представленная 23 сентября 2026 года вместе с более дешёвой версией Flash-Lite TTS. Обе читают текст голосом и поддерживают больше ста языков и диалектов. Главное отличие от прежних версий — голос можно не выбирать из списка, а описать словами: роль, акцент, темп, характер звучания.

Сколько голосов в Gemini 3.8 TTS?

Библиотека выросла с 30 исходных голосов до более чем 2000 готовых вариантов, включая региональные версии вроде мексиканского испанского, квебекского французского и шотландского английского. Плюс любой голос можно сконструировать текстовым описанием и сохранить для повторного использования.

Можно ли клонировать голос в Gemini 3.8 TTS?

Да, модель воссоздаёт голос по записи длиной около 30 секунд, но Google требует отдельную запись голосового согласия и сверяет её с образцом перед созданием голоса. На готовый звук наносится водяной знак SynthID. В ряде юрисдикций — в том числе в ЕЭЗ, Великобритании, Швейцарии, Индии, штатах Иллинойс и Техас — функция копирования голоса недоступна.

Доступна ли Gemini 3.8 TTS в Умке?

Нет, на момент выхода статьи эта модель работает только через Google AI Studio и Gemini API. В Умке есть собственный инструмент «Озвучка текста» — он читает текст готовым мужским или женским голосом с настройкой скорости и отдаёт звуковой файл, оплата списывается за тысячу знаков и точная сумма видна перед запуском.