Gemini 3.8 Flash TTS: Google выпустил озвучку с 2000 голосов
Коротко. 23 сентября 2026 года Google представил две новые модели озвучки — Gemini 3.8 Flash TTS и Gemini 3.8 Flash-Lite TTS — и назвал их самыми выразительными моделями генерации звука в своей линейке. Главное изменение не в качестве звука, а в подходе: голос теперь не выбирают из списка, а описывают словами. Библиотека при этом выросла с тридцати голосов до двух с лишним тысяч и покрывает больше ста языков и диалектов.
Что именно выпустили
Моделей две, и они делят работу по цене. Полная Flash TTS сделана под то, что Google называет «глубокой творческой режиссурой»: проработка персонажа, тонкая настройка подачи, длинные сцены. Более дешёвая Flash-Lite TTS рассчитана на поток — дубляж, голосовые ассистенты, озвучка больших объёмов текста, где важнее цена за минуту, чем актёрская игра.
Оба варианта раскатали сразу: они доступны в Google AI Studio и через Gemini API, а также появились в Gemini Notebook и Google Vids. Корпоративный доступ через Gemini Enterprise API обещан позже.
Голос по описанию вместо списка
Раньше работа с озвучкой выглядела так: открываете выпадающий список, слушаете десяток предустановленных голосов и выбираете наименее неподходящий. Gemini 3.8 разворачивает эту логику. Вы описываете текстом, кто говорит: роль, акцент, характер звучания, темп. Полученный голос сохраняется и потом используется повторно — то есть у проекта может быть свой постоянный диктор, которого нет ни у кого другого.
Отдельно расширили готовую библиотеку: тридцать исходных голосов превратились в 2000+ вариантов. Причём набор специально сделали регионально разнообразным — мексиканский испанский, квебекский французский, шотландский английский. Всего заявлено больше ста языков и диалектов.
| Возможность | Flash TTS | Flash-Lite TTS |
|---|---|---|
| Основной сценарий | персонажи, игры, аудиокниги, подкасты | дубляж, голосовые агенты, большие объёмы |
| Голос по описанию | да, с тонкой режиссурой подачи | да |
| Приоритет | выразительность | цена и скорость |
Копия голоса — с проверкой согласия
Самая обсуждаемая функция: модель воссоздаёт голос по записи примерно в тридцать секунд. Но Google выстроил вокруг этого процедуру. Нужна отдельная запись, где владелец голоса вслух даёт согласие, и система сверяет, что этот голос совпадает с образцом, — только после этого голос создаётся. На готовый звук наносится водяной знак SynthID.
И ограничение, о котором стоит знать заранее: копирование голоса недоступно в ЕЭЗ, Великобритании, Швейцарии, Индии, а также в штатах Иллинойс и Техас. Причина юридическая — в этих юрисдикциях действуют строгие нормы о биометрии и голосовых данных.
По качеству Google ссылается на внешние замеры: обе модели заняли первое место в Voice Design Benchmark и Voice Quality Index от Hume AI и вышли в верх таблицы Voice Arena сразу по нескольким языкам. Это независимые рейтинги, но формулировка «первое место» в аудио всегда чуть условна: оценка выразительности субъективнее, чем оценка решения математической задачи.
Как озвучить текст из России
Честно: самой Gemini 3.8 TTS в Умке нет — на момент выхода статьи она работает только через Google AI Studio и Gemini API, а это зарубежная карта для оплаты и, как правило, VPN для доступа. Про то, как устроен доступ к остальной линейке, мы разбирали отдельно: что умеет Gemini 3.8 Flash.
Если задача практическая — получить звуковой файл с прочитанным текстом, — в Умке для этого есть свой инструмент «Озвучка текста». Он читает текст готовым мужским или женским голосом, скорость настраивается, на выходе файл, который можно скачать и подставить в видео. Списание идёт за тысячу знаков, точная сумма показывается до запуска. Подробный разбор сценариев — в материале ИИ-озвучка текста, а если нужно не прочитать текст, а переделать уже записанный голос, смотрите как изменить голос нейросетью.
Озвучить текст без VPN и зарубежной карты
Готовые голоса, настройка скорости, файл на выходе. Оплата рублями, подписки нет. При регистрации 60 токенов.
Открыть Умку →Сколько стоит в Умке
Озвучка считается по объёму текста, а не по токенам за ответ, поэтому цену удобнее смотреть перед запуском. Для ориентира — как устроена сетка вообще: стартовый пакет стоит 290 ₽ и даёт 725 токенов, то есть токен выходит в 40 копеек. Ответ быстрой модели — 1 токен, ответ умной — 33 токена (около 13 рублей), генерация картинки — 35 токенов (примерно 14 рублей). На стартовый пакет приходится около 21 ответа умной модели или порядка 20 картинок.
Крупные пакеты дешевле в пересчёте на токен: 690 ₽ за 1 811 токенов, 1 490 ₽ за 4 172 и 3 900 ₽ за 11 700. Подписки нет, остаток не сгорает, списывается только за конкретный запрос. Всего в сервисе 367 моделей, из них 8 работают бесплатно — на них удобно прогонять черновики, прежде чем тратить баланс.
Коротко
Gemini 3.8 Flash TTS — заметный шаг не столько в качестве синтеза речи, сколько в управляемости: голос стал таким же объектом промпта, как картинка. Две тысячи готовых вариантов и сотня языков закрывают почти любой бытовой сценарий, а клонирование по тридцати секундам Google предусмотрительно обвязал проверкой согласия и водяным знаком — иначе функция превратилась бы в инструмент для подделок. Из России модель напрямую недоступна; если нужен просто озвученный файл на русском, задача решается инструментом озвучки в Умке за рубли и без VPN.
Источники: анонс в блоге Google, AI News.
300+ нейросетей в одном окне
Текст, картинки, видео и озвучка в одном чате. За рубли, без подписки и зарубежных карт.
Попробовать бесплатно →Частые вопросы
Что такое Gemini 3.8 Flash TTS?
Это модель Google для озвучки текста, представленная 23 сентября 2026 года вместе с более дешёвой версией Flash-Lite TTS. Обе читают текст голосом и поддерживают больше ста языков и диалектов. Главное отличие от прежних версий — голос можно не выбирать из списка, а описать словами: роль, акцент, темп, характер звучания.
Сколько голосов в Gemini 3.8 TTS?
Библиотека выросла с 30 исходных голосов до более чем 2000 готовых вариантов, включая региональные версии вроде мексиканского испанского, квебекского французского и шотландского английского. Плюс любой голос можно сконструировать текстовым описанием и сохранить для повторного использования.
Можно ли клонировать голос в Gemini 3.8 TTS?
Да, модель воссоздаёт голос по записи длиной около 30 секунд, но Google требует отдельную запись голосового согласия и сверяет её с образцом перед созданием голоса. На готовый звук наносится водяной знак SynthID. В ряде юрисдикций — в том числе в ЕЭЗ, Великобритании, Швейцарии, Индии, штатах Иллинойс и Техас — функция копирования голоса недоступна.
Доступна ли Gemini 3.8 TTS в Умке?
Нет, на момент выхода статьи эта модель работает только через Google AI Studio и Gemini API. В Умке есть собственный инструмент «Озвучка текста» — он читает текст готовым мужским или женским голосом с настройкой скорости и отдаёт звуковой файл, оплата списывается за тысячу знаков и точная сумма видна перед запуском.