Gemini 3.8 Live: голосовой ИИ Google, который думает вслух
Коротко. 15 сентября 2026 года Google выпустила Gemini 3.8 Live и Gemini 3.8 Live Extended Thinking — две модели для голосового разговора в реальном времени. Они понимают 97 языков и переключаются между ними прямо посреди беседы, а в индексе качества голосовых моделей Artificial Analysis первая версия набрала 82,6 балла и вышла на первое место. Это не обновление приложения Gemini, а движок для голосовых помощников — и он уже постепенно включается в Google Search Live.
Что такое «модель звук в звук»
Привычные голосовые помощники работают в три шага: распознали речь в текст, отдали текст языковой модели, озвучили ответ. На каждом шаге теряется время и интонация — отсюда роботизированный голос и паузы.
Live-модели работают со звуком напрямую: слышат голос и сразу отвечают голосом, без промежуточного текста. Разница слышна сразу: можно перебить на полуслове, модель улавливает интонацию вопроса и отвечает в темпе живой речи. Кроме звука на вход принимаются текст, изображения и видео — можно навести камеру и спросить, что в кадре.
Что умеет Gemini 3.8 Live
- 97 языков без переключателя. Модель сама определяет, на каком языке вы заговорили, и переходит на него посреди разговора — полезно, когда в одной фразе смешаны русский и английские термины.
- Фоновые вызовы. Пока модель говорит, она может обращаться к внешним сервисам — проверить расписание, найти товар — и не обрывать разговор паузой «секундочку».
- Версия с рассуждением. Extended Thinking рассчитана на задачи в несколько шагов: не просто ответить, а разобраться в вопросе. Обычная версия — быстрая и дешёвая, под массовых голосовых ассистентов.
- Водяной знак. Весь синтезированный звук помечен незаметным SynthID — попытка Google дать инструмент против голосовых подделок.
По оценке Artificial Analysis обычная версия заняла первое место в индексе качества «звук в звук» (82,6 балла) и второе — в Speech Agent Arena, где модели сравнивают живые пользователи вслепую. Лидерство в голосе Google забрала впервые.
Кому это адресовано
Главное, чего в новости нет: приложение Gemini на телефоне не получило нового режима. Live-модели отданы разработчикам через Gemini API и Google AI Studio, корпоративным клиентам — в закрытом превью, а из массовых продуктов их первым получил Google Search Live. Extended Thinking отдельно поедет в Google Workspace.
Адресат — те, кто делает голосовых роботов: поддержка, запись на приём, обучение языкам, помощники для незрячих. Именно там задержка в полсекунды решает, звучит помощник живым или нет. Для обычного пользователя эффект проявится позже — когда голосовой поиск и колонки начнут отвечать иначе.
Как поговорить с ИИ голосом из России
Честно: Gemini 3.8 Live из России напрямую не запустить. Ни Gemini, ни Google AI Studio официально в стране не работают, а живой голосовой режим требует постоянного соединения с серверами Google — через нестабильный обход он просто рвётся. В Умке этой модели тоже нет: сервис работает с моделями по текстовому API, а «звук в звук» так не подключается.
Что работает без оговорок — диктовка. В Умке можно наговорить вопрос голосом, речь распознаётся на сервере сервиса, а ответ любой модели приходит текстом; озвучить его можно отдельным шагом. Это не «звонок» с ИИ: реплики идут по очереди, перебить модель нельзя. Зато работает из России без VPN и с любой моделью на выбор. Подробный разбор режимов — в статье «Голосовой чат с ИИ онлайн».
Спросите нейросеть голосом
Надиктуйте вопрос — ответит GPT, Claude, Gemini или Qwen на выбор. Из России, без VPN, оплата в рублях.
Открыть Умку →Третий релиз Gemini за месяц
Google выпускает модели почти без пауз: 2 сентября вышла Gemini 3.8 Flash, через две недели — голосовая пара. Текстовые и голосовые линейки развиваются параллельно, и номер версии у них общий. Что из семейства Gemini доступно российскому пользователю и чем модели отличаются друг от друга, разобрано в обзоре «Джемини: нейросеть Google».
Сколько стоит в Умке
Подписки нет: баланс тратится только на фактические запросы. После регистрации начисляется 60 токенов — хватит опробовать диктовку. Ответ умной модели стоит около 33 токенов, быстрой — от 1 токена. Минимальный пакет — 290 ₽ за 725 токенов, это примерно 20 ответов умной модели или сотни быстрых. Дальше: 690 ₽ — 1 811 токенов, 1 490 ₽ — 4 172, 3 900 ₽ — 11 700. Токены не сгорают. Подробности — на странице тарифов.
Вывод
Gemini 3.8 Live — не новая кнопка в приложении, а движок для голосовых ассистентов, и по качеству голоса Google впервые вышла на первое место. Самое практичное в релизе — 97 языков с переключением на лету: голосовой помощник перестаёт требовать, чтобы вы заранее выбрали язык. Российскому пользователю новинка пока недоступна, и увидим мы её не в анонсе, а в том, как через полгода начнут отвечать голосовые сервисы вокруг.
Источники: MarkTechPost, TechRepublic.
Частые вопросы
Говорит ли Gemini 3.8 Live по-русски?
Google заявляет 97 поддерживаемых языков и автоматическое переключение между ними посреди разговора. Русский входит в число языков, на которых Gemini работает, но качество голосового режима на нём Google отдельно не измеряла.
Чем Gemini 3.8 Live отличается от Gemini 3.8 Flash?
Flash — текстовая модель: вы пишете, она пишет в ответ. Live — модель «звук в звук»: она слушает речь и сразу отвечает голосом, без промежуточного превращения в текст. Поэтому ответ приходит быстрее и звучит живее.
Доступен ли голосовой режим Gemini в России?
Официально нет: Gemini и Google AI Studio в России не работают без обхода блокировок, а голосовые режимы требуют постоянного соединения с серверами Google. Текстовые модели Gemini доступны через сервисы-посредники.
Есть ли живой голосовой режим в Умке?
Нет. В Умке работает диктовка: вы наговариваете вопрос, речь распознаётся, ответ приходит текстом, а озвучить его можно отдельно. Это не «звонок» с моделью, зато работает из России без VPN и с любой моделью на выбор.