Google представила две новые голосовые модели Gemini, Gemini 3.8 Live и Gemini 3.8 Live Extended Thinking. Они рассчитаны на диалог в близком к реальному времени режиме, работу с голосом и выполнение задач через инструменты и API. Базовая версия ориентирована на масштабирование и экономичность, а Extended Thinking предназначена для более сложных многошаговых сценариев.
Чем отличаются новые модели
Gemini 3.8 Live объединяет голосовой диалог и обработку визуального контекста. По заявлению Google, модель может анализировать визуальные входные данные почти в реальном времени, что должно помогать ей учитывать происходящее в разговоре.
Ещё одна заявленная функция, автоматическое переключение между 97 поддерживаемыми языками прямо во время беседы. Модель также может запускать инструменты и обращения к API в фоне, не прерывая разговор с пользователем.
Gemini 3.8 Live Extended Thinking создана для задач, где требуется больше рассуждений и несколько последовательных шагов. Google сообщает, что эта версия может одновременно рассуждать и отвечать голосом. Пока фоновая задача выполняется, модель способна подтверждать запрос короткими репликами и сообщать о ходе работы.
Для голосовых помощников и рабочих процессов
Основной сценарий для разработчиков и компаний, голосовые агенты, которые должны не просто отвечать на вопросы, но и обращаться к подключённым системам. Например, принимать запрос клиента, уточнять детали, запускать операцию через API и поддерживать диалог, пока система готовит результат.
Google называет новые модели основой для production ready голосовых агентов. При этом источник не раскрывает технические требования к внедрению, конкретные задержки ответа, лимиты запросов, размер контекста и стоимость использования.
В анонсе также указано, что модели будут использоваться в Gemini, Google Workspace и Search. Gemini 3.8 Live Extended Thinking заявлена для задач в Google Docs, Gmail и Keep у части подписчиков Google AI.
Что можно проверить на своей задаче
Для маркетинговой команды примером теста может стать голосовой помощник для первичного разбора обращений. Ему можно поручить определить язык собеседника, собрать вводные для рекламной кампании и передать данные в CRM через подключённый API.
Другой вариант, проверить визуальный голосовой сценарий. Например, пользователь показывает в камеру упаковку или рекламный макет, а система голосом фиксирует замечания и формирует список правок. Это только идея для теста: анонс не гарантирует точность распознавания, качество рекомендаций или корректную работу в конкретной связке сервисов.
Доступность
Gemini 3.8 Live развёртывается с 15 сентября 2026 года:
- для разработчиков, в Gemini API и Google AI Studio;
- для компаний, в формате закрытого предварительного доступа в Gemini Enterprise, позднее ожидается появление в Gemini Enterprise for Customer Experience;
- для всех пользователей, в Search Live.
Gemini 3.8 Live Extended Thinking также начинает развёртываться с этой даты:
- для разработчиков, в Gemini API и Google AI Studio;
- для компаний, в закрытом предварительном доступе Gemini Enterprise, позднее в Gemini Enterprise for Customer Experience и для бизнес пользователей Google Workspace;
- для пользователей, в Gemini Live, а также в Docs для подписчиков Google AI Pro и Ultra, в Gmail и Keep для всех подписчиков Google AI.
Маркировка аудио
Google сообщает, что аудио, созданное её ИИ продуктами, получает незаметную для слушателя водяную метку SynthID. По заявлению компании, это позволяет обнаруживать сгенерированный звук. Условия коммерческого использования, детали проверки метки и ограничения технологии в анонсе не описаны.
Страница Google: https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-8-live-gemini-3-8-live-extended-thinking/
Первоисточник: https://deepmind.google/blog/introducing-gemini-3-8-live-and-3-8-live-extended-thinking/
Нужна такая же реклама для вашего бизнеса?
Разберу нишу, посчитаю бюджет и покажу, из чего сложится цена заявки.



