Gemini 3.8 Live: Google научила голосовой AI думать не замолкая
Google выпустила Gemini 3.8 Live и Live Extended Thinking — голосовые модели, которые рассуждают и вызывают инструменты в фоне, не прерывая разговор. Разбор.

Главная беда голосовых ассистентов всегда была одна: стоит задать вопрос чуть сложнее прогноза погоды — и собеседник замолкает, «думая». Пауза в три секунды в чате незаметна, в живом разговоре — мучительна. Именно эту проблему Google атакует новым релизом: 15 сентября компания представила Gemini 3.8 Live и Gemini 3.8 Live Extended Thinking — голосовые модели, которые рассуждают и выполняют задачи в фоне, не переставая говорить.
Что нового
Обе модели — полностью аудио-в-аудио: они принимают речь, видеокадры, изображения и текст и отвечают голосом или текстом без промежуточной транскрипции. Каскадная схема «распознал — обработал — синтезировал», на которой до сих пор живёт большинство голосовых агентов, здесь убрана целиком, вместе с её задержками и потерей интонаций.
Ключевое нововведение — асинхронное рассуждение. Получив сложную задачу, модель не уходит в тишину: она вслух подтверждает, что поняла запрос, продолжает разговор, параллельно вызывает внешние инструменты и API, а когда фоновая работа закончена — возвращается с результатом. В демо Google модель следит через камеру за шахматной партией, поддерживает беседу и одновременно просчитывает ходы наперёд. Пример нарочито будничный: смысл релиза не в одном эффектном трюке, а в том, что голосовой агент перестаёт разваливаться на обычных многошаговых задачах — отладке скрипта, разборе налогового сценария, планировании поездки с пересадками.
Роли у пары моделей разные. Gemini 3.8 Live — массовая и дешёвая, для колл-центров, ассистентов в приложениях и прочих сценариев, где важна цена минуты. Extended Thinking — для задач, где нужно настоящее многошаговое рассуждение: она «думает» глубже и дольше, но проговаривает прогресс, пока работает. Обе переключаются между 97 языками прямо посреди разговора, с автоматическим определением языка.
Технические параметры по документации:
- Вход: 16-бит PCM, 16 кГц; видео — JPEG-кадры до 1 кадра/с
- Выход: аудио 24 кГц
- Вызов инструментов и API во время говорения
- Доступность: Gemini API, Google AI Studio, Workspace и приложение Gemini
Чего в релизе нет — так это цен. Google не опубликовала ни лимиты токенов, ни стоимость минуты для обеих моделей: тестировать можно уже сегодня, а закладывать продакшн-бюджет голосового агента — только после появления прайс-листа.
Конвейер, который не останавливается
Тайминг говорит не меньше самих моделей. Gemini 3.8 Flash и Flash Cyber вышли 2 сентября — Live-пара приехала ровно через две недели. С середины лета Google выдаёт крупный релиз Gemini примерно раз в три недели, и это уже не спринт, а устоявшийся темп работы конвейера.
Есть у этого тайминга и адресат. Четыре дня назад OpenAI выкатила залп из Agents API и GPT-Live-1 — своей реалтайм-голосовой модели, которую позиционирует как основу для продакшн-агентов. Ответ Google выглядит зеркально: та же ставка на голос как интерфейс для агентов, тот же акцент на вызов инструментов, но с козырем в виде фонового рассуждения, которого у конкурента в таком виде нет. Отдельная ирония — Siri: новый голосовой ассистент Apple, развёрнутый на этой неделе на сотнях миллионов iPhone, работает на моделях Gemini по партнёрству с Google. Пока OpenAI и Google меряются API, Google уже сидит в кармане у пользователей главного конкурента обеих.
Кому это нужно уже сейчас
Разработчикам голосовых агентов стоит присмотреться в первую очередь: убранный каскад транскрипции — это не только скорость, но и меньше мест, где ломается контекст. Сценарии с внешними системами — бронирование, поддержка, диспетчеризация — получают модель, которая умеет ждать ответа от API, не подвешивая клиента в тишине. А Extended Thinking интересна как первый серьёзный тест гипотезы, что «глубокое мышление» совместимо с живым диалогом в принципе.
Скептический вопрос тоже остаётся. Фоновое рассуждение усложняет оценку качества: когда модель проговаривает прогресс, а думает отдельно, понять, где она ошиблась — в рассуждении или в его пересказе, — становится труднее. Независимых бенчмарков голосовых моделей мало, а после истории с тихим нерфом Astra доверие к самоотчётам лабораторий — не самая твёрдая валюта. Через пару недель появятся первые продакшн-отчёты разработчиков — они и покажут, насколько «разговор без пауз» переживает встречу с реальными пользователями.


