GPT-5 без VPN

Aijora.ru — без ограничений

Попробовать бесплатно
Все новости
googlegeminiголосовой aiрелизагенты

Gemini 3.8 Live: Google научила голосовой AI думать не замолкая

Google выпустила Gemini 3.8 Live и Live Extended Thinking — голосовые модели, которые рассуждают и вызывают инструменты в фоне, не прерывая разговор. Разбор.

Влад МакаровВлад Макаровпроверил и опубликовал
6 мин чтения
Gemini 3.8 Live: Google научила голосовой AI думать не замолкая

Главная беда голосовых ассистентов всегда была одна: стоит задать вопрос чуть сложнее прогноза погоды — и собеседник замолкает, «думая». Пауза в три секунды в чате незаметна, в живом разговоре — мучительна. Именно эту проблему Google атакует новым релизом: 15 сентября компания представила Gemini 3.8 Live и Gemini 3.8 Live Extended Thinking — голосовые модели, которые рассуждают и выполняют задачи в фоне, не переставая говорить.

Что нового

Обе модели — полностью аудио-в-аудио: они принимают речь, видеокадры, изображения и текст и отвечают голосом или текстом без промежуточной транскрипции. Каскадная схема «распознал — обработал — синтезировал», на которой до сих пор живёт большинство голосовых агентов, здесь убрана целиком, вместе с её задержками и потерей интонаций.

Ключевое нововведение — асинхронное рассуждение. Получив сложную задачу, модель не уходит в тишину: она вслух подтверждает, что поняла запрос, продолжает разговор, параллельно вызывает внешние инструменты и API, а когда фоновая работа закончена — возвращается с результатом. В демо Google модель следит через камеру за шахматной партией, поддерживает беседу и одновременно просчитывает ходы наперёд. Пример нарочито будничный: смысл релиза не в одном эффектном трюке, а в том, что голосовой агент перестаёт разваливаться на обычных многошаговых задачах — отладке скрипта, разборе налогового сценария, планировании поездки с пересадками.

Роли у пары моделей разные. Gemini 3.8 Live — массовая и дешёвая, для колл-центров, ассистентов в приложениях и прочих сценариев, где важна цена минуты. Extended Thinking — для задач, где нужно настоящее многошаговое рассуждение: она «думает» глубже и дольше, но проговаривает прогресс, пока работает. Обе переключаются между 97 языками прямо посреди разговора, с автоматическим определением языка.

Технические параметры по документации:

  • Вход: 16-бит PCM, 16 кГц; видео — JPEG-кадры до 1 кадра/с
  • Выход: аудио 24 кГц
  • Вызов инструментов и API во время говорения
  • Доступность: Gemini API, Google AI Studio, Workspace и приложение Gemini

Чего в релизе нет — так это цен. Google не опубликовала ни лимиты токенов, ни стоимость минуты для обеих моделей: тестировать можно уже сегодня, а закладывать продакшн-бюджет голосового агента — только после появления прайс-листа.

Конвейер, который не останавливается

Тайминг говорит не меньше самих моделей. Gemini 3.8 Flash и Flash Cyber вышли 2 сентября — Live-пара приехала ровно через две недели. С середины лета Google выдаёт крупный релиз Gemini примерно раз в три недели, и это уже не спринт, а устоявшийся темп работы конвейера.

Есть у этого тайминга и адресат. Четыре дня назад OpenAI выкатила залп из Agents API и GPT-Live-1 — своей реалтайм-голосовой модели, которую позиционирует как основу для продакшн-агентов. Ответ Google выглядит зеркально: та же ставка на голос как интерфейс для агентов, тот же акцент на вызов инструментов, но с козырем в виде фонового рассуждения, которого у конкурента в таком виде нет. Отдельная ирония — Siri: новый голосовой ассистент Apple, развёрнутый на этой неделе на сотнях миллионов iPhone, работает на моделях Gemini по партнёрству с Google. Пока OpenAI и Google меряются API, Google уже сидит в кармане у пользователей главного конкурента обеих.

Кому это нужно уже сейчас

Разработчикам голосовых агентов стоит присмотреться в первую очередь: убранный каскад транскрипции — это не только скорость, но и меньше мест, где ломается контекст. Сценарии с внешними системами — бронирование, поддержка, диспетчеризация — получают модель, которая умеет ждать ответа от API, не подвешивая клиента в тишине. А Extended Thinking интересна как первый серьёзный тест гипотезы, что «глубокое мышление» совместимо с живым диалогом в принципе.

Скептический вопрос тоже остаётся. Фоновое рассуждение усложняет оценку качества: когда модель проговаривает прогресс, а думает отдельно, понять, где она ошиблась — в рассуждении или в его пересказе, — становится труднее. Независимых бенчмарков голосовых моделей мало, а после истории с тихим нерфом Astra доверие к самоотчётам лабораторий — не самая твёрдая валюта. Через пару недель появятся первые продакшн-отчёты разработчиков — они и покажут, насколько «разговор без пауз» переживает встречу с реальными пользователями.

Похожие новости

Листайте вниз

для загрузки следующей статьи