Google представила модель Gemini 3.8 Live, предназначенную для голосовых приложений и диалогов в реальном времени. Она рассчитана на сценарии, где важны низкая задержка, естественный обмен репликами и возможность выполнять действия во время разговора.

Gemini 3.8 Live доступна через Gemini API. Google описывает ее как основной вариант для большинства голосовых ИИ-агентов, которым не требуется длительное рассуждение перед ответом. Модель предназначена для быстрых аудиодиалогов без задержек, связанных с дополнительной обработкой запроса.
Gemini 3.8 Live принимает на вход текст, изображения, аудио и видео. На выходе она поддерживает текст и аудио. Это позволяет создавать приложения, в которых пользователь может не только вводить запросы, но и разговаривать с ИИ, показывать ему изображения или передавать видеопоток.
Модель поддерживает interleaved reasoning — чередующееся рассуждение. Также предусмотрены асинхронные вызовы функций. Они позволяют передавать модели инструменты для выполнения действий во внешних сервисах, не переводя весь диалог в обязательный режим ожидания. Асинхронное выполнение теперь используется по умолчанию, но разработчики могут вернуть блокирующий режим для обратной совместимости.
Еще одна возможность — обновление содержимого клиентом в течение всей сессии. Приложение может передавать новые данные с указанием роли отправителя: пользователя или модели.
Gemini 3.8 Live поддерживает proactive audio — возможность самостоятельно инициировать аудиовывод в рамках поддерживаемого сценария. Для видео по умолчанию используется режим, при котором видеокадры передаются вместе с аудиоданными. Разработчики могут самостоятельно управлять отправкой кадров, чтобы контролировать объем контекста и расходы.
Для Gemini 3.8 Live аудио является поддерживаемым форматом ответа. Если приложению требуется текстовая расшифровка, ее нужно включить отдельно.
Модель ориентирована прежде всего на голосовые приложения, которым нужны быстрые ответы, работа с аудио и видео, а также выполнение действий во время разговора. Для более сложных задач, требующих многоэтапного решения и фонового рассуждения, Google предлагает отдельную модель Gemini 3.8 Live Extended Thinking.
Читайте также:
Нейросети научились управлять скоростью событий в сгенерированных видео
OpenAI привлекла сотни подрядчиков для проверки реальных переписок ChatGPT
Microsoft экстренно исправляет проблемы после сентябрьского обновления Windows 11