Google выпустила Gemini 3.8 Live для диалогов в реальном времени

Google представила модель Gemini 3.8 Live, предназначенную для голосовых приложений и диалогов в реальном времени. Она рассчитана на сценарии, где важны низкая задержка, естественный обмен репликами и возможность выполнять действия во время разговора.

Google выпустила Gemini 3.8 Live для диалогов в реальном времени
livemint.com

Gemini 3.8 Live доступна через Gemini API. Google описывает ее как основной вариант для большинства голосовых ИИ-агентов, которым не требуется длительное рассуждение перед ответом. Модель предназначена для быстрых аудиодиалогов без задержек, связанных с дополнительной обработкой запроса.

Gemini 3.8 Live принимает на вход текст, изображения, аудио и видео. На выходе она поддерживает текст и аудио. Это позволяет создавать приложения, в которых пользователь может не только вводить запросы, но и разговаривать с ИИ, показывать ему изображения или передавать видеопоток.

Модель поддерживает interleaved reasoning — чередующееся рассуждение. Также предусмотрены асинхронные вызовы функций. Они позволяют передавать модели инструменты для выполнения действий во внешних сервисах, не переводя весь диалог в обязательный режим ожидания. Асинхронное выполнение теперь используется по умолчанию, но разработчики могут вернуть блокирующий режим для обратной совместимости.

Еще одна возможность — обновление содержимого клиентом в течение всей сессии. Приложение может передавать новые данные с указанием роли отправителя: пользователя или модели.

Gemini 3.8 Live поддерживает proactive audio — возможность самостоятельно инициировать аудиовывод в рамках поддерживаемого сценария. Для видео по умолчанию используется режим, при котором видеокадры передаются вместе с аудиоданными. Разработчики могут самостоятельно управлять отправкой кадров, чтобы контролировать объем контекста и расходы.

Для Gemini 3.8 Live аудио является поддерживаемым форматом ответа. Если приложению требуется текстовая расшифровка, ее нужно включить отдельно.

Модель ориентирована прежде всего на голосовые приложения, которым нужны быстрые ответы, работа с аудио и видео, а также выполнение действий во время разговора. Для более сложных задач, требующих многоэтапного решения и фонового рассуждения, Google предлагает отдельную модель Gemini 3.8 Live Extended Thinking.

Читайте также:

Нейросети научились управлять скоростью событий в сгенерированных видео

OpenAI привлекла сотни подрядчиков для проверки реальных переписок ChatGPT

Microsoft экстренно исправляет проблемы после сентябрьского обновления Windows 11

Что будем искать? Например,ChatGPT

Мы в социальных сетях