Google представила Gemini 3.8 Live с живым аватаром для мультимодального диалога

Google анонсировала новую версию своей модели Gemini 3.8 Live, расширенную функцией Live Avatar — визуальным аватаром в режиме близком к реальному времени. Это решение интегрирует нативный мультимодальный диалог с потоковым видео с низкой задержкой, что позволяет создать более естественное и наглядное взаимодействие для корпоративных пользователей.
Live Avatar синхронизирует речь с мимикой и движениями губ, обеспечивая плавный и выразительный визуальный образ, способный вести диалог с точной артикуляцией и естественной сменой реплик. Такая технология помогает компаниям улучшить виртуальное взаимодействие с клиентами, делая сервисы более интерактивными и доступными.
Новая функция поддерживает одновременную обработку аудио и видео, что позволяет вести более насыщенные и комплексные беседы. Кроме того, благодаря асинхронному вызову инструментов, аватар может выполнять фоновые задачи и получать данные, не прерывая диалог.
Live Avatar рассчитан на глобальное использование: он обеспечивает мультиязычную синхронизацию речи и визуальных движений в 97 языках без потери качества видео или рассинхронизации.
Для адаптации под фирменный стиль клиентов предусмотрена возможность создавать кастомные аватары на основе высококачественных изображений, сохраняя индивидуальность и брендовые особенности. Данная опция доступна по запросу для корпоративных пользователей.
Важным элементом разработки стала прозрачность и безопасность: весь сгенерированный аудио- и видеоконтент снабжается невидимым водяным знаком SynthID, который помогает обнаруживать искусственный контент и снижать риски дезинформации.
Gemini 3.8 Live с Live Avatar уже доступна в рамках Gemini Enterprise. Для интеграции и тестирования доступны соответствующая документация и API.
По данным blog.google.
