← Корпораты
Пресс-релиз

Google представила Gemini 3.8 Live с живым аватаром для мультимодального диалога

ForkLog · 1 час назад
Google представила Gemini 3.8 Live с живым аватаром для мультимодального диалога

Google анонсировала новую версию своей модели Gemini 3.8 Live, расширенную функцией Live Avatar — визуальным аватаром в режиме близком к реальному времени. Это решение интегрирует нативный мультимодальный диалог с потоковым видео с низкой задержкой, что позволяет создать более естественное и наглядное взаимодействие для корпоративных пользователей.

Live Avatar синхронизирует речь с мимикой и движениями губ, обеспечивая плавный и выразительный визуальный образ, способный вести диалог с точной артикуляцией и естественной сменой реплик. Такая технология помогает компаниям улучшить виртуальное взаимодействие с клиентами, делая сервисы более интерактивными и доступными.

Новая функция поддерживает одновременную обработку аудио и видео, что позволяет вести более насыщенные и комплексные беседы. Кроме того, благодаря асинхронному вызову инструментов, аватар может выполнять фоновые задачи и получать данные, не прерывая диалог.

Live Avatar рассчитан на глобальное использование: он обеспечивает мультиязычную синхронизацию речи и визуальных движений в 97 языках без потери качества видео или рассинхронизации.

Для адаптации под фирменный стиль клиентов предусмотрена возможность создавать кастомные аватары на основе высококачественных изображений, сохраняя индивидуальность и брендовые особенности. Данная опция доступна по запросу для корпоративных пользователей.

Важным элементом разработки стала прозрачность и безопасность: весь сгенерированный аудио- и видеоконтент снабжается невидимым водяным знаком SynthID, который помогает обнаруживать искусственный контент и снижать риски дезинформации.

Gemini 3.8 Live с Live Avatar уже доступна в рамках Gemini Enterprise. Для интеграции и тестирования доступны соответствующая документация и API.

По данным blog.google.

Google представила Gemini 3.8 Live с живым аватаром для мультимодального диалога — Корпораты ForkLog