Microsoft представила MAI-Transcribe-2 — улучшенную модель распознавания речи с расширенными возможностями

Microsoft анонсировала MAI-Transcribe-2 — новую версию своей модели для преобразования речи в текст, которая демонстрирует рекордные показатели точности и скорости.
MAI-Transcribe-2 заняла первое место по точности на FLEURS — ключевом многоязычном бенчмарке, а также поднялась с третьего на второе место в рейтинге по показателю Word Error Rate (WER) в искусственном анализе. Кроме того, модель лидирует по соотношению точности и задержки, что означает оптимальный баланс между качеством распознавания и скоростью обработки аудио.
Важным новшеством стала функция разделения спикеров (speaker diarization), позволяющая точно определить, кто и когда говорил в многопользовательских аудиозаписях — таких как совещания, интервью и звонки в контакт-центрах. Каждое слово теперь сопровождается временными метками начала и конца, что упрощает навигацию по транскрипту, создание субтитров и поиск по аудио.
MAI-Transcribe-2 поддерживает 60 языков, что значительно расширяет возможности для международных команд и организаций, стремящихся использовать единое решение для разных регионов.
Области применения включают анализ звонков в контакт-центрах с разделением ролей агента и клиента, автоматизацию протоколов совещаний с точной атрибуцией реплик, поддержку голосовых ассистентов благодаря минимальной задержке, а также создание субтитров и локализацию медиа-контента. Модель также отвечает требованиям регуляторов в сферах финансов, здравоохранения и госуправления, обеспечивая точные, снабжённые временными метками и разделённые по спикерам записи.
Кроме того, улучшенная точность и многоязычность MAI-Transcribe-2 способствуют повышению доступности информации для людей с нарушениями слуха, обеспечивая качественные субтитры и транскрипты в реальном времени.
По данным Techcommunity.microsoft.com.
