🌟 Nvidia открыла веса модели для разметки спикеров в аудио Nemotron 3 Diarization – открытая модель диаризации на 100 млн параметров, которая работает на аудиозаписях и в потоковом режиме, размечая на записи отрезки речи каждого участника, включая моменты, когда люди перебивают друг друга. Вместе с ASR это даёт расшифровку встреч, звонков и подкастов с разметкой по говорящим. Модель различает до восьми собеседников – вдвое больше, чем предыдущая Streaming Sortformer компании. Длина записи не ограничена, потому что звук обрабатывается фрагментами. Метки говорящих анонимные - модель сообщает, что speaker_Х говорил с такой-то секунды по такую-то, но не определяет, кто это. Имена и роли участников можно задать логикой сценария в целевом приложении, связав обезличенные каналы, временные метки и личность от вывода модели с заранее определенным списком спикеров. 🟡Архитектура Внутри 31-слойный трансформерный энкодер с RoPE. На вход подаётся моно-звук 16 кГц, мел-спектрограмма сжимается в кадры по 80 мс. На выходе модель для каждых 10 мс выдаёт вероятность того, что говорит каждый из восьми участников, поэтому одновременная речь двух людей не мешает разметке. Как и в Sortformer, каналы нумеруются в порядке появления голосов - первый новый голос получает первый канал. В потоковом режиме модель помнит собеседников через кэш голосов из прошлых фрагментов и очередь недавних кадров. 🟡Тесты Главный показатель – DER, доля времени речи, размеченной с ошибкой (пропуск, ложное срабатывание или путаница говорящих). Чем ниже значение, тем лучше. В Diarization-Bench от Voice Arena модель заняла первое место из 12 систем с DER 14,72% против 19,3% у следующей. Остальные сравнения Nvidia провела со своей прежней моделью. При задержке 1,04 секунды DER на DIHARD III снизился с 19,60 до 13,18%, на записях встреч NOTSOFAR1 – с 22,12 до 7,70%. На разговорах двух человек из CALLHOME в офлайн-режиме новая модель немного уступает Streaming Sortformer - 5,98% против 5,68%. Скорость подросла - на RTX PRO 5000 при обработке пакетами по 32 записи модель размечает 865 секунд звука за секунду вычислений против 136 у предшественницы. 📌Лицензирование: OpenMDW-1.1 🟡Блогпост 🟡Модель 🟡Демо @ai_machinelearning_big_data #AI #ML #Diarization #Speech #Nemotron #Nvidia
- 38
- 15
- 6
- 5
- 2