NVIDIA выпустила в открытый доступ лучшую модель для распознавания речи

Machinelearning@ai_machinelearning_big_dataТехнологии и IT24 сентября 2026, 15:01

🌟 Nvidia открыла веса модели для разметки спикеров в аудио Nemotron 3 Diarization – открытая модель диаризации на 100 млн параметров, которая работает на аудиозаписях и в потоковом режиме, размечая на записи отрезки речи каждого участника, включая моменты, когда люди перебивают друг друга. Вместе с ASR это даёт расшифровку встреч, звонков и подкастов с разметкой по говорящим. Модель различает до восьми собеседников – вдвое больше, чем предыдущая Streaming Sortformer компании. Длина записи не ограничена, потому что звук обрабатывается фрагментами. Метки говорящих анонимные - модель сообщает, что speaker_Х говорил с такой-то секунды по такую-то, но не определяет, кто это. Имена и роли участников можно задать логикой сценария в целевом приложении, связав обезличенные каналы, временные метки и личность от вывода модели с заранее определенным списком спикеров. 🟡Архитектура Внутри 31-слойный трансформерный энкодер с RoPE. На вход подаётся моно-звук 16 кГц, мел-спектрограмма сжимается в кадры по 80 мс. На выходе модель для каждых 10 мс выдаёт вероятность того, что говорит каждый из восьми участников, поэтому одновременная речь двух людей не мешает разметке. Как и в Sortformer, каналы нумеруются в порядке появления голосов - первый новый голос получает первый канал. В потоковом режиме модель помнит собеседников через кэш голосов из прошлых фрагментов и очередь недавних кадров. 🟡Тесты Главный показатель – DER, доля времени речи, размеченной с ошибкой (пропуск, ложное срабатывание или путаница говорящих). Чем ниже значение, тем лучше. В Diarization-Bench от Voice Arena модель заняла первое место из 12 систем с DER 14,72% против 19,3% у следующей. Остальные сравнения Nvidia провела со своей прежней моделью. При задержке 1,04 секунды DER на DIHARD III снизился с 19,60 до 13,18%, на записях встреч NOTSOFAR1 – с 22,12 до 7,70%. На разговорах двух человек из CALLHOME в офлайн-режиме новая модель немного уступает Streaming Sortformer - 5,98% против 5,68%. Скорость подросла - на RTX PRO 5000 при обработке пакетами по 32 записи модель размечает 865 секунд звука за секунду вычислений против 136 у предшественницы. 📌Лицензирование: OpenMDW-1.1 🟡Блогпост 🟡Модель 🟡Демо @ai_machinelearning_big_data #AI #ML #Diarization #Speech #Nemotron #Nvidia

  • 41
  • 15
  • 6
  • 5
  • 3

Похожие посты

Не баг, а фича@bugnotfeatureТехнологии и ITвчера
NVIDIA выпустила в открытый доступ лучшую модель для распознавания речи

Лучшую модель для распознавания речи дропнули в опенсорс — спецы из NVIDIA выкатили Nemotron 3 Diarization. Она разбирает голоса даже в дорожках, где люди спорят друг с другом, и умеет определять, кто и когда говорит. Всего модель для диаризации поддерживает разговоры до 8️⃣ участников. Это лучшие показатели по бенчам среди всех моделей такого типа: доля ошибок 14% — на 24% ниже ближайшего конкурента. Модель всего на 100 млн параметров и много мощностей не требует. Ну и да: 🔤🔤🔤🔤🔤🔤🔤🔤🔤...

  • 32
  • 13
  • 5
  • 4
XOR@xor_journalТехнологии и ITвчера
NVIDIA выпустила в открытый доступ лучшую модель для распознавания речи

NVIDIA выпустила в опенсорс лучшую модель для распознавания речи — она разбирает голоса, даже когда люди спорят друг с другом 😨 Nemotron 3 Diarization умеет определять, кто и когда говорит, даже если несколько человек перебивают друг друга. Всего модель для диаризации поддерживает разговоры до восьми (!) участников, в том числе в реальном времени. В бенче на распознавание она, как вы понимаете, стала лучшей: доля ошибок всего 14% — это на 24% ниже ближайшего конкурента. Причём модель довольно...

  • 70
  • 41
  • 7
  • 4
  • 1
Технотренды@techno_mediaТехнологии и ITвчера
NVIDIA выпустила в открытый доступ лучшую модель для распознавания речи

Забираем ЛУЧШУЮ модель для распознавания речи — спецы из NVIDIA выкатили Nemotron 3 Diarization. Она разбирает голоса даже в дорожках, где люди спорят друг с другом, и умеет определять, кто и когда говорит. Всего модель для диаризации поддерживает разговоры до 8 участников. Это лучшие показатели по бенчам среди всех моделей такого типа. Модель всего на 100 млн параметров, причем много мощностей вам не потребуется. 🕤🕤🕤🕤🕤🕤🕤🕤🕤 Пробуем демо — тут. 📲 Технотренды

  • 15
LOLZTEAM@lolz_legalТехнологии и ITвчера
NVIDIA выпустила в открытый доступ лучшую модель для распознавания речи

🎙 NVIDIA дропнули мощную опенсорсную модель для распознавания речи Nemotron 3 Diarization умеет разбирать сложные разговоры, где несколько людей перебивают и спорят друг с другом, а также определять, кто и когда говорил. Модель поддерживает до 8 участников и показывает 14% ошибок на бенчах – на 24% меньше ближайшего конкурента. При этом она всего на 100 млн параметров и не требует мощного железа. Тестим тут. ✅ LOLZTEAM. Подписаться

  • 14
  • 1
  • 1