Лучшую модель для распознавания речи дропнули в опенсорс — спецы из NVIDIA выкатили Nemotron 3 Diarization. Она разбирает голоса даже в дорожках, где люди спорят друг с другом, и умеет определять, кто и когда говорит. Всего модель для диаризации поддерживает разговоры до 8️⃣ участников. Это лучшие показатели по бенчам среди всех моделей такого типа: доля ошибок 14% — на 24% ниже ближайшего конкурента. Модель всего на 100 млн параметров и много мощностей не требует. Ну и да: 🔤🔤🔤🔤🔤🔤🔤🔤🔤 Тестим демо тут. 🙂 Не баг, а фича
- 30
- 13
- 5
- 4