Пользователь Хабра устроил тест-драйв нашим ИИ. Алису, GigaChat Max и GigaChat Ultra прогнали по пяти открытым бенчмаркам и посмотрели, как они справляются с длинными диалогами, инструкциями, кодом и многошаговыми задачами. Получилось интересно. На простых сценариях разница небольшая. А вот чем сложнее задача, тем заметнее результаты GigaChat. В MultiChallenge у Ultra 46% успешных ответов против 15% у Алисы, в агентном τ³ — 66% против примерно 8%. У исследования есть свои ограничения, о которых пишет и сам автор. Но приятно уже то, что внутри страны есть несколько сильных ИИ, которые можно всерьез сравнивать на сложных международных бенчмарках. И конкуренция между ними явно идет на пользу всем.
- 94
- 48
- 33
- 27
- 10
- 5
- 3