Модель Яндекса обогнала решение NVIDIA в коде и сравнялась с моделью Alibaba в олимпиадной математике 😳 Претрейн Alice AI Foundation LLM померили в сравнении с конкурентами. Главное: 🟢 Архитектура MoE: всего 80 млрд параметров, но в моменте активны только 3 млрд. Поэтому модель быстрая и экономная по железу; 🟢 В задачах, где нужны широкие фактические знания, превосходит DeepSeek. А прошлую Alice AI LLM 235B со всемеро большим числом активных параметров побеждает в 75% фактологических вопросов; 🟢 Особенно сильна в русском языке, литературе, истории, медицине и праве, а длинный контекст до 256K держит на уровне DeepSeek; 🟢 Лицензия Apache 2.0, так что модель можно спокойно тащить и в коммерческие продукты, и в исследования. Отдельно порадовали инженерные хаки: оптимизация хранения промежуточных данных срезала расход видеопамяти в три раза, а система предфильтров сократила вычисления на отбор датасета в десятки раз. Раньше на это уходило больше 200 тысяч GPU-часов. И это только экспериментальная версия, на которой Яндекс обкатывает архитектуру для будущей единой рассуждающей модели Алисы AI 👍 @xor_journal
- 104
- 48
- 33
- 29
- 17
- 8
- 3