Модель умеет рассуждать и работать в агентных сценариях. Благодаря этому она эффективно решает сложные логические задания и справляется с программированием. Например, в решении олимпиадных задач по математике она лидирует вместе с Qwen3.5-35B-A3B-Base, справляясь с большинством заданий. В тестах на написание кода она обходит модель компании NVIDIA Nemotron-3-Super-120B-Base, хотя использует в четыре раза меньше активных параметров. Развитые способности к ризонингу и программированию нужны для эффективной работы агентов, которые выполняют задания по поручению пользователя. Хотя у новой модели компактный размер и меньшая требовательность к вычислительным мощностям, она лучше решает задачи, где нужны широкие фактические знания, чем более крупные открытые модели. Обгоняет она в том числе DeepSeek-V4-Flash-Base с 284 миллиардами параметров и 13 миллиардами активных. Как показали бенчмарки для оценки знания фактов, новая модель отвечает так же хорошо, как предыдущая закрытая модель «Яндекса» Alice AI LLM, но у нее в три раза больше параметров и в семь раз больше активных. Новые бенчмарки Чтобы оценить знания модели, актуальные для русскоязычных пользователей, компания разработала два собственных бенчмарка: WikiWebFacts и HardMultiQA. Первый тест состоит из пар «короткий вопрос — короткий ответ». Он оценивает знание дат, определений, событий и персоналий. В его основу легли материалы онлайн-энциклопедий и популярные поисковые запросы. Второй, HardMultiQA, разработали на основе анонимизированного потока запросов к «Алисе AI». Он затрагивает более редкие области знаний: от медицины и права до IT и искусства. Отвечая на эти вопросы, модель должна не просто вспомнить один факт, но и выбрать несколько правильных вариантов из списка, перечислить сразу несколько фактов, подходящих под условие вопроса, а также отыскать фактическую ошибку в тексте. Новые бенчмарки разработали, чтобы оценить русскоязычные знания модели, поскольку англоязычные аналоги не могут проверить уровень объективно. «Яндекс» выложил оба бенчмарка в открытый доступ вместе с моделью. Благодаря этому разработчики и исследователи могут самостоятельно проверить результаты и сравнить модели. Также компания опубликовала эталонные ответы и полный протокол оценки. Инженерные решения Обучая модели, разработчики «Яндекса» улучшили работу оптимизатора — программы, отвечающей за процесс обучения. Теперь пересылка данных между видеокартами идет параллельно с вычислениями, что помогло примерно в два раза ускорить шаги оптимизации. «Яндекс» также ускорил подготовку качественных обучающих данных. Чтобы отобрать нужные документы, их проверяли с помощью ресурсоемкой модели. Запуск модели на всем корпусе занял бы более 200 тысяч часов работы видеокарт. Теперь документы предварительно проходят через каскад классификаторов. На каждом этапе более сложная и вычислительно затратная модель проверяет все меньшее число документов. Количество вычислений удалось сократить в десятки раз, сохранив около 95% полезных документов. Кроме того, инженеры сильно расширили базу знаний модели в сфере права, медицины и математики. «Яндекс» представил новую модель под лицензией Apache 2.0. Ее можно будет свободно использовать как в исследовательских, так и в коммерческих целях. Разработчики уже завершили основной этап обучения, от которого зависят эрудированность, способности и потенциал модели. Теперь ее можно использовать как основу для создания собственных проектов. Модель, технические отчеты и бенчмарки опубликовали на платформе Hugging Face , а техрепорт — на « Хабре ».
Яндекс выпустил в открытый доступ суверенную языковую модель Alice AI Foundation LLM с уникальными характеристиками
Похожие посты
- 🔥 81
- ❤ 22
- 👎 14
- 👍 10
- 🤔 10
- 👍 686
- 🤣 341
- 👎 82
- ❤ 53
- 👏 7
- 🗿 164
- 👍 90
- 😁 46
- ❤ 27
- 🔥 13
- 😭 7
- 🤡 391
- 😁 64
- ❤ 49
- 👎 41
- 🤣 183
- 👍 78
- 🤡 27
- 🔥 19
- ❤ 11
- 👌 7
🇷🇺#YDEX #ии #россия Яндекс выложил в опенсорс свою новую ИИ-модель, обученную с нуля — релиз