Открываем AliceAI-Foundation-80B-A3B-Base — новую языковую модель Яндекса, обученную с нуля Около полугода работы, 80 млрд параметров, из которых активны 3 млрд, 17,5 трлн токенов на основной стадии обучения. AliceAI-Foundation-80B-A3B-Base полностью обучена в Яндексе с нуля, без весов сторонних опенсорс-моделей. За это время команда пересобрала корпус, перебрала архитектурные решения, подобрала гиперпараметры и добавила данные для рассуждений и агентских взаимодействий. Один из самых напряжённых эпизодов начался после пересчёта гиперпараметров по scaling laws. Сначала стали расти MoE-активации, затем резко подскочил loss. Первой гипотезой была ошибка в прогнозе, но тот же эффект удалось воспроизвести на небольшой модели из нескольких широких слоёв. Команда нашла способ стабилизировать обучение, вернулась к предсказанному learning rate и успешно обучила финальную модель. И таких развилок в работе было много. Разработчики примерно вдвое ускорили распределённый шаг оптимизатора, в десятки раз сократили вычисления при отборе фактологических документов и провели отдельную стадию претрейна для развития рассуждений и агентских навыков. В итоговых замерах модель обходит более крупные DeepSeek-V4-Flash-Base и Nemotron-3-Super на многих задачах, а на IMO AnswerBench и LiveCodeBench лидирует среди сравниваемых открытых претрейнов. Какие эксперименты сработали, от каких пришлось отказаться и как модель дошла до финального чекпойнта.
- 68
- 52
- 41
- 11
- 8
- 6
- 5
- 4
- 3
- 3
- 2