🙂 Яндекс открыл LLM, обученную с нуля: модель обгоняет решение NVIDIA в коде Alice AI Foundation LLM обучена на данных Яндекса без инициализации чужими открытыми весами. Претрейн распространяется под лицензией Apache 2.0, что позволяет использовать решение в коммерческих и исследовательских целях, дообучая под свои задачи. Модель — экспериментальная ступень на пути к единой рассуждающей модели (ЕРМ): на ней Яндекс проверяет архитектурные решения, а сама ЕРМ станет основой агентных возможностей Алисы AI. 🟡 Архитектура Модель построена на MoE: из 80 млрд параметров в моменте активны только 3 млрд. Она уже прошла основной этап обучения, поэтому её можно использовать как основу для собственных проектов. 🟡 Качество По данным тестов: 🟢 в написании кода модель обгоняет решение от NVIDIA; 🟢 в олимпиадных задачах по математике делит лидерство с моделью от Alibaba; 🟢 при меньшем размере превосходит DeepSeek в задачах, требующих широких фактических знаний. С предыдущей моделью компании, Alice AI LLM 235B, новая версия выигрывает в 75% случаев на фактологических вопросах, хотя у той втрое больше параметров и всемеро больше активных. С длинными текстами до 128K токенов модель работает на уровне лидеров рынка, разделяя первенство с DeepSeek. 🟡 Бенчмарки Чтобы проверять знания, важные именно для русскоязычной аудитории, компания подготовила два собственных набора: WikiWebFacts построен на Википедии, HardMultiQA — на данных запросов пользователей к Алисе AI. Вместе с задачами опубликованы эталонные ответы и протокол оценки. 🟡 Обучение Во-первых, перестроили работу оптимизатора так, чтобы пересылки данных между видеокартами шли параллельно с вычислениями. Также в архитектуре появился механизм обращения к выходам предыдущих слоев. Чтобы потребление памяти при этом не возросло, поменяли схему хранения и пересчета промежуточных результатов. Во-вторых, оптимизировали подготовку данных для обучения. Ранее для оценки и отбора массивов использовалась исключительно отдельная ресурсоемкая модель — ее затраты оценивались в 200 тыс. часов работы видеокарт. Для нового решения построили каскад классификаторов. На каждом этапе более сложная и вычислительно затратная модель работает с уменьшающимся количеством документов. Это в десятки раз сократило количество вычислений. Модель, технические отчёты и бенчмарки доступны на Hugging Face, техрепорт опубликован на Хабре. @ai_machinelearning_big_data #news #ai #ml
- 131
- 126
- 82
- 26
- 16
- 8
- 8
- 7
- 6
- 6
- 5