Site icon Naked Science

«Яндекс» выложил в опенсорс новую ИИ-модель, обученную с нуля

Результаты моделей на бенчмарках / © Яндекс

На экспериментальной версии Alice AI Foundation LLM «Яндекс» тестирует архитектурные решения для своей будущей единой рассуждающей модели (ЕРМ). ЕРМ станет основой для агентных возможностей «Алисы AI», с помощью которых пользователи смогут поручать ей выполнение конкретных действий.

Качество модели

Alice AI Foundation LLM использует архитектуру MoE (Mixture of Experts). Она содержит 80 миллиардов параметров, но для обработки запроса задействует только три миллиарда. Это позволяет обеспечить высокую скорость работы и сэкономить затраты на вычисления.

Модель умеет рассуждать и работать в агентных сценариях. Благодаря этому она эффективно решает сложные логические задания и справляется с программированием. Например, в решении олимпиадных задач по математике она лидирует вместе с Qwen3.5-35B-A3B-Base, справляясь с большинством заданий. В тестах на написание кода она обходит модель компании NVIDIA Nemotron-3-Super-120B-Base, хотя использует в четыре раза меньше активных параметров. Развитые способности к ризонингу и программированию нужны для эффективной работы агентов, которые выполняют задания по поручению пользователя.

Хотя у новой модели компактный размер и меньшая требовательность к вычислительным мощностям, она лучше решает задачи, где нужны широкие фактические знания, чем более крупные открытые модели. Обгоняет она в том числе DeepSeek-V4-Flash-Base с 284 миллиардами параметров и 13 миллиардами активных. Как показали бенчмарки для оценки знания фактов, новая модель отвечает так же хорошо, как предыдущая закрытая модель «Яндекса» Alice AI LLM, но у нее в три раза больше параметров и в семь раз больше активных.

Новые бенчмарки

Чтобы оценить знания модели, актуальные для русскоязычных пользователей, компания разработала два собственных бенчмарка: WikiWebFacts и HardMultiQA. Первый тест состоит из пар «короткий вопрос — короткий ответ». Он оценивает знание дат, определений, событий и персоналий. В его основу легли материалы онлайн-энциклопедий и популярные поисковые запросы.

Второй, HardMultiQA, разработали на основе анонимизированного потока запросов к «Алисе AI». Он затрагивает более редкие области знаний: от медицины и права до IT и искусства. Отвечая на эти вопросы, модель должна не просто вспомнить один факт, но и выбрать несколько правильных вариантов из списка, перечислить сразу несколько фактов, подходящих под условие вопроса, а также отыскать фактическую ошибку в тексте.

Новые бенчмарки разработали, чтобы оценить русскоязычные знания модели, поскольку англоязычные аналоги не могут проверить уровень объективно. «Яндекс» выложил оба бенчмарка в открытый доступ вместе с моделью. Благодаря этому разработчики и исследователи могут самостоятельно проверить результаты и сравнить модели. Также компания опубликовала эталонные ответы и полный протокол оценки.

Инженерные решения

Обучая модели, разработчики «Яндекса» улучшили работу оптимизатора — программы, отвечающей за процесс обучения. Теперь пересылка данных между видеокартами идет параллельно с вычислениями, что помогло примерно в два раза ускорить шаги оптимизации.

«Яндекс» также ускорил подготовку качественных обучающих данных. Чтобы отобрать нужные документы, их проверяли с помощью ресурсоемкой модели. Запуск модели на всем корпусе занял бы более 200 тысяч часов работы видеокарт. Теперь документы предварительно проходят через каскад классификаторов.

На каждом этапе более сложная и вычислительно затратная модель проверяет все меньшее число документов. Количество вычислений удалось сократить в десятки раз, сохранив около 95% полезных документов. Кроме того, инженеры сильно расширили базу знаний модели в сфере права, медицины и математики.

«Яндекс» представил новую модель под лицензией Apache 2.0. Ее можно будет свободно использовать как в исследовательских, так и в коммерческих целях. Разработчики уже завершили основной этап обучения, от которого зависят эрудированность, способности и потенциал модели. Теперь ее можно использовать как основу для создания собственных проектов.

Модель, технические отчеты и бенчмарки опубликовали на платформе Hugging Face, а техрепорт — на «Хабре».

Exit mobile version