• Добавить в закладки
  • Facebook
  • Twitter
  • Telegram
  • VK
  • Печать
  • Email
  • Скопировать ссылку
8 июля, 12:33
Редакция Naked Science
1,4 тыс

Исследования «Яндекса» вошли в основную программу одной из крупнейших конференций по ИИ

❋ 4.7

Сегодня перед ИИ-индустрией стоят важные задачи: как эффективнее использовать вычислительные ресурсы, ускорить обучение моделей, работать со сложными данными и снизить зависимость от дорогостоящей ручной разметки? Этим вопросам посвящена серия научных работ, которые исследователи и инженеры «Яндекса» представили на International Conference on Machine Learning. Все эти исследования вошли в основную программу конференции.

Суперкомпьютер «Червоненкис» в дата-центре «Яндекса» в Сасове, Рязанская область / © «Яндекс»

International Conference on Machine Learning (ICML) — одна из крупнейших международных конференций по машинному обучению. Она проходит в Сеуле (Южная Корея) с 6 по 11 июля. 

ICML ежегодно собирает исследователей ведущих университетов, научных центров и технологических компаний мира. В 2026 году на ICML подали 23 918 научных работ. В основную программу вошли 6352 статьи — всего 26,6 процента от общего числа заявок. 

Как эффективнее использовать вычислительные ресурсы

Разработчики искусственного интеллекта сегодня ищут способы повысить производительность моделей, не увеличивая вычислительные мощности. Исследователи «Яндекса» предложили несколько способов, как можно решить эту проблему.

В одной из работ авторы уделили внимание графовым нейросетям. Такие модели анализируют не только объекты, но и связи между ними, например между пользователями и товарами, документами или участками дорожной сети.

Исследователи «Яндекса» предложили новые программные модули, позволяющие гораздо эффективнее использовать память видеокарт. В экспериментах они смогли ускорить вычисления до 8,5 раза, сократить пиковое потребление памяти до 76 раз, а отдельные операции — в 3,9-10 раз.

«Яндекс» уже опубликовал код модулей в открытом доступе. Эта работа получила статус Spotlight — его присваивают статьям с самыми высокими оценками от программного комитета. В этом году такой статус получили 536 работ — всего 2,2 процента от всех поданных.

В другом исследовании авторы предложили, как можно ускорить обучение больших языковых моделей. При использовании метода конвейерного параллелизма (Pipeline Parallelism) часть видеокарт простаивает в ожидании других устройств. Хотя асинхронные схемы позволяют устранить простои, считалось, что задержка градиентов делает их фундаментально нестабильными для больших языковых моделей (LLM).

Как показали исследователи «Яндекса», деградация качества связана не с самой задержкой, а с выбором алгоритма оптимизации. В отличие от классического AdamW, чувствительного к устаревшим градиентам, современные методы, например Muon, значительно лучше переносят их задержку.

Исследователи дополнительно сократили ошибку асинхронного обновления, внедрив легковесную коррекцию, вдохновленную Error-Feedback, на уровне шагов оптимизатора. В результате на моделях Mixture of Experts (MoE) размером 10 миллиардов параметров, обученных на 200 миллиардах токенов, асинхронный метод достиг такого же качества, как при синхронном обучении.

В еще одной статье исследователи «Яндекса» рассказали, как сделать обучение моделей эффективнее. Они предложили два новых алгоритма оптимизации — SoftSignum и SoftMuon. Они определяют, как модель обновляет свои параметры во время обучения. В экспериментах новые методы стабильно превосходили несколько распространенных подходов, в том числе AdamW.

Как работать со сложными данными

Для графовых задач исследователи разработали GraphPFN — модель, предварительно обученную более чем на 1,6 миллиона синтетических графов. Она показала высокое качество даже без дополнительной настройки. Когда модель адаптировали под конкретную задачу, она превзошла все рассмотренные в работе подходы на большинстве реальных наборов данных. Метод позволил быстрее создавать модели для новых задач и использовать меньше данных для обучения.

Еще одно исследование показало, что современные нейросети лучше работают с таблицами, если умеют учитывать неопределенность в данных. Для этого авторы предложили более эффективный способ представления числовых признаков.

Как обучать модели при нехватке данных

Обычно во многих прикладных задачах хватает данных, а вот качественной разметки недостаточно. Это особенно заметно в медицине, промышленности и других областях, где разметка требует участия экспертов.

Чтобы решить эту проблему, исследователи «Яндекса» вместе с другими авторами предложили подход, позволяющий использовать небольшое количество размеченных данных в сочетании с большим объемом неразмеченных. Это помогло обучать модели в задачах, где разметка новых данных обходится слишком дорого или занимает много времени. 

Как ускорить поиск и рекомендации

Поисковые и рекомендательные системы каждый день обрабатывают огромные объемы данных. В «Яндексе» предложили способ ускорить эту работу.

Во многих задачах самая точная модель оказывается слишком ресурсоемкой, чтобы применять ее ко всем возможным вариантам. Новый метод «Яндекса» помог заранее отбирать наиболее подходящих кандидатов, которых затем оценивала более точная модель. Это сократило вычислительные затраты.

Нашли опечатку? Выделите фрагмент и нажмите Ctrl + Enter.
Подписывайтесь на нас в Telegram, Яндекс.Новостях и VK
Предстоящие мероприятия
19 августа, 18:31
Александр Березин

После сокращения длины очередей и роста доступности бензина в первую неделю августа ситуация снова ухудшилась. Если с 20 июня по начало августа кризис носил в основном психологический характер, то сейчас ситуация принципиально иная: августовские атаки на НПЗ показали, что меры по усилению их противовоздушной обороны не были достаточно полными. Значит, прогноз автора Naked Science от 19 июля о том, что острая фаза кризиса закончится до конца лета, был частично неверным.

19 августа, 12:49
Мария Азарова

Воспоминания не исчезают бесследно: иногда пережитый опыт перестает влиять на поведение, хотя его след продолжает сохраняться в мозге. Ученые решили проверить, можно ли вернуть такую «забытую» память и что произойдет, если напомнить о произошедшем не совсем точно.

18 августа, 16:39
Evgenia Vavilova

С помощью ускорителей ученые имитируют процессы, происходившие в первые мгновения жизни Вселенной. Так пытаются решить загадки наблюдаемой реальности: почему материи больше, чем антиматерии, состоят ли кварки из других частиц, как сохраняется барионное число. В этот раз анализ столкновений на коллайдере RHIC предоставил сильное свидетельство того, что барионное число переносится не кварками, а глюонной перемычкой внутри протонов.

16 августа, 11:45
Татьяна Зайцева

В черепах участников битв эпохи Средневековья часто находят отверстия квадратной формы, о происхождении которых спорят специалисты. Авторы нового исследования пришли к выводу, что такое повреждение — следствие смертельного удара по голове палицей.

17 августа, 12:59
Марк Чернов

Анализ почти 69 тысяч видов насекомых помог опровергнуть главенствующую теорию эволюции, которая полвека объясняла устройство колоний пчел, муравьев и ос. Исследователи выяснили, что общепринятый генетический фактор сам по себе не приводит к разделению труда, а настоящий секрет их коллективного выживания кроется в совсем других биологических чертах.

19 августа, 18:31
Александр Березин

После сокращения длины очередей и роста доступности бензина в первую неделю августа ситуация снова ухудшилась. Если с 20 июня по начало августа кризис носил в основном психологический характер, то сейчас ситуация принципиально иная: августовские атаки на НПЗ показали, что меры по усилению их противовоздушной обороны не были достаточно полными. Значит, прогноз автора Naked Science от 19 июля о том, что острая фаза кризиса закончится до конца лета, был частично неверным.

31 июля, 14:12
Андрей Серегин

Долгое время считалось, что до прихода европейцев тропические леса Амазонии были заселены сравнительно плохо. Однако выяснилось, что плотная растительность скрывает большинство следов древних обществ. С помощью воздушного лазерного сканирования ученые обнаружили сотни неизвестных земляных сооружений и предположили, что около двух тысяч лет назад население юго-западной части Амазонии могло достигать трех миллионов человек.

9 августа, 19:34
Марк Чернов

Американская компания Firebird официально запустила в городе Раздан крупный центр обработки данных и фабрику искусственного интеллекта. На сегодняшний день это самый масштабный технологический хаб подобного уровня в СНГ, а после завершения всех этапов строительства он войдет в пятерку самых мощных вычислительных кластеров в мире.

4 августа, 12:03
Александр Березин

Остров Пекан недалеко от Мексиканского залива в Луизиане вскоре перейдет в собственность компании Илона Маска. Здесь будет новый космодром для Starship, почти в 20 раз больше, чем в Бока-Чике, где уже стоят две стартовых площадки. Уникальное местоположение позволит компании попытаться реализовать амбициозную цель о запуске миллиона низкоорбитальных спутников на орбиты, где сегодня находится подавляющее меньшинство спутников Земли.

[miniorange_social_login]

Комментарии

Написать комментарий