Исследователи «Яндекса» представили способ повысить качество работы рекомендательных систем
Исследователи рекомендательных технологий «Яндекса» нашли способ, как повысить качество работы рекомендательных систем, чтобы они лучше понимали предпочтения пользователей, например, в товарах или контенте, и составляли более точные рекомендации. Для этого исследователи внедрили дополнительную корректировку в процесс обучения таких моделей.
Внутреннее тестирование «Яндекса» показало, что новый подход позволяет повысить точность рекомендаций моделей в среднем на семь процентов по показателям качества ранжирования. «Яндекс» планирует использовать метод при обучении рекомендательных моделей собственных сервисов, в частности «Маркета». Метод будет полезен и другим компаниям, а также независимым разработчикам, работающим с рекомендательными системами в любой сфере — будь то соцсеть, интернет-магазин или стриминговый сервис.
О новом методе исследователи «Яндекса» рассказали в научной статье, которая была принята на ACM RecSys 2025. Это главная ежегодная международная конференция по рекомендательным системам, которая в этом году пройдет в девятнадцатый раз в Чехии. На конференцию также приняты работы крупнейших мировых технологических компаний — Amazon, Google и других.
Неточности при обучении рекомендательных систем
Рекомендательные системы обычно работают с миллионами объектов — текстами, аудио, видео, товарами. Это требует больших вычислительных ресурсов. Но сначала модель нужно обучить также на миллионах примеров, и для этого тоже необходимо много ресурсов. Чтобы сделать этот процесс менее ресурсоемким, во всем мире используют разные методы, которые заменяют сложные расчеты на более простые. Один из таких методов — sampled softmax, или алгоритм выборочного сэмплирования.
Его суть в том, что систему обучают различать предпочтения людей путем сравнения реализованных действий, которые пользователи совершили по отношению к конкретному объекту (положительные примеры), с нереализованными действиями, которых они не совершали относительно того же объекта (отрицательные примеры). В качестве объекта, например, может выступать определенный товар, тогда положительный пример — это добавление в корзину, а отрицательный — просмотр на сайте без добавления.
Обучение системы строится на том, что ей показывают положительный пример и отрицательные, — и благодаря этому модель начинает отличать одно от другого. Но можно показать ей миллионы отрицательных примеров из обучающего каталога, а можно лишь несколько случайно выбранных — в этом и заключается преимущество метода sampled softmax, которое позволяет экономить вычислительные ресурсы. Однако этот метод может привести к некачественному обучению из-за некорректного учета вероятностей — актуальна ли для пользователя рекомендация или нет. В результате модель будет давать неверные рекомендации.
Решение с помощью новой формулы
Для корректной работы метода требуется использовать обновленную формулу пересчета вероятностей того, что пользователь заинтересуется определенным товаром или контентом, — LogQ. Главная математическая трудность была в том, что существующие методы предполагают одинаковые правила отбора для всех примеров, а на практике положительные и отрицательные примеры попадают в данные по-разному. Из-за этого стандартные формулы начинают систематически искажать оценки, и требовалось специально скорректировать пересчет вероятностей, чтобы сделать модель объективнее.
Благодаря формуле модель при обучении начинает понимать, что реальные действия пользователя выбираются не случайным образом и явно задаются ей как положительные примеры, а остальные примеры — отрицательные и выбраны случайно. Это позволяет уменьшить смещения в оценках со стороны модели, то есть искажения, влияющие на точность ее финальных рекомендаций. В результате модель лучше понимает предпочтения пользователей и, как следствие, дает им более подходящие рекомендации.
Компании и разработчики могут использовать новую формулу при обучении любой рекомендательной системы. Для этого им не придется менять архитектуру своих моделей.
Американская компания Firebird официально запустила в городе Раздан крупный центр обработки данных и фабрику искусственного интеллекта. На сегодняшний день это самый масштабный технологический хаб подобного уровня в СНГ, а после завершения всех этапов строительства он войдет в пятерку самых мощных вычислительных кластеров в мире.
Авторы новой работы утверждают, что общий предок всего живого (LUCA) по сути не был свободноживущим организмом. А его потомки, чтобы стать такими, пошли двумя принципиально разными путями, образовав две принципиально разные группы существ.
Американское Министерство войны продолжает публиковать документы и видеозаписи о наблюдении неопознанных летающих объектов. Как и ранее, происхождение объектов из наблюдений неясно, но достаточно очевидно, что как минимум часть из них не относятся к известным сегодняшней науке природным феноменам.
Американская компания Firebird официально запустила в городе Раздан крупный центр обработки данных и фабрику искусственного интеллекта. На сегодняшний день это самый масштабный технологический хаб подобного уровня в СНГ, а после завершения всех этапов строительства он войдет в пятерку самых мощных вычислительных кластеров в мире.
Американское Министерство войны продолжает публиковать документы и видеозаписи о наблюдении неопознанных летающих объектов. Как и ранее, происхождение объектов из наблюдений неясно, но достаточно очевидно, что как минимум часть из них не относятся к известным сегодняшней науке природным феноменам.
Американские палеонтологи собрали первую научно достоверную копию скелета Deinosuchus schwimmeri — суперхищника длиной 9,5 метра, обитавшего в меловом периоде. В процессе реконструкции ученые провели ревизию уже найденных окаменелостей, упразднили один сомнительный вид и описали новый. В итоге исследователи классифицировали животное как предка аллигаторов, а еще нашли у него интересные анатомические особенности пока неясного назначения.
Долгое время считалось, что до прихода европейцев тропические леса Амазонии были заселены сравнительно плохо. Однако выяснилось, что плотная растительность скрывает большинство следов древних обществ. С помощью воздушного лазерного сканирования ученые обнаружили сотни неизвестных земляных сооружений и предположили, что около двух тысяч лет назад население юго-западной части Амазонии могло достигать трех миллионов человек.
Очереди на заправках стали привычным явлением в России, а на фоне информационного вакуума от властей о конкретных показателях производства бензина в июне население вынуждено ориентироваться на слухи. Все это выглядит довольно странно, но есть нюанс: скорее всего, кризис уже начинает выдыхаться. Как именно мы это выяснили?
Остров Пекан недалеко от Мексиканского залива в Луизиане вскоре перейдет в собственность компании Илона Маска. Здесь будет новый космодром для Starship, почти в 20 раз больше, чем в Бока-Чике, где уже стоят две стартовых площадки. Уникальное местоположение позволит компании попытаться реализовать амбициозную цель о запуске миллиона низкоорбитальных спутников на орбиты, где сегодня находится подавляющее меньшинство спутников Земли.
Вы попытались написать запрещенную фразу или вас забанили за частые нарушения.
Понятно
Что-то в вашем комментарии показалось подозрительным, поэтому перед публикацией он пройдет модерацию.
Понятно
Из-за нарушений правил сайта на ваш аккаунт были наложены ограничения. Если это ошибка, напишите нам.
Понятно
Наши фильтры обнаружили в ваших действиях признаки накрутки. Отдохните немного и вернитесь к нам позже.
Понятно
Мы скоро изучим заявку и свяжемся с Вами по указанной почте в случае положительного исхода. Спасибо за интерес к проекту.
Понятно
Последние комментарии