Ученые предложили эффективную модель для генерации ключевых слов в научном тексте
Исследователи Института проблем передачи информации имени А. А. Харкевича РАН и кафедры программного обеспечения Школы компьютерных наук ТюмГУ предложили подход к генерации ключевых слов для русскоязычных научных текстов с помощью модели mT5 (multilingual text-to-text transformer), дообученнной на материале текстового корпуса Keyphrases CS&Math Russian.
Ключевые слова – важный элемент научного текста. Их использование позволяет облегчить поиск статей, улучшить систематизацию научных текстов и резюмировать содержание статей для читателя.
Автоматизация подбора ключевых слов представляет собой актуальную задачу в условиях большого количества информационных ресурсов. Сегодня большинство методов подбора этой выборки протестировано на англоязычных текстовых корпусах, в то время как для анализа русскоязычных текстов используется достаточно узкий набор методов выделения ключевых слов.
Статья «Генерация ключевых слов для русскоязычных научных текстов с помощью модели mT5» ученых Анны Глазковой, Дмитрия Морозова, Марины Воробьевой и Андрея Ступникова вышла в журнале «Моделирование и анализ информационных систем».
Существует несколько подходов к подбору ключевых слов: извлечение их непосредственно из текста, подбор из заранее определенного перечня тематики или рубрики, генерация на основе семантики текста путем его обобщения и перефразирования. В последнем случае задача подбора ключевых слов схожа с задачей автоматического абстрактного реферирования текстов.
Большая часть широко используемых подходов к извлечению этих слов основана на выделении из текста наиболее значимых слов и словосочетаний по принципу обучения без учителя (unsupervised learning). К таким подходам относятся, в частности, статистические алгоритмы, такие как YAKE! и KP-Miner, графовые (TopicRank, TextRank) и ряд алгоритмов, основанных на применении методов машинного обучения и современных лингвистических моделей (KEA, KeyBERT).
Несмотря на впечатляющие результаты для ряда текстовых корпусов, алгоритмы, основанные на извлечении ключевых слов, обладают некоторыми ограничениями. В частности, они не способны определять количество этих слов автоматически и генерировать слова, отсутствующие в тексте в явном виде.
На практике же списки ключевых слов обычно включают в себя как слова и словосочетания, встречающиеся в тексте непосредственно, так и слова, семантически связанные с содержанием текста, но не упомянутые в нем явно. Данные ограничения могут быть преодолены при помощи нейросетевых моделей, в том числе современных лингвистических моделей для генерации текстов.
Ученые пытались преодолеть пробел в использовании современных лингвистических моделей для генерации ключевых слов для русскоязычных научных текстов. В статье представлены результаты экспериментов по генерации списка ключевых слов как последовательности токенов (единиц учета) на примере модели mT5.
Выбор модели обусловлен ее широким использованием для автоматического реферирования и, в частности, для реферирования русскоязычных текстов. Результаты сравниваются с результатами ряда широко используемых методов извлечения ключевых слов.
Среди преимуществ генерации ключевых слов с помощью предобученной лингвистической модели можно назвать отсутствие необходимости проводить нормализацию и задавать ограничения на количество и длину ключевых слов, возможность генерировать те слова, которые не упомянуты в исходном тексте в явном виде.
С другой стороны, указанные свойства могут быть также ограничениями указанного подхода. Дообучение рассмотренной модели требует наличия обучающей выборки и, вероятно, дообученная модель ограниченно пригодна для генерации ключевых слов для текстов других предметных областей.
Кроме того, эффективность предложенного подхода и значения метрик зависят от специфики корпуса текстов, используемого для экспериментов. В рассмотренном корпусе доля ключевых слов, не встречающих в тексте в явном виде, составляет 53.17 процента и 54.8 процента для обучающей и тестовой выборок соответственно.
Поскольку подходы, осуществляющие извлечение, а не генерацию ключевых слов, не способны генерировать слова данного типа, модели генерации текста, подобные mT5, имеют преимущество на таких корпусах. Работа выполнена в рамках проекта, поддержанного грантом Президента России для молодых ученых — кандидатов наук.
Сопротивление жителей Европы самой идее употребления насекомых в пищу может иметь эволюционные корни, уходящие вглубь тысячелетий, пришли к выводу авторы нового исследования. Оказалось, предки современных европейцев ели насекомых лишь эпизодически. Кроме того, из-за генетических мутаций они плохо переваривали их экзоскелеты.
Госдолг США достиг 40 триллионов долларов и растет все быстрее и быстрее. На Западе переполох: при таких размерах его не выплатить. Следовательно, полагают многие, надо решить проблему как древние шумеры — долг обнулить и начать занимать заново. Рецепт кажется здравым, но есть нюансы. Причем поучительнее всего они даже не для Штатов, а, как ни странно, именно для России.
Международная группа ученых обнаружила следы трех неизвестных ранее правителей Ассирийской империи, существование которых ставит под сомнение полноту и объективность древних хроник. Исследователи доказали, что царские списки, считавшиеся более века незыблемым источником, составляли с учетом политической цензуры.
Сопротивление жителей Европы самой идее употребления насекомых в пищу может иметь эволюционные корни, уходящие вглубь тысячелетий, пришли к выводу авторы нового исследования. Оказалось, предки современных европейцев ели насекомых лишь эпизодически. Кроме того, из-за генетических мутаций они плохо переваривали их экзоскелеты.
Ученые РГУ нефти и газа (НИУ) имени И.М. Губкина разработали первый отечественный гелеобразователь для гидроразрыва пласта на основе сжиженных углеводородных газов. Разработка позволяет заместить импортные реагенты, необходимые для освоения трудноизвлекаемых запасов нефти.
Госдолг США достиг 40 триллионов долларов и растет все быстрее и быстрее. На Западе переполох: при таких размерах его не выплатить. Следовательно, полагают многие, надо решить проблему как древние шумеры — долг обнулить и начать занимать заново. Рецепт кажется здравым, но есть нюансы. Причем поучительнее всего они даже не для Штатов, а, как ни странно, именно для России.
Долгое время считалось, что до прихода европейцев тропические леса Амазонии были заселены сравнительно плохо. Однако выяснилось, что плотная растительность скрывает большинство следов древних обществ. С помощью воздушного лазерного сканирования ученые обнаружили сотни неизвестных земляных сооружений и предположили, что около двух тысяч лет назад население юго-западной части Амазонии могло достигать трех миллионов человек.
Американская компания Firebird официально запустила в городе Раздан крупный центр обработки данных и фабрику искусственного интеллекта. На сегодняшний день это самый масштабный технологический хаб подобного уровня в СНГ, а после завершения всех этапов строительства он войдет в пятерку самых мощных вычислительных кластеров в мире.
После сокращения длины очередей и роста доступности бензина в первую неделю августа ситуация снова ухудшилась. Если с 20 июня по начало августа кризис носил в основном психологический характер, то сейчас ситуация принципиально иная: августовские атаки на НПЗ показали, что меры по усилению их противовоздушной обороны не были достаточно полными. Значит, прогноз автора Naked Science от 19 июля о том, что острая фаза кризиса закончится до конца лета, был частично неверным.
Вы попытались написать запрещенную фразу или вас забанили за частые нарушения.
Понятно
Что-то в вашем комментарии показалось подозрительным, поэтому перед публикацией он пройдет модерацию.
Понятно
Из-за нарушений правил сайта на ваш аккаунт были наложены ограничения. Если это ошибка, напишите нам.
Понятно
Наши фильтры обнаружили в ваших действиях признаки накрутки. Отдохните немного и вернитесь к нам позже.
Понятно
Мы скоро изучим заявку и свяжемся с Вами по указанной почте в случае положительного исхода. Спасибо за интерес к проекту.
Понятно