158

Ученые предложили эффективную модель для генерации ключевых слов в научном тексте

❋ 4.3

Исследователи Института проблем передачи информации имени А. А. Харкевича РАН и кафедры программного обеспечения Школы компьютерных наук ТюмГУ предложили подход к генерации ключевых слов для русскоязычных научных текстов с помощью модели mT5 (multilingual text-to-text transformer), дообученнной на материале текстового корпуса Keyphrases CS&Math Russian.

Ученые предложили эффективную модель для генерации ключевых слов в научном тексте
Ученые предложили эффективную модель для генерации ключевых слов в научном тексте / © Obi - @pixel8propix, unsplash.com

Ключевые слова – важный элемент научного текста. Их использование позволяет облегчить поиск статей, улучшить систематизацию научных текстов и резюмировать содержание статей для читателя.

Автоматизация подбора ключевых слов представляет собой актуальную задачу в условиях большого количества информационных ресурсов. Сегодня большинство методов подбора этой выборки протестировано на англоязычных текстовых корпусах, в то время как для анализа русскоязычных текстов используется достаточно узкий набор методов выделения ключевых слов.

Статья «Генерация ключевых слов для русскоязычных научных текстов с помощью модели mT5» ученых Анны Глазковой, Дмитрия Морозова, Марины Воробьевой и Андрея Ступникова вышла в журнале «Моделирование и анализ информационных систем».

Существует несколько подходов к подбору ключевых слов: извлечение их непосредственно из текста, подбор из заранее определенного перечня тематики или рубрики, генерация на основе семантики текста путем его обобщения и перефразирования. В последнем случае задача подбора ключевых слов схожа с задачей автоматического абстрактного реферирования текстов.

Большая часть широко используемых подходов к извлечению этих слов основана на выделении из текста наиболее значимых слов и словосочетаний по принципу обучения без учителя (unsupervised learning). К таким подходам относятся, в частности, статистические алгоритмы, такие как YAKE! и KP-Miner, графовые (TopicRank, TextRank) и ряд алгоритмов, основанных на применении методов машинного обучения и современных лингвистических моделей (KEA, KeyBERT).

Несмотря на впечатляющие результаты для ряда текстовых корпусов, алгоритмы, основанные на извлечении ключевых слов, обладают некоторыми ограничениями. В частности, они не способны определять количество этих слов автоматически и генерировать слова, отсутствующие в тексте в явном виде.

На практике же списки ключевых слов обычно включают в себя как слова и словосочетания, встречающиеся в тексте непосредственно, так и слова, семантически связанные с содержанием текста, но не упомянутые в нем явно. Данные ограничения могут быть преодолены при помощи нейросетевых моделей, в том числе современных лингвистических моделей для генерации текстов.

Ученые пытались преодолеть пробел в использовании современных лингвистических моделей для генерации ключевых слов для русскоязычных научных текстов. В статье представлены результаты экспериментов по генерации списка ключевых слов как последовательности токенов (единиц учета) на примере модели mT5.

Выбор модели обусловлен ее широким использованием для автоматического реферирования и, в частности, для реферирования русскоязычных текстов. Результаты сравниваются с результатами ряда широко используемых методов извлечения ключевых слов.

Среди преимуществ генерации ключевых слов с помощью предобученной лингвистической модели можно назвать отсутствие необходимости проводить нормализацию и задавать ограничения на количество и длину ключевых слов, возможность генерировать те слова, которые не упомянуты в исходном тексте в явном виде.

С другой стороны, указанные свойства могут быть также ограничениями указанного подхода. Дообучение рассмотренной модели требует наличия обучающей выборки и, вероятно, дообученная модель ограниченно пригодна для генерации ключевых слов для текстов других предметных областей.

Кроме того, эффективность предложенного подхода и значения метрик зависят от специфики корпуса текстов, используемого для экспериментов. В рассмотренном корпусе доля ключевых слов, не встречающих в тексте в явном виде, составляет 53.17 процента и 54.8 процента для обучающей и тестовой выборок соответственно.

Поскольку подходы, осуществляющие извлечение, а не генерацию ключевых слов, не способны генерировать слова данного типа, модели генерации текста, подобные mT5, имеют преимущество на таких корпусах. Работа выполнена в рамках проекта, поддержанного грантом Президента России для молодых ученых — кандидатов наук.

Нашли опечатку? Выделите фрагмент и нажмите Ctrl (Cmd) + Enter.
ТюмГУ
Тюменский государственный университет (ТюмГУ) — первый университет Тюменской области, был открыт в 1930 году. Готовит специалистов по 175 направлениям подготовки. Университет является участником федеральной программы стратегического академического лидерства «Приоритет 2030». Участие в программе способствует трансформации образовательного, научно-технологического и управленческого блоков ТюмГУ, а также его роли в качестве центра научно-технологического и социально-экономического развития региона.
Подписывайтесь на нас в Telegram, Дзен и в последнюю очередь на VK
Предстоящие мероприятия
22 сентября, 12:52
Марк Чернов

Американские исследователи впервые смогли напрямую увидеть «квантовый скачок» звука — скачкообразный переход фонона, минимальной единицы звуковой энергии, между энергетическими уровнями в реальном времени. Это наблюдение завершило столетнюю историю поисков, начатую еще на заре квантовой физики, и открыло дорогу к созданию устойчивых квантовых компьютеров и сверхчувствительных датчиков.

21 сентября, 16:52
Редакция Naked Science

Всего 20-30 лет назад большинство женщин ходили на каблуках, а большинство мужчин — в обуви, подошва которой серьезно нагружала позвоночник и мышцы спины. Если задуматься, факт поразительный: 20 тысяч лет назад, в палеолите, таких проблем человечество вообще не испытывало. Как так получилось и что новые материалы делают, чтобы все эти сложности стали прошлым?

22 сентября, 08:31
Марк Чернов

Человеческий мозг оказался двумя разными органами, которые объединились в процессе эволюции сотни миллионов лет назад. Исследователи доказали, что передняя и задняя части мозга формируются из совершенно разных стволовых клеток. Это открытие опровергло давнюю научную теорию и позволило впервые вырастить нейроны ствола мозга в лаборатории.

21 сентября, 09:24
Елизавета З.

Европейское космическое агентство опубликовало снимок галактики NGC 4698, расположенной в созвездии Дева. Хотя на фотографии, сделанной телескопом «Хаббл», галактика кажется безмятежной, она хранит удивительную тайну: находящиеся в центре звезды и газ вращаются под прямым углом по отношению к остальной части диска.

21 сентября, 16:52
Редакция Naked Science

Всего 20-30 лет назад большинство женщин ходили на каблуках, а большинство мужчин — в обуви, подошва которой серьезно нагружала позвоночник и мышцы спины. Если задуматься, факт поразительный: 20 тысяч лет назад, в палеолите, таких проблем человечество вообще не испытывало. Как так получилось и что новые материалы делают, чтобы все эти сложности стали прошлым?

21 сентября, 16:53
Елизавета З.

«Яндекс» опубликовал в открытом доступе Alice AI Foundation LLM — претрейн-версию новой большой языковой модели, которую разработчики обучили полностью с нуля. Она хорошо справляется с рассуждениями и задачами по программированию, а качество ответов на русском языке опережает многие зарубежные аналоги. В первую очередь это касается задач на знание фактов, интересных русскоязычной аудитории. Модель обошла даже более крупные опенсорс-модели, при этом для ее интерфейса не нужны большие вычислительные мощности. Свободная лицензия Apache 2.0. позволяет задействовать ее как в исследовательских, так и в коммерческих проектах.

9 сентября, 22:44
Александр Березин

Нейросеть OpenAI добилась серьезного прорыва в математике, решив одну из семи «задач тысячелетия». Получат ли США, чьи нейросети опираются на гораздо более мощное «железо», чем у Китая, монополию на конвейер научных открытий? Даст ли это возможности сравнимые с их атомной монополией 80 лет назад?

28 августа, 15:43
Татьяна Зайцева

Сопротивление жителей Европы самой идее употребления насекомых в пищу может иметь эволюционные корни, уходящие вглубь тысячелетий, пришли к выводу авторы нового исследования. Оказалось, предки современных европейцев ели насекомых лишь эпизодически. Кроме того, из-за генетических мутаций они плохо переваривали их экзоскелеты.

29 августа, 16:51
Александр Березин

Госдолг США достиг 40 триллионов долларов и растет все быстрее и быстрее. На Западе переполох: при таких размерах его не выплатить. Следовательно, полагают многие, надо решить проблему как древние шумеры — долг обнулить и начать занимать заново. Рецепт кажется здравым, но есть нюансы. Причем поучительнее всего они даже не для Штатов, а, как ни странно, именно для России.

[miniorange_social_login]

Комментарии

Написать комментарий