• Добавить в закладки
  • Facebook
  • Twitter
  • Telegram
  • VK
  • Печать
  • Email
  • Скопировать ссылку
13.05.2021, 11:24
Сколтех
1
1,2 тыс

Нейронные языковые модели расширили освоение человеческой речи

❋ 4.7

Исследователи Сколтеха и их коллеги провели первое в своем роде масштабное вычислительное исследование, в ходе которого сравнили самые современные языковые модели на основе нейронных сетей и оценили их возможности по решению одной из важнейших задач обработки естественного языка – лексической замены.

Нейронные языковые модели углубили освоение человеческой речи / ©Getty images / Автор: Visellia Orfius

Результаты исследования были представлены на 28-й Международной конференции по компьютерной лингвистике (COLING-2020). Лексическая замена – это замена слова в предложении на другое слово, которое тем или иным образом связано с исходным словом и подходит для употребления в данном контексте. Например, в предложении «Пётр Ильич Чайковский – великий русский композитор» слово «великий» можно заменить синонимом «выдающийся».

В предложении «Мой брат − профессиональный теннисист» слово «теннисист» можно заменить на гипероним (то есть слово с более широким значением) «спортсмен», а вместо фразы «Я сегодня на машине» автомобилист вполне может сказать: «Я сегодня на колесах» (слово «колесо» является меронимом, то есть понятием, обозначающим составную часть целого предмета).

Для человека как носителя языка лексическая замена – вещь вполне простая и естественная, чего нельзя сказать о компьютере, решающем задачи обработки естественного языка (NLP). Компьютеру приходится «овладевать навыками» индукции, чтобы научиться определять значение слова по контексту, исправлять орфографические ошибки в зависимости от смысла слова и даже решать более сложные задачи, например, перефразирование или упрощение текста.

Именно для решения таких задач и создаются языковые модели на основе глубоких нейронных сетей, способные выполнять лексическую замену в зависимости от ближайшего контекста целевого слова. Старший преподаватель Сколтеха Александр Панченко и его коллеги из Исследовательского центра Samsung в России, НИУ ВШЭ и МГУ имени М. В. Ломоносова сравнили пять языковых моделей на основе нейронных сетей, поставив перед ними две задачи − собственно лексическая замена и индукция значения слова (во втором случае компьютер должен был уловить разницу между омонимами, например, словом «среда» в значении «окружающая среда» или «день недели»).

По мнению ученых, полученные результаты могут оказаться полезными при решении чисто практических задач NLP. В частности, исследователи показали связь между конкретной моделью и типом семантических отношений между словами (синоним, омоним, гипероним и так далее), а также установили, что наличие дополнительной информации о целевом слове позволяет значительно (или существенно, если продолжать тему синонимов) улучшить качество лексической замены.

«Во-первых, результаты нашего исследования по лексической замене можно применять для целей изучения языка (замена слов на более простые). Во-вторых, их можно использовать для аугментации текстовых данных при обучении нейронных сетей. Аналогичные методы аугментации уже широко используются в компьютерном зрении, а вот в анализе текста они пока применяются не так часто. Также вполне реально использовать их при написании текстов в качестве вспомогательного средства для автоматического подбора синонимов и перефразирования текста», − отмечает Александр Панченко.

Нашли опечатку? Выделите фрагмент и нажмите Ctrl + Enter.
Сколтех
Сколковский институт науки и технологий — негосударственный технологический университет, расположенный в инновационном центре Сколково. Институт был создан в 2011 году при поддержке Массачусетского технологического института. Модель института предусматривает тесную интеграцию технологического образования, исследовательской работы и предпринимательских навыков. Институт ведёт обучение по программам магистратуры и PhD, рабочий язык — английский.
Подписывайтесь на нас в Telegram, Яндекс.Новостях и VK
Предстоящие мероприятия
29 августа, 16:51
Александр Березин

Госдолг США достиг 40 триллионов долларов и растет все быстрее и быстрее. На Западе переполох: при таких размерах его не выплатить. Следовательно, полагают многие, надо решить проблему как древние шумеры — долг обнулить и начать занимать заново. Рецепт кажется здравым, но есть нюансы. Причем поучительнее всего они даже не для Штатов, а, как ни странно, именно для России.

31 августа, 13:59
Мария Азарова

Мумии сохраняют следы не только болезней и травм, но и самих процедур, которым подвергали тела после смерти. Компьютерная томография головы мумии, много десятилетий пролежавшей в музее, раскрыла не совсем привычный способ извлечения мозга и другие детали бальзамирования.

31 августа, 16:00
Татьяна Зайцева

Археологи, проводящие раскопки древнего города Адрамиттейон в Западной Турции, обнаружили богатую римскую виллу II-III веков нашей эры. Украшающая виллу мозаика включает в себя неожиданно личный элемент жизни владельцев — изображения домашних питомцев с надписями, указывающими их имена.

28 августа, 15:43
Татьяна Зайцева

Сопротивление жителей Европы самой идее употребления насекомых в пищу может иметь эволюционные корни, уходящие вглубь тысячелетий, пришли к выводу авторы нового исследования. Оказалось, предки современных европейцев ели насекомых лишь эпизодически. Кроме того, из-за генетических мутаций они плохо переваривали их экзоскелеты.

26 августа, 17:59
МАИ

Ребенок легче взрослого, быстрее осваивается в новой обстановке и обладает пластичной нервной системой — значит, невесомость он перенесет проще. Это рассуждение звучит убедительно ровно до тех пор, пока ребенка считают уменьшенной копией взрослого. На самом деле его скелет еще набирает прочность, мышцы учатся работать вместе с нервной системой, вестибулярный аппарат настраивает ощущение положения тела, а органы и ткани проходят этапы, которые нельзя повторить после завершения роста. Если в этот период убрать постоянную нагрузку земного притяжения, организм будет не только приспосабливаться к новой среде: он станет формироваться внутри нее. Каким получится результат, медицина сегодня не знает: длительных орбитальных исследований с участием несовершеннолетних не проводилось.

29 августа, 16:51
Александр Березин

Госдолг США достиг 40 триллионов долларов и растет все быстрее и быстрее. На Западе переполох: при таких размерах его не выплатить. Следовательно, полагают многие, надо решить проблему как древние шумеры — долг обнулить и начать занимать заново. Рецепт кажется здравым, но есть нюансы. Причем поучительнее всего они даже не для Штатов, а, как ни странно, именно для России.

9 августа, 19:34
Марк Чернов

Американская компания Firebird официально запустила в городе Раздан крупный центр обработки данных и фабрику искусственного интеллекта. На сегодняшний день это самый масштабный технологический хаб подобного уровня в СНГ, а после завершения всех этапов строительства он войдет в пятерку самых мощных вычислительных кластеров в мире.

28 августа, 15:43
Татьяна Зайцева

Сопротивление жителей Европы самой идее употребления насекомых в пищу может иметь эволюционные корни, уходящие вглубь тысячелетий, пришли к выводу авторы нового исследования. Оказалось, предки современных европейцев ели насекомых лишь эпизодически. Кроме того, из-за генетических мутаций они плохо переваривали их экзоскелеты.

1 августа, 20:27
Evgenia Vavilova

Команда исследователей из Германии и Турции впервые исследовала ледник на вершине Большого Арарата на высоте более пяти тысяч метров. Две недели в июле 2026 года ученые собирали данные о вечных снегах горы, которые до этого не были тщательно исследованы.

[miniorange_social_login]

Комментарии

1 Комментарий
Материалы Сколтеха комментировать нельзя?!.. Всяко, мне это уже дважды не удалось...Вот сейчас попробовал, опять новый комментарий не появился. Сейчас проверю, можно ли критиковать, отредактировав уже прошедшую реплику?..Читаешь вот такое -- "для аугментации текстовых данных" -- и невольно вспоминаешь профессора Преображенского: "Потрудитесь излагать ваши мысли яснее..." Даже слазив в интернет не нашел значения слова "аугментация", применимого к машинному лингвистическому анализу текстов, а только к музыке, стоматологии и компьютерным играм... Друг наш, Сколтех, об одном тебя прошу: не говори красиво... А если уж говоришь, то сказанное сложно поясняй простыми словами...