Исследователи выяснили, как нейросети понимают каламбуры
Международная команда с участием исследователей ФКН НИУ ВШЭ представила KoWit-24 — корпус из 2700 заголовков одного из русскоязычных СМИ с игрой слов. Корпус позволил оценить, как искусственный интеллект распознает и объясняет языковую игру. Эксперименты с пятью большими языковыми моделями подтвердили: даже передовые системы пока ошибаются, причем интерпретация игры слов является для них более сложной задачей, чем ее выявление.
Результаты работы были представлены на конференции RANLP, cтатья доступна в репозитории Arxiv.org, датасет и код для воспроизведения экспериментов — в GitHub.
Игра слов — это прием, когда автор специально ломает норму языка ради эффекта: чтобы привлечь внимание, усилить иронию или вызвать улыбку. В российских новостных заголовках такие приемы встречаются часто и могут выглядеть по-разному. Например, «Особо бумажные персоны» обыгрывает фразу «особо важные персоны»: «важные» рифмуются с «бумажные», и смысл сдвигается к производству бумаги. Или «Код накликал» звучит почти так же, как идиома «кот наплакал» (очень мало), что создает шутливую двусмысленность.
Для читателя такая игра слов очевидна и заголовки не нуждаются в пояснении. Однако современные большие языковые модели, например ChatGPT или GigaChat Max, часто теряются: им трудно заметить каламбур и тем более объяснить, на чем построена шутка. Одна из причин — это ограниченность наборов данных, на которых обучаются языковые модели. Чаще всего юмор в них представлен короткими шутками из интернета, которые помечены ярлыком «шутка». Этого мало, чтобы алгоритм понял, почему это смешно. Кроме того, у таких наборов почти нет разметки — понятных машине и человеку слоев описания, которые могут показывать, есть ли там игра слов или нет, какой это тип приема, к чему отсылает заголовок и т.д.
Исследователи факультета компьютерных наук НИУ ВШЭ вместе с коллегами из Австрийского университета междисциплинарных трансформаций, а также независимыми исследователями создали набор данных KoWit-24. Он содержит 2700 заголовков за январь 2021 года — декабрь 2023-го с контекстом: к каждому заголовку приложены подводка к статье, название рубрики и краткое описание сюжета. Для примеров с игрой слов авторы вручную отметили тип приема, выделили «якоря» — ключевые слова, где происходит смысловой сдвиг, указали исходные выражения и добавили ссылки на статьи в «Википедии» там, где это возможно.
Авторы работы использовали определение лингвиста Алана Скотта Партингтона: игра слов возникает, когда одна и та же фраза читается минимум двумя способами, и этот эффект не случаен. При этом игра слов может возникать в нескольких случаях. Первый, когда двусмысленность заложена в самом слове или в его звучании. Например, заголовок «“Волгу” не могут заставить течь быстрее»: «Волга» здесь и река, и название федеральной трассы. Второй — легкая переделка известной фразы или названия: автор меняет форму, а читатель узнает исходник и достраивает шутку. Например, «Миссия сократима» отсылает к фильму «Миссия невыполнима» и одновременно намекает, что дипломатическую миссию можно сократить.
Исследователи отдельно выделили окказионализмы (разовые неологизмы под задачу) и оксюмороны (сочетание противоположных смыслов). Все это позволило не только собрать и описать примеры, но и сравнить разные языковые модели между собой.
После разметки авторы проверили корпус на пяти больших языковых моделях: GPT-4o, YandexGPT4, GigaChat Lite, GigaChat Max и Mistral NeMo. Моделям давали заголовок и подводку к новости и просили решить две задачи: сначала определить, есть ли в заголовке игра слов, а затем объяснить ее, то есть назвать исходную фразу или отсылку. При этом исследователи сравнивали два режима подсказок: короткий вопрос «Есть ли игра слов?» и расширенную инструкцию, в которой объясняется, что считать игрой слов, и приводятся примеры разных типов. Трем моделям из пяти более подробные инструкции помогали в распознавании игры слов, а лучшую точность показала GPT-4o. При этом интерпретировать источник шутки всем моделям заметно сложнее, чем просто фиксировать, что игра слов есть.
«KoWit-24 закрывает две ключевые проблемы прежних наборов — дает контекст к каждому заголовку и многоуровневую разметку. Это превращает подборку примеров в полноценный «тестовый стенд» для ИИ. Теперь можно объективно сравнивать модели между собой: видит ли модель сам факт игры слов, находит ли «якорь», правильно ли восстанавливает исходную фразу или отсылку. Такие проверяемые метрики помогают не только точнее оценивать текущие системы, но и целенаправленно их улучшать — подбирать формулировки подсказок, обучающие примеры и стратегии проверки фактов. В будущем мы хотим исследовать, можно ли с помощью этого набора улучшить генерацию шуток», — отмечает один из авторов работы, доцент факультета компьютерных наук НИУ ВШЭ Павел Браславский.
Кроме того, корпус задает общий понятный стандарт оценки: исследователи работают с одними и теми же данными и сценариями экспериментов. Это уменьшает «шум» в результатах и помогает создавать модели, которые лучше понимают живой язык, а не просто следят за логикой текста.
Американская компания Firebird официально запустила в городе Раздан крупный центр обработки данных и фабрику искусственного интеллекта. На сегодняшний день это самый масштабный технологический хаб подобного уровня в СНГ, а после завершения всех этапов строительства он войдет в пятерку самых мощных вычислительных кластеров в мире.
Когда заканчиваются догадки, начинается генетика. Ученые Сургутского государственного университета совместно с коллегами из Санкт-Петербурга доказали, что анализ ДНК методом полноэкзомного секвенирования способен найти генетические причины редких заболеваний там, где традиционная медицина остается бессильной. Такой способ помог установить причины заболеваний почти у каждого четвертого пациента с подозрением на наследственную патологию, а в перспективе может изменить подход к диагностике редких болезней не только в Югре, но и по всей России.
Британские экологи выяснили, что большинство людей не догадываются о вреде солнцезащитных кремов для Мирового океана. Обзор научной литературы и локальный уличный опрос наглядно продемонстрировали разрыв между реальными экологическими угрозами и повседневными привычками покупателей.
Американская компания Firebird официально запустила в городе Раздан крупный центр обработки данных и фабрику искусственного интеллекта. На сегодняшний день это самый масштабный технологический хаб подобного уровня в СНГ, а после завершения всех этапов строительства он войдет в пятерку самых мощных вычислительных кластеров в мире.
Британские экологи выяснили, что большинство людей не догадываются о вреде солнцезащитных кремов для Мирового океана. Обзор научной литературы и локальный уличный опрос наглядно продемонстрировали разрыв между реальными экологическими угрозами и повседневными привычками покупателей.
Американское Министерство войны продолжает публиковать документы и видеозаписи о наблюдении неопознанных летающих объектов. Как и ранее, происхождение объектов из наблюдений неясно, но достаточно очевидно, что как минимум часть из них не относятся к известным сегодняшней науке природным феноменам.
Долгое время считалось, что до прихода европейцев тропические леса Амазонии были заселены сравнительно плохо. Однако выяснилось, что плотная растительность скрывает большинство следов древних обществ. С помощью воздушного лазерного сканирования ученые обнаружили сотни неизвестных земляных сооружений и предположили, что около двух тысяч лет назад население юго-западной части Амазонии могло достигать трех миллионов человек.
Американская компания Firebird официально запустила в городе Раздан крупный центр обработки данных и фабрику искусственного интеллекта. На сегодняшний день это самый масштабный технологический хаб подобного уровня в СНГ, а после завершения всех этапов строительства он войдет в пятерку самых мощных вычислительных кластеров в мире.
Очереди на заправках стали привычным явлением в России, а на фоне информационного вакуума от властей о конкретных показателях производства бензина в июне население вынуждено ориентироваться на слухи. Все это выглядит довольно странно, но есть нюанс: скорее всего, кризис уже начинает выдыхаться. Как именно мы это выяснили?
Вы попытались написать запрещенную фразу или вас забанили за частые нарушения.
Понятно
Что-то в вашем комментарии показалось подозрительным, поэтому перед публикацией он пройдет модерацию.
Понятно
Из-за нарушений правил сайта на ваш аккаунт были наложены ограничения. Если это ошибка, напишите нам.
Понятно
Наши фильтры обнаружили в ваших действиях признаки накрутки. Отдохните немного и вернитесь к нам позже.
Понятно
Мы скоро изучим заявку и свяжемся с Вами по указанной почте в случае положительного исхода. Спасибо за интерес к проекту.
Понятно
