Уведомления
Авторизуйтесь или зарегистрируйтесь, чтобы оценивать материалы, создавать записи и писать комментарии.
Авторизуясь, вы соглашаетесь с правилами пользования сайтом и даете согласие на обработку персональных данных.
Нейросети отфильтруют «неуместные» высказывания чат-ботов
Исследователи из Сколтеха и МТС предложили научный подход к определению «неуместных» текстовых сообщений, представили корпус таких сообщений и нейросеть, обученную их находить. В числе возможных применений — предотвращение репутационного ущерба владельцам чат-ботов, модерация сообщений на форумах и родительский контроль.
Научная статья опубликована в сборнике Proceedings of the 8th Workshop on Balto-Slavic Natural Language Processing. Чат-боты известны своей способностью находить самые неожиданные и творческие способы опозорить компанию, которая их использует. Вдохновленные образцами живой речи расистские твиты, подстрекательство к самоубийству и оправдание рабовладельческого строя — лишь некоторые примеры взаимодействия чат-ботов с темами, которые авторы исследования называют «чувствительными».
Чувствительные темы дают благодатную почву для неуважительной коммуникации. Хотя само по себе их обсуждение вполне приемлемо, оно со сравнительно высокой вероятностью может нанести вред репутации говорящего и потому требует особого внимания со стороны разработчиков чат-ботов. Авторы исследования сформировали список из 18 таких тем, в числе которых религия, политика, сексуальные меньшинства, самоубийство, порнография и преступления. В основу перечня легли рекомендации специалистов МТС по правовым вопросам и связям с общественностью.
Понятие чувствительной темы служит основой для определения неуместных высказываний. Таковыми авторы работы называют сообщения на чувствительную тему, которые способны скомпрометировать говорящего, даже не будучи токсичными. При этом потенциал репутационного вреда определяется респондентом.
«Неуместность — шаг за рамки хорошо изученного понятия токсичности. Эта более тонкая категория охватывает более широкий круг ситуаций, в которых существует риск для репутации владельца чат-бота. Представьте, например, чат-бота, который любезно обсуждает с пользователем „лучшие способы покончить с собой“. Здесь явно имеет место нежелательный контент, но нет и намека на токсичность», — поясняет руководитель исследования, старший преподаватель Сколтеха Александр Панченко.
Для обучения моделей обнаружению чувствительных тем и неуместных сообщений авторы исследования сформировали два корпуса текстов с разметкой в рамках масштабного краудсорсингового проекта. На первом этапе носителям русского языка предложили опознать высказывания на чувствительные темы (и конкретную тему каждого) среди прочих сообщений, взятых с сайтов «Двач» и «Ответы Mail.ru».
На полученном таким образом корпусе обучили нейросетевую модель, которая затем набрала еще примерно столько же чувствительных высказываний с тех же сайтов. Расширенный таким образом датасет по чувствительности послужил основой для получения датасета по неуместности.
«Процент неуместных высказываний в реальных текстах, как правило, невысок. Поэтому для экономии ресурсов на втором этапе мы показывали разметчикам не произвольные сообщения, а примеры из корпуса чувствительных тем. Ведь про них мы подозревали, что они могут оказаться неуместными», — рассказывает Варвара Логачева, соавтор исследования. Увидев каждое сообщение, респондент должен был ответить на вопрос, навредит ли оно репутации отправителя. По итогам этого второго опроса сформировался корпус неуместных сообщений, на котором обучили новую модель распознавать такие сообщения.
«Мы продемонстрировали, что, хотя чувствительность темы и неуместность сообщения — довольно тонкие понятия, завязанные на человеческой интуиции, они тем не менее поддаются детектированию нейросетями, — комментирует результаты исследования один из его авторов, Николай Бабаков (Сколтех).
— В частности, наш классификатор в 89% случаев угадал, какие высказывания являются неуместными по версии респондентов». Коллектив из Сколтеха и МТС выложил в открытый доступ модели для распознавания неуместности и чувствительности высказываний и оба датасета: 163 тысяч предложений с разметкой «уместно — неуместно» и 33 тысяч высказываний на чувствительные темы.
«Наши модели можно усовершенствовать за счет ансамблей или альтернативных архитектур, — добавляет Бабаков. — Один из интересных вариантов продолжения работы — распространить понятие уместности на другие языки. Чувствительность тем варьируется между разными культурами. У каждой культуры свое понимание неуместности, поэтому переход к другим языкам меняет ситуацию.
Кроме того, можно расширить список из 18 чувствительных тем — мы не считаем его исчерпывающим». Результаты исследования были представлены на XVI Конференции европейского подразделения Ассоциации компьютерной лингвистики (EACL 2021).
Внимание тесно связано с воспоминаниями: мы фокусируемся на том, что как-то связано с информацией из долговременной памяти. Однако, как выяснили ученые из Канады и США, эта связь сложнее, чем принято было считать, и иногда не помогает, а мешает сконцентрироваться.
Лауреатами Нобелевской премии по химии в этом году стали Дэвид Бейкер, Демис Хассабис и Джон М. Джампер, которые «взломали код удивительных структур белков».
С помощью данных марсохода Curiosity в кратере Гейл на Красной планете обнаружили карбонатные минералы с аномально высоким содержанием тяжелых изотопов углерода и кислорода. Открытие предоставляет важную информацию о том, каким был климат на Марсе миллиарды лет назад.
Международная исследовательская группа совместно с биологами из Университета Мэриленда (США) обнаружила у геккона токи (Gekko gecko) способность воспринимать низкочастотные вибрации с помощью саккула — органа во внутреннем ухе, который, как считалось ранее, отвечает исключительно за равновесие и ориентацию в пространстве.
В Мурманской области не добывают золото: его месторождений здесь пока не нашли. Впрочем, сообщения о находках этого металла датируются еще XVIII веком. Геологам также известны в Кольском регионе рудопроявления золота — минеральные тела, содержащее драгоценный металл в ассоциации с другими минералами, характерными для промышленных руд, но в таком количестве, что при нынешнем развитии экономики и технологий добывать его нерентабельно. Чтобы обнаружить в Кольском Заполярье месторождения золота, необходимы новые исследования. Ученые Геологического института Кольского научного центра провели их и узнали о природе местных рудопроявлений.
Внимание тесно связано с воспоминаниями: мы фокусируемся на том, что как-то связано с информацией из долговременной памяти. Однако, как выяснили ученые из Канады и США, эта связь сложнее, чем принято было считать, и иногда не помогает, а мешает сконцентрироваться.
Марс не всегда был холодным и сухим, как сейчас. Все больше фактов говорит о том, что миллиарды лет назад там текли водные потоки. А значит, была плотная атмосфера, создающая парниковый эффект и поддерживающая воду в жидком состоянии. Примерно 3,5 миллиарда лет назад вода исчезла, газовая оболочка существенно поредела. Почему? Ответ буквально лежит на поверхности, выяснили американские геологи.
Французские исследователи проанализировали тысячи спутниковых снимков поверхности Антарктиды и выяснили, что почти весь континент покрывают продольные дюны — такой рельеф часто встречается на спутнике Сатурна Титане. Ученые также узнали, какие ветры формируют антарктические дюны, и нашли противоречие, раскрывающее детали климата на континенте.
Инженеры из Белоруссии разработали альтернативный маршрут для более быстрой, безопасной и доступной перевозки грузов по сравнению с использованием Северного морского пути (СМП). Проект предусматривает организацию высокоскоростных грузопассажирских перевозок, в том числе транзитных, что станет альтернативой другим видам транспорта, в первую очередь авиации, за счет высокой скорости передвижения и уровня комфорта.
5 раз пытался комментарий написать со ссылкой на «Парламентскую газету»Как там сказано выше "пальцы бы тебе поотрубать" )) Да нет никакой политики просто движок глючит. А может ваши борцы с нежелательным контентом стараются.
The Golden Shield Project же в России внедряютКитайцы, когда им приспичивает, как-то обходят эту напасть. Россияне навряд ли глупее.
Там все уже приказано. Чуть выше давал Ивану ссылку на HabrВот только у вас в голове она перевернулось. Разумеется тестирование _работоспособности_ интернета проводилось на случай внешнего отключения. Вполне ожидаемая угроза в свете ваших скакалок "требуем отключить Россию от..." К примеру сейчаc Украина усиленно продавливает отключение России от SWIFT. Что конечно будет весьма неприятно, но отнюдь не катастрофа как думают ваши кравчуки и тарасы
Россияне умнее как раз.Задорный так сказал?
5 раз пытался комментарий написать со ссылкой на «Парламентскую газету»Как там сказано выше "пальцы бы тебе поотрубать" )) Да нет никакой политики просто движок глючит. А может ваши борцы с нежелательным контентом стараются.
Комментарии