Новый Завет поможет в спасении исчезающих языков
6 минут
Редакция

Новый Завет поможет в спасении исчезающих языков

Международная группа лингвистов опубликовала параллельный корпус переводов Нового Завета, который может использоваться в обучении алгоритмов машинного перевода.

brms7_matthew2-3_1000
©Wikipedia

В настоящее время в мире существует порядка семи тысяч языков. Подавляющее большинство людей (95 процентов) говорит лишь на 100 из них, тогда как около половины используют только английский, русский, китайский, испанский и хинди.  Носителями примерно трети живых языков выступают менее одной тысячи человек — в ближайшее столетие этим диалектам грозит исчезновение. Вместе с языками под угрозой находится соответствующее культурное наследие, в том числе специфические абстрактные понятия и идиомы. Предполагается, что алгоритмы машинного перевода могут помочь в их сохранении.

 

Однако для успешного освоения материала системам машинного обучения требуются большие объемы текстов, аннотированных на языке. Необходимое количество размеченных стимулов существует только для некоторых языков. Например, крупнейший сервис онлайн-перевода Google Translate рассчитан на работу всего с 90 языками. Поэтому ученые ищут способы, которые позволяют обучать алгоритмы на сравнительно малых объемах аннотированных текстов. В новой работе специалисты из Мюнхенского университета Людвига-Максимилиана и Калифорнийского университета в Беркли представили такую технологию.

 

На первом этапе авторы создали корпус из 1169 переводов Нового Завета — наиболее распространенного текста в мире. Несмотря на объем, незначительный для стандартных тренировок автоматических переводчиков, он обладает важным преимуществом: благодаря религиозному содержанию Новый Завет широко представлен в различных языковых системах. Учитывая, что почти ни один вариант перевода не позволяет оценить все уровни языков, ученые предположили, что они, тем не менее, могут обеспечить представление о базовых грамматических категориях. Сопоставлять образцы они предложили по лингвистическим функциям.

 

Кластеризация маркеров будущего времени на примере 100 языков / ©Ehsaneddin Asgari et al., arXiv.org, 2017

 

Описанный подход заключается в том, что лингвист самостоятельно определяет и отмечает в нескольких переводах потенциальные маркеры языка и ассоциирующиеся с ними понятия. Затем наиболее близкие соответствия в остальном тексте объединяются в кластеры путем автоматического анализа. Методика испытывалась на 100 случайно отобранных переводах Нового Завета: исследователи выделили маркеры разных форм времени. Несмотря на необходимость дальнейшего совершенствования, полученная карта позволяет выяснить, какие языки используют схожую грамматику при образовании времен.

 

К недостаткам техники ученые отнесли низкую чувствительность: так, она не рассчитана на различение словоформ. Потенциально, помимо обучения автоматических переводчиков, она в то же время может использоваться для изучения эволюции языков. Ранее лингвисты из Германии и Австралии выяснили, почему люди склонны ошибаться при идентификации иностранных языков на слух — это в том числе объясняется схожей лексикой (например, в случае латышского и эстонского языков). Эксперимент, проводившийся в игровой форме, также позволил выявить фонетическое и географическое родство некоторых языков.

 

Исследование опубликовано на сервере препринтов arXiv.org.

Нашли опечатку? Выделите фрагмент и нажмите Ctrl + Enter.
3 июля
4 минуты
Сергей Васильев

Одна из самых больших черных дыр обладает соответствующим аппетитом: имея массу около 34 миллиардов масс Солнца, она добавляет еще по одной каждый день.

4 часа назад
26 минут
Илья Ведмеденко

Новый БПЛА С-70 «Охотник» может стать главным российским проектом в сфере боевой авиации. Но сначала ему нужно подтвердить свою пользу.

3 июля
4 минуты
Денис Гордеев

Dodge Durango SRT Hellcat свергает с вершины Jeep Grand Cherokee Trackhawk.

3 июля
4 минуты
Сергей Васильев

Одна из самых больших черных дыр обладает соответствующим аппетитом: имея массу около 34 миллиардов масс Солнца, она добавляет еще по одной каждый день.

1 июля
5 минут
Сергей Васильев

Точные данные о локализации центра масс Солнечной системы важны для поиска гравитационных волн, поэтому астрономы выяснили его с ошибкой не более 100 метров.

4 часа назад
26 минут
Илья Ведмеденко

Новый БПЛА С-70 «Охотник» может стать главным российским проектом в сфере боевой авиации. Но сначала ему нужно подтвердить свою пользу.

27 июня
8 минут
Sergei Sobol

Уроки астрономии вернулись в российские школы в 2018 году. За то время, пока эта наука была необязательным предметом, в ней произошло много событий, не все из которых нашли отражение в учебниках. Кроме того, в них и раньше не были упомянуты многие интересные факты.

1 июля
5 минут
Мария Кривоченко

Один из детекторов Большого адронного коллайдера обнаружил новую частицу, состоящую из четырех очарованных кварков. Физики полагают, что это первый представитель неописанного класса частиц.

18 июня
9 минут
Sergei Sobol

Россия знала многих правителей. Сможете ли вы распознать их по следу, оставленному в истории?

[miniorange_social_login]

Комментарии

Написать комментарий

Подтвердить?
Лучшие материалы
Предстоящие мероприятия
Войти
Регистрируясь, вы соглашаетесь с правилами использования сайта и даете согласие на обработку персональных данных.

Сообщить об опечатке

Текст, который будет отправлен нашим редакторам: