17.05.2017, 13:34
6 минут
Руслан Зораб
3

Новый Завет поможет в спасении исчезающих языков

Международная группа лингвистов опубликовала параллельный корпус переводов Нового Завета, который может использоваться в обучении алгоритмов машинного перевода.

brms7_matthew2-3_1000

В настоящее время в мире существует порядка семи тысяч языков. Подавляющее большинство людей (95 процентов) говорит лишь на 100 из них, тогда как около половины используют только английский, русский, китайский, испанский и хинди.  Носителями примерно трети живых языков выступают менее одной тысячи человек — в ближайшее столетие этим диалектам грозит исчезновение. Вместе с языками под угрозой находится соответствующее культурное наследие, в том числе специфические абстрактные понятия и идиомы. Предполагается, что алгоритмы машинного перевода могут помочь в их сохранении.

 

Однако для успешного освоения материала системам машинного обучения требуются большие объемы текстов, аннотированных на языке. Необходимое количество размеченных стимулов существует только для некоторых языков. Например, крупнейший сервис онлайн-перевода Google Translate рассчитан на работу всего с 90 языками. Поэтому ученые ищут способы, которые позволяют обучать алгоритмы на сравнительно малых объемах аннотированных текстов. В новой работе специалисты из Мюнхенского университета Людвига-Максимилиана и Калифорнийского университета в Беркли представили такую технологию.

 

На первом этапе авторы создали корпус из 1169 переводов Нового Завета — наиболее распространенного текста в мире. Несмотря на объем, незначительный для стандартных тренировок автоматических переводчиков, он обладает важным преимуществом: благодаря религиозному содержанию Новый Завет широко представлен в различных языковых системах. Учитывая, что почти ни один вариант перевода не позволяет оценить все уровни языков, ученые предположили, что они, тем не менее, могут обеспечить представление о базовых грамматических категориях. Сопоставлять образцы они предложили по лингвистическим функциям.

 

Кластеризация маркеров будущего времени на примере 100 языков / ©Ehsaneddin Asgari et al., arXiv.org, 2017

 

Описанный подход заключается в том, что лингвист самостоятельно определяет и отмечает в нескольких переводах потенциальные маркеры языка и ассоциирующиеся с ними понятия. Затем наиболее близкие соответствия в остальном тексте объединяются в кластеры путем автоматического анализа. Методика испытывалась на 100 случайно отобранных переводах Нового Завета: исследователи выделили маркеры разных форм времени. Несмотря на необходимость дальнейшего совершенствования, полученная карта позволяет выяснить, какие языки используют схожую грамматику при образовании времен.

 

К недостаткам техники ученые отнесли низкую чувствительность: так, она не рассчитана на различение словоформ. Потенциально, помимо обучения автоматических переводчиков, она в то же время может использоваться для изучения эволюции языков. Ранее лингвисты из Германии и Австралии выяснили, почему люди склонны ошибаться при идентификации иностранных языков на слух — это в том числе объясняется схожей лексикой (например, в случае латышского и эстонского языков). Эксперимент, проводившийся в игровой форме, также позволил выявить фонетическое и географическое родство некоторых языков.

 

Исследование опубликовано на сервере препринтов arXiv.org.

Сегодня, 09:04
4 минуты
Сергей Васильев

Грузинский ученый предположил существование крошечных, способных к самокопированию зондов, с помощью которых высокоразвитая цивилизация могла бы исследовать и осваивать Галактику.

12 октября
5 минут
Илья Ведмеденко

Исследователи полагают, что темп передвижения и интеллектуальные способности тесно связаны.

Сегодня, 12:55
9 минут
ФизТех

Международная команда ученых оценила сколько людей в мире болеют и умирают от рака, каково число лет жизни прожитых больными с онкологией или потерянных вследствие преждевременной смерти, какие из видов рака наиболее распространены, а какие уносят наибольшее число жизней, и насколько рак сопоставим с другими болезнями.

11 октября
2 минуты
Max Koval

Способные дышать воздухом рыбы-змееголовы распространяются по США, и власти выпустили официальный призыв убивать их при каждой встрече.

10 октября
2 минуты
Илья Ведмеденко

Исследователи проанализировали аспекты, влияющие на выбор партнера, на примере бедных и богатых стран.

10 октября
5 минут
Илья Ведмеденко

Китай показал необычный летательный аппарат, похожий на НЛО. Речь идет о перспективном скоростном вертолете.

11 октября
2 минуты
Max Koval

Способные дышать воздухом рыбы-змееголовы распространяются по США, и власти выпустили официальный призыв убивать их при каждой встрече.

10 октября
2 минуты
Илья Ведмеденко

Исследователи проанализировали аспекты, влияющие на выбор партнера, на примере бедных и богатых стран.

10 октября
5 минут
Илья Ведмеденко

Китай показал необычный летательный аппарат, похожий на НЛО. Речь идет о перспективном скоростном вертолете.

[miniorange_social_login]

Комментарии

Написать комментарий
Подтвердить?
Лучшие материалы
Войти
Регистрируясь, вы соглашаетесь с правилами использования сайта и даете согласие на обработку персональных данных.