• Добавить в закладки
  • Facebook
  • Twitter
  • Telegram
  • VK
  • Печать
  • Email
  • Скопировать ссылку
14.02.2022, 11:53
Сколтех
2,6 тыс

Нейронную сеть научили распознавать химические формулы из научных статей

❋ 4.5

Исследователи из основанного в Сколтехе стартапа «Синтелли», МГУ имени Ломоносова и Университета «Сириус» разработали решение на базе нейронной сети для автоматического распознавания химических формул на сканах научных статей.

Нейронную сеть научили распознавать химические формулы из научных статей / ©Getty images / Автор: Павел Сорокин

Статья с описанием исследования опубликована в научном журнале Chemistry-Methods, выпускаемом издательством Европейского химического общества. Человечество вступает в эпоху искусственного интеллекта, и химия здесь не исключение. Современные методы глубокого обучения всецело базируются на больших объемах качественных данных, которые необходимы для обучения нейросетей.

Хорошая новость: химические данные «не стареют». Даже если какое-то соединение было синтезировано, скажем, в начале XX века, информация о его структуре, свойствах и методах синтеза остается актуальной по сей день. Даже в наши дни всеобщей цифровизации нельзя назвать редкостью случай, когда химику-органику приходится искать по библиотекам оригинальный научный журнал или диссертацию, изданную в начале XX века, скажем, на немецком языке, чтобы получить информацию о малоизученной молекуле.

Но есть и плохая новость: не существует единого стандарта представления химических формул. Химики привыкли использовать множество приемов сокращения записи известных химических групп. Например, вместо рисунка трет-бутильной группы могут использоваться несколько вариантов обозначений: tBu, t-Bu или tert-Bu. Что еще хуже, часто целую группу похожих соединений записывают в виде шаблона с символами-заместителями (R1,R2), но сами расшифровки заместителей могут быть приведены где угодно: в таблицах, схемах, в тексте статьи, в приложениях к статье.

Примеры искусственных шаблонов с погрешностями / ©Иван Хохлов и другие / Chemistry-Methods

Добавьте сюда различные стили отрисовки в различных журналах, традиции и привычки химиков, изменения стилей рисования с течением времени. Все это приводит к тому, что иногда даже химики-эксперты теряются в попытках расшифровать «химический кроссворд» из очередной статьи. Для алгоритма эта задача и вовсе кажется неразрешимой.

Однако в руках у исследователей уже был опыт применения мощного инструмента для решения схожих задач — нейросети «Трансформер», предложенной компанией Google для машинного перевода с одного языка на другой. Вместо этого коллектив решил «переводить» изображение молекулы или молекулярного шаблона в специально разработанное текстовое представление этого шаблона. Это представление исследователи назвали Functional-Group-SMILES.

К большому удивлению авторов работы, нейросеть оказалась способна выучить практически все, если выбранный стиль отображения был представлен в обучающем наборе данных. Однако «Трансформер» сам по себе требует десятки миллионов примеров для обучения. Вручную вырезать из журналов столько химических формул просто невозможно. Тогда исследователи решили посмотреть на проблему под другим углом: сделать генератор данных, который будет создавать случайные молекулярные шаблоны комбинируя различные фрагменты молекул и стили отрисовки.

«Наше исследование наглядно демонстрирует сдвиг парадигмы в области оптического распознавания химических структур. Если раньше исследователи работали над тем, как распознать молекулярные структуры, то, благодаря уникальной производительности нейросетей типа „Трансформер“, возможно полностью сфокусироваться именно на создании генератора искусственных примеров, имитирующих большинство возможных стилей отрисовки молекулярных шаблонов.

Наш алгоритм комбинирует молекулы, функциональные группы, шрифты, стили и даже погрешности печати, фрагменты других молекул, фрагменты аннотаций и так далее. Даже химику будет тяжело сказать, была ли молекула взята из существующей статьи или ее рисунок создан нашим генератором», — говорит Сергей Соснин, руководитель исследования и основанного в Сколтехе стартапа «Синтелли».

Исследователи надеются, что метод станет важнейшим шагом на пути к химической системе искусственного интеллекта, которая будет способна «читать» и «понимать» статьи не хуже высококвалифицированного химика. 

Нашли опечатку? Выделите фрагмент и нажмите Ctrl + Enter.
Сколтех
Сколковский институт науки и технологий — негосударственный технологический университет, расположенный в инновационном центре Сколково. Институт был создан в 2011 году при поддержке Массачусетского технологического института. Модель института предусматривает тесную интеграцию технологического образования, исследовательской работы и предпринимательских навыков. Институт ведёт обучение по программам магистратуры и PhD, рабочий язык — английский.
Подписывайтесь на нас в Telegram, Яндекс.Новостях и VK
Предстоящие мероприятия
11 августа, 06:17
Мария Азарова

То, в каком порядке дети в одной семье появились на свет, оказалось связано с вероятностью развития самых разных заболеваний — от аллергии и гастрита до аутизма и СДВГ. Ученые составили наиболее полную на сегодня карту подобных связей, проанализировав данные более 10 миллионов человек.

10 августа, 18:14
Мария Азарова

Специалисты по поведению животных проверили, что важнее для кошки — голос ее котенка или место, откуда он доносится. Для этого 13 кошек-матерей слушали записи криков собственных и чужих котят, которые включали то возле их гнезда, то в другом месте. Голос своего детеныша заставлял самок реагировать, но оказался для них не главным ориентиром.

10 августа, 16:30
СурГУ

Когда заканчиваются догадки, начинается генетика. Ученые Сургутского государственного университета совместно с коллегами из Санкт-Петербурга доказали, что анализ ДНК методом полноэкзомного секвенирования способен найти генетические причины редких заболеваний там, где традиционная медицина остается бессильной. Такой способ помог установить причины заболеваний почти у каждого четвертого пациента с подозрением на наследственную патологию, а в перспективе может изменить подход к диагностике редких болезней не только в Югре, но и по всей России.

9 августа, 19:34
Марк Чернов

Американская компания Firebird официально запустила в городе Раздан крупный центр обработки данных и фабрику искусственного интеллекта. На сегодняшний день это самый масштабный технологический хаб подобного уровня в СНГ, а после завершения всех этапов строительства он войдет в пятерку самых мощных вычислительных кластеров в мире.

9 августа, 10:53
Редакция Naked Science

Американское Министерство войны продолжает публиковать документы и видеозаписи о наблюдении неопознанных летающих объектов. Как и ранее, происхождение объектов из наблюдений неясно, но достаточно очевидно, что как минимум часть из них не относятся к известным сегодняшней науке природным феноменам.

10 августа, 11:42
Илья Гриднев

Британские экологи выяснили, что большинство людей не догадываются о вреде солнцезащитных кремов для Мирового океана. Обзор научной литературы и локальный уличный опрос наглядно продемонстрировали разрыв между реальными экологическими угрозами и повседневными привычками покупателей.

31 июля, 14:12
Андрей Серегин

Долгое время считалось, что до прихода европейцев тропические леса Амазонии были заселены сравнительно плохо. Однако выяснилось, что плотная растительность скрывает большинство следов древних обществ. С помощью воздушного лазерного сканирования ученые обнаружили сотни неизвестных земляных сооружений и предположили, что около двух тысяч лет назад население юго-западной части Амазонии могло достигать трех миллионов человек.

9 августа, 19:34
Марк Чернов

Американская компания Firebird официально запустила в городе Раздан крупный центр обработки данных и фабрику искусственного интеллекта. На сегодняшний день это самый масштабный технологический хаб подобного уровня в СНГ, а после завершения всех этапов строительства он войдет в пятерку самых мощных вычислительных кластеров в мире.

19 июля, 20:09
Александр Березин

Очереди на заправках стали привычным явлением в России, а на фоне информационного вакуума от властей о конкретных показателях производства бензина в июне население вынуждено ориентироваться на слухи. Все это выглядит довольно странно, но есть нюанс: скорее всего, кризис уже начинает выдыхаться. Как именно мы это выяснили?

[miniorange_social_login]

Комментарии

Написать комментарий