299

Предложен новый метод анализа юридических текстов

❋ 4.3

Сфера права сталкивается с необходимостью мгновенного и точного анализа множества правовых документов, судебных решений и законодательных актов. Традиционные методы анализа часто оказывались недостаточно эффективными, что в свою очередь подчеркивает потребность в современных технологических решениях. В частности, метод TF-IDF, используемый в качестве основы для построения дерева решений, представляет собой эффективный инструмент для выделения ключевых слов и понятий. Его и предложили применять ученые МТУСИ для анализа юридических текстов.

В МТУСИ предложили новый метод анализа юридических текстов
В МТУСИ предложили новый метод анализа юридических текстов / © Jonathunder, ru.wikipedia.org

Дерево решений — метод машинного обучения, древовидная структура, где каждый узел представляет собой вопрос или тест на определенное свойство данных, каждая ветвь соответствует возможному ответу на этот вопрос, а каждый лист дерева — прогноз или решение. Построение дерева решений на основе алгоритма TF-IDF позволяет учитывать важность слов, выделяя ключевые термины и фильтруя часто встречающиеся слова. Этот подход обеспечивает легкость работы с текстовыми данными, интерпретируемость результатов и минимальные требования к предварительной обработке, что делает его удобным для задач категоризации и тематического анализа.

В МТУСИ над разработкой новой методики применения дерева решений, основанного на методе TF-IDF для анализа естественного языка при решении задач в области гражданского права, работали: Скородумова Елена Александровна, доцент кафедры ТВиПМ, кандидат физико-математических наук, доцент, и Захарьева Диана, студентка МТУСИ.

В ходе исследования они собрали массив данных с веб-ресурса https://sudact.ru/, который затем подвергался детальному анализу с акцентом на выявление релевантных глав и статей гражданского кодекса.

«В рамках сбора информации извлечено 12 дел в области гражданского права, которые впоследствии подверглись детальному изучению и анализу. Извлеченные обвинительные решения по делам были обработаны с целью выделения содержащихся в них мотивировочной части иска и дальнейшем внесении в разработанную программу для проведения дальнейшего исследования. В конечном итоге программа сформировала перечень глав и статей гражданского и семейного кодексов, и для каждого из них было приведено численное значение, отражающее степень соответствия между мотивировочной частью иска и содержанием определенной главы и статьи. Процедура сопоставления и оценки подобия проводилась для каждой главы и статьи отдельно», — отмечает Елена Александровна.

Исследователи отмечают, что перед анализом соответствия статей важно выявить соответствующие главы, основываясь на их расположении в списке, отсортированном по убыванию метрики релевантности.

«Дерево решений формировалось в несколько этапов. Сначала проводился расчет значений TF-IDF для кодексов, затем для разделов этих кодексов. Последующие этапы включают расчет TF-IDF для подразделов и, наконец, для глав. Полученные значения TF-IDF на каждом уровне иерархии перемножались между собой. Затем полученный список проходил процесс упорядочивания, при котором элементы расположились в порядке убывания значений. Это позволило выделить те главы, которые наиболее точно соответствуют иску», — рассказала об исследовании Захарьева Диана.

При построении дерева решений на основе алгоритма TF-IDF для поиска релевантных глав выявлены факторы, влияющие на качество модели: низкая эффективность при работе с большими объемами текста и отсутствие учета контекста. При анализе схожести статей и иска было обнаружено, что релевантные статьи расположены в первой половине отсортированного по убыванию метрики списка.

Установлено, что использование дерева решений, основанного на алгоритме TF-IDF, позволяет эффективно отфильтровать наиболее несоответствующие статьи и главы. Иными словами, этот метод способен провести отсев примерно половины глав, а в пределах каждой релевантной главы также отбросить около половины статей, исходя из степени их соответствия.

Исследователи уверены, что у нового метода есть потенциал для дальнейшего развития. Они планируют проведение дополнительных исследований и адаптацию методологии для расширения применения в различных контекстах, что откроет новые горизонты для эффективного анализа текста в области права.

Материал подготовлен на основе статьи «Применение дерева решений, основанного на методе TF-IDF, для анализа естественного языка при решении задач в области гражданского права», размещенной в сборнике трудов «Технологии информационного общества» (XVIII Международная отраслевая научно-техническая конференция).

Нашли опечатку? Выделите фрагмент и нажмите Ctrl (Cmd) + Enter.
МТУСИ
Московский технический университет связи и информатики (МТУСИ) — ведущее отраслевое техническое высшее учебное заведение Центральной России по подготовке кадров для IT и телеком-индустрии, подведомственное Министерству цифрового развития, связи и массовых коммуникаций РФ. Основан в 1921 году на базе Московского электротехнического института народной связи им. В.Н. Подбельского. Ежегодно МТУСИ выпускает востребованных специалистов в области связи, информационных технологий, квантовых коммуникаций, робототехники, информационной безопасности и цифровой экономики. В состав университета входят 5 факультетов, 34 кафедры, 2 филиала (Волго-Вятский и Северо-Кавказский), Колледж телекоммуникаций, Музей электросвязи, Квантовый центр, Центр робототехники, Лаборатория AR/VR, Центры заочного обучения бакалавров и магистров, Центр индивидуального обучения.
Подписывайтесь на нас в Telegram, Дзен и в последнюю очередь на VK
Предстоящие мероприятия
22 сентября, 12:52
Марк Чернов

Американские исследователи впервые смогли напрямую увидеть «квантовый скачок» звука — скачкообразный переход фонона, минимальной единицы звуковой энергии, между энергетическими уровнями в реальном времени. Это наблюдение завершило столетнюю историю поисков, начатую еще на заре квантовой физики, и открыло дорогу к созданию устойчивых квантовых компьютеров и сверхчувствительных датчиков.

21 сентября, 16:52
Редакция Naked Science

Всего 20-30 лет назад большинство женщин ходили на каблуках, а большинство мужчин — в обуви, подошва которой серьезно нагружала позвоночник и мышцы спины. Если задуматься, факт поразительный: 20 тысяч лет назад, в палеолите, таких проблем человечество вообще не испытывало. Как так получилось и что новые материалы делают, чтобы все эти сложности стали прошлым?

22 сентября, 08:31
Марк Чернов

Человеческий мозг оказался двумя разными органами, которые объединились в процессе эволюции сотни миллионов лет назад. Исследователи доказали, что передняя и задняя части мозга формируются из совершенно разных стволовых клеток. Это открытие опровергло давнюю научную теорию и позволило впервые вырастить нейроны ствола мозга в лаборатории.

21 сентября, 09:24
Елизавета З.

Европейское космическое агентство опубликовало снимок галактики NGC 4698, расположенной в созвездии Дева. Хотя на фотографии, сделанной телескопом «Хаббл», галактика кажется безмятежной, она хранит удивительную тайну: находящиеся в центре звезды и газ вращаются под прямым углом по отношению к остальной части диска.

21 сентября, 16:52
Редакция Naked Science

Всего 20-30 лет назад большинство женщин ходили на каблуках, а большинство мужчин — в обуви, подошва которой серьезно нагружала позвоночник и мышцы спины. Если задуматься, факт поразительный: 20 тысяч лет назад, в палеолите, таких проблем человечество вообще не испытывало. Как так получилось и что новые материалы делают, чтобы все эти сложности стали прошлым?

21 сентября, 16:53
Елизавета З.

«Яндекс» опубликовал в открытом доступе Alice AI Foundation LLM — претрейн-версию новой большой языковой модели, которую разработчики обучили полностью с нуля. Она хорошо справляется с рассуждениями и задачами по программированию, а качество ответов на русском языке опережает многие зарубежные аналоги. В первую очередь это касается задач на знание фактов, интересных русскоязычной аудитории. Модель обошла даже более крупные опенсорс-модели, при этом для ее интерфейса не нужны большие вычислительные мощности. Свободная лицензия Apache 2.0. позволяет задействовать ее как в исследовательских, так и в коммерческих проектах.

9 сентября, 22:44
Александр Березин

Нейросеть OpenAI добилась серьезного прорыва в математике, решив одну из семи «задач тысячелетия». Получат ли США, чьи нейросети опираются на гораздо более мощное «железо», чем у Китая, монополию на конвейер научных открытий? Даст ли это возможности сравнимые с их атомной монополией 80 лет назад?

28 августа, 15:43
Татьяна Зайцева

Сопротивление жителей Европы самой идее употребления насекомых в пищу может иметь эволюционные корни, уходящие вглубь тысячелетий, пришли к выводу авторы нового исследования. Оказалось, предки современных европейцев ели насекомых лишь эпизодически. Кроме того, из-за генетических мутаций они плохо переваривали их экзоскелеты.

29 августа, 16:51
Александр Березин

Госдолг США достиг 40 триллионов долларов и растет все быстрее и быстрее. На Западе переполох: при таких размерах его не выплатить. Следовательно, полагают многие, надо решить проблему как древние шумеры — долг обнулить и начать занимать заново. Рецепт кажется здравым, но есть нюансы. Причем поучительнее всего они даже не для Штатов, а, как ни странно, именно для России.

[miniorange_social_login]

Комментарии

Написать комментарий