Оказываем поддержку студентам в Ростове
г. Ростов-на-Дону, ул. Темерницкая 44, офис 612
Пн-Пт 10:00-19:00; Сб-Вс: выходной
| Тема работы: | ПОДХОД К ЗАДАЧЕ СЕМАНТИЧЕСКОГО СРАВНЕНИЯ ТЕКСТОВЫХ НАУЧНЫХ ДОКУМЕНТОВ И РАЗРАБОТКА МЕТОДОВ И АЛГОРИТМОВ |
| Предметная область: | Диссертация Кандидатская, Программирование |
| Краткое содержание: | ОГЛАВЛЕНИЕ ВВЕДЕНИЕ 3 1. ОБЗОР СУЩЕСТВУЮЩИХ ПОДХОДОВ И МЕТОДОВ К ОБРАБОТКЕ НАУЧНЫХ ТЕКСТОВ НА ЕСТЕСТВЕННОМ ЯЗЫКЕ. ПОСТАНОВКА ЗАДАЧИ ИССЛЕДОВАНИЯ 3 1.1 Обзор используемых семантических интерпретаций текстов языка 3 1.1.1 Анализ используемой структуры языка 3 1.1.2 Используемые особенности русского языка 3 1.1.3 Используемые определения понятий: лингвистическое явление анафоры……………………………………………………………………...3 1.2 Анализ существующих подходов к обработке научных текстов на естественном языке 3 1.3 Обзор существующего методов построения структурных элементов схемы существующего подхода к обработке научных текстов на естественном языке 3 1.3.1 Используемые методы сегментациитекстов 3 1.3.2 Известные методы разрешенияанафор 3 1.3.3 Используемые методы сравнения текстов 3 1.4 Постановка задачи нового подхода семантического сравнения текстовых научных документов и разработка методов и алгоритмов его реализация 3 Выводы по главе 3 2. ПРЕДЛАГАЕМЫЙ ПОДХОД К ЗАДАЧЕ СЕМАНТИЧЕСКОГО СРАВНЕНИЯ ТЕКСТОВЫХ НАУЧНЫХ ДОКУМЕНТОВ И РАЗРАБОТКА МЕТОДОВ ЕГО РЕАЛИЗАЦИИ 3 2.1 Новый подход обработки текстов для текстового сравнения 3 2.2 Разработка метода сегментация на значимых текстовых пассажах для последующего сравнения 3 2.3 Разработка метода сравнения текстов на основе текстовых пассажей с учетом семантических классов 3 2.4 Вычисление сходства междудокументами 3 Выводы по главе 3 3. РАЗРАБОТКА АЛГОРИТМЫ СЕМАНТИЧЕСКОГО СРАВНЕНИЯ НАУЧНЫХ ТЕКСТОВЫХ ДОКУМЕНТОВ 3 3.1 Разработка алгоритма нового подхода текстов для текстового сравнения 3 3.2 Разработка алгоритма сегментации текстов на значимых пассажах 3 3.3 Разработка алгоритма сравнения текстов основанном на значимых пассажах с учетом семантических классов 3 Выводы по главе 3 4. исполнение экспериментального исследования и оценку полученнных результатов 3 4.1 Результаты эксперимента, анализ и сравнение сегментация текстов на значимых текстовых пассажах 3 4.2 Результаты эксперимента, анализ и сравнение определения подобия текстов основанном на семантических классах 3 Выводы по главе 3 Заключение 3 Список использованных источников 3 |
| Описание работы: | ВВЕДЕНИЕ Актуальность темы. На любом жизненном этапе человек сталкивается с информацией. На-пример, Интернет содержит большие объёмы информации, среди которых значительную часть составляют тексты на естественных языках. В связи с большим количеством текстовых документов и постоянным увеличением их числа, потребность в их обработке современным оборудованием высоких вычислительных мощностей возникла и остаётся актуальной до сих пор. За-дачи обработки текстов на естественном языке возникают во многих облас-тях науки. Например, задачи «Больших данных» (BigData), для решения ко-торых применяются самые различные методы обработки информации. К задачам обработки текстовой информации на естественном языке от-носятся информационный поиск, вопросно-ответные системы, машинный перевод, извлечение информации, автоматическое аннотирование и рефери-рование, диалоговые системы, анализ и синтез текста и другие. Эти задачи характеризуются разным набором входных данных и тре-буемой формой их представления, целевым результатом и предлагаемыми подходами. Полученные в данной области результаты и их практическая реа-лизация показывают, что некоторые из этих задач требуют дальнейших ис-следований. Одной из который является сравнение текстов, т.е. задача выяв-ления семантической близости двух или более текстов на естественном язы-ке. Существуют различные методы представления данных, но чаще всего они представляются на естественном языке. Поэтому проблема автоматиче-ской обработки естественного языка заключается в том, что различные языки имеют различные семантические и грамматические особенности, а алгорит-мы, которые успешно используются для обработки одного языка, часто име-ют очень низкую эффективность для обработки другого языка. Проблема об-работки текста, написанного на естественном языке, также заключается в том, что требует понимания текста, что доступно только человеку, поэтому в автоматизированных системах пока не существует решения этой проблемы . Так же для обработки текстов на естественном языке, необходимо, прежде всего, решить задачу преобразования языка (русского, испанского) в формализованный , подобный языку программирования. При этом общие принципы для систем обработки текстов вообще включают следующие ком-поненты: фрагментация или разделение, морфологический анализ, синтакси-ческий анализ; и семантический анализ, из которых выход компонента явля-ется входом для следующего . На сегодняшний день, наиболее развитая отрасль обработки текстов на естественном языке – синтаксис; но есть также значительный прогресс в се-мантической обработке текстов. Метод синтактико-семантических шаблонов и его применение в ин-формационной технологии интерпретации текстов предложили Чубинидзе К. А. и Ярных Ю. А. Сбойчаков К. О. предложил в контексте создания элек-тронных фондов библиотеки автоматизировать систему смысловой обработ-ки текстов. Концептуальный анализ текстов в системах автоматической об-работки научно-технической информации рассматривал в диссертационном исследовании Козачук М. В. Другие аспекты, связанные с исследованием, можно отметить в следующих работах: Автоматизированные лексикографи-ческие системы (17); Информационно-поисковые системы (9); Системы Ма-шинного перевода (2,13); Технология TranslationMemory используется в сис-темах МП таких известных компаний, как Google (32) и Промт (25); Системы понимания речи (21); интерактивный интерфейс VisualWorld.ru (7) и другие. Данная работа является попыткой поиска решения проблем обработки текста; и посвящена изложению нового подхода сравнения текстовых доку-ментов научно-технического стиля и разработке их методов и алгоритмов; которые могут быть использованы в дальнейшем в приложениях автоматиче-ского обнаружения плагиата, для повышения его эффективности; и в дистан-ционном образовании, чтобы улучшить методы оценки ответов. Цель диссертационной работы заключается в изложении нового под-хода сравнения текстов на естественном языке, которая позволяет извлечение текстовых сегментов с полным смыслом и обнаружение семантического сходства, путём использования некоторых компонентов, разработанных в предыдущих исследованиях, и внедрении новых методов решения, учитывая смысловые семантические аспекты. Для достижения поставленной цели решаются следующие задачи: 1. Реализовать интеграцию компонентов или шагов, обрамленных в общие принципы схемы/модели систем обработки текстов, что является не-обходимым для нового подхода сравнения текстов. 2. Разработать метод сегментации текстов на естественном языке, который гарантирует извлечение значимых текстовых фрагментов, сохра-няющих смысл текста. 3. Разработать метод автоматического сравнения двух текстов на естественном языке, который обнаруживает семантическое сходство, незави-симо от используемых слов. 4. На базе разработанных методов предложенного сравнения, раз-работать алгоритмы сегментации и сравнения, также позволяющие оценивать сходство текстов научно-технического стиля по критериям правильности и глубины. 5. Провести экспериментальные исследования методов сегментации и сравнения текстов на естественном языке. Объект исследования – информационная технология интерпретации текстов на естественном языке. Предмет исследования –семантико-синтаксическая обработка научно-технического текстов на русском языке и автоматическая обработка текста. Методы исследования. При выполнении диссертационного исследо-вания использовались данные из смежных дисциплин: компьютерной лин-гвистики, теории вероятностей, теории графов, теории информационного по-иска и современные технологии программирования, теория интеллектуаль-ных систем, морфологический анализ, семантико-синтаксический и стати-стический анализ. Научная новизна диссертационной работы: В диссертации получены следующие новые научные и практические результаты: 1. Предложен новый подход сравнения научно-технического тек-стов на естественном языке, отличающийся тем, что сравниваются семанти-ческие элементы смысла, полученных путём сегментации с семантическими критериями, с учётом синонимов, что позволяет автоматическое обнаруже-ние семантического сходства между двумя сравниваемыми текстами, учиты-вая как морфологическую структуру текста, так и его лексико-семантическое содержание. 2. Предложен метод сегментации текста отличающийся от извест-ных использованием семантического критерия, что гарантирует извлечение значимых текстовых фрагментов, сохраняющих смысл текста. 3. Предложена процедура сравнения, отличающаяся от известных, комбинацией существующего семантического представления (8) и составле-ния синонимов, что позволяет обнаруживает семантическое сходство, неза-висимо от используемых слов. Положения, выносимые на защиту: 1. Предложена схема нового подхода сравнения научно-технического текстов на естественном языке, через адекватную интеграцию компонентов или шагов, обрамленных в общие принципы схемы систем об-работки текстов, которая повышает эффективность сравнения текстов науч-но-технического стиля. 2. Метод сегментации (необходимо написать) 3. Определение значимых текстовых пассажей и их формализация посредством идентификации глаголов и анафорических ссылок для обеспе-чения извлечение текстовых сегментов с законченным смыслом. 4. Процедура сравнения (необходимо написать) 5. Включение в оценку сравнения, критерии правильности и глуби-ны вычисления семантической близости значимых текстовых пассажей. Практическая значимость работы заключается в том, что метод и ал-горитмы, разработанные автором; для извлечения значительных пассажей и сравнения текстов, они позволили создать функциональную программу, ис-пользуемую в организационной среде для тестового режима. Реализация и внедрение результатов работы. Основные теоретиче-ские и практические результаты диссертационной работы использованы в организациях: Национальный политехнический экспериментальный универ-ситет национальных вооружённых Боливарианскихсил (УНЕФА - UNEFA); и Национальный центр по совершенствованию преподавания науки (СЕНА-МЕК - CENAMEC), что подтверждается актами о внедрении. Обоснованность и достоверность полученных результатов подтвер-ждается строгостью математических выкладок, использованием известных методов, разработкой действующей программы и результатами эксперимен-тов. Апробация результатов работы. Основные результаты, полученные в ходе работы, докладывались и обсуждались: 21-22 мая 2015 г. Международная конференция «Инновационные технологии и дидактика в обучении» (InnovativeTechnologiesandDidacticsinTeaching — ITDT 2015), Мадрид. Испа-ния. Выступление с докладом. 16-18 декабря 2015 г. ХIII Всероссийская Научная конференция молодых ученых аспирантов и студентов «Информационные технологии, системный анализ и управление» (ИТСАиУ — 2015), г. Таганрог. Россия. Выступление с докладом. 3-4 мая 2016 г. Международная конференция «Инновационные технологии и дидактика в обучении» (InnovativeTechnologiesandDidacticsinTeaching — ITDT 2016), Тенерифе. Ис-пания. Выступление с докладом. 5-7 сентября 2016 г. VII Международная научно-техническая конференция «Технологии разработки информационных систем» (ТРИС — 2016), г. Геленджик. Россия. Выступление с докладом. 16-19 ноября 2016 г. ХIV Всероссийская Научная конференция молодых ученых аспирантов и студентов «Информационные технологии, системный анализ и управление» (ИТСАиУ — 2016), г. Таганрог. Россия. Выступление с докладом. 2-3 мая 2017 г. Международная конференция «Инновационные технологии и дидактика в обучении» (InnovativeTechnologiesandDidacticsinTeaching — ITDT 2017), Берлин. Герма-ния. Выступление с докладом. 4-5 сентября 2017 г. VIII Международная научно-техническая конференция «Технологии разработки информационных систем» (ТРИС — 2017), г. Геленджик. Россия. Выступление с докладом. Публикации. По материалам диссертации автором опубликовано 12 печатных работ, в том числе четыре статьи в изданиях из списка, рекомендо-ванного ВАК, свидетельство об официальной регистрации программ в кото-рых отражены основные результаты диссертационного исследования. Структура и объем диссертационной работы. Диссертация состоит из введения, четыре главы и заключения. Основной текст изложен на ____ страниц, содержит ____ рисунков, ___ таблиц, список литературы из ____ наименований. В приложениях содержатся: программный код, листы данных Excel с записями результатов, полученных в экспериментах; свидетельства о государственной регистрации программы для ЭВМ, акты внедрения резуль-татов работы. Во введении обоснована актуальность темы диссертации, упомянуты цели и задачи работы, определён предмет исследования, представлены ос-новные научные результаты, показаны теоретическая и практическая значи-мость работы. В первой главе содержится обзор существующих методов и алгорит-мов в рамках известного подхода к обработки научных текстов на естествен-ном языке. Кратко описываются язык и семантическая интерпретация тек-стов. Формулируется постановка задачи исследования. Вторая глава посвящена изложению нового подхода и разработан-ных автором методов обработки текстов для текстового сравнения; метода сегментации текстов в значимых текстовых пассажей; и метода самого срав-нения текстов на основе на семантических классах. В третьей главе описываются алгоритмы обработки текстов для тек-стового сравнения; сегментации текстов в значимых текстовых пассажей; и самого сравнения текстов на основе на семантических классах. Четвёртая глава посвящена описанию выполнения экспериментов сегментации значимых пассажей и текстового сравнения, в отличие от дру-гих известных методов. В заключение приводятся основные результаты работы; проблемы, которые необходимо решить, возникают; и предлагаются возможные вариан-ты использования предложенного подхода и их методов. |
| Цена: | 14750 ₽ |
| Уникальность: | 80-90 % ( antiplagiat.ru ) |
Купить эту работу
Помощь студентам по написанию студенческих работ в Ростове. Помогаем выполнять задания студентам обучающимся в ВУЗах и ССУЗах Соблюдаем указания методических рекомендаций Гарантируем низкие цены и высокое качество услуг
Название: ООО 'Дипломы - Ростов'
Адрес: г. Ростов-на-Дону, ул. Темерницкая 44, офис 612
Телефон: 8(900) 363-40-38
Email: zakaz@diplom-rostov.ru
График работы: Пн-Пт: 10:00 - 19:00