Внимание! diplom-rostov.ru не продает дипломы, аттестаты об образовании и иные документы об образовании. Все услуги на сайте предоставляются исключительно в рамках законодательства РФ.
Ростов Диплом

Оказываем поддержку студентам в Ростове

г. Ростов-на-Дону, ул. Темерницкая 44, офис 612

Пн-Пт 10:00-19:00; Сб-Вс: выходной

Сделать заказ

СПОСОБЫ СВЯЗИ

8(900) 363-40-38

задать вопрос online

- офицальная группа вк

УСЛУГИ

ПОДХОД К ЗАДАЧЕ СЕМАНТИЧЕСКОГО СРАВНЕНИЯ ТЕКСТОВЫХ НАУЧНЫХ ДОКУМЕНТОВ И РАЗРАБОТКА МЕТОДОВ И АЛГОРИТМОВ

Тема работы: ПОДХОД К ЗАДАЧЕ СЕМАНТИЧЕСКОГО СРАВНЕНИЯ ТЕКСТОВЫХ НАУЧНЫХ ДОКУМЕНТОВ И РАЗРАБОТКА МЕТОДОВ И АЛГОРИТМОВ
Предметная область: Диссертация Кандидатская, Программирование
Краткое содержание:

ОГЛАВЛЕНИЕ

ВВЕДЕНИЕ 3

1. ОБЗОР СУЩЕСТВУЮЩИХ ПОДХОДОВ И МЕТОДОВ К ОБРАБОТКЕ НАУЧНЫХ ТЕКСТОВ НА ЕСТЕСТВЕННОМ ЯЗЫКЕ. ПОСТАНОВКА ЗАДАЧИ ИССЛЕДОВАНИЯ 3

1.1 Обзор используемых семантических интерпретаций текстов языка 3

1.1.1 Анализ используемой структуры языка 3

1.1.2 Используемые особенности русского языка 3

1.1.3 Используемые определения понятий: лингвистическое явление анафоры……………………………………………………………………...3

1.2 Анализ существующих подходов к обработке научных текстов на естественном языке 3

1.3 Обзор существующего методов построения структурных элементов схемы существующего подхода к обработке научных текстов на естественном языке 3

1.3.1 Используемые методы сегментациитекстов 3

1.3.2 Известные методы разрешенияанафор 3

1.3.3 Используемые методы сравнения текстов 3

1.4 Постановка задачи нового подхода семантического сравнения текстовых научных документов и разработка методов и алгоритмов его реализация 3

Выводы по главе 3

2. ПРЕДЛАГАЕМЫЙ ПОДХОД К ЗАДАЧЕ СЕМАНТИЧЕСКОГО СРАВНЕНИЯ ТЕКСТОВЫХ НАУЧНЫХ ДОКУМЕНТОВ И РАЗРАБОТКА МЕТОДОВ ЕГО РЕАЛИЗАЦИИ 3

2.1 Новый подход обработки текстов для текстового сравнения 3

2.2 Разработка метода сегментация на значимых текстовых пассажах для последующего сравнения 3

2.3 Разработка метода сравнения текстов на основе текстовых пассажей с учетом семантических классов 3

2.4 Вычисление сходства междудокументами 3

Выводы по главе 3

3. РАЗРАБОТКА АЛГОРИТМЫ СЕМАНТИЧЕСКОГО СРАВНЕНИЯ НАУЧНЫХ ТЕКСТОВЫХ ДОКУМЕНТОВ 3

3.1 Разработка алгоритма нового подхода текстов для текстового сравнения 3

3.2 Разработка алгоритма сегментации текстов на значимых пассажах 3

3.3 Разработка алгоритма сравнения текстов основанном на значимых пассажах с учетом семантических классов 3

Выводы по главе 3

4. исполнение экспериментального исследования и оценку полученнных результатов 3

4.1 Результаты эксперимента, анализ и сравнение сегментация текстов на значимых текстовых пассажах 3

4.2 Результаты эксперимента, анализ и сравнение определения подобия текстов основанном на семантических классах 3

Выводы по главе 3

Заключение 3

Список использованных источников 3

Описание работы:

ВВЕДЕНИЕ

Актуальность темы.

На любом жизненном этапе человек сталкивается с информацией. На-пример, Интернет содержит большие объёмы информации, среди которых значительную часть составляют тексты на естественных языках. В связи с большим количеством текстовых документов и постоянным увеличением их числа, потребность в их обработке современным оборудованием высоких вычислительных мощностей возникла и остаётся актуальной до сих пор. За-дачи обработки текстов на естественном языке возникают во многих облас-тях науки. Например, задачи «Больших данных» (BigData), для решения ко-торых применяются самые различные методы обработки информации.

К задачам обработки текстовой информации на естественном языке от-носятся информационный поиск, вопросно-ответные системы, машинный перевод, извлечение информации, автоматическое аннотирование и рефери-рование, диалоговые системы, анализ и синтез текста и другие.

Эти задачи характеризуются разным набором входных данных и тре-буемой формой их представления, целевым результатом и предлагаемыми подходами. Полученные в данной области результаты и их практическая реа-лизация показывают, что некоторые из этих задач требуют дальнейших ис-следований. Одной из который является сравнение текстов, т.е. задача выяв-ления семантической близости двух или более текстов на естественном язы-ке.

Существуют различные методы представления данных, но чаще всего они представляются на естественном языке. Поэтому проблема автоматиче-ской обработки естественного языка заключается в том, что различные языки имеют различные семантические и грамматические особенности, а алгорит-мы, которые успешно используются для обработки одного языка, часто име-ют очень низкую эффективность для обработки другого языка. Проблема об-работки текста, написанного на естественном языке, также заключается в том, что требует понимания текста, что доступно только человеку, поэтому в автоматизированных системах пока не существует решения этой проблемы .

Так же для обработки текстов на естественном языке, необходимо, прежде всего, решить задачу преобразования языка (русского, испанского) в формализованный , подобный языку программирования. При этом общие принципы для систем обработки текстов вообще включают следующие ком-поненты: фрагментация или разделение, морфологический анализ, синтакси-ческий анализ; и семантический анализ, из которых выход компонента явля-ется входом для следующего .

На сегодняшний день, наиболее развитая отрасль обработки текстов на естественном языке – синтаксис; но есть также значительный прогресс в се-мантической обработке текстов.

Метод синтактико-семантических шаблонов и его применение в ин-формационной технологии интерпретации текстов предложили Чубинидзе К. А. и Ярных Ю. А. Сбойчаков К. О. предложил в контексте создания элек-тронных фондов библиотеки автоматизировать систему смысловой обработ-ки текстов. Концептуальный анализ текстов в системах автоматической об-работки научно-технической информации рассматривал в диссертационном исследовании Козачук М. В. Другие аспекты, связанные с исследованием, можно отметить в следующих работах: Автоматизированные лексикографи-ческие системы (17); Информационно-поисковые системы (9); Системы Ма-шинного перевода (2,13); Технология TranslationMemory используется в сис-темах МП таких известных компаний, как Google (32) и Промт (25); Системы понимания речи (21); интерактивный интерфейс VisualWorld.ru (7) и другие.

Данная работа является попыткой поиска решения проблем обработки текста; и посвящена изложению нового подхода сравнения текстовых доку-ментов научно-технического стиля и разработке их методов и алгоритмов; которые могут быть использованы в дальнейшем в приложениях автоматиче-ского обнаружения плагиата, для повышения его эффективности; и в дистан-ционном образовании, чтобы улучшить методы оценки ответов.

Цель диссертационной работы заключается в изложении нового под-хода сравнения текстов на естественном языке, которая позволяет извлечение текстовых сегментов с полным смыслом и обнаружение семантического сходства, путём использования некоторых компонентов, разработанных в предыдущих исследованиях, и внедрении новых методов решения, учитывая смысловые семантические аспекты.

Для достижения поставленной цели решаются следующие задачи:

1. Реализовать интеграцию компонентов или шагов, обрамленных в общие принципы схемы/модели систем обработки текстов, что является не-обходимым для нового подхода сравнения текстов.

2. Разработать метод сегментации текстов на естественном языке, который гарантирует извлечение значимых текстовых фрагментов, сохра-няющих смысл текста.

3. Разработать метод автоматического сравнения двух текстов на естественном языке, который обнаруживает семантическое сходство, незави-симо от используемых слов.

4. На базе разработанных методов предложенного сравнения, раз-работать алгоритмы сегментации и сравнения, также позволяющие оценивать сходство текстов научно-технического стиля по критериям правильности и глубины.

5. Провести экспериментальные исследования методов сегментации и сравнения текстов на естественном языке.

Объект исследования – информационная технология интерпретации текстов на естественном языке.

Предмет исследования –семантико-синтаксическая обработка научно-технического текстов на русском языке и автоматическая обработка текста.

Методы исследования. При выполнении диссертационного исследо-вания использовались данные из смежных дисциплин: компьютерной лин-гвистики, теории вероятностей, теории графов, теории информационного по-иска и современные технологии программирования, теория интеллектуаль-ных систем, морфологический анализ, семантико-синтаксический и стати-стический анализ.

Научная новизна диссертационной работы:

В диссертации получены следующие новые научные и практические результаты:

1. Предложен новый подход сравнения научно-технического тек-стов на естественном языке, отличающийся тем, что сравниваются семанти-ческие элементы смысла, полученных путём сегментации с семантическими критериями, с учётом синонимов, что позволяет автоматическое обнаруже-ние семантического сходства между двумя сравниваемыми текстами, учиты-вая как морфологическую структуру текста, так и его лексико-семантическое содержание.

2. Предложен метод сегментации текста отличающийся от извест-ных использованием семантического критерия, что гарантирует извлечение значимых текстовых фрагментов, сохраняющих смысл текста.

3. Предложена процедура сравнения, отличающаяся от известных, комбинацией существующего семантического представления (8) и составле-ния синонимов, что позволяет обнаруживает семантическое сходство, неза-висимо от используемых слов.

Положения, выносимые на защиту:

1. Предложена схема нового подхода сравнения научно-технического текстов на естественном языке, через адекватную интеграцию компонентов или шагов, обрамленных в общие принципы схемы систем об-работки текстов, которая повышает эффективность сравнения текстов науч-но-технического стиля.

2. Метод сегментации (необходимо написать)

3. Определение значимых текстовых пассажей и их формализация посредством идентификации глаголов и анафорических ссылок для обеспе-чения извлечение текстовых сегментов с законченным смыслом.

4. Процедура сравнения (необходимо написать)

5. Включение в оценку сравнения, критерии правильности и глуби-ны вычисления семантической близости значимых текстовых пассажей.

Практическая значимость работы заключается в том, что метод и ал-горитмы, разработанные автором; для извлечения значительных пассажей и сравнения текстов, они позволили создать функциональную программу, ис-пользуемую в организационной среде для тестового режима.

Реализация и внедрение результатов работы. Основные теоретиче-ские и практические результаты диссертационной работы использованы в организациях: Национальный политехнический экспериментальный универ-ситет национальных вооружённых Боливарианскихсил (УНЕФА - UNEFA); и Национальный центр по совершенствованию преподавания науки (СЕНА-МЕК - CENAMEC), что подтверждается актами о внедрении.

Обоснованность и достоверность полученных результатов подтвер-ждается строгостью математических выкладок, использованием известных методов, разработкой действующей программы и результатами эксперимен-тов.

Апробация результатов работы. Основные результаты, полученные в ходе работы, докладывались и обсуждались:

 21-22 мая 2015 г. Международная конференция «Инновационные технологии и дидактика в обучении» (InnovativeTechnologiesandDidacticsinTeaching — ITDT 2015), Мадрид. Испа-ния. Выступление с докладом.

 16-18 декабря 2015 г. ХIII Всероссийская Научная конференция молодых ученых аспирантов и студентов «Информационные технологии, системный анализ и управление» (ИТСАиУ — 2015), г. Таганрог. Россия. Выступление с докладом.

 3-4 мая 2016 г. Международная конференция «Инновационные технологии и дидактика в обучении» (InnovativeTechnologiesandDidacticsinTeaching — ITDT 2016), Тенерифе. Ис-пания. Выступление с докладом.

 5-7 сентября 2016 г. VII Международная научно-техническая конференция «Технологии разработки информационных систем» (ТРИС — 2016), г. Геленджик. Россия. Выступление с докладом.

 16-19 ноября 2016 г. ХIV Всероссийская Научная конференция молодых ученых аспирантов и студентов «Информационные технологии, системный анализ и управление» (ИТСАиУ — 2016), г. Таганрог. Россия. Выступление с докладом.

 2-3 мая 2017 г. Международная конференция «Инновационные технологии и дидактика в обучении» (InnovativeTechnologiesandDidacticsinTeaching — ITDT 2017), Берлин. Герма-ния. Выступление с докладом.

 4-5 сентября 2017 г. VIII Международная научно-техническая конференция «Технологии разработки информационных систем» (ТРИС — 2017), г. Геленджик. Россия. Выступление с докладом.

Публикации. По материалам диссертации автором опубликовано 12 печатных работ, в том числе четыре статьи в изданиях из списка, рекомендо-ванного ВАК, свидетельство об официальной регистрации программ в кото-рых отражены основные результаты диссертационного исследования.

Структура и объем диссертационной работы. Диссертация состоит из введения, четыре главы и заключения. Основной текст изложен на ____ страниц, содержит ____ рисунков, ___ таблиц, список литературы из ____ наименований. В приложениях содержатся: программный код, листы данных Excel с записями результатов, полученных в экспериментах; свидетельства о государственной регистрации программы для ЭВМ, акты внедрения резуль-татов работы.

Во введении обоснована актуальность темы диссертации, упомянуты цели и задачи работы, определён предмет исследования, представлены ос-новные научные результаты, показаны теоретическая и практическая значи-мость работы.

В первой главе содержится обзор существующих методов и алгорит-мов в рамках известного подхода к обработки научных текстов на естествен-ном языке. Кратко описываются язык и семантическая интерпретация тек-стов. Формулируется постановка задачи исследования.

Вторая глава посвящена изложению нового подхода и разработан-ных автором методов обработки текстов для текстового сравнения; метода сегментации текстов в значимых текстовых пассажей; и метода самого срав-нения текстов на основе на семантических классах.

В третьей главе описываются алгоритмы обработки текстов для тек-стового сравнения; сегментации текстов в значимых текстовых пассажей; и самого сравнения текстов на основе на семантических классах.

Четвёртая глава посвящена описанию выполнения экспериментов сегментации значимых пассажей и текстового сравнения, в отличие от дру-гих известных методов.

В заключение приводятся основные результаты работы; проблемы, которые необходимо решить, возникают; и предлагаются возможные вариан-ты использования предложенного подхода и их методов.

Цена: 14750 ₽
Уникальность: 80-90 % ( antiplagiat.ru )

Купить эту работу

diplom-rostov.ru

Помощь студентам по написанию студенческих работ в Ростове. Помогаем выполнять задания студентам обучающимся в ВУЗах и ССУЗах Соблюдаем указания методических рекомендаций Гарантируем низкие цены и высокое качество услуг

Юридические документы

КОНТАКТЫ

Название: ООО 'Дипломы - Ростов'

Адрес: г. Ростов-на-Дону, ул. Темерницкая 44, офис 612

Телефон: 8(900) 363-40-38

Email: zakaz@diplom-rostov.ru

График работы: Пн-Пт: 10:00 - 19:00

Авторские права 2002-2026 diplom-rostov.ru