Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Особенности использования систем компьютерного сурдоперевода в инклюзивном образовании лиц с нарушением слуха. Учебное пособие

.pdf
Скачиваний:
0
Добавлен:
07.09.2026
Размер:
1 Мб
Скачать
Рис. 3.4. Интерфейс программы для записи жестов
с использованием Kineсt
Рис. 3.5. Пример перевода предложения «Мир ищет лекарство от болезней» в набор жестов
31
Рис. 3.6. Перевод текстовых учебных материалов на РЖЯ
3.1. ПЕРЕВОД РУССКОЙ РЕЧИ (ТЕКСТА) НА РУССКИЙ ЖЕСТОВЫЙ ЯЗЫК
Cистема компьютерного сурдоперевода включает в себя следую-
щие модули [28].
1. Модуль распознавания русского звучащего языка (РЗЯ). В базо-
вом варианте системы применяется сервис Google.
2. Модуль анализа русского текста, включая подсистемы морфоло- гического, синтаксического и семантического анализа. Данный модуль в существенной степени опирается
на свободно распространяемые ко-
ды (система ДИАЛИНГ) [29].
3. Модуль перевода русского текста на инструкции (команды) его отображения на РЖЯ [30]. Данный модуль использует взаимосвязь грамматических систем указанных языков.
4. Модуль визуализации РЖЯ на основе компьютерного манекена человека (аватар) сурдопереводчика. Система управления данного ава­тара основана на гамбургской системе нотаций [31].
32
Модуль анализа русского текста
Досемантический анализ включает в себя, как правило, следую­щие этапы: 1) графематический анализ; 2) морфологический анализ, который также может включать морфемный анализ; 3) синтаксический анализ. Этап графематического анализа является наиболее простым и часто определяется как предварительный. Основная его цель – выде­ление элементов структуры исходного текста: пунктов, параграфов, абзацев, предложений, слов довательность символов текста, определяемая и используемая на дальнейших этапах его обработки как наименьшая семантическая единица. Простейшей реализацией данного этапа анализа является следование правилу: разделитель – любой символ, не являющийся числом и буквой. Однако данный подход не учитывает наличия в язы­ке сложных слов, апострофов и т. ций применяются словари с набором некоторых эвристических правил, статистические модели (Сonditional Random Fields) [32, 33]. Результат проведения графематического анализа наиболее часто представляется в форме текста, дополненного тегами, подобными используемым в XML, либо, что является более наглядным, в виде графематической таблицы, состоящей из двух столбцов. В первом столбце содержатся выделенные элементы це – графематические дескрипторы, набор которых формируется с учетом целей создания конкретных систем перевода. Примерами возможных дескрипторов могут быть используемые в работе [34]: ЛЕ
(русская лексема), РЗД (разделитель), ЗПР (знак препинания), ЦК (цифровой комплекс), ДАТА, URL, АББРЕВИАТУРА и т.д.
На основе результатов графематического анализа проводится фологический анализ, заключающийся в определении морфологиче­ских характеристик (часть речи, род, число и другие) и основной сло­воформы каждого слова. Методы осуществления морфологического анализа русских текстов, применяемые в настоящее время, условно разделяют на две группы: метод с использованием «Грамматического словаря русского языка» А.А. Зализняка («четкая» морфология) и «не­четкая» морфология. Словарь Зализняка содержит основные слово­формы слов русского языка, для каждой из которых указан определен­ный код. Также задана система правил, по которой, отталкиваясь от начальной словоформы и соответствующего ей кода, можно построить все формы данного слова, автоматически получив при этом их морфо-
. Слово (token) в данном контексте – после-
п. Для обработки подобных ситуа-
текста: слова или разделители, во втором столб-
мор-
33
логические характеристики. Таким образом, для проведения морфоло­гического анализа текста необходимо на основе словаря Зализняка по­строить словарь всех словоформ слов русского языка, поставив в соот­ветствие каждой из них набор морфологических характеристик. Тогда задача морфологического разбора отдельного слова сводится к нахож­дению его в словаре и извлечению хранящихся там характеристик этом могут быть найдены несколько вариантов их значений. Недостат­ком такого подхода является необходимость наличия словаря всех слов и всех словоформ языка, что не реализуемо на практике ввиду наличия большого количества имен собственных, возможных ошибок ввода и др.
Методы «нечеткой» морфологии заключаются в формировании набора правил, определяющих по слову, составе определенных частей, как частный случай – морфем, т. е. его морфологические характеристики, и используются в случае, если ана­лиз по словарю Зализняка дает неудовлетворительные результаты. За основу берется свойство аффиксов отражать грамматические характе­ристики слова. Предполагается использование морфологического сло­варя, содержащего корни, префиксы, суффиксы, аффиксы, исключе ния. Прообразом такого словаря является «Словообразовательный словарь русского языка» А.Н. Тихонова. Другой метод нечеткой мор­фологии – поиск сходных слов по словарю, полученному из словаря Зализняка. При максимальном совпадении окончаний слово считается эквивалентным. Характеристики берутся из словаря. Применение ме­тода, основанного на использовании морфологического словаря, зна­чительно уменьшает требования к только основных частей словоформ и таблицы флективных частей (префиксов, суффиксов и инфиксов), но из-за использования более сложных алгоритмов сопоставления увеличиваются требования к про­изводительности процессора.
После окончания морфологического анализа каждого слова произ­водится анализ отдельных предложений (синтаксический анализ), цель которого – определение взаимосвязей между отдельными словами и частями предложения. Классическим подходом к проведе­нию синтаксического анализа предложений является использование формальных грамматик, задающих синтаксис языка. Данный подход обладает рядом недостатков, среди которых – невозможность разбора некорректно построенного предложения и необходимость привлечения лингвистов к построению грамматики. Вторая группа методов синтак-
наличию и отсутствию в его
памяти, так как требует хранения
элементами:
, при
-
34
сического анализа – методы, основанные на вероятностно-статисти­ческом подходе (использовании вероятностных грамматик). Вероят­ностные грамматики являются контекстно-свободными грамматиками, где каждое правило дополнено некоторой вероятностной оценкой [35]. После проведения синтаксического анализа предложения и получения всех вариантов его разбора на основе вероятностных оценок правил производится выбор наиболее вероятного способа построения предло­жения. К системы правил, однако этот метод позволяет анализировать непра­вильно построенные предложения.
методы на основе обучающихся систем. Для реализации такой систе­мы применяются нейронные сети, генетические алгоритмы, распозна­вание образов [35], где в качестве обучающего материала используется специально разрабатываемое множество примеров, «исходное предложение – результат его синтаксического анализа».
анализа отдельного предложения являются: дерево непосредственных составляющих и дерево зависимостей. Дерево непосредственных со­ставляющих отражает последовательное усложнение синтаксической структуры, т. е. бинарное объединение синтаксических единиц в син­таксические группы. При построении дерева зависимостей отобража­ются связи между пают слова предложения в своей основной словоформе, дугами – отношения между словами.
сического анализа представлен на рис. 3.7, где используются следую­щие принятые разработчиками обозначения:
таксического анализа, производится уже не над набором слов предло­жений, а над множеством деревьев, отражающих синтаксическую структуру предложений исходного текста. Его результатом является представление смысла текста в виде строгой формальной системы, вид
недостаткам метода относится необходимость построения
Отдельную группу методов синтаксического анализа составляют
содержащих пару
Основными способами представления результата синтаксического
отдельными словами предложения: узлами высту-
Пример возможного графического изображения результата синтак-
det – определитель;
det: – определитель;
subj: – субъект;
main: – основной элемент;
man: – обстоятельство образа действия;
сс: – сочинительный союз.
Семантический анализ текста
, основываясь на результатах син-
35
которой зависит от выбранного метода анализа. Различают следующие подходы к проведению семантического анализа: так называемые «сильный» и «слабый» подходы [36]. Группа «слабых» подходов изна­чально подразумевает интерпретацию только тех фрагментов текста, которые описывают искомые отношения между сущностями предмет­ной области или ситуации, в которые вовлечены эти сущности, не претендуя при этом
на точность семантического описания, что не удовлетворяет целям автоматического перевода. «Сильный подход» к анализу текста, созданный специально для целей автоматического перевода текста и использующий семантические метаязыки, характе­ризуется максимально возможной полнотой охвата множества интер­претируемых выражений естественного языка и точностью (подробно­стью) семантического описания этих выражений.
Рис. 3.7. Пример результата анализа текста
синтаксическим анализатором FDG
Теоретической основой метода являются работа «Лексическая се­мантика» Ю.Д. Апресяна и теория «Смысл-Текст» И.А. Мельчука. В рамках этого подхода каждое значение слова должно быть описано семантической формулой, а множество всех таких описаний представ­ляет собой семантический словарь языка. Значение предложения описывается математическим выражением. Задача создания семанти-
36
ческого метаязыка заключается в выборе системы базисных функций и понятий, позволяющих описать значения всех других понятий и пред­ложений, дальнейшее толкование которых либо невозможно, либо не­целесообразно. Последнее условие является причиной того, что в зави­симости от целей разработки систем анализа текста предлагаются различные варианты решения данной проблемы. На этапе семантиче ского анализа можно учесть редукцию, которая является широко рас­пространенным явлением в жестовой речи и заключается в исключе­нии малозначащих элементов фразы [37]. На данный момент общие вопросы и проблемы реализации семантического анализа текста в рам­ках перевода русского текста на русский жестовый язык наиболее пол­но освещены в работах [37, 38, 39]. К
ним относятся, в первую очередь, вопросы разрешения многозначности, омонимии [37]. Таким образом, при определении смыслового содержания слов необходимо учитывать также контекст, границы которого в случае перевода на жестовый язык уже могут не совпадать с границами предложения, как показано в [38]. Важным вопросом при этом является размер контекста: слишком ма­лый не позволит описать
особенности высказывания, слишком боль-
шой приведет к замедлению работы системы.
Описание констант русского словаря
Русский морфологический словарь Диалинг [29] базируется на грамматическом словаре А.А. Зализняка. Он включает в себя на дан­ный момент 161 тыс. лемм.
При лемматизации для каждого слова входного текста выдается множество морфологических интерпретаций следующего вида:
лемма (всегда пишется большими буквами);
морфологическая часть речи;
набор общих граммем (которые относятся ко всем словоформам
парадигмы слова);
множество наборов граммем.
Ниже приводится полный перечень русских частей речи (см. таб­лицу).
Граммема – это элементарный морфологический описатель, отно­сящий словоформу к какому-то морфологическому классу. Например, словоформе стол с леммой СТОЛ будут приписаны следующие набо-
ры граммем: «мр, ед, им, но», «мр, ед, вн, но». Таким образом, мор
-
фологический анализ выдает два варианта анализа словоформы стол с
-
37
леммой СТОЛ внутри одной морфологической интерпретации: с вини-
тельным (вн) и именительным падежами (им).
Перечень русских частей речи
Часть речи
в системе Диалинг
C Мама Существительное П Красный Прилагательное МС Он Местоимение-существительное Г Идет Глагол в личной форме ПРИЧАСТИЕ Идущий Причастие ДЕЕПРИЧАСТИЕ Идя Деепричастие ИНФИНИТИВ Идти Инфинитив МС-ПРЕДК Нечего Местоимение-предикатив МС-П Всякий Местоименное прилагательное ЧИСЛ Восемь Числительное (количественное) ЧИСЛ-П Восьмой Порядковое числительное Н Круто Наречие ПРЕДК Интересно Предикатив ПРЕДЛ Под Предлог СОЮЗ И Союз МЕЖД Ой Междометие ЧАСТ Же, бы Частица ВВОДН Конечно Вводное слово КР_ПРИЛ Красива Краткое прилагательное КР_ПРИЧАСТИЕ Построена Краткое причастие
Пример Расшифровка
Перечислим все используемые граммемы:
мр, жр, ср – мужской, женский, средний род; од, но – одушевленность, неодушевленность; ед, мн – единственное, множественное число; им, рд, дт, вн, тв, пр, зв – падежи: именительный, родительный,
дательный, винительный, творительный, предложный, звательный;
2 – обозначает второй родительный или второй предложный падежи;
св, нс – совершенный, несовершенный вид; пе, нп –
переходный, непереходный глагол;
дст, стр – действительный, страдательный залог; нст, прш, буд – настоящее, прошедшее, будущее время;
38
пвлповелительная форма глагола;
1л, 2л, 3л – первое, второе, третье лицо; 0 – неизменяемое;
кр – краткость (для прилагательных и причастий); сравн – сравнительная форма (для прилагательных); имя, фам, отч – имя, фамилия, отчество; лок, орг – локативность, организация; кач – качественное прилагательное; вопр, относ – вопросительность и относительность (для наречий); дфст – слово обычно не
имеет множественного числа;
опч – частая опечатка или ошибка; жарг, арх, проф – жаргонизм, архаизм, профессионализм; аббр – аббревиатура; безл – безличный глагол.
Как уже было сказано, одной словоформе может соответствовать много морфологических интерпретаций. Например, у словоформы стали две интерпретации:
 {СТАЛЬ, C, "но", ("жр,ед,рд","жр,ед,дт", "жр,мн,им", "жр,мн,вн") };
{СТАТЬ, Г, "нп,св",("мн,дст,прш")}.
Примеры использования программных модулей анализа русского текста
Программные модули разработаны на языке программирования С++, операционная система Win32.
Приведем примеры морфологического анализа русского текста (рис. 3.8–3.11).
Рис. 3.8. Определение существительного
39
Рис. 3.9. Определение существительного (глагола)
Рис. 3.10. Определение причастия
Рис. 3.11. Проверка предсказания (анализ
несуществующих слов)
40
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]