Добавил:
ivanov666
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз:
Предмет:
Файл:Машинный и автоматизированный перевод. Учебное пособие.pdf
X
- •Оглавление
- •2.1. Машинный перевод до изобретения компьютера
- •2.2. Пионеры машинного перевода
- •Теоретические вопросы машинного перевода
- •1. Понятие машинного перевода
- •1.1. Определения машинного перевода
- •1.2. Первые шаги в истории развития машинного перевода
- •1.3. Машинные помощники переводчика
- •1.4. Автоматизированный перевод
- •1.5. Автоматический перевод
- •2. История машинного перевода
- •2.3. Годы инноваций и великой эйфории
- •2.4. Годы разочарований
- •2.5. Доклад ALPAC и его последствия
- •2.6. Возвращение МП на научную арену
- •2.7. История становления и развития МП в советском и постсоветском пространстве
- •2.8. Новейшие разработки: состояние вопроса
- •3. Современные стратегии МП
- •3.1. МП, основанный на правилах
- •3.2. Прямой перевод
- •3.3. Непрямой перевод
- •3.3.1.Метод перевода с языком посредником (Interlingua)
- •3.3.2. Метод трансфера
- •4. Эмпирические методы
- •4.1. Статистический перевод
- •4.1.1. Принцип работы
- •4.1.2. Типы статистического машинного перевода
- •4.1.2.1. Статистический перевод на уровне слова
- •4.1.2.2. Фразеологический статистический МП
- •4.2. Статистические и основанные на правилах системы МП
- •4.3. Другие подходы
- •4.3.1. Нейронный машинный перевод (NMT)
- •4.3.2. Перевод, основанный на примерах
- •4.3.3. Контекстуальный подход
- •4.3.4. Подход, основанный на знаниях
- •4.3.5. Гибридные системы
- •5. Современные системы машинного перевода
- •5.1. PROMT Professional 7.0
- •5.2. SYSTRAN
- •5.3. GOOGLE-переводчик (или Google Translate)
- •5.4. Яндекс. Переводчик
- •5.5. ЭТАП-3 (Россия)
- •6. Системы автоматизированного перевода («КОШКИ»)
- •6.1. Smartcat
- •6.2. Memsource
- •6.3. SDL Trados Studio
- •6.4. memoQ
- •7. Оценка качества МП
- •8. Практические аспекты работы переводчика с МП
- •8.1. Алгоритм работы переводчика с машинным переводом
- •8.2. Пользовательский словарь переводчика при работе с МП
- •Контрольные вопросы и практические задания
- •1. Контрольные вопросы
- •3. Задания для самостоятельной работы
- •Список литературы

Часть 1
3.3.1.Метод перевода с языком посредником (Interlingua)
Метод перевода Interlingua стал активно развиваться, когда стало очевид-
но, что традиционный (основанный на правилах) метод не принес удовлетворительных результатов.
Главная особенность этого подхода в том, что между структурами ис-
ходного языка и структурами целевого языка находится один или несколько промежуточных языков, на которые по соответствующим правилам последовательно «переписываются» выражения исходного языка. Анализ и
синтез при использовании Interlingua принципиально различаются. Анализ
ведется в категориях исходного языка, а синтез – в категориях целевого.
В качестве языка (языков) – посредников могут выступать языки представления синтаксической и семантико-синтаксической структуры, чисто семантические языки, языки глубинной семантики, приближающиеся к концептуальному представлению в категориях теории знаний (фреймов, сценариев,
планов) [4, с. 4–6].
Процесс МП на базе метода Interlingua состоит из двух этапов. На первом
этапе исходный текст анализируется и переводится в промежуточный текст на
языке-посреднике. На второй фазе промежуточный кодовый текст преобразуется в текст на целевом языке [27, 39]. В научной литературе встречаются
упоминания универсальной или нейтральной языковой презентации текста
Interlingua [23, с. 14]. Под названием «презентация Interlingua» в большинстве
случаев понимается особый вид кодирования, которое с естественным языком не имеет ничего общего [23, с. 124].
Важнейшей целью теории метода Interlingua МП была разработка универ-
сального, независимого от языка кода, с помощью которого станет возможным перекодировка исходного текста в целевой. Однако эта амбициозная
цель оказалась неосуществимой на практике. Теория МП Interlingua оказалась
несостоятельной. [32, с. 8]. По причине несостоятельности этой теории началась активная работа над менее амбициозным и более реалистичным методом трансфера в МП.
21
3.3.2. Метод трансфера
Работа системы МП, основанного на трансфере, протекает в три этапа. На
первом этапе происходит грамматический и лексический исходного текста с
помощью правил и словарей исходного естественного языка и переводится в
абстрактный код исходного языка. На втором этапе этот закодированный исходный текст переводится в абстрактную презентацию на целевом языке посредством двуязычных правил трансфера (переноса). Исходя из абстрактной
презентации (кода) текста на целевом языке, формируется текст перевода на
целевом естественном языке. При этом используются грамматические правила и словари теперь уже целевого языка [27, с. 40].

Часть 1
Главным отличием от метода Interlingua является тот факт, что перекоди-
ровка исходного текста на естественном языке в промежуточный происходит
в четко заданной языковой паре, она привязана к языкам и учитывает известные правила грамматических и синтаксических трансформаций при переводе, поэтому эффект разработки более очевиден, и результат перевода
лучше [28, с. 27].
В отличие от систем прямого МП в системах МП, основанных на трансфе-
ре, морфологический анализ более продуман и, кроме того, дополнительно
используется семантическая и синтаксическая обработка, что существенно повышает качество перевода. На первый взгляд, кажется, что чем больше правил
интегрировано в программу МП, тем выше качество перевода. Однако практика показывает, что существует некий потолок в количестве источников информации для МП. На определенном этапе пополнение базы данных грамматическими правилами работа по их обработке приводит к внутреннему конфликту
между противоречащими друг другу правилами и возникновению новых ошибок. [32, с. 8].
Кроме того, необходимо учесть, что парсинг (автоматический синтаксиче-
ский анализ) осуществляется в рамках одного предложения, а не в пределах
сверхфразового единства и тем более не текста как целого. Ранее переведенные соответствия системы, основанные на трансфере, система МП не сохраняет, поэтому с каждым новым предложением система МП как бы начинает
анализ заново, теряя информацию о границах именных и глагольных групп,
функциональных сегментах, установленную при анализе предыдущего предложения. Разработчики осознавали несовершенство созданной системы, но
метод трансфера стал важной вехой в истории МП и был предопределен требованием перехода от конкретных лексических единиц к их кодовым обозначениям [1].
22
4. Эмпирические методы
При так называемом эмпирическом (аналоговом или корпусном) подходе
в отличие от традиционного метода МП, основанного на правилах, лингвистические модели не используются. Используемая лингвистическая база формируется эмпирически. Статистический метод МП, равно как и основанный на
примерах или контексте, функционируют на основе эмпирического подхода
[28, с. 29].
4.1. Статистический перевод
В 1988 Питер Браун, исследователь IBM, представила на Второй конферен-
ции TMI университета Карнеги Меллон свой разработанный совместно с коллегами метод статистического перевода [17, с. 79]. Статистический метод базируется на идее вероятности переводческих решений. Для этого требуется не

23
Часть 1
ввод грамматических правил в систему, а использование большого количества
параллельных корпусов.
Статистический машинный перевод (англ. Statistical Machine Translation –
SMT) – это перевод, который генерируется на основе статистических моделей,
с использованием двуязычных корпусов текста.
В 2007 году Google был одним из первых поставщиков, которые предста-
вили самообучающуюся систему перевода, которая статистически оценивает
базы данных и таким образом определяет наиболее вероятные переводы.
В рамках этой методологии ряд следующих друг за другом слов одновременно
рассматривается при статистическом переводе (машинный перевод на основе
фраз, PBMT) и при этом также оценивается частота употребления словосочетаний, что обуславливает неявное восприятие контекста принимается, особенно
когда значение сравниваемых слов достаточно близко.
Реализация статистического машинного перевода (SMT) в Translator ос-
нована на более чем десятилетних естественных исследованиях в Microsoft.
Вместо того, чтобы писать вручную созданные правила для перевода между
языками, современные системы перевода рассматривают перевод как проблему для обучения преобразованию текста между языками из существующих
переводов, выполненных человеком, и использования последних достижений
в прикладной статистике и машинном обучении.
Так называемые «параллельные корпусы» обеспечивают переводы слов,
фраз и идиоматических слов в контексте для многих языковых пар и сфер деятельности. Методы статистического моделирования и эффективные алгоритмы помогают компьютеру решать проблему декодирования (распознавания
соответствия между исходным и целевым языками в обучающих данных) и
декодирования (поиск лучшего перевода нового входного предложения). Переводчик сочетает мощь статистических методов с лингвистической информацией для создания моделей, которые лучше обобщают и приводят к более
понятным переводам.
Благодаря такому подходу, который не полагается на словари или грамма-
тические правила, этот метод обеспечивает лучший перевод фраз с использованием контекста вокруг конкретного слова по сравнению с попытками перевода отдельных слов.
К достоинствам статистических переводчиков можно отнести то, что они
хорошо запоминают редкие и сложные слова и фразы, присутствующие в параллельных корпусах Недостатком статистического перевода является иногда
проявляющийся эффект пазла, когда общая картина вроде бы понятна, но если
присмотреться, то видно, что она составлена из отдельных неидеально подходящих друг к другу кусочков.
Здесь и начинаются проблемы, особенно в случае с языковыми парами, в
которых порядок слов и / или грамматическая структура сильно различаются.
Эти недостатки устраняются путем интеграции дополнительных языковых моделей, моделей «переупорядочивания» и других поддерживающих алгоритмов.

24
Часть 1
Статистический подход также сильно зависит от практического материала.
Например, если вы тренируете алгоритм исключительно на примерных текстах зоологической тематики, то в репортаже об игре в бейсбол английское
слово „bat“ будет переведено как «летучая мышь», а не как «бита». В эйфории
от того, что появился новый метод журнал Computerbild (2007) процитировал
Филиппа Кёна, одного из разработчиков SMT: «Мы можем без проблем перевести технические и политические тексты – но мы не беремся за спортивные
комментарии и рецепты приготовления блюд» [36]. Причиной такой оценки
послужило тематическое ограничение текстов базы Организации Объединенных Наций или Европейского Союза, которые находятся в свободном доступе
и могут быть использованы в качестве практического материала для «обучения» машин.
4.1.1. Принцип работы
П. Браун в своей теории исходит из того, что каждое предложение T (target)
одного языка имеет вероятностный вариант перевода – предложение S (source)
на другой язык. С каждой парой предложений (S, T), т.е. исходным и целевым
текстом устанавливается вероятностная соотнесенность Pr (probability), ориентированная на правильный перевод [17, с. 79]. В параллельных корпусах система находит и соотносит наиболее вероятные пары предложений, исходя при
этом из исходного предложения T и соответствующего ему перевода предложения S, переведенного квалифицированным переводчиком.
Но, конечно, невозможно располагать корпусом всех возможных предло-
жений любого языка, поэтому статистические системы машинного перевода
работают с приблизительными моделями. Как правило, системы статистического МП комбинируют, по меньшей мере, две статистические модели, разработанные Брауном: модель перевода и языковую модель [16, с. 236].
Переводческая модель представляет собой двуязычный параллельный
корпус с маркировкой переводческих соответствий. С помощью этого параллельного корпуса вычисляется вероятность присутствия в исходном и целевом
тексте отдельных слов или фраз, соотнесенных не только по лексическому, но
и по синтаксическому критерию. По этому принципу из корпусов могут выбираться отдельные части предложения, соответствующие исходному тексту, как
варианты для перевода [32, с. 10].
Помимо переводческой модели используются одноязычные корпуса в рам-
ках определенной языковой пары. Они образуют языковую модель. Языковая
модель служит эталоном лингвистических структур соответствующих языков
[27, с. 43]. Затем применятся поиск для обнаружения фраз, которые система
МП идентифицирует согласно отдельным моделям как наиболее вероятные
варианты перевода и выдает их ранжированным списком, начиная с наиболее
вероятного. В результате получаем наиболее вероятностный перевод. Вероятности обычно передаются формулой Томаса Байеса, которая гласит:

Часть 1
Pr (S|T) =
, [17, 79]
где Pr (S|T) – вероятностная пара предложений, Pr (S) и Pr (T) соотносятся
с вероятностью того, что S und T в исходном и целевом языке будут идеально
коррелировать, а Pr (T|S) означает вероятность того , что S можно перевести
и как T [32, с. 10].
Обе системы используют и другие источники информации, так называ-
емые элементы (Features). К ним относят, например, длину предложения,
количество используемых фраз, насколько их последовательность в целевом
тексте отклоняется от последовательности в исходном и т.д. Все статистические модели и элементы комбинируются затем друг с другом в одной модели [16, с. 236].
4.1.2. Типы статистического машинного перевода
Анализ полных предложений статистическим методом не слишком целе-
сообразен, т. к. очень редко в корпусах обнаруживаются стопроцентные соответствия целых предложений. До тех пор, пока система не располагает корпусом, включающем в себя все возможные предложения языка. Анализируемую
системой единицу нужно уменьшать. В настоящее время различают несколько
типов статистического перевода по уровню, на котором анализируется текст:
статистический перевод на уровне слова и на уровне фразы [32, с. 11].
4.1.2.1. Статистический перевод на уровне слова
Первичный вариант статистического машинного перевода анализирует
корпус на уровне слова. Это означает, что одно слово исходного языка должно соответствовать слову целевого языка. Этот вариант может вызывать различные проблемы. Иногда слово может быть переведено только с помощью
нескольких слов, например, Öffnungszeiten на немецком и часы работы на
русском. Перевод с русского языка на немецкий возможен, а вот обратный
перевод технически невыполним, т. к. каждому слову исходного языка должно соответствовать, по меньшей мере, одно слово целевого. При переводе с
русского языка на немецкий мы получили бы ошибочное выражение Stunden
der Arbeit.
Следующая проблема состоит в том, что слова, образующие фразу, пере-
водятся отдельно. Это особенно ощутимо при переводе глаголов с отделяемыми приставками, поскольку при опущении приставки значение глагола может
сильно меняться. Эта проблема возникает также в языковых парах со значительными различиями в синтаксисе, как, например, в случае с позицией финитного глагола [32, с. 12].
25

26
Часть 1
4.1.2.2. Фразеологический статистический МП
Для преодоления вышеописанных проблем были разработаны новые ме-
тоды статистического МП. Современные системы работают, как правило, на
уровне фраз, под которыми понимаются не целые предложения, а его словосочетания. С помощью этого метода можно слово перевести словосочетанием и наоборот. Еще одним преимуществом является использование контекста, который во многих случаях исключает двусмысленность, решая проблему
многозначности. Так, основанная на пословном переводе система МП, не может решить, какой перевод для faul верный в выражениях fauler Schüler и faule
Kartoffel, а фразеологический МП на это способен. Системы МП различаются
количеством слов в словосочетании. Таким образом, различия в синтаксисе
исходного и целевого языков могут преодолеваться тем успешнее, чем длиннее словосочетание, содержащееся в памяти переводов [32, с. 12].
Рассмотрим принципы работы фразеологического машинного перевода,
разработанные, например, российскими учеными Г. Г. Белоноговым и А. А. Хорошиловым, более подробно. По мнению А. А. Хорошилова, базовые принципы ФМП следует сформулировать следующим образом:
1. Основными единицами языка и речи, включаемыми в базу МП, должны
быть словосочетания, фразы. Отдельные слова тоже нужно добавлять к лингвистическим ресурсам для использования их в крайнем случае, т. е. если они
не входили в переводимые словосочетания.
2. Наряду с фразеологическими единицами система ФМП использует и так
называемые «речевые модели» – фразы с лакунам «пустыми местами», которые могут заполняться путем подстановки словами или фразами, образуя
смысловые единства.
3. Машинный словарь обязательно должен быть политематическим для
перевода текстов из различных предметных сфер, поскольку, как показывает практика перевода, большинство тестов политематичны. Кроме того, подключение к системе ФМП словарей с общенациональным словарным фондом
тоже обязательно.
4. Для систем ФМП требуются словари большого объема. Такие словари
должны генерироваться в процессе автоматизированного перевода.
5. Помимо политематических словарей большого объема целесообразно
использовать также несколько небольших по объему дополнительных словарей для восполнения пробелов в данных политематических словарей.
6. Фразеологический перевод является одним из действенных средств
преодоления полисемии (многозначности), т. к. слова переводятся в контексте. Вспомогательным средством служат словари, в которых для каждого слова указываются его приоритетные значения для данной области знаний.
7. Велика роль процедур морфологического и синтаксического анализа и
синтеза текстов, построенных на основе принципа аналогии. Она позволяет
отказаться от громоздких грамматических справочников и синтезировать пра-

27
Часть 1
вила в процессе перевода автоматически и делает систему перевода открытой, не привязанной к конкретным лексическим единицам.
8. ФМП предусматривает интерактивный режим их работы. Интерактив-
ный режим означает возможность вмешательства человека-переводчика в
процесс до завершения процесса перевода. Вмешиваясь в процесс перевода,
переводчик может менять настройки системы, например, подключать соответствующие тематические словари. Системы ФМП ориентированы прежде всего
на перевод специальных текстов технической, экономической, политической
и т. д. направленности. Для перевода художественных текстов использование
МП нецелесообразно [8, с. 48-50].
4.2. Статистические и основанные на правилах системы МП
Важнейшим преимуществом статистических систем по сравнению с систе-
мами, основанным на правилах, является стоимость и затраты времени. Установка систем, основанных на правилах, занимает много времени и связана с
большими затратами, поскольку экспертам необходимо задавать новые правила и интегрировать их в системы. Статистические системы в ближайшее время станут доступными по цене, и их можно будет использовать для тех языков,
для которых отсутствуют лингвистические ресурсы у систем, основанных на
правилах. Необходимым условием является наличие единого многоязычного
корпуса. Для большинства стран Европейского союза, это, к примеру, тот случай, когда в параллельном корпусе Европейского союза сохранены все протоколы Европейского парламента.
В таком случае в скором времени возможно создание статистических си-
стем МП, способных к качественному переводу не в меньшей степени, чем системы, основанные на правилах. Если говорить о лингвистической многозначности или свободных словосочетаниях, то статистический перевод справляется
с этими трудностями даже лучше, с условием, что в эти словосочетания уже
присутствуют в памяти системы. Исходя из вышесказанного, простое правило
статистического перевода можно сформулировать таким образом: чем больше используемые корпуса, тем лучше [32, с. 12]. Недостатки статистического
перевода вытекают почти полностью из его преимуществ. Поскольку переводы создаются на необозримо большом материале, могут возникать отдельные
ошибки, которые систематически повторяются и не могут быть устранены. Качество перевода зависит в значительной степени от той тренировочной базы,
на которую опирается система. Следующую проблему представляет потребность в объемных единых корпусах. Некоторые языки не располагают достаточным количеством необходимого материала в электронной форме. Отсюда
следует еще одна очевидная проблема: бесконечная потребность статистических систем в пополнении новыми данными, поскольку тренировочного материала может оказаться недостаточно [32, с. 13].

28
Часть 1
4.3. Другие подходы
4.3.1. Нейронный машинный перевод (NMT)
В ноябре 2016 года, получив широкое освещение в СМИ, компания Google
представила первую систему перевода на основе нейронной сети (Neural
Machine Translation, NMT) и пообещала сократить разрыв между человеческим и машинным переводом с помощью более естественно сформулированных предложений («Преодоление разрыва между человеческим и машинный
перевод»; (Yonghui Wu et al., 2016)). До этого времени проводились многообещающие исследования по использованию нейронных сетей, но системы
NMT сократили их количество, так как справлялись с практическим переводом
хуже, чем усовершенствованные SMT-технологии. Google впервые удалось
устранить определенные недостатки, такие как медленная скорость обучения,
неэффективная обработка редко используемых слов или отсутствие перевода
всех слов в исходном предложении.
В отличие от SMT, в NMT-системах все предложение анализируется еди-
новременно. В математическом плане осуществляется переход от линейного
отображения между входным языком и языком вывода в SMT к нелинейному
отображению в NMT, основанном на векторном представлении предложения
ввода и вывода через несколько промежуточных стадий и несколько степеней
абстракции. Это означает, что каждое отдельное слово можно рассматривать
в соотношении с остальными словами в предложении, т.е. в контексте. Дополнительные языковые модели здесь не нужны. За счет единовременного
рассмотрения целого предложения со всеми связями алгоритмы NMT лучше
справляются с так называемыми „long-distance dependencies“ («зависимостями на большом расстоянии»), т.е. с рассмотрением отдельных частей предложений, которые зависят друг от друга грамматически или содержательно и
могут оказывать сильное влияние на контекст.
Особенно в немецком языке часто встречаются такие „long-distance
dependencies“: „Für die Geburtstagsfeier der dreijährigen Lise brachte der Vater
ein Kaninchen mit einer blauen Schleife mit/um.“ Также NMT лучше обрабатывает
языковые пары, в которых сильно различается порядок слов. Тем не менее сохраняется сильная зависимость от объема, качества и направленности обучающего материала. В целом системы NMT генерируют предложения, которые
звучат намного естественнее и понятнее для людей, чем системы SMT, в которых больше внимания уделяется контенту. Структура предложения становится
лучше, количество синтаксических ошибок сокращается, а также допускается
меньше ошибок в порядке слов.
На сайте Microsoft Translator (Microsoft) заинтересованный пользователь
может сам провести тест и попробовать сравнить качество полученных переводов. Два примера в таблице ниже демонстрируют, с одной стороны, лучший
уровень перевода NMT, а с другой стороны по-прежнему сохраняющуюся не-

Часть 1
адекватность предложений, формулировки которых требуют дополнительных
усилий для понимания сообщения.
Deutsch
Mal entwickeln sich Umsätze anders als geplant, die IT-Probleme sind größer als erwartet
oder Fachkräe Mangelware. Wir porträeren jede Woche einen Mielständler, der eine
Herausforderung kreav, mug und klug gemeistert hat.
Russisch
SMT NMT
Иногда продажи развиваются иначе, чем
планировалось, ИТ-проблемы больше, чем
ожидалось, или квалифицированных работников не хватает. Каждую неделю мы
изображаем компанию среднего размера,
которая справилась с задачей творчески,
смело и мудро.
Deutsch
Gedichte sind Ideen-Erweiterungs-Maschinen. Sie können das Unmögliche wahr werden lassen, in ihnen kann etwas völlig Verrücktes und Überraschendes geschehen
Russisch
SMT NMT
Стихи – это машины для расширения идей.
Они могут сделать невозможное реальностью, в них может произойти что-то совершенно сумасшедшее и удивительное.
Иногда продажи развиваются не так, как
планировалось, проблемы с ИТ больше,
чем ожидалось, или не хватает квалифицированных рабочих. Каждую неделю мы
изображаем компанию среднего размера, которая творчески, смело и умно
справилась с задачей.
Стихи – это машина для расширения
идей. Они могут воплотить в жизнь невозможное, внутри них может произойти
что-то совершенно безумное и удивительное.
29
Даже несмотря на то, что по данным Google, в течение 2017 года прак-
тически все крупные провайдеры в сфере перевода, такие как Microsoft/Bing,
Yandex, Systran, SDL или Omniscien интегрировали технологию NMT в свои системы, алгоритм SMT не исчез. Часто используются гибридные процессы, в
которых используют оба подхода. Например, алгоритмы SMT упрощают интеграцию проблемных или прикладных баз данных, перевод специфической технической терминологии или регулярно повторяющихся терминов, включают
предложения и формулировки с проверенным переводом (база переводов). В
отличие от возможностей NMT, это гарантирует, что обучающие тексты будут
размечены, а фиксированные метки будут последовательно расставлены по
всему тексту. В зависимости от назначения приложения, области применения,
доступных обучающих материалов SMT также может обеспечить лучшее качество перевода для рассматриваемой языковой пары.
В августе 2017 года на рынке неожиданно появился новый игрок. Немец-
кая компания DeepL опубликовала на своем веб-сайте (DeepL) нескромное заявление о том, что „im Blindtest […] DeepLs Resultate etwa drei Mal so häufig als
beste Übersetzung gewählt werden, wie die der anderen.“ («в ходе слепого тестирования [...] результаты DeepL признаются лучшим переводом примерно в три
раза чаще, чем результаты других систем». В качестве базовых нейронных сетей
DeepL впервые использует не так называемых рекуррентные нейронные сети, а

Часть 1
сверточные сети („Convolutional Networks“). Такие архитектуры являются общими для распознавания изображений, их использование рассматривалось в исследовательских проектах некоторых компаний, в том числе Google и Facebook,
но в коммерческих целях они до этого не применялись. Преимущество сверток заключается в том, что все слова могут переводиться параллельно и сразу
подвергаться оптимизации с использованием уже существующих библиотек для
расчета (Merkert, 2017). Кроме того, система DeepL получила преимущества и
за счет другого фактора. Дочернее предприятие DeepL под названием Linguee
ранее продавало поисковую систему для переводов и смогло таким образом
собрать чрезвычайно объемные, высококачественные обучающие данные.
Центральной технологией будущего, безусловно, будет самообучающаяся
система, выходящая за рамки чисто статистических методов. Наряду с дебатами о качестве переводимых текстов это обосновано и возможностью нулевых
переводов, т.е. прямых переводов между языковыми парами, для которых нет
параллельных обучающих текстов. Какие предположения и какие обещания
действительно сбудутся станет очевидно в ближайшие годы.
Чтобы сделать однозначное заявление о том, какой алгоритм даст лучшие
результаты, качество перевода должно быть измерено объективно. При этом
особенно важно изменить настройки параметров существующих алгоритмов,
научиться оптимизировать их и соответственно развиваться дальше. Если будет использоваться система ИИ (искусственный интеллект), которая, например,
научится легко находить дорожные знаки в видеостримах в других контекстах,
то легко будет проверить, сколько знаков было правильно идентифицировано,
а сколько было упущено из виду.
4.3.2. Перевод, основанный на примерах
30
Перевод, основанный на примерах, наряду со статистическим, один из
наиболее обсуждаемых в последнее время подходов [28, с. 13]. Эти два подхода различаются методами использования корпуса. Системы, основанные на
примерах, не ориентируются на математически вероятностный выбор перевода, а пользуется принципом аналогий. Сегменты исходного текста соотносятся
с наиболее близкими соответствиями целевого языка [31, с. 113].
Системы, основанные на примерах, исходят из менее объемных корпусов,
чем системы статистического [32, с. 13]. Целью поиска являются не наиболее
вероятностные, а самые близкие варианты перевода. Чтобы справиться с проблемой многозначности, работают с тезаурусами, в которых языковые сегменты иерархически систематизируются по содержанию значения [32, с. 29]. Часто
системы, основанные на примерах, интегрируются с системами памяти переводов (Translation Memory). Их можно рассматривать как идентичные методы.
Различие состоит в том, системы памяти переводов задуманы как поддержка
специалиста- переводчика в то время, как системы, основанные на примерах,
работают абсолютно автономно [32, с. 114].
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]
