Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:
Основы прикладной лингвистики. Учебно-методическое пособие.pdf
Скачиваний:
0
Добавлен:
07.09.2026
Размер:
2 Мб
Скачать
☆
команд (JMP, MOV и ADD). Они соответствуют определенным ин­струкциям, написанным на машинном языке.
Написать программу, правильно работающую при первом же
запуске, практически невозможно. Поэтому программы в этом язы­ке можно менять и добавлять новые функции. Для этого нужно по­нять, как программа работает.
Компьютер не знает, как прочитать или выполнить инструкцию,
написанную на ЯА. Поэтому были созданы программы, переводя­щие язык ассемблера на МЯ, – ассемблеры.
Достоинства ЯА: программы, написанные на ассемблере,
намного проще читать и писать, а также изменять.
Недостатки ЯА
1. Программы на ассемблере медленнее запускаются и занима­ют больше места (как на физическом диске, так и в памяти) по сравнению с программами на МЯ.
2. Невозможно просто перенести программу на ассемблере с одного компьютера на другой.
3. Написание программ на ассемблере – довольно скучное дело, требующее много времени.
Вывод: чем проще разобраться в ЯП, тем больше и медленнее будут создаваемые с его помощью программы. А программисты хотят создавать программы, простые в написании, быстро работа­ющие и занимающие минимум дискового пространства.
Преодолеть недостатки удалось, создав языки высокого уровня.
2.2. Языки программирования высокого уровня
Языки программирования, которые имитируют естественные языки (ЕЯ) и способны на основании одного предложения строить несколько команд компьютера, принято считать языками высокого уровня. Они более строги и точны, чем ЕЯ. В них нет многознач­ных слов, игры слов и слова не употребляются в переносном смысле.
Язык программирования C
Это высокоуровневый язык. Он обеспечивает доступ к устрой-
31
ствам компьютера (как ЯА), и его программы просты для чтения, написания и изменения.
Пример программы на языке C:
main ()
{
printf (" Доброе утро! \n");
}
Эта программа отображает на экране фразу Доброе утро!
Преимущества языка С
1. Программы на С легче читать и писать.
2. С помощью этих программ вы получите доступ ко всем эле-
ментам компьютера, как и с помощью программ на ассемблере.
3. Программы можно запускать на других компьютерах без до-
полнительной доработки текста. Нужно только выполнить повтор­ную компиляцию.
Чтобы компьютер читал и понимал инструкции на языке С, нужно перевести программу на МЯ с помощью компиляторов.
На другом компьютере программу на языке С можно запустить с помощью специальной компилирующей программы.
В настоящее время бóльшая часть программ пишется на языке С. Улучшенные варианты языка С – языки С++, С# и Java. На язы­ках С и С++ написаны операционные системы Windows, Unix, Linux, а также программы Microsoft Word и Netscape Navigator.
Недостатки языка С
1. Программы на языке С достаточно велики и медленно рабо-
тают.
2. Язык С предоставляет доступ ко всем элементам компьютера,
включая возможность управления оперативной памятью компью­тера.
Создано много других языков программирования: FORTRAN, COBOL, Pascal, BASIC, Ada и др. FORTRAN – FORmula TRANsla-
tor (Транслятор формул). COBOL – Common Business-Oriented Lan­guage (общий язык для деловых предложений). BASIC – Beginner's All-purpose Symbolic Instruction Code (Универсальный символиче­ский код инструкций для начинающих).
32
Языки BASIC и Pascal используются для обучения людей про­граммированию. Это учебные языки. Язык BASIC очень простой. Чтобы отобразить на экране сообщение «Доброе утро!» нужно вве­сти только одну команду: PRINT " Доброе утро!".
Исходный код программ на BASIC позволяет сконцентрировать внимание на том, что необходимо сделать, а не на правильном напи­сании команд, как на языке ассемблера или на машинном языке.
Язык Pascal назван в честь французского математика и филосо­фа Блеза Паскаля. Он позволяет создавать хорошо структуриро­ванные программы. Их легко понять и изменить в будущем.
Программа для отображения фразы «Доброе утро!» выглядит следующим образом:
Program message (Input, Output);
Begin
Writeln ('Доброе утро!');
End.
Программы на BASIC менее структурированы. Это позволяет быстрее написать программу, но затрудняет чтение и понимание других программ.
2.3. Среда быстрой разработки приложений
Большинство языков программирования были созданы тогда, когда компьютеры могли отображать на экране только текст.
Когда понадобилось отображать графику, указатели мыши, окна, полосы прокрутки и панели задач, разработчики языков стали со­здавать диалекты уже существующих языков. Их назвали языками RAD (Rapid Application Development – быстрая разработка прило­жений).
Языки RAD позволяют создавать программы, в которых есть всевозможные графические элементы (кнопки, флажки, текстовые поля ввода и т. д.). В среде RAD можно проще и быстрее создать графический интерфейс, чем без нее. Самые популярные языки
RAD – Visual BASIC (на основе BASIC), Delphi и Kylix (на основе Pascal), Visual C# (на основе C#) Jbuilder (на основе языка Java).
33
Преимущества языков RAD
1. Скорость создания программы намного выше, чем с помощью
обыкновенного C++, BASIC или Pascal.
2. Уменьшение трудоемкости. Упрощение создания пользова-
тельских интерфейсов. Больше времени уделяется самой програм­ме, а не внешнему виду интерфейса.
3. Преемственность. Языки RAD созданы на основе ЯП высоко-
го уровня. Зная их, можно легко программировать на языках RAD.
Недостатки языков RAD
1. Плохая переносимость. Программы невозможно перенести с
одной платформы на другую без существенной переделки. Напри­мер, язык Visual Basic работает только с Windows 98/Me/NT/2000 и XP. Но не работает в операционной системе Linux.
2. Уменьшение быстродействия. Программы создаются быстрее,
а работают медленнее, чем аналогичные программы на C++, Pascal и BASIC.
3. Выбор подходящего языка
Нет такого языка программирования, который бы одинаково хо­рошо подходил для любых задач.
Чтобы стать профессионалом в написании программ, нужно изучить один из ЯП высокого уровня, например, C++. Зная его, можно легко перейти на другой язык, похожий на C++, например, Python или Java.
Чтобы научиться создавать программы для баз данных, то нуж­но изучить такой язык, как SQL (Structured Query Language – язык структурированных запросов) или VBA (Visual Basic for Applica­tions – Visual Basic для приложений).
Чтобы уметь создавать Web-страницы, нужно знать язык HTML (HyperText Markup Language – язык разметки гипертекста), а также немного Java, JavaScript или другие ЯП для Интернета.
Самым нужным будет тот язык программирования (ЯП), кото­рый позволит решать те задачи, которые будут перед вами постав­лены, легко и быстро.
34

ТЕМА 6

ЛЕКСИКОГРАФИЯ. ВЫЧИСЛИТЕЛЬНАЯ
ЛЕКСИКОГРАФИЯ. КОМПЬЮТЕРНОЕ

СОЗДАНИЕ СЛОВАРЕЙ

Лексикография (Л.) – наука о составлении словарей и само со-
ставление словарей как описание лексики языка и других языковых явлений.
Вычислительная лексикография – наука о машинных словарях естественных языков, используемых в памяти компьютера для ре­шения задач, требующих искусственного интеллекта. Это также ма­шинный анализ лексики.
1. Традиционная и машинная лексикография
Лексический мир языка изменился. Это связано с тем, что в настоящее время существует потребность записи человеческого зна­ния в память компьютера, а также коммуникация с ЭВМ.
Существует два аспекта проблемы.
1. Компьютерная техника проникает в традиционную Л. Она за-
меняет традиционную ручную картотеку. Здесь вычислительная Л. – часть обычной Л., которая занимается созданием бумажных словарей.
2. В интеллектуальных системах используются специальные ма­шинные словари естественных языков. Они нужны для распознавания лексических единиц на уровне ввода и морфологического анализа и для моделирования элементов понимания и мышления. Здесь вычис­лительная Л. – наука о машинных словарях естественных языков.
Использование ЭВМ позволяет избавить лексикографов от
огромного многолетнего труда по сбору, занесению на карточки и анализу лексического материала.
Есть примеры работ, которые демонстрируют возможности ма-
шинных фондов естественных языков для Л. Это «Сводный словник словарей русского языка». Он описан в работе Р. П. Рогожниковой «Машинный фонд русского языка и словарное дело» (1986). С по­мощью такого словника можно решать разные теоретические и практические задачи. Например, использовать его в научных иссле-
35
дованиях и учебных занятиях по Л., так как в нем отражены вариан­ты слов, отмеченные в словарях, а также омонимы и некоторые грамматические особенности слов.
Основные отличия машинных словарей от обычных:
1) обычный словарь комплементарен к знаниям человека. То есть он дает некоторую дополнительную информацию к той, которая уже есть.
2) машинный словарь (МС) автономен в функции информирова­ния. Он должен содержать всю информацию, необходимую для «ис­кусственного интеллекта» машины и для работы с данным словом. Компьютер не располагает «фоновым» знанием для пользования словарем.
В течение веков Л. была трудоемким и дорогим занятием, требу-
ющим много времени. Нужно было искать примеры употребления лексем, исследовать словари и тексты. Современная компьютерная технология изменила характер работы лексикографов.
1. Обработка больших объемов текстов за короткое время. Это позволяет получить огромное количество информации об употреб­лении слов, словоформ и словосочетаний, об особенностях грамма­тики и синтаксиса. Можно проследить эволюцию языковых элемен­тов. Можно получить настоящие современные словари за короткое время и сравнительно дешево.
2. Форма словарей. Используются CD-ROM с памятью в милли- арды байтов, быстродействующие компьютеры и мультимедийные технологии. Электронные словари снабжаются голосом, графикой и изображениями. Это позволяет более эффективно воспринимать ин­формацию.
3. Интернет. Словари, размещенные в базах знаний в разных концах мира, доступны пользователям, где бы они ни находились.
Существуют три типа словарей:
1) обычные бумажные словари;
2) электронные версии таких словарей, т. е. электронные словари с текстом на CD-ROM и с размещением в Интернете;
3) мультимедийные словари, объединяющие текст, речь и изоб­ражение.
Следующий шаг – объединение речевых и лингвистических тех-
нологий в мультимедийных словарях. Это позволит значительно
36
расширить возможности использования словарей для человека.
Это, например, следующие технологии:
1) лемматизаторы. Они позволяют распознать лемму в любой из форм. Это важно для языков синтетического строя;
2) морфологические анализаторы. Они дают возможность пред­ставлять лемму во всех ее словоизменительных разновидностях;
3) конвертеры «графема – фонема». Они дают возможность усво­ить произношение любого написанного слова;
4) конвертеры «фонема – графема». Они приводят написание лю­бой устной формы слова.
2. Отличия машинного словаря от обычного
Существует одно основное функциональное отличие МС от сло­варя, предназначенного для человека. МС работает в системе авто­матической обработки текстов. Он имеет принципиальную перемен­ность состава и может быть включен в работу практически с нуле­вым количеством слов, что бессмысленно для человеческого слова­ря. Структура словарной статьи в нем отличается от словарной ста­тьи обычного словаря. Она определяется целями и задачами машин­ной обработки текстов.
Перевод с одного языка на другой – это поиск близкого по значе­нию слова. Он неоднозначен, потому что описанию фактов на языке опыта может соответствовать несколько различных описаний на языке моделей. Неоднозначность можно расценивать как ошибку распознавания и последовательно применять методики для устране­ния ошибок идентификации.
Этот вопрос можно трактовать в рамках общих проблем комму­никации «человек – машина». Основной принцип коммуникации «человек – машина» на ЕЯ состоит в переводе конструкций ЕЯ в понятные машине коды. Для перевода в памяти машины как часть машинной информации содержится специальная лингвистическая информация. Элементы этой информации представлены в виде сло­варей, списков наименований понятий, наборов фраз и т. п.
В общем случае механизм перевода состоит в следующем: на каждом этапе поступающие элементы коммуникации сравнива- ются с набором альтернативных версий о том, каким должен быть
37
поступающий на этом этапе элемент после поступивших ранее эле­ментов. Результат работы этапа – наиболее подходящая версия из набора версий этого этапа.
На промежуточных этапах машина готовится воспринять не лю­бой элемент ЕЯ, а только те элементы, которые соответствуют по­степенно уточняющейся теме. Поиск элементов осуществляется только среди тех элементов лингвистической информации машины, которые представляют адекватную альтернативу для данного этапа коммуникации.
3. Словарь «МультиЛекс»
Словарь «МультиЛекс» – пример плодотворного сотрудничества в области традиционной и компьютерной отечественной Л.
Лексическая база – это самая важная составляющая компьютер­ного словаря. В основу «МультиЛекса» положены самые полные и авторитетные словари. Компания «Медиа-Лингва» выпускает специ­ализированные словари. Они могут подгружаться в программную среду «МультиЛекса 3.5». Пользователи могут самостоятельно со­здавать библиотеку словарей, подходящих для их профессиональной деятельности.
Словари электронные, но пользователю доступна вся информа­ция, которая имеется в оригинальных печатных словарях. Электрон­ная форма словаря позволяет существенно ускорить поиск словар­ной статьи. Она также предоставляет новые возможности в работе над переводом.
«МультиЛекс» облегчает поиск перевода устойчивых словосоче­таний. При работе с традиционными бумажными словарями нужно:
1) правильно определить опорное слово в словосочетании;
2) просмотреть всю словарную статью этого ключевого слова,
чтобы найти нужное словосочетание.
В «МультиЛексе» этой проблемы нет. В нем словосочетание – это такая же единица поиска, как и отдельное слово. В ответ на запрос словарь выдает список примеров, т. е. словосочетаний, в которых встретилась данная единица поиска.
Например, зададим русское идиоматическое выражение «когда рак на горе свистнет». В ответ получим следующий список англий-
38
ских словосочетаний: 1) once in a blue moon (см. once II); 2) when pigs begin to fly (см. pig II); tomorrow come never (см. tomorrow I).
В ответ на запрос словарь выдает список словарных статей, в ко­торых встретилось искомое выражение (в заголовке или в зоне рус­ских эквивалентов).
«МультиЛекс» имеет возможность осуществлять поиск по алфа­виту в режиме «Алфавитный поиск». Пользователю предлагается алфавитный список всех заголовков словарных статей. По нему можно передвигаться и выбирать нужные слова «вручную», т. е. с помощью мыши или клавиатуры.
Одна из основных особенностей компьютерного словаря «Муль­тиЛекс» – это его обратимость. То есть возможность перевода как с английского на русский, так и с русского на английский. Это потому, что поиск производится не только среди заголовков словарных ста­тей, но и непосредственно в их текстах.
Например, при поиске русского слова по англо-русским словарям «МультиЛекс» выдает список словарных статей английских слов, в которых встречается искомое русское слово в качестве переводного элемента или его части. Искомая единица будет выделена «маркером» в текстах словарных статей. Это позволяет легко ориентироваться в найденном материале и выбирать нужные переводные эквиваленты.
4. Проблема разрешения лексической многозначности
Основная проблема прикладной лингвистики в части лексическо­го уровня языка – это разрешение лексической многозначности. Впервые проблема автоматического разрешения лексической много­значности была сформулирована в связи с созданием систем ма­шинного перевода. Она стала одной из ключевых также и при созда­нии других систем обработки естественно-языкового текста. Напри­мер, информационный поиск, автоматическое реферирование, авто­матическое индексирование текстов, экспертные системы.
В задаче машинного перевода требуется максимально полное разрешение многозначности лексем. Основная часть смысловой ин­формации заключена в лексике. Неправильный перевод слов реша­ющим образом влияет на понятность текста и эквивалентность тек-
39
ста перевода. При правильном переводе слов грамматические ошиб­ки, например, меньше влияют на понятность текста.

ТЕМА 7

ИСКУССТВЕННЫЙ ИНТЕЛЛЕКТ: ОПРЕДЕЛЕНИЯ
И ОСНОВНЫЕ ПОНЯТИЯ
1. Искусственный интеллект. Объект исследования, методы
исследования, цели и задачи исследования
Искусственный интеллект – научное направление, в рамках ко-
торого разрабатываются теоретические и практические принципы компьютерного моделирования интеллектуальных способностей че­ловека, в том числе способности к пониманию естественноязыковых выражений и их синтезу.
Эта наука появилась во второй половине XX века на базе вычисли­тельной техники, математической логики, программирования, психо­логии, лингвистики, нейрофизиологии.
Искусственный интеллект (ИИ) – образец междисциплинарных исследований. Название науки возникло в конце 1960-х годов. В 1969 г. в Вашингтоне (США) состоялась первая Всемирная конференция по ИИ.
Совокупность научных исследований превращается в науку, если выполнены два необходимых условия. У них должен быть свой объ­ект изучения, не совпадающий с объектами изучения других наук. И должны быть методы исследования этого объекта, отличные от мето­дов других наук.
Объект изучения ИИ – метапроцедуры, используемые при реше­нии человеком задач, которые называются интеллектуальными, или творческими. Психология мышления изучает эти метапроцедуры применительно к человеку. ИИ создает программные и программно­аппаратные модели таких метапроцедур.
Цели исследований в области ИИ:
1) создание арсенала метапроцедур для того, чтобы ЭВМ могли
находить по постановкам задач их решения;
2) попытки проникнуть в области мышления человека, которые
40
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]