Добавил:
Upload Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:
CH2.DOC
Скачиваний:
0
Добавлен:
01.07.2025
Размер:
465 Кб
Скачать
☆

Спектральный анализ

Анализ на основе кодирования методом линейного предсказания.

Синхронный анализ основного тона.

Кепстр.

Трехмерный логарифм с регистрацией значения на основе кодирования методом линейного предсказания.

Спектр частоты.

Реальный или сложный кепстр.

Синтез на основе кодирования методом линейного предсказания, формантный синтез.

Параметры спектральных пиков.

Спектрограмма.

Трехмерный спектр быстрого преобразования Фурье.

Спектр на основе кодирования методом линейного предсказания.

Синхронный синтез основного тона.

Амплитудные или частотные кривые сглаженных спектров.

Асинхронный спектр основного тона.

Моделирование адресного регистра, кепстральное выделение основного тона.

Выбор спектральных пиков путем извлечения корней.

Анализ частоты основного тона

Локализация пиков для синхронного анализа основного тона.

Анализ адресного регистра, выделение основного тона путем преобразования Фурье (с переходом на нижний регистр).

Автокорреляции, перекрестные корреляции.

Моделирование адресного регистра, кепстральные выделения частоты основного тона.

Выделение основного тона методом КЛП.

Фильтрация

Виды: эллиптическая, Баттервота, Чебышева I/II, линейно-фазовая, нижних частот, верхних частот, полосная, с режекцией полос, октавных полос.

Обработка речевого сигнала и формы речевой волны

Сложение, вычитание, умножение, деление, усреднение, свертывание, уплотнение, разрежение, клиппирование, генерирование белого шума, интерполяция, локализация экстремумов.

Преобразования Гильберта. Вычисление сигнал-остатка (для обратной фильтрации).

Линейная и динамическая деформация во времени.

Прочие характеристики

Генераторы тестовых функций. Трехмерные функции.

Моделирование речевого тракта.

Параметрические амплитудные кривые, гистограммы, кривые разброса.

Возможность обнаружения.

Статистика: стандартная, линейная регрессия, сглаживание кривых, сравнение и классификация, дискриминантный анализ, выделение признаков.

Все программы для IBM PC, так же как и KAY 5500, применяют стандартные мониторы с горизонтальным размером экрана из 640 элементов изображения (точек). Поскольку все они могут использовать почти всю ширину экрана для изображения формы волны или спектра, репрезентативными для этой группы являются следующие величины разрешающей способности:

  • форма речевой волны за одну секунду: одно передвижение курсора равно 1,5 мс;

  • спектр в частотном диапазоне, равном 5 кГц: одно передвижение курсора равно 8 Гц.

MacSpeech Lab. II достигает подобной разрешающей способности на дисплее Macintosh II. Разрешающая способность по вертикали, однако, варьируется для этих систем в зависимости от средств обеспечения графического режима, пропорции используемого экрана, амплитудного и частотного диапазонов.

Все программы требуют наличия компьютера, монитора и клавиатуры. Четыре программы, которые выполняются на IBM PC, могут также выполняться и на компьютерах серии PS/2. CSpeech в настоящее время обеспечивается аналого-цифровым преобразователем только для моделей Micro Channel этой серии. Принтер является необязательным, но крайне желательным для многих целей. CSpeech, CSRE и ILS-PS включают только программное обеспечение, поэтому пользователь должен предусмотреть аналого-цифровой преобразователь, фильтры против эффектов наложения, устройство речевого ввода/вывода, сопроцессор для выполнения математических операций.

Kay 5500 выступает как полная система с различным дополнительным оборудованием, включая принтер и компьютерный интерфейс.

Выбор пакета программ речевого анализа зависит от потребностей пользователя, бюджета и степени опыта в области цифрового анализа речи. Пользователь должен также учитывать не только стоимость и скорость работы системы, но и разрешающую способность и память, которые могут быть ограничены из-за технического обеспечения. В настоящее время анализ сигнала в реальном масштабе времени доступен только при наличии специализированных сигнальных процессоров, таких, например, как в Kay 5500. Разрешающая способность изображения в громадной степени зависит от технического обеспечения видоизображения.

Macintosh II использует черно-белый дисплей с 256 градациями, так что MacSpeech Lab. II дает черно-белые спектрограммы.

CSRE дает спектрограммы в 16—256 цветовых градациях на стандартном IBM-дисплее5 с усовершенствованным графическим адаптером. Они могут быть напечатаны на многоцветном печатающем устройстве или на лазерном печатающем устройстве.

Kay 5500 предлагает на своем мониторе как многоцветные, так и черно-белые спектрограммы. Частота дискретизации также зависит от технического обеспечения. Некоторые аналого-цифровые преобразователи, подобные поставляемому вместе с MSL, имеют ограничение до приблизительно 25 000 замеров в секунду на PC/AT, в то время как некоторые преобразователи из обеспечения CSpeech, CSRE и ILS-PC могут производить замеры вдвое быстрее и даже еще чаще. Эти высокие скорости полезны при дискретизации звука с более высокой частотой многочисленных каналов либо при наличии того и другого. Пользователи при выборе пакета программ речевого анализа должны учитывать свои специфические задачи. Клиницисты-медики, возможно, отдадут предпочтение системам, которые предлагают простоту использования, быстрый анализ и информативное графическое представление результатов. Лучше всего этим требованиям отвечают CSpeech. Lab. II и Kay 5500. MSL, MacSpeech Lab. II и CSpeech разработаны с расчетом на простоту использования, а CSRE может быть сравнительно доступна для начинающего пользователя.

Kay 5500 может также служить мощным средством, предлагая обратную связь в реальном масштабе времени и непосредственные визуальные сравнения между формой волны, изображениями спектра и спектрограммами. Более опытный исследователь найдет для себя широчайшие возможности и аналитическую модель в ILS PC и Kay 5500, особенно при наличии дополнительного компьютерного интерфейса для последнего, что обеспечивает хранение и передачу файлов, а также анализ и ресинтез на основе кодирования методом линейного предсказания. Такому пользователю следует также обратить внимание на CSpeech из-за масштабирования Барка (Bark scaling) и исключительно тонкого голосового анализа (дрожание, мерцание, уровень сигнал/шум).

Система CSRE может также быть полезной для исследователя главным образом из-за включения в нее модели параметрического синтеза Клатта и непрерывного генератора, который порождает градуированную последовательность синтетических стимулов. В среде фирмы Macintosh MacSpeech Lab. II может также служить основой исследовательских программ с высоким уровнем требований. Ее данные могут использоваться в качестве ввода для программ Signalyze.

Для более крупных лабораторий и совместных проектов переносимость данных может быть еще одним решающим моментом выбора Kay 5500, которая, например, способна записывать свои файлы данных в форматах, читаемых MSL и ISL, и может служить великолепной оцифровывающей станцией сбора файлов данных. Эти файлы затем могут передаваться в сеть микрокомпьютерных анализирующих станций, доступных членам исследовательской группы. Программисты могут записывать небольшие трансляторы для передачи данных по всем программам, рассмотренным в данном обзоре.

MacSpeech Lab. II и Kay 5500 (с дополнительным компьютерным интерфейсом) могут передавать данные непосредственно программам обработки крупноформатных таблиц.

CSpeech записывает данные в стандартные файлы ASCII, которые служат вводом для программ обработки крупноформатных таблиц, программ графического отображения и программ базы данных.

Как ILS-PC, так и CSpeech обеспечивают и другие способы обработки данных: ILS включает в себя программы для множества других операций, в то время как CSpeech предоставляет исключительные возможности для самостоятельного программирования. Пользователь, который владеет языком, например Turbo Pascal, может брать данные с любого канала, модифицировать их любым способом и выводить результат на любой канал.

Современные разработки представляют собой шаг вперед в отношении расширения возможностей аппаратно-программных средств, особенно для небольших лабораторий по изучению речи. В качестве примера приведем некоторые дополнительные системы:

а) Signalyze — программа многоканального речевого анализа для персональных компьютеров фирмы Macintosh (512 из серии II).

Текстовой вариант не включает сбор данных и поэтому не требует аналогового технологического обеспечения, но он способен вводить данные в нескольких форматах:

MacRecorder (Sound Edit),

Impulse (Sound Ware),

Mac DZOS (MacSpeech Lab. II), двух стандартных форматах Apple и формате с настраиваемым звуковым ресурсом, так же как и цифровой ASCII. Разработчики планируют сбор данных в формат AIFF (DigiDesign and Audio Interchange Format) в промышленном варианте.

Signalyze пользуется памятью более крупных устройств; Mac Plus с памятью в 1 Мб обеспечит размещение отрезка речи в 15 с с объемом в 16 бит на образец и частотой дискретизации в 10 кГц. Signalyze поставляет меню Macintosh, диалоговые блоки и сообщения об ошибках на английском, французском и немецком языках. На одном экране система может дать параллельное изображение разных характеристик сигнала, таких, как форма волны, контуры основной частоты F0, RMS и спектрограмма.

Signalyze описывается как многоканальный анализатор с временной блокировкой для сигналов, записанных с различной скоростью. Обработка формы волны включает изменение масштаба изображения, редактирование (сегментацию, копирование, склеивание, очищение) и ручную маркировку. Спектральный анализ включает 512-точечную спектрограмму на основании быстрого преобразования Фурье и изображение спектрального отрезка. Частота основного тона может быть выделена либо с помощью временного структурного анализа, либо программы Клатта. Программная фильтрация включает фильтр банка данных (n=24), основанный на шкалах Bark/Mel/cents, 1/3 octave или линейном/логарифмическом. Целый ряд других функций планируется или уже осуществлен для выпуска в продажу.

б) Ultrasound — пакет программ звукового анализа, продаваемый фирмой Uniquest Ltd. из Австралии. Программы реализуются на IBM PC или устройстве, совместимом с графическим дисплеем и аналого-цифровым преобразователем из Data Translation, MSL, либо на самом Ultrasound.

Для редактирования требуется мышь, а сопроцессор для выполнения математических операций ускоряет вычисления. Обеспечиваются общепринятые для PC графические форматы: VGA, EGA, CGA и Hercules.

С помощью Ultrasound можно записать, вывести на экран, отредактировать и воспроизвести образцы речевых отрезков на одном канале. Размер образцов ограничивается только местом, имеющимся на твердом диске; каждый мегабайт удерживает отрезок речи в 50 с с частотой замеров в 10 000 в секунду. Ultrasound предлагает до четырех изображений на экране одновременно; каждое может быть пяти типов: кривая формы волны, цветная спектрограмма, контур основного тона, каскадный спектр или статистический спектр. Каждое изображение может принадлежать по желанию пользователя разным сигналам, и пользователь может выбирать линейный или логарифмический масштаб для любого анализа частоты. Можно отмечать и маркировать сегменты формы волны, вычерчивать кривую каскадного спектра как вперед, так и назад по времени, выбирать срезанные амплитуды для изменений цвета в спектрограмме и отформовывать предварительно выделенные кривые в соответствии с сигналом.

в) RSL (Realtime Signal Laboratory). Система RSL вычерчивает кривые двух спектрограмм (с различной шириной полосы частот) в шестнадцати тонах на монохромном дисплее при расположении между ними формы волны. Пользователь может записать, воспроизвести, вывести на экран отрезок спектра или выбрать часть сигнала для изображения в измененном масштабе на одной из спектрограмм.

г) IBM Speech Viewer — инструментальное средство для занимающихся патологией речи, преподавателей в области специальной системы обучения и других лиц, имеющих дело с нарушениями речи. Она состоит из программного и технического обеспечения, предназначенного для IBM PS.

Кроме записи, воспроизведения и сохранения образцов речи система включает модули для прогона на мониторе и обеспечения практики в таких речевых параметрах, как озвучение, частота основного тона, амплитуда и синхронизация. Она предназначается для обеспечения работы в клиниках, начиная от создания уровня осознания до приобретения навыков, и использует усовершенствованную графику и игровую стратегию.

Speech Viewer обладает некоторыми возможностями систем анализа, описанных выше, но в составе программ, предназначенных для клинического использования.

д) MacRecorder Sound System — комплект программного и технического обеспечения для микрокомпьютеров Apple Macintosh, который включает программы Hyper Sound и Sound Edit.

Система может записывать, редактировать, копировать и воспроизводить формы сигнала. Она также может выводить на экран спектр в реальном времени, спектрограмму или каскадное быстрое преобразование Фурье. Запись (с разрешающей способностью в 8 бит) осуществляется с помощью устройства ввода и последующей оцифровки речевого сигнала.

е) CSL (Computerized Speech Lab.) разработана для IBM PC и совместимых компьютеров. Содержит аппаратно-программное обеспечение для записи, воспроизведения, анализа и синтеза речевого сигнала.

CSL — это полная система (за исключением компьютера), включающая микрофон, предусилитель, АЦП и ЦАП, выходные фильтры, наушники, динамики, усилитель, межкомпьютерный коннектор, регулировку уровня входного и выходного сигналов, печатную плату, на которой находятся два сигнальных процессора и соответствующие программы.

Система обеспечивает высококачественную оцифровку и воспроизведение речевого сигнала. Возможные виды анализа речи: спектрограмма (в VGA-графике), отслеживание формант, выделение частоты основного тона, спектр интенсивности и кодирование методом линейного предсказания.

Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]