- •Научно исследовательский Иркутский Государственный технический университет
- •Методические указания к лабораторным и контрольным работам для студентов заочной формы обучения специальностей:
- •230101 “Вычислительные машины, комплексы, системы и сети ”.
- •Введение Цели и задачи дисциплины:
- •Место дисциплины в структурно-логической схеме
- •1.2. Основы регрессионного анализа
- •3.1. Генерация случайных чисел, имитирующих погрешность измерений
- •3.2. Моделирование "погрешностей" измерений при наличии "выбросов".
- •3.3. Помехоустойчивые оценки
- •3.4 Задание на лабораторную работу
- •4. Контрольная работа. Построение линейной регрессионной модели с одной независимой переменной.
- •Вопросы для самопроверки
- •Библиографический список
Место дисциплины в структурно-логической схеме
В перечень дисциплин, используемых при изучении информатики и вычислительной техники, входит большое число специальных предметов. Многие из них предполагают знакомство со статистическими методами обработки данных и методами построения математических моделей по эмпирическим данным. Без знания этих методов невозможно создание информационно-измерительных систем, систем автоматического управления, систем передачи данных и т.д.
Программа дисциплины «Методы обработки данных»
1.1. Основы теории оценивания
1.1.1. Основные задачи обработки измерений
Погрешности измерений. Основные понятия теории вероятностей. Статистическая обработка измерений. Числовые характеристики системы случайных величин. Многомерный нормальный закон распределения и законы распределения, связанные с нормальным.
1.1.2. Критерии качества оценок
Несмещенность оценок. Состоятельность. Эффективность. Асимптотически несмещенные оценки. Асимптотически нормальные оценки. Асимптотически эффективные оценки.
Метод максимального правдоподобия
Функция правдоподобия. Логарифмическая функция правдоподобия. Система нормальных уравнений. Метод наименьших квадратов. Недостатки метода.
1.1.4. Помехоустойчивое оценивание
«Выбросы» и роль аномальных измерений в системах обработки данных. Медиана как помехоустойчивая оценка. Метод наименьших модулей. Введение в робастное оценивание. Винзорированные и альфа-усеченные оценки. Помехоустойчивая оценка параметра масштаба.
Интервальные оценки
Надежность получаемых оценок. Неравенство Чебышева. Доверительный интервал. Распределение Стьюдента. Интервальные оценки параметров.
Проверка законов о распределении случайной величины
Коэффициенты асимметрии и эксцесса Гистограмма. Хи–квадрат распределение. Мера расхождения между статистическим и гипотетическим распределениями. Критерий Пирсона. Тест Колмогорова – Смирнова.
1.2. Основы регрессионного анализа
1.2.1. Основные задачи регрессионного анализа
Регрессионный анализ технологических объектов. Зависимые и независимые переменные. Диаграммы рассеивания. Линейные и нелинейные регрессии. Сведение нелинейных зависимостей к линейным.
1.2.2. Определение коэффициентов линейной модели
Общий вид линейной модели. Порядок модели. Корректированная и некорректированная суммы квадратов. Центрированные и нецентрированные модели.
1.2.3. Доверительные интервалы для коэффициентов
Доверительный интервал для коэффициента 1. Доверительный интервал для коэффициента 0.
1.2.4. Основные понятия дисперсионного анализа
Фундаментальное уравнение дисперсионного анализа. Число степеней свободы. Таблица дисперсионного анализа. Источники вариации зависимой переменной. Исследование уравнения регрессии.
1.2.5. Множественная линейная регрессия
Векторные уравнения регрессии. Система нормальных уравнений в векторной форме. Свойства оценки вектора параметров регрессии. Проверка адекватности модели. Принцип дополнительной суммы квадратов.
1.2.6. Последовательный регрессионный анализ
Частный и последовательный F–критерий. Проверка общей линейной гипотезы в регрессионных моделях. Статистика для проверки гипотез. Остаточная сумма квадратов. Анализ остатков.
2. Примерная тематика практических занятий
Генерация случайных чисел, имитирующих погрешности измерений.
Генерация случайных чисел, имитирующих погрешности измерений при наличии «выбросов».
Методы получения точечных оценок.
Помехоустойчивое оценивание.
3.Лабораторная работа. Точечные оценки параметров распределения (метод наименьших квадратов)
Цель работы: изучение свойств МНК-оценок (оценок, полученных методом наименьших квадратов); изучение методов генерации случайных чисел, имитирующих погрешности измерений при наличии «выбросов». Работа выполняется с использованием системы Mathcad.
Основная цель обработки данных состоит в том, чтобы получить некоторые заключения об ансамбле (генеральной совокупности) по выборке из этого ансамбля. Под ансамблем понимается набор всех возможных значений экспериментальных данных, т.е. ансамбль можно рассматривать как бесконечно большую выборку.
При получении наилучшей из возможных оценок одного или нескольких параметров распределения вероятностей возникает задача оценивания параметров. Такими параметрами могут быть коэффициенты, описывающие распределения вероятности: математическое ожидание и дисперсия (параметр сдвига и параметр масштаба) в случае нормального распределения или коэффициенты в эмпирической модели процесса.
Оценивание
некоторого отдельного значения параметра
дает точечную
оценку. Если плотность распределения
вероятности случайной величины Х задана
в виде функции Р(х,
),
где
– неизвестный параметр, а экспериментальные
данные представлены выборкой (x1,
x2,..,
xn),
то, вычисляя некоторую статистику,
например выборочное среднее
,
можно получить оценку значения.
Необходимо стремиться к тому, чтобы оценки–были:
— несмещенными;
— состоятельными;
— эффективными.
Оценка
параметра
является несмещенной,
если ее математическое ожидание M[
]
равно значению параметра.
Оценка называется состоятельной, если по мере увеличения выборки она все более приближается к значению параметра.
Несмещенная оценка называется эффективной, если ее дисперсия минимальна.
При оценивании параметров широко применяется метод максимального правдоподобия. Сущность этого метода состоит в следующем. Пусть Р(х; 1, 2,..,n) — плотность распределения случайной величины X, i — параметры функции распределения. Считается, что вид плотности распределения известен. Пусть имеем выборку из независимых наблюдений из одного и того же распределения. Совместную плотность при этом можно записать в виде:
gn(x\Θ) = gn(x1,x2,…,xn\Θ) = f1(x1, Θ) f2(x2, Θ)… fn(x1, Θ). (1)
Функцией правдоподобия (ФП) выборки называется совместное распределение наблюдений gn(x\ ), рассматриваемое как функция неизвестного параметра.
Так как события x1, x2,.., xn уже произошли, то они имеют максимальную вероятность, равную 1.
Оценками максимального правдоподобия называются значения величины , для которых функция правдоподобия достигает максимума (события x1, x2,.., xn уже произошли, следовательно, вероятность их появления равна единице, то есть имеет максимальное значение).
Более удобно работать с логарифмической функцией правдоподобия:
Ln(x\Θ)=lng(x\Θ)=∑ln f(xi, Θ). (2)
Переход к логарифмической функции правдоподобия (2) возможен потому, что значения аргументов, максимизирующих функцию и ее логарифм, совпадают. Если функция правдоподобия имеет первую и вторую производные, то ее максимум находится приравниванием нулю частных ее производных по каждому из параметров i. В случае нормального распределения, имеющего плотность вероятности (3)
f(x; 1, 2 ) = 1/(2√(2π))exp[(-1/2)(x-1)2/22] , (3)
неизвестными являются два параметра: 1 и 2.
Логарифмическая функция правдоподобия равна:
L = ln g (1, 2\x1, x2,…, xn,) = -n ln(2√(2π)) – (1/2)∑ (xi-1)2/22. (4)
В
выражении (4) первый член
не влияет на расположение максимума
плотности вероятности, так как2
— параметр масштаба. Второй член входит
в L
со знаком минус. Поэтому для максимизации
функции правдоподобия необходимо
минимизировать выражение
,
то есть сумму квадратов отклонений
случайных величинxi
от своего математического ожидания.
Таким
образом, если погрешности измерений
подчиняются нормальному распределению,
оценки параметров, полученные методом
максимального правдоподобия, совпадают
с оценками метода наименьших квадратов
(МНК-оценки). Приравнивая нулю частные
производные
и
,
получаем оценки параметров сдвига (1)
и масштаба (2):
;
(5)
.
Следовательно,
МНК-оценка математического ожидания
1
равна среднему значению результатов
наблюдений xi.
Оценка дисперсии (параметр масштаба)
смещена. Чтобы сделать ее несмещенной,
следует умножить ее на поправочный
коэффициент
.
Таким образом получаем следующие
МНК-оценки (6,7): оценка математического
ожидания (выборочное среднее):
,
(6)
оценка параметра масштаба (выборочная дисперсия):
(7)
Так как погрешности измерений очень часто обусловлены воздействием большого числа случайных факторов в силу центральной предельной теоремы теории вероятностей, можно предположить, что погрешности измерений подчиняются нормальному закону. В этом случае оценки, полученные по формулам (6) и (7), являются:
— несмещенными;
— состоятельными;
— эффективными.
