Добавил:
ivanov666
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз:
Предмет:
Файл:Методы обработки и анализа экспериментальных данных. Учебное пособие
.pdf
значения характеристики в этот интервал оценивается доверительной
вероятностью. Очевидно, что если исходный статистический материал
однороден, то с ростом N для той же доверительной вероятности
доверительный интервал будет уменьшаться или, если доверительный интервал
оставить постоянным, то с ростом N будет возрастать доверительная
вероятность попадания истинного значения характеристики в этот интервал. В
математической статистике есть специальные методы оценки доверительных
интервалов. Для определенных условий доказаны свойства и законы
распределения выборочных оценок, дающие возможность задать с
определенной доверительной вероятностью их доверительные интервалы. Для
среднего μх – этоt-критерий Стьюдента, для дисперсии Dx и коэффициента
корреляцииr– это F-критерий Фишера. Этим критериям соответствуют и
специальные законы распределения вероятностей: распределение Стьюдента,
распределение Фишера. Их табличные оценки можно найти в любом учебнике
по математической статистике. На практике рекомендуется искать
доверительные интервалы для стандартных значений доверительной
вероятности. Эти стандартные значения: 0,90, 0,95, 0,99, иногда 0,995. Чем
выше доверительная вероятность при постоянном N, тем шире доверительный
интервал. На практике авторы не рекомендуют пользоваться стандартными
схемами математической статистики при оценке доверительных интервалов. В
последнее время все больше исследователей склоняется к этой позиции. Для
определения достоверности выборочных оценок полезнее собрать как можно
больше статистического материала, разбить его на несколько одинаковых
выборок, рассчитать интересующие нас оценки и совместно проанализировать
полученный результат. После этого увеличить объемы подвыборок, уменьшив
их количество, вновь провести расчеты и вновь проанализировать результат,
тем самым сделав заключение о том, как же сильно колеблется выборочная
оценка. В конечном итоге следует получить выборочную оценку по всей
выборке. Полезно так же осуществить расчет интересующих нас выборочных
31

оценок по непрерывно нарастающей выборке с отображением графика
1
ˆ
Р
Р
ˆ
47,0
3
45,047,05,0
3
201918
hhh
изменения этой выборочной оценки.
Пример.
– вероятность выпадения решки.
2
– вероятность выпадения орла;
Рис. 11.Оценка по нарастающей выборке
Из полученного графика изменения частоты выпадения решки видно,
что по мере нарастания числа экспериментов оценка частоты выпадения решки
стабилизируется и все ближе приближается к истинному значению равному 0,5,
следовательно, эмпирический доверительный интервал для этой оценки можно
ввести, нарисовав определенной ширины «трубку» в окрестности, приходящей
в стабильное состояние частоты на конечном участке нарастающих
наблюдений. На рис. 11 обозначим эту «трубку» пунктиром. Можно сделать
заключение, что при данном количестве опытов с достаточно высокой
доверительной вероятностью можно будет принять доверительный интервалh20
± 0,05 = 0,45 ± ± 0,05.
В принципе за точную оценку частоты можно будет взять среднюю из
последних трех
и относительно этого значения задать доверительный интервал.
32

Анализ кривой изменения оценки по мере нарастания объема
наблюдений дает возможность проследить уровень ее стабилизации и
возможную тенденцию в стабильном возрастании или убывании значения
оценки, что говорит о неоднородности выборки.
Пример. Первая половина данных – дневные цены, вторая половина
данных – цены ночью. Это требует тщательного анализа исходных данных, и,
возможно, разделения выборки на несколько по некоторым специальным
условиям.
При решении практических задач доверительный интервал можно
задавать заранее, исходя из некоторых потребительских свойств, вытекающих
из специфики предметной области объекта исследования. В этом случае
экспериментальный материал собирается до тех пор, пока интересующая нас
выборочная оценка при расчете по мере нарастания наблюдений не войдет
устойчиво в «трубку», ширина которой задается выбранным доверительным
интервалом.
Такой подход к выбору доверительного интервала имеет под собой
четкую прикладную ориентацию и аргументировано обосновывается
пользователем. Ширина доверительного интервала при этом должна
выбираться, исходя из специфики решаемой задачи и/или точностных свойств
измеряемой случайной величины.
Например, если случайная величина измеряется с ошибкой ± σ, то
доверительный интервал для оценки математического ожидания ± ∆ не следует
выбирать уже приведенной точности измерения и выше нее.
Иногда величина доверительного интервала может быть задана
потребителем, исходя из конкретных условий решения задачи.
33

7. Проверка статистических гипотез
При обработке статистических данных возникает необходимость делать
заключения типа: «два средних значения не существенно отличаются друг от
друга», «выборочный закон распределения вероятностей (гистограмма) «может
– не может» быть аппроксимирован нормальным законом распределения
вероятностей»; «существенно или не существенно отличие от нуля
коэффициента корреляции» и т.д. Подобный класс задач называется классом
задач проверки статистических гипотез. Как правило, рассматривают
двухальтернативные гипотезы. Основную гипотезу обычно обозначают Н.
Н: r12 = 0, то есть выдвигается гипотеза, что коэффициент корреляции
случайных величин х1 и х2 не существенно отличается от 0, а, следовательно,
может быть равен 0.
Альтернатива основной гипотезе обозначается как ее отрицание :r12≠0.
В математической статистике есть специальный математический
аппарат проверки статистических гипотез. Он тесно переплетается с аппаратом
определения доверительных вероятностей и интервалов. Вместе с тем мы
считаем, что изложенная в предыдущем разделе идеология подхода для
доверительных интервалов, справедливой оказывается и для проверки
статистических гипотез. Например, если доверительные интервалы двух оценок
«захватывают» друг друга, то может быть принята гипотеза об их
незначительном различии.
Пример.
Н:
=
1
= 2,1 ± 0,15;
1
;
2
= 2,2;
1
= 2,2 ± 0,2.
2
= 2,1;
2
Так как доверительные интервалы перекрывают друг друга, то
принимается основная гипотеза, то есть делается заключение, что
и
1
незначительно отличаются друг от друга.
2
Важно помнить, что надежность выводов при проверке гипотез, равно,
как и при построении доверительных интервалов, в значительной степени
34

зависит от объема выборки. Чем больше N, тем более надежными будут
результаты статистического вывода.
В задачах статистического вывода (проверка статистических гипотез)
часто оперируют понятием ошибки 1-го и 2-го ряда и соответствующих им
вероятностям ошибок е1 и е2.
Под ошибкой 1-го рода понимается ошибка, в соответствии с которой
основная гипотеза Н принимается, хотя на самом деле она не имеет места.
Ошибка 2-го рода – это когда основная гипотеза отвергается, в то время
как на самом деле она справедлива.
8. Анализ временных рядов
До сих пор мы рассматривали поведение случайной величины и по
умолчанию предполагали, что отдельные наблюдения в выборке не зависимы
друг от друга.
Если предположить, что последовательность измерений случайной
величины упорядочена во времени и/или как-либо в пространстве, то возникает
задача уже анализа не случайной величины, аслучайных процессов.
В теории случайных процессов принципиальным является то, что
изменять последовательность измерений данных в выборке не допустимо, в то
время как при анализе случайной величины, в принципе, выборка может быть
произвольно «перетасована», что никак не скажется на конечных результатах
анализа.
Чаще всего случайные процессы рассматриваются в развитии вдоль
временной координаты. Такие процессы называют временными рядами,
поэтому в заголовок введено название «Анализ временных рядов». Эту
координату обозначают t.
Примеры. В рассматриваемом выше примере с выпадением «орла» и
«решки», собранную нами статистику из 20 наблюдений без ущерба для
последующей работы можно было перетасовать в произвольном порядке,
35

конечный результат от этого не изменился бы. С другой стороны, если взять,
например, цены на овощи в какой-нибудь конкретной торговой точке и
проконтролировать их в течении года, то они могут быть представлены в виде
некоторой временной последовательности, на которой явно будут
прослеживаться сезонные факторы изменения цен. В этих данных перестановка
наблюдений местами недопустима, ибо привязка к конкретной
последовательности этих наблюдений и их анализ приводят к конкретным
содержательным результатам.
При анализе случайной величины предполагается, что соседние
наблюдения не взаимосвязаны между собой, и именно поэтому
последовательность расположения этих наблюдений не имеет содержательного
смысла. В случайных же процессах и временных рядах соседние наблюдения,
как правило, оказываются взаимосвязанными между собой, и именно анализ
этой взаимосвязи дает качественно новую содержательную информацию для
исследователя в области экономических временных рядов.
Как правило, случайный процесс обозначаютxt. Обычно t – дискретная
величина, соответствующая определенному значению времени. Вместе с тем,
бывают и непрерывные случайные процессы, например, записываемые
прибором изменения давления воды в трубопроводе.
Рис. 12. Непрерывный временной ряд
36

При изучении экономических явлений непрерывные случайные
N,1
процессы такого вида практически не встречаются. Обычно t принимает
дискретные значения, как правило, целочисленные, например, курс доллара на
ММВБ может быть представлен в виде временного графика с ежедневной
котировкой на момент окончания валютных торгов; среднемесячная стоимость
потребительской корзины населения.
По-прежнему, как и для случайной величины, мы будем считать, что
t =
. Если временных рядов несколько и требуется их совместный анализ,
то говорят о векторном случайном процессе и о многомерном временном ряде.
В векторной форме его обозначают: Xi= {x
1 t,x2 t
,. ..,xnt}, где n – число
компонентов многомерного случайного процесса.
Часто, чтобы не выносить t в подстрочный индекс, его обозначают в
скобках:x(t), x1(t ).
При анализе временных рядов следует обращать внимание на
следующие моменты:
1) взаимосвязаны ли соседние наблюдения временного ряда между
собой;
2) имеются ли устойчивые тенденции в изменении временного ряда
(эти тенденции принято называть трендами);
3) какие характерные особенности прослеживаются на кривой
изменения случайного процесса во времени? Под характерными особенностями
будем понимать характерные точки и участки, отражающие специфическое
поведение временного ряда;
4) какова величина разброса (рассеивания) наблюдений относительно
устойчивой тенденции поведения временного ряда;
5) как взаимосвязаны между собой временные ряды;
6) что общего в поведении нескольких временных последова-
тельностей (рядов)?
37

7) как часто, в какой последовательности и когда появляются
t
t
характерные особенности в поведении временного ряда?
Важно помнить, что изучение временных рядов по перечисленным выше
позициям должно подтверждаться серьезным и вдумчивым содержательным
анализом полученных результатов с позиции специфики предметной области
анализа экономического, социально-психологического либо иного явления.
Некоторые примеры.
Рис. 13. Регулярный прогнозируемый временной ряд
Даже визуальный анализ временного ряда показывает, что по
предыдущим наблюдениям можно с определенной уверенностью
прогнозировать последующее. Следовательно, соседние наблюдения в среднем
взаимосвязаны между собой.
Рис. 14.Линейный тренд
38

На приведенном временном ряде явно прослеживается линейный тренд.
Рис. 15. Тренд с экспоненциальным затуханием
Рис. 16. Гармонический тренд
Но все-таки тренд – это устойчивая тенденция, поэтому вместо
выражения «гармонический тренд» корректнее и правильнее говорить о
присутствии во временном ряде устойчивой гармонической составляющей с
определенной амплитудой и периодом.
39

n
i
ttМx
xx
N
t
1
1
ˆ
Рис. 17. Примеры характерных точек
Пример анализа электрокардиограммы. Врач судит о состоянии
здоровья больного по наличию характерных особенностей на кардиограмме
(высота основного и вспомогательного пика, ширина этих пиков, ритмичность
их следования), ставя на основании этого диагноз.
Пусть имеет место временной ряд, и в нем очевидно наличие
временного тренда. Важно проанализировать, как разбросаны наблюдения
относительно этого тренда.
тренд
Рис. 18. Тренд со случайной составляющей
Для этого идут двумя путями:
1) рассчитывают один из показателей колеблемости, например,
среднеквадратичное или среднемодульное отклонение, но не от абсолютного
среднегох, а от тренда, который обозначимх(t). В частности, среднемодульное отклонение тогда запишется как
,
гдех(t ) – есть значение тренда при конкретном t;
40
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]
