Добавил:
ivanov666
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз:
Предмет:
Файл:Современные информационные технологии. Учебное пособие
.pdf
Рис. 5.2. Гистограмма, n=100, K=13
Рис. 5.3. Гистограмма, n = 100, K = 23
Суммарная площадь прямоугольников равна n, для относительных частот
она равна 1. Гистограмма является грубым приближением графика плотности
вероятности.
Величина интервала группировки существенно влияет на общий вид гистограммы. Если l мала, то начинает преобладать влияние случайных колебаний,
так как каждый интервал содержит небольшое число наблюдений (рис. 5.3).
Чем больше величина l, тем более скрадываются характерные черты распределения (рис. 5.4).
61

Рис. 5.4. Гистограмма, n = 100, K = 6
Рис. 5.5. Полигон
Изображение полигона для замеров обхвата груди школьников при К = 13
показано на рис. 5.5.
Графической оценкой распределения переменной X может служить кривая, проведенная от руки и сглаживающая пики на полигоне.
5.2. Практическое задание: наглядное представление выборки
в специализированном пакете
Построить гистограммы и графики эмпирической функции распределения
для одной из входных переменных Xj и выходной переменной Y. Сделать вывод
о нормальности выборок.
Для проведения статистических исследований используем один из популярных программных продуктов – пакет Statgraphics (Statistical Graphical
System). Пакет не требует инсталляции – для переноса на компьютер достаточно скопировать папку Statgr_win. Запуск программы выполняется с помощью
файла Sgwin.exe.
Файлы с переменными (Data File) имеют тип *.SF. Они представляют собой обычные электронные таблицы. Для создания нового файла данных следует
развернуть расположенное в левом нижнем углу окно Untitled. Каждой пере-
62

n
1i
i
_
x
n
1
x
менной соответствует отдельный столбец, в ячейки которого вводятся значения
переменной. Программа также может открывать исходные данные, подготовленные в MS Excel.
В одном файле могут храниться значения сразу для нескольких переменных X1, X2, ..., Y. Исходные данные сохраняются на диске командой Save Data
File As. Файл данных может быть закрыт и в дальнейшем открыт для редактирования.
Процедуры описательной статистики собраны в пакете Statgraphics Plus в
разделе Describe/ Numeric Data/ One-Variable Analysis. Предварительно должен
быть открыт файл с данными.
Переменная выбирается для анализа кнопками Data и OK после выделения имени переменной в левой части.
Построение гистограммы для выбранной переменной осуществляется
процедурой Frequency Histogram после выбора инструмента Graphics Options
.
Количество групп (классов, интервалов группировки), в которые объединяются близкие значения исследуемой переменной, подбирается для получения
сглаженного графика. Число классов, установленное по умолчанию, можно изменить в поле No. of classes с помощью команды Pan Options из контекстного
меню.
График Fn(x) эмпирической функции распределения строится установкой в
том же контекстном меню режима Poligon вместо заданного по умолчанию режима Histogram.
5.3. Выборочные точечные характеристики (статистики)
Выборки описываются с помощью характеристических чисел – так называемых статистик, которые служат для оценки параметров законов распределений при исследовании свойств случайных величин. Статистика, определяемая одним числом, называется точечной.
Статистики сами являются случайными величинами, так как описываемая
ими выборка является случайным набором чисел. Точечная оценка, математическое ожидание которой равно оцениваемому параметру генеральной совокупности, называется несмещенной, в противном случае – смещенной.
Средние определяют центр распределения случайной величины X, около
которого группируется большая ее часть. Средние имеют ту же размерность,
что и величина X. Характеристиками среднего являются следующие величины.
Выборочное среднее или среднее арифметическое
- наиболее
распространенный вид средней, является несмещенной оценкой математического ожидания . Характеризует расположение центра распределения.
Медиана (Me) – значение среднего элемента вариационного ряда.
Медиана делит вариационный ряд на две равные по объему части: 50 %
всех элементов вариационного ряда меньше медианы, а 50 % – больше нее.
63

0
dx
)x(df
_
x
n
1i
2
_
i
2
0
)xx(
n
1
S
)x(D
n
1n
]S[M
2
0
2
00
SS
2
0
S
0
S
2
_
n
1i
2
i
2
0
)x(x
n
1
S
)x
_
Для теоретического распределения медиана соответствует квантилю
уровня = 0.5 (пятидесятому процентилю), т. е. равновероятно, что случайная
величина окажется больше или меньше медианы: Р(Х < Me)=P(X > Me) = 0.5.
Медиана находит применение, например, в маркетинговой деятельности
при выборе базы снабжения с целью минимизировать транспортные расходы.
Мода (Mo) – значение x
, которое наблюдается наибольшее число раз. На
(i)
графике теоретической кривой распределения f(x) мода является абсциссой
точки максимума, для которой
.
Мода часто используется при определении размеров одежды и обуви, которые пользуются широким покупательским спросом. Она выявляет наиболее
часто встречающийся тип покупателя.
Средние величины являются закономерным результатом от воздействия
главных факторов, влияние прочих факторов увеличивает степень рассеяния
случайной величины.
Характеристиками рассеяния случайной величины X около центра рас-
пределения
Выборочная дисперсия
дисперсии, так как
являются следующие показатели.
, является смещенной оценкой
.
Выборочное среднее квадратическое (стандартное) отклонение
.
,
характеризуют степень рассеяния около центра распределения.
Для быстрого ручного счета используют формулу
.
Коэффициент вариации – V=(S/
100 %. Если V> 40 %, то разброс зна-
чений признака X в исследуемой выборке считается значительным. Если V >
100 %, то можно сделать вывод, что наблюдения неоднородны.
Размах варьирования R = x
max
– x
из-за простоты вычисления часто ис-
min
пользуют как характеристику рассеяния при контроле качества в промышленности, поскольку в этом случае изменения контролируемого параметра x обычно происходят постепенно и равномерно и вариационный ряд не имеет случайных выбросов.
Межквартильный размах x
0.75
– x
, равный разности значений верхней и
0.25
нижней квартилей, используется в экономических и социальных задачах, когда
распределения частот имеют сильные выбросы ("хвосты") или скошенность
(слишком большие или малые выпадающие значения).
64

3
3
S
A
n
)xx(
n
1i
3
_
i
3
_
x
_
x
_
x
f(x) A=0
A>0 A
1
<0
A
2
<0
0 x
_
x
_
x
3
S
E
4
4
n
)xx(
n
1i
4
_
i
4
Скошенность распределения f(x), его несимметричность характеризует
коэффициент асимметрии
, где
ряду преобладают наблюдения, меньшие
при этом A < 0, Mo >
чае Mo <
(рис. 5.6).
; при A > 0 асимметрия – правосторонняя, в этом слу-
Рис. 5.6. Кривые распределений с различной асимметрией
Несимметричность возникает под влиянием причин, действующих в одном направлении.
. Если в вариационном
, то асимметрия – левосторонняя,
Для симметричного распределения
= Mo = Me.
Большинство данных, собираемых в промышленности для контроля,
например, размеров деталей, распределены симметрично. Скошенность распределений характерна для данных в социологии. Например, при сравнении доходов различных слоев населения наблюдаются перекосы в пользу бедных или
богатых. В этом случае важно получить информацию о соотношении средних
величин
, Mo, Me.
Эксцесс или коэффициент крутости
характеризует отклонение от крутовершинности нормальной кривой, для которой E = 0. При E < 0 кривые по сравнению с нормальной менее крутые, имеют
плоскую вершину и выраженные хвосты; при E > 0 кривые крутые и островершинные (рис. 5.7).
, где
,
65

E>0
f(x)
f(x)
E<0
x x 0
а
б
0
Рис. 5.7. Кривые распределений с положительным (а)
и отрицательным (б) эксцессом
Асимметрия и эксцесс могут использоваться для подбора закона распределения. Так как для любого нормального распределения асимметрия и эксцесс
равны нулю, то распределение считается близким к нормальному, если выбо-
рочные A < 0.1 и E < 0.1. Значения A > 0.5 или E > 0.5 говорят о том, что
распределение является соответственно сильно асимметричным или значитель-
но отклоняется от нормального.
Появление двухвершинной или асимметричной кривой говорит о неоднородном, разнотипном составе выборки, который может быть вызван нарушением
нормальных параметров технологического процесса или условий производства.
5.4. Практическое задание: расчет точечных статистик
в специализированном пакете
Провести расчет основных и дополнительных выборочных характеристик
для одной из входных переменных Xj и выходной переменной Y. На основе результатов сделать предположения о виде законов распределения переменных.
Выборочные точечные характеристики в пакете Statgraphics Plus рассчитываются табличной процедурой Summary Statistics.
По умолчанию вычисляются основные выборочные характеристики среднего, рассеяния и формы: среднее Average, дисперсия Variance и стандартное
отклонение Stdandard deviation, минимальное и максимальное значения, стандартизованные асимметрия Skewness и эксцесс Kurtosis, а также сумма Sum всех
замеров переменной. При необходимости с помощью команды Pan Options из
контекстного меню можно выбрать дополнительные статистики: медиану
Median, моду Mode, размах значений Range, нижнюю квартиль Lower Quartile,
верхнюю квартиль Upper quartile, межквартильный размах Interquartile Range.
В нижней части окна анализа или в отдельном окне StatAdvisor можно
просмотреть интерпретацию результатов анализа переменной. Например, сообщение "In this case, the standardized skewness value is within the range expected
66

~
~
~
~
~
~
~
~
~
Рис. 5.8. Двусторонний
доверительный интервал
for data from a normal distribution. The standardized kurtosis value is within the
range expected for data from a normal distribution" свидетельствует о том, что
стандартизованные величины асимметрии и эксцесса лежат в диапазоне, ожидаемом для нормального распределения.
5.5. Интервальное оценивание параметров
На практике параметры генеральной совокупности, такие как математическое ожидание и дисперсия, неизвестны. Точечные оценки этих параметров –
выборочное среднее и выборочная дисперсия – являются случайными величинами. При малом числе наблюдений (n < 25) точечные оценки являются мало
надежными. Поэтому используют интервальные оценки. Для этого на числовой
прямой строят интервал (область), в который оцениваемый параметр попадает с
заранее выбранной вероятностью 1–α, близкой к единице,
Р(|
– θ | < ε) = 1–α,
где
вероятность или надежность оценки
чиной, поэтому существует вероятность того, что
– оценка параметра, θ – оцениваемый параметр, 1– – доверительная
. Оценка
является случайной вели-
окажется больше ;
– допустимое расхождение оценки
и параметра или заданная точность.
Значение называется уровнем значимости. Например, при = 0.01 надеж-
ность 1–= 0.99 или 99 %.
Интервал (
–,
+), который покрывает
параметр с надежностью 1-, называется двусторонним доверительным интервалом (рис. 5.8).
В форме интервала часто задаются характеристики,
которые должны удовлетворять некоторым техническим условиям, например, пределы прочности на
разрыв материала 5.000 0.001 [кг/мм2].
Выбор уровня значимости определяется прикладной задачей. Если =
= 0.01 – вероятность выпуска бракованных изделий, то при производстве пуговиц такая вероятность брака приемлема; при производстве деталей парашютов
такое значение слишком велико.
Чем меньше для выбранной вероятности 1– доверительный интервал,
тем точнее оценка неизвестного параметра ; если же интервал велик, то оценка мало пригодна для практики.
5.6. Практическое задание: расчет доверительных интервалов
в специализированном пакете
Для переменных Xj и Y построить 95%-е доверительные интервалы: для
математического ожидания (с неизвестной дисперсией) и для дисперсии.
Процедуры расчета двусторонних доверительных интервалов для числовых характеристик нормально распределенных случайных величин в пакете
67

0
1
Statgraphics Plus представлены в разделе Describe/ Numeric Data/ One-Variable
Analysis. После выбора переменной используется табличная процедура
Confidence Intervals.
По умолчанию строятся двусторонние 95%-е доверительные интервалы
для среднего значения (Confidence Interval fo Mean) и для стандартного отклонения (Confidence Interval fo Standard Deviation). При необходимости уровень
доверия (Confidence Level) можно изменить с помощью команды Pan Options из
контекстного меню.
Если консультант StatAdvisor сообщает "If the data do not come from a
normal distribution, the interval for the standard deviation may be incorrect. To
check whether the data come from a normal distribution, select Summary Statistics
from the list of Tabular Options, or choose Normal Probability Plot from the list of
Graphical Options", то это означает, что особенно чувствителен к нарушению
предположения о нормальности распределения интервал для и с целью проверить нормальность следует проанализировать точечные статистики или использовать график значений выборки в нормальной вероятностной шкале.
5.7. Проверка гипотез о параметрах распределения
Статистическая гипотеза – это предположение о законе распределения
выборки и отдельных параметров (статистик) этого распределения.
Например, можно выдвинуть гипотезу о том, что распределение производительности труда работников, выполняющих на данном предприятии одинаковую работу, имеет нормальный закон распределения. Выдвинутая гипотеза
называется нулевой, обозначается через H0. Если f(X,) – закон распределения
случайной величины X, зависящий от параметра , то может быть выдвинута
нулевая гипотеза о величине этого параметра, H0: =
.
Конкурирующей или альтернативной называется гипотеза, которая про-
тиворечит нулевой. Обозначается через H1, например, H1: =
.
Задача состоит в проверке гипотезы H0 относительно альтернативы H1 на
основании выборки (x1 , x2 ,..., xn ) из n независимых наблюдений над случайной
величиной X. Для конкретной задачи выбирают критерий T (тест). Определяют так называемую критическую область K – множество значений критерия T,
при которых нулевую гипотезу H0 отвергают в пользу альтернативы H1.
Принципы выбора области K были сформулированы в работах математиков Неймана и Пирсона. Критическая область удовлетворяет условию P(T K
H0 верна)
( – заданный уровень значимости).
Метод проверки заключается в следующем. Для выборки определяется
значение теста T = t. Если t лежит в критической области, то от гипотезы H0 отказываются, так как осуществляется событие, имеющее малую вероятность ;
если t не лежит в критической области, то данные наблюдения не противоречат
выдвинутой гипотезе.
Статистика T является случайной величиной, поэтому при проверке гипотезы H0 можно допустить ошибки двух видов (табл. 5.1). Ошибку первого рода –
68

Решение
Событие
H0 верна
H0 не верна (верна H1)
"Отвергнуть H0"
Ошибка 1-го рода,
вероятность
Верное решение,
вероятность
1
(мощность критерия)
"Принять H0"
Верное решение,
вероятность
1
Ошибка 2-го рода,
вероятность
0
1
xT
кр
xx
Kt
tK
Верна H0 Верна H1
f(
x
)
0
кр
x
1
x
область принятия критическая область
Рис 5.9. Проверка гипотезы H0:
0 против
H1: =
1
> 0
отвержение гипотезы в случае, когда она в действительности верна, ее вероятность выбирается так, что событие практически невозможно (обычно =
= 0.01, 0.02, 0.05, чем весомее потери от ошибочного отвержения H0, тем
должна быть меньше). Ошибку второго рода – принятие гипотезы H0, когда в
действительности верна альтернатива H1, вероятность ошибки второго рода
обозначается через . Область K обычно выбирают таким образом, чтобы при
заданной минимизировать ошибку второго рода
Т а б л и ц а 5.1. Типы ошибок при проверке гипотез
При уменьшении уровня значимости критическая область K сужается.
Например, пусть проверяется гипотеза H0:
В данном случае
, K:
. Может оказаться, что при начальном значе-
против H1: =
нии критерия t будет справедливо событие
min.
> 0 (рис. 5.9).
, после уменьшения (обла-
сти К) станет верным событие
(области К), что гипотеза H0 не будет отвергнута. Действительно, чем меньше
задается вероятность ошибки 1-го рода , тем больше вероятность 1– того,
что гипотеза H0 не должна быть отвергнута.
, т. е. можно так уменьшить величину
69

0в ыч
Hxx(P
*
i
y
5,1i
*
i
x
*
i
y
*
i
x
y
4
3
2
1
0 1 2 3 4 5 x
Рис. 5.10. Диаграмма рассеяния для
сгруппированных данных
y y
1 2
0 x 0 x
Рис. 5.11. Диаграммы рассеяния,
отличающиеся теснотой связи X и Y
На практике часто используют вычисленный уровень значимости
выч
. Он
равен вероятности ошибки 1-го рода, если за границу критической области
принять вычисленное значение критерия t. Для случая, приведенного на
рис. 5.9,
выч
=
верна). Гипотеза H0 отвергается при
выч
≤.
5.8. Диаграмма рассеяния
Двумерная статистическая зависимость может быть наглядно представ-
лена диаграммой рассеяния. Наблюдениями являются парные данные (xi, yi ),
образующие выборку. Множества значений xi и yi разбиваются на интервалы
группировки, границы которых определяют координатную cетку (рис. 5.10). Каждая пара признаков (xi yi) изображается в
виде точки в соответствующей ячейке. Если в каждом интервале изменения X вы-
числить средние значения
соединить соответствующие точки (
(
) и
,
), где
середины интервалов, то по-
лучим ломаную линию эмпирическую линию регрессии, которая в первом
приближении характеризует форму связи. По ней можно судить, как в среднем
меняется y в зависимости от изменения x. На рисунке связь между X и Y – положительная (чем больше Х, тем, вообще говоря, больше Y). Расположение точек относительно линии регрессии характеризует тесноту статистической связи.
Рассмотрим две диаграммы
рассеяния 1 и 2 (рис. 5.11). Линии
регрессии y по x расположены
одинаково, однако точки на диаграмме 2 расположены гораздо
ближе к линии регрессии, чем
точки на диаграмме 1. Если бы y
полностью определялся переменной x, то все точки лежали бы
на линии регрессии. При этом
каждому возможному значению x было бы поставлено в однозначное соответствие определенное значение y, характеризуемое функциональной зависимо-
стью y = f(x). Примером такой зависимости является закон Бойля-Мариотта
зависимость между давлением и объемом газа.
70
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]
