Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Современные информационные технологии. Учебное пособие

.pdf
Скачиваний:
0
Добавлен:
07.09.2026
Размер:
2 Мб
Скачать
☆
Рис. 5.2. Гистограмма, n=100, K=13
Рис. 5.3. Гистограмма, n = 100, K = 23
Суммарная площадь прямоугольников равна n, для относительных частот она равна 1. Гистограмма является грубым приближением графика плотности вероятности.
Величина интервала группировки существенно влияет на общий вид ги­стограммы. Если l мала, то начинает преобладать влияние случайных колебаний, так как каждый интервал содержит небольшое число наблюдений (рис. 5.3).
Чем больше величина l, тем более скрадываются характерные черты рас­пределения (рис. 5.4).
61
Рис. 5.4. Гистограмма, n = 100, K = 6
Рис. 5.5. Полигон
Изображение полигона для замеров обхвата груди школьников при К = 13 показано на рис. 5.5.
Графической оценкой распределения переменной X может служить кри­вая, проведенная от руки и сглаживающая пики на полигоне.
5.2. Практическое задание: наглядное представление выборки
в специализированном пакете
Построить гистограммы и графики эмпирической функции распределения для одной из входных переменных Xj и выходной переменной Y. Сделать вывод о нормальности выборок.
Для проведения статистических исследований используем один из попу­лярных программных продуктов – пакет Statgraphics (Statistical Graphical System). Пакет не требует инсталляции – для переноса на компьютер достаточ­но скопировать папку Statgr_win. Запуск программы выполняется с помощью файла Sgwin.exe.
Файлы с переменными (Data File) имеют тип *.SF. Они представляют со­бой обычные электронные таблицы. Для создания нового файла данных следует развернуть расположенное в левом нижнем углу окно Untitled. Каждой пере-
62
n
1i
i
_
x
n
1
x
менной соответствует отдельный столбец, в ячейки которого вводятся значения переменной. Программа также может открывать исходные данные, подготов­ленные в MS Excel.
В одном файле могут храниться значения сразу для нескольких перемен­ных X1, X2, ..., Y. Исходные данные сохраняются на диске командой Save Data File As. Файл данных может быть закрыт и в дальнейшем открыт для редакти­рования.
Процедуры описательной статистики собраны в пакете Statgraphics Plus в разделе Describe/ Numeric Data/ One-Variable Analysis. Предварительно должен быть открыт файл с данными.
Переменная выбирается для анализа кнопками Data и OK после выде­ления имени переменной в левой части.
Построение гистограммы для выбранной переменной осуществляется процедурой Frequency Histogram после выбора инструмента Graphics Options
.
Количество групп (классов, интервалов группировки), в которые объеди­няются близкие значения исследуемой переменной, подбирается для получения сглаженного графика. Число классов, установленное по умолчанию, можно из­менить в поле No. of classes с помощью команды Pan Options из контекстного меню.
График Fn(x) эмпирической функции распределения строится установкой в том же контекстном меню режима Poligon вместо заданного по умолчанию ре­жима Histogram.
5.3. Выборочные точечные характеристики (статистики)
Выборки описываются с помощью характеристических чисел – так назы­ваемых статистик, которые служат для оценки параметров законов распреде­лений при исследовании свойств случайных величин. Статистика, определяе­мая одним числом, называется точечной.
Статистики сами являются случайными величинами, так как описываемая ими выборка является случайным набором чисел. Точечная оценка, математи­ческое ожидание которой равно оцениваемому параметру генеральной сово­купности, называется несмещенной, в противном случае – смещенной.
Средние определяют центр распределения случайной величины X, около которого группируется большая ее часть. Средние имеют ту же размерность, что и величина X. Характеристиками среднего являются следующие величины.
Выборочное среднее или среднее арифметическое
- наиболее
распространенный вид средней, является несмещенной оценкой математиче­ского ожидания . Характеризует расположение центра распределения.
Медиана (Me) – значение среднего элемента вариационного ряда.
Медиана делит вариационный ряд на две равные по объему части: 50 % всех элементов вариационного ряда меньше медианы, а 50 % – больше нее.
63
0
dx
)x(df
_
x
n
1i
2
_
i
2
0
)xx(
n
1
S
)x(D
n
1n
]S[M
2
0
2
00
SS
2
0
S
0
S
2
_
n
1i
2
i
2
0
)x(x
n
1
S
)x
_
Для теоретического распределения медиана соответствует квантилю уровня = 0.5 (пятидесятому процентилю), т. е. равновероятно, что случайная величина окажется больше или меньше медианы: Р(Х < Me)=P(X > Me) = 0.5.
Медиана находит применение, например, в маркетинговой деятельности при выборе базы снабжения с целью минимизировать транспортные расходы.
Мода (Mo) – значение x
, которое наблюдается наибольшее число раз. На
(i)
графике теоретической кривой распределения f(x) мода является абсциссой
точки максимума, для которой
.
Мода часто используется при определении размеров одежды и обуви, ко­торые пользуются широким покупательским спросом. Она выявляет наиболее часто встречающийся тип покупателя.
Средние величины являются закономерным результатом от воздействия главных факторов, влияние прочих факторов увеличивает степень рассеяния случайной величины.
Характеристиками рассеяния случайной величины X около центра рас-
пределения
Выборочная дисперсия
дисперсии, так как
являются следующие показатели.
, является смещенной оценкой
.
Выборочное среднее квадратическое (стандартное) отклонение
.
,
характеризуют степень рассеяния около центра распределения.
Для быстрого ручного счета используют формулу
.
Коэффициент вариации – V=(S/
100 %. Если V> 40 %, то разброс зна-
чений признака X в исследуемой выборке считается значительным. Если V > 100 %, то можно сделать вывод, что наблюдения неоднородны.
Размах варьирования R = x
max
– x
из-за простоты вычисления часто ис-
min
пользуют как характеристику рассеяния при контроле качества в промышлен­ности, поскольку в этом случае изменения контролируемого параметра x обыч­но происходят постепенно и равномерно и вариационный ряд не имеет случай­ных выбросов.
Межквартильный размах x
0.75
– x
, равный разности значений верхней и
0.25
нижней квартилей, используется в экономических и социальных задачах, когда распределения частот имеют сильные выбросы ("хвосты") или скошенность (слишком большие или малые выпадающие значения).
64
3
3
S
A
n
)xx(
n
1i
3
_
i
3
_
x
_
x
_
x
f(x) A=0 A>0 A
1
<0
A
2
<0
0 x
_
x
_
x
3
S
E
4
4
n
)xx(
n
1i
4
_
i
4
Скошенность распределения f(x), его несимметричность характеризует
коэффициент асимметрии
, где
ряду преобладают наблюдения, меньшие при этом A < 0, Mo > чае Mo <
(рис. 5.6).
; при A > 0 асимметрия – правосторонняя, в этом слу-
Рис. 5.6. Кривые распределений с различной асимметрией
Несимметричность возникает под влиянием причин, действующих в од­ном направлении.
. Если в вариационном
, то асимметрия – левосторонняя,
Для симметричного распределения
= Mo = Me.
Большинство данных, собираемых в промышленности для контроля, например, размеров деталей, распределены симметрично. Скошенность распре­делений характерна для данных в социологии. Например, при сравнении дохо­дов различных слоев населения наблюдаются перекосы в пользу бедных или богатых. В этом случае важно получить информацию о соотношении средних
величин
, Mo, Me.
Эксцесс или коэффициент крутости
характеризует отклонение от крутовершинности нормальной кривой, для кото­рой E = 0. При E < 0 кривые по сравнению с нормальной менее крутые, имеют плоскую вершину и выраженные хвосты; при E > 0 кривые крутые и островер­шинные (рис. 5.7).
, где
,
65
E>0
f(x)
f(x)
E<0
x x 0
а
б
0
Рис. 5.7. Кривые распределений с положительным (а)
и отрицательным (б) эксцессом
Асимметрия и эксцесс могут использоваться для подбора закона распре­деления. Так как для любого нормального распределения асимметрия и эксцесс равны нулю, то распределение считается близким к нормальному, если выбо-
рочные A < 0.1 и E < 0.1. Значения A > 0.5 или E > 0.5 говорят о том, что распределение является соответственно сильно асимметричным или значитель-
но отклоняется от нормального.
Появление двухвершинной или асимметричной кривой говорит о неодно­родном, разнотипном составе выборки, который может быть вызван нарушением нормальных параметров технологического процесса или условий производства.
5.4. Практическое задание: расчет точечных статистик
в специализированном пакете
Провести расчет основных и дополнительных выборочных характеристик для одной из входных переменных Xj и выходной переменной Y. На основе ре­зультатов сделать предположения о виде законов распределения переменных.
Выборочные точечные характеристики в пакете Statgraphics Plus рас­считываются табличной процедурой Summary Statistics.
По умолчанию вычисляются основные выборочные характеристики сред­него, рассеяния и формы: среднее Average, дисперсия Variance и стандартное отклонение Stdandard deviation, минимальное и максимальное значения, стан­дартизованные асимметрия Skewness и эксцесс Kurtosis, а также сумма Sum всех замеров переменной. При необходимости с помощью команды Pan Options из контекстного меню можно выбрать дополнительные статистики: медиану Median, моду Mode, размах значений Range, нижнюю квартиль Lower Quartile, верхнюю квартиль Upper quartile, межквартильный размах Interquartile Range.
В нижней части окна анализа или в отдельном окне StatAdvisor можно просмотреть интерпретацию результатов анализа переменной. Например, со­общение "In this case, the standardized skewness value is within the range expected
66
~
~
~
~
~
~
~
~
~
 
Рис. 5.8. Двусторонний доверительный интервал
for data from a normal distribution. The standardized kurtosis value is within the range expected for data from a normal distribution" свидетельствует о том, что
стандартизованные величины асимметрии и эксцесса лежат в диапазоне, ожи­даемом для нормального распределения.
5.5. Интервальное оценивание параметров
На практике параметры генеральной совокупности, такие как математи­ческое ожидание и дисперсия, неизвестны. Точечные оценки этих параметров – выборочное среднее и выборочная дисперсия – являются случайными величи­нами. При малом числе наблюдений (n < 25) точечные оценки являются мало надежными. Поэтому используют интервальные оценки. Для этого на числовой прямой строят интервал (область), в который оцениваемый параметр попадает с заранее выбранной вероятностью 1–α, близкой к единице,
Р(|
– θ | < ε) = 1–α,
где вероятность или надежность оценки
чиной, поэтому существует вероятность  того, что
– оценка параметра, θ – оцениваемый параметр, 1– – доверительная
. Оценка
является случайной вели-
окажется больше ;
– допустимое расхождение оценки
и параметра или заданная точность.
Значение называется уровнем значимости. Например, при = 0.01 надеж- ность 1–= 0.99 или 99 %.
Интервал (
–,
+), который покрывает
параметр  с надежностью 1-, называется дву­сторонним доверительным интервалом (рис. 5.8).
В форме интервала часто задаются характеристики, которые должны удовлетворять некоторым техни­ческим условиям, например, пределы прочности на разрыв материала 5.000  0.001 [кг/мм2].
Выбор уровня значимости  определяется прикладной задачей. Если = = 0.01 – вероятность выпуска бракованных изделий, то при производстве пуго­виц такая вероятность брака приемлема; при производстве деталей парашютов такое значение  слишком велико.
Чем меньше для выбранной вероятности 1– доверительный интервал, тем точнее оценка неизвестного параметра ; если же интервал велик, то оцен­ка мало пригодна для практики.
5.6. Практическое задание: расчет доверительных интервалов
в специализированном пакете
Для переменных Xj и Y построить 95%-е доверительные интервалы: для математического ожидания (с неизвестной дисперсией) и для дисперсии.
Процедуры расчета двусторонних доверительных интервалов для число­вых характеристик нормально распределенных случайных величин в пакете
67
0
1
Statgraphics Plus представлены в разделе Describe/ Numeric Data/ One-Variable Analysis. После выбора переменной используется табличная процедура Confidence Intervals.
По умолчанию строятся двусторонние 95%-е доверительные интервалы для среднего значения (Confidence Interval fo Mean) и для стандартного откло­нения (Confidence Interval fo Standard Deviation). При необходимости уровень доверия (Confidence Level) можно изменить с помощью команды Pan Options из контекстного меню.
Если консультант StatAdvisor сообщает "If the data do not come from a
normal distribution, the interval for the standard deviation may be incorrect. To check whether the data come from a normal distribution, select Summary Statistics from the list of Tabular Options, or choose Normal Probability Plot from the list of Graphical Options", то это означает, что особенно чувствителен к нарушению
предположения о нормальности распределения интервал для  и с целью про­верить нормальность следует проанализировать точечные статистики или ис­пользовать график значений выборки в нормальной вероятностной шкале.
5.7. Проверка гипотез о параметрах распределения
Статистическая гипотеза – это предположение о законе распределения выборки и отдельных параметров (статистик) этого распределения.
Например, можно выдвинуть гипотезу о том, что распределение произво­дительности труда работников, выполняющих на данном предприятии одина­ковую работу, имеет нормальный закон распределения. Выдвинутая гипотеза называется нулевой, обозначается через H0. Если f(X,) – закон распределения случайной величины X, зависящий от параметра , то может быть выдвинута нулевая гипотеза о величине этого параметра, H0:  =
.
Конкурирующей или альтернативной называется гипотеза, которая про- тиворечит нулевой. Обозначается через H1, например, H1:  =
.
Задача состоит в проверке гипотезы H0 относительно альтернативы H1 на основании выборки (x1 , x2 ,..., xn ) из n независимых наблюдений над случайной величиной X. Для конкретной задачи выбирают критерий T (тест). Определя­ют так называемую критическую область K – множество значений критерия T, при которых нулевую гипотезу H0 отвергают в пользу альтернативы H1.
Принципы выбора области K были сформулированы в работах математи­ков Неймана и Пирсона. Критическая область удовлетворяет условию P(T  K
H0 верна)
( – заданный уровень значимости).
Метод проверки заключается в следующем. Для выборки определяется значение теста T = t. Если t лежит в критической области, то от гипотезы H0 от­казываются, так как осуществляется событие, имеющее малую вероятность ; если t не лежит в критической области, то данные наблюдения не противоречат выдвинутой гипотезе.
Статистика T является случайной величиной, поэтому при проверке гипо­тезы H0 можно допустить ошибки двух видов (табл. 5.1). Ошибку первого рода –
68
Решение
Событие
H0 верна
H0 не верна (верна H1)
"Отвергнуть H0"
Ошибка 1-го рода,
вероятность 
Верное решение,
вероятность
1
(мощность критерия)
"Принять H0"
Верное решение,
вероятность
1
Ошибка 2-го рода,
вероятность 
0
1
xT
кр
xx
Kt
tK
Верна H0 Верна H1
f(
x
)
 
0
кр
x
1
x
область принятия критическая область
Рис 5.9. Проверка гипотезы H0:
0 против
H1:  =
1
> 0
отвержение гипотезы в случае, когда она в действительности верна, ее вероят­ность  выбирается так, что событие практически невозможно (обычно  = = 0.01, 0.02, 0.05, чем весомее потери от ошибочного отвержения H0, тем  должна быть меньше). Ошибку второго рода – принятие гипотезы H0, когда в действительности верна альтернатива H1, вероятность ошибки второго рода обозначается через . Область K обычно выбирают таким образом, чтобы при
заданной  минимизировать ошибку второго рода
Т а б л и ц а 5.1. Типы ошибок при проверке гипотез
При уменьшении уровня значимости  критическая область K сужается. Например, пусть проверяется гипотеза H0:
В данном случае
, K:
. Может оказаться, что при начальном значе-
против H1:  =
нии критерия t будет справедливо событие
min.
> 0 (рис. 5.9).
, после уменьшения (обла-
сти К) станет верным событие
(области К), что гипотеза H0 не будет отвергнута. Действительно, чем меньше
задается вероятность ошибки 1-го рода , тем больше вероятность 1– того, что гипотеза H0 не должна быть отвергнута.
, т. е. можно так уменьшить величину
69
0в ыч
Hxx(P
* i
y
5,1i
* i
x
* i
y
* i
x
y
4 3
2 1
0 1 2 3 4 5 x
Рис. 5.10. Диаграмма рассеяния для
сгруппированных данных
y y
1 2 0 x 0 x
Рис. 5.11. Диаграммы рассеяния, отличающиеся теснотой связи X и Y
На практике часто используют вычисленный уровень значимости
выч
. Он равен вероятности ошибки 1-го рода, если за границу критической области принять вычисленное значение критерия t. Для случая, приведенного на
рис. 5.9,
выч
=
верна). Гипотеза H0 отвергается при
выч
≤.
5.8. Диаграмма рассеяния
Двумерная статистическая зависимость может быть наглядно представ-
лена диаграммой рассеяния. Наблюдениями являются парные данные (xi, yi ), образующие выборку. Множества значе­ний xi и yi разбиваются на интервалы группировки, границы которых определя­ют координатную cетку (рис. 5.10). Каж­дая пара признаков (xi yi) изображается в виде точки в соответствующей ячейке. Ес­ли в каждом интервале изменения X вы-
числить средние значения соединить соответствующие точки (
(
) и
,
), где
середины интервалов, то по-
лучим ломаную линию эмпирическую линию регрессии, которая в первом приближении характеризует форму связи. По ней можно судить, как в среднем меняется y в зависимости от изменения x. На рисунке связь между X и Y – по­ложительная (чем больше Х, тем, вообще говоря, больше Y). Расположение то­чек относительно линии регрессии характеризует тесноту статистической связи.
Рассмотрим две диаграммы
рассеяния 1 и 2 (рис. 5.11). Линии регрессии y по x расположены одинаково, однако точки на диа­грамме 2 расположены гораздо ближе к линии регрессии, чем точки на диаграмме 1. Если бы y полностью определялся пере­менной x, то все точки лежали бы на линии регрессии. При этом каждому возможному значению x было бы поставлено в однозначное соответ­ствие определенное значение y, характеризуемое функциональной зависимо- стью y = f(x). Примером такой зависимости является закон Бойля-Мариотта зависимость между давлением и объемом газа.
70
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]