Добавил:
ivanov666
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз:
Предмет:
Файл:Статистические системы в управлении качеством промышленных коллекций. Часть 1. Задачи и программные средства управления качеством промышленных коллекц
.pdf
51
тельно упрощается доступными программными средствами,
представленными в любых статистических программах.
В модуле Описательные статистики (Descriptive statistics),
как правило, возможно выполнить следующие процедуры:
выбрать переменные для анализа (из уже открытого файла);
вычислить различные описательные статистики;
оценить близость распределения к нормальному закону;
построить гистограммы;
сгруппировать данные, разбив различными способами на
классы;
удобно визуализировать данные и т. д.
Отметим, что сколько-нибудь уверенно о нормальности закона распределения можно судить, если имеется, по крайней мере,
не менее 50 результатов наблюдений. В случаях меньшего числа
данных можно говорить только о том, что данные не противоречат нормальному закону, и в этом случае обычно используют
графические методы оценки соответствия. При большем числе
наблюдений целесообразно совместное использование графических и статистических методов оценки (например, тест КолмогороваСмирнова), естественно дополняющих друг друга.
2.4.3. Методы оценивания параметров распределений
по результатам измерений
Одним из фундаментальных в статистическом анализе является понятие случайной величины. Случайной называется переменная величина, принимающая в зависимости от случая те или
иные значения с определенными вероятностями. В практических
задачах обычно используются дискретные и непрерывные случайные величины [8, 11].
Дискретной случайной величиной называется такая случайная величина, множество возможных значений которой либо конечно, либо бесконечно, но счетно.
Непрерывной случайной величиной называется такая случайная величина, которая может принять любое значение из некоторого конечного или бесконечного интервала.

52
Чтобы дать полное математическое описание случайной величины, нужно указать множество ее значений и соответствующее случайной величине распределение вероятностей на этом
множестве.
Кроме того, каждое отдельное значение непрерывной случайной величины обладает нулевой вероятностью. Однако, несмотря
на данное обстоятельство, нахождение возможных значений случайной величины в различных интервалах обладает различными
и отличными от нуля вероятностями. Таким образом, для непрерывной случайной величины, так же как и для дискретной, можно определить закон распределения, по несколько в ином виде,
чем для дискретной. Для этого используют понятие функции рас-
пределения случайной величины.
Функцией распределения случайной величины X называется
функция F(x). Иногда функцию F(x) называют интегральной
функцией распределения.
Функция распределения вероятностей непрерывной случайной величины дает полную вероятностную характеристику ее поведения.
Функция F(x)задает вероятность того, что случайная величина «Р» принимает значение, меньшее х, т. е.:
()= ( < ),
()=
∑
( < )
.
Однако способ задания непрерывной случайной величины с
помощью функции распределения не является единственным. Ее
можно задать с помощью другой функции, которая называется
дифференциальной функцией распределения, или плотностью
распределения. В некотором смысле эта функция более удобна,
чем интегральная функция F(x), так как последняя не в полной
мере дает представление о характере распределения случайной
величины в небольшой окрестности той или иной точки числовой
оси.

53
Решить эту задачу позволяет дифференциальная функция
распределения, которая является первой производной интегральной функции распределения:
()= ().
График дифференциальной функции распределения f(x)
называется кривой распределения. Кривая распределения, выражающая общую закономерность данного типа распределения,
называется теоретической кривой распределения.
В статистике широко используются различные виды теоретических распределений – нормальное распределение, биномиальное, распределение Пуассона и др. Каждое из теоретических распределений имеет специфику и свою область применения. Чаще
всего в качестве теоретического распределения используется
нормальное распределение, занимающее особое положение в статистических исследованиях.
Строить графики интегральных и дифференциальных функций распределения удобно с помощью «Мастера диаграмм»
(Microsoft Excel) или «Графической галереи» (Statistica)
(см.п.2.5). Для этого необходимо предварительно сформировать
интегральные и дифференциальные массивы значений, используя
в качестве ее аргументов сгенерированную последовательность
случайных чисел.
Графики интегральной и дифференциальной функций нормального распределения при х=0 и σ2=1 показаны на рисунке 4.
Распределения вероятностей используются для анализа и моделирования процессов, происходящих в реальном мире. Речь
идет о теоретическом распределении, описываемом математической формулой.
Дискретные распределения описывают случайные процессы,
принимающие дискретный набор значений (обычно несколько
различных целых чисел). В этом случае можно перечислить возможные значения и соответствующие им вероятности ("точечные
массы"). Например, интенсивность обрыва нити на ткацком станке. Данная случайная величина принимает значения 0, 1, 2, 3, 4, 5

54
и 6. Поэтому она имеет дискретное распределение, ставящее в
соответствие каждому из этих семи чисел их вероятности.
Рисунок 4. Графики интегральной и дифференциальной функций
нормального распределения при х=0 и σ2=1
Непрерывные распределения описывают случайные величины с непрерывной областью значений, например, отрезком действительной оси чисел. Так как имеется бесконечное число чисел
между двумя действительными, то каждому из них необходимо
сопоставить вероятность «ноль». Для непрерывных распределений вероятность сопоставляется не отдельным значениям, а интервалам чисел. Непрерывные распределения обычно описываются функцией плотности распределения, причем площадь графика под функцией плотности на определенном интервале определяет вероятность.
Примером может служить рост человека определенной возрастной группы. Хотя точность измерения роста ограничена,
имеется бесконечное число возможных значений, и поэтому в
данном случае для моделирования и анализа процесса (например,

55
n
в случае планирования ассортимента швейного предприятия)
следует использовать непрерывное распределение.
2.4.4. Методы корреляция и регрессия
В качестве меры связи признаков обычно используют числовую величину, называемую коэффициентом корреляции.
Коэффициент корреляции случайных величин может принимать значения от 1 до 1 и может быть равна ±1, только если эти
величины линейно зависят друг от друга. Значения корреляции,
близкие к 1 или 1, указывают, что зависимость случайных вели-
чин друг от друга почти линейная. Значения ковариации, близкие
к нулю, означают, что связь между случайными величинами либо
слаба, либо не носит линейного характера [22, 27].
Выборочная корреляция. Если в каждом наблюдении мы ре-
гистрируем значения не одной, а двух (или нескольких) случайных величин одновременно, мы получаем в результате двумерную (или многомерную) выборку. Для таких выборок тоже можно говорить о числовых характеристиках, например, о корреляции компонент этой выборки.
Коэффициентом корреляции двумерной выборки (x1, y1), ... ,
(хп, yn), или выборочным коэффициентом корреляции называют
величину:
))((
y
yx
i
n
i
y
i
1
.
2
)(
y
r
n
1
i
x
i
1
i
2
)(
x
x
i
(Иногда ее называют коэффициентом корреляции К. Пирсона.)
Регрессионный анализ. В регрессионном анализе изучается
связь и определяется количественная зависимость между зависимой переменной и одной или несколькими независимыми переменными [27].
Пусть переменная Y зависит от одной переменной x. При
этом предполагается, что переменная x принимает заданные фиксированные значения, а зависимая переменна Y имеет случайный

56
разброс из-за ошибок измерения, влияния неучтенных факторов и
т. д. Каждому значению x соответствует некоторый закон распределения вероятностей случайной величины Y. Предположим, что
Y линейно зависит от значений переменной x. Это означает, что
условное математическое ожидание случайной величины Y при
заданном значении x имеет вид линейной функции:
(/)= + .
Данная функция называется линейной теоретической
функцией регрессии Y на x, параметры a0 и a1 – параметрами линейной регрессии (коэффициенты регрессии).
На практике параметры регрессии определяются по результатам наблюдений переменных Y и x, связь между которыми можно
записать:
= + + ,
где – случайная ошибка наблюдений.
Последовательность проведения регрессионного анализа состоит из этапов:
Формулировка задачи.
Идентификация переменных (определение входных и выход-
ных переменных).
Сбор статистических данных.
Спецификация функции регрессии (определение вида моде-
ли).
Оценивание параметров функции регрессии.
Оценка точности регрессионного анализа.
Интерполяция результатов, анализ, оптимизация и прогно-
зирование.
Для оценки точности регрессионного анализа осуществляется:
проверка адекватности всей модели, т.е. согласуются ли
предсказанные значения выходной величины с наблюдаемыми
данными;

57
проверка значимости параметров модели, т.е. значимо ли
они отличаются от нуля или нет.
Предпосылки к проведению регрессионного анализа:
случайные ошибки наблюдений имеют нормальный закон
распределения;
отсутствие автокорреляции между ошибками наблюдений,
т.е. последовательные значения ei не зависят друг от друга.
Для нахождения оценок параметров модели по результатам
наблюдений используется метод наименьших квадратов (МНК).
Возможно три метода выполнения регрессионного анализа с
помощью статистических программ [11]:
1. Добавить линию тренда.
2. Использовать инструмент анализа "Регрессия".
3. Использовать статистические функции.
Для оценки качества приближения данных к полученной математической модели используется коэффициент детерминации
R2. Коэффициент детерминации – это квадрат коэффициента корреляции. Он объясняет долю дисперсии, объясняемую ре-
грессией в общей дисперсии результативного (зависимого) признака.
Для определения величины степени стохастической взаимосвязи результативного признака Y и факторов X необходимо
знать следующие дисперсии:
общую дисперсию результативного признака Y, отображаю-
щую влияние как основных, так и остаточных факторов:
∑
()
=
;
факторную дисперсию результативного признака Y, отобра-
жающую влияние только основных факторов:
ф
∑
=
(
)
;

58
остаточную дисперсию результативного признака Y, отоб-
ражающую влияние только остаточных факторов:
∑
(
=
()
)
.
При корреляционной связи результативного признака и факторов выполняется соотношение:
ф
>
;
=
ф
+
.
о
Для анализа общего качества уравнения многофакторной регрессии обычно используют множественный коэффициент детерминации R2. Множественный коэффициент детерминации R2
определяет долю вариации результативного признака, обусловленную изменением факторных признаков, входящих в многофакторную регрессионную модель и рассчитывается по формуле:
2
ф
.
2
y
R
2
Множественный коэффициент детерминации называют также квадратом коэффициента множественной корреляции R.
Проверка статистической значимости коэффициента детерминации R2 проводится на основе F-критерия Фишера:
2
m
ф
F
где n – число наблюдений,
m – число факторов в уравнении регрессии.
2
o
2
Rmn
2
R
11
mn
1
m
,
Если в уравнении регрессии свободный член а0 = 0, то числитель следует увеличить на 1, т.е. он будет равен n – m.
Сравнивая F
расч
и F
,, делаем вывод о значимости R2.
табл
При R2 > 0,7 считается, что вариация результативного признака Y обусловлена в основном влиянием включенных в регрессионную модель факторов X.

59
n
Для оценки адекватности уравнения регрессии часто используют показатель средней ошибки аппроксимации:
€
1
n
1
ni
yy
xii
y
i
%100
Кроме того, необходимо оценить значимость параметров
уравнения регрессии.
2
xx
срi
.
t
aрасч
. ,
n
a
a
a
ост
2
n
x
,
i
1
x
Значения параметров должны быть больше их стандартных
ошибок, и рассчитать критерий Стьюдента (сравнив его с табличным значением). Зная значения t
можно найти границы
расч,.
доверительных интервалов для коэффициентов регрессии:
min
taa
;
атаблii
.
max
taa
.
атаблii
.
При экономической интерпретации уравнения регрессии широко используются частные коэффициенты эластичности, показывающие, на сколько процентов в среднем изменится значение
результативного признака при изменении значения соответствующего факторного признака на 1 %, и определяемые по формуле:
x
ср
aЭ
ixi
,
y
ср
где ai – коэффициент регрессии при соответствующем признаке.
Для получения дополнительной информации о зависимости
двух переменных используется инструмент анализа «Регрессия»
(Excel: Сервис / Анализ данных / Регрессия) или «Множественная
регрессия» (Statistica: Статистика / Множественная регрессия)
(рис. 5).
Результаты анализа можно получить как в числовой, так и в
графической форме (см. п. 2.5 ). Задача пользователя – в их правильной интерпретации для принятия решений.

60
Итоги регрессионного анализа в результате обработки программой представлены на рисунке 6.
Рисунок 5. Инструмент анализа «Регрессия» в Statistica
Таблица с итогами регрессионного анализа (рис. 6) содержит
расчетные значения коэффициентов корреляции, детерминации,
критерия Фишера, стандартную ошибку вычислений.
Рисунок 6. Итоги регрессионного анализа в Statistica
Кроме линейной функции в регрессионном анализе возможно
использование других моделей полиномиальной, логарифмической, экспоненциальной, показательной. Для выполнения при-
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]
