Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Статистические системы в управлении качеством промышленных коллекций. Часть 1. Задачи и программные средства управления качеством промышленных коллекц

.pdf
Скачиваний:
0
Добавлен:
07.09.2026
Размер:
1 Мб
Скачать
☆
51
тельно упрощается доступными программными средствами, представленными в любых статистических программах.
В модуле Описательные статистики (Descriptive statistics), как правило, возможно выполнить следующие процедуры:
выбрать переменные для анализа (из уже открытого файла);
вычислить различные описательные статистики;
оценить близость распределения к нормальному закону;
построить гистограммы;
сгруппировать данные, разбив различными способами на
классы;
удобно визуализировать данные и т. д.
Отметим, что сколько-нибудь уверенно о нормальности зако­на распределения можно судить, если имеется, по крайней мере, не менее 50 результатов наблюдений. В случаях меньшего числа данных можно говорить только о том, что данные не противоре­чат нормальному закону, и в этом случае обычно используют графические методы оценки соответствия. При большем числе наблюдений целесообразно совместное использование графичес­ких и статистических методов оценки (например, тест Колмого­роваСмирнова), естественно дополняющих друг друга.
2.4.3. Методы оценивания параметров распределений по результатам измерений
Одним из фундаментальных в статистическом анализе явля­ется понятие случайной величины. Случайной называется пере­менная величина, принимающая в зависимости от случая те или иные значения с определенными вероятностями. В практических задачах обычно используются дискретные и непрерывные слу­чайные величины [8, 11].
Дискретной случайной величиной называется такая случай­ная величина, множество возможных значений которой либо ко­нечно, либо бесконечно, но счетно.
Непрерывной случайной величиной называется такая случай­ная величина, которая может принять любое значение из некото­рого конечного или бесконечного интервала.
52
Чтобы дать полное математическое описание случайной ве­личины, нужно указать множество ее значений и соответствую­щее случайной величине распределение вероятностей на этом множестве.
Кроме того, каждое отдельное значение непрерывной случай­ной величины обладает нулевой вероятностью. Однако, несмотря на данное обстоятельство, нахождение возможных значений слу­чайной величины в различных интервалах обладает различными и отличными от нуля вероятностями. Таким образом, для непре­рывной случайной величины, так же как и для дискретной, мож­но определить закон распределения, по несколько в ином виде, чем для дискретной. Для этого используют понятие функции рас-
пределения случайной величины.
Функцией распределения случайной величины X называется функция F(x). Иногда функцию F(x) называют интегральной функцией распределения.
Функция распределения вероятностей непрерывной случай­ной величины дает полную вероятностную характеристику ее по­ведения.
Функция F(x)задает вероятность того, что случайная величи­на «Р» принимает значение, меньшее х, т. е.:
()= ( < ),
()= 
∑
( <  )

.
Однако способ задания непрерывной случайной величины с помощью функции распределения не является единственным. Ее можно задать с помощью другой функции, которая называется
дифференциальной функцией распределения, или плотностью распределения. В некотором смысле эта функция более удобна,
чем интегральная функция F(x), так как последняя не в полной мере дает представление о характере распределения случайной величины в небольшой окрестности той или иной точки числовой оси.
53
Решить эту задачу позволяет дифференциальная функция распределения, которая является первой производной интеграль­ной функции распределения:
()=  󰆒().
График дифференциальной функции распределения f(x) называется кривой распределения. Кривая распределения, выра­жающая общую закономерность данного типа распределения, называется теоретической кривой распределения.
В статистике широко используются различные виды теорети­ческих распределений – нормальное распределение, биномиаль­ное, распределение Пуассона и др. Каждое из теоретических рас­пределений имеет специфику и свою область применения. Чаще всего в качестве теоретического распределения используется нормальное распределение, занимающее особое положение в ста­тистических исследованиях.
Строить графики интегральных и дифференциальных функ­ций распределения удобно с помощью «Мастера диаграмм» (Microsoft Excel) или «Графической галереи» (Statistica) (см.п.2.5). Для этого необходимо предварительно сформировать интегральные и дифференциальные массивы значений, используя в качестве ее аргументов сгенерированную последовательность случайных чисел.
Графики интегральной и дифференциальной функций нор­мального распределения при х=0 и σ2=1 показаны на рисунке 4.
Распределения вероятностей используются для анализа и мо­делирования процессов, происходящих в реальном мире. Речь идет о теоретическом распределении, описываемом математиче­ской формулой.
Дискретные распределения описывают случайные процессы, принимающие дискретный набор значений (обычно несколько различных целых чисел). В этом случае можно перечислить воз­можные значения и соответствующие им вероятности ("точечные массы"). Например, интенсивность обрыва нити на ткацком стан­ке. Данная случайная величина принимает значения 0, 1, 2, 3, 4, 5
54
и 6. Поэтому она имеет дискретное распределение, ставящее в соответствие каждому из этих семи чисел их вероятности.
Рисунок 4. Графики интегральной и дифференциальной функций
нормального распределения при х=0 и σ2=1
Непрерывные распределения описывают случайные величи­ны с непрерывной областью значений, например, отрезком дей­ствительной оси чисел. Так как имеется бесконечное число чисел между двумя действительными, то каждому из них необходимо сопоставить вероятность «ноль». Для непрерывных распределе­ний вероятность сопоставляется не отдельным значениям, а ин­тервалам чисел. Непрерывные распределения обычно описыва­ются функцией плотности распределения, причем площадь гра­фика под функцией плотности на определенном интервале опре­деляет вероятность.
Примером может служить рост человека определенной воз­растной группы. Хотя точность измерения роста ограничена, имеется бесконечное число возможных значений, и поэтому в данном случае для моделирования и анализа процесса (например,
55
n
в случае планирования ассортимента швейного предприятия) следует использовать непрерывное распределение.
2.4.4. Методы корреляция и регрессия
В качестве меры связи признаков обычно используют число­вую величину, называемую коэффициентом корреляции.
Коэффициент корреляции случайных величин может прини­мать значения от 1 до 1 и может быть равна ±1, только если эти
величины линейно зависят друг от друга. Значения корреляции, близкие к 1 или 1, указывают, что зависимость случайных вели-
чин друг от друга почти линейная. Значения ковариации, близкие к нулю, означают, что связь между случайными величинами либо слаба, либо не носит линейного характера [22, 27].
Выборочная корреляция. Если в каждом наблюдении мы ре- гистрируем значения не одной, а двух (или нескольких) случай­ных величин одновременно, мы получаем в результате двумер­ную (или многомерную) выборку. Для таких выборок тоже мож­но говорить о числовых характеристиках, например, о корреля­ции компонент этой выборки.
Коэффициентом корреляции двумерной выборки (x1, y1), ... , (хп, yn), или выборочным коэффициентом корреляции называют
величину:
))((
y
yx
i
n
i
y
i
1
.
2
)(
y
r
n
1
i
x
i
1
i
2
)(
x
x
i
(Иногда ее называют коэффициентом корреляции К. Пирсо­на.)
Регрессионный анализ. В регрессионном анализе изучается связь и определяется количественная зависимость между зависи­мой переменной и одной или несколькими независимыми пере­менными [27].
Пусть переменная Y зависит от одной переменной x. При этом предполагается, что переменная x принимает заданные фик­сированные значения, а зависимая переменна Y имеет случайный
56
разброс из-за ошибок измерения, влияния неучтенных факторов и т. д. Каждому значению x соответствует некоторый закон распре­деления вероятностей случайной величины Y. Предположим, что Y линейно зависит от значений переменной x. Это означает, что условное математическое ожидание случайной величины Y при заданном значении x имеет вид линейной функции:
(/)=  + .
Данная функция называется линейной теоретической функцией регрессии Y на x, параметры a0 и a1 – параметрами ли­нейной регрессии (коэффициенты регрессии).
На практике параметры регрессии определяются по результа­там наблюдений переменных Y и x, связь между которыми можно записать:
 =  + +  ,
где – случайная ошибка наблюдений.
Последовательность проведения регрессионного анализа со­стоит из этапов:
Формулировка задачи. Идентификация переменных (определение входных и выход-
ных переменных).
Сбор статистических данных. Спецификация функции регрессии (определение вида моде-
ли).
Оценивание параметров функции регрессии. Оценка точности регрессионного анализа. Интерполяция результатов, анализ, оптимизация и прогно-
зирование.
Для оценки точности регрессионного анализа осуществляет­ся:
проверка адекватности всей модели, т.е. согласуются ли
предсказанные значения выходной величины с наблюдаемыми данными;
57
проверка значимости параметров модели, т.е. значимо ли
они отличаются от нуля или нет.
Предпосылки к проведению регрессионного анализа:
случайные ошибки наблюдений имеют нормальный закон
распределения;
отсутствие автокорреляции между ошибками наблюдений,
т.е. последовательные значения ei не зависят друг от друга.
Для нахождения оценок параметров модели по результатам наблюдений используется метод наименьших квадратов (МНК).
Возможно три метода выполнения регрессионного анализа с помощью статистических программ [11]:
1. Добавить линию тренда.
2. Использовать инструмент анализа "Регрессия".
3. Использовать статистические функции.
Для оценки качества приближения данных к полученной ма­тематической модели используется коэффициент детерминации
R2. Коэффициент детерминации – это квадрат коэффициен­та корреляции. Он объясняет долю дисперсии, объясняемую ре-
грессией в общей дисперсии результативного (зависимого) при­знака.
Для определения величины степени стохастической взаимо­связи результативного признака Y и факторов X необходимо знать следующие дисперсии:
общую дисперсию результативного признака Y, отображаю-
щую влияние как основных, так и остаточных факторов:
∑
()
= 

;
факторную дисперсию результативного признака Y, отобра-
жающую влияние только основных факторов:
ф
∑
= 

(
)
;
58
остаточную дисперсию результативного признака Y, отоб-
ражающую влияние только остаточных факторов:
∑
(
= 

()
)
.
При корреляционной связи результативного признака и фак­торов выполняется соотношение:
ф
>  

;
=  
ф
+  
.
о
Для анализа общего качества уравнения многофакторной ре­грессии обычно используют множественный коэффициент де­терминации R2. Множественный коэффициент детерминации R2 определяет долю вариации результативного признака, обуслов­ленную изменением факторных признаков, входящих в много­факторную регрессионную модель и рассчитывается по формуле:
2
ф
.
2
y
R
2
Множественный коэффициент детерминации называют так­же квадратом коэффициента множественной корреляции R.
Проверка статистической значимости коэффициента детер­минации R2 проводится на основе F-критерия Фишера:
2
m
ф
F
где n – число наблюдений,
m – число факторов в уравнении регрессии.
2
o
2
Rmn
2
R
11
mn
1
m
,
Если в уравнении регрессии свободный член а0 = 0, то чис­литель следует увеличить на 1, т.е. он будет равен n – m.
Сравнивая F
расч
и F
,, делаем вывод о значимости R2.
табл
При R2 > 0,7 считается, что вариация результативного при­знака Y обусловлена в основном влиянием включенных в регрес­сионную модель факторов X.
59
n
Для оценки адекватности уравнения регрессии часто исполь­зуют показатель средней ошибки аппроксимации:
€
1
n
1
ni
yy
xii
y
i
%100
Кроме того, необходимо оценить значимость параметров уравнения регрессии.
2
xx
срi
.
t
aрасч
. ,
n
a
a
a
ост
2
n
x
,
i
1
x
Значения параметров должны быть больше их стандартных ошибок, и рассчитать критерий Стьюдента (сравнив его с таб­личным значением). Зная значения t
можно найти границы
расч,.
доверительных интервалов для коэффициентов регрессии:
min
taa
;
атаблii
.
max
taa
.
атаблii
.
При экономической интерпретации уравнения регрессии ши­роко используются частные коэффициенты эластичности, пока­зывающие, на сколько процентов в среднем изменится значение результативного признака при изменении значения соответству­ющего факторного признака на 1 %, и определяемые по формуле:
x
ср
aЭ
ixi
,
y
ср
где ai – коэффициент регрессии при соответствующем признаке.
Для получения дополнительной информации о зависимости двух переменных используется инструмент анализа «Регрессия» (Excel: Сервис / Анализ данных / Регрессия) или «Множественная регрессия» (Statistica: Статистика / Множественная регрессия) (рис. 5).
Результаты анализа можно получить как в числовой, так и в графической форме (см. п. 2.5 ). Задача пользователя – в их пра­вильной интерпретации для принятия решений.
60
Итоги регрессионного анализа в результате обработки про­граммой представлены на рисунке 6.
Рисунок 5. Инструмент анализа «Регрессия» в Statistica
Таблица с итогами регрессионного анализа (рис. 6) содержит расчетные значения коэффициентов корреляции, детерминации, критерия Фишера, стандартную ошибку вычислений.
Рисунок 6. Итоги регрессионного анализа в Statistica
Кроме линейной функции в регрессионном анализе возможно использование других моделей полиномиальной, логарифмиче­ской, экспоненциальной, показательной. Для выполнения при-
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]