Добавил:
ivanov666
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз:
Предмет:
Файл:Статистические методы контроля качества. Практикум. Учебное пособие
.pdf
Под размахом понимается разность между наибольшим и
R
X
наименьшим элементами выборки
XX
max min
. (5)
Межквартильный размах (IQR – Inter Quartile Range), как разность
между квартилями выборки (третьим и первым), определяется как
IQR QQ
31
. (6)
Показатель позволяет оценить разброс 50 % элементов, не учиты-
вая влияние экстремальных элементов.
Выборочная дисперсия – среднее арифметическое квадратов откло-
нения наблюдаемых значений признака от их среднего значения
n
2
S
i
i
1
n
2
X
. (7)
1
Выборочное среднеквадратичное отклонение – характеристика
рассеивания значений случайной физической величины, определенная
по выборке, относительно ее математического ожидания
SS
2
n
XX
i
i
1
n
2
. (8)
1
Дисперсия и выборочное среднеквадратичное отклонение позволяют оценить разброс данных вокруг среднего значения и определить,
сколько элементов выборки меньше среднего, а сколько – больше.
Величина дисперсии представляет собой квадрат единицы измерения. Оценка дисперсии – стандартное отклонение, которое выражается в
обычных единицах измерений.
Среднеквадратичное отклонение позволяет произвести оценку величины вариации элементов
выборки вокруг среднего значения. Практически всегда основное количество наблюдаемых величин лежит в интервале плюс-минус одно стандартное отклонение от среднего значения. По значениям среднего арифметического и выборочного отклонения, можно определить интервал, которому принадлежит основная доля
данных [1].
11

1.2. Форма распределения
Для оценки степени крутизны кривой распределения относительно
нормальной кривой применяется коэффициент эксцесса E
μ
4
=3
E
k
σ
, (9)
4
:
k
где μ
– четвертый центральный момент; σ – стандартное среднеквадра-
4
тичное отклонение.
При E
> 0 вершина кривой эмпирического распределения нахо-
k
дится выше вершины кривой нормального распределения и форма кривой распределения более островершинная, чем у нормальной кривой
(рис. 1). Это свидетельствует о группировке большинства значений случайной величины около центра распределения.
При E
< 0 вершина кривой эмпирического распределения находит-
k
ся ниже вершины кривой нормального распределения и форма кривой
распределения более пологая, чем у нормальной кривой (рис. 1).
0,7
0,6
0,5
0,4
0,3
0,2
0,1
функции распределения f(x)
Значение дифференциальной
0
16 17 18 19 20 21 22 23 24
Значение аргумента
нормальное плосковершинное островершинное
Рис. 1. Типы распределения
Для нормальной кривой Ek = 0. Эмпирическое распределение тем
больше отличается от нормального, чем выше абсолютное значение |E
| [2].
k
Показатели асимметрии
Показатели асимметрии используются для оценки симметричности
распределения относительно центра. Они показывают, насколько смещены значения ряда распределения влево или вправо относительно
симметричного нормального распределения.
12

Асимметрию оценивают:
М
М
М
по соотношению между медианой и средним значением;
коэффициенту асимметрии.
Для симметричного распределения максимальное значение ординаты находится в середине кривой, а показатели описательной статистики,
оценивающие среднее значение распределения, совпадают
X
Me
D
.
Для асимметричного распределения вершина кривой сдвинута или
влево, или вправо. Когда вершина сдвинута влево, правая часть кривой
длиннее левой (рис. 2, а), наблюдается правосторонняя асимметрия.
В этом случае:
.XMe
0
а б
Рис. 2. Кривые асимметричных распределений:
а – левосторонняя асимметрия As < 0; б – правосторонняя асимметрия As > 0
В распределении чаще наблюдаются высокие значения случайной
величины.
Когда вершина распределения сдвинута вправо, левая часть оказывается длиннее правой, наблюдается левосторонняя асимметрия
(рис. 2, б):
.XMe
0
В распределении чаще встречаются более низкие значения случайной величины. Чем больше отличаются между собой
X , Me, M
, тем
0
более асимметричен ряд.
13

Более точным показателем асимметричности распределения явля-
ется коэффициент асимметрии A
:
s
3
S
, (10)
3
где μ
A
– третий центральный момент; σ – стандартное среднеквадратич-
4
ное отклонение.
Используется шкала асимметричности, приведенная ниже:
| < 0,25 – незначительная асимметрия;
|A
s
0,25 < |A
| > 0,5 – выраженная асимметрия.
|A
s
Коэффициент асимметрии A
| < 0,5 – заметная асимметрия;
s
является относительной безразмерной
s
величиной, применяется для сравнения асимметричности различных
распределений.
Сделать выводы о форме распределения данных можно на основе
таблицы частот, полигона, гистограммы. С ними мы познакомимся в
Теме 2 «Графическое представление данных».
1.3. Описание работы в Excel
1.3.1. Пакет «Анализа данных»
Перед началом работы необходимо проверить наличие в Excel
надстройки «Пакет анализа». Если «Пакет анализа» установлен, то меню «Данные» будет содержать вкладку «Анализ данных». Если эта
вкладка в меню «Данные» отсутствует, необходимо выполнить следующие действия: в меню «Файл» выбрать вкладку «Параметры» (рис. 3),
«Надстройки». В открывшемся меню выбрать «Пакет анализа» (рис. 4).
Рис. 3. Действия в меню «Файл» программы Excel
14

Рис. 4. Управление надстройками, подключение пакета анализа
В меню окна программы «Данные» должна появиться вкладка
«Анализ данных» (рис. 5).
Рис. 5. Меню программы Excel из пакета программ Microsoft Office 2010
Пакет «Анализ данных» включает в себя основные инструменты
статистического анализа (рис. 6).
Рис. 6. Окно пакета анализа данных
15

Инструмент «Генерация случайных чисел»
Инструмент «Генерация случайных чисел» применяется для генерирования данных и позволяет получить данные с различными законами распределения: равномерным, нормальным, биномиальным и другими. Результат расчета может быть выведен: на выходной интервал данного рабочего листа, новый рабочий лист, в новую рабочую книгу (рис. 7).
Рис. 7. Окно функции «Генерация данных»
Для фиксации определенной совокупности случайных чисел используют поле «Случайное рассеивание». Если оно не заполнено, каждый раз будет моделироваться разный набор случайных чисел. В противном случае определенному числу будет соответствовать определенная последовательность случайных чисел.
Инструмент «Выборка»
Из генеральной совокупности можно сделать выборку, используя
функцию «Выборка» из меню «Анализ
данных» (рис. 8).
Инструмент «Описательная статистика»
Расчет показателей описательной статистики выборки можно произвести с использованием статистических функций Excel. Меню «Описательная статистика» пакета анализа данных (рис. 9), позволяет произвести расчет многих показателей сразу (рис. 10).
16

Рис. 8. Меню функции «Выборка»
В диалоговом окне задаются следующие параметры:
входной интервал – указывается ссылка на ячейки с данными;
группирование – по строкам или столбцам данных;
метки в первой строке / метки в первом столбце – устанавливает-
ся флажок при условии, что первая строка или первый столбец во входном диапазоне имеет заголовки;
выходной интервал
, новый лист или новая книга;
уровень надежности активизируется, когда в выходной таблице
включена строка для предельной ошибки выборки при установленном
уровне надежности;
итоговая статистика активизируется, если требуется получить в
выходном диапазоне по одному полю каждого из показателей описательной статистики: средняя ошибка выборки, средняя арифметическая
выборки, мода, медиана,
оценка стандартного отклонения по выборке,
оценка дисперсии по выборке, оценка эксцесса по выборке, оценка коэффициента асимметрии по выборке, минимальный и максимальный
элементы выборки, размах вариации выборки, сумма элементов выборки, количество элементов в выборке, k-й наибольший и наименьший
элементы, предельная ошибка выборки (рис. 9).
В поле, расположенном напротив флажка, вводится
требуемое
значение уровня надежности. Например, при значении уровня надежности 95 % доверительная вероятность составит Р = 0,95 (уровень значимости α = 0,05).
17

Рис. 9. Диалоговое окно инструмента «Описательная статистика»
Рис. 10. Результаты расчета при использовании инструмента
«Описательная статистика»
Пример
Затраты, связанные с изготовлением бракованной продукции по
каждому из цехов завода «ХХХ» за 2014 год, приведены таблице, сформированной на рабочем листе Microsoft Excel (рис. 11).
Необходимо проанализировать данные.
18

ν
1 Затраты, связанные с изготовлением бракованной продукции
2 Цех № 1 389,04
3 Цех № 2 417,78
4 Цех № 3 394
5 Цех № 4 371,96
6 Цех № 5 525,96
7 Цех № 6 405,12
8 Цех № 7 419,52
9 Цех № 8 401,93
10 Цех № 9 418,97
Рис. 11. Затраты, связанные с изготовлением бракованной продукции
A В
по каждому из цехов за 2014 г., тыс. руб.
Решение
Произведем расчет показателей описательной статистики, используя инструмент «Описательная статистика» (рис. 12).
На основании анализа показателей (рис. 12) можно сказать, что среднее значение составило 416,03. В диапазоне 416,03 ± 44,13 лежит основная
масса всех значений случайной величины.
Для характеристики разброса значений в выборке рассчитаем коэффициент вариации:
100 % 100 % 10,6 %
.
416,03x
Значение меньше 40 % свидетельствует о незначительном колебании
44,13
Рис. 12. Результаты расчетов
признака в выборке.
Среднее значение выборки незначительно отклоняется от медианы:
416,03 – 405,12 = 10,91.
По значениям коэффициентов асимметрии (As) и эксцесса (Еk)
можно сделать вывод об отличии эмпирического распределения от нормального. Распределение асимметричное имеет выраженную правостороннюю асимметрию. Распределение островершинное – его вершина
лежит выше вершины нормального распределения и характеризуется
скоплением членов ряда в центре распределения.
19

1.3.2. Статистические функции программы Excel
Ниже приводятся описания некоторых из функций раздела «Статистические» программы Excel.
СРЗНАЧ(число1; число2, …). Рассчитывает среднее значение
(среднее арифметическое) аргументов. Например, если диапазон (Диапазон. Две или более ячеек листа. Ячейки диапазона могут быть как
смежными, так и несмежными) A1:A20 содержит числа, формула =
СРЗНАЧ(A1:A20) возвращает среднее значение этих чисел.
МЕДИАНА(число1; число2; ...).
Рассчитывает медиану заданных
чисел. Медиану можно определить через функцию КВАРТИЛЬ(массив,
часть). Медиана – это второй квартиль.
МОДА.ОДН(число1; число2; ...). Определяет максимально повторяющееся значение в массиве или интервале данных. Если данные не
содержат повторяющихся значений, то моду определить нельзя, тогда
появляется указание на ошибку #Н/Д.
СТАНДОТКЛОН.В(число1; число
2; ...). Рассчитывает стандартное
отклонение по выборке.
СТАНДОТКЛОН.Г(число1; число2; ...). Рассчитывает стандартное
отклонение по генеральной совокупности.
ДИСП.В(число1; число2; ...). Рассчитывает дисперсию по выборке.
ДИСП.Г(число1; число2; ...). Вычисляет дисперсию для генеральной совокупности. Логические значения и текст игнорируются.
МАКС (число1; число2; ...). Определяет наибольшее значение.
МИН (число1; число2; ...). Определяет наименьшее значение.
СКОС (число1; число2; ...). Определяет асимметрию распределения
относительно среднего.
ЭКСЦЕСС(число1; число2; ...). Определяет показатель эксцесса в
наборе данных.
ЗАДАНИЯ
1. Смоделируйте два столбца по 500 чисел по нормальному закону
распределения со средним значением 40 и стандартным отклонением 2.
Принимая сгенерированные данные как генеральную совокупность, разбейте из их на две случайные выборки (по одной из
каждого столбца) по
70 чисел. Воспользуйтесь для анализа этих выборок инструментом «Анализ данных». Интерпретируйте полученные результаты (см. пример).
Сделайте выводы.
20
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]
