Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Математическая статистика и анализ данных. Учебное пособие-1

.pdf
Скачиваний:
0
Добавлен:
15.08.2026
Размер:
1 Мб
Скачать

№ 3431 МИНИСТЕРСТВО ОБРАЗОВАНИЯ И НАУКИ РФ

ФЕДЕРАЛЬНОЕ ГОСУДАРСТВЕННОЕ АВТОНОМНОЕ ОБРАЗОВАТЕЛЬНОЕ УЧРЕЖДЕНИЕ ВЫСШЕГО ОБРАЗОВАНИЯ

«НАЦИОНАЛЬНЫЙ ИССЛЕДОВАТЕЛЬСКИЙ ТЕХНОЛОГИЧЕСКИЙ УНИВЕРСИТЕТ «МИСиС»

ИНСТИТУТ НОВЫХ МАТЕРИАЛОВ И НАНОТЕХНОЛОГИЙ

Кафедра металловедения и физики прочности

А.С. Мельниченко

МАТЕМАТИЧЕСКАЯ СТАТИСТИКА И АНАЛИЗ ДАННЫХ

Учебное пособие

Рекомендовано редакционно-издательским советом университета

Москва 2018

УДК 519.2 М48

Рецензент канд. физ.-мат. наук, доц. В.Л. Столяров

Мельниченко А.С.

М48 Математическая статистика и анализ данных : учеб. пособие / А.С. Мельниченко. – М. : Изд. Дом НИТУ «МИСиС», 2018. 45 с.

ISBN 978-5-906953-62-9

В пособии рассмотрены практические задачи, которые часто встречаются в практике анализа материаловедческих данных: описательная статистика, проверка вида распределения, сравнение средних и дисперсий, построение и анализ диаграммы рассеяния и расчет парного коэффициента корреляции. Каждый раздел содержит краткое теоретическое введение, задание для самостоятельного решения, порядок выполнения задания.

УДК 519.2

ISBN 978-5-906953-62-9

 

А.С. Мельниченко, 2018

 

НИТУ «МИСиС», 2018

СОДЕРЖАНИЕ

 

ПРЕДИСЛОВИЕ........................................................................................

4

1. ПЕРВИЧНЫЙ АНАЛИЗ ЭКСПЕРИМЕНТАЛЬНЫХ ДАННЫХ.....

5

1.1. Теоретическое введение....................................................................

5

1.2. Задание..............................................................................................

15

1.3. Порядок выполнения задания........................................................

15

2. СРАВНЕНИЕ СРЕДНИХ И ДИСПЕРСИЙ.......................................

20

2.1. Теоретическое введение .................................................................

20

2.2. Задание..............................................................................................

25

2.3. Порядок выполнения задания........................................................

26

3. ПАРНЫЙ КОЭФФИЦИЕНТ КОРРЕЛЯЦИИ И ЭЛЛИПС

 

РАССЕЯНИЯ............................................................................................

30

3.1. Теоретическое введение..................................................................

30

3.2. Задание..............................................................................................

33

3.3. Порядок выполнения задания........................................................

34

БИБЛИОГРАФИЧЕСКИЙ СПИСОК.....................................................

36

Приложение .............................................................................................

37

Таблица П1. Процентные точки t-распределения Стьюдента...........

37

Таблица П2. Функция нормального распределения...........................

38

Таблица П3. Процентные точки c2 распределения Пирсона.............

40

Таблица П4. Процентные точки F-распределения .............................

41

Таблица П5. Процентные точки распределения выборочного

 

парного коэффициента корреляции......................................................

44

3

ПРЕДИСЛОВИЕ

В данном пособии рассматриваются вопросы анализа данных, которые по опыту кафедры металловедения и физики прочности наиболее часто встречаются в курсовых и дипломных работах студентов. Это описательная статистика, проверка нормальности распределения, сравнение средних и дисперсий, дисперсионный анализ, построение

ианализ диаграмм рассеяния и расчет парного коэффициента корреляции. Каждой теме предпослано краткое теоретическое введение, цель которого – напомнить теоретические основы применяемого метода. Более подробно и глубоко с теорией можно ознакомиться в изданиях [1–4]. Далее следует задание для самостоятельной работы

ипорядок выполнения задания с необходимыми расчетными формулами. Пособие не ориентировано на использование конкретных компьютерных программ, поэтому разделы «порядок выполнения задания» изложены с детализацией, достаточной для проведения расчетов на калькуляторе, а в приложении имеются все необходимые таблицы [5]. В то же время применение любых компьютерных средств приветствуется.

Пособие предназначено для студентов, обучающихся в бакалавриате по направлению подготовки 22.03.01 «Материаловедение и технологии материалов», профилю «Металловедение и термическая обработка металлов». Может быть использовано бакалаврами и магистрами других направлений.

4

1. ПЕРВИЧНЫЙ АНАЛИЗ ЭКСПЕРИМЕНТАЛЬНЫХ ДАННЫХ

1.1. Теоретическое введение

Характеристики случайной величины

Результаты эксперимента или производственного контроля не являются полностью предсказуемыми, даже если известны значения всех факторов. В результатах всегда присутствует элемент неопределенности. С точки зрения теории вероятностей результат эксперимента или контроля является случайным событием, а сам эксперимент или производственный контроль – статистическим испытанием. Если случайное событие выражается числом, то такое число считается случайной величиной. Случайный – не означает «какой угодно». Каждое случайное событие Х происходит с некоторой вероятностью Р(Х).

Если регистрируемая в эксперименте случайная величина Х может (по крайней мере, теоретически) принимать любое произвольное значение на отрезке или числовой оси, то она называется непрерывной. Число возможных значений непрерывной случайной величины несчетно. Поэтому вероятность принять какое-либо конкретное значение х равна нулю: P(X = x) = 0 или P(x) = 0. Вместо этой вероятности можно определить вероятность попадания непрерывной случайной величины Х в интервал (x1;x2]:

x2

 

P(x1 < X x2) = w(x)dx .

(1.1)

x1

 

Функция w(x) (рис. 1.1) называется плотностью распределения вероятности (или плотностью распределения или плотностью ве-

роятности). Вероятность (1.1) можно представить графически как заштрихованную площадь на рис. 1.1. Функция плотности распределения нормирована так, что полная площадь под кривой w(x) , т.е. вероятность того, что случайная величина Х примет какое-либо значение из интервала (-∞; ) – P(-∞ < X < ∞) – равна 1. График плотности распределения дает наглядное представление о том, как часто встречаются различные значения случайной величины Х.

5

Рис. 1.1. Плотность распределения непрерывной случайной величины

Рис. 1.2. Функция распределения непрерывной случайной величины

Функция

x

 

F(x) = w(t)dt

(1.2)

-∞

называется функцией распределения. Функция F(x) вычисляет вероятность P = F(x) того, что случайная величина Х принимает зна-

чение, меньшее или равное х, а обратная функция распределения по вероятности P = F(x) рассчитывает значение аргумента функции распределения х. Функция распределения – это неубывающая функция, такая, что F(-∞) = 0 и F() =1 (рис. 1.2). Плотность вероятности w(x) , как и функция распределения F(x) полностью определяют свойства непрерывной случайной величины.

6

Некоторые наиболее важные свойства распределения случайной величины можно описать числовыми характеристиками распределения. Первая из них – математическое ожидание m (иначе первый момент распределения) – характеристика расположения центра распределения случайной величины. Математическое ожидание непрерывной случайной величины Х с плотностью вероятности w(x)

 

mx = xw(x)dx .

(1.3)

-∞

(Далее характеристики распределения конкретной случайной величины будут приводиться с нижним индексом – именем этой величины). Если распределения случайных величин X и Y различаются единственно их математическими ожиданиями mx и my , то графики функций распределения или плотностей вероятностей одинаковые по форме, но сдвинуты один относительно другого на величину mx -my .

Характеристикой разброса случайной величины вокруг ее математического ожидания является дисперсия (иначе второй центральный момент). Дисперсия s2 непрерывной случайной величины Х

 

s2x = (x -mx )2 w(x)dx .

(1.4)

-∞

Кроме дисперсии характеристикой разброса является и квадрат-

ный корень из нее – стандартное отклонение

 

 

 

 

 

sx =

s2x

= (x -mx )2 w(x)dx .

(1.5)

 

 

 

-∞

 

Стандартное отклонение sx имеет ту же размерность, что и сама случайная величина Х (а дисперсия – квадрат этой размерности), поэтому оно удобнее для практической оценки разброса.

Другими важными характеристиками распределения непрерывной случайной величины являются квантили. Квантилем xP случайной величины X с функцией распределения F(x) называется значение случайной величины, для которого функция распределения прини-

мает значение Р: F(xP ) = P . На рис. 1.2 показан квантиль x0,5 , называемый медианой, и имеющий специальное обозначение mx . Ве-

роятность того, что случайная величина окажется меньше медианы равна вероятности того, что она окажется больше медианы и равна 0,5. В прикладной статистике часто применяется квантиль x0,95 , вероятность превышения которого равна 0,05.

7

Нормальное распределение

Нормальное распределение занимает центральное место в теоретической статистике. Нормальное распределение возникает, когда разброс наблюдаемой величины вызван множеством причин, каждая из которых вносит в этот разброс вклад, сравнимый с вкладом других причин, и нет единственной преобладающей причины. Большинство методов статистического анализа применимо только к выборкам из нормальных распределений.

Плотность вероятности

w(x) =

 

1

exp

-

(x -m)2

.

(1.6)

 

 

 

2s2

 

s

 

2π

 

 

 

 

 

 

 

 

 

 

 

 

 

Область определения -∞ < x < ∞ .

 

 

 

Параметры распределения m и

s > 0 являются математическим

ожиданием и стандартным отклонением нормально распределенной случайной величины.

Математическое ожидание mx =m. Дисперсия s2x = s2 .

МедианаНормальноеmx распределение=m. симметрично относительно математического ожидания m, поэтому значения медианы и математического ожиданиясовпадают.Графикнормальногораспределенияспараметрами m = 0 и s =1 приведеннарис.1.3.

Рис. 1.3. Плотность вероятности нормального распределения с m = 0, s =1

8

Пусть P(m-a < X <m+a)

– вероятность того, что нормаль-

но распределенная случайная

величина X находится в интервале

(m-a;m+a), тогда

 

P(mx -sx < X <mx +sx ) = 0,6827;

P(mx -2sx < X <mx + 2sx ) = 0,9545; P(mx -3sx < X <mx +3sx ) = 0,9973.

Следовательно, менее 1/3 значений нормально распределенной случайной величины отклоняется от математического ожидания более чем на одно стандартное отклонение.

Вероятность отклонения нормально распределенной случайной величиныотматематическогоожиданияболеечемнадвастандартныхотклонения не превышает 0,0455, а на три стандартных отклонения – 0,0027.

Выборочные оценки

Результаты эксперимента – наблюдения x1,x2,...,xn , полученные в n повторных испытаниях, проведенных в идентичных условиях, – считаются значениями, принимаемыми в эксперименте измеряемой случайной величиной X. Все возможные значения случайной величины Х, распределенные с плотностью вероятности w(x) или функцией распределения F(x) , называются генеральной совокупностью. Числовые характеристики распределения считаются параметрами генеральной совокупности. В математической статистике эксперимент интерпретируется как случайный выбор конкретного значения из бесконечной генеральной совокупности. Множество результатов x1,x2,...,xn – это случайная выборка из генеральной совокупности.

Генеральная совокупность является абстрактным понятием. Чтобы выборка полностью отражала свойства генеральной совокупности, она должна быть бесконечной. (Поэтому генеральную совокупность еще определяют как бесконечное множество значений результатов статистического испытания, которое может при идентичных условиях повторяться сколь угодно большое число раз). Конечная выборка лишь приближенно с большей или меньшей точностью отражает свойства генеральной совокупности. По выборке можно оценить параметры генеральной совокупности и построить приближенную функцию распределения. Величины, рассчитанные по выборке, на-

9

зываются выборочными оценками параметров генеральной совокупности или просто оценками.

Простейшие выборочные оценки параметров генеральной совокупности – точечные оценки. Точечная оценка – оценка параметра ге-

неральной совокупности одним числом.

 

 

Точечная оценка математического ожидания

по случайной вы-

борке x1,x2,...,xn выборочное среднее

 

 

 

 

n

 

 

 

x =

1xi .

 

(1.7)

 

 

n i=1

 

 

Точечная оценка дисперсии s2x при условии, что среднее x

опре-

делено из тех же n наблюдений – выборочная дисперсия:

 

 

1

n

 

 

sx2 =

(xi - x)2 .

 

(1.8)

 

 

 

n -1 i=1

 

 

Величина, стоящая в знаменателе (1.8), – число степеней свободы (ч.с.с.) выборочной дисперсии. В общем случае ч.с.с. дисперсии это число наблюдений минус число линейных зависимостей между этими наблюдениями, использованных в расчете дисперсии (в данном случае одна зависимость (1.7) для среднего).

Квадратный корень из выборочной дисперсии – выборочное стандартное отклонение – оценка стандартного отклонения генеральной совокупности sx

 

 

 

 

1

n

 

 

sx = sx2 =

(xi - x)2 .

(1.9)

 

 

 

 

 

n -1 i=1

 

Для оценки выборочной медианы mx выборка x1,x2,...,xn сначала перестраивается в порядке возрастания (перестраивается в вариационный ряд). За выборочную медиану принимается средний по порядку член вариационного ряда (член с номером (n2+1) ) если n нечетное:

mx = xn+1 ,

(1.10а)

2

 

или полусумма двух расположенных в середине вариационного ряда чисел, если n четное

m

 

=

1

 

 

+ x

 

 

 

(1.10б)

x

 

x

n

n

 

.

 

 

2

 

 

+1

 

 

 

 

 

 

2

 

2

 

 

10

Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]