Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:
Основы математического моделирования и обработки данных в медицине. Учебно-методическое пособие.pdf
Скачиваний:
0
Добавлен:
07.09.2026
Размер:
1 Мб
Скачать
☆

НОРМАЛЬНОЕ РАСПРЕДЕЛЕНИЕ И ЕГО ХАРАКТЕРИСТИКИ

Понятие нормального распределения

Распределение вероятностей – это закон, описывающий связь значений
случайной величины и их вероятности.
Нормальное распределение, также называемое распределением Гаусса, –
распределение вероятностей какой-то случайной величины. Это распределение играет важнейшую роль во многих областях науки и технике. Из всех распре­делений наиболее часто встречается в природе именно нормальное распределе­ние, в общем-то именно поэтому оно и называется нормальным. Например, оценки в классе за контрольную распределены именно в соответствии с нор­мальным распределением.
В теории вероятности и статистике сформулированы и доказаны Цен-
тральные предельные теоремы – класс теорем, утверждающих, что сумма большого количества независимых случайных величин имеет распределение, близкое к нормальному. Так как многие случайные величины в приложениях являются суммами нескольких случайных факторов, центральные предельные теоремы обосновывают распространённость нормального распределения.
В статистике нормальное распределение – одно из краеугольных понятий,
знать и понимать которое необходимо. Многие статистические методы и кри­терии требуют, чтобы распределение, которое соответствует выборке, было нормальным.

Функция плотности вероятности и функция распределения

Функция плотности вероятности при нормальном распределении опи-
сывается следующей формулой:

󰇡
󰇢
,
(
1
)
=

где , – среднеквадратичное отклонение и математическое ожидание, = 3,14 – число пи, = . – число е.
Функция распределения при нормальном распределении имеет сле-
дующий вид:
)
(
=

1

21
󰇡

󰇢

.
Нормальное распределение подчиняется так называемому Правилу
68-95-99,7, согласно которому количество значений, отличающиеся от среднего
на число, меньшее чем одно стандартное отклонение, составляют 68,27 % выбо­рок. В то же время количество значений, отличающиеся от среднего на два стан­дартных отклонения, составляют 95,45 %, а на три стандартных отклонения –
99,73 %.
Пример графика нормального распределения показан на Рис. 4.
Рис. 4. Нормальное распределение
Свойства нормального распределения:
• Растяжение до бесконечности: кривая теоретически никогда не до-
стигает нуля, хотя плотность вероятности экстремальных значений становятся бесконечно малыми.
• Симметрия: Форма кривой одинакова по обе стороны от среднего
значения.
• Совокупность процессов: общая площадь под кривой составляет
практически 100 % от того, что мы измеряем.
Как пример практического применения нормального распределения мож-
но привести такой случай. В популярных психологических тестах часто ис­пользуются списки вопросов, ответы на которые соответствуют определённым количествам баллов, которые затем суммируются. В зависимости от суммы, те­стируемый причислятся к той или иной категории. Согласно центральной пре-
22
дельной теореме, если вопросы не имеют никакого смысла и никак не соотно­сятся с теми категориями, к которым причисляют испытуемых, а ответы слу­чайны (то есть, если тест фальшивый), то распределение сумм окажется при­ближенно нормальным, а это значит, что большинство испытуемых окажутся причислены к некоей средней категории. Поэтому, если в каком-то тесте вы и ваши знакомые оказались посередине шкалы, то вполне возможно, что сработа­ло нормальное распределение, и тест ничего не значит.

Стандартное нормальное распределение

Стандартным нормальным распределением называется нормальное
распределение с математическим ожиданием 0 и стандартным отклонением 1.
Функция плотности вероятности при стандартном нормальном распреде-
лении описывается следующей формулой:
.
(
1
)
=

Функция распределения при стандартном нормальном распределении
имеет следующий вид:
График стандартного нормального распределения выборки приведен на
Рис. 5.
Обратите внимание, что стандартное нормальное распределение симмет-
рично относительно нуля.
Φ
()
=
1



.
Рис. 5. Нормальное стандартное распределение
23

Построение графика нормального распределения

Допустим у нас есть таблица с данными результатов 500 измерений тем-
пературы у пациентов, находящихся в стационаре. Первые 100 измерений пока­заны на Рис. 6.
Рис. 6. Таблица с измерениями
Так как количество измерений достаточно велико, и измерения проводи-
лись у всех пациентов, то распределение температур будет нормальным. Это можно проверить, например, построив график вероятности распределения тем­ператур и график плотности распределения температур.
Для этого запишем все значения температур вертикально в таблицу и от-
сортируем по возрастанию. Затем вычислим основные характеристики набора данных – среднее значение, стандартное отклонение, максимальное и минималь­ное значения. Первые два будут нужны для вычисления вероятности и плотности вероятности в соответствии с законом нормального распределения. Максималь­ные и минимальные значения будут нужны для построения графиков.
Затем вычисляем плотность вероятности и вероятность с помощью встро-
енной функции Excel: НОРМ.РАСП(x; среднее; стандартное_откл; интеграль­ная). При использовании функции НОРМ.РАСП должны быть заданы следую­щие обязательные аргументы:
X – Значение, для которого строится распределение. Среднее – Среднее арифметическое распределения.
24
Стандартное_откл – Стандартное отклонение распределения. Интегральная – Логическое значение, определяющее форму функции. Ес-
ли аргумент равен ИСТИНА, то функция вернет значение вероятности, с какой значение X встречается в наборе данных. Если аргумент равен ЛОЖЬ, то воз­вращается плотность вероятности.
Заполнение таблицы значениями вероятности и ее плотности с помощью
функции НОРМ.РАСП показано на Рис. 7.
Рис. 7. Заполнение таблицы значениями вероятности
и ее плотности с помощью функции НОРМ.РАСП
Далее на вкладке Вставить – Диаграммы выбираем и добавляем на лист
две точечные диаграммы и определяем данные для отображения. В качестве ‘Значения Х’ выбираем значения в столбце X. В качестве ‘Значения Y’ выбира­ем значения Плотности вероятности для одного графика и значения Вероятно­сти для второго (Рис. 8).
Рис. 8. Вставка точечной диаграммы в Excel
Должно получиться два графика – нормальное распределение со среднем
значением 35.5 и стандартным отклонением 3.4 плотности вероятности и веро-
25
ятность. Минимальное и максимальное значение по горизонтальной оси уста­навливаем вручную, ориентируясь на минимальные и максимальные значения в наборе данных.
Рис. 9. Графики плотности вероятности и вероятности
Для отображения графика плотности вероятности можно использовать
гистрограмму с группировкой. Для получения категорий, применим функцию УНИК к столбцам (X, плотности вероятности). Для того, чтобы уникальные значения собирались в столбце, последний параметр функции УНИК должен быть равен 0.
Затем выделяем полученные значения категорий и на вкладке Вставить
выбираем диаграмму типа ‘Гистограмма с категориями’.
Рис. 10. Гистограмма с категориями для отображения плотности вероятности
26

Квантили нормального распределения

Нахождение квантиля распределения порядка α является обратной опера-
цией нахождения вероятности. То есть, если при вычислении функции распре-
деления мы находим вероятность α, зная значение случайной переменной при нахождении квантиля мы, наоборот, ищем
зная α. Другими словами,
, то
квантиль отвечает на вопрос – какая случайная величина, распределенная по
нормальному закону, примет значение меньше, чем стью. Квантиль обозначается как
и может называться α-квантилем, альфа-
с заданной вероятно-
квантиль, квантиль порядка α, нижний α-квантиль. При этом α – это значение вероятности, с которой это число будет больше других случайных чисел. Как пример рассмотрим график вероятности, который был построен в предыдущем параграфе. Найдем число, меньше которого будут случайные числа с вероят­ность 0.25 (25 %). То есть число, для которого будет выполняться неравенство
.
.
Проведем на графике горизонтальную линию от значения вероятности
0.25 до пересечения с линией вероятности (Рис. 11). Затем опустим линию вер­тикально вниз до пересечения с горизонтальной осью. Значение на горизон­тальной оси и будет искомым значением. В нашем случае, как видно из графика
примерно равен 33.22. То есть случайные значения будут меньше, чем
.
33.22 с 25 % вероятностью.
Рис. 11. Нижний квантиль
Более точно значение
можно вычислить с помощью функции Excel
НОРМ.ОБР (вероятность; среднее; стандартное_откл), где среднее и стандарт­ное_откл – среднее значение и стандартное отклонение, которые использова­лись при построении нормального распределения.
27
В рассматриваемом случае
=33,22742885.
.
Но что, если необходимо найти, такое число, что остальные случайные
числа будут больше его с определенной вероятностью ? Тогда можно найти
верхний α-квантиль по той же формуле и методике, что описана для нижнего
квартиля. Единственно, при расчетах в формулах заменяют на (1 ).
Смысл такой замены в следующем. Если случайные числа больше какого-то
числа с вероятностью , то с вероятностью (1 ) они будут меньше его. То
есть фактически мы рассчитываем тоже нижний квантиль, но с вероятностью
(1 ).
Пример вычисления верхнего 25 % квантиля показан на Рис. 12.
Рис. 12. Верхний квантиль
На графике плотности вероятности нижний и верхний 0.25 квантили вы-
глядят следующим образом (Рис. 13):
= 37,8106473
.
Рис. 13. Нижний и верхний квантили нормального распределения
28
Вычисленные одновременно нижний
и верхний
 
квантиль назы-
 
вается двусторонним α-квантилем. Двусторонний α-квантиль задает интервал, в который рассматриваемая случайная величина попадает с заданной вероятно­стью α.
Допустим, нужно найти интервал, в который случайное значение попада-
ет с вероятностью 0.5 (50 %). Тогда ищется нижний и верхний квантили
,
интервал между ними – и будет искомым интервалом.
В рассматриваемом случае такой интервал равен [33,23; 37,81]. То есть
вероятность того, что все значения случайной величины находится в этом ин­тервале, равна 0.5.
В статистике широко используются специальные квантили процентили x квартили x медиана x
1/2
p/4
, где p = 1, 2, 3, ... 99
p/100
, где p = 1, 2, 3
То есть медиану для непрерывных числовых данных, описываемых нор-
мальным распределением, можно найти как 0.5 – квантилем
Пример вычисления квантилей с помощью функций Excel приведен на
Рис. 14. Как видно среднее значение и значение медианы, вычисленной как квантиль, совпадают с достаточной точностью.
Доверительный интервал – интервал, который покрывает неизвестный
,
параметр с заданной надёжностью. Другими словами – это интервал, в котором окажется случайная величина с заданной надёжностью.
Рис. 14. Вычисление квантилей с помощью функций Excel
Вычисление процентилей – быстрый способ разобраться в том, насколько
распределение близко к нормальному. Напомним, что для нормального распре­деления 95 % значений заключено в пределах двух стандартных отклонений от среднего и 68 % – в пределах одного стандартного отклонения, медиана совпа-
29
дает со средним. Соответствие между процентилями и числом стандартных от-
Процентили
Отклонения от среднего
2.5

16

50  84
+
97.5
+ 
клонений от среднего приведены в таблице 1 и на рис. 15.
Таблица 1. Соответствие между процентилями и стандартными отклонениями от среднего
Рис. 15. Соответствие между процентилями и стандартными отклонениями от среднего
Если соответствие между процентилями и отклонениями от среднего не
слишком отличается от приведенного, то распределение близко к нормальному и его можно описать при помощи среднего и стандартного отклонения.

ИНДУКТИВНАЯ СТАТИСТИКА

Нулевая гипотеза

Цель индуктивного статистического исследования – сформулировать ра-
бочую статистическую гипотезу и затем опровергнуть или подтвердить ее с помощью одного из критерия.
30
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]