Добавил:
ivanov666
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз:
Предмет:
Файл:Основы математического моделирования и обработки данных в медицине. Учебно-методическое пособие.pdf
X
- •ЧАСТНОЕ УЧРЕЖДЕНИЕ
- •Медицинский университет «РЕАВИЗ»
- •ВВЕДЕНИЕ
- •Цифровые технологии в медицине
- •Зачем нужна математическая статистика в медицине
- •ОСНОВНЫЕ ПОНЯТИЯ МАТЕМАТИЧЕСКОЙ СТАТИСТИКИ
- •Понятие выборки и генеральной совокупности
- •ОПИСАТЕЛЬНАЯ СТАТИСТИКА. ОСНОВНЫЕ ХАРАКТЕРИСТИКИ
- •Среднее значение
- •Стандартное отклонение и дисперсия
- •Стандартная ошибка
- •Минимум, Максимум, Размах вариации
- •Медиана
- •Математическое ожидание
- •Типы статистического исследования
- •Типы данных и их особенности
- •НОРМАЛЬНОЕ РАСПРЕДЕЛЕНИЕ И ЕГО ХАРАКТЕРИСТИКИ
- •Понятие нормального распределения
- •Функция плотности вероятности и функция распределения
- •Стандартное нормальное распределение
- •Построение графика нормального распределения
- •Квантили нормального распределения
- •ИНДУКТИВНАЯ СТАТИСТИКА
- •Нулевая гипотеза
- •Проверка статистических критериев
- •Доверительные интервалы
- •Гипотеза о генеральной средней нормального распределения
- •Критерий Шапиро-Уилка
- •Числовые данные. t-критерии Стьюдента
- •Случай 1. Несвязные выборки. Генеральные дисперсии неизвестны
- •Случай 2. Связные выборки
- •Расчет t-критерия в Excel
- •Числовые данные. Критерий Манна-Уитни
- •Пример 1. Эффективно ли новое лекарство?
- •Пример 2. Расчет U-статистики в Excel
- •Приложение 1. Таблица значений функции Лапласа
- •Приложение 2. Критические точки распределения Стьюдента
- •Приложение 4. Критические точки критерия Стьюдента
- •Приложение 5. Критические значения U-критерия
- •СПИСОК ЛИТЕРАТУРЫ

НОРМАЛЬНОЕ РАСПРЕДЕЛЕНИЕ И ЕГО ХАРАКТЕРИСТИКИ
Понятие нормального распределения
Распределение вероятностей – это закон, описывающий связь значений
случайной величины и их вероятности.
Нормальное распределение, также называемое распределением Гаусса, –
распределение вероятностей какой-то случайной величины. Это распределение
играет важнейшую роль во многих областях науки и технике. Из всех распределений наиболее часто встречается в природе именно нормальное распределение, в общем-то именно поэтому оно и называется нормальным. Например,
оценки в классе за контрольную распределены именно в соответствии с нормальным распределением.
В теории вероятности и статистике сформулированы и доказаны Цен-
тральные предельные теоремы – класс теорем, утверждающих, что сумма
большого количества независимых случайных величин имеет распределение,
близкое к нормальному. Так как многие случайные величины в приложениях
являются суммами нескольких случайных факторов, центральные предельные
теоремы обосновывают распространённость нормального распределения.
В статистике нормальное распределение – одно из краеугольных понятий,
знать и понимать которое необходимо. Многие статистические методы и критерии требуют, чтобы распределение, которое соответствует выборке, было
нормальным.
Функция плотности вероятности и функция распределения
Функция плотности вероятности при нормальном распределении опи-
сывается следующей формулой:
,
(
1
)
=
где , – среднеквадратичное отклонение и математическое ожидание, =
3,14 – число пи, = . – число е.
Функция распределения при нормальном распределении имеет сле-
дующий вид:
)
(
=
1
21
.

Нормальное распределение подчиняется так называемому Правилу
68-95-99,7, согласно которому количество значений, отличающиеся от среднего
на число, меньшее чем одно стандартное отклонение, составляют 68,27 % выборок. В то же время количество значений, отличающиеся от среднего на два стандартных отклонения, составляют 95,45 %, а на три стандартных отклонения –
99,73 %.
Пример графика нормального распределения показан на Рис. 4.
Рис. 4. Нормальное распределение
Свойства нормального распределения:
• Растяжение до бесконечности: кривая теоретически никогда не до-
стигает нуля, хотя плотность вероятности экстремальных значений становятся
бесконечно малыми.
• Симметрия: Форма кривой одинакова по обе стороны от среднего
значения.
• Совокупность процессов: общая площадь под кривой составляет
практически 100 % от того, что мы измеряем.
Как пример практического применения нормального распределения мож-
но привести такой случай. В популярных психологических тестах часто используются списки вопросов, ответы на которые соответствуют определённым
количествам баллов, которые затем суммируются. В зависимости от суммы, тестируемый причислятся к той или иной категории. Согласно центральной пре-
22

дельной теореме, если вопросы не имеют никакого смысла и никак не соотносятся с теми категориями, к которым причисляют испытуемых, а ответы случайны (то есть, если тест фальшивый), то распределение сумм окажется приближенно нормальным, а это значит, что большинство испытуемых окажутся
причислены к некоей средней категории. Поэтому, если в каком-то тесте вы и
ваши знакомые оказались посередине шкалы, то вполне возможно, что сработало нормальное распределение, и тест ничего не значит.
Стандартное нормальное распределение
Стандартным нормальным распределением называется нормальное
распределение с математическим ожиданием 0 и стандартным отклонением 1.
Функция плотности вероятности при стандартном нормальном распреде-
лении описывается следующей формулой:
.
(
1
)
=
Функция распределения при стандартном нормальном распределении
имеет следующий вид:
График стандартного нормального распределения выборки приведен на
Рис. 5.
Обратите внимание, что стандартное нормальное распределение симмет-
рично относительно нуля.
Φ
()
=
1
.
Рис. 5. Нормальное стандартное распределение
23

Построение графика нормального распределения
Допустим у нас есть таблица с данными результатов 500 измерений тем-
пературы у пациентов, находящихся в стационаре. Первые 100 измерений показаны на Рис. 6.
Рис. 6. Таблица с измерениями
Так как количество измерений достаточно велико, и измерения проводи-
лись у всех пациентов, то распределение температур будет нормальным. Это
можно проверить, например, построив график вероятности распределения температур и график плотности распределения температур.
Для этого запишем все значения температур вертикально в таблицу и от-
сортируем по возрастанию. Затем вычислим основные характеристики набора
данных – среднее значение, стандартное отклонение, максимальное и минимальное значения. Первые два будут нужны для вычисления вероятности и плотности
вероятности в соответствии с законом нормального распределения. Максимальные и минимальные значения будут нужны для построения графиков.
Затем вычисляем плотность вероятности и вероятность с помощью встро-
енной функции Excel: НОРМ.РАСП(x; среднее; стандартное_откл; интегральная). При использовании функции НОРМ.РАСП должны быть заданы следующие обязательные аргументы:
X – Значение, для которого строится распределение.
Среднее – Среднее арифметическое распределения.
24

Стандартное_откл – Стандартное отклонение распределения.
Интегральная – Логическое значение, определяющее форму функции. Ес-
ли аргумент равен ИСТИНА, то функция вернет значение вероятности, с какой
значение X встречается в наборе данных. Если аргумент равен ЛОЖЬ, то возвращается плотность вероятности.
Заполнение таблицы значениями вероятности и ее плотности с помощью
функции НОРМ.РАСП показано на Рис. 7.
Рис. 7. Заполнение таблицы значениями вероятности
и ее плотности с помощью функции НОРМ.РАСП
Далее на вкладке Вставить – Диаграммы выбираем и добавляем на лист
две точечные диаграммы и определяем данные для отображения. В качестве
‘Значения Х’ выбираем значения в столбце X. В качестве ‘Значения Y’ выбираем значения Плотности вероятности для одного графика и значения Вероятности для второго (Рис. 8).
Рис. 8. Вставка точечной диаграммы в Excel
Должно получиться два графика – нормальное распределение со среднем
значением 35.5 и стандартным отклонением 3.4 плотности вероятности и веро-
25

ятность. Минимальное и максимальное значение по горизонтальной оси устанавливаем вручную, ориентируясь на минимальные и максимальные значения в
наборе данных.
Рис. 9. Графики плотности вероятности и вероятности
Для отображения графика плотности вероятности можно использовать
гистрограмму с группировкой. Для получения категорий, применим функцию
УНИК к столбцам (X, плотности вероятности). Для того, чтобы уникальные
значения собирались в столбце, последний параметр функции УНИК должен
быть равен 0.
Затем выделяем полученные значения категорий и на вкладке Вставить
выбираем диаграмму типа ‘Гистограмма с категориями’.
Рис. 10. Гистограмма с категориями для отображения плотности вероятности
26

Квантили нормального распределения
Нахождение квантиля распределения порядка α является обратной опера-
цией нахождения вероятности. То есть, если при вычислении функции распре-
деления мы находим вероятность α, зная значение случайной переменной
при нахождении квантиля мы, наоборот, ищем
зная α. Другими словами,
, то
квантиль отвечает на вопрос – какая случайная величина, распределенная по
нормальному закону, примет значение меньше, чем
стью. Квантиль обозначается как
и может называться α-квантилем, альфа-
с заданной вероятно-
квантиль, квантиль порядка α, нижний α-квантиль. При этом α – это значение
вероятности, с которой это число будет больше других случайных чисел. Как
пример рассмотрим график вероятности, который был построен в предыдущем
параграфе. Найдем число, меньше которого будут случайные числа с вероятность 0.25 (25 %). То есть число, для которого будет выполняться неравенство
.
.
Проведем на графике горизонтальную линию от значения вероятности
0.25 до пересечения с линией вероятности (Рис. 11). Затем опустим линию вертикально вниз до пересечения с горизонтальной осью. Значение на горизонтальной оси и будет искомым значением. В нашем случае, как видно из графика
примерно равен 33.22. То есть случайные значения будут меньше, чем
.
33.22 с 25 % вероятностью.
Рис. 11. Нижний квантиль
Более точно значение
можно вычислить с помощью функции Excel
НОРМ.ОБР (вероятность; среднее; стандартное_откл), где среднее и стандартное_откл – среднее значение и стандартное отклонение, которые использовались при построении нормального распределения.
27

В рассматриваемом случае
=33,22742885.
.
Но что, если необходимо найти, такое число, что остальные случайные
числа будут больше его с определенной вероятностью ? Тогда можно найти
верхний α-квантиль по той же формуле и методике, что описана для нижнего
квартиля. Единственно, при расчетах в формулах заменяют на (1 ).
Смысл такой замены в следующем. Если случайные числа больше какого-то
числа с вероятностью , то с вероятностью (1 ) они будут меньше его. То
есть фактически мы рассчитываем тоже нижний квантиль, но с вероятностью
(1 ).
Пример вычисления верхнего 25 % квантиля показан на Рис. 12.
Рис. 12. Верхний квантиль
На графике плотности вероятности нижний и верхний 0.25 квантили вы-
глядят следующим образом (Рис. 13):
= 37,8106473
.
Рис. 13. Нижний и верхний квантили нормального распределения
28

Вычисленные одновременно нижний
и верхний
квантиль назы-
вается двусторонним α-квантилем. Двусторонний α-квантиль задает интервал, в
который рассматриваемая случайная величина попадает с заданной вероятностью α.
Допустим, нужно найти интервал, в который случайное значение попада-
ет с вероятностью 0.5 (50 %). Тогда ищется нижний и верхний квантили
,
интервал между ними – и будет искомым интервалом.
В рассматриваемом случае такой интервал равен [33,23; 37,81]. То есть
вероятность того, что все значения случайной величины находится в этом интервале, равна 0.5.
В статистике широко используются специальные квантили
процентили x
квартили x
медиана x
1/2
p/4
, где p = 1, 2, 3, ... 99
p/100
, где p = 1, 2, 3
То есть медиану для непрерывных числовых данных, описываемых нор-
мальным распределением, можно найти как 0.5 – квантилем
Пример вычисления квантилей с помощью функций Excel приведен на
Рис. 14. Как видно среднее значение и значение медианы, вычисленной как
квантиль, совпадают с достаточной точностью.
Доверительный интервал – интервал, который покрывает неизвестный
,
параметр с заданной надёжностью. Другими словами – это интервал, в котором
окажется случайная величина с заданной надёжностью.
Рис. 14. Вычисление квантилей с помощью функций Excel
Вычисление процентилей – быстрый способ разобраться в том, насколько
распределение близко к нормальному. Напомним, что для нормального распределения 95 % значений заключено в пределах двух стандартных отклонений от
среднего и 68 % – в пределах одного стандартного отклонения, медиана совпа-
29

дает со средним. Соответствие между процентилями и числом стандартных от-
Процентили
Отклонения от среднего
2.5
16
50 84
+
97.5
+
клонений от среднего приведены в таблице 1 и на рис. 15.
Таблица 1. Соответствие между процентилями и стандартными отклонениями от среднего
Рис. 15. Соответствие между процентилями и стандартными отклонениями от среднего
Если соответствие между процентилями и отклонениями от среднего не
слишком отличается от приведенного, то распределение близко к нормальному
и его можно описать при помощи среднего и стандартного отклонения.
ИНДУКТИВНАЯ СТАТИСТИКА
Нулевая гипотеза
Цель индуктивного статистического исследования – сформулировать ра-
бочую статистическую гипотезу и затем опровергнуть или подтвердить ее с
помощью одного из критерия.
30
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]
