Добавил:
ivanov666
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз:
Предмет:
Файл:Основы математического моделирования и обработки данных в медицине. Учебно-методическое пособие.pdf
X
- •ЧАСТНОЕ УЧРЕЖДЕНИЕ
- •Медицинский университет «РЕАВИЗ»
- •ВВЕДЕНИЕ
- •Цифровые технологии в медицине
- •Зачем нужна математическая статистика в медицине
- •ОСНОВНЫЕ ПОНЯТИЯ МАТЕМАТИЧЕСКОЙ СТАТИСТИКИ
- •Понятие выборки и генеральной совокупности
- •ОПИСАТЕЛЬНАЯ СТАТИСТИКА. ОСНОВНЫЕ ХАРАКТЕРИСТИКИ
- •Среднее значение
- •Стандартное отклонение и дисперсия
- •Стандартная ошибка
- •Минимум, Максимум, Размах вариации
- •Медиана
- •Математическое ожидание
- •Типы статистического исследования
- •Типы данных и их особенности
- •НОРМАЛЬНОЕ РАСПРЕДЕЛЕНИЕ И ЕГО ХАРАКТЕРИСТИКИ
- •Понятие нормального распределения
- •Функция плотности вероятности и функция распределения
- •Стандартное нормальное распределение
- •Построение графика нормального распределения
- •Квантили нормального распределения
- •ИНДУКТИВНАЯ СТАТИСТИКА
- •Нулевая гипотеза
- •Проверка статистических критериев
- •Доверительные интервалы
- •Гипотеза о генеральной средней нормального распределения
- •Критерий Шапиро-Уилка
- •Числовые данные. t-критерии Стьюдента
- •Случай 1. Несвязные выборки. Генеральные дисперсии неизвестны
- •Случай 2. Связные выборки
- •Расчет t-критерия в Excel
- •Числовые данные. Критерий Манна-Уитни
- •Пример 1. Эффективно ли новое лекарство?
- •Пример 2. Расчет U-статистики в Excel
- •Приложение 1. Таблица значений функции Лапласа
- •Приложение 2. Критические точки распределения Стьюдента
- •Приложение 4. Критические точки критерия Стьюдента
- •Приложение 5. Критические значения U-критерия
- •СПИСОК ЛИТЕРАТУРЫ

Рис. 19. Проверка критерия Шапиро-Уилка в Excel
Категориальные данные.
критерий Пирсона
Критерий
(Хи-квадрат) или критерий Пирсона позволяет сравнить ка-
чественные характеристики, проанализировать частоты и выявить закономерности и тенденции развития испытуемой группы.
Для применения критерия Хи-квадрат необходимо представить данные в
виде таблиц сопряженности.
Пример. Проводится исследование влияния курения на риск развития ар-
териальной гипертонии. Для этого были отобраны две группы исследуемых – в
первую вошли 70 человек, ежедневно выкуривающих не менее 1 пачки сигарет,
во вторую – 80 некурящих такого же возраста. В первой группе у 40 человек
отмечалось повышенное артериальное давление. Во второй – артериальная гипертония наблюдалась у 32 человек. Соответственно, нормальное артериальное
давление в группе курильщиков было у 30 человек (70 – 40 = 30) а в группе
некурящих – у 48 (80 – 32 = 48).
Задача, которая ставится перед исследователем: имеются ли статистиче-
ски значимые различия между частотой лиц с артериальным давлением среди
курящих и некурящих? Ответить на этот вопрос можно, рассчитав критерий хиквадрат Пирсона и сравнив получившееся значение с критическим.
41

Принимаем нулевую гипотезу – отличие между частотой лиц с артери-
Артериальная
Артериальной
Курящие (1)
40
30
70
Некурящие (0)
32
48
80
Всего
72
78
150
Артериальная
Артериальной
Курящие (1)
A
B
A + B
Некурящие (0)
C
D
C + D
Всего
A + C
B + D
A+B+C+D
Исход есть (1)
Исхода нет (0)
Всего
=
(+ )(+ )
A + B + C + D
=
(+ )(B + D)
A + B + C + D
=
(+ C)(C + D)
A + B + C + D
=
(C + D)(B + D)
A + B + C + D
Всего
А + С
В + D
A+B+C+D
альным давлением среди курящих и некурящих есть.
Заполненная таблица сопряжённости имеет вид:
гипертония есть (1)
гипертонии нет (0)
Всего
В таблице сопряженности каждая строчка соответствует определенной
группе исследуемых. Столбцы – показывают число лиц с артериальной гипертонией или с нормальным артериальным давлением.
Обозначим каждую ячейку в таблице сопряженности буквой:
гипертония есть (1)
гипертонии нет (0)
Всего
Рассчитываем ожидаемое количество наблюдений для каждой из ячеек
таблицы сопряженности (при условии справедливости нулевой гипотезы об отсутствии взаимосвязи) путем перемножения сумм рядов и столбцов с последующим делением полученного произведения на общее число наблюдений. Общий вид таблицы ожидаемых значений представлен ниже:
Фактор риска есть (1)
Фактор риска отсутствует (0)
A + В
С + D
Значение
критерия рассчитывается по формуле:
(
)
+
(
=
(
)
+
(
)
+
)
.
Определяем число степеней свободы
где r и с – количество групп и категорий.
f
×
(
=
1)(1
42
)
,

В рассматриваемом случае r = 2 и с = 2 и, соответственно, f
Сравниваем значение критерия
с критическим значением при числе
степеней свободы f по таблице (см. приложение. Критические точки
×
= 1.
распре-
деления).
В рассматриваемом примере
Критическое значение
свобод 1, равно 3.841. Так как
= 4.396.
критерия при уровне значимости 0.05 и числе
>
, то зависимость частоты артериальной
гипертонии от курения статистически значима.
Отметим, что
критерий можно использовать и с большим, чем два, ко-
личеством групп и категорий.
Числовые данные. t-критерии Стьюдента
Критерий t Стьюдента направлен на оценку различий величин средних
и двух выборок x и y. Выборки должны быть распределены по нормальному
закону, поэтому, прежде чем применять использовать критерий Стьюдента,
надо убедиться в нормальности выборок, используя, например, критерий Шапиро-Уилка. Критерий Стьюдента может быть использован для сопоставления
средних у связных и несвязных выборок, причем выборки могут быть не равны
по величине.
Случай 1. Несвязные выборки. Генеральные дисперсии неизвестны
Пусть имеем две несвязные выборки из генеральной совокупности
[
борок равны
…
и
. Генеральные дисперсии выборок неизвестны, но предпо-
]
и
[
…
]
, несмещенные дисперсии вы-
лагаются одинаковыми.
=
Нулевая гипотеза формулируется как H0:
(математическое ожи-
дание генеральных выборок X и Y равны.
Конкурирующие гипотезы могут быть сформулированы следующим об-
разом: H1:
Для расчета t
, H1: > или H1: <
-статистики используют формулу:
.
=
,
где , – средние соответствующих выборок; определяется по формуле:
+
= (
1)
+ (1)
43
(
+
.
)

Если выборки одного размера (= = ), то выражение для Sd при-
нимает вид
1
.
=
+
Число степеней свободы вычисляется следующим образом:
Значение
=
сравнивается с величиной
+ .
, которая зависит от числа
степеней свободы и уровня значимости . Значение
или определить по таблице (см. приложение 4).
При конкурирующей гипотезе H1:
рительный интервал и вычисляется
|
Если
Если
|
|
|
<
>
(, ) – нулевая гипотеза принимается.
(, ) – нулевая гипотеза отвергается.
(, ).
строится двусторонний дове-
точку
При конкурирующей гипотезе H1:
(, ) =
( , ).
>
находят правую критическую
можно или вычислить,
Если
Если
<
>
(, ) – нулевая гипотеза принимается.
(, ) – нулевая гипотеза отвергается.
<
находят левую критическую
точку
При конкурирующей гипотезе H1:
(, ) =
Если
Если
>
<
( , ).
– нулевая гипотеза принимается.
– нулевая гипотеза отвергается.
Пример. Измерения пульса 10 больных, проведенные после некоторой
процедуры, и 12 больных контрольной группы дали следующие результаты:
для первой группы = 70 уд/мин, = 68 уд/мин, несмещенные оценки дис-
персий равны
= 9 уд/мин,
= 4 уд/мин. При уровне значимости α = 0.05
проверить гипотезу о равенстве средних значений пульса больных, принявших
процедуру, и больных, ее не принимавших.
Имеем гипотезу H0:
= . Конкурирующая гипотеза H1:
.
Вычисляем значение t-критерия:
44

= (1)
(
=
+ (1)
(10 1)9 + (1)4
+
(
+
)
10 +
)
10 (10 +
=
= 11.
)
=
70 68
=
11.
= 0.167
Число степеней свободы = + = 10 + =
По таблице или вычисляем
|
Так как
|
<
– нулевая гипотеза принимается. То есть с вероят-
(0.05, ) = .09
ностью 0.05 средние значения пульса больных в обоих группах равны.
Случай 2. Связные выборки
Пусть имеем две связные выборки из генеральной совокупности
[
…
]
и
[
…
]
. Выборки должны быть тако-
вы, чтобы имелось по два значения изучаемого признака для каждого объекта
(при повторных измерениях) или для каждой пары связанных (зависимых) объектов. Измерения по обеим выборкам должны быть сопоставимы, то есть
должны использоваться аналогичные методы получения и обработки данных,
одинаковые единицы измерения и т.д.
Нулевая и возможные конкурирующие гипотезы аналогичны тем, что
описаны в предыдущем параграфе для несвязных выборок.
Для расчета t-статистики используют формулу:
=
где – разность между двумя выборками,
1
=
=
=
(1
– среднее значение этой разности.
1
)
;
.
(
)
Число степеней свободы = 1.
Пример: Психолог предположил, что в результате научения время реше-
ния эквивалентных задач “игры в 5”, т. е. имеющих один и тот же алгоритм решения, будет значимо уменьшаться при уровне значимости α = 0.05. Для проверки гипотезы у восьми испытуемых сравнивалось время решения (в минутах)
первой и третьей задач.
Нулевая гипотеза H0:
= . Конкурирующая гипотеза H1: >
45
.

№ испытуемых
1 2 3 4 5 6 7
8
1 задача (x)
4
3,5
4,1
5,5
4,6 6 5,1
4,3
3 задача (y)
3 3 3,8
2,1
4,9
5,3
3,1
2,7
d = x – y
1.0
0.5
0.3
3.4
-0.3
0.7
2.0
1.6
d2
1.0
0.25
0.09
11.56
0.09
0.49
4.0
2.56
Вычисляем t-статистику.
=
Определяем критическое значение t-критерия. Так как конкурирующая
гипотеза H1:
Число степеней свободы = 1 = 7. Находим в таблице (для
)
=
=
1.15
0.41
9.
8
.04
= .80.
= 1.15;
(
(
8
8 1
9.
)
)
= 0.41;
1
(
=
=
>
, то строим правостороннюю критическую область.
(1
)
=
= 0., ):
Оценивая результат, делаем вывод, так как
(0., 7) = ,37.
>
(0.05, 7) , то нуле-
вая гипотеза о равенстве средний отклоняется, и с уровнем значимости 0.05
принимается конкурирующая гипотеза – время решения эквивалентных задач
значимо уменьшается.
Расчет t-критерия в Excel
Решение задачи о времени решения эквивалентных задач показано на Рис. 20.
Функция СТЬЮДЕНТ.ОБР(вероятность; степень_свободы) возвращает
левое значение обратного распределения Стьюдента, соответствующее вероятности ‘уровень_значимости’ и заданной степени свободы. Чтобы получить правое значение, необходимо принять в первом параметре этой функции задать вероятность, равную (1 – уровень_значимости).
Функция СТЬЮДЕНТ.ТЕСТ(массив1;массив2;хвосты;тип) – возвращает
вероятность p-значение , соответствующую t-тесту Стьюдента. Если p-значение
меньше заданного уровня значимости, то нулевая гипотеза отвергается в пользу
альтернативной.
Аргументы функции СТЬЮДЕНТ.ТЕСТ:
массив1 – первый диапазон числовых значений.
массив2 – второй диапазон числовых значений.
46

хвосты – число хвостов распределения. Если значение этого аргумента
равно 1, используется одностороннее распределение. Если значение этого аргумента равно 2, используется двустороннее распределение.
тип – числовое значение, определяющее вид выполняемого t-теста. Мо-
жет использоваться одно из следующих значений: 1 – связанные выборки;
2 – независимые выборки с равными дисперсиями; 3 – независимые выборки с
неравными дисперсиями.
Рис. 20. Расчет t-критерия в Excel
Числовые данные. Критерий Манна-Уитни
U-критерий Манна-Уитни (Mann-Whitney U test) – непараметрический
статистический критерий, используемый для оценки различий между двумя
выборками по признаку, измеренному в количественной или порядковой шкале.
U-критерий является ранговым, поэтому он не требует нормального распределения и, соответственно, не требует предварительной проверки на нормальность генеральной совокупности.
U-критерий определяет, достаточно ли мала зона перекрещивающихся
значений между двумя выборками. Чем меньше значение критерия, тем вероятнее, что различия между значениями параметра в выборках достоверны.
Ограничения применимости критерия:
• Выборки для этого критерия должны быть простыми – случайными,
однородными и независимыми.
47

• В каждой из выборок должно быть не менее 3 значений признака. До-
пускается, чтобы в одной выборке было два значения, но во второй тогда не
менее пяти.
• В выборочных данных не должно быть совпадающих значений (все
числа – разные) или таких совпадений должно быть очень мало (до 10).
Другие названия критерия Манна-Уитни: критерий Манна-Уитни-
Уилкоксона (Mann-Whitney-Wilcoxon, MWW), критерий суммы рангов Уилкоксона (Wilcoxon rank-sum test) или критерий Уилкоксона-Манна-Уитни
(Wilcoxon-Mann-Whitney test, WMW).
Пример задачи, когда может использоваться критерий Манна-Уитни:
пусть первая выборка – это пациенты, которых лечили препаратом А. Вторая
выборка – пациенты, которых лечили препаратом Б. Значения в выборках – это
некоторая характеристика эффективности лечения (биохимические показатель
крови и мочи, температура через определенное количестве дней после начала
лечения, срок выздоровления, количество дней в стационаре, и т.д.). Требуется
выяснить, имеется ли значимое различие эффективности препаратов А и Б, или
различия являются чисто случайными и объясняются естественной дисперсией
выбранной характеристики.
Нулевая гипотеза H0 состоит в том, что отличий между совокупностями,
которым принадлежат выборки, нет. Альтернативная гипотеза H1 – отличия
между совокупностями, которым принадлежат выборки, есть.
Алгоритм применения U-критерия Манна-Уитни заключается в следую-
щем.
Пусть имеем две случайные, однородные и независимые выборки
[
…
1 шаг. Составляем ряд из двух выборок:
]
и
[
…
]
.
[
…
]
. Ранжи-
руем элементы этого ряда, расставив его элементы по степени нарастания признака и приписав меньшему значению меньший ранг. Если встречаются одинаковые значения, то используем среднее. Общее количество рангов получается
равным N = n + m.
2 шаг. Разделяем единый ранжированный ряд на два, состоящие из эле-
ментов первой и второй выборок соответственно. Подсчитываем отдельно сумму рангов R
гов R
, пришедшихся на долю элементов второй выборки.
2
, пришедшихся на долю элементов первой выборки, и сумму ран-
1
3 шаг. Вычисляем следующие параметры:
= +
48
(
+ 1
)
–

Если все сделано правильно, то будет выполняться равенство
4 шаг. Минимальное значение из
Мана-Уитни:
5 шаг. По таблице для избранного уровня статистической значимости α
= +
+ =
U = (
(
+ 1
и
)
+
и будет значением U-статистики
,
)
определить критическое значение критерия U
6 шаг. Сравниваем U с U
Если U > U
, то нулевая гипотеза об отсутствии различий между выбор-
и делаем вывод:
для данных n и m.
ками принимается с уровнем значимости α.
Если U < U
, то нулевая гипотеза об отсутствии различий между выбор-
ками отклоняется с уровнем значимости α. И принимается альтернативная
гипотеза о статистически достоверном различии между выборками с уровнем
значимости α.
Важные свойства U-статистики:
Всегда выполняется равенство
+ = .
Если n
и n2 достаточно велики, то распределение U-статистики прибли-
1
женно к нормальному с характеристиками:
+ 1
)
=
(
=
+
z-статистика может быть вычислена с помощью формулы
–
=
для любых n1 и n2 может быть вычислена по формуле:
крит
U
= + ()– 0.5,
– функция, возвращающая обратное значение стандартного нормально-
где
U
го распределения.
Пример 1. Эффективно ли новое лекарство?
Рассмотрим пример применения U-критерия Манна-Уитни.
Разработано новое лекарство для предотвращения панических атак. Необ-
ходимо узнать, эффективно ли новое лекарство в предотвращении панических
атак. В общей сложности 12 пациентов случайным образом были разделены на
две группы по 6 человек для приема нового препарата или плацебо. Затем пациенты записывают, сколько панических атак у них было в течение одного месяца.
49

Лекарство
3 5 1 4 3
5
Плацебо
4 8 6 2 1
9
Выборка
Л П П Л Л П Л Л Л П П П Единый ряд
1 1 2 3 3 4 4 5 5 6 8 9 → 1 2 3 4 5 6 7 8 9 10
11
12
=(1+2)/2
=(4+5)/2
=(6+7)/2
=(8+9)/2
Ранг
1,5
1,5
3,0
4,5
4,5
6,5
6,5
8,5
8,5
10,0
11,0
12,0
Используя U-критерий Манна-Уитни можно определить, есть ли разница
в количестве панических атак у пациентов в группе плацебо по сравнению с
группой нового препарата. Уровень значимости 0.05.
Решение.
1. Формулируем гипотезы
H0: две совокупности, которым принадлежат выборки, равны
H1: две совокупности, которым принадлежат выборки, не равны
2. Записали обе выборки в единый ряд, расставив значения по возраста-
нию. Каждое значение ранжируем.
Процесс ранжирования заключается в следующем. Каждому значению
присваивается целое число, начиная от 1. Затем, если значения совпадают, то
им присваивается ранг, равный среднему значению чисел, присвоенный ранее.
Если значение уникально, то это присвоенное число и будет рангом.
3. Вычисляем суммы рангов выборок.
R1 = сумма выборки “Лекарство” = 1.5 + 4.5 + 4.5 + 6.5 + 8.5 + 8.5 = 34
R2 = сумма выборки “Плацебо” = 1.5 + 3 + 6.5 + 10 + 11 + 12 = 44
4. Вычисляем значения статистики:
= 6(6) + 6(6+1)/2 – 34 = 23
U
1
= 6(6) + 6(6+1)/2 – 44 = 13
U
2
U = min (U
, U2) = 13
1
5. По таблице (см. приложение 5) находим критическое значение U-теста
Манна-Уитни для n
= 5.
U
крит
6. Делаем вывод. Так как U > U
= 6, n2 = 6, α = 0.05.
1
, то принимается нулевая гипотеза –
крит
генеральные совокупности пациентов, принимавших лекарство, и пациентов,
принимавших плацебо, равны с уровнем значимости 0.05. Эффективность нового препарата не подтверждена.
50
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]
