Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:
Основы математического моделирования и обработки данных в медицине. Учебно-методическое пособие.pdf
Скачиваний:
0
Добавлен:
07.09.2026
Размер:
1 Мб
Скачать
☆
Рис. 19. Проверка критерия Шапиро-Уилка в Excel
Категориальные данные.
критерий Пирсона
Критерий
(Хи-квадрат) или критерий Пирсона позволяет сравнить ка-
чественные характеристики, проанализировать частоты и выявить закономер­ности и тенденции развития испытуемой группы.
Для применения критерия Хи-квадрат необходимо представить данные в
виде таблиц сопряженности.
Пример. Проводится исследование влияния курения на риск развития ар-
териальной гипертонии. Для этого были отобраны две группы исследуемых – в первую вошли 70 человек, ежедневно выкуривающих не менее 1 пачки сигарет, во вторую – 80 некурящих такого же возраста. В первой группе у 40 человек отмечалось повышенное артериальное давление. Во второй – артериальная ги­пертония наблюдалась у 32 человек. Соответственно, нормальное артериальное давление в группе курильщиков было у 30 человек (70 – 40 = 30) а в группе некурящих – у 48 (80 – 32 = 48).
Задача, которая ставится перед исследователем: имеются ли статистиче-
ски значимые различия между частотой лиц с артериальным давлением среди курящих и некурящих? Ответить на этот вопрос можно, рассчитав критерий хи­квадрат Пирсона и сравнив получившееся значение с критическим.
41
Принимаем нулевую гипотезу – отличие между частотой лиц с артери-
Артериальная
Артериальной
Курящие (1)
40
30
70
Некурящие (0)
32
48
80
Всего
72
78
150
Артериальная
Артериальной
Курящие (1)
A
B
A + B
Некурящие (0)
C
D
C + D
Всего
A + C
B + D
A+B+C+D
Исход есть (1)
Исхода нет (0)
Всего

=
(+ )(+ )
A + B + C + D

=
(+ )(B + D)
A + B + C + D

=
(+ C)(C + D)
A + B + C + D

=
(C + D)(B + D)
A + B + C + D
Всего
А + С
В + D
A+B+C+D
альным давлением среди курящих и некурящих есть.
Заполненная таблица сопряжённости имеет вид:
гипертония есть (1)
гипертонии нет (0)
Всего
В таблице сопряженности каждая строчка соответствует определенной
группе исследуемых. Столбцы – показывают число лиц с артериальной гипер­тонией или с нормальным артериальным давлением.
Обозначим каждую ячейку в таблице сопряженности буквой:
гипертония есть (1)
гипертонии нет (0)
Всего
Рассчитываем ожидаемое количество наблюдений для каждой из ячеек
таблицы сопряженности (при условии справедливости нулевой гипотезы об от­сутствии взаимосвязи) путем перемножения сумм рядов и столбцов с последу­ющим делением полученного произведения на общее число наблюдений. Об­щий вид таблицы ожидаемых значений представлен ниже:
Фактор риска есть (1)
Фактор риска отсутствует (0)
A + В
С + D
Значение
критерия рассчитывается по формуле:


(
)

+
(

=


(
)

+


(
)

+


)
.
Определяем число степеней свободы
где r и с – количество групп и категорий.
f
×
(
=
1)(1
42
)
,
В рассматриваемом случае r = 2 и с = 2 и, соответственно, f
Сравниваем значение критерия
с критическим значением при числе
степеней свободы f по таблице (см. приложение. Критические точки
×
= 1.
распре-
деления).
В рассматриваемом примере Критическое значение
свобод 1, равно 3.841. Так как

= 4.396.
критерия при уровне значимости 0.05 и числе
>
, то зависимость частоты артериальной

гипертонии от курения статистически значима.
Отметим, что
критерий можно использовать и с большим, чем два, ко-
личеством групп и категорий.

Числовые данные. t-критерии Стьюдента

Критерий t Стьюдента направлен на оценку различий величин средних 
и  двух выборок x и y. Выборки должны быть распределены по нормальному
закону, поэтому, прежде чем применять использовать критерий Стьюдента, надо убедиться в нормальности выборок, используя, например, критерий Ша­пиро-Уилка. Критерий Стьюдента может быть использован для сопоставления средних у связных и несвязных выборок, причем выборки могут быть не равны по величине.
Случай 1. Несвязные выборки. Генеральные дисперсии неизвестны
Пусть имеем две несвязные выборки из генеральной совокупности
[
борок равны
…
и

. Генеральные дисперсии выборок неизвестны, но предпо-
]
и
[
…
]
, несмещенные дисперсии вы-

лагаются одинаковыми.
=
Нулевая гипотеза формулируется как H0: 
(математическое ожи-
дание генеральных выборок X и Y равны.
Конкурирующие гипотезы могут быть сформулированы следующим об-
разом: H1:
Для расчета t
, H1: >  или H1: < 
-статистики используют формулу:
.


=
,

где ,  – средние соответствующих выборок;  определяется по формуле:
+
= (
1)
+ (1)
43

(
+ 
.
)
Если выборки одного размера (= = ), то выражение для Sd при-
нимает вид
1
.
= 
+
Число степеней свободы вычисляется следующим образом:
Значение
=
сравнивается с величиной

+ .
, которая зависит от числа

степеней свободы и уровня значимости . Значение
или определить по таблице (см. приложение 4).

При конкурирующей гипотезе H1:
рительный интервал и вычисляется
|
Если Если
|
|
 
 
|
< >
(, ) – нулевая гипотеза принимается.
 
(, ) – нулевая гипотеза отвергается.
 
 
(, ).
строится двусторонний дове-
точку
При конкурирующей гипотезе H1:
(, ) = 

( , ).
 
>
находят правую критическую
можно или вычислить,

Если Если
 
< >
(, ) – нулевая гипотеза принимается.
 
(, ) – нулевая гипотеза отвергается.
 
<
находят левую критическую
точку
При конкурирующей гипотезе H1:
(, ) = 

Если Если
 
> <
 
( , ).
 
– нулевая гипотеза принимается. – нулевая гипотеза отвергается.
Пример. Измерения пульса 10 больных, проведенные после некоторой
процедуры, и 12 больных контрольной группы дали следующие результаты:
для первой группы = 70 уд/мин, = 68 уд/мин, несмещенные оценки дис- персий равны
= 9 уд/мин,
= 4 уд/мин. При уровне значимости α = 0.05
проверить гипотезу о равенстве средних значений пульса больных, принявших процедуру, и больных, ее не принимавших.
Имеем гипотезу H0:
= . Конкурирующая гипотеза H1: 
.
Вычисляем значение t-критерия:
44
= (1)
(
=
+ (1)

(10 1)9 + (1)4
+
(
+ 
)
10 + 
)
10 (10 + 
=
= 11.
)


=

70 68
=
11.
= 0.167
Число степеней свободы = + = 10 + =  По таблице или вычисляем
|
Так как
|

<
– нулевая гипотеза принимается. То есть с вероят-
 
(0.05, ) = .09
 
ностью 0.05 средние значения пульса больных в обоих группах равны.
Случай 2. Связные выборки
Пусть имеем две связные выборки из генеральной совокупности
[
…

]
и
[
…
]
. Выборки должны быть тако-

вы, чтобы имелось по два значения изучаемого признака для каждого объекта (при повторных измерениях) или для каждой пары связанных (зависимых) объ­ектов. Измерения по обеим выборкам должны быть сопоставимы, то есть должны использоваться аналогичные методы получения и обработки данных, одинаковые единицы измерения и т.д.
Нулевая и возможные конкурирующие гипотезы аналогичны тем, что
описаны в предыдущем параграфе для несвязных выборок.
Для расчета t-статистики используют формулу:
=

где  – разность между двумя выборками,
1
=
=



=
(1

– среднее значение этой разности.
1
)
;
.
(


)
Число степеней свободы = 1.
Пример: Психолог предположил, что в результате научения время реше-
ния эквивалентных задач “игры в 5”, т. е. имеющих один и тот же алгоритм ре­шения, будет значимо уменьшаться при уровне значимости α = 0.05. Для про­верки гипотезы у восьми испытуемых сравнивалось время решения (в минутах) первой и третьей задач.
Нулевая гипотеза H0:
= . Конкурирующая гипотеза H1: >
45
.
№ испытуемых
1 2 3 4 5 6 7
8
1 задача (x)
4
3,5
4,1
5,5
4,6 6 5,1
4,3
3 задача (y)
3 3 3,8
2,1
4,9
5,3
3,1
2,7
d = x – y
1.0
0.5
0.3
3.4
-0.3
0.7
2.0
1.6
d2
1.0
0.25
0.09
11.56
0.09
0.49
4.0
2.56
Вычисляем t-статистику.
=
Определяем критическое значение t-критерия. Так как конкурирующая
гипотеза H1:
Число степеней свободы = 1 = 7. Находим в таблице (для
)
=
=
1.15
0.41
9.
8
.04
= .80.
= 1.15;
(
(
8
8 1
9.
)
)
= 0.41;
1
(
=


=

>
, то строим правостороннюю критическую область.
(1


)
=
= 0.,    ):
Оценивая результат, делаем вывод, так как
(0., 7) = ,37.
 
>

 
(0.05, 7) , то нуле-
вая гипотеза о равенстве средний отклоняется, и с уровнем значимости 0.05 принимается конкурирующая гипотеза – время решения эквивалентных задач значимо уменьшается.
Расчет t-критерия в Excel
Решение задачи о времени решения эквивалентных задач показано на Рис. 20. Функция СТЬЮДЕНТ.ОБР(вероятность; степень_свободы) возвращает
левое значение обратного распределения Стьюдента, соответствующее вероят­ности ‘уровень_значимости’ и заданной степени свободы. Чтобы получить пра­вое значение, необходимо принять в первом параметре этой функции задать ве­роятность, равную (1 – уровень_значимости).
Функция СТЬЮДЕНТ.ТЕСТ(массив1;массив2;хвосты;тип) – возвращает
вероятность p-значение , соответствующую t-тесту Стьюдента. Если p-значение меньше заданного уровня значимости, то нулевая гипотеза отвергается в пользу альтернативной.
Аргументы функции СТЬЮДЕНТ.ТЕСТ: массив1 – первый диапазон числовых значений. массив2 – второй диапазон числовых значений.
46
хвосты – число хвостов распределения. Если значение этого аргумента
равно 1, используется одностороннее распределение. Если значение этого ар­гумента равно 2, используется двустороннее распределение.
тип – числовое значение, определяющее вид выполняемого t-теста. Мо-
жет использоваться одно из следующих значений: 1 – связанные выборки; 2 – независимые выборки с равными дисперсиями; 3 – независимые выборки с неравными дисперсиями.
Рис. 20. Расчет t-критерия в Excel

Числовые данные. Критерий Манна-Уитни

U-критерий Манна-Уитни (Mann-Whitney U test) – непараметрический
статистический критерий, используемый для оценки различий между двумя выборками по признаку, измеренному в количественной или порядковой шкале. U-критерий является ранговым, поэтому он не требует нормального распреде­ления и, соответственно, не требует предварительной проверки на нормаль­ность генеральной совокупности.
U-критерий определяет, достаточно ли мала зона перекрещивающихся
значений между двумя выборками. Чем меньше значение критерия, тем вероят­нее, что различия между значениями параметра в выборках достоверны.
Ограничения применимости критерия:
• Выборки для этого критерия должны быть простыми – случайными,
однородными и независимыми.
47
• В каждой из выборок должно быть не менее 3 значений признака. До-
пускается, чтобы в одной выборке было два значения, но во второй тогда не менее пяти.
• В выборочных данных не должно быть совпадающих значений (все
числа – разные) или таких совпадений должно быть очень мало (до 10).
Другие названия критерия Манна-Уитни: критерий Манна-Уитни-
Уилкоксона (Mann-Whitney-Wilcoxon, MWW), критерий суммы рангов Уилкок­сона (Wilcoxon rank-sum test) или критерий Уилкоксона-Манна-Уитни
(Wilcoxon-Mann-Whitney test, WMW).
Пример задачи, когда может использоваться критерий Манна-Уитни:
пусть первая выборка – это пациенты, которых лечили препаратом А. Вторая выборка – пациенты, которых лечили препаратом Б. Значения в выборках – это некоторая характеристика эффективности лечения (биохимические показатель крови и мочи, температура через определенное количестве дней после начала лечения, срок выздоровления, количество дней в стационаре, и т.д.). Требуется выяснить, имеется ли значимое различие эффективности препаратов А и Б, или различия являются чисто случайными и объясняются естественной дисперсией выбранной характеристики.
Нулевая гипотеза H0 состоит в том, что отличий между совокупностями,
которым принадлежат выборки, нет. Альтернативная гипотеза H1 – отличия между совокупностями, которым принадлежат выборки, есть.
Алгоритм применения U-критерия Манна-Уитни заключается в следую-
щем.
Пусть имеем две случайные, однородные и независимые выборки
[
…
1 шаг. Составляем ряд из двух выборок:
]
и

[
…
]
.

[
…

]
. Ранжи-
руем элементы этого ряда, расставив его элементы по степени нарастания при­знака и приписав меньшему значению меньший ранг. Если встречаются одина­ковые значения, то используем среднее. Общее количество рангов получается равным N = n + m.
2 шаг. Разделяем единый ранжированный ряд на два, состоящие из эле-
ментов первой и второй выборок соответственно. Подсчитываем отдельно сум­му рангов R гов R
, пришедшихся на долю элементов второй выборки.
2
, пришедшихся на долю элементов первой выборки, и сумму ран-
1
3 шаг. Вычисляем следующие параметры:
= +

48
(
+ 1
)
–
Если все сделано правильно, то будет выполняться равенство
4 шаг. Минимальное значение из
Мана-Уитни:
5 шаг. По таблице для избранного уровня статистической значимости α
= +
+ = 
U = (

(
+ 1
и
)
+
и будет значением U-статистики
,
)
определить критическое значение критерия U
6 шаг. Сравниваем U с U Если U > U
, то нулевая гипотеза об отсутствии различий между выбор-

и делаем вывод:

для данных n и m.

ками принимается с уровнем значимости α.
Если U < U
, то нулевая гипотеза об отсутствии различий между выбор-

ками отклоняется с уровнем значимости α. И принимается альтернативная гипотеза о статистически достоверном различии между выборками с уровнем значимости α.
Важные свойства U-статистики: Всегда выполняется равенство
+ = .
Если n
и n2 достаточно велики, то распределение U-статистики прибли-
1
женно к нормальному с характеристиками:
+ 1
)
=

(
=

+

z-статистика может быть вычислена с помощью формулы
–
=
для любых n1 и n2 может быть вычислена по формуле:
крит
U
= + ()– 0.5,

– функция, возвращающая обратное значение стандартного нормально-
где
U

го распределения.
Пример 1. Эффективно ли новое лекарство?
Рассмотрим пример применения U-критерия Манна-Уитни. Разработано новое лекарство для предотвращения панических атак. Необ-
ходимо узнать, эффективно ли новое лекарство в предотвращении панических атак. В общей сложности 12 пациентов случайным образом были разделены на две группы по 6 человек для приема нового препарата или плацебо. Затем пациен­ты записывают, сколько панических атак у них было в течение одного месяца.
49
Лекарство
3 5 1 4 3
5
Плацебо
4 8 6 2 1
9
Выборка
Л П П Л Л П Л Л Л П П П Единый ряд
1 1 2 3 3 4 4 5 5 6 8 9 → 1 2 3 4 5 6 7 8 9 10
11
12
=(1+2)/2
=(4+5)/2
=(6+7)/2
=(8+9)/2
Ранг
1,5
1,5
3,0
4,5
4,5
6,5
6,5
8,5
8,5
10,0
11,0
12,0
Используя U-критерий Манна-Уитни можно определить, есть ли разница
в количестве панических атак у пациентов в группе плацебо по сравнению с группой нового препарата. Уровень значимости 0.05.
Решение.
1. Формулируем гипотезы H0: две совокупности, которым принадлежат выборки, равны
H1: две совокупности, которым принадлежат выборки, не равны
2. Записали обе выборки в единый ряд, расставив значения по возраста-
нию. Каждое значение ранжируем.
Процесс ранжирования заключается в следующем. Каждому значению
присваивается целое число, начиная от 1. Затем, если значения совпадают, то им присваивается ранг, равный среднему значению чисел, присвоенный ранее. Если значение уникально, то это присвоенное число и будет рангом.
3. Вычисляем суммы рангов выборок. R1 = сумма выборки “Лекарство” = 1.5 + 4.5 + 4.5 + 6.5 + 8.5 + 8.5 = 34 R2 = сумма выборки “Плацебо” = 1.5 + 3 + 6.5 + 10 + 11 + 12 = 44
4. Вычисляем значения статистики:
= 6(6) + 6(6+1)/2 – 34 = 23
U
1
= 6(6) + 6(6+1)/2 – 44 = 13
U
2
U = min (U
, U2) = 13
1
5. По таблице (см. приложение 5) находим критическое значение U-теста
Манна-Уитни для n
= 5.
U
крит
6. Делаем вывод. Так как U > U
= 6, n2 = 6, α = 0.05.
1
, то принимается нулевая гипотеза –
крит
генеральные совокупности пациентов, принимавших лекарство, и пациентов, принимавших плацебо, равны с уровнем значимости 0.05. Эффективность но­вого препарата не подтверждена.
50
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]