Добавил:
ivanov666
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз:
Предмет:
Файл:Основы математического моделирования и обработки данных в медицине. Учебно-методическое пособие.pdf
X
- •ЧАСТНОЕ УЧРЕЖДЕНИЕ
- •Медицинский университет «РЕАВИЗ»
- •ВВЕДЕНИЕ
- •Цифровые технологии в медицине
- •Зачем нужна математическая статистика в медицине
- •ОСНОВНЫЕ ПОНЯТИЯ МАТЕМАТИЧЕСКОЙ СТАТИСТИКИ
- •Понятие выборки и генеральной совокупности
- •ОПИСАТЕЛЬНАЯ СТАТИСТИКА. ОСНОВНЫЕ ХАРАКТЕРИСТИКИ
- •Среднее значение
- •Стандартное отклонение и дисперсия
- •Стандартная ошибка
- •Минимум, Максимум, Размах вариации
- •Медиана
- •Математическое ожидание
- •Типы статистического исследования
- •Типы данных и их особенности
- •НОРМАЛЬНОЕ РАСПРЕДЕЛЕНИЕ И ЕГО ХАРАКТЕРИСТИКИ
- •Понятие нормального распределения
- •Функция плотности вероятности и функция распределения
- •Стандартное нормальное распределение
- •Построение графика нормального распределения
- •Квантили нормального распределения
- •ИНДУКТИВНАЯ СТАТИСТИКА
- •Нулевая гипотеза
- •Проверка статистических критериев
- •Доверительные интервалы
- •Гипотеза о генеральной средней нормального распределения
- •Критерий Шапиро-Уилка
- •Числовые данные. t-критерии Стьюдента
- •Случай 1. Несвязные выборки. Генеральные дисперсии неизвестны
- •Случай 2. Связные выборки
- •Расчет t-критерия в Excel
- •Числовые данные. Критерий Манна-Уитни
- •Пример 1. Эффективно ли новое лекарство?
- •Пример 2. Расчет U-статистики в Excel
- •Приложение 1. Таблица значений функции Лапласа
- •Приложение 2. Критические точки распределения Стьюдента
- •Приложение 4. Критические точки критерия Стьюдента
- •Приложение 5. Критические значения U-критерия
- •СПИСОК ЛИТЕРАТУРЫ

Репрезентативность выборки – это свойство выборки корректно отра-
жать генеральную совокупность. Одна и та же выборка может быть репрезентативной и нерепрезентативной для разных генеральных совокупностей.
Пример:
• Выборка, целиком состоящая из всех жителей города, имеющих выс-
шее образование, не репрезентирует все население этого города.
• Выборка из получивших вакцину от какого-либо заболевания и забо-
левших граждан не репрезентирует всех заболевших от этого заболевания.
При этом указанные выборки при определенно поставленных целях ста-
тистического исследования могут отлично репрезентировать жителейавтовладельцев, вакцинировавшихся граждан и т.д.
Важно понимать, что репрезентативность выборки и ошибка выборки –
разные явления. Репрезентативность, в отличие от ошибки, никак не зависит от
размера выборки. Как бы мы ни увеличивали количество обследованных пациентов, поставивших вакцину, мы не сможем ничего сказать о тех пациентах, кто
не привился.
Если данные, получаемые на выборке, существенно отличаются от ис-
тинных данных генеральной совокупности, то имеет место ошибка выборки.
Ошибка выборки может быть статистической и систематической. Стати-
стическая ошибка зависит от размера выборки. В случае статистической
ошибки выборки для ее уменьшения достаточно увеличить размер выборки.
Систематическая ошибка возникает в результате различных причин,
оказывающих влияние на исследование, и на практике оценить ее бывает достаточно проблематично.
Примеры систематических ошибок:
• Использование любых вероятностных выборок занижает долю людей с
высоким доходом, ведущих активный образ жизни. Происходит это в силу того,
что таких людей гораздо сложней застать в каком-либо определенном месте
(например, дома).
• Проблема респондентов, отказывающихся принимать участие в иссле-
дованиях, например, отказ проходить тесты, или принимающих участие формально.
По способу формирования выборки делятся на:
• случайные (вероятностные);
• неслучайные (вероятностные).
11

Вероятностные выборки:
• Случайная выборка (простой случайный отбор)
Такая выборка предполагает однородность генеральной совокупности,
одинаковую вероятность доступности всех элементов, наличие полного списка
всех элементов. При отборе элементов, как правило, используется таблица случайных чисел.
• Механическая (систематическая) выборка
Разновидность случайной выборки, упорядоченная по какому-либо при-
знаку (алфавитный порядок, номер телефона, дата рождения и т.д.). Первый
элемент отбирается случайно, затем, с шагом n отбирается каждый k-й элемент.
Размер генеральной совокупности, при этом N = n*k.
• Стратифицированная (районированная)
Применяется в случае неоднородности генеральной совокупности. Гене-
ральная совокупность разбивается на группы (страты). Например, генеральная
совокупность всех пациентов разбивается по возрасту, полу, по сопутствующим заболеваниям. В каждой страте отбор осуществляется случайным или механическим образом.
• Серийная (гнездовая или кластерная) выборка
При серийной выборке единицами отбора выступают не сами объекты, а
группы (кластеры или гнёзда). Группы отбираются случайным образом. Объекты внутри групп обследуются сплошняком.
Невероятностные выборки – отбор элементов для такой выборки осу-
ществляется по субъективным критериям – доступности, типичности, равного
представительства и т.д.
• Квотная выборка
Изначально выделяется некоторое количество групп объектов (например,
мужчины в возрасте 20–30 лет, 31–45 лет и 46–60 лет; лица с доходом до 30 тысяч рублей, с доходом от 30 до 60 тысяч рублей и с доходом свыше 60 тысяч
рублей) Для каждой группы задается количество объектов, которые должны
быть обследованы. Количество объектов, которые должны попасть в каждую из
групп, задается, чаще всего, либо пропорционально заранее известной доле
группы в генеральной совокупности, либо одинаковым для каждой группы.
Внутри групп объекты отбираются произвольно. Квотные выборки используются в маркетинговых исследованиях достаточно часто.
12

• Метод снежного кома
Выборка строится следующим образом. У каждого респондента, начиная с
первого, просятся контакты его друзей, коллег, знакомых, которые подходили бы
под условия отбора и могли бы принять участие в исследовании. Таким образом,
за исключением первого шага, выборка формируется с участием самих объектов
исследования. Метод часто применяется, когда необходимо найти и опросить
труднодоступные группы респондентов (например, респондентов, имеющих высокий доход, респондентов, принадлежащих к одной профессиональной группе,
респондентов, имеющих какие-либо схожие хобби/увлечения и т.д.)
• Стихийная выборка
Опрашиваются наиболее доступные респонденты. Типичные примеры
стихийных выборок – опросы в газетах/журналах, анкеты, отданные респондентам на самозаполнение, большинство интернет-опросов. Размер и состав стихийных выборок заранее не известен, и определяется только одним параметром –
активностью респондентов.
• Выборка типичных случаев
Отбираются единицы генеральной совокупности, обладающие средним
(типичным) значением признака. При этом возникает проблема выбора признака и определения его типичного значения.
Задачи статистики часто подразумевают необходимость сравнения двух
выборок. Выборки могут быть независимыми и зависимыми.
Выборки называются независимыми (несвязными), если процедура экс-
перимента и полученные результаты измерения некоторого свойства у испытуемых одной выборки не оказывают влияния на особенности протекания этого
же эксперимента и результаты измерения этого же свойства у испытуемых (респондентов) другой выборки.
Пример независимых выборок – две группы пациентов стационара, у ко-
торых независимо друг от друга измерили температуру, провели исследование
биохимии крови и так далее.
Выборки называется зависимыми (связными) если процедура экспери-
мента и полученные результаты измерения некоторого свойства, проведенные на
одной выборке, оказывают влияние на другую. Пример зависимых выборок – два
набора данных по одной и той же группе испытуемых, например, измерение
биохимии крови при поступлении в стационар и в процессе лечения.
13

Типы статистического исследования
Статистическое исследование может быть описательным (дескриптив-
ным) и индуктивным (статистический вывод).
Описательная статистика занимается обработкой полученных данных,
их систематизацией, визуальным представлением в форме графиков и таблиц, и
количественным описанием данных посредством основных статистических показателей.
Статистические показатели можно разнести по двух группам – меры
среднего уровня и меры рассеяния.
Меры среднего уровня позволяют вычислить усредненные характеристи-
ки совокупности объектов выборки по определенному признаку. Меры рассеяния показывают, насколько хорошо данные значения представляют данную выборку и соответствующую ей генеральную совокупность.
К мерам среднего уровня относятся такие характеристики, как Среднее
значение, Стандартная ошибка, Стандартное отклонение, Эксцесс, Асимметрия,
Интервал, Минимум, Максимум, Счёт, Медиана, Мода, Квантиль, Математическое ожидание, Доверительный интервал.
К мерам рассеяния относятся такие характеристики, как Дисперсия слу-
чайной величины, Среднеквадратическое отклонение, Размах вариации, Интерквантильный размах, Среднее абсолютное отклонение.
Описательная статистика – это обязательный этап любого статисти-
ческого исследования, так как именно на основе вычисленных мер описательной статистики принимается решение об используемых на дальнейших этапах статистических методов и критериев.
Индуктивная статистика – это обобщение информации из выборки для
получения представления о свойствах генеральной совокупности. Другими словами, это статистическая методика, использующаяся для получения обобщений
относительно генеральной совокупности на основе выборки, взятой из этой же
совокупности. В индуктивной статистике применяются статистические модели.
Результатом индуктивной статистики является одно или несколько статистических суждений о генеральной совокупности. Например, одной из задач индуктивной статистики является проверка статистических гипотез о законе распределения данных. Другой задачей индуктивной статистики в медикобиологических исследованиях является сравнение двух разных выборок на
предмет принадлежности к общей генеральной совокупности.
14

Типы данных и их особенности
При работе с данными необходимо ясно понимать их тип. Тип данных
влияет на выбор статистических критериев и методов для их обработки. Возможные способы визуализации и графического представления данных так же
отличаются для разных типов данных.
Рассмотрим основные типы данных. Данные могут быть числовыми или
категориальными (Рис. 1).
Числовые данные – это данные, которые выражены числами: возраст,
вес, количество детей, индекс массы тела, и т.д. Числовые данные могут быть
непрерывными и дискретными.
Непрерывные числовые данные – те данные, значения которых могут
принимать неограниченное число вариантов, например, возраст, вес, артериальное давление, температура. Любые нецелочисленные числовые данные
можно рассматривать как непрерывные. Непрерывные переменные часто измеряют по шкале.
Рис. 1. Возможные типы данных
При медико-биологических исследованиях зачастую важны не сами зна-
чения непрерывных числовых данных, а насколько они отличаются от данных,
считающихся нормальными.
В этом случае анализируемые непрерывные числовые данные распреде-
ляются на категории (или интервалы) относительно интервала референсных
значений. Результаты, соответствующие интервалу нормы, принимаются за 0,
отклонение от максимального значения нормы на 10, 20, 30 % и т.д. в большую
15

сторону записываются как 10, 20, 30…, отклонения от минимального значения
нормы в меньшую сторону записываются как –10, –20, –30 и т.д., как показано
на Рис. 2.
Рис. 2. Категориальная шкала
Дискретные числовые данные – данные, которые могут принимать
только некоторые значения. Обычно это данные, которые могут быть выражены только целочисленными значениями. Пример дискретных данных – размер
обуви, количество детей.
Категориальные данные – данные, численное выражение которых за-
труднено или такое выражение может быть субъективным. При этом эти данные можно разделить на некоторые категории. К таким данным относятся –
вкус (сладкий, соленый, кислый, и т.д.), цвет автомобиля, запах, архитектурный
стиль, семейное положение, цвет глаз, пол, группа крови, этническая принадлежность.
Порядковые категориальные данные – данные, которые могут быть
распределены по категориям, и эти категории образуют иерархию: выраженность боли, уровень удовлетворённости, настроение. Для математического анализа название категорий можно заменить числовым значением, например, рейтинг ресторана от 0 (самый низкий) до 4 (самый высокий) звёзд.
Номинальные категориальные данные – категориальные данные, но
между категориями нельзя установить никакой связи или иерархии. Пример таких данных: цвет глаз, порода собак, группа крови, владение иностранным языком (английский, французский, немецкий, испанский).
Еще одним типом данных являются бинарные данные. Бинарные данные
принимают только два значения – “да” или “нет”, “истина” и “ложь”, 1 и 0.
Примеры бинарных данных можно привести следующие ситуации: отменил человек подписку или нет, купил машину или нет, умер или выжил.
16

ОПИСАТЕЛЬНАЯ СТАТИСТИКА. ОСНОВНЫЕ ХАРАКТЕРИСТИКИ
Следующие статистические характеристики должны быть вычислены для
любых выборок. Эти характеристики не только описывают выборку в целом, но
и являются основой для принятия решения о ходе и методах дальнейшего статистического исследования.
Пусть генеральная совокупность состоит из N элементов
…
[
[
…
]
. Из нее случайным образом получили выборку
]
из n элементов. Здесь и далее, параметры, характеризу-
ющие генеральную совокупность, обозначаются заглавной буквой, а характеризующие выборку – строчной.
Среднее значение
Среднее значение (выборочное среднее, среднее по выборке) – некото-
рое число, заключённое между наименьшим и наибольшим из множества зна-
чений. Обычно обозначается или с чертой сверху или угловыми скобками
.
Для нахождения среднего значения нужно сложить все значения и разде-
лить на их количество.
Математическая формула для вычисления среднего значения:
+ + +
В
= =
.
Математическая формула для вычисления среднего значения генеральной
совокупности имеет аналогичный вид, хотя на практике ее вычисление может
быть затруднительно:
+ + +
=
.
Стандартное отклонение и дисперсия
Стандартное отклонение. Так же иногда используются термины среднее
квадратическое отклонение, среднеквадратичное отклонение, квадратичное отклонение, стандартный разброс, стандартная неопределённость.
Стандартное отклонение обозначается греческой буквой , если речь идет
о генеральной совокупности. И комбинацией латинских букв (с англ.
standard deviation – стандартное отклонение) для выборки.
17

Стандартное (среднеквадратическое отклонение) определяется как квад-
ратный корень из дисперсии (меры разброса значений случайной величины относительно её среднего значения):
=.
На практике, когда вместо точного распределения случайной величины в
распоряжении имеется лишь выборка, стандартное отклонение вычисляют по
следующему алгоритму.
Сначала вычисляют среднее выборки .
Затем вычисляют разницу
[
]
.
…
Возводим значения в квадрат:
)
(
[
(
)
(
)
…
(
]
)
Полученные значения суммируем и на количество величин:
)
(
+
(
)
+ +(
)
=
1
)
(
Согласно определению, эту величину мы можем использовать для оценки
дисперсии :
=
1
(
)
.
Квадратный корень из полученной величины и будет стандартным откло-
нением:
=
1
(
)
.
То есть верно равенство = .
Отметим, что получаемая по приведенным выше формуле выборочная
дисперсия будет давать систематически заниженную оценку генеральной дисперсии D
. Поэтому выборочную дисперсию необходимо поправить по формуле:
=
.
1
Величина
называется исправленной выборочной дисперсией или не-
смещенной оценкой генеральной дисперсии.
18

Стандартная ошибка
Стандартная ошибка (стандартная ошибка среднего, стандартное от-
клонение выборочного среднего) – статистический параметр, характеризующий
выборочное распределение.
Стандартная ошибка выборки вычисляется по формуле:
=
.
Оценка стандартной ошибки генеральной совокупности вычисляется по
формуле на основе несмещённой оценки:
=
.
Минимум, Максимум, Размах вариации
Минимум, Максимум, Размах вариации (интервал) – наименьшее
(min) и максимальное (max) значение в выборке данных. Под размахом вариации понимается множество всех чисел, для которых выполняется неравенство
. То есть все числовые значения выборки будут находится в
пределах этого интервала.
Медиана
Медиана – это такое число, что половина из числовых элементов выбор-
ки больше него, а другая половина меньше. Например, медианой набора {11, 9,
3, 5, 5} является число 5, так как оно стоит в середине этого набора после его
упорядочивания: {3, 5, 5, 9, 11}. Если в выборке чётное число элементов, медиана может быть не определена однозначно. В этом случае используют полусумму двух соседних значений. Например, медиана набора {1, 3, 5, 7} принимается равной 4.
В случае если выборка описывается непрерывным законом распределения
F(), то медиана выборки находится как решение уравнения:
F() = 0.5.
19

Математическое ожидание
Математическое ожидание – среднее взвешенное по вероятностям зна-
чение случайной величины.
Математическое ожидание дискретной случайной величины вычисляется
как сумма произведений значений x
Х, на соответствующие вероятности p
, которые принимает случайная величина
i
:
i
=
.
Для непрерывной случайной величины (заданной плотностью вероятно-
стей ()), формула вычисления математического ожидания выглядит следую-
щим образом:
∞
=
().
На практике математическое ожидание обычно оценивается как среднее
арифметическое наблюдаемых значений случайной величины (среднее значение). Можно показать, что при соблюдении определенных слабых условий (в
частности, если выборка является случайной, то есть наблюдения являются независимыми) выборочное среднее стремится к истинному значению математического ожидания случайной величины при стремлении объема выборки (количества наблюдений, испытаний, измерений) к бесконечности.
Другими словами, в прикладной математической статистике принимают
следующее равенство:
=
.
Пример вычисления описанных характеристик с помощью функций
Excel, показан на Рис. 3.
Рис. 3. Расчет статистических характеристик выборки
20
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]
