Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:
Основы математического моделирования и обработки данных в медицине. Учебно-методическое пособие.pdf
Скачиваний:
0
Добавлен:
07.09.2026
Размер:
1 Мб
Скачать
☆
Репрезентативность выборки – это свойство выборки корректно отра-
жать генеральную совокупность. Одна и та же выборка может быть репрезента­тивной и нерепрезентативной для разных генеральных совокупностей.
Пример:
• Выборка, целиком состоящая из всех жителей города, имеющих выс-
шее образование, не репрезентирует все население этого города.
• Выборка из получивших вакцину от какого-либо заболевания и забо-
левших граждан не репрезентирует всех заболевших от этого заболевания.
При этом указанные выборки при определенно поставленных целях ста-
тистического исследования могут отлично репрезентировать жителей­автовладельцев, вакцинировавшихся граждан и т.д.
Важно понимать, что репрезентативность выборки и ошибка выборки –
разные явления. Репрезентативность, в отличие от ошибки, никак не зависит от размера выборки. Как бы мы ни увеличивали количество обследованных паци­ентов, поставивших вакцину, мы не сможем ничего сказать о тех пациентах, кто не привился.
Если данные, получаемые на выборке, существенно отличаются от ис-
тинных данных генеральной совокупности, то имеет место ошибка выборки.
Ошибка выборки может быть статистической и систематической. Стати-
стическая ошибка зависит от размера выборки. В случае статистической ошибки выборки для ее уменьшения достаточно увеличить размер выборки.
Систематическая ошибка возникает в результате различных причин,
оказывающих влияние на исследование, и на практике оценить ее бывает до­статочно проблематично.
Примеры систематических ошибок:
• Использование любых вероятностных выборок занижает долю людей с
высоким доходом, ведущих активный образ жизни. Происходит это в силу того, что таких людей гораздо сложней застать в каком-либо определенном месте (например, дома).
• Проблема респондентов, отказывающихся принимать участие в иссле-
дованиях, например, отказ проходить тесты, или принимающих участие фор­мально.
По способу формирования выборки делятся на:
• случайные (вероятностные);
• неслучайные (вероятностные).
11
Вероятностные выборки:
• Случайная выборка (простой случайный отбор) Такая выборка предполагает однородность генеральной совокупности,
одинаковую вероятность доступности всех элементов, наличие полного списка всех элементов. При отборе элементов, как правило, используется таблица слу­чайных чисел.
• Механическая (систематическая) выборка Разновидность случайной выборки, упорядоченная по какому-либо при-
знаку (алфавитный порядок, номер телефона, дата рождения и т.д.). Первый элемент отбирается случайно, затем, с шагом n отбирается каждый k-й элемент. Размер генеральной совокупности, при этом N = n*k.
• Стратифицированная (районированная) Применяется в случае неоднородности генеральной совокупности. Гене-
ральная совокупность разбивается на группы (страты). Например, генеральная совокупность всех пациентов разбивается по возрасту, полу, по сопутствую­щим заболеваниям. В каждой страте отбор осуществляется случайным или ме­ханическим образом.
• Серийная (гнездовая или кластерная) выборка При серийной выборке единицами отбора выступают не сами объекты, а
группы (кластеры или гнёзда). Группы отбираются случайным образом. Объек­ты внутри групп обследуются сплошняком.
Невероятностные выборки – отбор элементов для такой выборки осу-
ществляется по субъективным критериям – доступности, типичности, равного представительства и т.д.
• Квотная выборка Изначально выделяется некоторое количество групп объектов (например,
мужчины в возрасте 20–30 лет, 31–45 лет и 46–60 лет; лица с доходом до 30 ты­сяч рублей, с доходом от 30 до 60 тысяч рублей и с доходом свыше 60 тысяч рублей) Для каждой группы задается количество объектов, которые должны быть обследованы. Количество объектов, которые должны попасть в каждую из групп, задается, чаще всего, либо пропорционально заранее известной доле группы в генеральной совокупности, либо одинаковым для каждой группы. Внутри групп объекты отбираются произвольно. Квотные выборки использу­ются в маркетинговых исследованиях достаточно часто.
12
• Метод снежного кома Выборка строится следующим образом. У каждого респондента, начиная с
первого, просятся контакты его друзей, коллег, знакомых, которые подходили бы под условия отбора и могли бы принять участие в исследовании. Таким образом, за исключением первого шага, выборка формируется с участием самих объектов исследования. Метод часто применяется, когда необходимо найти и опросить труднодоступные группы респондентов (например, респондентов, имеющих вы­сокий доход, респондентов, принадлежащих к одной профессиональной группе, респондентов, имеющих какие-либо схожие хобби/увлечения и т.д.)
• Стихийная выборка Опрашиваются наиболее доступные респонденты. Типичные примеры
стихийных выборок – опросы в газетах/журналах, анкеты, отданные респонден­там на самозаполнение, большинство интернет-опросов. Размер и состав стихий­ных выборок заранее не известен, и определяется только одним параметром – активностью респондентов.
• Выборка типичных случаев Отбираются единицы генеральной совокупности, обладающие средним
(типичным) значением признака. При этом возникает проблема выбора призна­ка и определения его типичного значения.
Задачи статистики часто подразумевают необходимость сравнения двух
выборок. Выборки могут быть независимыми и зависимыми.
Выборки называются независимыми (несвязными), если процедура экс-
перимента и полученные результаты измерения некоторого свойства у испыту­емых одной выборки не оказывают влияния на особенности протекания этого же эксперимента и результаты измерения этого же свойства у испытуемых (ре­спондентов) другой выборки.
Пример независимых выборок – две группы пациентов стационара, у ко-
торых независимо друг от друга измерили температуру, провели исследование биохимии крови и так далее.
Выборки называется зависимыми (связными) если процедура экспери-
мента и полученные результаты измерения некоторого свойства, проведенные на одной выборке, оказывают влияние на другую. Пример зависимых выборок – два набора данных по одной и той же группе испытуемых, например, измерение биохимии крови при поступлении в стационар и в процессе лечения.
13

Типы статистического исследования

Статистическое исследование может быть описательным (дескриптив-
ным) и индуктивным (статистический вывод).
Описательная статистика занимается обработкой полученных данных,
их систематизацией, визуальным представлением в форме графиков и таблиц, и количественным описанием данных посредством основных статистических по­казателей.
Статистические показатели можно разнести по двух группам – меры
среднего уровня и меры рассеяния.
Меры среднего уровня позволяют вычислить усредненные характеристи-
ки совокупности объектов выборки по определенному признаку. Меры рассея­ния показывают, насколько хорошо данные значения представляют данную вы­борку и соответствующую ей генеральную совокупность.
К мерам среднего уровня относятся такие характеристики, как Среднее
значение, Стандартная ошибка, Стандартное отклонение, Эксцесс, Асимметрия, Интервал, Минимум, Максимум, Счёт, Медиана, Мода, Квантиль, Математиче­ское ожидание, Доверительный интервал.
К мерам рассеяния относятся такие характеристики, как Дисперсия слу-
чайной величины, Среднеквадратическое отклонение, Размах вариации, Интер­квантильный размах, Среднее абсолютное отклонение.
Описательная статистика – это обязательный этап любого статисти-
ческого исследования, так как именно на основе вычисленных мер описа­тельной статистики принимается решение об используемых на дальней­ших этапах статистических методов и критериев.
Индуктивная статистика – это обобщение информации из выборки для
получения представления о свойствах генеральной совокупности. Другими сло­вами, это статистическая методика, использующаяся для получения обобщений относительно генеральной совокупности на основе выборки, взятой из этой же совокупности. В индуктивной статистике применяются статистические модели. Результатом индуктивной статистики является одно или несколько статистиче­ских суждений о генеральной совокупности. Например, одной из задач индук­тивной статистики является проверка статистических гипотез о законе распре­деления данных. Другой задачей индуктивной статистики в медико­биологических исследованиях является сравнение двух разных выборок на предмет принадлежности к общей генеральной совокупности.
14

Типы данных и их особенности

При работе с данными необходимо ясно понимать их тип. Тип данных
влияет на выбор статистических критериев и методов для их обработки. Воз­можные способы визуализации и графического представления данных так же отличаются для разных типов данных.
Рассмотрим основные типы данных. Данные могут быть числовыми или
категориальными (Рис. 1).
Числовые данные – это данные, которые выражены числами: возраст,
вес, количество детей, индекс массы тела, и т.д. Числовые данные могут быть непрерывными и дискретными.
Непрерывные числовые данные – те данные, значения которых могут
принимать неограниченное число вариантов, например, возраст, вес, артери­альное давление, температура. Любые нецелочисленные числовые данные можно рассматривать как непрерывные. Непрерывные переменные часто изме­ряют по шкале.
Рис. 1. Возможные типы данных
При медико-биологических исследованиях зачастую важны не сами зна-
чения непрерывных числовых данных, а насколько они отличаются от данных, считающихся нормальными.
В этом случае анализируемые непрерывные числовые данные распреде-
ляются на категории (или интервалы) относительно интервала референсных значений. Результаты, соответствующие интервалу нормы, принимаются за 0, отклонение от максимального значения нормы на 10, 20, 30 % и т.д. в большую
15
сторону записываются как 10, 20, 30…, отклонения от минимального значения нормы в меньшую сторону записываются как –10, –20, –30 и т.д., как показано на Рис. 2.
Рис. 2. Категориальная шкала
Дискретные числовые данные – данные, которые могут принимать
только некоторые значения. Обычно это данные, которые могут быть выраже­ны только целочисленными значениями. Пример дискретных данных – размер обуви, количество детей.
Категориальные данные – данные, численное выражение которых за-
труднено или такое выражение может быть субъективным. При этом эти дан­ные можно разделить на некоторые категории. К таким данным относятся – вкус (сладкий, соленый, кислый, и т.д.), цвет автомобиля, запах, архитектурный стиль, семейное положение, цвет глаз, пол, группа крови, этническая принад­лежность.
Порядковые категориальные данные – данные, которые могут быть
распределены по категориям, и эти категории образуют иерархию: выражен­ность боли, уровень удовлетворённости, настроение. Для математического ана­лиза название категорий можно заменить числовым значением, например, рей­тинг ресторана от 0 (самый низкий) до 4 (самый высокий) звёзд.
Номинальные категориальные данные – категориальные данные, но
между категориями нельзя установить никакой связи или иерархии. Пример та­ких данных: цвет глаз, порода собак, группа крови, владение иностранным язы­ком (английский, французский, немецкий, испанский).
Еще одним типом данных являются бинарные данные. Бинарные данные
принимают только два значения – “да” или “нет”, “истина” и “ложь”, 1 и 0. Примеры бинарных данных можно привести следующие ситуации: отменил че­ловек подписку или нет, купил машину или нет, умер или выжил.
16

ОПИСАТЕЛЬНАЯ СТАТИСТИКА. ОСНОВНЫЕ ХАРАКТЕРИСТИКИ

Следующие статистические характеристики должны быть вычислены для
любых выборок. Эти характеристики не только описывают выборку в целом, но и являются основой для принятия решения о ходе и методах дальнейшего ста­тистического исследования.
Пусть генеральная совокупность состоит из N элементов
…
[
[
…
]
. Из нее случайным образом получили выборку
]
из n элементов. Здесь и далее, параметры, характеризу-
ющие генеральную совокупность, обозначаются заглавной буквой, а характери­зующие выборку – строчной.

Среднее значение

Среднее значение (выборочное среднее, среднее по выборке) – некото-
рое число, заключённое между наименьшим и наибольшим из множества зна-
чений. Обычно обозначается или с чертой сверху  или угловыми скобками 
.
Для нахождения среднего значения нужно сложить все значения и разде-
лить на их количество.
Математическая формула для вычисления среднего значения:
+ + +

В
= =
.
Математическая формула для вычисления среднего значения генеральной
совокупности имеет аналогичный вид, хотя на практике ее вычисление может быть затруднительно:
+ + +
=
.

Стандартное отклонение и дисперсия

Стандартное отклонение. Так же иногда используются термины среднее
квадратическое отклонение, среднеквадратичное отклонение, квадратичное от­клонение, стандартный разброс, стандартная неопределённость.
Стандартное отклонение обозначается греческой буквой , если речь идет
о генеральной совокупности. И комбинацией латинских букв  (с англ.
standard deviation – стандартное отклонение) для выборки.
17
Стандартное (среднеквадратическое отклонение) определяется как квад-
ратный корень из дисперсии (меры разброса значений случайной величины от­носительно её среднего значения):
=.
На практике, когда вместо точного распределения случайной величины в
распоряжении имеется лишь выборка, стандартное отклонение вычисляют по следующему алгоритму.
Сначала вычисляют среднее выборки .
Затем вычисляют разницу
[
]
.
   … 
Возводим значения в квадрат:

)
(
[
(

)
(

)
…
(

]
)
Полученные значения суммируем и на количество величин:
)
(

+
(

)
+ +(
)
=
1


)
(
Согласно определению, эту величину мы можем использовать для оценки
дисперсии :
=
1

(

)
.
Квадратный корень из полученной величины и будет стандартным откло-
нением:
=
1

(

)
.
То есть верно равенство = .
Отметим, что получаемая по приведенным выше формуле выборочная
дисперсия будет давать систематически заниженную оценку генеральной дис­персии D
. Поэтому выборочную дисперсию необходимо поправить по формуле:
=
.
1
Величина
называется исправленной выборочной дисперсией или не-
смещенной оценкой генеральной дисперсии.
18

Стандартная ошибка

Стандартная ошибка (стандартная ошибка среднего, стандартное от-
клонение выборочного среднего) – статистический параметр, характеризующий выборочное распределение.
Стандартная ошибка выборки вычисляется по формуле:

=
.
Оценка стандартной ошибки генеральной совокупности вычисляется по
формуле на основе несмещённой оценки:

=
.

Минимум, Максимум, Размах вариации

Минимум, Максимум, Размах вариации (интервал) – наименьшее
(min) и максимальное (max) значение в выборке данных. Под размахом вариа­ции понимается множество всех чисел, для которых выполняется неравенство
. То есть все числовые значения выборки будут находится в
пределах этого интервала.

Медиана

Медиана – это такое число, что половина из числовых элементов выбор-
ки больше него, а другая половина меньше. Например, медианой набора {11, 9, 3, 5, 5} является число 5, так как оно стоит в середине этого набора после его упорядочивания: {3, 5, 5, 9, 11}. Если в выборке чётное число элементов, меди­ана может быть не определена однозначно. В этом случае используют полу­сумму двух соседних значений. Например, медиана набора {1, 3, 5, 7} принимает­ся равной 4.
В случае если выборка описывается непрерывным законом распределения
F(), то медиана выборки находится как решение уравнения:
F() = 0.5.
19

Математическое ожидание

Математическое ожидание – среднее взвешенное по вероятностям зна-
чение случайной величины.
Математическое ожидание дискретной случайной величины вычисляется
как сумма произведений значений x Х, на соответствующие вероятности p
, которые принимает случайная величина
i
:
i
= 


.
Для непрерывной случайной величины (заданной плотностью вероятно-
стей ()), формула вычисления математического ожидания выглядит следую-
щим образом:
∞
=

().
На практике математическое ожидание обычно оценивается как среднее
арифметическое наблюдаемых значений случайной величины (среднее значе­ние). Можно показать, что при соблюдении определенных слабых условий (в частности, если выборка является случайной, то есть наблюдения являются не­зависимыми) выборочное среднее стремится к истинному значению математи­ческого ожидания случайной величины при стремлении объема выборки (коли­чества наблюдений, испытаний, измерений) к бесконечности.
Другими словами, в прикладной математической статистике принимают
следующее равенство:
= 
.
Пример вычисления описанных характеристик с помощью функций
Excel, показан на Рис. 3.
Рис. 3. Расчет статистических характеристик выборки
20
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]