Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Сенсорные и перцептивные процессы. Учебное пособие

.pdf
Скачиваний:
0
Добавлен:
08.09.2026
Размер:
2 Мб
Скачать
☆
Расчёт и интервальное оценивание некоторых статистических параметров 91
стантами или выражениями. Расчёт производится для всех аргументов сразу, результатом является скаляр.
Таблица 3.2
Критические
значения распределения Стьюдента для
двусторонней
области
df 0,05 0,01
1 12,706 63,657 2 4,303 9,925 3 3,182 5,841 4 2,776 4,604 5 2,571 4,032 6 2,447 3,707 7 2,365 3,499 8 2,306 3,355 9 2,262 3,250
10 2,228 3,169 11 2,201 3,106 12 2,179 3,055 13 2,160 3,012 14 2,145 2,977 15 2,131 2,947 16 2,120 2,921 17 2,110 2,898 18 2,101 2,878 19 2,093 2,861 20 2,086 2,845 21 2,080 2,831 22 2,074 2,819 23 2,069 2,807 24 2,064 2,797 25 2,060 2,787 26 2,056 2,779 27 2,052 2,771 28 2,048 2,763
Функция NORMSINV возвращает обратное зна-
чение кумулятивного нормального распределения, так что её можно использовать для определения z по доле накопленной вероятности вместо таб­лицы. Это становится особенно удобным, когда нужное табличное значение отсутствует: если уста­новлена доверительная вероятность p = 0, 93, то
Φ(z) = 1 −
α
2
= 0, 965, а NORMSINV(1-0,07/2) вер-
нёт 1,811910673. При расчёте σ
¯
X
удобно использо­вать функцию SQRT, возвращающую квадратный корень аргумента.
После вычисления среднего и стандартного от­клонения можно пойти и по существенно более про­стому пути, примененив функцию CONFIDENCE. В качестве аргументов она принимает уровень зна­чимости α, стандартное отклонение и размер вы­борки, а возвращает z · σ
¯
X
– половину длины (ра-
диус) доверительного интервала. В общем случае
этот способ предпочтительнее.
Изложенный выше подход к построению до­верительного интервала для M применим и при n < 30, но только если генеральная совокупность распределена нормально и известно её σ.
К сожалению, далеко не всегда имеется прак­тическая возможность провести достаточно боль­шое (n ≥ 30) число измерений, кроме того σ ге­неральной совокупности очень часто неизвестна. В таком случае прибегают к построению довери­тельного интервала с использованием распределе­ния Стьюдента
1
. Этому закону подчиняются вы­борочные параметры при небольших n, с увеличе­нием выборки распределение Стьюдента приближается к нормальному.
1
Стьюдент – псевдоним Уильяма Сили Госсета (1876–1937), выдающегося статистика.
92 Методический справочник
Важно учитывать, что обязательным условием применения этого способа является нормальность распределения исследуемой генеральной совокуп­ности.
Алгоритм построения доверительного интервала с использованием
распределения Стьюдента в основном повторяет представленный ранее. Единственным и главным отличием является замена z нормального рас­пределения на аналогичный по смыслу параметр t распределения Стью­дента в формуле P (¯X − t · σ
¯
X
< M <¯X + t · σ
¯
X
). Значение t, соответ-
ствующее выбранной доверительной вероятности p при n − 1 степенях свободы (degrees of freedom, df), можно взять из таблицы 3.2. Нетрудно заметить, что с ростом объёма выборки стандартное отклонение распре­деления Стьюдента становится всё ближе к нормальному.
При компьютерных расчётах в табличных процессорах для получения
значения t можно использовать функцию TINV, принимающую в каче­стве аргументов уровень значимости α и степени свободы n − 1. Табли­ца 3.2 была сформирована именно таким способом
1
.
3.1.2 Медиана и её интервальное оценивание
Оценка генерального среднего не всегда применима в качестве со­держательной характеристики результатов измерений. Часто в случаях, когда распределение отличается от нормального (например, имеет значи­тельную асимметрию), используют медиану – срединное значение иссле­дуемого признака, разделяющее интервал варьирования пополам (подоб­но геометрической медиане, разделяющей на две равные части сторону треугольника, противолежащую углу). Медиана также применяется вме­сто среднего, если данные представлены в порядковой шкале.
Чтобы получить точечную оценку выборочной медианы M e, снача­ла нужно упорядочить выборку по возрастанию, при этом одинаковые элементы должны следовать друг за другом. Полученная последователь-
1
К сожалению, функция, автоматизирующая расчёт доверительного интервала с использо­ванием распределения Стьюдента, на момент подготовки издания имелась только в новых дис­трибутивах MS Office (2010 и выше) и Open/LibreOffice, выпущенных в 2016 г. (напр., LibreOffice
5.1.4.2). В русской и английской локализациях Excel она может именоваться соответственно ДОВЕРИТ.СТЬЮДЕНТ и CONFIDENCE.T, вызов её аналогичен ранее описанной функции CONFIDENCE; в Open/LibreOffice – CONFIDENCE.T вне зависимости от локализации. В табли­цах Google на сентябрь 2016 г. такой функции нет.
Расчёт и интервальное оценивание некоторых статистических параметров 93
ность нумеруется. Например, если выборка включает n = 10 результатов измерений X = {3; 2; 9; 8; 6; 1; 1; 5; 8; 7}, упорядоченная по k = 1, . . . , n последовательность будет выглядеть следующим образом:
k : 1 2 3 4 5 6 7 8 9 10
x
k
: 1 1 2 3 5 6 7 8 8 9
.
Медиану определяют как значение из середины этой последовательно-
сти. В нашем случае n чётно, поэтому следует вычислить среднее ариф­метическое двух срединных значений с номерами
n
2
и
n
2
+ 1, т. е.
Me =
x
n/2+xn/2+1
2
=
5+6
2
= 5, 5.
Если же n нечётно, то медианным будет значение с порядковым номером k = [
n
2
] + 1∗. Для вычисления медианы в табличном процессоре можно
воспользоваться функцией MEDIAN.
При построении двустороннего доверительного интервала в общем
случае (при любых n) можно воспользоваться следующим приближён­ным методом [3].
1. Из таблицы 3.1 определить z, соответствующее доверительной веро­ятности p = 1 − α.
2. Определить порядковые номера значений упорядоченной выборки, соответствующие левой и правой границам доверительного интер-
вала, по формулам k
1
= [
n+1−z√n+0,5−0,25z
2
2
]∗и k2= n − k1+ 1.
При n ≤ 30 можно воспользоваться значениями из таблицы 3.3.
3. Построить доверительный интервал P (x
k
1
≤ Me < x
k
2
), взяв в ка-
честве границ значения упорядоченной выборки с номерами k
1
и k2.
Границы могут быть определены и с использованием более простой
приближённой формулы
k
1
= [
n+1−z√n−0,5
2
]∗,
∗
Квадратными скобками [ ] в математических формулах принято обозначать операцию взятия
целой части числа.
94 Методический справочник
которую можно применить в случае n > 30 вместо предлагаемой в пунк­те 2. Следует иметь в виду, что эта формула даёт хорошее приближение для обычно используемых значений α [3].
Кроме того, при n > 50 для расчёта порядковых номеров границ
допускается [4] использовать формулу
k
1
≈
[n−z√n−1]
2
∗
.
При компьютерных расчётах для округления числа в сторону ближай­шего меньшего целого можно использовать функцию INT, для матема­тического округления – ROUND.
Значения порядковых номеров границ, рассчитываемые в пункте 2,
приведены в табл. 3.3.
Таблица 3.3
Порядковые номера границ доверительного интервала для медианы
n 0,95 0,99 n 0,95 0,99
k1k2− 1 k1k2− 1 k1k2− 1 k1k2− 1
5 0 5 0 5 18 5 13 4 14 6 1 5 0 6 19 5 14 4 15 7 1 6 0 7 20 6 14 4 16 8 1 7 1 7 21 6 15 5 16
9 2 7 1 8 22 6 16 5 17 10 2 8 1 9 23 7 16 5 18 11 2 9 1 10 24 7 17 6 18 12 3 9 2 10 25 8 17 6 19 13 3 10 2 11 26 8 18 7 19 14 3 11 2 12 27 8 19 7 20 15 4 11 3 12 28 9 19 7 21 16 4 12 3 13 29 9 20 8 21 17 5 12 3 14 30 10 20 8 22
Рассмотрим также классический способ построения доверительного
интервала для медианы, основанный на следующем рассуждении. Ес­ли распределение случайной величины непрерывно, то вероятности того, что она примет значение больше или меньше медианного, равны. То­гда её распределение является биномиальным с известными параметрами p = 0, 5 и n, и можно определить вероятности того, что точно 1, 2, . . . , n
Расчёт и интервальное оценивание некоторых статистических параметров 95
выборочных значений окажутся больше (или меньше) медианы. Напри­мер, мы определили вероятность того, что нет значений меньше медианы, равное вероятности того, что нет значений больше медианы; что толь­ко одно или 0 значений меньше медианы, равное вероятности того, что только одно или 0 больше; и т. д. На каждом шаге мы получаем довери­тельный интервал с уровнем значимости α, равным сумме полученных вероятностей. С практическим применением данного метода полезно по­знакомиться более подробно [5, c. 474–476].
3.1.3 Корреляция и доверительный интервал
для коэффициента корреляции
Корреляционный анализ является вторым по частоте встречаемо-
сти в психологических исследованиях статистическим методом после дескриптивного (описательного) [6].
А Б
Рисунок 3.2: взаимное рассеяние значений двух случайных величин, имеющих при- мерно нормальное совместное распределение. А – r ≈ 0, 02, Б – r ≈ 0, 96
Коэффициент корреляции – это мера корреляционной связи, при кото­рой математическое ожидание одной случайной величины зависит от зна­чения, принятого другой случайной величиной. Корреляционная связь является частным случаем связи вероятностной [5]. Следует отличать
96 Методический справочник
такую связь от функциональной, при наличии которой имеется строгое соответствие между значениями двух величин. В основе корреляционной связи может лежать функциональная связь, однако это не следует из одного только факта обнаружения корреляционной связи, даже доста­точно сильной. Кроме того, важно учитывать, что производимая оцен­ка корреляционной связи сама по себе не даёт оснований для суждений о причинно-следственных отношениях между величинами. Примеры от­сутствия (А) и наличия (Б) корреляционной связи между двумя случай­ными величинами показаны на рис. 3.2.
Коэффициент корреляции варьирует от −1 до +1, абсолютная его ве-
личина отражает силу соответственно отрицательной или положительной связи. Параметрический, т. е. предназначенный для случаев, когда пара­метры исследуемых совокупностей известны, выборочный коэффициент линейной корреляции r Карла Пирсона (1857–1936) рассчитывается по формуле
r =
n
i=1
(xi−¯X)(yi−¯Y )
(n−1)sxs
y
,
где sx, sy– исправленные выборочные стандартные отклонения случай-
ных величин X и Y , а
1
(n−1)
n
i=1
(xi−¯X)(yi−¯Y ) – ковариация этих величин.
Иногда коэффициент корреляции называют также безразмерной ковари-
ацией [7].
Упрощая приведённую формулу, получают (напр., [8])
r =
n
i=1
(xi−¯X)(yi−¯Y )
n
i=1
(xi−¯X)
2
n
i=1
(yi−¯Y )
2
.
В табличном процессоре коэффициент корреляции можно посчитать
вызовом полностью аналогичных функций PEARSON или CORREL, аргументами которых выступают два массива значений. Массивы­аргументы должны быть согласованы по длине.
Применение r Пирсона в психологических исследованиях связано с известными ограничениями, которые в ряде случаев могут сделать его оценку нецелесообразной или бессмысленной. Условием применимости коэффициента корреляции Пирсона является нормальность двумерного
Расчёт и интервальное оценивание некоторых статистических параметров 97
распределения случайных величин1, причём нарушения этого условия могут вести к различным последствиям. Так как соответствующая про­верка достаточно сложна [9], в литературе из практических соображений часто предлагают ограничиться проверкой нормальности распределе­ния каждой из величин. Однако известно, что из такой нормальности ещё не следует нормальность совместного распределения (напр., [10]), и в некоторых случаях эта проверка может оказаться недостаточной. На рис. 3.3А показан случай, когда двумерное распределение двух нор­мально распределённых случайных величин не является нормальным.
А Б
Рисунок 3.3: взаимное рассеяние значений двух случайных величин, не имеющих совместного нормального распределения. А – r ≈ 0, 65, Б – r ≈ 0, 75
Применяя коэффициент Пирсона r, в общем случае разумно иметь в виду следующие рассуждения, частично основанные на [11]. Если хотя бы одна случайная величина имеет распределение, отличное от нормаль­ного, их совместное распределение не может быть нормальным, и связь между этими величинами может оказаться нелинейной. Нелинейность может иметь место даже тогда, когда обе величины распределены нор­мально. Учитывая то, что r измеряет силу именно линейной связи, очень полезным может оказаться построение простой скатерграммы (графика, демонстрирующего разброс Y относительно X). Коробчатые (ящичковые)
1
Это условие включает в себя требования и гомоскедастичности разброса, и линейности зави-
симости переменных (напр., [7, с. 101–102]).
98 Методический справочник
диаграммы1или гистограммы частот помогают быстро оценить степень асимметрии распределения отдельных величин.
Табличные процессоры, как правило, позволяют выполнить эти дей-
ствия простыми средствами. Так, разброс значений одной величины относительно другой может быть показан путём вставки диаграммы XY; группировка данных в статистический ряд выполняется с ис­пользованием массивоподобной функции FREQUENCY, принимающей 2 аргумента-массива – диапазон ячеек со значениями случайной ве­личины и диапазон, содержащий границы интервалов группирования статистического ряда. Результат имеет размер, на единицу превышаю­щий размер второго аргумента; вставка функции в выделенный диапазон ячеек осуществляется нажатием клавиш
Ctrl + Shift + Enter .
Результаты такого графического анализа могут привести исследова­теля к отказу от применения параметрического коэффициента в поль­зу более устойчивого (робастного
2
) непараметрического. Вместе с тем они могут и подсказать способы нормализующей и/или линеаризующей трансформации исходных данных. Так, на рис. 3.3Б показан случай очень тесной нелинейной (экспоненциальной) связи между двумя величинами. Довольно очевидно, что линеаризовать связь случайных величин, при этом приблизив к нормальному их двумерное распределение, можно ло­гарифмированием значений величины Y . После выполнения этой опера­ции коэффициент линейной корреляции будет близок к 1, тогда как на рис. 3.3Б r ≈ 0, 75. Однако вполне правильным решением в этой ситуации будет и расчёт непараметрического коэффициента корреляции Спирме-
на
3
– для нашего примера он также близок к 1.
Высказываемое некоторыми психологами мнение о недопустимости
применения непараметрических коэффициентов корреляции к данным, представленным в абсолютных или интервальных шкалах, является ошибочным. Вероятно, оно основано на (1) неверной трактовке ча­сто встречающихся в статистической литературе таблиц, ставящих
1
Этот тип диаграмм удобнее всего строить в специализированных программах, например, GNU
PSPP https://www.gnu.org/software/pspp/ или R https://www.r-project.org/.
2
«Свойства робастности процедуре оценивания (коэффициента корреляции – Д. Я. и др.) могут
быть приданы при использовании непараметрических ранговых статистик» [12, c. 73].
3
Чарльз Эдвард Спирмен (1863–1945) – выдающийся психолог, разработавший двухфактор­ную теорию интеллекта и целый ряд широко используемых математико-статистических техник – факторный анализ и др.
Расчёт и интервальное оценивание некоторых статистических параметров 99
в соответствие различные меры корреляционной связи и типы измери­тельных шкал, а также на том, что (2) мощность (чувствительность) непараметрических коэффициентов в случае двумерного нормального распределения ниже, чем параметрического коэффициента Пирсона. Второе действительно имеет место; приведём исчерпывающий коммен­тарий Стентона Гланца на этот счёт: «Если параметрические методы, требующие нормального распределения, применить к данным с иным ти­пом распределения, это приведет к ошибочному заключению. Напротив, непараметрические методы можно смело применять и в случае нормаль­ного распределения. Однако тогда чувствительность их будет несколько ниже чувствительности параметрических методов. Что касается коэффи­циента ранговой корреляции Спирмена, то он и в этом случае (курсив наш – Д. Я. и др.) проигрывает коэффициенту корреляции Пирсона весьма незначительно» [8, с. 262]. Важно отметить, что коэффициент Спирмена является фактически коэффицентом Пирсона, рассчитанным для рангов данных. Ранжирование в данном случае выступает в роли линеаризующей процедуры.
Таблица 3.4
Пример ранжирования
переменной X =
{70; 20; 90; 40; 50; 10; 80; 20; 40; 60}
i xi«после- итоговый
дователь- ранг
ный» ранг
6 10 1 1 2 20 2 2,5 8 20 3 2,5 4 40 4 4,5 9 40 5 4,5 5 50 6 6 10 60 7 7 1 70 8 8 7 80 9 9 3 90 10 10
Рассмотрим подробнее вычисле­ние рангового коэффициента корреля­ции Спирмена. Вычисления начинают с ранжирования каждой из двух пе­ременных, причём меньшие значения получают меньший ранг, б´ольшие – б´ольший. Если в данных имеются по­вторяющиеся значения, им присваива­ется одинаковый ранг, равный среднему их «последовательных» рангов; очевид­но, не имеет значения, в какой после­довательности присваиваются «после­довательные» ранги внутри группы повторяющихся значений. Пример ран­жирования содержится в табл. 3.4. Обращаем внимание читателя на то, что значения переменной X в этом примере отсортированы для удобства, так что их порядок отличается от
100 Методический справочник
исходного, задаваемого индексом i. Восстановление исходного порядка необходимо для дальнейшего расчёта коэффициента корреляции.
При использовании табличных процессоров для ранжирования можно
воспользоваться функцией RANK.AVG
1
, имеющей три аргумента: значе­ние, которому присваивается ранг; ранжируемый массив, включающий значение предыдущего аргумента; числовая переменная, задающая поря­док ранжирования от большего к меньшему (0, значение по умолчанию) или от меньшего к большему (1). Третий аргумент не является обязатель­ным, однако в нашем случае он необходим, т.к. ранги должны присваи­ваться в порядке возрастания. Более привычная пользователям старых версий табличных процессоров функция RANK имеет аналогичный син­таксис, но не столь удобна: для повторяющихся значений она возвращает ранг, равный меньшему рангу первого повторяющегося значения, так что для получения среднего ранга необходимо прибавлять к результату по­ловину от уменьшенного на единицу числа повторов данного значения
2
.
Таблица 3.5
Пример предварительных
вычислений для определения r
Спирмена
i xiyiранг ранг d d
2
x
i
y
i
1 70 60 8 8 0 0 2 20 35 2 4 -2 4 3 90 80 10 9 1 1 4 45 25 5 2 3 9 5 50 45 6 6 0 0 6 10 20 1 1 0 0 7 80 90 9 10 -1 1 8 25 30 3 3 0 0 9 40 40 4 5 -1 1
10 60 50 7 7 0 0
16
Если ни одна из переменных не со­держит повторяющихся значений, для вычисления коэффициента корреля­ции Спирмена
3
r можно воспользо­ваться следующей упрощённой фор­мулой:
r = 1 −
6
n
i=1
d
2
i
n3−n
,
где d – разность парных рангов. Эта формула особенно удобна при руч­ных вычислениях, порядок которых иллюстрируется таблицей 3.5. Если же в данных имеются повторы, r Спирме­на расчитывается как r Пирсона для рангов
3
.
1
Эта функция с недавних пор имеется и в GoogleDocs, и в популярных офисных пакетах.
2
Пример использования функции RANK в сочетании с COUNTIF, используемой для
подсчёта соответствующих условию значений, можно увидеть на странице http://www.real-
statistics.com/correlation/spearmans-rank-correlation/.
3
Учитывая то, что r Спирмена есть r Пирсона для рангов, мы будем использовать для этих
коэффициентов единое обозначение r.
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]