Добавил:
ivanov666
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз:
Предмет:
Файл:Сенсорные и перцептивные процессы. Учебное пособие
.pdf
Расчёт и интервальное оценивание некоторых статистических параметров 91
стантами или выражениями. Расчёт производится для всех аргументов
сразу, результатом является скаляр.
Таблица 3.2
Критические
значения
распределения
Стьюдента для
двусторонней
области
df 0,05 0,01
1 12,706 63,657
2 4,303 9,925
3 3,182 5,841
4 2,776 4,604
5 2,571 4,032
6 2,447 3,707
7 2,365 3,499
8 2,306 3,355
9 2,262 3,250
10 2,228 3,169
11 2,201 3,106
12 2,179 3,055
13 2,160 3,012
14 2,145 2,977
15 2,131 2,947
16 2,120 2,921
17 2,110 2,898
18 2,101 2,878
19 2,093 2,861
20 2,086 2,845
21 2,080 2,831
22 2,074 2,819
23 2,069 2,807
24 2,064 2,797
25 2,060 2,787
26 2,056 2,779
27 2,052 2,771
28 2,048 2,763
Функция NORMSINV возвращает обратное зна-
чение кумулятивного нормального распределения,
так что её можно использовать для определения
z по доле накопленной вероятности вместо таблицы. Это становится особенно удобным, когда
нужное табличное значение отсутствует: если установлена доверительная вероятность p = 0, 93, то
Φ(z) = 1 −
α
2
= 0, 965, а NORMSINV(1-0,07/2) вер-
нёт 1,811910673. При расчёте σ
¯
X
удобно использовать функцию SQRT, возвращающую квадратный
корень аргумента.
После вычисления среднего и стандартного отклонения можно пойти и по существенно более простому пути, примененив функцию CONFIDENCE.
В качестве аргументов она принимает уровень значимости α, стандартное отклонение и размер выборки, а возвращает z · σ
¯
X
– половину длины (ра-
диус) доверительного интервала. В общем случае
этот способ предпочтительнее.
Изложенный выше подход к построению доверительного интервала для M применим и при
n < 30, но только если генеральная совокупность
распределена нормально и известно её σ.
К сожалению, далеко не всегда имеется практическая возможность провести достаточно большое (n ≥ 30) число измерений, кроме того σ генеральной совокупности очень часто неизвестна.
В таком случае прибегают к построению доверительного интервала с использованием распределения Стьюдента
1
. Этому закону подчиняются выборочные параметры при небольших n, с увеличением выборки распределение Стьюдента приближается к нормальному.
1
Стьюдент – псевдоним Уильяма Сили Госсета (1876–1937), выдающегося статистика.

92 Методический справочник
Важно учитывать, что обязательным условием применения этого способа
является нормальность распределения исследуемой генеральной совокупности.
Алгоритм построения доверительного интервала с использованием
распределения Стьюдента в основном повторяет представленный ранее.
Единственным и главным отличием является замена z нормального распределения на аналогичный по смыслу параметр t распределения Стьюдента в формуле P (¯X − t · σ
¯
X
< M <¯X + t · σ
¯
X
). Значение t, соответ-
ствующее выбранной доверительной вероятности p при n − 1 степенях
свободы (degrees of freedom, df), можно взять из таблицы 3.2. Нетрудно
заметить, что с ростом объёма выборки стандартное отклонение распределения Стьюдента становится всё ближе к нормальному.
При компьютерных расчётах в табличных процессорах для получения
значения t можно использовать функцию TINV, принимающую в качестве аргументов уровень значимости α и степени свободы n − 1. Таблица 3.2 была сформирована именно таким способом
1
.
3.1.2 Медиана и её интервальное оценивание
Оценка генерального среднего не всегда применима в качестве содержательной характеристики результатов измерений. Часто в случаях,
когда распределение отличается от нормального (например, имеет значительную асимметрию), используют медиану – срединное значение исследуемого признака, разделяющее интервал варьирования пополам (подобно геометрической медиане, разделяющей на две равные части сторону
треугольника, противолежащую углу). Медиана также применяется вместо среднего, если данные представлены в порядковой шкале.
Чтобы получить точечную оценку выборочной медианы M e, сначала нужно упорядочить выборку по возрастанию, при этом одинаковые
элементы должны следовать друг за другом. Полученная последователь-
1
К сожалению, функция, автоматизирующая расчёт доверительного интервала с использованием распределения Стьюдента, на момент подготовки издания имелась только в новых дистрибутивах MS Office (2010 и выше) и Open/LibreOffice, выпущенных в 2016 г. (напр., LibreOffice
5.1.4.2). В русской и английской локализациях Excel она может именоваться соответственно
ДОВЕРИТ.СТЬЮДЕНТ и CONFIDENCE.T, вызов её аналогичен ранее описанной функции
CONFIDENCE; в Open/LibreOffice – CONFIDENCE.T вне зависимости от локализации. В таблицах Google на сентябрь 2016 г. такой функции нет.

Расчёт и интервальное оценивание некоторых статистических параметров 93
ность нумеруется. Например, если выборка включает n = 10 результатов
измерений X = {3; 2; 9; 8; 6; 1; 1; 5; 8; 7}, упорядоченная по k = 1, . . . , n
последовательность будет выглядеть следующим образом:
k : 1 2 3 4 5 6 7 8 9 10
x
k
: 1 1 2 3 5 6 7 8 8 9
.
Медиану определяют как значение из середины этой последовательно-
сти. В нашем случае n чётно, поэтому следует вычислить среднее арифметическое двух срединных значений с номерами
n
2
и
n
2
+ 1, т. е.
Me =
x
n/2+xn/2+1
2
=
5+6
2
= 5, 5.
Если же n нечётно, то медианным будет значение с порядковым номером
k = [
n
2
] + 1∗. Для вычисления медианы в табличном процессоре можно
воспользоваться функцией MEDIAN.
При построении двустороннего доверительного интервала в общем
случае (при любых n) можно воспользоваться следующим приближённым методом [3].
1. Из таблицы 3.1 определить z, соответствующее доверительной вероятности p = 1 − α.
2. Определить порядковые номера значений упорядоченной выборки,
соответствующие левой и правой границам доверительного интер-
вала, по формулам k
1
= [
n+1−z√n+0,5−0,25z
2
2
]∗и k2= n − k1+ 1.
При n ≤ 30 можно воспользоваться значениями из таблицы 3.3.
3. Построить доверительный интервал P (x
k
1
≤ Me < x
k
2
), взяв в ка-
честве границ значения упорядоченной выборки с номерами k
1
и k2.
Границы могут быть определены и с использованием более простой
приближённой формулы
k
1
= [
n+1−z√n−0,5
2
]∗,
∗
Квадратными скобками [ ] в математических формулах принято обозначать операцию взятия
целой части числа.

94 Методический справочник
которую можно применить в случае n > 30 вместо предлагаемой в пункте 2. Следует иметь в виду, что эта формула даёт хорошее приближение
для обычно используемых значений α [3].
Кроме того, при n > 50 для расчёта порядковых номеров границ
допускается [4] использовать формулу
k
1
≈
[n−z√n−1]
2
∗
.
При компьютерных расчётах для округления числа в сторону ближайшего меньшего целого можно использовать функцию INT, для математического округления – ROUND.
Значения порядковых номеров границ, рассчитываемые в пункте 2,
приведены в табл. 3.3.
Таблица 3.3
Порядковые номера границ доверительного интервала для медианы
n 0,95 0,99 n 0,95 0,99
k1k2− 1 k1k2− 1 k1k2− 1 k1k2− 1
5 0 5 0 5 18 5 13 4 14
6 1 5 0 6 19 5 14 4 15
7 1 6 0 7 20 6 14 4 16
8 1 7 1 7 21 6 15 5 16
9 2 7 1 8 22 6 16 5 17
10 2 8 1 9 23 7 16 5 18
11 2 9 1 10 24 7 17 6 18
12 3 9 2 10 25 8 17 6 19
13 3 10 2 11 26 8 18 7 19
14 3 11 2 12 27 8 19 7 20
15 4 11 3 12 28 9 19 7 21
16 4 12 3 13 29 9 20 8 21
17 5 12 3 14 30 10 20 8 22
Рассмотрим также классический способ построения доверительного
интервала для медианы, основанный на следующем рассуждении. Если распределение случайной величины непрерывно, то вероятности того,
что она примет значение больше или меньше медианного, равны. Тогда её распределение является биномиальным с известными параметрами
p = 0, 5 и n, и можно определить вероятности того, что точно 1, 2, . . . , n

Расчёт и интервальное оценивание некоторых статистических параметров 95
выборочных значений окажутся больше (или меньше) медианы. Например, мы определили вероятность того, что нет значений меньше медианы,
равное вероятности того, что нет значений больше медианы; что только одно или 0 значений меньше медианы, равное вероятности того, что
только одно или 0 больше; и т. д. На каждом шаге мы получаем доверительный интервал с уровнем значимости α, равным сумме полученных
вероятностей. С практическим применением данного метода полезно познакомиться более подробно [5, c. 474–476].
3.1.3 Корреляция и доверительный интервал
для коэффициента корреляции
Корреляционный анализ является вторым по частоте встречаемо-
сти в психологических исследованиях статистическим методом после
дескриптивного (описательного) [6].
А Б
Рисунок 3.2: взаимное рассеяние значений двух случайных величин, имеющих при-
мерно нормальное совместное распределение. А – r ≈ 0, 02, Б – r ≈ 0, 96
Коэффициент корреляции – это мера корреляционной связи, при которой математическое ожидание одной случайной величины зависит от значения, принятого другой случайной величиной. Корреляционная связь
является частным случаем связи вероятностной [5]. Следует отличать

96 Методический справочник
такую связь от функциональной, при наличии которой имеется строгое
соответствие между значениями двух величин. В основе корреляционной
связи может лежать функциональная связь, однако это не следует из
одного только факта обнаружения корреляционной связи, даже достаточно сильной. Кроме того, важно учитывать, что производимая оценка корреляционной связи сама по себе не даёт оснований для суждений
о причинно-следственных отношениях между величинами. Примеры отсутствия (А) и наличия (Б) корреляционной связи между двумя случайными величинами показаны на рис. 3.2.
Коэффициент корреляции варьирует от −1 до +1, абсолютная его ве-
личина отражает силу соответственно отрицательной или положительной
связи. Параметрический, т. е. предназначенный для случаев, когда параметры исследуемых совокупностей известны, выборочный коэффициент
линейной корреляции r Карла Пирсона (1857–1936) рассчитывается по
формуле
r =
n
i=1
(xi−¯X)(yi−¯Y )
(n−1)sxs
y
,
где sx, sy– исправленные выборочные стандартные отклонения случай-
ных величин X и Y , а
1
(n−1)
n
i=1
(xi−¯X)(yi−¯Y ) – ковариация этих величин.
Иногда коэффициент корреляции называют также безразмерной ковари-
ацией [7].
Упрощая приведённую формулу, получают (напр., [8])
r =
n
i=1
(xi−¯X)(yi−¯Y )
n
i=1
(xi−¯X)
2
n
i=1
(yi−¯Y )
2
.
В табличном процессоре коэффициент корреляции можно посчитать
вызовом полностью аналогичных функций PEARSON или CORREL,
аргументами которых выступают два массива значений. Массивыаргументы должны быть согласованы по длине.
Применение r Пирсона в психологических исследованиях связано
с известными ограничениями, которые в ряде случаев могут сделать его
оценку нецелесообразной или бессмысленной. Условием применимости
коэффициента корреляции Пирсона является нормальность двумерного

Расчёт и интервальное оценивание некоторых статистических параметров 97
распределения случайных величин1, причём нарушения этого условия
могут вести к различным последствиям. Так как соответствующая проверка достаточно сложна [9], в литературе из практических соображений
часто предлагают ограничиться проверкой нормальности распределения каждой из величин. Однако известно, что из такой нормальности
ещё не следует нормальность совместного распределения (напр., [10]),
и в некоторых случаях эта проверка может оказаться недостаточной.
На рис. 3.3А показан случай, когда двумерное распределение двух нормально распределённых случайных величин не является нормальным.
А Б
Рисунок 3.3: взаимное рассеяние значений двух случайных величин, не имеющих
совместного нормального распределения. А – r ≈ 0, 65, Б – r ≈ 0, 75
Применяя коэффициент Пирсона r, в общем случае разумно иметь
в виду следующие рассуждения, частично основанные на [11]. Если хотя
бы одна случайная величина имеет распределение, отличное от нормального, их совместное распределение не может быть нормальным, и связь
между этими величинами может оказаться нелинейной. Нелинейность
может иметь место даже тогда, когда обе величины распределены нормально. Учитывая то, что r измеряет силу именно линейной связи, очень
полезным может оказаться построение простой скатерграммы (графика,
демонстрирующего разброс Y относительно X). Коробчатые (ящичковые)
1
Это условие включает в себя требования и гомоскедастичности разброса, и линейности зави-
симости переменных (напр., [7, с. 101–102]).

98 Методический справочник
диаграммы1или гистограммы частот помогают быстро оценить степень
асимметрии распределения отдельных величин.
Табличные процессоры, как правило, позволяют выполнить эти дей-
ствия простыми средствами. Так, разброс значений одной величины
относительно другой может быть показан путём вставки диаграммы
XY; группировка данных в статистический ряд выполняется с использованием массивоподобной функции FREQUENCY, принимающей
2 аргумента-массива – диапазон ячеек со значениями случайной величины и диапазон, содержащий границы интервалов группирования
статистического ряда. Результат имеет размер, на единицу превышающий размер второго аргумента; вставка функции в выделенный диапазон
ячеек осуществляется нажатием клавиш
Ctrl + Shift + Enter .
Результаты такого графического анализа могут привести исследователя к отказу от применения параметрического коэффициента в пользу более устойчивого (робастного
2
) непараметрического. Вместе с тем
они могут и подсказать способы нормализующей и/или линеаризующей
трансформации исходных данных. Так, на рис. 3.3Б показан случай очень
тесной нелинейной (экспоненциальной) связи между двумя величинами.
Довольно очевидно, что линеаризовать связь случайных величин, при
этом приблизив к нормальному их двумерное распределение, можно логарифмированием значений величины Y . После выполнения этой операции коэффициент линейной корреляции будет близок к 1, тогда как на
рис. 3.3Б r ≈ 0, 75. Однако вполне правильным решением в этой ситуации
будет и расчёт непараметрического коэффициента корреляции Спирме-
на
3
– для нашего примера он также близок к 1.
Высказываемое некоторыми психологами мнение о недопустимости
применения непараметрических коэффициентов корреляции к данным,
представленным в абсолютных или интервальных шкалах, является
ошибочным. Вероятно, оно основано на (1) неверной трактовке часто встречающихся в статистической литературе таблиц, ставящих
1
Этот тип диаграмм удобнее всего строить в специализированных программах, например, GNU
PSPP https://www.gnu.org/software/pspp/ или R https://www.r-project.org/.
2
«Свойства робастности процедуре оценивания (коэффициента корреляции – Д. Я. и др.) могут
быть приданы при использовании непараметрических ранговых статистик» [12, c. 73].
3
Чарльз Эдвард Спирмен (1863–1945) – выдающийся психолог, разработавший двухфакторную теорию интеллекта и целый ряд широко используемых математико-статистических техник –
факторный анализ и др.

Расчёт и интервальное оценивание некоторых статистических параметров 99
в соответствие различные меры корреляционной связи и типы измерительных шкал, а также на том, что (2) мощность (чувствительность)
непараметрических коэффициентов в случае двумерного нормального
распределения ниже, чем параметрического коэффициента Пирсона.
Второе действительно имеет место; приведём исчерпывающий комментарий Стентона Гланца на этот счёт: «Если параметрические методы,
требующие нормального распределения, применить к данным с иным типом распределения, это приведет к ошибочному заключению. Напротив,
непараметрические методы можно смело применять и в случае нормального распределения. Однако тогда чувствительность их будет несколько
ниже чувствительности параметрических методов. Что касается коэффициента ранговой корреляции Спирмена, то он и в этом случае (курсив
наш – Д. Я. и др.) проигрывает коэффициенту корреляции Пирсона
весьма незначительно» [8, с. 262]. Важно отметить, что коэффициент
Спирмена является фактически коэффицентом Пирсона, рассчитанным
для рангов данных. Ранжирование в данном случае выступает в роли
линеаризующей процедуры.
Таблица 3.4
Пример ранжирования
переменной X =
{70; 20; 90; 40; 50; 10; 80; 20; 40; 60}
i xi«после- итоговый
дователь- ранг
ный» ранг
6 10 1 1
2 20 2 2,5
8 20 3 2,5
4 40 4 4,5
9 40 5 4,5
5 50 6 6
10 60 7 7
1 70 8 8
7 80 9 9
3 90 10 10
Рассмотрим подробнее вычисление рангового коэффициента корреляции Спирмена. Вычисления начинают
с ранжирования каждой из двух переменных, причём меньшие значения
получают меньший ранг, б´ольшие –
б´ольший. Если в данных имеются повторяющиеся значения, им присваивается одинаковый ранг, равный среднему
их «последовательных» рангов; очевидно, не имеет значения, в какой последовательности присваиваются «последовательные» ранги внутри группы
повторяющихся значений. Пример ранжирования содержится в табл. 3.4.
Обращаем внимание читателя на то, что значения переменной X в этом
примере отсортированы для удобства, так что их порядок отличается от

100 Методический справочник
исходного, задаваемого индексом i. Восстановление исходного порядка
необходимо для дальнейшего расчёта коэффициента корреляции.
При использовании табличных процессоров для ранжирования можно
воспользоваться функцией RANK.AVG
1
, имеющей три аргумента: значение, которому присваивается ранг; ранжируемый массив, включающий
значение предыдущего аргумента; числовая переменная, задающая порядок ранжирования от большего к меньшему (0, значение по умолчанию)
или от меньшего к большему (1). Третий аргумент не является обязательным, однако в нашем случае он необходим, т.к. ранги должны присваиваться в порядке возрастания. Более привычная пользователям старых
версий табличных процессоров функция RANK имеет аналогичный синтаксис, но не столь удобна: для повторяющихся значений она возвращает
ранг, равный меньшему рангу первого повторяющегося значения, так что
для получения среднего ранга необходимо прибавлять к результату половину от уменьшенного на единицу числа повторов данного значения
2
.
Таблица 3.5
Пример предварительных
вычислений для определения r
Спирмена
i xiyiранг ранг d d
2
x
i
y
i
1 70 60 8 8 0 0
2 20 35 2 4 -2 4
3 90 80 10 9 1 1
4 45 25 5 2 3 9
5 50 45 6 6 0 0
6 10 20 1 1 0 0
7 80 90 9 10 -1 1
8 25 30 3 3 0 0
9 40 40 4 5 -1 1
10 60 50 7 7 0 0
16
Если ни одна из переменных не содержит повторяющихся значений, для
вычисления коэффициента корреляции Спирмена
3
r можно воспользоваться следующей упрощённой формулой:
r = 1 −
6
n
i=1
d
2
i
n3−n
,
где d – разность парных рангов. Эта
формула особенно удобна при ручных вычислениях, порядок которых
иллюстрируется таблицей 3.5. Если же
в данных имеются повторы, r Спирмена расчитывается как r Пирсона для
рангов
3
.
1
Эта функция с недавних пор имеется и в GoogleDocs, и в популярных офисных пакетах.
2
Пример использования функции RANK в сочетании с COUNTIF, используемой для
подсчёта соответствующих условию значений, можно увидеть на странице http://www.real-
statistics.com/correlation/spearmans-rank-correlation/.
3
Учитывая то, что r Спирмена есть r Пирсона для рангов, мы будем использовать для этих
коэффициентов единое обозначение r.
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]
