Добавил:
ivanov666
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз:
Предмет:
Файл:Социологические и психологические методы исследований в социальной работе. Учебное пособие для высшей школы
.pdf
Методы анализа данных
ровка данных приводит к потере части информации.
Но зато мы добиваемся ее лучшей обозримости. Таб&
лица, которая в результате получится, может выгля&
деть так:
Таблица 2
Данные о возрастном составе группы
ȼɨɡɪɚɫɬɧɚɹ
ɝɪɭɩɩɚ
20–29 12 40,0 12 40,0
30–39 8 26,7 20 66,7
40–49 5 16,7 25 83,4
50–59 3 10,0 28 93,4
60–69 2 6,7 30 100,1
ȼɫɟɝɨ 30 100,1 30 100,1
ɑɚɫɬɨɬɵ % ɇɚɤɨɩɥɟɧɧɵɟ
ɱɚɫɬɨɬɵ
ɇɚɤɨɩɥɟɧɧɵɟ
%
В первом столбце представлены возрастные интер&
валы. Обратим внимание, что они не пересекаются,
то есть мы берем интервалы 20–29, 30–39, а не
20–30, 30–40. Иначе неясно будет, куда относить ин&
дивидов, попадающих на стык возрастных групп.
Во втором и третьем столбцах представлены соответ&
ственно частоты и проценты. Глядя на них, мы видим,
что возрастной состав группы неоднородный: в ней
преобладают молодые люди, а люди старших возрас&
тов встречаются реже.
В четвертом и пятом столбцах частоты и проценты
представлены в несколько иной форме, которая при&
менима для упорядоченных категорий (шкал порядка
или отношений). Частоты и проценты суммируются по
всем предыдущим категориям. При такой форме пред&
ставления данных хорошо видно, сколько человек или
какая доля выборки находятся ниже (или выше) опре&
деленного уровня. В нашем примере 25 человек из 30,
или 83,4 %, моложе пятидесяти лет.
Данные о распределении переменной можно пред&
ставить не только в форме таблиц, но и в форме гра#
фиков, которые еще более наглядны. Рассмотрим
четыре типа графиков, которые чаще всего использу&
381

Глава 3
Ⱦ
ɞ
ɰ
ɭ
ɭ
ɞ
ɭ
ɭ
ɦ
ются в случае одномерного распределения. Для неупо&
рядоченных категорий (шкала наименований) обычно
применяют столбиковые диаграммы. Число столбиков
соответствует числу категорий. Высота каждого стол&
бика отражает частоту встречаемости данной катего&
рии. Все столбики рисуются одинаковой ширины и не
соприкасаются друг с другом. Порядок их расположе&
ния на горизонтальной оси может быть любым.
Для представления долей и процентов удобны круго#
вые диаграммы. Весь круг соответствует единице или
ста процентам, а величина каждого сектора отражает
представительство соответствующей категории.
20
16
15
10
5
0
ɀɟɧɚɬ/ɡɚɦ
ɠɟɦ
ɏɨɥɨɫɬ/ɧɟ ɡɚɦ
4
Ɋɚɡɜɟɞɟɧ/ɪɚɡɜɟɞɟɧɚ
ɠɟɦ
7
2
ɚɧɧɵɟ ɨɬɫɭɬɫɬɜɭɸɬ
ɨɜɚ/ɜɞɨɜɟ
ȼ
Рис. 1. Столбиковая диа#
грамма (Данные взяты из
1
ȼɞɨɜɚ/ɜɞɨɜɟɰ
6.9%
ɟɧ/ɪɚɡɜɟɞɟɧɚ
Ɋɚɡɜɟ
24.1%
ɠɟɦ
ɏɨɥɨɫɬ/ɧɟ ɡɚɦ
13.8%
Рис. 2. Круговая диаграмма
(Данные из Табл. 1)
Табл. 1)
Для наглядного представления измеренных данных
(шкала равных интервалов) используются так называ&
емые гистограммы и полигоны. Гистограмма похожа
на столбиковую диаграмму, только на горизонтальной
оси в этом случае указываются границы интервалов.
Столбики примыкают друг к другу. Высота столбика
соответствует наблюдаемой частоте. Гистограмму лег&
ко преобразовать в полигон. Для этого середины вер&
шин каждого столбца соединяются между собой пря&
мыми отрезками. Получается ломаная линия, повторя&
ющая контур, образуемый столбиками. Гистограмма
удобна для изображения особенностей одного распре&
деления. Преимущество полигона заключается в том,
что на одном графике можно представить несколько
полигонов и затем сравнивать между собой разные
выборки.
382
ɠɟ
ɀɟɧɚɬ/ɡɚɦ
55.2%

Методы анализа данных
14
12
12
10
8
6
4
2
0
ȼɨɡɪɚɫɬɧɵɟ ɝɪɭɩɩɵ
8
5
3
2
60-7050-6040-5030-4020-30
Рис. 3. Гистограмма рас#
пределения возрастов
(данные из Табл. 2)
Построение таблиц и графиков — это первый шаг
статистического анализа. Следующим шагом является
оценка параметров распределения. Вычисляются пока&
затели, которые позволяют дать еще более сжатое опи&
сание наблюдаемых значений. Эти показатели распада&
ются на две основные группы: меры центральной тен#
денции и меры рассеяния. К наиболее часто
используемым показателям первого типа относится так
называемое (арифметическое) среднее. Вычисляют его,
как известно, путем суммирования значений всех на&
блюдений и деления полученной суммы на общее число
наблюдений. В случае сгруппированных данных посту&
пают следующим образом: находят середину каждого
интервала, это значение умножают на частоту, получен&
ные величины складывают и делят на общее число на&
блюдений. Рассматриваемый показатель характеризует
область распределения, в которой концентрируются
наиболее типичные представители изучаемой выборки.
Но это справедливо лишь для тех случаев, когда распре&
деление близко к нормальному. При таком распределе&
нии основная масса значений концентрируется в его
средней части, а любые отклонения встречаются тем
реже, чем дальше они отстоят от центра. Например,
распределение такого признака, как рост человека,
в целом близко к нормальному: больше всего людей
среднего роста, а очень высокие и очень маленькие по&
падаются довольно редко. Средняя величина удобна для
сравнения двух выборок или двух популяций. Так, мы
говорим, что мужчины в среднем выше женщин, и это
14
12
10
8
6
4
2
0
ȼɨɡɪɚɫɬɧɵɟ ɝɪɭɩɩɵ
Рис. 4. Полигон распреде#
ления возрастов (те же
данные)
6555453525
383

утверждение вполне справедливо несмотря на то, что
встречаются высокие женщины, рост которых значи&
тельно превышает среднестатистический. Или, напри&
мер, известно, что средний рост мужчины&пигмея мень&
ше роста средней европейской женщины.
Две другие меры центральной тенденции — это мо#
да и медиана. В качестве моды берется значение, кото&
рое чаще всего встречается в распределении. Моду
специально вычислять не надо. Достаточно сгруппиро&
вать данные и выбрать тот класс, в который попадает
больше всего наблюдений. В разобранном выше при&
мере (Табл. 1) лучше всего представлена категория се&
мейных людей. Это и есть мода для данной выборки.
Можно рассчитать среднее количество детей в совре&
менной российской семье. Допустим, мы получим по&
казатель 1,3. Но какой реальный смысл он будет
иметь? Что такое три десятых ребенка? Правильнее
сказать, что сейчас в семье чаще всего один ребенок,
то есть использовать моду в качестве показателя цент&
ральной тенденции. Встречаются распределения, име&
ющие не одну, а две моды. Распределение такого типа
называется бимодальным. На графике в этом случае
мы увидим две вершины. Чаще всего это указывает на
то, что выборка является неоднородной: в ней присут&
ствуют два типа объектов. Констатация такого факта
обычно наводит нас на мысль разбить всю выборку на
две подгруппы и рассмотреть их отдельно.
Для того чтобы найти медиану, нужно ранжиро#
вать все наблюдения, то есть расположить их в поряд&
ке возрастания значений. Значение того наблюдения,
которое окажется как раз посредине, и будет медиа&
ной. А если число наблюдений четное? Тогда сравни&
вают значения двух наблюдений, попадающих в сере&
дину. Если они различаются между собой, то берется
их среднее арифметическое значение. В случае сгруп&
пированных данных медиана рассчитывается по спе&
циальной формуле. Когда распределение имеет нор&
мальный вид (то есть оно симметрично), его среднее
арифметическое значение и медиана совпадают. Ког&
да же распределение асимметрично (скошено), медиа&
на лучше схватывает его центральную тенденцию.
Выбор подходящей меры центральной тенденции
определяется как характером распределения, так и ха&
384
Глава 3

Методы анализа данных
рактером используемых данных. Качественные дан&
ные (шкала наименований) допускают использование
только моды. Для ранжированных данных (шкала по&
рядка) допустимо использование и моды, и медианы.
Количественные данные (шкала равных интервалов)
можно описывать любым из трех показателей, хотя на
практике чаще всего в этом случае вычисляют среднее
арифметическое значение. Именно этот показатель
вместе с показателем рассеяния участвует в расчете
целого ряда других статистических показателей.
Показатели рассеяния характеризуют степень раз&
броса данных вокруг некоторого среднего значения.
Мы говорим о значительном рассеянии тогда, когда
многие значения сильно отклоняются от воображае&
мого центра распределения. Специалисты по матема&
тической статистике говорят, что в этом случае данные
«размазаны». Про распределение, характеризующее&
ся малым разбросом, говорят, пользуясь аналогией из
области стрельбы, что данные ложатся кучно. Понят&
но, что в первом случае среднее значение оказывается
более информативным показателем, чем во втором
случае, то есть оно лучше описывает выборку в целом.
Например, в кордебалет идет строгий отбор танцов&
щиц по росту. В результате рассеяние показателей
роста в этой группе людей значительно меньше, чем по
популяции в целом. Зная средний рост балерины, мож&
но быть уверенным, что реальный рост любой балери&
ны будет очень близок к нему. Если брать измеритель&
ные инструменты, то их точность определяется степе&
нью разброса получаемых с их помощью данных: чем
меньше разброс, тем выше точность измерения.
Как оценить степень рассеяния значений перемен&
ной? Здесь тоже существуют разные способы, выбор
которых в каждом конкретном случае определяется
характером данных — их типом и распределением. Не&
которое представление о рассеянии мы получаем, ког&
да рассматриваем крайние члены распределения. Рас&
стояние между ними называется размахом. Например,
в разобранном выше примере (Табл. 2) выборка вклю&
чает индивидов, чей возраст колеблется в пределах от
двадцати до семидесяти лет. Общий размах составляет
пятьдесят лет. Большинство людей (40 %) моложе трид&
цати лет. Но в выборку попали два человека, которым
385

уже за шестьдесят. Если мы вычислим показатель цен&
тральной тенденции по формуле среднего арифмети&
ческого, то получим значение 36,5. Так как распреде&
ление сильно скошено, этот показатель сильно отлича&
ется от моды (25 лет). Медиана в этом случае лежит
между этими двумя значениями (33,3).
Для более точной оценки рассеяния в случае изме&
рений по шкале равных интервалов используется по&
казатель, называемый дисперсия. В этом случае учиты&
вается отклонение каждого индивидуального значе&
ния от среднего в одну или в другую сторону. Нас
интересует сумма таких отклонений. Но в случае сим&
метричного распределения эта сумма всегда обраща&
ется в нуль, поскольку положительные и отрицатель&
ные отклонения взаимно гасятся. Поэтому используют
сумму квадратов отклонений. Квадрат любого числа —
величина положительная, и эта сумма тем больше, чем
больше рассеяние измерений. Сумма квадратов откло&
нений от среднего, деленная на количество наблюде&
ний N дает значение дисперсии. Если извлечь из этого
выражения квадратный корень, то мы получим еще
одну меру рассеяния — стандартное отклонение, ко&
торое также называют среднеквадратическим откло&
нением. Удобство этого показателя в том, что он выра&
жается в тех же единицах, что и сами измеренные ве&
личины.
Рассмотренный показатель очень удобен, когда
форма распределения близка к той, которая называет&
ся нормальным распределением. Мы уже упоминали
этот термин. Сейчас поясним, что он означает. Нор#
мальное распределение — это такое распределение не&
прерывного признака, которое симметрично относи&
тельно среднего значения и если откладывать его зна&
чения на графике, то кривая имеет вид колокола. Рост
человека оказывается одним из признаков, обнаружи&
вающих распределение, хорошо описываемое нор&
мальной кривой. Если мы измеряем рост многих лю&
дей, например — призывников в армию, а затем на ос&
нове этих данных строим график, то мы получаем
нормальную кривую. С точки зрения анализа данных
нормальное распределение привлекательно тем, что
его можно исчерпывающе описать через два парамет&
ра — значение среднего и стандартного отклонения
386
Глава 3

Методы анализа данных
(дисперсии). Вместо тысяч значений — всего два чис&
ла! Чрезвычайно эффективный метод сжатия инфор&
мации.
Стандартное отклонение действительно позволяет
четко задавать критерии для выявления статистичес&
кой нормы. Это возможно благодаря тому, что свойст&
ва нормального распределения хорошо известны и до&
статочно просто описываются. Так, известно, что в ди&
апазоне одного стандартного отклонения в обе
стороны от среднего оказывается примерно 68 % всех
наблюдений, а если взять два стандартных отклоне&
ния, то этот участок распределения покроет около 95 %
всех случаев. Значит, за этот диапазон выходит всего
5% возможных наблюдений. Проинтерпретируем это
содержательно. Что значит «высокий человек»? С точ&
ки зрения статистики человек, рост которого превы&
шает средний рост по данной популяции более чем на
величину одного стандартного отклонения, может счи&
таться высоким. А того, чей рост выделяется в положи&
тельную сторону более чем на два стандартных откло&
нения, следует отнести к категории очень высоких.
Ведь такой рост будет встречаться не чаще, чем в трех
случаях из ста.
Используя свойства нормального распределения,
можно ввести строгие количественные критерии, оп&
ределяющие, что такое «нормальный вес», «нормаль&
ная острота зрения» и т. д. Психологические тесты то&
же создаются с опорой на эти статистические законо&
мерности. Выше, в разделе о тестах, мы касались
процедуры конструирования и стандартизации тес&
тов. Мы там указывали, что нормы для оценки резуль&
татов испытаний выводят эмпирически с использова&
нием аппарата математической статистики. Теперь,
после знакомства с основными идеями статистическо&
го анализа, можно пояснить эту процедуру. Трудность
заданий подбирается таким образом, чтобы распреде&
ление результатов решения тестовых задач (число пра&
вильных ответов) описывалось нормальным законом.
А затем строится шкала, где среднему значению соот&
ветствует сто баллов, а стандартное отклонение равно
пятнадцати баллам. Выводимый показатель называет&
ся коэффициентом интеллектуального развития (по&
английски — intelligence quotient, или сокращен&
387

но IQ). Человек, у которого этот показатель ниже 70,
считается умственно отсталым, а человека с показате&
лем выше 130 относят к категории особо умственно
одаренных.
Мы подробно разобрали случай, когда анализиру&
ется характер распределения одной переменной. Эти
приемы очень важны, поскольку на них основаны все
другие виды статистического анализа. Теперь мы мо&
жем перейти к более сложному виду анализа, каким
является двумерный анализ. Здесь рассматривается
связь между двумя переменными. Мы имеем пары на&
блюдений, полученные на одном объекте. Это могут
быть, например, результаты по двум тестам. Нас инте&
ресует, как один изучаемый признак связан с другим.
Важнейшей мерой связи является коэффициент
корреляции. Само слово «корреляция» как раз и озна&
чает «взаимосвязь». Какого типа отношения возмож&
ны между двумя переменными? Ну, во&первых, при&
знаки могут быть совершенно независимыми друг от
друга. Тогда изменения одного никак не связаны с из&
менением другого. Мы говорим, что переменные не
коррелированны между собой. Если признаки связа&
ны, то сама связь может быть прямой или обратной.
В первом случае большим значениям одного признака
соответствуют более высокие значения другого и на&
оборот. Во втором случае увеличение первого призна&
ка сопровождается уменьшением второго, а уменьше&
ние первого — увеличением второго. Статистики гово&
рят о положительной и отрицательной корреляции.
Наконец, степень связи тоже может варьироваться от
максимума, когда значения одного признака позволя&
ют уверенно предсказывать значения другого, до ее
полного отсутствия. Коэффициент корреляции отра&
жает всю гамму возможных отношений. Его значение
может варьироваться от +1 до –1. Положительные
значения указывают на прямую связь между перемен&
ными, отрицательные — на обратную. Нуль соответст&
вует случаю отсутствия корреляции.
Предположим, что у многих людей измеряют рост
и вес тела. Каждый человек описывается двумя пока&
зателями, и в результате образуются два ряда измере&
ний. Сравнивая между собой пары измерений, мы
стремимся выявить характер связи между переменны&
388
Глава 3

Методы анализа данных
ми. Между ростом и весом тела существует довольно
высокая положительная корреляция. Это значит, что
высокий человек, как правило, весит больше, чем че&
ловек меньшего роста. Связь эта не однозначная: вы&
сокий человек может быть очень худым, а человек не&
высокого роста может быть очень полным. Поэтому
значение коэффициента корреляции в данном случае
находится где&то между 0 и +1, видимо, чуть ближе
к единице.
Коэффициент корреляции по&разному вычисляет&
ся для измеренных показателей (рост, вес) и для ран&
жированных данных (оценки, предпочтения). Но его
окончательная форма и интерпретация остаются теми
же. Если данные носят качественный характер (муж&
чина — женщина, совершеннолетний — несовершен&
нолетний, работающий — пенсионер), то вместо коэф&
фициента корреляции применяются другие меры свя&
зи, основанные на сравнении частот. Для тех случаев,
когда два ряда получены с помощью разных шкал, име&
ются свои вычислительные процедуры. Но общая ло&
гика анализа сохраняется.
Следует специально остановиться на вопросе ин&
терпретации данных двумерного анализа, поскольку
здесь требуется известная осторожность. Мы каса&
лись этой проблемы в первой главе, когда обсуждали
момент перехода от научного описания к объяснению.
Там отмечалось, что сам факт наличия связи двух пере&
менных еще не позволяет утверждать существование
причинно&следственных отношений между ними.
Корреляция может указывать на такие отношения,
но одной этой информации недостаточно, чтобы де&
лать однозначные выводы. Тогда мы пояснили это на
примере интерпретации уровня интеллекта родителей
и детей. Сейчас имеет смысл вернуться к данной про&
блеме и рассмотреть ее глубже.
Итак, в ряде случаев корреляция между двумя пере&
менными отражает то обстоятельство, что они связаны
между собой, как причина и следствие. Но причинно&
следственные отношения — это лишь один из возмож&
ных типов связи. Определенно можно утверждать
только следующее: если два явления никак не связаны
между собой, то заведомо исключены любые взаимо&
влияния. Отсутствие корреляции опровергает гипоте&
389

зу о возможных связях причинно&следственного ха&
рактера, и такой отрицательный результат может быть
полезен в плане уточнения теории.
Отношения между двумя коррелированными пере&
менными X и Y могут быть содержательно самыми
разными:
1. 2.
4.
A B C...X
XYXYXY
3.
A
Y
Случай 1: явление Х вызывает явление Y, выступает
как его причина.
Случай 2: явления Х и Y взаимно обусловливают
друг друга.
Случай 3: некоторое третье явление А вызывает яв&
ление Х и явление Y, выступает как причина их обоих.
Случай 4: явление Х вызывает явление Y, действуя
в комплексе с другими факторами.
Для иллюстрации приведем пример. Он похож на
шутку, но хорошо демонстрирует суть проблемы. Если
сравнивать между собой два показателя — потребление
мороженого и количество утонувших, то между ними
можно обнаружить положительную корреляцию. Зна&
чит ли это, что любовь к мороженому приводит к не&
счастным случаям на воде или (совершенно абсурдный
вывод) что отношение здесь обратное? Конечно, нет.
Очевидно, что есть некий третий фактор, который объ&
ясняет оба явления. Это — температура воздуха. В жар&
кую погоду едят много мороженого и купаются. В холод&
ную погоду потребление мороженого и количество купа&
ющихся резко падает. Понятно, что в эти дни почти
никто не тонет. Перед нами ситуация, соответствующая
третьему из схематически представленных случаев.
Социальные науки чаще всего имеют дело с явле&
ниями, которые отличаются множественной детерми&
нацией и контекстуальным характером. Здесь трудно
устранить влияние посторонних переменных, выде&
лить явление в чистом виде. Поэтому необходима осо&
бая тщательность в интерпретации наблюдаемых фак&
тов. Для того чтобы избежать необоснованных выво&
390
Глава 3
X
Y
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]
