Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Социологические и психологические методы исследований в социальной работе. Учебное пособие для высшей школы

.pdf
Скачиваний:
0
Добавлен:
07.09.2026
Размер:
1 Мб
Скачать
☆
Методы анализа данных
ровка данных приводит к потере части информации. Но зато мы добиваемся ее лучшей обозримости. Таб& лица, которая в результате получится, может выгля& деть так:
Таблица 2
Данные о возрастном составе группы
ȼɨɡɪɚɫɬɧɚɹ
ɝɪɭɩɩɚ
20–29 12 40,0 12 40,0
30–39 8 26,7 20 66,7
40–49 5 16,7 25 83,4
50–59 3 10,0 28 93,4
60–69 2 6,7 30 100,1
ȼɫɟɝɨ 30 100,1 30 100,1
ɑɚɫɬɨɬɵ % ɇɚɤɨɩɥɟɧɧɵɟ
ɱɚɫɬɨɬɵ
ɇɚɤɨɩɥɟɧɧɵɟ
%
В первом столбце представлены возрастные интер&
валы. Обратим внимание, что они не пересекаются, то есть мы берем интервалы 20–29, 30–39, а не 20–30, 30–40. Иначе неясно будет, куда относить ин& дивидов, попадающих на стык возрастных групп. Во втором и третьем столбцах представлены соответ& ственно частоты и проценты. Глядя на них, мы видим, что возрастной состав группы неоднородный: в ней преобладают молодые люди, а люди старших возрас& тов встречаются реже.
В четвертом и пятом столбцах частоты и проценты
представлены в несколько иной форме, которая при& менима для упорядоченных категорий (шкал порядка или отношений). Частоты и проценты суммируются по всем предыдущим категориям. При такой форме пред& ставления данных хорошо видно, сколько человек или какая доля выборки находятся ниже (или выше) опре& деленного уровня. В нашем примере 25 человек из 30, или 83,4 %, моложе пятидесяти лет.
Данные о распределении переменной можно пред&
ставить не только в форме таблиц, но и в форме гра# фиков, которые еще более наглядны. Рассмотрим четыре типа графиков, которые чаще всего использу&
381
Глава 3
Ⱦ
ɞ
ɰ
ɭ
ɭ
ɞ
ɭ
ɭ
ɦ
ются в случае одномерного распределения. Для неупо& рядоченных категорий (шкала наименований) обычно применяют столбиковые диаграммы. Число столбиков соответствует числу категорий. Высота каждого стол& бика отражает частоту встречаемости данной катего& рии. Все столбики рисуются одинаковой ширины и не соприкасаются друг с другом. Порядок их расположе& ния на горизонтальной оси может быть любым. Для представления долей и процентов удобны круго# вые диаграммы. Весь круг соответствует единице или ста процентам, а величина каждого сектора отражает представительство соответствующей категории.
20
16
15
10
5
0
ɀɟɧɚɬ/ɡɚɦ
ɠɟɦ
ɏɨɥɨɫɬ/ɧɟ ɡɚɦ
4
Ɋɚɡɜɟɞɟɧ/ɪɚɡɜɟɞɟɧɚ
ɠɟɦ
7
2
ɚɧɧɵɟ ɨɬɫɭɬɫɬɜɭɸɬ
ɨɜɚ/ɜɞɨɜɟ
ȼ
Рис. 1. Столбиковая диа# грамма (Данные взяты из
1
ȼɞɨɜɚ/ɜɞɨɜɟɰ
6.9%
ɟɧ/ɪɚɡɜɟɞɟɧɚ
Ɋɚɡɜɟ
24.1%
ɠɟɦ
ɏɨɥɨɫɬ/ɧɟ ɡɚɦ
13.8%
Рис. 2. Круговая диаграмма (Данные из Табл. 1)
Табл. 1)
Для наглядного представления измеренных данных
(шкала равных интервалов) используются так называ& емые гистограммы и полигоны. Гистограмма похожа на столбиковую диаграмму, только на горизонтальной оси в этом случае указываются границы интервалов. Столбики примыкают друг к другу. Высота столбика соответствует наблюдаемой частоте. Гистограмму лег& ко преобразовать в полигон. Для этого середины вер& шин каждого столбца соединяются между собой пря& мыми отрезками. Получается ломаная линия, повторя& ющая контур, образуемый столбиками. Гистограмма удобна для изображения особенностей одного распре& деления. Преимущество полигона заключается в том, что на одном графике можно представить несколько полигонов и затем сравнивать между собой разные выборки.
382
ɠɟ
ɀɟɧɚɬ/ɡɚɦ
55.2%
Методы анализа данных
14
12
12
10
8
6
4
2
0
ȼɨɡɪɚɫɬɧɵɟ ɝɪɭɩɩɵ
8
5
3
2
60-7050-6040-5030-4020-30
Рис. 3. Гистограмма рас# пределения возрастов (данные из Табл. 2)
Построение таблиц и графиков — это первый шаг
статистического анализа. Следующим шагом является оценка параметров распределения. Вычисляются пока& затели, которые позволяют дать еще более сжатое опи& сание наблюдаемых значений. Эти показатели распада& ются на две основные группы: меры центральной тен# денции и меры рассеяния. К наиболее часто используемым показателям первого типа относится так называемое (арифметическое) среднее. Вычисляют его, как известно, путем суммирования значений всех на& блюдений и деления полученной суммы на общее число наблюдений. В случае сгруппированных данных посту& пают следующим образом: находят середину каждого интервала, это значение умножают на частоту, получен& ные величины складывают и делят на общее число на& блюдений. Рассматриваемый показатель характеризует область распределения, в которой концентрируются наиболее типичные представители изучаемой выборки. Но это справедливо лишь для тех случаев, когда распре& деление близко к нормальному. При таком распределе& нии основная масса значений концентрируется в его средней части, а любые отклонения встречаются тем реже, чем дальше они отстоят от центра. Например, распределение такого признака, как рост человека, в целом близко к нормальному: больше всего людей среднего роста, а очень высокие и очень маленькие по& падаются довольно редко. Средняя величина удобна для сравнения двух выборок или двух популяций. Так, мы говорим, что мужчины в среднем выше женщин, и это
14
12
10
8
6
4
2
0
ȼɨɡɪɚɫɬɧɵɟ ɝɪɭɩɩɵ
Рис. 4. Полигон распреде# ления возрастов (те же данные)
6555453525
383
утверждение вполне справедливо несмотря на то, что встречаются высокие женщины, рост которых значи& тельно превышает среднестатистический. Или, напри& мер, известно, что средний рост мужчины&пигмея мень& ше роста средней европейской женщины.
Две другие меры центральной тенденции — это мо#
да и медиана. В качестве моды берется значение, кото& рое чаще всего встречается в распределении. Моду специально вычислять не надо. Достаточно сгруппиро& вать данные и выбрать тот класс, в который попадает больше всего наблюдений. В разобранном выше при& мере (Табл. 1) лучше всего представлена категория се& мейных людей. Это и есть мода для данной выборки. Можно рассчитать среднее количество детей в совре& менной российской семье. Допустим, мы получим по& казатель 1,3. Но какой реальный смысл он будет иметь? Что такое три десятых ребенка? Правильнее сказать, что сейчас в семье чаще всего один ребенок, то есть использовать моду в качестве показателя цент& ральной тенденции. Встречаются распределения, име& ющие не одну, а две моды. Распределение такого типа называется бимодальным. На графике в этом случае мы увидим две вершины. Чаще всего это указывает на то, что выборка является неоднородной: в ней присут& ствуют два типа объектов. Констатация такого факта обычно наводит нас на мысль разбить всю выборку на две подгруппы и рассмотреть их отдельно.
Для того чтобы найти медиану, нужно ранжиро#
вать все наблюдения, то есть расположить их в поряд& ке возрастания значений. Значение того наблюдения, которое окажется как раз посредине, и будет медиа& ной. А если число наблюдений четное? Тогда сравни& вают значения двух наблюдений, попадающих в сере& дину. Если они различаются между собой, то берется их среднее арифметическое значение. В случае сгруп& пированных данных медиана рассчитывается по спе& циальной формуле. Когда распределение имеет нор& мальный вид (то есть оно симметрично), его среднее арифметическое значение и медиана совпадают. Ког& да же распределение асимметрично (скошено), медиа& на лучше схватывает его центральную тенденцию.
Выбор подходящей меры центральной тенденции
определяется как характером распределения, так и ха&
384
Глава 3
Методы анализа данных
рактером используемых данных. Качественные дан& ные (шкала наименований) допускают использование только моды. Для ранжированных данных (шкала по& рядка) допустимо использование и моды, и медианы. Количественные данные (шкала равных интервалов) можно описывать любым из трех показателей, хотя на практике чаще всего в этом случае вычисляют среднее арифметическое значение. Именно этот показатель вместе с показателем рассеяния участвует в расчете целого ряда других статистических показателей.
Показатели рассеяния характеризуют степень раз&
броса данных вокруг некоторого среднего значения. Мы говорим о значительном рассеянии тогда, когда многие значения сильно отклоняются от воображае& мого центра распределения. Специалисты по матема& тической статистике говорят, что в этом случае данные «размазаны». Про распределение, характеризующее& ся малым разбросом, говорят, пользуясь аналогией из области стрельбы, что данные ложатся кучно. Понят& но, что в первом случае среднее значение оказывается более информативным показателем, чем во втором случае, то есть оно лучше описывает выборку в целом. Например, в кордебалет идет строгий отбор танцов& щиц по росту. В результате рассеяние показателей роста в этой группе людей значительно меньше, чем по популяции в целом. Зная средний рост балерины, мож& но быть уверенным, что реальный рост любой балери& ны будет очень близок к нему. Если брать измеритель& ные инструменты, то их точность определяется степе& нью разброса получаемых с их помощью данных: чем меньше разброс, тем выше точность измерения.
Как оценить степень рассеяния значений перемен&
ной? Здесь тоже существуют разные способы, выбор которых в каждом конкретном случае определяется характером данных — их типом и распределением. Не& которое представление о рассеянии мы получаем, ког& да рассматриваем крайние члены распределения. Рас& стояние между ними называется размахом. Например, в разобранном выше примере (Табл. 2) выборка вклю& чает индивидов, чей возраст колеблется в пределах от двадцати до семидесяти лет. Общий размах составляет пятьдесят лет. Большинство людей (40 %) моложе трид& цати лет. Но в выборку попали два человека, которым
385
уже за шестьдесят. Если мы вычислим показатель цен& тральной тенденции по формуле среднего арифмети& ческого, то получим значение 36,5. Так как распреде& ление сильно скошено, этот показатель сильно отлича& ется от моды (25 лет). Медиана в этом случае лежит между этими двумя значениями (33,3).
Для более точной оценки рассеяния в случае изме&
рений по шкале равных интервалов используется по& казатель, называемый дисперсия. В этом случае учиты& вается отклонение каждого индивидуального значе& ния от среднего в одну или в другую сторону. Нас интересует сумма таких отклонений. Но в случае сим& метричного распределения эта сумма всегда обраща& ется в нуль, поскольку положительные и отрицатель& ные отклонения взаимно гасятся. Поэтому используют сумму квадратов отклонений. Квадрат любого числа — величина положительная, и эта сумма тем больше, чем больше рассеяние измерений. Сумма квадратов откло& нений от среднего, деленная на количество наблюде& ний N дает значение дисперсии. Если извлечь из этого выражения квадратный корень, то мы получим еще одну меру рассеяния — стандартное отклонение, ко& торое также называют среднеквадратическим откло& нением. Удобство этого показателя в том, что он выра& жается в тех же единицах, что и сами измеренные ве& личины.
Рассмотренный показатель очень удобен, когда
форма распределения близка к той, которая называет& ся нормальным распределением. Мы уже упоминали этот термин. Сейчас поясним, что он означает. Нор# мальное распределение — это такое распределение не& прерывного признака, которое симметрично относи& тельно среднего значения и если откладывать его зна& чения на графике, то кривая имеет вид колокола. Рост человека оказывается одним из признаков, обнаружи& вающих распределение, хорошо описываемое нор& мальной кривой. Если мы измеряем рост многих лю& дей, например — призывников в армию, а затем на ос& нове этих данных строим график, то мы получаем нормальную кривую. С точки зрения анализа данных нормальное распределение привлекательно тем, что его можно исчерпывающе описать через два парамет& ра — значение среднего и стандартного отклонения
386
Глава 3
Методы анализа данных
(дисперсии). Вместо тысяч значений — всего два чис& ла! Чрезвычайно эффективный метод сжатия инфор& мации.
Стандартное отклонение действительно позволяет
четко задавать критерии для выявления статистичес& кой нормы. Это возможно благодаря тому, что свойст& ва нормального распределения хорошо известны и до& статочно просто описываются. Так, известно, что в ди& апазоне одного стандартного отклонения в обе стороны от среднего оказывается примерно 68 % всех наблюдений, а если взять два стандартных отклоне& ния, то этот участок распределения покроет около 95 % всех случаев. Значит, за этот диапазон выходит всего 5% возможных наблюдений. Проинтерпретируем это содержательно. Что значит «высокий человек»? С точ& ки зрения статистики человек, рост которого превы& шает средний рост по данной популяции более чем на величину одного стандартного отклонения, может счи& таться высоким. А того, чей рост выделяется в положи& тельную сторону более чем на два стандартных откло& нения, следует отнести к категории очень высоких. Ведь такой рост будет встречаться не чаще, чем в трех случаях из ста.
Используя свойства нормального распределения,
можно ввести строгие количественные критерии, оп& ределяющие, что такое «нормальный вес», «нормаль& ная острота зрения» и т. д. Психологические тесты то& же создаются с опорой на эти статистические законо& мерности. Выше, в разделе о тестах, мы касались процедуры конструирования и стандартизации тес& тов. Мы там указывали, что нормы для оценки резуль& татов испытаний выводят эмпирически с использова& нием аппарата математической статистики. Теперь, после знакомства с основными идеями статистическо& го анализа, можно пояснить эту процедуру. Трудность заданий подбирается таким образом, чтобы распреде& ление результатов решения тестовых задач (число пра& вильных ответов) описывалось нормальным законом. А затем строится шкала, где среднему значению соот& ветствует сто баллов, а стандартное отклонение равно пятнадцати баллам. Выводимый показатель называет& ся коэффициентом интеллектуального развития (по& английски — intelligence quotient, или сокращен&
387
но IQ). Человек, у которого этот показатель ниже 70, считается умственно отсталым, а человека с показате& лем выше 130 относят к категории особо умственно одаренных.
Мы подробно разобрали случай, когда анализиру&
ется характер распределения одной переменной. Эти приемы очень важны, поскольку на них основаны все другие виды статистического анализа. Теперь мы мо& жем перейти к более сложному виду анализа, каким является двумерный анализ. Здесь рассматривается связь между двумя переменными. Мы имеем пары на& блюдений, полученные на одном объекте. Это могут быть, например, результаты по двум тестам. Нас инте& ресует, как один изучаемый признак связан с другим.
Важнейшей мерой связи является коэффициент
корреляции. Само слово «корреляция» как раз и озна& чает «взаимосвязь». Какого типа отношения возмож& ны между двумя переменными? Ну, во&первых, при& знаки могут быть совершенно независимыми друг от друга. Тогда изменения одного никак не связаны с из& менением другого. Мы говорим, что переменные не коррелированны между собой. Если признаки связа& ны, то сама связь может быть прямой или обратной. В первом случае большим значениям одного признака соответствуют более высокие значения другого и на& оборот. Во втором случае увеличение первого призна& ка сопровождается уменьшением второго, а уменьше& ние первого — увеличением второго. Статистики гово& рят о положительной и отрицательной корреляции. Наконец, степень связи тоже может варьироваться от максимума, когда значения одного признака позволя& ют уверенно предсказывать значения другого, до ее полного отсутствия. Коэффициент корреляции отра& жает всю гамму возможных отношений. Его значение может варьироваться от +1 до –1. Положительные значения указывают на прямую связь между перемен& ными, отрицательные — на обратную. Нуль соответст& вует случаю отсутствия корреляции.
Предположим, что у многих людей измеряют рост
и вес тела. Каждый человек описывается двумя пока& зателями, и в результате образуются два ряда измере& ний. Сравнивая между собой пары измерений, мы стремимся выявить характер связи между переменны&
388
Глава 3
Методы анализа данных
ми. Между ростом и весом тела существует довольно высокая положительная корреляция. Это значит, что высокий человек, как правило, весит больше, чем че& ловек меньшего роста. Связь эта не однозначная: вы& сокий человек может быть очень худым, а человек не& высокого роста может быть очень полным. Поэтому значение коэффициента корреляции в данном случае находится где&то между 0 и +1, видимо, чуть ближе к единице.
Коэффициент корреляции по&разному вычисляет&
ся для измеренных показателей (рост, вес) и для ран& жированных данных (оценки, предпочтения). Но его окончательная форма и интерпретация остаются теми же. Если данные носят качественный характер (муж& чина — женщина, совершеннолетний — несовершен& нолетний, работающий — пенсионер), то вместо коэф& фициента корреляции применяются другие меры свя& зи, основанные на сравнении частот. Для тех случаев, когда два ряда получены с помощью разных шкал, име& ются свои вычислительные процедуры. Но общая ло& гика анализа сохраняется.
Следует специально остановиться на вопросе ин&
терпретации данных двумерного анализа, поскольку здесь требуется известная осторожность. Мы каса& лись этой проблемы в первой главе, когда обсуждали момент перехода от научного описания к объяснению. Там отмечалось, что сам факт наличия связи двух пере& менных еще не позволяет утверждать существование причинно&следственных отношений между ними. Корреляция может указывать на такие отношения, но одной этой информации недостаточно, чтобы де& лать однозначные выводы. Тогда мы пояснили это на примере интерпретации уровня интеллекта родителей и детей. Сейчас имеет смысл вернуться к данной про& блеме и рассмотреть ее глубже.
Итак, в ряде случаев корреляция между двумя пере&
менными отражает то обстоятельство, что они связаны между собой, как причина и следствие. Но причинно& следственные отношения — это лишь один из возмож& ных типов связи. Определенно можно утверждать только следующее: если два явления никак не связаны между собой, то заведомо исключены любые взаимо& влияния. Отсутствие корреляции опровергает гипоте&
389
зу о возможных связях причинно&следственного ха& рактера, и такой отрицательный результат может быть полезен в плане уточнения теории.
Отношения между двумя коррелированными пере&
менными X и Y могут быть содержательно самыми разными:
1. 2.
4.
A B C...X
XYXYXY
3.
A
Y
Случай 1: явление Х вызывает явление Y, выступает
как его причина.
Случай 2: явления Х и Y взаимно обусловливают
друг друга.
Случай 3: некоторое третье явление А вызывает яв&
ление Х и явление Y, выступает как причина их обоих.
Случай 4: явление Х вызывает явление Y, действуя
в комплексе с другими факторами.
Для иллюстрации приведем пример. Он похож на
шутку, но хорошо демонстрирует суть проблемы. Если сравнивать между собой два показателя — потребление мороженого и количество утонувших, то между ними можно обнаружить положительную корреляцию. Зна& чит ли это, что любовь к мороженому приводит к не& счастным случаям на воде или (совершенно абсурдный вывод) что отношение здесь обратное? Конечно, нет. Очевидно, что есть некий третий фактор, который объ& ясняет оба явления. Это — температура воздуха. В жар& кую погоду едят много мороженого и купаются. В холод& ную погоду потребление мороженого и количество купа& ющихся резко падает. Понятно, что в эти дни почти никто не тонет. Перед нами ситуация, соответствующая третьему из схематически представленных случаев.
Социальные науки чаще всего имеют дело с явле&
ниями, которые отличаются множественной детерми& нацией и контекстуальным характером. Здесь трудно устранить влияние посторонних переменных, выде& лить явление в чистом виде. Поэтому необходима осо& бая тщательность в интерпретации наблюдаемых фак& тов. Для того чтобы избежать необоснованных выво&
390
Глава 3
X
Y
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]