Добавил:
ivanov666
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз:
Предмет:
Файл:Социологические и психологические методы исследований в социальной работе. Учебное пособие для высшей школы
.pdf
Методы анализа данных
дов, исследователь должен обладать определенной ме&
тодологической культурой, понимать, какого рода под&
водные камни могут встретиться на этом пути.
Корреляционный анализ представляет собой метод
выявления связи между двумя переменными. Если чис&
ло переменных больше двух, то можно, вообще говоря,
рассматривать каждую пару отдельно. Но существуют
приемы, специально разработанные для данных такого
рода, которые в совокупности носят название много#
мерный анализ. Мы кратко рассмотрим один из этих
методов — факторный анализ, который довольно часто
используется в социальных исследованиях. В вычисли&
тельном плане он весьма сложен, но использование
компьютера существенно упрощает дело. Современно&
му исследователю не надо вдаваться в тонкости вычис&
лительной процедуры, а достаточно понимать возмож&
ности этого метода и знать особенности работы с ним.
Факторный анализ является своеобразным развити&
ем метода множественных корреляций. Вначале рассчи&
тываются коэффициенты корреляции между парами
переменных. Затем чисто математически получают не&
сколько общих факторов, связанных с группами изучае&
мых признаков. Поскольку число таких факторов мень&
ше числа исходных переменных, и этот вид анализа
можно рассматривать как способ сжатия информации,
приведения ее к более компактному виду. Последний
этап анализа — содержательная интерпретация полу&
ченных факторов. Ее осуществляет сам исследователь,
выявляя те переменные (признаки), которые теснее все&
го связаны с каждым фактором. Например, исследуются
интересы людей. Если вокруг одного фактора группиру&
ются такие виды активности, как посещение театра,
концертов, художественных выставок, то мы назовем
такой фактор «эстетические интересы». Другим факто&
ром может быть, например, интерес к спорту. В резуль&
тате мы получаем несколько групп однотипных интере&
сов. С точки зрения структуры данных отдельный
фактор представляет собой как бы интегральный инди&
катор, выявляющий комплекс взаимосвязанных прояв&
лений. Еще один пример. Исследование качества обслу&
живания в доме престарелых путем опроса его обитате&
лей выявило два главных фактора удовлетворенности:
отношение персонала (доброта, отзывчивость, уваже&
391

ние, готовность помочь, расторопность) и условия со&
держания (состояние здания и территории, оборудова&
ние комнат, чистота, качество питания).
Итак, факторный анализ является объективным ме&
тодом выявления структуры изучаемых данных. Его
можно рассматривать как количественный аналог типо&
логического анализа, проводимого на качественном
уровне. Будучи формальным аппаратом, факторный
анализ не может гарантировать, что получаемые ре&
зультаты будут интересными, с точки зрения исследо&
вателя. Например, иногда выделяемые факторы трудно
содержательно интерпретировать: в них входят доволь&
но разнородные компоненты, которые трудно объеди&
нить каким&то общим понятием. Во всяком случае, как
любой метод вообще, факторный анализ сам по себе не
может быть хорошим или плохим, эффективным или
бесполезным. Все зависит от того, насколько уместно
он применяется, в какой степени он соответствует зада&
чам исследования и характеру анализируемых данных.
2.2. Статистический вывод
Теперь обратимся ко второй большой группе коли&
чественных методов анализа, на основе которых дела&
ется статистический вывод. В этом случае стоит зада&
ча перехода от отдельной выборки к характеристикам
(параметрам) генеральной совокупности, то есть всего
класса объектов в целом. Дело в том, что исследователь
редко имеет возможность изучать всех представите&
лей какой&то группы или социальной категории. Мож&
но, например, обследовать все многодетные семьи,
проживающие в данном микрорайоне. Но тогда выво&
ды в полной мере будут относиться лишь к этой кон&
кретной группе людей. Насколько они справедливы
для многодетных семей всего города или области? Что&
бы ответить на этот вопрос, нужно знать, насколько
типична или специфична обследованная группа. Если
она типична, то сходные проблемы выявятся и у дру&
гих многодетных семей. Если группа очень специфич&
на, то мы не имеем права обобщать полученные дан&
ные. На языке статистики это значит, что наша выбор&
ка принадлежит к другой генеральной совокупности.
392
Глава 3

Методы анализа данных
Опять мы сталкиваемся с задачей сравнения характе&
ристик выборки и генеральной совокупности, с необ&
ходимостью суждения об их тождестве или различии.
В реальной практике исследования вопрос чаще все&
го ставится несколько иначе, но логически он относится
к тому же классу. Требуется сравнить две группы (вы&
борки) и решить, насколько значимо они различаются
между собой. Любой эксперимент предполагает оценку
эффекта изучаемого воздействия. Исследователь в этом
случае стремится показать, что экспериментальная груп&
па существенно отличается в интересующем его отноше&
нии от контрольной группы. Оценивая эффективность
образовательных программ, лечебных и оздоровитель&
ных мероприятий, мы смотрим, насколько существенны&
ми оказываются позитивные сдвиги. И что называть
сдвигом? Если больной выздоровел, то это — явный ка&
чественный сдвиг. Если ему стало легче, его меньше бес&
покоят боли, то это некоторый количественный сдвиг.
Но можно ли говорить о переходе из одного состояния
в другое? Для этого нам нужны критерии тождества или
различия двух состояний. Статистика в этой второй сво&
ей роли предлагает определенные формальные правила,
позволяющие делать такого рода выводы.
Общая логика рассуждений такова. У нас есть два
множества объектов. Если различие между ними по
какому&то параметру настолько очевидное, что эти два
множества не пересекаются, мы с уверенностью гово&
рим, что это два разных класса объектов. Например,
если минимальное значение дохода в одной группе на&
селения превышает максимальное значение дохода
в другой группе, то мы в праве утверждать, что группы
различаются по своему материальному положению.
Но это случай весьма тривиальный. Никому не придет
в голову проводить исследования, чтобы доказать, что
слон больше муравья. Это очевидно. Наука имеет дело
с нетривиальными задачами, то есть с такими ситуаци&
ями, где на основании имеющихся знаний мы выдвига&
ем какие&то более или менее правдоподобные гипоте&
зы, которые еще нуждаются в проверке и в доказа&
тельстве. Обычный случай, с которым имеет дело
ученый, — это частично пересекающиеся множества
(частично перекрывающиеся распределения). Вот тут
и встает проблема различения и отождествления.
393

Проблема осложняется тем, что, кроме нечеткости
категорий (математики в этом случае говорят о размы&
тых множествах), нужно учитывать возможность вся&
кого рода ошибок. Ошибки измерений связаны с точ&
ностью тех инструментов, которые мы используем.
Никакой инструмент не дает абсолютной точности из&
мерений. А надежность тех методов сбора информа&
ции, которыми пользуются исследователи в социаль&
ных науках, далеко уступает надежности физических
приборов. Кроме того, нужно учитывать возможную
ошибку выборки. Так как для исследования берутся
только некоторые экземпляры, у нас нет никакой га&
рантии, что они являются типичными представителя&
ми популяции в целом. Рассмотренные нами ранее
способы корректного построения выборки направле&
ны на устранение систематической ошибки. Но слу&
чайные ошибки полностью исключить невозможно.
Статистика не претендует на то, чтобы сделать наши
суждения абсолютно достоверными. Она ставит перед
собой более скромную задачу: оценить степень надеж&
ности получаемых данных и степень надежности тех
выводов, которые делаются на их основе. Для этой це&
ли используется аппарат теории вероятностей.
Нетрудно доказать, что ошибка выборки зависит от
двух моментов: от размера выборки и от степени вари&
ации признака, который нас интересует. Чем больше
выборка, тем меньше вероятность того, что в нее попа&
дут индивиды с крайними значениями исследуемой
переменной. С другой стороны, чем меньше степень
вариации признака, тем в целом ближе будет каждое
значение к истинному среднему. Размер выборки нам
известен. А степень вариации признака можно при&
мерно оценить по степени разброса данных. Таким об&
разом, зная размер выборки и получив меру рассеяния
наблюдений, нетрудно вывести показатель, который
называется стандартная ошибка среднего. Он дает
нам интервал, в котором должна лежать истинная
средняя популяции.
Описанная процедура основана на том факте, что
ошибки выборки и ошибки измерений вообще подчи&
няются нормальному закону, поскольку они обуслов&
лены множеством случайных факторов. При этом со&
вершенно не обязательно, чтобы само распределение
394
Глава 3

Методы анализа данных
данных имело нормальный вид. Представим себе, что
мы изучаем разные случайные выборки из одной гене&
ральной совокупности. Оценки среднего, получаемые
в каждом случае, будут несколько различаться между
собой, но в целом они будут группироваться вокруг ис&
тинного значения. Если построить распределение этих
оценок, то оно окажется нормальным. В центре его бу&
дет лежать среднее по генеральной совокупности,
а стандартное отклонение будет равно стандартной
ошибке среднего. Но последний показатель, как мы
видели, можно вывести и на основании одной выбор&
ки. Он вычисляется по формуле: стандартное отклоне&
ние деленное на корень квадратный из числа наблюде&
ний. Теперь, зная свойства нормального распределе&
ния, можно указать интервал, в котором должно
находиться истинное среднее. Выше, рассматривая
свойства нормального распределения, мы отмечали,
что в диапазоне двух стандартных отклонений в обе
стороны от среднего сосредоточено примерно 95 %
всех случаев. Значит, вероятность получить значение,
выходящее за эти пределы, не превышает 5 %, то есть
такие ошибки будут встречаться не чаще, чем один раз
из 20 случаев. С вероятностью 0,95 можно утверждать,
что истинное значение лежит в указанных границах,
которые задают доверительный интервал.
Итак, поскольку какая&то вероятность ошибки все&
гда присутствует, мы вводим количественную меру на&
дежности наших выводов. Все статистические крите&
рии построены по этому принципу. Уровень 95 % при&
нят как соответствующий достаточной надежности
суждений. Если мы стремимся к еще большей надеж&
ности, то можно взять 99 % уровень. Это означает, что
случайная ошибка допускается не чаще, чем в одном
случае из ста. Точные доверительные границы для 95 %
±
уровня составляют
го, а для 99 % уровня мы используем коэффициент 2,58.
В первом случае вне этого интервала остается не более
5 % возможных значений (по 2,5 % с каждой стороны).
Во втором случае — не больше 1 % (по 0,5 % с каждой
стороны). Рассмотрим пример. Допустим, что в неко&
торой группе безработных из 25 человек средний воз&
раст оказался 32 года. А массовые исследования гово&
рят, что средний возраст для этой категории составля&
1,96 стандартной ошибки средне&
395

Глава 3
ет 40 лет, а стандартное отклонение составляет 6 лет.
Нас интересует вопрос, типична или нетипична наша
выборка. Если это перевести на язык статистики,
то мы спрашиваем, можно ли объяснить различие
средних ошибкой выборки.
Статистический вывод представляет собой процесс
проверки гипотез. Причем первоначально всегда вы&
двигается предположение, что наблюдаемые различия
носят случайный характер, то есть выборка принадле&
жит к той же генеральной совокупности. В статистике
такое предположение получило название нулевая ги#
потеза. Итак, мы полагаем для начала, что наша вы&
борка вполне типична. А затем мы спрашиваем: Како&
ва вероятность получить выборку с таким средним (32
года) из генеральной совокупности, средний возраст
которой нам известен (40 лет)? Мы знаем, что при мно&
гократных испытаниях получаемые значения будут
распределены нормально, и средняя этого распределе&
ния будет равна 40 годам. Стандартную ошибку при
условии, что мы будем каждый раз брать по 25 чело&
век, можно рассчитать по известной нам формуле: мы
делим 6 (стандартное отклонение) на корень квадрат&
ный из 25 и получаем значение 1,2 года (стандартная
ошибка среднего). Затем вычисляется доверительный
интервал, который в нашем случае при уровне досто&
верности в 95 % составит:
±
1,96 · 1,2 года = 40 ±2,35 года (т. е. от 37, 65 до 42, 35)
40
Значение среднего для нашей выборки (32) лежит
вне найденного диапазона. Это может означать, что:
а) либо мы наткнулись на тот чрезвычайно редкий
случай, который лежит на самом краю распределения;
б) либо наше предположение, что два средних (по
выборке и по генеральной совокупности) не различа&
ются, ошибочно.
Если основываться только на имеющихся данных,
то мы имеем основание отклонить нулевую гипотезу,
то есть считать, что наша группа какая&то особая. Мы
говорим, что различие между средними статистичес#
ки значимо на уровне p < 0,05. Вероятность ошибки со&
ставляет менее 5 %, и поэтому мы с достаточной уве&
ренностью утверждаем, что различие не случайно. Ес&
396

Методы анализа данных
ли мы задаем более строгий критерий (99 %), то у нас
еще больше оснований отклонить нулевую гипотезу.
Мы говорим тогда, что различие статистически высо#
ко значимо. Для социальных исследований 95 % уро&
вень значимости считается вполне приемлемым.
Разобранный пример иллюстрирует случай сравне&
ния эмпирического и теоретического распределения.
Аналогичная процедура применяется и тогда, когда
требуется оценить различие двух выборок. Мы исхо&
дим из допущения, что наблюдаемое различие средних
обусловлено случайными факторами (ошибкой выбор&
ки и измерения). Другими словами, мы предполагаем,
что обе выборки принадлежат к одной генеральной со&
вокупности, параметры которой нам неизвестны. За&
тем мы оцениваем различие средних с учетом наблю&
даемого рассеяния данных в каждой из выборок. Кри&
тические значения задаются с учетом выбранного
уровня значимости. Если заданная величина оказыва&
ется превышенной, мы отвергаем нулевую гипотезу
и считаем, что наблюдаемые различия не случайны.
Мы разобрали принципы проверки статистических
гипотез. Существуют разные статистические крите#
рии, разработанные для разных типов данных. Некото&
рые из них, так называемые параметрические крите#
рии, применимы только к данным, полученным с помо&
щью интервальных шкал. Название отражает тот
момент, что в основе процедуры оценки лежит предпо&
ложение о характере распределения данных. Если эти
условия не выполняются, то выводы оказываются со&
мнительными. К наиболее известным критериям этого
типа относится t&критерий Стьюдента, применяемый
для оценки различия средних. Но разработан также
целый ряд статистических процедур, которые не при&
вязаны к какому&то определенному распределению.
Эти критерии, которые называются непараметричес#
кими, особенно удобны для анализа данных, с которы&
ми обычно имеют дело социальные науки. Примером
может случить критерий хи&квадрат, который основан
на сравнении частот. Кстати, этот же метод использу&
ется для оценки связи между качественными призна&
ками. Выбор подходящего критерия — задача весьма
непростая. Здесь следует обратиться к помощи специ&
алиста по математической статистике.
397

Заканчивая раздел о количественных методах ана&
лиза, сделаем несколько замечаний общего характера.
Во&первых, как читатель смог убедиться, грамотное
применение статистики требует от исследователя спе&
циальной подготовки. Но это касается и приемов каче&
ственного анализа, и методов сбора данных. По мето&
дам обработки социальной информации имеется об&
ширная литература — от элементарных учебников до
серьезных руководств. Мы надеемся, что теперь, по&
сле знакомства с основными идеями и понятиями ста&
тистики, эта литература станет вам доступнее. Во&вто&
рых, статистика есть особый инструмент исследова&
ния, овладеть которым по&настоящему можно только
на практике. Важно подчеркнуть, что статистика —
это не собрание стандартных приемов обработки дан&
ных, а продолжение логики научного исследования,
доведение ее до математической строгости. В этом
смысле она полезна не только профессиональному ис&
следователю, но и любому специалисту, который пыта&
ется осмыслить свой собственный опыт и опыт своих
коллег.
Наконец, нельзя не затронуть вопрос о границах
применения статистики в социальных науках. Мы воз&
вращаемся к той проблеме, которая была поднята
в первой главе: к проблеме специфики предмета ис&
следования в социальных науках, к спору между пози&
тивизмом и феноменологией, между представителями
номотетического и идиографического подходов. Дей&
ствительно, целый ряд факторов ограничивает сферу
применения традиционных математических моделей
для изучения социальных явлений. Недаром столь зна&
чительное место здесь занимает качественный анализ.
Характер данных часто мешает использовать наиболее
мощные статистические процедуры, привязанные
к нормальному распределению. И тем не менее, коли&
чественный анализ прочно занял свое место в арсена&
ле социальных наук. Разрабатываются новые матема&
тические модели, лучше учитывающие характер ис&
следовательских задач. В частности, активнее
привлекаются непараметрические критерии. Принци&
пиально новые возможности открывает использова&
ние компьютера. Все это позволяет прогнозировать
новый всплеск интереса к количественным методам
398
Глава 3

Методы анализа данных
анализа данных среди ученых&гуманитариев, более
широкое и грамотное их применение во всех сферах
исследования.
n 3. Использование компьютера для анализа данных
Современный компьютер, как известно, является
устройством, позволяющим эффективно оперировать
информацией разного рода, но в первую очередь текс&
товой и числовой. Само название происходит от анг&
лийского слова «вычислять». И первые компьютеры
действительно предназначались для сложных матема&
тических расчетов. Недаром и по&русски их вначале
именовали электронно&вычислительными машинами
(ЭВМ). Правда, и внешне они существенно отличались
от современного персонального компьютера. Такая
машина занимала целое большое помещение и обслу&
живалась целым штатом инженеров и программистов.
Она использовалась в основном для инженерных
и экономико&статистических расчетов.
За последние двадцать лет в области компьютерной
техники произошла подлинная революция. Прогресс
был связан в первую очередь со значительным повыше&
нием быстродействия и сокращением размеров ЭВМ.
Появился так называемый персональный компьютер,
который сейчас становится не только обязательным ат&
рибутом любого учреждения, но и широко входит в быт.
Современный портативный компьютер, свободно уме&
щающийся в портфеле, вовсе не уступает по возможно&
стям своим предшественникам — ЭВМ тридцатилетней
давности, но при этом он стал значительно проще в об&
ращении. Конечно, эта простота относительная. Будучи
универсальным устройством переработки информа&
ции, компьютер совмещает в себе целый ряд функ&
ций — от функции пишущей машинки до функции тер&
минала для связи с удаленными базами данных. Всеми
этими функциями приходится специально овладевать.
Вряд ли существует человек, который досконально вла&
деет всеми возможными операциями. Их слишком мно&
го. Но есть базовые навыки, которые необходимы лю&
бому пользователю. Они образуют то, что сейчас при&
нято называть компьютерной грамотностью.
399

Удобства, которые компьютер предоставляет в об&
ращении с текстовой и цифровой информацией, дела&
ют его незаменимым помощником в работе ученого&
исследователя. Сейчас уже трудно себе представить,
что еще совсем недавно основными инструментами
ученого при работе с текстом были ручка, ножницы
и клей, а при работе с цифровым материалом — счеты,
арифмометр и карандаш. Теперь практически все
делается на компьютере. Мы уже не говорим о тех
удобствах, которые создает хранение информации на
электронных носителях. Недаром многие научные из&
дательства сегодня требуют, чтобы материалы подава&
лись авторами в компьютерном виде — на дискетах.
Это избавляет от необходимости набора текстов. Ко&
роче говоря, компьютер превращается в обязательный
инструмент исследователя.
Для анализа информации существуют разнообраз&
ные специальные программы, но некоторые элементы
качественного и количественного анализа можно осу&
ществлять даже с помощью обычного текстового ре&
дактора. Имеется в виду тот редактор, который входит
в состав наиболее распространенной сейчас системы
Windows. Он позволяет просматривать текст, выделять
его отдельные участки, вставлять заметки, находить
в тексте заданные слова и словосочетания, распола&
гать списки в алфавитном порядке. С его помощью
можно также создавать таблицы, производить ариф&
метические вычисления, рисовать диаграммы.
Специализированные программы для качественно&
го анализа позволяют более гибко структурировать
текст, вычленять его элементы, подсчитывать их, ис&
пользовать многоуровневую систему кодирования,
выявлять характер отношений между элементами,
представлять их в виде наглядных схем. Эти програм&
мы удобны для работы с большими массивами инфор&
мации, когда непосредственный просмотр становится
слишком трудоемким и неэффективным.
Для работы с информацией, представленной в таб&
личной форме, в состав системы Windows входит осо&
бая программа Excel. Она может работать как с цифро&
вой, так и с текстовой информацией. С ее помощью
можно сортировать данные, производить основные
статистические вычисления, преобразовывать табли&
400
Глава 3
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]
