Добавил:
ivanov666
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз:
Предмет:
Файл:Психодиагностика теоретические основы. Учебное пособие
.pdf
101
Очевидная валидность
Содержательная валидность
чтения. Если заботиться о содержательной валидности соответствующего
теста, то нужно ввести в него группы заданий на проверку этих довольно
разных по своему операциональному составу компонентов вербального
интеллекта. Вводя разнородные пункты и субшкалы (субтесты), мы обязательно сокращаем внутреннюю согласованность, одномоментную надежность теста, но зато добиваемся существенного повышения валидности.
Таким образом, для расширения области применения теста психодиагност
должен избегать излишнего повышения внутренней согласованности. Одновременно с этим снижением внутренних корреляций между различными
пунктами теста обязательно исчезает отрицательный эксцесс на кривой
распределения тестовых баллов, и она все более приближается по форме к
нормальной кривой.
Очевидная валидность описывает пред-
ставление о тесте, сложившееся у испытуемого. Тест должен восприниматься об-
следуемым как серьезный инструмент познания его личности, чем-то схожий с вызывающим уважение и в какой-то мере трепет медицинским диагностическим инструментарием. Очевидная валидность приобретает особое значение в современных условиях, когда представление о тестах в общественном сознании формируется многочисленными публикациями в популярных газетах и журналах того, что можно назвать квазитестами, с помощью которых читателю предлагается определить все, что угодно: от интеллекта до совместимости с будущим супругом.
Определяется через подтверждение
того, что задания теста отражают все
аспекты изучаемой области поведения. Обычно она определяется у тестов достижений (смысл измеряемого параметра полностью ясен), которые тестами собственно психологическими не являются, а предназначены
для измерения того, насколько человек овладел конкретными навыками
или учебным предметом. На практике для определения содержательной валидности подбираются эксперты, которые указывают, какая область (области) поведения наиболее важна. Тестируемая область поведения сначала
подвергается систематическому анализу на предмет полноты и пропорциональности охвата ее главных аспектов заданиями тестов. Затем, исходя из
этого, генерируются задания теста, которые вновь оценивают эксперты.
Содержание необходимо определять достаточно широко, включая в него,

102
1
Критериальная
(эмпирическая) валидность
Прогностическая валид-
ность устанавливается с помощью
корреляции между показателями
теста и некоторым критерием, характеризующим измеряемое свойство, но в более позднее время.
Текущая валидность – ха-
рактеристика теста, отражающая
его способность различать испытуемых на основании диагностического признака, являющегося объектом исследования в данной методике, в данное время.
помимо знания фактического материала, такие важные цели обучения, как
применение изученных правил и объяснение фактов.
А. Анастази характеризует валидность по критерию как возможность теста
судить об интересующем нас аспекте по-
ведения индивида в настоящем и будущем1. Чтобы определить ее, выполнение теста соотносится с критерием, то есть непосредственной и независимой мерой того, что должен предсказывать тест. Так, для теста технических способностей критерием может быть последующая работа на производстве; для теста готовности к обучению это могут быть оценки, получаемые в колледже; для теста на невротизм – отзывы коллег испытуемого
и другие доступные сведения о его поведении при разных жизненных обстоятельствах.
Критериальную меру, по
которой устанавливается валидность тестовых показателей,
можно получить почти одновременно с ними или же через установленный промежуток времени.
В зависимос язи между критерием и тестом различают текущую и прогностиче-
скую валидность.
Информация, содержащаяся в прогностической валидности, особенно важна для тестов,
используемых при отборе и распределении персонала. Прием на
работу, отбор учащихся в колледжи или профессиональные училища, военнослужащих на курсы специальной подготовки - вот примеры ситуаций, когда нужно знать валидность используемых тестов. Сюда же можно
отнести использование тестов при выявлении лиц, склонных в стрессовых
ситуациях к эмоциональным расстройствам, и назначение курса лечения,
Анастази, А. Психологическое тестирование / под ред. К.М.Гуревича, В.И. Лубовского. Предисловие: К.М.Гуревича, В.И.Лубовского. - М.: Педагогика, 1982. -
Книга 1. С. 131.

103
При определении валидности
теста необходимо, чтобы результаты теста не сказывались на определении действительного (критериального) статуса индивида.
Необходимо, чтобы лицам, производящим критериальную оценку,
ничего не было известно о тестовых результатах испытуемого. По
этой причине тестовые результаты обследуемого держатся в
строгом секрете.
наиболее подходящего тому или иному больному с расстройством психики.
В ряде случаев текущая валидность заменяет валидность прогности-
ческую. Часто практически невыгодно слишком затягивать валидацию,
без которой невозможно установить прогностическую валидность или
сформировать предварительную выборку, соответствующую целям тестирования. Поэтому в качестве компромиссного решения тесты проводятся на группах, для которых уже имеются критериальные данные. Например, результаты тестирования студентов сравниваются с их успеваемостью, результаты тестирования служащих - с их успехами на производстве.
Вместе с тем в определенных ситуациях текущая валидность гораздо
точнее отвечает существу решаемых задач. Различие между двумя видами
валидности, рассматриваемыми в
данном разделе, основано не на
времени, а на целях тестирования. Текущая валидность используется в тестах, оцениваю-
щих настоящее положение дел, а
не предсказывающих будущие
результаты. Если мы спрашиваем, невротик ли Смит, то это означает, что нас интересует текущая валидность. Если же мы хотим знать, склонен ли Смит к
неврозам, то это значит, что нас
интересует прогностическая валидность.
Общие критерии. Для валидации теста можно использовать самые
разнообразные критерии. Любой метод оценки поведения в любой ситуации мог бы стать источником критериальной меры для той или иной цели
тестирования. Однако критерии, на основе которых определяются значения
валидности, приводимые в руководствах к тестам, можно разбить на несколько основных категорий. Для валидации тестов интеллекта чаще всего
используется тот или иной показатель успеваемости. Вот почему такие
тесты иногда называют тестами способности к обучению. Их критериальной мерой служат школьные оценки, данные тестов достижений, сведения о
переводе в следующий класс и об окончании школы, особые отличия и поощрения, мнение учителей об интеллектуальном уровне ученика. Поскольку

104
1
1
2
на такие субъективные оценки в основном влияет выполнение ребенком сво-
их ученических обязанностей, их вполне можно отнести к разряду показателей успеваемости.
Показатели успеваемости могут играть роль критериальных данных
на всех уровнях обучения - от младших классов школы до колледжа и аспирантуры. Хотя их используют главным образом для валидации тестов
общего интеллекта, они также выступают в качестве критерия некоторых
личностных тестов и комплексных батарей способностей. При валидации тестов, предназначенных для отбора абитуриентов, общим критерием является
средний балл первокурсника.
Разновидностью критерия достижений в обучении для неучащихся
взрослых является объем полученного ими образования. При этом предполагается, что более развитые индивиды продолжают свое образование, а
менее развитые прекращают его. Хотя не подлежит сомнению, что, скажем,
выпускники колледжа составляют более развитую группу, чем окончившие
лишь восемь классов общественной школы, соотношение между объемом
образования и способностью к обучению отнюдь не однозначно. Факторы,
не относящиеся к интеллектуальному развитию, такие, как экономические,
социальные, мотивационные и другие особенно сказываются на продолжении различного уровня высшего образования. Более того, при такой текущей валидации трудно решить, что является причиной, а что - следствием. В
какой степени полученные различия в тесте интеллекта есть просто результат разницы в образовании? Насколько точно тест мог бы предсказать
индивидуальные различия в успехах при дальнейшем обучении? На эти
вопросы удается ответить, только когда тест проводится до получения критериальных данных, как при предсказательной валидности.
В отечественной психодиагностике используется термин «эмпириче-
ская валидность
».
Процедура эмпирической валидизации. Организация выборки при
эмпирической валидизации зависит от временного статуса критерия. Если
этот критерий - событие в прошлом (ретроспективная валидизация), то к
участию в психодиагностическом обследовании достаточно привлечь
только тех испытуемых, которые оказались на экстремальных полюсах по
этому критерию2. В результате применяется метод экстремальных (контрастных) групп. Коррелирование с суммарным баллом по тесту оценивается с
Бодалев, А.А., Столин. Общая диагностика. – СПб.: Изд-во «Речь», 200. С. -114.
В этом случае имеет место схема исследования, известная под названием «ква-
зиэксперимент»: контроль осуществляется не в виде воздействия на независимую переменную, а в виде привлечения особой выборки испытуемых.

105
Конструктная валидность
помощью бисериального коэффициента. При этом в статусе дихотомической
переменной (на месте отдельного пункта) оказывается сам критерий валидности: ∑ х - сумма баллов по тесту, полученных «высокой» группой по критерию; √ pq - стандартная ошибка критерия, связанная с численностью «высокой» (р) и «низкой» (q) групп.
Если критерии - будущее событие (проспективная валидизация), то выборка должна быть составлена с запасом – с учетом вероятного объема экстремальных групп в будущем. Например, нужно выяснить, позволяет ли диагностика темперамента прогнозировать повышенный риск психосоматических
заболеваний (гипертония, язва, астма и т. п.). Пусть на основании эпидемиологических исследований известно, что в течение трех лет из 1000 здоровых
людей этими болезнями заболевают 57 человек. Это означает, что превентивной (предупреждающей) диагностикой должно быть охвачено около 2000 человек, чтобы получить численность «высокой» группы (заболевших) порядка
100 человек. Проспективная валидизация выявляет прогностическую эффективность диагностической процедуры. Высокая прогностическая валидность
доказывает как валидность самого измерения, так и наличие предполагаемой
причинной связи.
Ретроспективная валидизация позволяет в лучшем случае решить только, первую из двух задач. Например, если для исследования личностной предрасположенности к совершению краж проведено обследование лиц, находящихся под следствием (т. е. уже совершивших преступление), то выявление
акцентированных черт «тревожности» «агрессивности» и т. п. еще не может
интерпретироваться как свидетельство причинных факторов преступности эти черты могут быть лишь следствием сложившихся обстоятельств; лишение
свободы, угрызения совести и т. п. (Ратинов А. Р., 1979). Во многих медикопсихологических исследованиях был выделен особый диагностический синдром «госпитализации», который обнаруживается у любой категории госпитализированных больных (обычно он выражается в повышении шкал «депрессии» и «ипохондрии» по MMPI – Шхвацабая, 1980). Очевидно, что подобные
личностные сдвиги никак нельзя интерпретировать в смысле симптомов предрасположенности к определенным психогенным заболеваниям, ибо они относятся к следствиям, а не к причинам этих заболеваний.
зацию порой оказывается провести гораздо труднее в силу отсутствия какоголибо более объективного внутрипсихологического критерия, чем сам тест.
В отличие от прагматической валиди-
зации собственно психологическую валиди-

106
Наиболее благополучная ситуация имеется тогда, когда для измерения
данного свойства в психологии уже имеется процедура с известной валидностью. В этом случае корреляция между баллами двух тестов - линейная
или ранговая - указывает на то, обладает ли новый тест конвергентной валидностью по отношению к старому. Если новый тест обнаруживает высокую конвергентность результатов со старым и одновременно оказывается
более компактным и экономичным в приведении и подсчете, то психодиагносты получают возможность использовать новый тест вместо старого.
Однако во многих случаях для измеряемого свойства психодиагност не
может найти в литературе ни одного уже апробированного теста с известной
валидностью. В этом случае он может сформулировать ряд предсказательных
гипотез о том, как будет коррелировать его новый тест - с другими тестами,
измеряющими родственные характеристики испытуемых. Эти гипотезы выдвигаются на основе теоретических представлений об измеряемом свойстве. Их
подтверждение указывает на валидность выдвигаемого конструкта, т.е. на конструктную валидность теста.
В западной литературе это операциональное определение конструктной
валидности называется предлагаемой валидностью (assumed validity).
Представления о конструктной валидности тестов постоянно развиваются с пополнением репертуара методик. Эмпирические исследования взаимосвязей результатов, получаемых с помощью разных методик, обогащают
теоретические представления об измеряемых свойствах.
С другой стороны, понятие конструктной валидности указывает на
высокую зависимость эмпирических связей теста от теоретических представлений его автора об измеряемом свойстве. Для иллюстрации приведем
пример взаимоотношений между двумя популярными тест-опросниками:
MAS Ж. Тейлор и EPI Г. Айзенка. Многочисленные корреляционные исследования, проведенные на репрезентативных выборках, показали, что
шкала MAS (тревожность) Ж. Тейлор положительно коррелирует со шкалой «нейротизм» и отрицательно со шкалой «экстраверсия» Айзенка. На
графике (рис. 9) вектор MAS оказывается расположенным в квадранте
«Нейротизм - Интроверсия», образованном системой из ортогональных
(статистически независимых) факторов ЕРI.
С точки зрения концепции Г. Айзенка, эти данные можно рассматривать как свидетельства низкой валидности шкалы Ж. Тейлор: MAS коррелирует не только с релевантным фактором «нейротизм», но и с иррелевантным фактором «интроверсия». С этой точки зрения, опросник ЕРI оказывается просто нечувствительным к особой разновидности «нейротизма»

107
Интроверсия
Экстраверсия
(MAS)
Тревожность
Нейротизм
Рис. 9. Векторная модель соотношения показателя «Тревожность» по тесту (MAS) с
факторами теста-опросника ЕРI
Конвергентная и дискриминантная
валидность
- к нейротизму (тревожности) экстравертов: в перечне пунктов MAS отсутствуют высказывания, в которых могла бы проявиться тревожность экстраверта.
Однако с точки зрения того
теоретического смысла, который
приписывают показателям MAS
К. Спенс и Ж. Тейлор, эта ситуация вполне закономерна, желательна и никак не является артефактом - следствием дефекта их
диагностического средства. Согласно К. Спенсу, пытавшемуся
перенести на человеческое поведение теорию научения Халла,
MAS измеряет общий уровень
драйва - неспециализированного
побуждения, которое достигает
максимума как раз при сочетании
нейротизма (специфическая активация по Г. Айзенку) и интроверсии (неспецифическая активация). Таким
образом, вовсе не всегда краткие названия тестов однозначно выражают
теоретический статус диагностического конструкта - понятия об измеряемом свойстве.
От того, как психолог определяет диагностический конструкт зависит стратегия вклю-
чения в тест определенных пунктов. Если Айзенк определяет свойство
«нейротизм» как независимое от экстраверсии-интроверсии, то это означает, что в его опроснике примерно поровну должны быть представлены
пункты, с которыми будут соглашаться невротичные интроверты и невротичные экстраверты (векторы этих пунктов должны быть примерно поровну распределены в правом и левом нижних квадрантах на графике. Если
же на практике окажется, что в тесте будут преобладать пункты из квадранта «Нейротизм-Интроверсия», то, с точки зрения теории Айзенка, это
означает, что фактор «нейротизм» оказывается нагруженным иррелевантным фактором - «интроверсией». (Точно такой же эффект возникает, если

108
Рис. 10. Связь эмпирических показателей П1, П2, П3 с релевантным
(измеряемым фактором А) и иррелевантными («шумовыми») факторами X, Y, Z, обслуживающими невалидность показателей
X A Z
П2
Y A Z
П3
X A Y
П1
появится перекос в выборке - если в ней будет больше невротичных интровертов, чем невротичных экстравертов.)
Для того чтобы не сталкиваться с такими сложностями, психологи
хотели бы иметь дело с такими эмпирическими показателями (пунктами),
которые однозначно информируют только об одном факторе. Но это требование реально никогда не выполняется: всякий эмпирический показатель
оказывается детерминированным не только тем фактором, который нам
нужен, но и другими - иррелевантными задаче измерения (рис. 10).
На рис. 10 постоянным для всех показателей является релевантный
фактор А, но каждый раз он оказывается сопряжен с иррелевантными факторами - X, Y, Z.
Задача состоит в таком подборе пунктов, чтобы все потенциальные
иррелевантные факторы были уравновешены, т. е. чтобы ни один из них не
встречался бы чаще других на множестве показателей (пунктов), включенных в тест. Таким образом, по отношению к факторам, которые концептуально определяются как ортогональные к измеряемому (встречающиеся с
ним во всех, комбинациях), составитель теста должен при отборе пунктов
применить стратегию искусственного балансирования (Р. Готтсданкер,
1982).
Соответствие пунктов измеряемому фактору обеспечивает конвергентную валидность теста. Сбалансированность пунктов относительно иррелевантных факторов обеспечивает дискриминативную валидность. Эмпирически она выражается в отсутствии значимой корреляции с тестом,
измеряющим концептуально независимое свойство.

109
С точки зрения теории Айзенка, тест Ж. Тейлор не обладает дискриминантной валидностью по отношению к факторам «экстраверсияинтроверсия», хотя и обладает определенной конвергентной валидностью
по отношению к релевантному фактору - «нейротизму».
Экспертная эмпирическая валидизация. В отсутствие какого-либо
уже валидизированного теста, параллельно измеряющего изучаемое свойство, а также в отсутствие разработанного теоретического контекста, позволяющего проверять конструктную валидность, психодиагност оказывается перед необходимостью привлечения экспертов к валидизации теста. В
отличие от экспертного анализа содержания теста, эмпирическая экспертная валидизация предполагает работу экспертов не с тестом (лучше, чтобы
о нем эксперты вообще ничего не знали), а с испытуемыми из выборки
стандартизации.
Необходимо обеспечить экспертам стандартные условия для наблюдения за испытуемыми. Но не всегда такое стандартизованное наблюдение
удается организовать. Даже если предприняты серьезные усилия по организации наблюдения за поведением испытуемых в какой-либо искусственной лабораторной ситуации, такое наблюдение всѐ равно будет значительно уступать по информативности полевому наблюдению - в естественных
условиях. Если измеряемое свойство теоретически определено как устойчивая универсальная черта личности - как диспозиция к инвариантному
доведению в широком спектре ситуаций, - то и отдельного полевого наблюдения оказывается недостаточно для получения полноценного экспертного критерия валидности.
Поэтому на практике часто прибегают к оценкам особого типа - к
субъективным оценкам, которые выносят испытуемому люди из его круга,
имеющие опыт реального общения с ним. С учетом этого процедура оценивания приспосабливается к обычным людям, не являющимся психологами. На психолога падает большая нагрузка по составлению детальной
инструкции оценщикам, однозначно задающей смысл оцениваемой характеристики. Лучшие условия для такой процедуры возникают при наличии
группы испытуемых, тесно общающихся между собой; тех, которые могут
одновременно побывать и испытуемыми по отношению к тесту, и оценщиками по отношению друг к другу. В отечественной литературе эта процедура получила сокращенное обозначение ГОЛ «групповая оценка личности» (Кузьмин Н. В., Семенов В. С., 1977).
Для того чтобы групповая оценка личности была источником действительно валидной информации, оценщики должны согласованно оцени-

110
Испытуемые
Оценщики
О1
О2 … Оk
∑
И1
И2
…
И
n
X11
X21
…
Xn1
X12
X22
…
Xn2
… … X1k
X2k
…
Xnk
C1
C2
…
Cn
вать испытуемых. Если в оценках разных оценщиков нет согласованности,
то это означает, что либо оцениваемое свойство не проявилось у объекта
оценивания, либо оценщики по-разному проинтерпретировали инструкцию. Для измерения согласованности должна быть составлена таблица с
оценками (табл. 10).
Таблица 10
Методы анализа данных, содержащихся в такой таблице, формально
совершенно эквивалентны тем методам, которые применяются для обработки таблиц «испытуемые - пункты». B частности, суммы по строкам дают суммарные баллы, полученные каждым испытуемым у всех оценщиков.
Таким образом, оценщики в данном случае оказываются формально в роли
пунктов теста. Рассчитывая попарные корреляции между различными
столбцами этой таблицы, можно получить коэффициенты согласованности
для отдельных пар оценщиков. Глобальной мерой согласованности оценщиков может служить коэффициент надежности Кронбаха. Если же групповая оценка не обнаруживает надежности, то она не может использоваться в качестве критерия валидизации при проверке валидности теста.
Эмпирическое значение коэффициента валидности рассчитывается
как линейная или ранговая корреляция между двумя рядами значений: тестовыми баллами и суммарными баллами экспертной оценки. Это эмпирическое значение при наличии невысокого коэффициента надежности критерия корректируют по формуле.
Анализ пунктов по критерию валидности. Валидность всего теста
целиком зависит от валидности входящих в него пунктов. Максимальная
валидность достигается за счет отбора таких пунктов из пилотажной батареи, которые, обладая значимой корреляцией с критерием, минимально
коррелируют между собой. Отбор пунктов именно по критерию валидности обеспечивает максимальную прагматическую эффективность теста.
Вручную (на калькуляторе) такой отбор можно произвести, рассчитав бисериальную корреляцию (или фи-корреляцию) критерия с каждым пунк-
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]
