Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Психодиагностика теоретические основы. Учебное пособие

.pdf
Скачиваний:
3
Добавлен:
08.09.2026
Размер:
2 Мб
Скачать
☆
101
Очевидная валидность
Содержательная валидность
чтения. Если заботиться о содержательной валидности соответствующего теста, то нужно ввести в него группы заданий на проверку этих довольно разных по своему операциональному составу компонентов вербального интеллекта. Вводя разнородные пункты и субшкалы (субтесты), мы обяза­тельно сокращаем внутреннюю согласованность, одномоментную надеж­ность теста, но зато добиваемся существенного повышения валидности. Таким образом, для расширения области применения теста психодиагност должен избегать излишнего повышения внутренней согласованности. Од­новременно с этим снижением внутренних корреляций между различными пунктами теста обязательно исчезает отрицательный эксцесс на кривой распределения тестовых баллов, и она все более приближается по форме к нормальной кривой.
Очевидная валидность описывает пред-
ставление о тесте, сложившееся у ис­пытуемого. Тест должен восприниматься об-
следуемым как серьезный инструмент познания его личности, чем-то схо­жий с вызывающим уважение и в какой-то мере трепет медицинским ди­агностическим инструментарием. Очевидная валидность приобретает осо­бое значение в современных условиях, когда представление о тестах в об­щественном сознании формируется многочисленными публикациями в по­пулярных газетах и журналах того, что можно назвать квазитестами, с по­мощью которых читателю предлагается определить все, что угодно: от ин­теллекта до совместимости с будущим супругом.
Определяется через подтверждение
того, что задания теста отражают все аспекты изучаемой области поведения. Обычно она определяется у тес­тов достижений (смысл измеряемого параметра полностью ясен), кото­рые тестами собственно психологическими не являются, а предназначены для измерения того, насколько человек овладел конкретными навыками или учебным предметом. На практике для определения содержательной ва­лидности подбираются эксперты, которые указывают, какая область (об­ласти) поведения наиболее важна. Тестируемая область поведения сначала подвергается систематическому анализу на предмет полноты и пропорцио­нальности охвата ее главных аспектов заданиями тестов. Затем, исходя из этого, генерируются задания теста, которые вновь оценивают эксперты. Содержание необходимо определять достаточно широко, включая в него,
102
1
Критериальная
(эмпирическая) валидность
Прогностическая валид-
ность устанавливается с помощью
корреляции между показателями теста и некоторым критерием, ха­рактеризующим измеряемое свой­ство, но в более позднее время.
Текущая валидность – ха-
рактеристика теста, отражающая его способность различать испы­туемых на основании диагностиче­ского признака, являющегося объ­ектом исследования в данной мето­дике, в данное время.
помимо знания фактического материала, такие важные цели обучения, как применение изученных правил и объяснение фактов.
А. Анастази характеризует валид­ность по критерию как возможность теста судить об интересующем нас аспекте по-
ведения индивида в настоящем и будущем1. Чтобы определить ее, выпол­нение теста соотносится с критерием, то есть непосредственной и неза­висимой мерой того, что должен предсказывать тест. Так, для теста техни­ческих способностей критерием может быть последующая работа на про­изводстве; для теста готовности к обучению это могут быть оценки, полу­чаемые в колледже; для теста на невротизм – отзывы коллег испытуемого и другие доступные сведения о его поведении при разных жизненных об­стоятельствах.
Критериальную меру, по которой устанавливается валид­ность тестовых показателей, можно получить почти одновре­менно с ними или же через уста­новленный промежуток времени. В зависимос я­зи между критерием и тестом раз­личают текущую и прогностиче-
скую валидность.
Информация, содержащая­ся в прогностической валидно­сти, особенно важна для тестов, используемых при отборе и рас­пределении персонала. Прием на работу, отбор учащихся в колледжи или профессиональные училища, во­еннослужащих на курсы специальной подготовки - вот примеры ситуа­ций, когда нужно знать валидность используемых тестов. Сюда же можно отнести использование тестов при выявлении лиц, склонных в стрессовых ситуациях к эмоциональным расстройствам, и назначение курса лечения,
Анастази, А. Психологическое тестирование / под ред. К.М.Гуревича, В.И. Лу­бовского. Предисловие: К.М.Гуревича, В.И.Лубовского. - М.: Педагогика, 1982. - Книга 1. С. 131.
103
При определении валидности теста необходимо, чтобы резуль­таты теста не сказывались на оп­ределении действительного (кри­териального) статуса индивида. Необходимо, чтобы лицам, произ­водящим критериальную оценку, ничего не было известно о тесто­вых результатах испытуемого. По этой причине тестовые результа­ты обследуемого держатся в строгом секрете.
наиболее подходящего тому или иному больному с расстройством пси­хики.
В ряде случаев текущая валидность заменяет валидность прогности-
ческую. Часто практически невыгодно слишком затягивать валидацию, без которой невозможно установить прогностическую валидность или сформировать предварительную выборку, соответствующую целям те­стирования. Поэтому в качестве компромиссного решения тесты прово­дятся на группах, для которых уже имеются критериальные данные. На­пример, результаты тестирования студентов сравниваются с их успевае­мостью, результаты тестирования служащих - с их успехами на про­изводстве.
Вместе с тем в определенных ситуациях текущая валидность гораздо точнее отвечает существу решаемых задач. Различие между двумя видами валидности, рассматриваемыми в данном разделе, основано не на времени, а на целях тестирова­ния. Текущая валидность ис­пользуется в тестах, оцениваю- щих настоящее положение дел, а не предсказывающих будущие результаты. Если мы спрашива­ем, невротик ли Смит, то это оз­начает, что нас интересует теку­щая валидность. Если же мы хо­тим знать, склонен ли Смит к неврозам, то это значит, что нас интересует прогностическая валидность.
Общие критерии. Для валидации теста можно использовать самые разнообразные критерии. Любой метод оценки поведения в любой ситуа­ции мог бы стать источником критериальной меры для той или иной цели тестирования. Однако критерии, на основе которых определяются значения валидности, приводимые в руководствах к тестам, можно разбить на не­сколько основных категорий. Для валидации тестов интеллекта чаще всего используется тот или иной показатель успеваемости. Вот почему такие тесты иногда называют тестами способности к обучению. Их критериаль­ной мерой служат школьные оценки, данные тестов достижений, сведения о переводе в следующий класс и об окончании школы, особые отличия и по­ощрения, мнение учителей об интеллектуальном уровне ученика. Поскольку
104
1
1
2
на такие субъективные оценки в основном влияет выполнение ребенком сво- их ученических обязанностей, их вполне можно отнести к разряду показа­телей успеваемости.
Показатели успеваемости могут играть роль критериальных данных на всех уровнях обучения - от младших классов школы до колледжа и ас­пирантуры. Хотя их используют главным образом для валидации тестов общего интеллекта, они также выступают в качестве критерия некоторых личностных тестов и комплексных батарей способностей. При валидации тес­тов, предназначенных для отбора абитуриентов, общим критерием является средний балл первокурсника.
Разновидностью критерия достижений в обучении для неучащихся взрослых является объем полученного ими образования. При этом пред­полагается, что более развитые индивиды продолжают свое образование, а менее развитые прекращают его. Хотя не подлежит сомнению, что, скажем, выпускники колледжа составляют более развитую группу, чем окончившие лишь восемь классов общественной школы, соотношение между объемом образования и способностью к обучению отнюдь не однозначно. Факторы, не относящиеся к интеллектуальному развитию, такие, как экономические, социальные, мотивационные и другие особенно сказываются на продолже­нии различного уровня высшего образования. Более того, при такой теку­щей валидации трудно решить, что является причиной, а что - следствием. В какой степени полученные различия в тесте интеллекта есть просто резуль­тат разницы в образовании? Насколько точно тест мог бы предсказать индивидуальные различия в успехах при дальнейшем обучении? На эти вопросы удается ответить, только когда тест проводится до получения кри­териальных данных, как при предсказательной валидности.
В отечественной психодиагностике используется термин «эмпириче-
ская валидность
».
Процедура эмпирической валидизации. Организация выборки при эмпирической валидизации зависит от временного статуса критерия. Если этот критерий - событие в прошлом (ретроспективная валидизация), то к участию в психодиагностическом обследовании достаточно привлечь только тех испытуемых, которые оказались на экстремальных полюсах по этому критерию2. В результате применяется метод экстремальных (контраст­ных) групп. Коррелирование с суммарным баллом по тесту оценивается с
Бодалев, А.А., Столин. Общая диагностика. – СПб.: Изд-во «Речь», 200. С. -114.
В этом случае имеет место схема исследования, известная под названием «ква-
зиэксперимент»: контроль осуществляется не в виде воздействия на независимую пе­ременную, а в виде привлечения особой выборки испытуемых.
105
Конструктная валидность
помощью бисериального коэффициента. При этом в статусе дихотомической переменной (на месте отдельного пункта) оказывается сам критерий валидно­сти: ∑ х - сумма баллов по тесту, полученных «высокой» группой по крите­рию; √ pq - стандартная ошибка критерия, связанная с численностью «высо­кой» (р) и «низкой» (q) групп.
Если критерии - будущее событие (проспективная валидизация), то вы­борка должна быть составлена с запасом – с учетом вероятного объема экс­тремальных групп в будущем. Например, нужно выяснить, позволяет ли диаг­ностика темперамента прогнозировать повышенный риск психосоматических заболеваний (гипертония, язва, астма и т. п.). Пусть на основании эпидемио­логических исследований известно, что в течение трех лет из 1000 здоровых людей этими болезнями заболевают 57 человек. Это означает, что превентив­ной (предупреждающей) диагностикой должно быть охвачено около 2000 че­ловек, чтобы получить численность «высокой» группы (заболевших) порядка 100 человек. Проспективная валидизация выявляет прогностическую эффек­тивность диагностической процедуры. Высокая прогностическая валидность доказывает как валидность самого измерения, так и наличие предполагаемой причинной связи.
Ретроспективная валидизация позволяет в лучшем случае решить толь­ко, первую из двух задач. Например, если для исследования личностной пред­расположенности к совершению краж проведено обследование лиц, находя­щихся под следствием (т. е. уже совершивших преступление), то выявление акцентированных черт «тревожности» «агрессивности» и т. п. еще не может интерпретироваться как свидетельство причинных факторов преступности ­эти черты могут быть лишь следствием сложившихся обстоятельств; лишение свободы, угрызения совести и т. п. (Ратинов А. Р., 1979). Во многих медико­психологических исследованиях был выделен особый диагностический син­дром «госпитализации», который обнаруживается у любой категории госпи­тализированных больных (обычно он выражается в повышении шкал «депрес­сии» и «ипохондрии» по MMPI – Шхвацабая, 1980). Очевидно, что подобные личностные сдвиги никак нельзя интерпретировать в смысле симптомов пред­расположенности к определенным психогенным заболеваниям, ибо они отно­сятся к следствиям, а не к причинам этих заболеваний.
зацию порой оказывается провести гораздо труднее в силу отсутствия какого­либо более объективного внутрипсихологического критерия, чем сам тест.
В отличие от прагматической валиди-
зации собственно психологическую валиди-
106
Наиболее благополучная ситуация имеется тогда, когда для измерения данного свойства в психологии уже имеется процедура с известной валид­ностью. В этом случае корреляция между баллами двух тестов - линейная или ранговая - указывает на то, обладает ли новый тест конвергентной ва­лидностью по отношению к старому. Если новый тест обнаруживает высо­кую конвергентность результатов со старым и одновременно оказывается более компактным и экономичным в приведении и подсчете, то психодиаг­носты получают возможность использовать новый тест вместо старого.
Однако во многих случаях для измеряемого свойства психодиагност не может найти в литературе ни одного уже апробированного теста с известной валидностью. В этом случае он может сформулировать ряд предсказательных гипотез о том, как будет коррелировать его новый тест - с другими тестами, измеряющими родственные характеристики испытуемых. Эти гипотезы вы­двигаются на основе теоретических представлений об измеряемом свойстве. Их подтверждение указывает на валидность выдвигаемого конструкта, т.е. на кон­структную валидность теста.
В западной литературе это операциональное определение конструктной валидности называется предлагаемой валидностью (assumed validity).
Представления о конструктной валидности тестов постоянно развива­ются с пополнением репертуара методик. Эмпирические исследования взаи­мосвязей результатов, получаемых с помощью разных методик, обогащают теоретические представления об измеряемых свойствах.
С другой стороны, понятие конструктной валидности указывает на высокую зависимость эмпирических связей теста от теоретических пред­ставлений его автора об измеряемом свойстве. Для иллюстрации приведем пример взаимоотношений между двумя популярными тест-опросниками: MAS Ж. Тейлор и EPI Г. Айзенка. Многочисленные корреляционные ис­следования, проведенные на репрезентативных выборках, показали, что шкала MAS (тревожность) Ж. Тейлор положительно коррелирует со шка­лой «нейротизм» и отрицательно со шкалой «экстраверсия» Айзенка. На графике (рис. 9) вектор MAS оказывается расположенным в квадранте «Нейротизм - Интроверсия», образованном системой из ортогональных (статистически независимых) факторов ЕРI.
С точки зрения концепции Г. Айзенка, эти данные можно рассматри­вать как свидетельства низкой валидности шкалы Ж. Тейлор: MAS корре­лирует не только с релевантным фактором «нейротизм», но и с ирреле­вантным фактором «интроверсия». С этой точки зрения, опросник ЕРI ока­зывается просто нечувствительным к особой разновидности «нейротизма»
107
Интроверсия
Экстраверсия
(MAS)
Тревожность
Нейротизм
Рис. 9. Векторная модель соотношения по­казателя «Тревожность» по тесту (MAS) с факторами теста-опросника ЕРI
Конвергентная и дискриминантная
валидность
- к нейротизму (тревожности) экстравертов: в перечне пунктов MAS отсут­ствуют высказывания, в которых могла бы проявиться тревожность экст­раверта.
Однако с точки зрения того теоретического смысла, который приписывают показателям MAS К. Спенс и Ж. Тейлор, эта ситуа­ция вполне закономерна, жела­тельна и никак не является арте­фактом - следствием дефекта их диагностического средства. Со­гласно К. Спенсу, пытавшемуся перенести на человеческое пове­дение теорию научения Халла, MAS измеряет общий уровень драйва - неспециализированного побуждения, которое достигает максимума как раз при сочетании нейротизма (специфическая акти­вация по Г. Айзенку) и интроверсии (неспецифическая активация). Таким образом, вовсе не всегда краткие названия тестов однозначно выражают теоретический статус диагностического конструкта - понятия об измеряе­мом свойстве.
От того, как психолог оп­ределяет диагностический кон­структ зависит стратегия вклю-
чения в тест определенных пунктов. Если Айзенк определяет свойство «нейротизм» как независимое от экстраверсии-интроверсии, то это означа­ет, что в его опроснике примерно поровну должны быть представлены пункты, с которыми будут соглашаться невротичные интроверты и невро­тичные экстраверты (векторы этих пунктов должны быть примерно поров­ну распределены в правом и левом нижних квадрантах на графике. Если же на практике окажется, что в тесте будут преобладать пункты из квад­ранта «Нейротизм-Интроверсия», то, с точки зрения теории Айзенка, это означает, что фактор «нейротизм» оказывается нагруженным иррелевант­ным фактором - «интроверсией». (Точно такой же эффект возникает, если
108
Рис. 10. Связь эмпирических показателей П1, П2, П3 с релевантным (измеряемым фактором А) и иррелевантными («шумовыми») фактора­ми X, Y, Z, обслуживающими невалидность показателей
X A Z
П2
Y A Z
П3
X A Y
П1
появится перекос в выборке - если в ней будет больше невротичных ин­тровертов, чем невротичных экстравертов.)
Для того чтобы не сталкиваться с такими сложностями, психологи хотели бы иметь дело с такими эмпирическими показателями (пунктами), которые однозначно информируют только об одном факторе. Но это тре­бование реально никогда не выполняется: всякий эмпирический показатель оказывается детерминированным не только тем фактором, который нам нужен, но и другими - иррелевантными задаче измерения (рис. 10).
На рис. 10 постоянным для всех показателей является релевантный фактор А, но каждый раз он оказывается сопряжен с иррелевантными фак­торами - X, Y, Z.
Задача состоит в таком подборе пунктов, чтобы все потенциальные иррелевантные факторы были уравновешены, т. е. чтобы ни один из них не встречался бы чаще других на множестве показателей (пунктов), включен­ных в тест. Таким образом, по отношению к факторам, которые концепту­ально определяются как ортогональные к измеряемому (встречающиеся с ним во всех, комбинациях), составитель теста должен при отборе пунктов применить стратегию искусственного балансирования (Р. Готтсданкер,
1982).
Соответствие пунктов измеряемому фактору обеспечивает конвер­гентную валидность теста. Сбалансированность пунктов относительно ир­релевантных факторов обеспечивает дискриминативную валидность. Эм­пирически она выражается в отсутствии значимой корреляции с тестом, измеряющим концептуально независимое свойство.
109
С точки зрения теории Айзенка, тест Ж. Тейлор не обладает дис­криминантной валидностью по отношению к факторам «экстраверсия­интроверсия», хотя и обладает определенной конвергентной валидностью по отношению к релевантному фактору - «нейротизму».
Экспертная эмпирическая валидизация. В отсутствие какого-либо уже валидизированного теста, параллельно измеряющего изучаемое свой­ство, а также в отсутствие разработанного теоретического контекста, по­зволяющего проверять конструктную валидность, психодиагност оказыва­ется перед необходимостью привлечения экспертов к валидизации теста. В отличие от экспертного анализа содержания теста, эмпирическая эксперт­ная валидизация предполагает работу экспертов не с тестом (лучше, чтобы о нем эксперты вообще ничего не знали), а с испытуемыми из выборки стандартизации.
Необходимо обеспечить экспертам стандартные условия для наблю­дения за испытуемыми. Но не всегда такое стандартизованное наблюдение удается организовать. Даже если предприняты серьезные усилия по орга­низации наблюдения за поведением испытуемых в какой-либо искусствен­ной лабораторной ситуации, такое наблюдение всѐ равно будет значитель­но уступать по информативности полевому наблюдению - в естественных условиях. Если измеряемое свойство теоретически определено как устой­чивая универсальная черта личности - как диспозиция к инвариантному доведению в широком спектре ситуаций, - то и отдельного полевого на­блюдения оказывается недостаточно для получения полноценного экс­пертного критерия валидности.
Поэтому на практике часто прибегают к оценкам особого типа - к субъективным оценкам, которые выносят испытуемому люди из его круга, имеющие опыт реального общения с ним. С учетом этого процедура оце­нивания приспосабливается к обычным людям, не являющимся психоло­гами. На психолога падает большая нагрузка по составлению детальной инструкции оценщикам, однозначно задающей смысл оцениваемой харак­теристики. Лучшие условия для такой процедуры возникают при наличии группы испытуемых, тесно общающихся между собой; тех, которые могут одновременно побывать и испытуемыми по отношению к тесту, и оценщи­ками по отношению друг к другу. В отечественной литературе эта проце­дура получила сокращенное обозначение ГОЛ «групповая оценка лично­сти» (Кузьмин Н. В., Семенов В. С., 1977).
Для того чтобы групповая оценка личности была источником дейст­вительно валидной информации, оценщики должны согласованно оцени-
110
Испытуемые
Оценщики
О1
О2 … Оk
∑
И1 И2 … И
n
X11 X21
…
Xn1
X12 X22
…
Xn2
… … X1k
X2k
…
Xnk
C1 C2 … Cn
вать испытуемых. Если в оценках разных оценщиков нет согласованности, то это означает, что либо оцениваемое свойство не проявилось у объекта оценивания, либо оценщики по-разному проинтерпретировали инструк­цию. Для измерения согласованности должна быть составлена таблица с оценками (табл. 10).
Таблица 10
Методы анализа данных, содержащихся в такой таблице, формально совершенно эквивалентны тем методам, которые применяются для обра­ботки таблиц «испытуемые - пункты». B частности, суммы по строкам да­ют суммарные баллы, полученные каждым испытуемым у всех оценщиков. Таким образом, оценщики в данном случае оказываются формально в роли пунктов теста. Рассчитывая попарные корреляции между различными столбцами этой таблицы, можно получить коэффициенты согласованности для отдельных пар оценщиков. Глобальной мерой согласованности оцен­щиков может служить коэффициент надежности Кронбаха. Если же груп­повая оценка не обнаруживает надежности, то она не может использовать­ся в качестве критерия валидизации при проверке валидности теста.
Эмпирическое значение коэффициента валидности рассчитывается как линейная или ранговая корреляция между двумя рядами значений: тес­товыми баллами и суммарными баллами экспертной оценки. Это эмпири­ческое значение при наличии невысокого коэффициента надежности кри­терия корректируют по формуле.
Анализ пунктов по критерию валидности. Валидность всего теста целиком зависит от валидности входящих в него пунктов. Максимальная валидность достигается за счет отбора таких пунктов из пилотажной бата­реи, которые, обладая значимой корреляцией с критерием, минимально коррелируют между собой. Отбор пунктов именно по критерию валидно­сти обеспечивает максимальную прагматическую эффективность теста. Вручную (на калькуляторе) такой отбор можно произвести, рассчитав би­сериальную корреляцию (или фи-корреляцию) критерия с каждым пунк-
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]