Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Психодиагностика теоретические основы. Учебное пособие

.pdf
Скачиваний:
3
Добавлен:
08.09.2026
Размер:
2 Мб
Скачать
☆
91
Надежность взаимозаменяемых форм
Один из способов избе-
жать трудностей, с которыми
приходится сталкиваться при определении ретестовой надежности, — исполь­зование взаимозаменяемых форм (alternate forms) теста. Одних и тех же испы- туемых могут тестировать в первый раз с помощью одной формы, а второй раз — с помощью другой, эквивалентной формы. Корреляция между показа­телями, полученными по двум формам теста, представляет его коэффициент надежности. Заметим, что такой коэффициент надежности служит мерой как временной устойчивости, так и согласованности ответов на различные вы­борки заданий (или формы теста). Таким образом, этот коэффициент служит смешанной характеристикой двух типов надежности. Однако, поскольку оба ее типа важны для большинства целей тестирования, надежность взаимозаменяе­мых форм оказывается полезной мерой для оценки многих тестов. Понятие выборочной проверки заданий или выборочной проверки содержания лежит в основе не только данного, но и других типов надежности, о которых речь пойдет дальше. Именно поэтому оно заслуживает более тщательного рассмотрения. Вероятно, каждому студенту когда-то доставались на экзамене вопросы именно по той теме, к которой он был особенно хорошо подготовлен или, напротив, знал этот материал особенно плохо. Столь знакомая всем ситуация иллюстрирует дисперсию ошибок, вызванную выборочной проверкой содержания. В какой степени показатели данного теста зависят от факторов, специфичных для этой конкретной подборки заданий? И если другой исследователь, работая не­зависимо от нас, подготовил бы другой тест в соответствии с теми же требова­ниями, то насколько бы результаты этих тестов отличались друг от друга?
Предположим, что для оценки понимания слов общего употребления был сконструирован словарный тест, состоящий из 40 заданий. Предположим далее, что с той же целью был составлен второй тест из 40 других слов, причем были соблюдены все предосторожности, чтобы трудность теста оставалась той же самой. Различия в показателях, полученных по этим двум тестам одними и теми же людьми, иллюстрирует рассматриваемый тип дисперсии ошибок. Под действием случайных факторов, связанных с прошлым опытом разных людей, относительная трудность двух списков будет несколько меняться с переходом от одного человека к другому. Так, первый список может содержать больше слов, незнакомых испытуемому A, чем второй, в котором, в свою очередь, мог­ло оказаться непропорционально много слов, незнакомых испытуемому В. Если оба испытуемых примерно равны по своему словарному запасу (т. е. по своим «истинным показателям»), то В тем не менее превзойдет A по первому списку,
92
тогда как А превзойдет В по второму. Относительное положение испытуемых А и В по данным двум спискам окажется взаимно противоположным из-за слу- чайных различий в подборке заданий.
Как и в случае ретестовой надежности, сведения о надежности взаимоза­меняемых форм всегда должны сопровождаться указанием длительности вре­менного интервала между двумя предъявлениями теста, а также характеристи­кой релевантных событий, происшедших за это время в жизни испытуемых. Если обе формы применяются непосредственно одна за другой, то полученная корреляция показывает только надежность параллельных форм, но ничего не го­ворит о надежности как временной устойчивости. Дисперсия ошибок в этом слу­чае обусловлена колебаниями результатов при переходе от одного набора заданий к другому, а не временными флуктуациями показателей.
При разработке взаимозаменяемых форм, безусловно, следует позабо­титься о том, чтобы они на самом деле были параллельными. Принципиально важно, чтобы параллельные формы конструировались как независимые тесты, отвечающие, однако, одним и тем же требованиям. Такие тесты должны со­держать одинаковое число заданий, представленных в одной и той же форме и с однотипным содержанием. Диапазон и уровень трудности заданий тоже должны быть одинаковыми. Инструкции, временные рамки, поясняющие при­меры, формат бланков и все другие аспекты теста также необходимо проверить на сопоставимость.
Следует добавить, что наличие параллельных форм желательно и по дру­гим соображениям, помимо определения надежности теста. Взаимозаменяемые формы полезны при повторных исследованиях и при изучении влияния не­которых промежуточных экспериментальных факторов на выполнение тес­та. Использование нескольких взаимозаменяемых форм служит, кроме то­го, средством уменьшения возможности натаскивания в выполнении тес­тов и обмана.
Несмотря на гораздо более широкое сравнительно с ретестовой надеж­ностью применение, надежность взаимозаменяемых форм также обнаружи­вает ряд ограничений. Прежде всего, если изучаемые поведенческие функ­ции подвержены значительному влиянию тренировки, использование па­раллельных форм ослабит, но не устранит его полностью. Конечно, если бы у всех тестируемых наблюдалось одно и то же улучшение результатов при повторном проведении теста, это не повлияло бы на корреляцию показате­лей, поскольку прибавление постоянной величины к каждому показателю не меняет коэффициента корреляции. Однако, скорее всего, улучшение ре­зультатов у разных людей будет неодинаковым вследствие индивидуаль-
93
Надежность эквивалентных
половин теста
ных различий в опыте работы с подобным материалом, в мотивации уча­стия в тесте и по других причинам. При этих условиях эффект тренировки представляет собой еще один источник дисперсии, снижающей, в общем, корреляцию между двумя формами. Но если влияние тренированности не­велико, снижение корреляции будет незначительным.
Другая проблема связана с возможным изменением сущности теста при повторном его проведении. Например, если в параллельных задачах на сообразительность применен один и тот же принцип, то большинство испы­туемых, однажды найдя решение, и во второй раз применят его. В подоб­ных случаях одной замены содержания заданий явно недостаточно для то­го, чтобы избежать переноса принципа принципов решения из одной формы теста на другую. Наконец, следует добавить, что для многих тестов взаимо­заменяемые формы отсутствуют ввиду практических трудностей создания подлинно эквивалентных форм. В силу этих причин часто приходится об­ращаться к другим методам оценки надежности теста.
Меру надежности можно опреде­лить и на основании однократного при­менения единственной формы теста,
пользуясь для этого различными процедурами расщепления теста на две равноценные половины. При таком способе каждый испытуемый получает два показателя благодаря разделению теста на две эквивалентные части. Очевидно, что надежность, найденная методом расщепления, дает нам меру согласованности выборочных проверок содержания. Временная устойчи­вость показателей в такой характеристике надежности не представлена, по­скольку она предполагает только один сеанс тестирования. Этот тип коэф­фициента надежности иногда называют коэффициентом внутренней согла­сованности, так как для его определения требуется лишь однократное про­ведение единственной формы теста.
Первая проблема, с которой мы сталкиваемся при применении метода расщепления, связана с тем, как разделить тест, чтобы добиться максималь­ной эквивалентности его половин. Всякий тест можно членить многими способами. В большинстве тестов первая и вторая половины оказались бы неэквивалентными вследствие различий в характере и уровне трудности заданий, а также в связи с кумулятивными эффектами вхождения в работу, практики, утомления, скуки и любых других факторов, воздействие которых нарастает от начала к концу теста. Подходящий для большинства целей ме­тод состоит в вычислении показателей отдельно по четным и нечетным за-
94
Надежность
по Кьюдеру-Ричадсону
и коэффициент альфа
даниям теста. Если задания теста были изначально расположены в порядке возрастания трудности, то такое разбиение дает практически эквивалент­ные показатели обеих половин. Одна предосторожность, которую требуется при этом соблюдать, относится к случаю, когда тест содержит группу взаи­мосвязанных заданий — например, когда несколько вопросов касаются како­го-то одного чертежа механического устройства в тесте технических способ­ностей или одного и того же фрагмента текста в тесте чтения. В этом случае каждая такая группа заданий должна быть целиком отнесена либо к одной, либо к другой половине. Если задания таких групп разделить на две части, то возникнет обманчивое сходство сравниваемых показателей, так как лю­бая ошибка в понимании задачи скажется на выполнении заданий из обеих половин.
Полученные показатели по двум частям теста коррелируются обыч­ным методом. Нужно иметь в виду, однако, что эта корреляция в действи­тельности показывает надежность лишь половины теста. Например, если весь тест состоит из 100 заданий, то корреляция вычисляется между двумя множествами показателей, каждый из которых основан только на выполне­нии 50 заданий. В отличие от надежности этого типа при расчете ретестовой надежности, как и надежности взаимозаменяемых форм, каждый показатель основывается на полном наборе заданий теста.
При прочих равных условиях - чем больше заданий содержит тест, тем выше его надежность. Вполне оправданно ожидать, что чем обширнее выборка поведения, тем адекватнее и согласованнее получаемые единицы измерения. Влияние, оказываемое увеличением или сокращением теста на его коэффициент надежности, можно оценить с помощью формулы Спирме­на-Брауна.
Данный метод определения надежности пред­полагает однократное предъявление единст­венной формы теста, основан на оценке согла-
сованности ответов по всем заданиям теста. На эту внутреннюю согласованность влияют два источника дисперсии ошибок: 1) выборочная представленность содержания (как в случае на­дежности взаимозаменяемых форм и эквивалентных половин теста) и 2) неоднородность выборочной области поведения. Чем однороднее эта об­ласть, тем выше внутренняя согласованность. Например, если один тест включает только задания на умножение, а другой — на сложение, вычита­ние, умножение и деление, то первый тест, вероятно, покажет более высо-
95
кую внутреннюю согласованность, чем второй. Во втором, более разно­родном тесте, один испытуемый может лучше справиться с вычитанием, чем с другими арифметическими действиями. Другой покажет относитель­но высокий результат в делении, но хуже проявит себя в сложении, вычи­тании и умножении и т.д. Более контрастным примером однородности и разнородности мог бы служить тест, состоящий из 40 словарных заданий, и тест, содержащий 10 словарных заданий, 10 заданий на пространствен­ные отношения, 10 — на арифметическое рассуждение и 10 — на скорость восприятия. В последнем тесте связь между выполнением различных ти­пов заданий одним человеком может быть незначительной или полностью отсутствовать.
Очевидно, что чем однороднее тест, тем однозначнее его результаты. Предположим, что в последнем из только что упомянутых тестов из 40 за­даний Смит и Джонс получили по 20 баллов. Можем ли мы заключить, что с этим тестом они справились одинаково? Вовсе нет. Смит мог правильно ответить на 10 словарных вопросов, выполнить 10 заданий на скорость восприятия и не справиться ни с одним заданием на арифметическое рас­суждение и пространственные отношения. Напротив, 20 баллов Джонса могли распределиться таким образом: 5 - за скорость восприятия, 5 - за пространственные отношения, 10 - за арифметическое рассуждение и 0 - за словарь.
Суммарный показатель в 20 баллов, разумеется, можно было бы на­брать путем множества других комбинаций, и тогда он имел бы совершен­но иной смысл для каждой из таких различных комбинаций. С другой сто­роны, в более однородном словарном тесте показатель в 20 баллов, веро­ятно, означал бы, что испытуемый правильно указал значение примерно 20 первых слов, если задания располагались в порядке возрастания трудно­сти. Он мог ошибиться в отношении двух-трех сравнительно легких слов, дать правильный ответ по более трудным словам, расположенным под но­мерами, большими 20-ти, но такие индивидуальные колебания ничтожны по сравнению с теми, которые обнаруживаются в более разнородном тесте.
Весьма существенным в этой связи является вопрос об относительной однородности (или неоднородности) самого критериального признака, на пред­сказание которого направлен тест. Хотя однородные тесты могут предпочитать­ся, потому что их показатели допускают довольно однозначную интерпрета­цию, но взятый в отдельности однородный тест, очевидно, непригоден для предсказания крайне неоднородного критериального признака. Более того, при предсказании неоднородного признака-критерия разнородность заданий теста
96
Надежность оценщика
не обязательно означала бы дисперсию ошибок. Традиционные тесты интеллек­та дают хороший пример неоднородных тестов, предназначенных для предска­зания неоднородного критериального признака. В подобных случаях, однако, иногда желательно составить несколько относительно однородных тестов, каждый из которых измерял бы различные аспекты неоднородного критери­ального признака. Тем самым однозначная интерпретация показателей теста могла бы сочетаться с адекватным охватом признака-критерия.
Самая распространенная методика оценки внутренней согласованности была разработана Кьюдером и Ричардсоном (Kuder, & Richardson, 1937). Эта методика опирается на результаты выполнения каждого задания.
Формула Кьюдера—Ричардсона применима лишь к тем тестам, в ко­торых выполнение заданий оценивается как правильное либо ошибочное, или, в общем, по принципу «все или ничего». В некоторых тестах, однако, практикуется более дифференцированная форма представления результатов отдельных заданий. Например, в личностном опроснике респондент может получить различные числовые показатели по любому конкретному пункту опросника в зависимости от того, на какой из готовых категорий ответов он остановил свой выбор: «обычно», «иногда», «редко», «никогда». Для таких тестов была выведена обобщенная формула, известная как коэффициент альфа (Сгоnbach, 1951; Kaiser, & Michael, 1975; Novick, & Lewis, 1967). Про- цедура вычислений состоит в нахождении дисперсии всех индивидуальных балльных оценок по каждому заданию с последующим суммированием этих дисперсий по всем заданиям.
Различные типы надежности отличаются
друг от друга факторами, относимыми к источ­никам дисперсии ошибок. В одном случае дисперсия ошибок охватывает временн е колебания, в другом относится к различиям между наборами па­раллельных заданий, в третьем учитывает любую внутреннюю несогласо­ванность теста. С другой стороны, факторы, исключенные из мер дисперсии ошибок, образуют два широких класса: а) факторы, чья дисперсия со- храняется в показателях, так как эти факторы составляют часть истинных различий, измеряемых тестами, и б) нерелевантные факторы, поддающие­ся экспериментальному контролю. Например, в руководстве к тесту не при­нято сообщать об ошибках измерения, которые могут появиться в результате проведения теста в отвлекающей обстановке или в более короткое или дли­тельное, чем это положено, время. Подобных нарушений можно избежать, и
97
Общий обзор типов
и коэффициентов надежности
поэтому нет нужды в отдельных коэффициентах надежности, соответст­вующих «дисперсии отвлечения» или «дисперсии временных лимитов».
Большинство тестов, особенно если они предназначены для массового обследования с использованием компьютеров для вычисления показателей, настолько стандартизированы, что их проведение и регистрация результа­тов сводят на нет дисперсию ошибок, обусловленную этими факторами. Пользуясь такими тестами, необходимо лишь внимательно следить за вы­полнением соответствующих предписаний. Вместе с тем в отношении кли­нических тестов, применяемых при интенсивных индивидуальных обследо­ваниях, накоплены данные о значительной дисперсии наблюдателя. Благо- даря использованию специальных планов эксперимента удается отделить эту
ми колебаниями в состоя-
нии испытуемого или применением взаимозаменяемых форм теста.
Один источник дисперсии ошибок, который довольно легко устано­вить, — это дисперсия оценщика (scorer variance). Некоторые типы тестов, — особенно тесты креативности и проективные личностные тесты — предос­тавляют довольно много свободы пользователю, оценивающему ответы ис­пытуемого и выставляющему за них определенное количество баллов. При работе с такими тестами потребность в мере надежности оценщика столь же велика, как и в более привычных коэффициентах надежности. Надежность оценщика можно определить, располагая выборкой протоколов выполне­ния теста, оцененного двумя специалистами независимо друг от друга. Меж­ду двумя множествами полученных таким образом показателей вычисляет­ся обычный коэффициент корреляции, который и служит искомой мерой надежности оценщика. Если подсчет показателей теста существенно зависит от суждений пользователя, то в руководстве к тесту необходимо также при­вести и коэффициент надежности оценщика.
Различные виды только что рас-
смотренных коэффициентов надежно­сти сведены в табл. 8 - 9. В табл. 8 ме-
тоды, применяемые для оценки каждого типа надежности, сгруппированы в зависимости от числа требуемых для этой цели форм теста и сеансов тести­рования. В табл. 9 представлены источники дисперсии, трактуемые каждым из методов как дисперсия ошибок.
98
Необходимое число сеансов тестирования
Необходимое число форм теста
Одна
Две
Один
Расщепления Кьюдера-Ричардсона Надежность оценщика
Взаимозаменяемые (не­посредственно следую­щие друг за другом)
Два
Ретестовая
Взаимозаменяемые (проводимые через оп­ределенный промежуток времени)
Тип коэффициента надежности
Дисперсия ошибки
Ретестовый испытуемого
Взаимозаменяемых форм (непосредственный)
Неоднородность содержания
Взаимозаменяемых форм (с временным интервалом)
Колебания состояния испытуемого и неоднозначность содержания
Кьюдера-Ричардсона
Неоднородность и неоднозначность содержания
Надежность оценщика
Индивидуальные различия ставящих оценки
Таблица 8
Методы измерения надежности теста в зависимости
от форм теста и сеансов тестирования
Таблица 9
Источники дисперсии ошибки для различных
коэффициентов надежности
99
1
2
Валидность и надежность
2.4.2. Валидность. Виды валидности
Проблемы валидизации психологических тестов являются централь­ными для дифференциальной психометрики, но, к сожалению, до сих пор решенными не до конца. Решение этой проблемы зависит не от статисти­ческого аппарата, а от уровня развития теоретического аппарата диффе­ренциальной психологии1.
Валидность теста – это понятие, ука-
зывающее на нам, что тест измеряет и на­сколько хорошо он это делает2.
Валидность (или обоснованность) всякой процедуры измерения со­стоит в однозначности (устойчивости) получаемых результатов относи­тельно измеряемых свойств объектов, т. е. относительно предмета измере­ния. Отличие понятия валидности от надежности измерения удобно рас­крывать с помощью различения «объекта» и «предмета» измерения. На­дежность - это устойчивость процедуры относительно объектов. Надеж­ность не обязательно предполагает валидность. В психологии довольно часто возникает такая ситуация, когда исследователь вначале предлагает определенную процедуру измерения, показывает ее надежность­способность устойчиво различать объекты, но вопрос о валидности остается открытым.
Если в сенсорной психофизике вопрос о валидности измерений ока­зывается в значительной степени затушеванным тем обстоятельством, что простейшие физические стимулы достаточно однозначно детерминируют измеряемые свойства ощущений, то в дифференциальной психометрике значимость проблемы валидности резко возрастает. Здесь ситуация подоб­на той, когда в психофизическом опыте испытуемому не указывают, по ка­кому именно параметру следует сравнивать стимулы. Пусть испытуемый А понял инструкцию так, что стимульные объекты надо сравнивать по весу, а испытуемый Б - по размеру. Если процедура измерения будет повторена по отношению к тем же объектам, то она даст вполне устойчивые данные от­носительно объектов, но не даст валидной информации ни о шкале ощу­щения «веса», ни о шкале ощущений «размера». При измерении способно-
Бодалев, А.А., Столин. Общая диагностика. – СПб.: Изд-во «Речь», 200. С. -112.
Анастази, А. Психологическое тестирование / под ред. К.М.Гуревича, В.И. Лубовско-
го. Предисловие: К.М.Гуревича, В.И.Лубовского. - М.: Педагогика, 1982. - Книга 1. С. 126.
100
1
валидность ≤ надежность
стей предъявляемый тест отнюдь не обязательно актуализирует именно тот психический процесс, который предполагается измерить. Например, столкнувшись с уже встречавшейся однажды задачей (например, с ана­граммой «дзиканпр»), испытуемый может начать запоминать просто то решение, к которому он уже однажды пришел (слово «праздник»), чем за­ново решать эту задачу.
Здесь будет измеряться скорее уровень словесной памяти, чем уровень вербального интеллекта. Точно так же реальная валидность некоторых тестов раскрывается только в результате значительного опыта работы с ними. Например, доказано, что ряд тестов, внешне выглядящих интеллектуальными, на деле измеряют скорее личностно­стилевые особенности индивида, чем операциональные возможности ин­теллекта; например, методика «креативного поля» Д. Б. Богоявленской.
Устойчивость теста относительно объектов (испытуемых) является необходимым, но не достаточным условием его устойчивости относитель­но измеряемых атрибутов (свойств) объектов. Надежность является необ­ходимым, но не достаточным условием валидности. Отсюда вытекает ос­новное соотношение психометрики:
Это означает, что валидность теста не может превышать его надеж­ность.
Данное соотношение, однако, неверно трактовать как указание на прямую пропорциональную связь валидности и надежности. Повышение надежности отнюдь не обязательно приводит к повышению валидности1. В терминах А. Анастази валидность определяется репрезентативностью тес­та относительно измеряемой области поведения. Если эта область поведе­ния складывается из разнообразных феноменов, то содержательная валид­ность теста автоматически требует представленности в нем моделей всех этих разнообразных феноменов. Возьмем глобальное понятие «речевая способность» (этому психологическому термину в традиционной тестоло­гии соответствует термин «вербальный интеллект»). Сюда относятся такие относительно независимые друг от друга навыки, как навыки письма и
Предельной внутренней согласованностью будет, например, обладать тест-оп-
росник, состоящий из повторения одного и того же вопроса. Но валидность в данном случае будет минимальной.
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]