Добавил:
ivanov666
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз:
Предмет:
Файл:Психодиагностика теоретические основы. Учебное пособие
.pdf
91
Надежность взаимозаменяемых форм
Один из способов избе-
жать трудностей, с которыми
приходится сталкиваться при определении ретестовой надежности, — использование взаимозаменяемых форм (alternate forms) теста. Одних и тех же испы-
туемых могут тестировать в первый раз с помощью одной формы, а второй
раз — с помощью другой, эквивалентной формы. Корреляция между показателями, полученными по двум формам теста, представляет его коэффициент
надежности. Заметим, что такой коэффициент надежности служит мерой как
временной устойчивости, так и согласованности ответов на различные выборки заданий (или формы теста). Таким образом, этот коэффициент служит
смешанной характеристикой двух типов надежности. Однако, поскольку оба ее
типа важны для большинства целей тестирования, надежность взаимозаменяемых форм оказывается полезной мерой для оценки многих тестов. Понятие
выборочной проверки заданий или выборочной проверки содержания лежит в
основе не только данного, но и других типов надежности, о которых речь пойдет
дальше. Именно поэтому оно заслуживает более тщательного рассмотрения.
Вероятно, каждому студенту когда-то доставались на экзамене вопросы именно
по той теме, к которой он был особенно хорошо подготовлен или, напротив, знал
этот материал особенно плохо. Столь знакомая всем ситуация иллюстрирует
дисперсию ошибок, вызванную выборочной проверкой содержания. В какой
степени показатели данного теста зависят от факторов, специфичных для
этой конкретной подборки заданий? И если другой исследователь, работая независимо от нас, подготовил бы другой тест в соответствии с теми же требованиями, то насколько бы результаты этих тестов отличались друг от друга?
Предположим, что для оценки понимания слов общего употребления
был сконструирован словарный тест, состоящий из 40 заданий. Предположим
далее, что с той же целью был составлен второй тест из 40 других слов, причем
были соблюдены все предосторожности, чтобы трудность теста оставалась той
же самой. Различия в показателях, полученных по этим двум тестам одними и
теми же людьми, иллюстрирует рассматриваемый тип дисперсии ошибок. Под
действием случайных факторов, связанных с прошлым опытом разных людей,
относительная трудность двух списков будет несколько меняться с переходом
от одного человека к другому. Так, первый список может содержать больше
слов, незнакомых испытуемому A, чем второй, в котором, в свою очередь, могло оказаться непропорционально много слов, незнакомых испытуемому В. Если
оба испытуемых примерно равны по своему словарному запасу (т. е. по своим
«истинным показателям»), то В тем не менее превзойдет A по первому списку,

92
тогда как А превзойдет В по второму. Относительное положение испытуемых А
и В по данным двум спискам окажется взаимно противоположным из-за слу-
чайных различий в подборке заданий.
Как и в случае ретестовой надежности, сведения о надежности взаимозаменяемых форм всегда должны сопровождаться указанием длительности временного интервала между двумя предъявлениями теста, а также характеристикой релевантных событий, происшедших за это время в жизни испытуемых.
Если обе формы применяются непосредственно одна за другой, то полученная
корреляция показывает только надежность параллельных форм, но ничего не говорит о надежности как временной устойчивости. Дисперсия ошибок в этом случае обусловлена колебаниями результатов при переходе от одного набора заданий
к другому, а не временными флуктуациями показателей.
При разработке взаимозаменяемых форм, безусловно, следует позаботиться о том, чтобы они на самом деле были параллельными. Принципиально
важно, чтобы параллельные формы конструировались как независимые тесты,
отвечающие, однако, одним и тем же требованиям. Такие тесты должны содержать одинаковое число заданий, представленных в одной и той же форме и
с однотипным содержанием. Диапазон и уровень трудности заданий тоже
должны быть одинаковыми. Инструкции, временные рамки, поясняющие примеры, формат бланков и все другие аспекты теста также необходимо проверить
на сопоставимость.
Следует добавить, что наличие параллельных форм желательно и по другим соображениям, помимо определения надежности теста. Взаимозаменяемые
формы полезны при повторных исследованиях и при изучении влияния некоторых промежуточных экспериментальных факторов на выполнение теста. Использование нескольких взаимозаменяемых форм служит, кроме того, средством уменьшения возможности натаскивания в выполнении тестов и обмана.
Несмотря на гораздо более широкое сравнительно с ретестовой надежностью применение, надежность взаимозаменяемых форм также обнаруживает ряд ограничений. Прежде всего, если изучаемые поведенческие функции подвержены значительному влиянию тренировки, использование параллельных форм ослабит, но не устранит его полностью. Конечно, если бы
у всех тестируемых наблюдалось одно и то же улучшение результатов при
повторном проведении теста, это не повлияло бы на корреляцию показателей, поскольку прибавление постоянной величины к каждому показателю не
меняет коэффициента корреляции. Однако, скорее всего, улучшение результатов у разных людей будет неодинаковым вследствие индивидуаль-

93
Надежность эквивалентных
половин теста
ных различий в опыте работы с подобным материалом, в мотивации участия в тесте и по других причинам. При этих условиях эффект тренировки
представляет собой еще один источник дисперсии, снижающей, в общем,
корреляцию между двумя формами. Но если влияние тренированности невелико, снижение корреляции будет незначительным.
Другая проблема связана с возможным изменением сущности теста
при повторном его проведении. Например, если в параллельных задачах на
сообразительность применен один и тот же принцип, то большинство испытуемых, однажды найдя решение, и во второй раз применят его. В подобных случаях одной замены содержания заданий явно недостаточно для того, чтобы избежать переноса принципа принципов решения из одной формы
теста на другую. Наконец, следует добавить, что для многих тестов взаимозаменяемые формы отсутствуют ввиду практических трудностей создания
подлинно эквивалентных форм. В силу этих причин часто приходится обращаться к другим методам оценки надежности теста.
Меру надежности можно определить и на основании однократного применения единственной формы теста,
пользуясь для этого различными процедурами расщепления теста на две
равноценные половины. При таком способе каждый испытуемый получает
два показателя благодаря разделению теста на две эквивалентные части.
Очевидно, что надежность, найденная методом расщепления, дает нам меру
согласованности выборочных проверок содержания. Временная устойчивость показателей в такой характеристике надежности не представлена, поскольку она предполагает только один сеанс тестирования. Этот тип коэффициента надежности иногда называют коэффициентом внутренней согласованности, так как для его определения требуется лишь однократное проведение единственной формы теста.
Первая проблема, с которой мы сталкиваемся при применении метода
расщепления, связана с тем, как разделить тест, чтобы добиться максимальной эквивалентности его половин. Всякий тест можно членить многими
способами. В большинстве тестов первая и вторая половины оказались бы
неэквивалентными вследствие различий в характере и уровне трудности
заданий, а также в связи с кумулятивными эффектами вхождения в работу,
практики, утомления, скуки и любых других факторов, воздействие которых
нарастает от начала к концу теста. Подходящий для большинства целей метод состоит в вычислении показателей отдельно по четным и нечетным за-

94
Надежность
по Кьюдеру-Ричадсону
и коэффициент альфа
даниям теста. Если задания теста были изначально расположены в порядке
возрастания трудности, то такое разбиение дает практически эквивалентные показатели обеих половин. Одна предосторожность, которую требуется
при этом соблюдать, относится к случаю, когда тест содержит группу взаимосвязанных заданий — например, когда несколько вопросов касаются какого-то одного чертежа механического устройства в тесте технических способностей или одного и того же фрагмента текста в тесте чтения. В этом случае
каждая такая группа заданий должна быть целиком отнесена либо к одной,
либо к другой половине. Если задания таких групп разделить на две части,
то возникнет обманчивое сходство сравниваемых показателей, так как любая ошибка в понимании задачи скажется на выполнении заданий из обеих
половин.
Полученные показатели по двум частям теста коррелируются обычным методом. Нужно иметь в виду, однако, что эта корреляция в действительности показывает надежность лишь половины теста. Например, если
весь тест состоит из 100 заданий, то корреляция вычисляется между двумя
множествами показателей, каждый из которых основан только на выполнении 50 заданий. В отличие от надежности этого типа при расчете ретестовой
надежности, как и надежности взаимозаменяемых форм, каждый показатель
основывается на полном наборе заданий теста.
При прочих равных условиях - чем больше заданий содержит тест,
тем выше его надежность. Вполне оправданно ожидать, что чем обширнее
выборка поведения, тем адекватнее и согласованнее получаемые единицы
измерения. Влияние, оказываемое увеличением или сокращением теста на
его коэффициент надежности, можно оценить с помощью формулы Спирмена-Брауна.
Данный метод определения надежности предполагает однократное предъявление единственной формы теста, основан на оценке согла-
сованности ответов по всем заданиям теста.
На эту внутреннюю согласованность влияют два источника дисперсии
ошибок: 1) выборочная представленность содержания (как в случае надежности взаимозаменяемых форм и эквивалентных половин теста) и 2)
неоднородность выборочной области поведения. Чем однороднее эта область, тем выше внутренняя согласованность. Например, если один тест
включает только задания на умножение, а другой — на сложение, вычитание, умножение и деление, то первый тест, вероятно, покажет более высо-

95
кую внутреннюю согласованность, чем второй. Во втором, более разнородном тесте, один испытуемый может лучше справиться с вычитанием,
чем с другими арифметическими действиями. Другой покажет относительно высокий результат в делении, но хуже проявит себя в сложении, вычитании и умножении и т.д. Более контрастным примером однородности и
разнородности мог бы служить тест, состоящий из 40 словарных заданий,
и тест, содержащий 10 словарных заданий, 10 заданий на пространственные отношения, 10 — на арифметическое рассуждение и 10 — на скорость
восприятия. В последнем тесте связь между выполнением различных типов заданий одним человеком может быть незначительной или полностью
отсутствовать.
Очевидно, что чем однороднее тест, тем однозначнее его результаты.
Предположим, что в последнем из только что упомянутых тестов из 40 заданий Смит и Джонс получили по 20 баллов. Можем ли мы заключить, что
с этим тестом они справились одинаково? Вовсе нет. Смит мог правильно
ответить на 10 словарных вопросов, выполнить 10 заданий на скорость
восприятия и не справиться ни с одним заданием на арифметическое рассуждение и пространственные отношения. Напротив, 20 баллов Джонса
могли распределиться таким образом: 5 - за скорость восприятия, 5 - за
пространственные отношения, 10 - за арифметическое рассуждение и 0 - за
словарь.
Суммарный показатель в 20 баллов, разумеется, можно было бы набрать путем множества других комбинаций, и тогда он имел бы совершенно иной смысл для каждой из таких различных комбинаций. С другой стороны, в более однородном словарном тесте показатель в 20 баллов, вероятно, означал бы, что испытуемый правильно указал значение примерно 20
первых слов, если задания располагались в порядке возрастания трудности. Он мог ошибиться в отношении двух-трех сравнительно легких слов,
дать правильный ответ по более трудным словам, расположенным под номерами, большими 20-ти, но такие индивидуальные колебания ничтожны по
сравнению с теми, которые обнаруживаются в более разнородном тесте.
Весьма существенным в этой связи является вопрос об относительной
однородности (или неоднородности) самого критериального признака, на предсказание которого направлен тест. Хотя однородные тесты могут предпочитаться, потому что их показатели допускают довольно однозначную интерпретацию, но взятый в отдельности однородный тест, очевидно, непригоден для
предсказания крайне неоднородного критериального признака. Более того, при
предсказании неоднородного признака-критерия разнородность заданий теста

96
Надежность оценщика
не обязательно означала бы дисперсию ошибок. Традиционные тесты интеллекта дают хороший пример неоднородных тестов, предназначенных для предсказания неоднородного критериального признака. В подобных случаях, однако,
иногда желательно составить несколько относительно однородных тестов,
каждый из которых измерял бы различные аспекты неоднородного критериального признака. Тем самым однозначная интерпретация показателей теста
могла бы сочетаться с адекватным охватом признака-критерия.
Самая распространенная методика оценки внутренней согласованности
была разработана Кьюдером и Ричардсоном (Kuder, & Richardson, 1937). Эта
методика опирается на результаты выполнения каждого задания.
Формула Кьюдера—Ричардсона применима лишь к тем тестам, в которых выполнение заданий оценивается как правильное либо ошибочное,
или, в общем, по принципу «все или ничего». В некоторых тестах, однако,
практикуется более дифференцированная форма представления результатов
отдельных заданий. Например, в личностном опроснике респондент может
получить различные числовые показатели по любому конкретному пункту
опросника в зависимости от того, на какой из готовых категорий ответов он
остановил свой выбор: «обычно», «иногда», «редко», «никогда». Для таких
тестов была выведена обобщенная формула, известная как коэффициент
альфа (Сгоnbach, 1951; Kaiser, & Michael, 1975; Novick, & Lewis, 1967). Про-
цедура вычислений состоит в нахождении дисперсии всех индивидуальных
балльных оценок по каждому заданию с последующим суммированием этих
дисперсий по всем заданиям.
Различные типы надежности отличаются
друг от друга факторами, относимыми к источникам дисперсии ошибок. В одном случае дисперсия ошибок охватывает
временн е колебания, в другом относится к различиям между наборами параллельных заданий, в третьем учитывает любую внутреннюю несогласованность теста. С другой стороны, факторы, исключенные из мер дисперсии
ошибок, образуют два широких класса: а) факторы, чья дисперсия со-
храняется в показателях, так как эти факторы составляют часть истинных
различий, измеряемых тестами, и б) нерелевантные факторы, поддающиеся экспериментальному контролю. Например, в руководстве к тесту не принято сообщать об ошибках измерения, которые могут появиться в результате
проведения теста в отвлекающей обстановке или в более короткое или длительное, чем это положено, время. Подобных нарушений можно избежать, и

97
Общий обзор типов
и коэффициентов надежности
поэтому нет нужды в отдельных коэффициентах надежности, соответствующих «дисперсии отвлечения» или «дисперсии временных лимитов».
Большинство тестов, особенно если они предназначены для массового
обследования с использованием компьютеров для вычисления показателей,
настолько стандартизированы, что их проведение и регистрация результатов сводят на нет дисперсию ошибок, обусловленную этими факторами.
Пользуясь такими тестами, необходимо лишь внимательно следить за выполнением соответствующих предписаний. Вместе с тем в отношении клинических тестов, применяемых при интенсивных индивидуальных обследованиях, накоплены данные о значительной дисперсии наблюдателя. Благо-
даря использованию специальных планов эксперимента удается отделить эту
ми колебаниями в состоя-
нии испытуемого или применением взаимозаменяемых форм теста.
Один источник дисперсии ошибок, который довольно легко установить, — это дисперсия оценщика (scorer variance). Некоторые типы тестов,
— особенно тесты креативности и проективные личностные тесты — предоставляют довольно много свободы пользователю, оценивающему ответы испытуемого и выставляющему за них определенное количество баллов. При
работе с такими тестами потребность в мере надежности оценщика столь же
велика, как и в более привычных коэффициентах надежности. Надежность
оценщика можно определить, располагая выборкой протоколов выполнения теста, оцененного двумя специалистами независимо друг от друга. Между двумя множествами полученных таким образом показателей вычисляется обычный коэффициент корреляции, который и служит искомой мерой
надежности оценщика. Если подсчет показателей теста существенно зависит
от суждений пользователя, то в руководстве к тесту необходимо также привести и коэффициент надежности оценщика.
Различные виды только что рас-
смотренных коэффициентов надежности сведены в табл. 8 - 9. В табл. 8 ме-
тоды, применяемые для оценки каждого типа надежности, сгруппированы в
зависимости от числа требуемых для этой цели форм теста и сеансов тестирования. В табл. 9 представлены источники дисперсии, трактуемые каждым
из методов как дисперсия ошибок.

98
Необходимое
число сеансов
тестирования
Необходимое число форм теста
Одна
Две
Один
Расщепления
Кьюдера-Ричардсона
Надежность оценщика
Взаимозаменяемые (непосредственно следующие друг за другом)
Два
Ретестовая
Взаимозаменяемые
(проводимые через определенный промежуток
времени)
Тип коэффициента надежности
Дисперсия ошибки
Ретестовый
испытуемого
Взаимозаменяемых форм
(непосредственный)
Неоднородность содержания
Взаимозаменяемых форм
(с временным интервалом)
Колебания состояния испытуемого
и неоднозначность содержания
Кьюдера-Ричардсона
Неоднородность и неоднозначность
содержания
Надежность оценщика
Индивидуальные различия
ставящих оценки
Таблица 8
Методы измерения надежности теста в зависимости
от форм теста и сеансов тестирования
Таблица 9
Источники дисперсии ошибки для различных
коэффициентов надежности

99
1
2
Валидность и надежность
2.4.2. Валидность. Виды валидности
Проблемы валидизации психологических тестов являются центральными для дифференциальной психометрики, но, к сожалению, до сих пор
решенными не до конца. Решение этой проблемы зависит не от статистического аппарата, а от уровня развития теоретического аппарата дифференциальной психологии1.
Валидность теста – это понятие, ука-
зывающее на нам, что тест измеряет и насколько хорошо он это делает2.
Валидность (или обоснованность) всякой процедуры измерения состоит в однозначности (устойчивости) получаемых результатов относительно измеряемых свойств объектов, т. е. относительно предмета измерения. Отличие понятия валидности от надежности измерения удобно раскрывать с помощью различения «объекта» и «предмета» измерения. Надежность - это устойчивость процедуры относительно объектов. Надежность не обязательно предполагает валидность. В психологии довольно
часто возникает такая ситуация, когда исследователь вначале предлагает
определенную процедуру измерения, показывает ее надежностьспособность устойчиво различать объекты, но вопрос о валидности
остается открытым.
Если в сенсорной психофизике вопрос о валидности измерений оказывается в значительной степени затушеванным тем обстоятельством, что
простейшие физические стимулы достаточно однозначно детерминируют
измеряемые свойства ощущений, то в дифференциальной психометрике
значимость проблемы валидности резко возрастает. Здесь ситуация подобна той, когда в психофизическом опыте испытуемому не указывают, по какому именно параметру следует сравнивать стимулы. Пусть испытуемый А
понял инструкцию так, что стимульные объекты надо сравнивать по весу, а
испытуемый Б - по размеру. Если процедура измерения будет повторена по
отношению к тем же объектам, то она даст вполне устойчивые данные относительно объектов, но не даст валидной информации ни о шкале ощущения «веса», ни о шкале ощущений «размера». При измерении способно-
Бодалев, А.А., Столин. Общая диагностика. – СПб.: Изд-во «Речь», 200. С. -112.
Анастази, А. Психологическое тестирование / под ред. К.М.Гуревича, В.И. Лубовско-
го. Предисловие: К.М.Гуревича, В.И.Лубовского. - М.: Педагогика, 1982. - Книга 1.
С. 126.

100
1
валидность ≤ надежность
стей предъявляемый тест отнюдь не обязательно актуализирует именно тот
психический процесс, который предполагается измерить. Например,
столкнувшись с уже встречавшейся однажды задачей (например, с анаграммой «дзиканпр»), испытуемый может начать запоминать просто то
решение, к которому он уже однажды пришел (слово «праздник»), чем заново решать эту задачу.
Здесь будет измеряться скорее уровень словесной памяти, чем
уровень вербального интеллекта. Точно так же реальная валидность
некоторых тестов раскрывается только в результате значительного
опыта работы с ними. Например, доказано, что ряд тестов, внешне
выглядящих интеллектуальными, на деле измеряют скорее личностностилевые особенности индивида, чем операциональные возможности интеллекта; например, методика «креативного поля» Д. Б. Богоявленской.
Устойчивость теста относительно объектов (испытуемых) является
необходимым, но не достаточным условием его устойчивости относительно измеряемых атрибутов (свойств) объектов. Надежность является необходимым, но не достаточным условием валидности. Отсюда вытекает основное соотношение психометрики:
Это означает, что валидность теста не может превышать его надежность.
Данное соотношение, однако, неверно трактовать как указание на
прямую пропорциональную связь валидности и надежности. Повышение
надежности отнюдь не обязательно приводит к повышению валидности1. В
терминах А. Анастази валидность определяется репрезентативностью теста относительно измеряемой области поведения. Если эта область поведения складывается из разнообразных феноменов, то содержательная валидность теста автоматически требует представленности в нем моделей всех
этих разнообразных феноменов. Возьмем глобальное понятие «речевая
способность» (этому психологическому термину в традиционной тестологии соответствует термин «вербальный интеллект»). Сюда относятся такие
относительно независимые друг от друга навыки, как навыки письма и
Предельной внутренней согласованностью будет, например, обладать тест-оп-
росник, состоящий из повторения одного и того же вопроса. Но валидность в данном
случае будет минимальной.
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]
