Добавил:
Upload Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:
Фар, Бакарак - Психометрика (перевод Попова А.Ю.).doc
Скачиваний:
1
Добавлен:
01.07.2025
Размер:
2 Мб
Скачать
☆

Глава 11 систематическая ошибка теста

Как следует из предшествующего изложения, психологические тесты могут иметь солидную концептуальную основу и быть грамотно сконструированными, но идеальных тестов все же не бывает. Надежность тестовых баллов может снижаться под влиянием ошибки измерения, а валидность их интерпретации может быть подорвана установкой на ответ, систематически искажающей индивидуально-психологические различия респондентов. В данной главе будет рассматриваться еще одна угроза валидности интерпретации тестовых баллов – систематическая ошибка теста, искажающая различия (или их отсутствие) между группами респондентов. По результатам психологического тестирования зачастую принимаются важные решения, которые влияют на жизнь людей – принимать или не принимать ученика в колледж, в какой класс будет зачислен ребенок, примут ли данного соискателя на работу? Если такого рода решения основаны на результатах теста, дающего систематическую ошибку в пользу или против определенных групп людей, такие ошибки будут иметь крайне важные личные и общественные последствия.

Допустим, исследователя интересует, существуют ли половые различия в уровне математических способностей. Он предлагает репрезентативной выборке мужчин и женщин пройти относительно надежный математический тест, а по результатам обнаруживает, что мужчины в среднем получили более высокие баллы, чем женщины. У исследователя сразу возникнет желание истолковать полученный результат с точки зрения исходного психологического конструкта: у мужчин математические способности развиты лучше, чем у женщин. Тем не менее, есть вероятность того, что результаты тестирования респондентов не являются отражением только лишь их математических способностей. Возможно, что в результатах тестирования присутствует систематическая ошибка. Она может проявляться, например, если в результатах теста переоцениваются истинные математические способности мужчин и недооцениваются математические способности женщин. В этом случае разница между тестовыми баллами мужчин и женщин может быть следствием систематической ошибки теста, а не показателем истинных различий в их математических способностях.

В данной главе будут рассматриваться две формы систематической ошибки теста, а также методы, используемые для их обнаружения. Говоря упрощенно, речь идет о систематических ошибках в значении теста и систематических ошибках в использовании теста. Конструктная систематическая ошибка возникает тогда, когда для двух исследуемых групп значение теста различно, т.е. конструкт, лежащий в основе теста, в данных двух случаях отражается неравнозначно. Конструктная ошибка связана с отношением наблюдаемых тестовых баллов к истинным баллам, выражающим уровень выраженности признака. Если это отношение различно для различных тестируемых групп, можно сделать вывод о том, что тест обладает систематической ошибкой. Наличие конструктной систематической ошибки может привести к такой ситуации, в которой две группы респондентов имеют одинаковый истинный уровень выраженности признака, но различные тестовые баллы.

Второй вид систематической ошибки теста – прогностическая ошибка. Она имеет место тогда, когда использование теста предполагает для двух разных групп респондентов разные последствия. В основе прогностической систематической ошибки лежит соотношение показателей двух различных тестов. Считается, что один из этих тестов (прогностический) дает результаты, которые могут быть использованы для того, чтобы спрогнозировать результаты другого теста (критериального). Например, специалисты приемной комиссии в колледже для прогноза средней успеваемости абитуриента в первый год обучения (GPA) могут использовать результаты этого абитуриента по тесту академических способностей SAT. В данном случае результаты SAT являются прогностической переменной, а средний балл успеваемости GPA – критериальной. В этом контексте систематическая ошибка теста выражает то, насколько взаимосвязь между истинным уровнем выраженности признака, измеряемого прогностическим тестом, и наблюдаемыми баллами критериального теста различна для двух групп. Если для одной из групп тест SAT прогнозирует средний балл успеваемости в колледже точнее, чем для другой группы, то SAT (при его использовании в качестве предиктора успеваемости в колледже) обладает прогностической систематической ошибкой.

Данные два типа систематической ошибки теста (конструктная и прогностическая) независимы друг от друга. Например, тест может обладать прогностической систематической ошибкой, но не обладать конструктной. Тест академических способностей SAT может точно отражать истинные различия между группами респондентов (т.е. не обладать конструктной систематической ошибкой), но при этом академические способности для двух разных групп могут быть взаимосвязаны со средним баллом успеваемости в колледже по-разному (т.е. тест может обладать прогностической систематической ошибкой).

В данной главе будут обсуждаться несколько способов операционального определения и обнаружения систематической ошибки теста. Для обнаружения систематической ошибки тестовых баллов можно использовать по меньшей мере два класса процедур: (а) внутренние методы обнаружения конструктной ошибки, (б) внешние методы обнаружения прогностической ошибки. Такая формулировка звучит достаточно операционально, однако необходимо помнить, что систематическая ошибка теста в обеих своих формах является теоретическим концептом, отчасти потому, что она зависит от теоретических представлений об истинных тестовых баллах. Единственного точного способа обнаружения систематической ошибки теста не существует, как не существует и единственного способа вычисления таких психометрических показателей, как надежность и валидность. Тем не менее, существуют различные общепринятые методы, использующиеся для оценки степени проявления в тесте систематической ошибки.

Красной нитью в определении и обнаружении систематической ошибки теста проходит мысль о том, что разница в тестовых баллах для двух групп не обязательно означает систематическую ошибку. Допустим, при использовании методики диагностики оптимизма было обнаружено, что показатели женщин по шкале оптимизма выше, чем у мужчин. Этот результат сам по себе не является свидетельством наличия систематической ошибки теста (Jensen, 1980, 1998; Thorndike, 1971). Тестовые баллы, полученные респондентами, могут вполне точно отражать их истинный уровень оптимизма. В этом случае тест не обладает систематической ошибкой, а различие средних показателей в двух группах отражает истинное различие в уровне оптимизма между мужчинами и женщинами. Допустим, в некотором исследовании у репрезентативной выборки мужчин и женщин измеряется вес тела. Вероятно, будет обнаружено, что средний вес женщин меньше, чем у мужчин. Этот результат вовсе не будет означать, что шкала, использованная для измерения веса, обладает систематической ошибкой.

В ЧЕМ ВАЖНОСТЬ СИСТЕМАТИЧЕСКОЙ ОШИБКИ ТЕСТОВЫХ БАЛЛОВ?

Вероятно, каждый, читающий эту книгу, уже имел опыт с психологическими тестами. Практически со всеми школьниками США и других развитых стран регулярно проводят тесты, оценивающие успеваемость или учебные достижения. В США большинство старшеклассников, планирующих поступить в высшее учебное заведение, проходят тест академических способностей SAT или Американский тест для поступления в колледж ACT11. Кандидатам на большинство федеральных правительственных постов нужно сдавать государственный гражданский экзамен, а руководство коммерческих предприятий зачастую организует тестирование претендентов на работу, а иногда даже и уже работающий персонал, с использованием психологических методик.

Результаты этого и других видов психологического тестирования часто используются для принятия важных решений, влияющих на судьбу людей. В сфере образования результаты проверки умственных способностей часто используются для того, чтобы подобрать ребенку специальную программу обучения. Также эти результаты используются в суде, когда принимается решение о том, можно или нельзя приговаривать человека, обвиненного в убийстве, к смертной казни. Образовательные учреждения используют баллы стандартизированных тестов, чтобы принимать решение о зачислении абитуриентов. Коммерческие и правительственные организации, по крайней мере частично, также основывают кадровую политику на результатах тестирования. Во многих общеобразовательных школах США учителя обязаны пройти процедуру стандартизированного тестирования, чтобы стать сертифицированными специалистами. Использование психологических тестов в нашем обществе очень распространено, а результаты этих тестов могут оказать огромное влияние на личную и общественную жизнь людей.

Из-за того, что тестирование стало частью нашего общества и его результаты имеют важные последствия для людей, хотелось бы разрабатывать такие тесты, результаты которых позволят дифференцировать респондентов на основании реальных психологических различий, а не на основании групповой принадлежности.

Например, используя шкалу оптимизма, хочется быть уверенным в том, что результаты определяются только лишь самим уровнем оптимизма у респондента, а не искажаются каким- нибудь внешним фактором, таким как его половая принадлежность. Другими словами, хочется пользоваться тестами, оценивающими истинные психологические характеристики и не вносящими в психологическую реальность систематических искажений.

Желание исследователей разрабатывать тесты, не обладающие систематическими ошибками, коренится в убежденности в том, что нельзя дискриминировать людей на основе биологического пола, этнической или расовой принадлежности, вероисповедания или возраста. В некоторых случаях список групп, которые должны быть защищены от систематических ошибок психологических тестов, расширялся и включал в себя такие факторы, как сексуальные предпочтения, беременность, семейное положение, родной язык и всевозможные нарушения здоровья. В каждом из этих случаев необходимо обладать уверенностью в том, что различия в полученных тестовых баллах являются функцией истинных различий в уровне выраженности измеряемого признака. Особенно важно доказывать отсутствие систематической ошибки теста тогда, когда по результатам тестирования средний балл в одной группе респондентов отличается от среднего балла в другой группе.

ОБНАРУЖЕНИЕ КОНСТРУКТНОЙ СИСТЕМАТИЧЕСКОЙ ОШИБКИ: ВНУТРЕННЯЯ ОЦЕНКА ТЕСТА

Конструктная систематическая ошибка зачастую оценивается путем исследования ответов на отдельные пункты теста. Пункт теста может быть подвержен систематической ошибке в том случае, если (а) люди, состоящие в разных группах, дали разные ответы на данный пункт и (б) можно установить, что данные различные ответы не связаны с групповыми различиями, касающимися именно той психологической характеристики, которая измеряется тестом. Например, предположим, что имеется тест на выявление технических способностей, состоящий из ста пунктов. Представим, что из этого теста выбран один пункт и обнаружено, что ответы мужчин совпадают с ответами женщин. В таком случае этот пункт не оказался бы подверженным систематической ошибке (допуская, что мужчины и женщины обладают одинаковым уровнем технических способностей). С другой стороны, если мужчины и женщины с одинаковым уровнем технических способностей дали разные ответы на данный пункт, можно предположить наличие в данном пункте определенного типа систематической погрешности.

Как уже говорилось, большинство психологических тестов являются составными – они состоят из множества пунктов (вопросов, заданий или утверждений). Для таких тестов общий показатель систематической ошибки тестовых баллов является функцией всех частных показателей систематической ошибки, связанных с каждым из пунктов в отдельности. Если показано, что ни один из пунктов в тесте не подвержен систематической ошибке, тогда можно допустить, что итоговый результат теста также не подвержен систематической ошибке. Если же один или более пунктов предположительно содержат систематическую ошибку, тогда можно допустить, что ошибка содержится и в итоговом результате теста.

Как вы помните, систематическая ошибка теста затрагивает взаимосвязь между групповыми различиями в истинных уровнях выраженности признака и групповыми различиями в полученных тестовых баллах. В случае конструктной систематической ошибки пункт теста будет содержать систематическую ошибку в том случае, если ответы людей, принадлежащих к одной группе, отражают их истинную психологическую характеристику, а ответы на этот же пункт людей, принадлежащих к другой группе, - нет (при этом предполагается некая минимальная степень надежности теста). Естественно, узнать истинный уровень выраженности какого-либо психологического признака у респондента невозможно. Поэтому методы, которые будут обсуждаться ниже, являются лишь оценками наличия и степени проявления конструктной систематической ошибки теста

Конструктная систематическая ошибка связана с содержательным значением тестовых баллов. Наличие конструктной систематической ошибки предполагает, что результаты теста могут иметь различный смысл для разных групп людей. Если по результатам исследования обнаружилось, что показатели теста на выявление технических способностей подвержены конструктной систематической ошибке, относящейся к полу респондентов, тогда необходимо учитывать возможность того, что показатели теста в группе мужчин и в группе женщин отражают различные психологические характеристики. Например, ответы мужчин на пункты теста могут определяться главным образом единственной составляющей - техническими способностями. В то же время ответы женщин могут определяться двумя составляющими – техническими способностями и угрозой стереотипа (тенденцией к поведению, которое подтверждает стереотипы о какой-либо социальной группе) (Spencer, Steele, & Quinn, 1999). Таким образом, тест технических способностей у представителей разных полов оценивает разные психологические характеристики.

Далее будут описаны несколько методов, которые могут быть использованы для оценки наличия и степени выраженности конструктной систематической ошибки. Эти методы сосредоточены вокруг внутренней структуры теста, описанной при рассмотрении валидности в Главе 8. В этой главе внутренняя структура теста определялась как «то, как части теста взаимосвязаны друг с другом». Простыми словами, внутренняя структура теста отражает паттерн интеркорреляций между пунктами и/или корреляций между пунктами и суммарным баллом теста. Чтобы оценить наличие конструктной систематической ошибки, исследование внутренней структуры теста проводится отдельно для двух групп. Если эти две группы показывают одинаковую внутреннюю структуру ответов на пункты теста, можно заключить, что данный тест, вероятно, конструктной погрешности не подвержен. Если же в этих двух группах респондентов обнаруживаются различные внутренние структуры ответов, делается заключение о том, что тест может быть подвержен конструктной систематической ошибке. Для выявления конструктной систематической ошибки теста существуют как минимум четыре метода.

Индекс дискриминативности пунктов

Один из методов определения конструктной систематической ошибки заключается в отдельном для двух групп подсчете индексов дискриминативности пунктов. Как было описано в Главе 7, индекс дискриминативности отражает степень взаимосвязи отдельного пункта с суммарным баллу теста (то есть то, насколько люди, ответившие на какой-либо пункт правильно12, имеют тенденцию в целом лучше справиться с тестом, чем те, кто ответил на этот пункт неправильно). Как следствие, высокий индекс дискриминативности показывает, что пункт обладает высокой концептуальной схожестью с большинством других пунктов теста. Таким образом, данные индексы отражают структуру связей между пунктами теста.

Исторически сложилось так, что индекс дискриминативности пунктов развивался в рамках классической теории тестов. Данный индекс играет важную роль в измерении той степени, в которой ответы на пункты теста могут использоваться для того, чтобы проводить различия между людьми на основании их знаний по определенной теме или на основании обладания какой-либо другой психологической характеристикой. Вновь предположим, что группа респондентов опрошена с использованием теста технических способностей. Если люди с высокими техническими способностями с большой вероятностью отвечают на какой-то конкретный вопрос правильно, в то время как люди с низкими техническими способностями отвечают на этот же вопрос правильно с низкой степенью вероятности, данный вопрос будет обладать высоким индексом дискриминативности (например, 0.90). Это будет означать, что данный пункт хорошо дифференцирует людей с разными уровнями технических способностей. И наоборот, если люди с низкими техническими способностями дают правильный ответ на вопрос практически так же часто, как и люди с высокими техническими способностями, в таком случае данный вопрос будет обладать низким индексом дискриминативности (например, 0.10). В этой ситуации пункт не выявляет четких различий между людьми, обладающими разными уровнями технических способностей.

Индекс дискриминативности пунктов может быть использован для оценки конструктной систематической ошибки теста. Для этого выбирается какой-либо пункт, подсчитывается индекс его дискриминативности отдельно для двух групп респондентов, после чего индексы сравниваются между собой. Если два полученных индекса дискриминативности приблизительно одинаковы, исследователь приходит к выводу, что данный пункт, скорее всего, не обладает систематической ошибкой. Однако если величина двух индексов дискриминативности не является приблизительно равной, то можно предположить, что данный пункт в какой-то мере содержит в себе систематическую ошибку. Другими словами, исследователь в этом случае приходит к выводу о том, что данный пункт соответствует тесту в одной группе, но не соответствует в другой. Включение данного пункта в тесты для обеих групп приводит к тому, что тест в двух группах респондентов в некоторой степени различен. Как правило, такой анализ проводится по отдельности для каждого из пунктов теста.

Важной чертой индекса дискриминативности как способа измерения конструктной систематической ошибки теста является то, что он не зависит от количества респондентов, которые дают правильный ответ на вопрос. Например, можно обнаружить, что на определенный пункт в тесте технических способностей ответили правильно лишь 40% мужчин и 60% женщин. Даже в этом случае индекс дискриминативности данного пункта может быть одинаковым в обеих группах. Будет сделано заключение о том, что данный пункт как способ измерения технических способностей функционирует для обеих групп одинаково, хотя женщины и обладают по данному вопросу большими знаниями, чем мужчины (то есть больше женщин дали правильный ответ на вопрос).

Факторный анализ

Второй метод исследования конструктной систематической ошибки теста состоит в проведении факторного анализа пунктов отдельно для двух или более групп. Как уже говорилось в предыдущих главах, факторный анализ является важным инструментом оценки внутренней структуры теста. Факторный анализ - статистическая процедура, которая используется для объединения корреляций или ковариаций в более общие группы, или «факторы», которые в некоторой степени внутренне однородны (более детальное рассмотрение факторного анализа см. в Главе 4). Иногда случается так, что ответы на какие-либо пункты в тесте коррелируют друг с другом гораздо сильнее, чем с ответами на другие пункты теста. Пункты, которые сильно коррелируют друг с другом, статистически связаны, и считается, что они отражают один фактор. Если все пункты в тесте в одинаковой мере коррелируют друг с другом (то есть пункты образуют лишь одну внутренне однородную группу), это свидетельствует о том, что тест является одномерным, т.е. вся вариативность тестовых баллов объясняется (помимо ошибки) единственным фактором.

Факторный анализ может быть использован, чтобы оценить внутреннюю структуру теста отдельно для двух групп людей. Например, можно обнаружить, что среди мужчин тест на выявление технических способностей имеет четко выраженную одномерную структуру – все пункты тесно коррелируют друг с другом, а тестовые баллы отражают один и только один конструкт. Для того чтобы оценить потенциальную возможность наличия конструктной систематической ошибки, необходимо также исследовать факторную структуру ответов на вопросы теста в подвыборке женщин. Если в этой подвыборке респондентов также обнаружится только один фактор, можно заключить, что данный тест на выявление способностей обладает одинаковой внутренней структурой и для мужчин, и для женщин. Следовательно, данный тест не подвержен конструктной систематической ошибке. Однако если факторный анализ «женских» ответов обнаруживает наличие двух или более факторов, можно заключить, что исследуемый тест в выборке мужчин и в выборке женщин обладает разной внутренней структурой. Следовательно, тест подвержен конструктной систематической ошибке. Это приводит к тому, что результаты тестирования в выборке мужчин и женщин отражают разные психологические конструкты.

Анализ дифференциального функционирования пунктов

Вероятно, наилучшим методом оценки конструктной систематической ошибки теста является процедура, известная как «анализ дифференциального функционирования пунктов». Анализ дифференциального функционирования пунктов – часть психометрического подхода IRT (подробное описание которого будет приведено в Главе 13). Важный аспект теории IRT – предположение о том, что уровень выраженности признака у респондента можно оценить исходя непосредственно из данных теста. Уровень выраженности признака – это, в сущности, истинный балл респондента по той психологической характеристике, на измерение которой направлен тест. Предположим, исследователь может оценить уровень выраженности измеряемого признака у всех респондентов в двух группах, а также имеются ответы респондентов на какой-либо из пунктов теста. В этом случае исследователь может проанализировать, насколько соответствуют истинный уровень выраженности признака и ответ респондента на данный пункт, и насколько это соответствие сходно в двух исследуемых группах. Если такого сходства не наблюдается, пункт может быть подвержен систематической ошибке, связанной с групповой принадлежностью респондента.

IRT основана на идее о том, что существует математическая функция, связывающая уровень выраженности признака у респондента и вероятность правильного ответа на тот или иной пункт. Например, может обнаружиться, что для человека с уровнем выраженности признака, на одно стандартное отклонение превышающим средний, вероятность правильного ответа на определенный пункт теста составляет 0.80, в то время как для человека с уровнем выраженности признака на одно стандартное отклонение ниже среднего вероятность правильного ответа составляет 0.20. Так, если исследователь тестирует группу респондентов и в результате обладает информацией об истинных уровнях выраженности измеряемого признака у каждого из них, можно использовать специализированное статистическое программное обеспечение, чтобы построить характеристическую кривую пунктов (ICC). Эта кривая выражает взаимосвязь уровня выраженности измеряемого признака и вероятности правильного ответа для каждого из пунктов теста по отдельности. Более того, если имеются две группы респондентов, можно построить характеристические кривые отдельно для каждой из групп. Для того чтобы оценить наличие конструктной систематической ошибки, нужно сравнить кривые, полученные в двух разных группах. Если рассматриваемый пункт не подвержен систематической ошибке, кривые будут обладать высоким уровнем схожести. Другими словами, вероятность того, что два человека (из разных групп) дадут правильный ответ на вопрос, должна быть одинакова для любых двух респондентов, обладающих одинаковым уровнем выраженности признака. С другой стороны, если пункт подвержен систематической ошибке, характеристические кривые для этих двух групп будут различаться. Другими словами, вероятность того, что два человека (напр., мужчина и женщина) дадут правильный ответ на вопрос, может различаться, даже если уровень выраженности измеряемого признака у них одинаков. Такая ситуация будет ясно указывать на наличие конструктной систематической ошибки.

Предположим, например, что необходимо оценить наличие систематической ошибки в одном из пунктов теста технических способностей. Допустим, исследователя интересует систематическая ошибка относительно биологического пола респондентов. Используя методы и подходы, которые будут детально описываться в Главе 13, можно вычислить для каждого из респондентов суммарный балл технических способностей (который будет отражать уровень выраженности измеряемого признака), а также вероятность правильного ответа на тот или иной пункт. Эту информацию можно использовать для того, чтобы построить характеристическую кривую пункта (ICC) (см. Рисунок 11.1). Далее нужно распределить испытуемых на две группы (т.е. на группу мужчин и группу женщин) и построить характеристическую кривую отдельно для каждой из групп. Если эти кривые приблизительно совпадают, можно прийти к выводу, что пункт не подвержен систематической ошибке. Предположим, однако, что были получены результаты, изображенные на Рисунках 11.2 и 11.3. Подобные результаты позволяют предположить наличие систематической ошибки. Рисунок 11.2 иллюстрирует пример монотонной систематической ошибки. Здесь женщинам, обладающим тем же уровнем технических способностей, что и мужчины, труднее ответить на вопрос. Рисунок 11.3 иллюстрирует пример немонотонной систематической ошибки, при которой характеристические кривые различаются как по расположению, так и по форме. В данном случае, вероятно, анализируемый пункт измеряет у мужчин и у женщин несколько разные признаки. Построение характеристических кривых для оценки конструктной систематической ошибки является всего лишь методом визуализации, в репертуар IRT входят и более точные количественные процедуры (напр., Smith & Reise, 1998).

Рисунок 11.1. Характеристическая кривая пункта в общей выборке

Рисунок 11.2. Характеристические кривые пункта в выборке мужчин и женщин: иллюстрация монотонной систематической ошибки

Рисунок 11.3. Характеристические кривые пункта в выборке мужчин и женщин: иллюстрация немонотонной систематической ошибки

Несмотря на то, что анализ дифференциального функционирования пунктов является достаточно сильным методом для определения конструктной систематической ошибки, в нем имеется недостаток. Во многих своих аспектах анализы IRT достаточно сложны – какую модель использовать, как определить, действительно ли уровень выраженности признака в двух группах различен, либо же это проявление погрешности измерения. Кроме того, сложности заключаются в необходимости достаточно большого объема выборки, достаточной гетерогенности респондентов и пунктов (для того, чтобы обладать репрезентативностью по отношению к полному спектру признаков, на измерение которых направлен тест), а также в необходимости специализированного статистического программного обеспечения. Эти сложности обусловливают то, что теория IRT только лишь начинает использоваться как метод определения конструктной систематической ошибки теста.

Ранжирование

Существует еще один быстрый и простой с точки зрения вычислений способ оценки конструктной систематической ошибки теста при том условии, что задания теста можно упорядочить по уровню сложности. Рассматривая в качестве примера тест на выявление технических способностей, состоящий из 100 пунктов, можно отметить, что на некоторые из вопросов теста ответить легче, и, соответственно, пункты теста можно упорядочить по уровню сложности. Ранжирование можно произвести для разных групп по отдельности (напр., для мужчин и для женщин). Если порядок пунктов в двух группах различается, можно предположить наличие конструктной систематической ошибки. Данное предположение делается на основании того, что в таком случае каждый из пунктов дает в разных группах оценку разных показателей. Ранги можно использовать для вычисления коэффициента ранговой корреляции Спирмена («ро», который интерпретируется так же, как rxy), что в свою очередь позволит оценить степень согласованности результатов ранжирования в двух группах. Если данный коэффициент является низким (напр., < 0.90), можно предположить наличие конструктной ошибки. Если же обнаруживается наличие конструктной ошибки, возможно, у исследователя появится желание с помощью дополнительных статистических процедур определить точную причину низкого коэффициента корреляции (см. Jensen, 1980).

Следует заметить, что ранговый коэффициент корреляции может быть высоким, даже если количество правильных ответов на пункт в разных группах различно. Взяв в качестве примера тест на выявление технических способностей, можно заметить, что женщины с меньшей долей вероятности могут дать правильные ответы на определенные вопросы теста, чем мужчины, однако ранжирование вопросов по уровню сложности может быть одинаковым в обеих группах. Как и в случае с индексом дискриминативности, групповые различия в количестве правильных ответов сами по себе не являются показателем наличия систематической ошибки теста.

ОПРЕДЕЛЕНИЕ ПРОГНОСТИЧЕСКОЙ СИСТЕМАТИЧЕСКОЙ ОШИБКИ: ВНЕШНЯЯ ОЦЕНКА ТЕСТА

Прогностическая ошибка связана со степенью того, насколько одинаково тестовые баллы в разных группах предсказывают значение некой критериальной переменной. Например, предполагается, что тест академических способностей SAT измеряет уровень учебных достижений. Допуская, что уровень успеваемости в средней школе имеет отношение к уровню успеваемости в первый год обучения в колледже (выражаемому в показателе GPA), вузы зачастую используют результаты тестирования по SAT для принятия решения о зачислении абитуриентов. Предполагается, что на основе школьного теста академических способностей можно с некоторой степенью точности предсказать учебную успеваемость студента-первокурсника. Если в результате получается, что возможность успешно предсказать уровень академической успеваемости первокурсников на основе школьных тестов в различных группах респондентов различается, можно предположить, что школьные тесты подвержены прогностической систематической ошибке измерения.

Наличие прогностической ошибки исследуется путем измерения двух переменных. Исследуется степень того, насколько показатели основного теста (прогностического) могут использоваться для прогнозирования показателей респондентов по какому-либо другому психологическому параметру (критериальной переменной), который предположительно связан с показателями основного теста.

Определение наличия прогностической ошибки начинается с предположения о том, что тест является «универсальной мерой», т.е. дает одинаковый прогноз для всех групп респондентов. С целью подтверждения данного предположения проводятся разного рода статистические анализы. Если анализы подтверждают, что тест для обеих групп одинаково прогностичен, исследователь приходит к выводу, что тест не подвержен прогностической ошибке (по крайней мере, в отношении исследуемой критериальной переменной и исследуемых групп респондентов). Если же по результатам анализа обнаруживается, что прогностичность теста для двух групп неодинакова, можно заключить, что данный тест подвержен прогностической систематической ошибке.

Представьте, что вы занимаете должность агента по выбору участников обучающих программ в крупной компании, которая тратит большие суммы денег на развитие у работников механических навыков, нужных для проведения определенных операций. Ваша работа заключается в том, чтобы выбрать для этой обучающей программы наиболее талантливых кандидатов. Выбор именно тех людей, которые с большей долей вероятности справятся с программой успешно, является существенно важным из-за ее стоимости. Успех вашей работы зависит от того, насколько правильно вы сделаете выбор. Для того чтобы увеличить вероятность правильного выбора, вы разрабатываете тест на выявление технических способностей, который предоставляете всем кандидатам. Более того, вы предполагаете, что результаты этого теста будут связаны с некоторым параметром, отражающим успешность в работе после прохождения обучающей программы. Например, после проведения данной программы уровень технической компетентности каждого работника будет оцениваться руководителем. Наконец, вы предполагаете, что между показателями теста на выявление технических способностей, проведенного перед обучающей программой, и оценкой технической компетентности (со стороны руководителя) после ее проведения существует положительная линейная связь. Другими словами, кандидаты с высокими показателями технических способностей (прогностический тест) будут получать более высокие оценки технической компетентности после прохождения обучающей программы (критериальная переменная), нежели кандидаты с низкими показателями технических способностей.

При разработке и оценке теста на выявление технических способностей вы можете запланировать оценку прогностической систематической ошибки. Прогностическая ошибка связана с использованием показателей теста для того, чтобы предсказать значение некой релевантной переменной (напр., поведение, компетентность, успешность и т.д.), которая будет играть роль в ситуациях, отличных от той, в которой проводился тест. Поэтому если у вас есть причина думать, что тест на выявление технических способностей будет обладать предсказательной способностью только для группы мужчин, но не женщин, вы можете предположить наличие прогностической систематической ошибки теста.

Для того чтобы оценить эффективность теста на выявление технических способностей и наличие в нем прогностической ошибки, вам необходимо обратить внимание на два вопроса: а) действительно ли ваш тест помогает предсказать итог обучающей программы и б) одинаково ли верно ваш тест прогнозирует этот итог в двух разных группах респондентов? Чтобы ответить на эти вопросы, вам понадобятся данные, которые могут быть использованы, чтобы оценить прогностическую эффективность вашего теста. Подобные данные могут быть получены путем проведения тестирования среди участников программы перед ее проведением и регистрацией итоговых показателей (критериальных переменных) в конце обучающей программы. Эти два вопроса часто исследуются с помощью статистического метода под названием «регрессия», при котором вы используете показатели теста на выявление технических способностей, проведенного перед обучающей программой, для того, чтобы рассчитать прогнозируемые оценки технической компетентности, выставляемые впоследствии руководителем.

Основы регрессионного анализа

Регрессионный анализ основан на предположении о том, что между показателями теста и критериальной переменной существует линейная связь. Если такая связь действительно существует, то для того, чтобы спрогнозировать значение критериальной переменной исходя из показателей теста способностей, можно воспользоваться следующей формулой прямой линии:

Ŷ= a + b(X),

где Ŷ – прогнозируемое значение критериальной переменной для отдельно взятого респондента, a – свободный член (прогнозируемое значение критериальной переменной при условии, что тестовый балл равен нулю), b – угловой коэффициент регрессии, или наклон линии регрессии по отношению к осям координат (число, которое показывает, как изменится показатель Ŷ при увеличении показателя Х на 1 пункт), а X – балл, полученный респондентом в тесте способностей. Для проведения регрессионного анализа и вычисления значений a и b используется множество видов статистического программного обеспечения.

После вычисления значений свободного члена и наклона линии регрессии появляется возможность оценить способность теста к прогнозированию. Так, можно взять индивидуальный балл респондента по тесту способностей (X), подставить его в регрессионное уравнение и рассчитать для этого человека прогнозируемую экспертную оценку работодателя (Ŷ).

Чтобы проиллюстрировать этот процесс, используем данные из Таблицы 11.1. В этой таблице приведены баллы, полученные четырьмя респондентами по тесту способностей, а также (для каждого из респондентов) значение критериальной переменной, т.е. экспертная оценка профессиональной успешности (следует заметить, что подобный анализ предполагает наличие гораздо большего числа участников). На основании регрессионного анализа в пакете SPSS величина a (свободный член) составляет 56.03, а угловой коэффициент регрессии (b) составляет 0.58. Эти результаты говорят о том, что прогнозируемое значение критериальной переменной у респондента с тестовым баллом, равным нулю, равняется 56.03, и что при увеличении тестового балла на 1 пункт критериальная переменная увеличивается на 0.58.

Таблица 11.1. Данные, иллюстрирующие пример регрессионного анализа

Респондент

Балл по тесту способностей

Экспертная оценка руководителя (критериальная переменная)

Прогнозируемая оценка руководителя (прогнозируемое значение критериальной переменной)

1

32

75

74.59

2

40

80

79.23

3

57

81

89.09

4

60

98

90.83

Как было упомянуто ранее, эти величины могут быть использованы для того, чтобы получить прогнозируемые значения критериальной переменной для всех участников тестирования путем подстановки их тестовых баллов в следующее регрессионное уравнение:

Ŷ=56.03 +0.58(X)

Прогнозируемая оценка руководителя = 56.03 + 0.58 (тестовый балл).

Например, для респондента с тестовым баллом 69 прогнозируемая оценка руководителя составляет 96.05:

Ŷ=56.03 + 0.58(69),

Ŷ=96.05.

Сходным образом, для респондента с тестовым баллом 70 прогнозируемая оценка руководителя составляет 96.63:

Ŷ=56.03+ 0.58(70),

Ŷ=96.63.

Заметьте, что разница между этими двумя прогнозируемыми показателями составляет 0.58 (96.63 – 96.05 = 0.58), что соответствует наклону линии регрессии в регрессионном уравнении. Другими словами, отклонение в тестовом балле на 1 пункт влечет за собой отклонение в значении критериальной переменной на 0.58.

Если подсчитать прогнозируемые значения критериальной переменной для большого числа тестовых баллов, можно построить линейный график регрессии (линию наилучшего соответствия). Каждая точка на графике линейной регрессии связана с прогнозируемым значением Y для каждого из X. Этот график используется для того, чтобы проиллюстрировать связь между прогнозируемыми значениями критериальной переменной и тестовыми баллами. В Таблице 11.1 приведены прогнозируемые показатели Ŷ для каждого из респондентов. На графике на Рисунке 11.4 для каждого из респондентов изображены показатели по тесту и по критериальной переменной (точками), а также показана линия регрессии, которая отражает прогнозируемые оценки кандидата руководителем.

«Универсальная мера»: общее регрессионное уравнение

Рисунок 11.4. Баллы респондента по тесту способностей и экспертные оценки руководителя: график рассеивания и линия регрессии

Оценка прогностической ошибки теста обычно начинается с определения того, что произойдет, если ошибки обнаружено не будет. Если тест не подвержен систематической прогностической ошибке, одно регрессионное уравнение должно быть одинаково применимо к разным группам респондентов. Предположение о том, что к разным группам респондентов подходит общее регрессионное уравнение, основано на рассмотрении теста как «универсальной меры», не зависящей от пола, этнической принадлежности, культуры и любых других групповых различий. В этом случае прогностическая способность теста должна адекватно выражаться одним и тем же регрессионным уравнением.

Представьте, что вы предлагаете тест способностей большому количеству кандидатов на прохождение обучающей программы (напр., 100 человек). Предположим, в выборке равное количество мужчин и женщин, и вы хотите убедиться, что тест не подвержен систематической ошибке относительно пола респондентов. Чтобы начать исследование этой проблемы, вы можете рассчитать регрессионное уравнение, основанное на данных всей выборки вне зависимости от пола. Представьте, что в этом уравнении a = 56.03, а наклон линии регрессии b = 0.58. Эти величины характеризуют общее регрессионное уравнение и, следовательно, будут называться общим свободным членом и общим наклоном линии регрессии. Таким образом, если ваш тест на выявление способностей не подвержен систематической ошибке относительно пола, общее регрессионное уравнение должно быть одинаково применимо как к мужчинам, так и к женщинам.

Чтобы оценить наличие прогностической ошибки, необходимо провести дополнительные серии регрессионного анализа. Чтобы определить, действительно ли общее регрессионное уравнение одинаково применимо как для мужчин, так и для женщин, необходимо рассчитать одно регрессионное уравнение для мужчин и одно - для женщин. Затем нужно сравнить эти уравнения с общим регрессионным уравнением. Если коэффициенты внутригрупповых регрессионных уравнений не совпадают с коэффициентами общего регрессионного уравнения, можно предположить, что тестовые баллы подвержены систематической ошибке. На практике для такого рода анализа существует множество сложных статистических процедур, однако представленное здесь обсуждение будет сконцентрировано на более концептуальном уровне. Чтобы разъяснить специфику интерпретации различного рода результатов, сперва сосредоточимся на систематической ошибке свободного члена, а затем на систематической ошибке наклона линии регрессии. На практике, однако, группы с большей степенью вероятности будут различаться в обоих элементах регрессии сразу. Поэтому ниже будет также проиллюстрирован эффект систематической ошибки одновременно как в свободном члене регрессии, так и в наклоне регрессионной линии.

Систематическая ошибка свободного члена регрессии

Предположим, что регрессионный анализ внутри групп показывает, что и в группе мужчин, и в группе женщин наклон линии регрессии совпадает с общим регрессионным уравнением, но значения свободного члена расходятся со значением, данным в общем регрессионном уравнении. В этом случае можно предположить, что тест подвержен систематической ошибке свободного члена регрессии.

Например, представьте, что в рассматриваемом примере с тестом технических способностей регрессионный анализ проводится отдельно для 50 мужчин и для 50 женщин. Обнаруживается, что для обеих групп наклон линии регрессии b составляет 0.58, что совпадает с наклоном линии регрессии в общем регрессионном уравнении. Однако обнаруживается также, что значение свободного члена регрессии в группе мужчин a = 58.03, а в группе женщин a = 54.03. Следует заметить, что данные внутригрупповые значения свободного члена регрессии расходятся со значением свободного члена в общем регрессионном уравнении. Следовательно, тест, вероятно, подвержен систематической ошибке свободного члена регрессии.

Каковы же следствия наличия этой ошибки? Тот факт, что значение свободного члена регрессии в группе мужчин выше, чем в группе женщин, указывает на то, что при любом одинаковом уровне способностей экспертная оценка руководителей для мужчин будет выше, чем для женщин. Чтобы проиллюстрировать это, рассчитаем прогнозируемые значения критериальной переменной для мужчин с тестовым баллом, равным 70, и для женщин с таким же тестовым баллом:

Прогнозируемое значение критериальной переменной для мужчин = 58.03 + 0.58(70),

Прогнозируемое значение критериальной переменной для мужчин = 98.63,

Прогнозируемое значение критериальной переменной для женщин = 54.03 + 0.58(70),

Прогнозируемое значение критериальной переменной для женщин = 94.63.

Данные расчеты показывают, что при одинаковом уровне способностей у мужчин и у женщин прогнозируемая экспертная оценка руководителя в группе мужчин будет на 4 пункта выше. Если предположить, что критериальная переменная сама по себе не подвержена систематической ошибке (это предположение будет рассмотрено ниже в данной главе), данное расхождение в значениях показывает, что тест технических способностей для мужчин и для женщин «работает» по-разному. Как было показано ранее, прогнозируемое значение критериальной переменной в общем регрессионном уравнении при тестовом балле, равном 70, составляло 96.63. Сравнивая данный результат с внутригрупповыми результатами, приходим к выводу, что общее регрессионное уравнение преуменьшает экспертную оценку руководителя для мужчин и преувеличивает - для женщин. Таким образом, тест оказывается подверженным прогностической систематической ошибке.

Если тест подвержен только лишь систематической ошибке свободного члена регрессии, величина расхождения между группами будет оставаться постоянной при всех значениях тестового балла. Выше было показано, что расхождение по прогнозируемому значению критериальной переменной между мужчиной и женщиной, тестовые баллы которых равны 70, составило 4 пункта. Если тест способностей подвержен систематической ошибке только лишь свободного члена регрессии, такое же расхождение будет наблюдаться при любом из возможных тестовых баллов. Это проиллюстрировано на Рисунке 11.5, где изображена как общая линия регрессии (пунктиром), так и линии регрессии отдельно для двух групп. Как показано на рисунке, эти линии параллельны, что означает, что прогнозируемая экспертная оценка руководителя для респондента-мужчины с определенным уровнем технических способностей всегда будет на 4 балла превышать такую оценку для респондента-женщины с таким же уровнем технических способностей.

Рисунок 11.5. Графики линейной регрессии в группах мужчин и женщин по сравнению с графиком общего регрессионного уравнения (иллюстрация систематической ошибки свободного члена регрессии)

Систематическая ошибка наклона линии регрессии (вариант: систематическая ошибка углового коэффициента регрессии)

Прогностическая систематическая ошибка теста может проявляться также через ошибку наклона линии регрессии. Предположим, что регрессионный анализ показал, что значение свободного члена регрессии для группы мужчин и для группы женщин является сходным с аналогичным значением в общем регрессионном уравнении, однако показатель наклона линии регрессии в этих группах отличается от общего. Это означает, что связь между тестовыми баллами и значениями критериальной переменной в двух группах различается.

Например, предположим, что значение свободного члена регрессии а для обеих групп составляет 56.03, что сходится со значением свободного члена в общем регрессионном уравнении. Однако значение наклона линии регрессии для мужчин составляет b = 0.53, а для женщин b = 0.63. Следует заметить, что данные значения наклона линии регрессии отдельно для двух групп респондентов отличаются от наклона, общего для двух групп (0.58).

Наклон линии регрессии значительным образом отражается на степени расхождения между прогнозируемыми значениями критериальной переменной для двух групп. Тот факт, что наклон линии регрессии в группе мужчин меньше, чем наклон линии регрессии в группе женщин, показывает, что систематическая ошибка варьирует в зависимости от полученного тестового балла. Чтобы проиллюстрировать это, следует рассчитать прогнозируемые значения критериальной переменной для мужчины с тестовым баллом, равным 70, и для женщины с таким же тестовым баллом:

Прогнозируемое значение критериальной переменной для мужчин = 56.03 + 0.53(70),

Прогнозируемое значение критериальной переменной для мужчин = 93.13,

Прогнозируемое значение критериальной переменной для женщин = 56.03 + 0.63(70),

Прогнозируемое значение критериальной переменной для женщин = 100.13.

Результаты показывают, что при тестовом балле, равном (как у мужчины, так и у женщины) 70, прогнозируемое значение критериальной переменной для женщины будет на 7 баллов выше, чем для мужчины. Рассчитаем теперь прогнозируемое значение критериальной переменной для мужчины и для женщины, тестовый балл которых (по тесту технических способностей) составляет 60.

Прогнозируемое значение критериальной переменной для мужчин = 56.03 + 0.53(60),

Прогнозируемое значение критериальной переменной для мужчин = 87.83

Прогнозируемое значение критериальной переменной для женщин = 56.03 + 0.63(60)

Прогнозируемое значение критериальной переменной для женщин = 93.83

В данном случае прогнозируемое значение критериальной переменной для женщины превышает «мужское» уже на 6 баллов. Таким образом, систематическая ошибка (т.е. степень, в которой прогнозируемые значения критериальной переменной различаются у мужчин и женщин, имеющих одинаковые тестовые баллы) является относительно незначительной для относительно низких уровней выраженности технических способностей, но с повышением уровня выраженности способностей увеличивается. Другими словами, расхождение между прогнозируемыми значениями критериальной переменной будет увеличиваться по мере увеличения полученных респондентами тестовых баллов. Такого рода «чистая» систематическая ошибка наклона линии регрессии изображена на Рисунке 11.6, который показывает, что линии регрессии для мужчин и для женщин уже не параллельны друг другу, а расходятся.

Рисунок 11.6. Графики линейной регрессии в группах мужчин и женщин по сравнению с графиком общего регрессионного уравнения (иллюстрация систематической ошибки наклона линии регрессии)

Смешанная систематическая ошибка свободного члена и наклона линии регрессии

До сих пор рассматривались лишь «чистые» систематические ошибки свободного члена регрессии или наклона линии регрессии – случаи, в которых систематической ошибке подвержен либо первый элемент, либо второй, но не оба вместе взятые. Подводя итог, можно отметить, что «чистая» систематическая ошибка свободного члена регрессии показывает, что между двумя группами существует расхождение в предсказанном значении критериальной переменной, кроме того, величина этого расхождения с изменением тестового балла не меняется. И наоборот, «чистая» систематическая ошибка наклона линии регрессии показывает, что величина расхождения изменяется вместе с изменением тестовых баллов, получаемых респондентами.

Также возможно (и чаще всего происходит на практике) одновременное присутствие систематической ошибки и свободного члена, и наклона линии регрессии. В таком случае между тестовыми баллами и прогнозируемым значением критериальной переменной в двух разных будет наблюдаться сложная взаимосвязь. Например, может оказаться, что при низком уровне технических способностей прогнозируемое значение критериальной переменной для мужчин будет выше, чем для женщин; однако же при высоком уровне технических способностей прогнозируемое значение критериальной переменной будет выше в группе женщин. Возможны весьма различные варианты такого рода расхождений, один из них изображен на Рисунке 11.7.

Рисунок 11.7. Графики линейной регрессии в группах мужчин и женщин по сравнению с графиком общего регрессионного уравнения (иллюстрация смешанной систематической ошибки свободного члена и наклона линии регрессии)

Систематическая ошибка критериальной переменной

До сих пор обсуждение систематической прогностической ошибки было сосредоточено вокруг самого валидизируемого теста. Однако также возможны случаи, когда систематической ошибке подвержена критериальная переменная. Например, возможно, что руководитель, проводящий оценку компетентности участников после прохождения ими обучающей программы, склоняется в пользу одной из групп. Тест, использующийся в качестве критериальной переменной, например, 100-пунктовый тест технической компетентности, также может быть подвержен ошибке. В приведенных выше рассуждениях всегда подразумевалось, что критериальная переменная систематическую ошибку не содержит, но, естественно, такой вариант тоже возможен.

Эффект надежности

Следует понимать, что и угловой коэффициент регрессии (наклон линии), и значение свободного члена зависят от надежности тестовых показателей. В приведенном выше обсуждении подразумевалось, что валидизируемый тест и критериальная переменная обладают высокой надежностью (напр., Rxx > 0.90). Уменьшение надежности тестовых показателей может оказать значительное влияние на параметры регрессионного уравнения и, как следствие, повлиять на заключение исследователя о наличии прогностической погрешности. Эти вопросы являются довольно сложными и выходят за рамки данной книги, но заинтересованному читателю можно порекомендовать Дженсена (Jensen, 1980, глава 9).

ДРУГИЕ СТАТИСТИЧЕСКИЕ МЕТОДЫ

Следует также отметить, что для обнаружения систематической ошибки тестовых баллов используются и другие статистические методы, до сих пор нами не затронутые. Например, такой метод, как моделирование структурными уравнениями, при определенных условиях может определить наличие как конструктной, так и прогностической систематической ошибки. В качестве статистического метода оценки прогностической систематической ошибки в данной главе рассматривался регрессионный анализ. Такие более сложные регрессионные методы, как, например, иерархическая регрессия, расширяют возможности традиционного и предоставляют исследователям возможность тестировать гипотезы о конкретных источниках ошибки. Моделирование структурными уравнениями и такие регрессионные методы, как иерархическая регрессия, являются довольно сложными статистическими процедурами, рассмотрение которых выходит за рамки данной книги.

СПРАВЕДЛИВОСТЬ ТЕСТА

Наконец, остановимся вкратце на такой противоречивой проблеме психологического тестирования, как справедливость теста. Когда результаты психологического теста используются для принятия решений, которые влияют на жизнь людей, респонденты, принадлежащие к определенной группе (напр., к определенным этническим или расовым меньшинствам) могут посчитать, что результаты теста являются несправедливыми и неблагоприятными для членов именно этой группы. Например, предположим, работодатель использует определенный психологический тест, чтобы отобрать потенциальных сотрудников. Предположим, что в среднем мужчины справляются с тестом лучше женщин, поэтому более вероятно, что на работу наймут мужчин. Женщины могут посчитать, что результаты теста используются несправедливо.

Очень важно отличать справедливость теста от систематической ошибки теста. Как уже говорилось, систематическая ошибка теста – это психометрическое понятие, используемое в теориях валидности тестовых показателей. Систематическая ошибка определяется в рамках психометрических теорий статистическими методами, которые позволяют исследователям принимать решение о наличии или отсутствии погрешности измерения. Справедливость теста, наоборот, не имеет отношения к психометрическим свойствам. Справедливость теста имеет отношение к правильному использованию результатов тестирования и является скорее социальным, философским и, возможно, правовым термином, который отражает ценностное суждение (Ghiselli et al., 1981; Jensen, 1980; Thorndike, 2005). Здесь уместно было бы вспомнить старинный афоризм о том, что справедливость – в глазах смотрящего. Можно опросить респондентов о том, считают ли они тест справедливым, но их ответы не будут иметь ничего общего с психометрическими свойствами данного теста. Возможен вариант, когда исследователь имеет убедительные доказательства того, что показатели определенного теста не подвержены систематической ошибке, однако у большинства респондентов складывается мнение, что показатели теста используются несправедливо. Более того, они могут быть правы, потому что справедливость теста и систематическая ошибка теста - два разных понятия, которые существуют в различных областях знания, в научной сфере и в общественно-политической сфере.

Справедливость теста – важная проблема психологического тестирования. Психологическое тестирование предполагает выбор и администрирование теста, а также интерпретацию его результатов. Предполагается, что психодиагносты должны быть знакомы с психометрическими свойствами используемого теста. Те действия, которые психодиагносты производят с результатами теста, могут повлиять на суждение респондентов о его справедливости. Более того, даже тест с высокими психометрическими качествами может быть использован для принятия несправедливых решений. Справедливость теста является важной социальной проблемой. Психометрические свойства теста, включая информацию о потенциальном наличии систематической ошибки, всегда должны служить фактором применения теста в той или иной сфере, однако они не всегда влияют на то, как справедливость теста будут оценивать сами респонденты.

РЕЗЮМЕ

В нескольких последних главах затрагивался ряд вопросов, имеющих большое значение для определения понятий надежности и валидности. В Главе 8 были представлены концептуальные основы валидности, имеющие отношение к интерпретации и использованию результатов теста. Также в ней были рассмотрены несколько видов эмпирических показателей, свидетельствующих о валидности теста (напр., внутренняя структура теста, взаимосвязь теста с другими переменными). В Главе 9 рассматривались методы, которые используются, чтобы оценить «номологическую сеть» результатов тестирования: например, такие методы, как матрица множественных методов и признаков и квантификация конструктной валидности. Данные методы могут быть использованы для того, чтобы определить, насколько взаимосвязь результатов тестирования с другими переменными соответствует той, которая была предсказана на основе теоретического конструкта.

Данная и предыдущая главы представили на рассмотрение анализ тех факторов, которые могут представлять угрозу для надежности и валидности интерпретации и использования тестовых баллов. В Главе 10 рассматривались установки респондента на тот или иной ответ (напр., установка на согласие, установка на социальную желательность). Систематическая ошибка, связанная с установками на ответ, искажает истинные индивидуальные различия между респондентами. В Главе 11 рассматривалась уже систематическая ошибка теста, которая приводит к тому, что систематически искажаются (или создаются) различия между группами респондентов. Существуют простые и широко распространенные методы работы с установками респондентов на тот или иной ответ. Что касается методов работы с систематической ошибкой теста, они несколько противоречивы и во многом выходят за пределы данной книги. Для того, чтобы познакомиться с современными исследованиями данных вопросов, рекомендуем заинтересованным читателям обратиться к работам таких авторов, как Sackett, Schmitt, Ellingson (2001).

В целом можно отметить, что валидность интерпретации и использования тестовых баллов – фундаментальная проблема, с которой сталкиваются ученые, изучающие поведение и использующие для этого методы психологического измерения. Спустя десятилетия концептуальной и методологической работы разработчики, пользователи и исследователи тестов определили значение и способы оценки валидности. Несмотря на то, что факторы, угрожающие валидности, до сих пор существуют, психологи добились значительного прогресса в идентификации этих факторов и в разработке различных стратегий для их выявления, предотвращения или сведения к минимуму. Тем не менее, психологические тесты должны использоваться и интерпретироваться в тесном соотношении с теоретическими и практическими основами их значения и применения, которые описаны в предыдущих главах.

РЕКОМЕНДУЕМАЯ ЛИТЕРАТУРА

Одна из самых полных и информативных работ по проблемам систематической ошибки теста и справедливости его использования:

Jensen, A.R. (1980).Bias in mental testing. New York: Free Press.