Добавил:
ivanov666
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз:
Предмет:
Файл:Психодиагностика теоретические основы. Учебное пособие
.pdf
81
Стандартные показате-
ли IQ из разных тестов сравнимы лишь в тех случаях, когда в их шкалах используются
одинаковые или близкие по
величине σ. Величину стан-
дартного отклонения следует
всегда указывать в руководстве к тесту и учитывать
пользователем. Если при построении какой-либо шкалы
стандартного IQ выбирается
иное σ, чем в других тестах,
то и смысловое значение любого конкретного IQ по такому тесту будет существенно
отличаться от его смыслового
значения в других тестах.
Следует добавить, что использование термина «IQ» для обозначения
таких стандартных показателей может в какой-то степени вводить в заблуждение. Действительно, стандартные IQ определяются иначе, неже-
ли традиционные коэффициенты IQ, они не являются отношениями
умственного и хронологического возраста. И все же употребление при-
менительно к ним традиционного обозначения оправдывается его привычностью, а также тем, что такие показатели могут интерпретироваться как
IQ при условии приблизительного равенства их σ стандартному отклонению ранее известного IQ. Среди первых тестов, чьи показатели выра-
жались в единицах стандартного IQ, были шкалы интеллекта Векслера со средним М= 100 и стандартным отклонением σ = 15. Стандартный
IQ используется в ряде современных групповых тестов интеллекта и в
третьей (I960) редакции шкалы интеллекта Стэнфорда-Бине.
Эти расхождения проиллюстрированы в табл. 7, приведены проценты
случаев получения показателей IQ при
нормальных распределениях со стандартными отклонениями от 12 до 18.
Эти величины σ фактически использованы в шкалах IQ ряда опубликованных
тестов. Из табл. 5 видно, например, что
IQ ниже 70 отсекает 3,1% площади под
нормальной кривой с σ = 16 (как в шкалах Стэнфорда-Бине), но может отсекать всего лишь 0,7 % площади при
нормальном распределении с σ = 12 или
до 5,1 % при распределении с σ = 18.
IQ, равный 70, традиционно использовался в качестве пограничного значения, отделяющего норму от умственного дефекта. Подобные расхождения, разумеется, имеют место для уровня IQ - 130 и выше, который можно использовать при отборе детей для программ работы с интеллектуально одаренными.

82
Уровень IQ
Процент случаев
σ = 12
σ = 14
σ = 16
σ = 18
130 и выше
0,7
1,6
3,1
5,1
120-129
4,3
6,3
7,5
8,5
110-119
15,2
16,0
15,8
15,4
100-109
29,8
26,1
23,6
21,0
90-99
29,8
26,1
23,6
21,0
80-89
15,2
16,0
15,8
15,4
70-79
4,3
6,3
7,5
8,5
Ниже 70
0,7
1,6
3,1
5,1
Всего
100,0
100,0
100,0
100,0
Таблица 7
Процент случаев получения показателей IQ, соответствующих
разным уровням интеллектуального развития, при нормальных
распределениях и М = 100 и σ = (12, 14, 16, 18)
Диапазон IQ - 90-110, обычно характеризуемый как нормальный,
может включать от 42 до 59,6 % популяции в зависимости от выбранного
теста. Разумеется, издатели тестов стремятся к унификации, принимая σ 16 в новых тестах и новых редакциях старых тестов, однако сохранившийся разнобой в используемых ныне тестах заставляет каждый раз выяснить
величину σ.
Соотношения внутригрупповых показателей. На данном этапе
рассмотрения производных показателей читатель, вероятно, уже уловил
определенную общность между ними. Процентили постепенно приобрели,
по крайней мере на графическом уровне, сходство с нормализованными
стандартными показателями. Линейные стандартные показатели вообще
оказываются неотличимыми от нормализованных, если исходное распределение первичных оценок близко к нормальному. Наконец, стандартные
показатели обратились в IQ, и наоборот. В связи с последним обстоятельством переосмысление традиционного IQ, как в шкале Стэнфорда-Бине,
показывает, что эти первые коэффициенты интеллекта (в виде отношения
УВ к ХВ) тоже можно интерпретировать как стандартные показатели. Если
мы знаем, что распределение коэффициентов IQ Стэнфорда-Бине имеет
М = 100 и σ = 16, отсюда следует, что IQ = 116 превышает среднее на 1σ и
совпадает по смыслу со стандартным показателем z = +1,0. Аналогично,
IQ, = 132 соответствует z = + 2,0, a IQ = 76 эквивалентен z = -1,5 и т. д.

83
Кроме того, показатель IQ Стэнфорда-Бине, равный 116, соответствует
примерно 84-му процентилю, поскольку 84 % площади под нормальной
кривой лежит ниже отметки + 1σ (рис. 8).
Рис. 8. Соотношения между различными типами тестовых
показателей при условии нормального распределения
На рис. 8 показаны соотношения, существующие при нормальном
распределении между рассмотренными типами показателей, включая z -, Т
- и СЕЕВ-показатели, стандартный IQ Векслера (σ = 15), станайны и процентили. Коэффициенты интеллекта (IQ) по любому тесту, если они нор-

84
Межтестовые сравнения
и относительность норм
мально распределены и имеют σ =15, будут совпадать с приведенной здесь
шкалой стандартного IQ. В эту диаграмму можно было бы включить любой другой нормально распределенный IQ при условии, что мы знаем его
стандартное отклонение. Если, например, σ = 20, то IQ = 120 будет соответствовать +1 σ, a IQ = 80, естественно, - 1 σ, и т. д.
IQ или любой другой показатель
следует всегда приводить вместе с на-
званием теста, в котором они получены.
Тестовые показатели невозможно правильно интерпретировать в отрыве от
конкретного теста. Если в школьных записях значится, что Билл Джонс
получил IQ = 94, а Терри Браун - IQ = 110, то эти данные нельзя принимать, так сказать, по нарицательной стоимости без дополнительной информации. Положение этих учащихся вполне могло бы оказаться обратным, доведись им «поменяться» тестами, которые они проходили в своих
школах.
Точно так же относительная позиция индивида по различным функ-
циям может быть неверно интерпретирована из-за несопоставимости тестовых норм. Предположим, учащемуся были даны тесты на понимание
слов и на способность оперировать пространственными представлениями
для оценки его уровня развития в двух соответствующих областях. Если
первый из этих двух тестов стандартизован на случайной выборке учеников старших классов, а второй — на специально отобранной группе учеников, посещающих факультативные занятия в школьных мастерских, тестирующий может ошибочно заключить, что этот учащийся гораздо более
развит в вербальном, чем пространственном отношении, тогда как на самом деле может иметь место обратное.
Другой пример связан со сравнениями в лонгитюдных исследовани-
ях результатов выполнения теста одним и тем же человеком на разных
этапах жизни. Если в личном деле школьника содержатся показатели IQ,
равные 118, 115 и 101, относящиеся соответственно к 4,5 и 6-му классам,
то первый вопрос, который необходимо задать, прежде чем интерпретировать эти изменения, должен быть таким: «Какие тесты давали в этих трех
случаях?» Очевидное снижение результатов может отражать всего-навсего
различие между тестами. В этом случае показатели ребенка остались бы
теми же, даже если бы эти три теста были проведены с интервалом в одну
неделю.

85
Существуют три основные причины систематических вариаций оце-
нок, получаемых одним и тем же человеком по различным тестам. Вопервых, тесты, даже если они одинаково называются, могут различаться по
содержанию. Множество примеров тому мы находим среди так называемых тестов интеллекта, обычно фигурирующих под одним и тем же именем, хотя одни из них включают в себя только вербальные задания, другие
нацелены преимущественно на проверку пространственных способностей,
а третьи могут в равных пропорциях содержать вербальные, пространственные и числовые задания. Во-вторых, иногда несопоставимыми оказываются единицы измерения сравниваемых шкал. Как уже объяснялось, если
показатели IQ по одному тесту имеют σ - 12, а по другому - σ = 18, то испытуемый, получивший по первому тесту IQ - 112, по второму скорее всего получит IQ - 118. В-третьих, состав выборок стандартизации, использо-
ванных при определении норм для разных тестов, может оказаться различным. Очевидно, что результаты одного и того же человека будут выглядеть
лучше на фоне средних результатов менее способной, чем более способной
группы. Несопоставимость содержания тестов или единиц измерения
обычно выявляется при рассмотрении самого теста или при обращении к
руководству по его использованию. Но несоответствие нормативных выборок заметить труднее, и им-то, вероятно, и можно объяснить многие не
поддающиеся иному объяснению расхождения в результатах теста.
2.3. Выборка стандартизации (нормативная выборка)
Любая норма, как бы она ни выражалась, ограничивается конкретной
совокупностью людей, для которой она выводилась. Пользователь теста
никогда не должен забывать о том, каким образом устанавливались тестовые нормы. Нормы психологических тестов ни в каком смысле нельзя считать абсолютными, универсальными или постоянными. Они просто отра-
жают уровень выполнения теста лицами, составляющими выборку
стандартизации. При формировании такой выборки обычно стремятся
получить репрезентативный срез популяции, на которую ориентирован
тест.
В статистике принято различать выборку и (генеральную) совокуп-
ность. Первый из этих двух терминов обозначает группу лиц, которые ре-
ально проходят тестирование. Второй относится к более широкой, но
имеющей тот же состав группе людей, из которой извлекается выборка.
Например, если мы хотим установить нормы выполнения теста для сово-

86
Тестовых норм, действительных для всего рода человеческого, не существует!
купности мальчиков 10 лет, живущих в городах и посещающих общественную школу, то нам нужно было бы отобрать, скажем, 500 десятилетних
мальчиков, посещающих такие школы в нескольких американских городах. Их выборка, чтобы быть действительно репрезентативной для данной
совокупности, должна быть выверена по географическому распределению,
социоэкономическому уровню, этническому составу и другим существенным характеристикам.
При разработке и применении тестовых норм на выборку стандартизации следует обращать особое внимание. Очевидно, что выборка, на которой основываются нормы, должна быть достаточно большой для обеспечения их устойчивости. Другая выборка, извлеченная аналогичным способом из той же совокупности, не должна приводить к нормам, заметно отличающимся от полученных. Нормы с большой ошибкой выборки вряд ли
добавили бы смысла в интерпретацию тестовых показателей.
Столь же важно, чтобы выборка была репрезентативна изучаемой
генеральной совокупности. Необходимо тщательно исследовать даже незначительные факторы, влияющие на отбор испытуемых и делающие выборку нерепрезентативной. Ряд таких факторов можно проиллюстрировать
на примере институционных выборок (т. е. выборок из совокупности членов учебных, военных, лечебных, исправительных и других общественных
заведений). Использование таких выборок ввиду их доступности и возможности привлечения большого числа испытуемых представляется заманчивым для сбора нормативных данных. Однако нужно внимательно
анализировать присущие этим выборкам ограничения. Так, тестированию
школьников свойственно постепенное от класса к классу повышение уровня испытуемых, вследствие отсева менее cпособных учеников. В различных подгруппах это явление выражено неодинаково. Например, процент
выбывших выше для мальчиков, чем
для девочек. Он также выше для социальных групп, находящихся на более
низком экономическом уровне.
Факторы отбора действуют и в
других институционных выборках, например, в выборках заключенных,
пациентов психиатрических больниц или интернатов для умственно отсталых. Благодаря конкретным причинам, определившим помещение индивидуума в специальное учреждение, упомянутые группы не репрезентативны

87
reнеральной совокупности преступников, душевнобольных или умственно
отсталых. Так, умственно отсталые, страдающие физическими недостатками чаще оказываются в специальном учреждении, чем физически полноценные. Аналогично этому доля лиц с глубокой умственной отсталостью
будет намного больше в выборке такого типа, чем в соответствующей генеральной совокупности.
С вопросом репрезентативности выборки тесно связана потребность
точного определения совокупности, на которую можно распространить
полученные нормы. Очевидно, одним из способов обеспечения репрезентативности выборки является ограничение совокупности в соответствии с
техническими характеристиками выборки. Например, если генеральная совокупность определяется так, чтобы включать не всех вообще 14-летних
детей, а только 14-летних школьников, то при таких ограничениях школьная выборка могла бы быть репрезентативной. В идеале, разумеется, желаемая совокупность должна определяться заранее, исходя из целей теста,
а уж затем формироваться выборка. Невозможность привлечь нужных испытуемых может, однако, сделать эту цель недостижимой. В таком случае
лучше переопределить более узко изучаемую совокупность, чем распространять нормы на генеральную совокупность, которая не была адекватно
представлена выборкой стандартизации. На самом деле лишь очень малое
число тестов стандартизовано на таких широких совокупностях, как это
обычно представляется непрофессионалам.
Сомнительно также, чтобы по какому-либо тесту имелись адекватные нормы для таких широко определяемых совокупностей, как «взрослые
американцы-мужчины», «американские дети 10-летнего возраста» и т. п.
Следовательно, выборки, получаемые различными создателями тестов, могут и не представлять в полной мере предполагаемые ими совокупности,
обнаруживая смещенность в тех или иных отношениях. Отсюда и несопоставимость получаемых норм.
При интерпретировании тестовых показателей пользователю теста
следует принимать во внимание специфические факторы, которые могли
повлиять на нормативную выборку, использовавшуюся при стандартизации данного конкретного теста.

88
Ретестовая надежность
2.4. Психометрические критерии научности
психодиагностических методик
2.4.1. Надежность. Виды надежности
Надежность в психометрии означает согласованность показателей,
полученных у тех же самых испытуемых при повторном тестировании тем
же самым тестом или его эквивалентной формой. Выделяется несколько
видов надежности: ретестовая, параллельных (взаимозаменяемых) форм,
внутренней согласованности, расщепления, Кьюдера-Ричардсона, надежность оценщика. Многообразие видов надежности обусловлено разнообразием видов тестов и диагностических методик.
Самый очевидный и понятный метод оп-
ределения надежности результатов теста — его
повторное проведение. В этом случае коэффициент надежности (rn) просто равен корреляции между показателями, полученными теми же испытуемыми в
каждом из двух случаев проведения теста. Дисперсия ошибок соответствует
случайным колебаниям в выполнении заданий от одного сеанса тестирования к
другому. Эти колебания могут отчасти быть результатом неконтролируемых
условий тестирования — таких, как резкие изменения погоды, внезапные шумы и другие отвлекающие факторы или, скажем, сломавшийся некстати карандаш. В какой-то степени они могут быть вызваны и изменениями в состоянии самих тестируемых — например, болезнью, утомлением, эмоциональным напряжением, беспокойством, недавними приятными или неприятными переживаниями и т. д. Ретестовая надежность показывает, в какой
степени результаты теста можно распространить на различные случаи его
применения. Чем выше надежность, тем менее чувствительны тестовые показатели к случайным суточным изменениям состояния тестируемых и обстановки тестирования.
Приводя в руководстве к тесту его ретестовую надежность, всегда
следует указывать, в каком интервале времени она измерена. Поскольку
ретестовые корреляции постепенно снижаются по мере увеличения этого
интервала, для любого теста существует не один, а бесконечное множество
ретестовых коэффициентов надежности. Желательно также давать некоторые сведения о событиях, произошедших за время между двумя сеансами тестирования с теми, на ком измерялась надежность теста, и касающихся их учебы, работы, семейной жизни, консультирования, психотерапии и т. д.

89
Кроме желательности сообщения длины интервала между двумя тестированиями, хорошо бы знать, какими соображениями направлялся выбор
именно этого интервала? Можно привести немало примеров тестов, надежность которых остается высокой в течение нескольких дней или недель, но
спустя десять-пятнадцать лет их результаты уже практически не коррелируют с первоначальными. Так, многие из тестов интеллекта для дошкольников дают достаточно устойчивые показатели на протяжении дошкольного периода, но совершенно бесполезны в качестве инструментов предсказания IQ в позднем детстве или во взрослости. На практике, однако, чаще
всего следуют простому правилу в установлении границ ретестового интервала. Обычно дисперсия ошибок тестового показателя определяется кратковременными, случайными колебаниями, происходящими в интервалах
от нескольких часов до нескольких месяцев. Поэтому при проверке этого
типа тестовой надежности стараются придерживаться небольших временных интервалов. При тестировании маленьких детей этот период должен
быть еще короче, чем у испытуемых старшего возраста, поскольку в первые
годы жизни связанные с возрастным развитием изменения наблюдаются
ежемесячно и даже быстрее. В целом, для любого типа обследуемых лиц ретестовый интервал, по-видимому, редко превышает шесть месяцев.
Какие-либо дополнительные изменения в относительном выполнении
теста одними и теми же людьми, происходящие в более длительные промежутки времени, уместнее относить к кумулятивным и прогрессирующим, а
не к чисто случайным. Кроме того, такие изменения, вероятно, характеризуют более широкую сферу поведения, чем ту, которая проявляется при
выполнении данного теста. Так, общий уровень способности человека к
обучению, пониманию технических устройств или искусства мог за 10 лет
существенно измениться вследствие каких-то произошедших с ним неординарных событий. Его статус с годами мог заметно возрасти или упасть относительно статуса других людей того же возраста вследствие обстоятельств
жизни дома, в школе или условий социального окружения, а также по таким причинам, как физическая болезнь или эмоциональное расстройство.
Степень влияния таких факторов на психологическое развитие человека является важной исследовательской проблемой. Однако этот вопрос
не следует смешивать с вопросом надежности конкретного теста. Например, при измерении надежности тестов Стэнфорда-Бине обычно вычисляется
корреляция между показателями, полученными с интервалом не в десять лет и
даже не в один год, а в несколько недель. Конечно, с этими тестами проводи-
лись и долгосрочные ретестовые испытания, но их результаты обычно обсуж-

90
Методика повторного тести-
рования применима только к
тем тестам, на которые их по-
вторное проведение на одних
и тех же испытуемых не оказывает заметного влияния. К
этой категории относится ряд
моторных тестов и тестов сенсорного различения. Однако
для подавляющего большинства
психологических тестов эта методика определения коэффициента надежности оказывается
неприменимой.
даются с точки зрения предсказуемости уровня интеллекта взрослого на основе
выполнения теста в детском возрасте, а не с точки зрения надежности конкретного теста. Понятие надежности в основном ограничивается сферой краткосрочных случайных изменений, характеризующих технические характеристики самого теста, а не тестируемую область поведения.
Следует отметить, что различные поведенческие функции сами могут
различаться по степени обнаруживаемых суточных колебаний. Например, на
отточенности движений пальцев рук могут сказаться самые незначительные
изменения в состоянии человека, никак не влияющие на понимание им речи.
Если хотят получить полную оценку характера движений пальцев, свойственного конкретному человеку, то, по всей видимости, придется провести повторные тесты в течение нескольких дней; в то же время для оценки уровня его
вербального понимания достаточно было бы одного сеанса тестирования. Всякий раз мы должны обращаться к анализу целей теста и всестороннему осмыслению того поведения, для предсказания которого предназначен данный тест.
Несмотря на кажущуюся простоту и очевидность методики повторного
тестирования, ее применение к большинству психологических тестов представляет немалые трудности. Улучшение показателей как результат тренировки при повторении теста будет, вероятно, различным у разных людей. Кроме
того, если промежуток времени между
первым и вторым тестированием достаточно мал, испытуемые могут припомнить многие из своих прежних ответов. Иными словами, та же картина
правильных и ошибочных ответов, вероятно, воспроизводится благодаря
работе одной только памяти. Следовательно, результаты двух предъявлений
теста не будут независимыми, и корреляция между ними окажется обманчиво высокой. К тому же повторное проведение может изменить саму сущность теста. В первую очередь это относится к задачам, требующим логических рассуждений или сообразительности. Испытуемый, однажды ухватив принцип решения или построив всю
цепь рассуждений, в дальнейшем может воспроизводить правильный ответ,
минуя промежуточные ступени.
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]
