Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Психодиагностика теоретические основы. Учебное пособие

.pdf
Скачиваний:
3
Добавлен:
08.09.2026
Размер:
2 Мб
Скачать
☆
81
Стандартные показате-
ли IQ из разных тестов срав­нимы лишь в тех случаях, ко­гда в их шкалах используются
одинаковые или близкие по величине σ. Величину стан-
дартного отклонения следует всегда указывать в руково­дстве к тесту и учитывать пользователем. Если при по­строении какой-либо шкалы стандартного IQ выбирается иное σ, чем в других тестах, то и смысловое значение лю­бого конкретного IQ по тако­му тесту будет существенно отличаться от его смыслового значения в других тестах.
Следует добавить, что использование термина «IQ» для обозначения таких стандартных показателей может в какой-то степени вводить в за­блуждение. Действительно, стандартные IQ определяются иначе, неже-
ли традиционные коэффициенты IQ, они не являются отношениями умственного и хронологического возраста. И все же употребление при-
менительно к ним традиционного обозначения оправдывается его привыч­ностью, а также тем, что такие показатели могут интерпретироваться как IQ при условии приблизительного равенства их σ стандартному отклоне­нию ранее известного IQ. Среди первых тестов, чьи показатели выра-
жались в единицах стандартного IQ, были шкалы интеллекта Вексле­ра со средним М= 100 и стандартным отклонением σ = 15. Стандартный
IQ используется в ряде современных групповых тестов интеллекта и в третьей (I960) редакции шкалы интеллекта Стэнфорда-Бине.
Эти расхождения проиллюстри­рованы в табл. 7, приведены проценты случаев получения показателей IQ при нормальных распределениях со стан­дартными отклонениями от 12 до 18. Эти величины σ фактически использо­ваны в шкалах IQ ряда опубликованных тестов. Из табл. 5 видно, например, что IQ ниже 70 отсекает 3,1% площади под нормальной кривой с σ = 16 (как в шка­лах Стэнфорда-Бине), но может отсе­кать всего лишь 0,7 % площади при нормальном распределении с σ = 12 или до 5,1 % при распределении с σ = 18. IQ, равный 70, традиционно использо­вался в качестве пограничного значе­ния, отделяющего норму от умственно­го дефекта. Подобные расхождения, ра­зумеется, имеют место для уровня IQ - 130 и выше, который можно ис­пользовать при отборе детей для программ работы с интеллектуально ода­ренными.
82
Уровень IQ
Процент случаев
σ = 12
σ = 14
σ = 16
σ = 18
130 и выше
0,7
1,6
3,1
5,1
120-129
4,3
6,3
7,5
8,5
110-119
15,2
16,0
15,8
15,4
100-109
29,8
26,1
23,6
21,0
90-99
29,8
26,1
23,6
21,0
80-89
15,2
16,0
15,8
15,4
70-79
4,3
6,3
7,5
8,5
Ниже 70
0,7
1,6
3,1
5,1
Всего
100,0
100,0
100,0
100,0
Таблица 7
Процент случаев получения показателей IQ, соответствующих
разным уровням интеллектуального развития, при нормальных
распределениях и М = 100 и σ = (12, 14, 16, 18)
Диапазон IQ - 90-110, обычно характеризуемый как нормальный, может включать от 42 до 59,6 % популяции в зависимости от выбранного теста. Разумеется, издатели тестов стремятся к унификации, принимая σ ­16 в новых тестах и новых редакциях старых тестов, однако сохранивший­ся разнобой в используемых ныне тестах заставляет каждый раз выяснить величину σ.
Соотношения внутригрупповых показателей. На данном этапе рассмотрения производных показателей читатель, вероятно, уже уловил определенную общность между ними. Процентили постепенно приобрели, по крайней мере на графическом уровне, сходство с нормализованными стандартными показателями. Линейные стандартные показатели вообще оказываются неотличимыми от нормализованных, если исходное распре­деление первичных оценок близко к нормальному. Наконец, стандартные показатели обратились в IQ, и наоборот. В связи с последним обстоятель­ством переосмысление традиционного IQ, как в шкале Стэнфорда-Бине, показывает, что эти первые коэффициенты интеллекта (в виде отношения УВ к ХВ) тоже можно интерпретировать как стандартные показатели. Если мы знаем, что распределение коэффициентов IQ Стэнфорда-Бине имеет М = 100 и σ = 16, отсюда следует, что IQ = 116 превышает среднее на 1σ и совпадает по смыслу со стандартным показателем z = +1,0. Аналогично,
IQ, = 132 соответствует z = + 2,0, a IQ = 76 эквивалентен z = -1,5 и т. д.
83
Кроме того, показатель IQ Стэнфорда-Бине, равный 116, соответствует примерно 84-му процентилю, поскольку 84 % площади под нормальной кривой лежит ниже отметки + 1σ (рис. 8).
Рис. 8. Соотношения между различными типами тестовых
показателей при условии нормального распределения
На рис. 8 показаны соотношения, существующие при нормальном распределении между рассмотренными типами показателей, включая z -, Т
- и СЕЕВ-показатели, стандартный IQ Векслера (σ = 15), станайны и про­центили. Коэффициенты интеллекта (IQ) по любому тесту, если они нор-
84
Межтестовые сравнения
и относительность норм
мально распределены и имеют σ =15, будут совпадать с приведенной здесь шкалой стандартного IQ. В эту диаграмму можно было бы включить лю­бой другой нормально распределенный IQ при условии, что мы знаем его стандартное отклонение. Если, например, σ = 20, то IQ = 120 будет соот­ветствовать +1 σ, a IQ = 80, естественно, - 1 σ, и т. д.
IQ или любой другой показатель
следует всегда приводить вместе с на-
званием теста, в котором они получены. Тестовые показатели невозможно правильно интерпретировать в отрыве от конкретного теста. Если в школьных записях значится, что Билл Джонс получил IQ = 94, а Терри Браун - IQ = 110, то эти данные нельзя прини­мать, так сказать, по нарицательной стоимости без дополнительной ин­формации. Положение этих учащихся вполне могло бы оказаться обрат­ным, доведись им «поменяться» тестами, которые они проходили в своих школах.
Точно так же относительная позиция индивида по различным функ-
циям может быть неверно интерпретирована из-за несопоставимости тес­товых норм. Предположим, учащемуся были даны тесты на понимание слов и на способность оперировать пространственными представлениями для оценки его уровня развития в двух соответствующих областях. Если первый из этих двух тестов стандартизован на случайной выборке учени­ков старших классов, а второй — на специально отобранной группе учени­ков, посещающих факультативные занятия в школьных мастерских, тести­рующий может ошибочно заключить, что этот учащийся гораздо более развит в вербальном, чем пространственном отношении, тогда как на са­мом деле может иметь место обратное.
Другой пример связан со сравнениями в лонгитюдных исследовани-
ях результатов выполнения теста одним и тем же человеком на разных этапах жизни. Если в личном деле школьника содержатся показатели IQ, равные 118, 115 и 101, относящиеся соответственно к 4,5 и 6-му классам, то первый вопрос, который необходимо задать, прежде чем интерпретиро­вать эти изменения, должен быть таким: «Какие тесты давали в этих трех случаях?» Очевидное снижение результатов может отражать всего-навсего различие между тестами. В этом случае показатели ребенка остались бы теми же, даже если бы эти три теста были проведены с интервалом в одну неделю.
85
Существуют три основные причины систематических вариаций оце-
нок, получаемых одним и тем же человеком по различным тестам. Во­первых, тесты, даже если они одинаково называются, могут различаться по содержанию. Множество примеров тому мы находим среди так называе­мых тестов интеллекта, обычно фигурирующих под одним и тем же име­нем, хотя одни из них включают в себя только вербальные задания, другие нацелены преимущественно на проверку пространственных способностей, а третьи могут в равных пропорциях содержать вербальные, пространст­венные и числовые задания. Во-вторых, иногда несопоставимыми оказы­ваются единицы измерения сравниваемых шкал. Как уже объяснялось, если показатели IQ по одному тесту имеют σ - 12, а по другому - σ = 18, то ис­пытуемый, получивший по первому тесту IQ - 112, по второму скорее все­го получит IQ - 118. В-третьих, состав выборок стандартизации, использо- ванных при определении норм для разных тестов, может оказаться различ­ным. Очевидно, что результаты одного и того же человека будут выглядеть лучше на фоне средних результатов менее способной, чем более способной группы. Несопоставимость содержания тестов или единиц измерения обычно выявляется при рассмотрении самого теста или при обращении к руководству по его использованию. Но несоответствие нормативных вы­борок заметить труднее, и им-то, вероятно, и можно объяснить многие не поддающиеся иному объяснению расхождения в результатах теста.
2.3. Выборка стандартизации (нормативная выборка)
Любая норма, как бы она ни выражалась, ограничивается конкретной совокупностью людей, для которой она выводилась. Пользователь теста никогда не должен забывать о том, каким образом устанавливались тесто­вые нормы. Нормы психологических тестов ни в каком смысле нельзя счи­тать абсолютными, универсальными или постоянными. Они просто отра-
жают уровень выполнения теста лицами, составляющими выборку стандартизации. При формировании такой выборки обычно стремятся
получить репрезентативный срез популяции, на которую ориентирован тест.
В статистике принято различать выборку и (генеральную) совокуп- ность. Первый из этих двух терминов обозначает группу лиц, которые ре- ально проходят тестирование. Второй относится к более широкой, но имеющей тот же состав группе людей, из которой извлекается выборка. Например, если мы хотим установить нормы выполнения теста для сово-
86
Тестовых норм, действи­тельных для всего рода че­ловеческого, не существует!
купности мальчиков 10 лет, живущих в городах и посещающих общест­венную школу, то нам нужно было бы отобрать, скажем, 500 десятилетних мальчиков, посещающих такие школы в нескольких американских горо­дах. Их выборка, чтобы быть действительно репрезентативной для данной совокупности, должна быть выверена по географическому распределению, социоэкономическому уровню, этническому составу и другим существен­ным характеристикам.
При разработке и применении тестовых норм на выборку стандарти­зации следует обращать особое внимание. Очевидно, что выборка, на ко­торой основываются нормы, должна быть достаточно большой для обеспе­чения их устойчивости. Другая выборка, извлеченная аналогичным спосо­бом из той же совокупности, не должна приводить к нормам, заметно от­личающимся от полученных. Нормы с большой ошибкой выборки вряд ли добавили бы смысла в интерпретацию тестовых показателей.
Столь же важно, чтобы выборка была репрезентативна изучаемой генеральной совокупности. Необходимо тщательно исследовать даже не­значительные факторы, влияющие на отбор испытуемых и делающие вы­борку нерепрезентативной. Ряд таких факторов можно проиллюстрировать на примере институционных выборок (т. е. выборок из совокупности чле­нов учебных, военных, лечебных, исправительных и других общественных заведений). Использование таких выборок ввиду их доступности и воз­можности привлечения большого числа испытуемых представляется за­манчивым для сбора нормативных данных. Однако нужно внимательно анализировать присущие этим выборкам ограничения. Так, тестированию школьников свойственно постепенное от класса к классу повышение уров­ня испытуемых, вследствие отсева менее cпособных учеников. В различ­ных подгруппах это явление выражено неодинаково. Например, процент выбывших выше для мальчиков, чем для девочек. Он также выше для соци­альных групп, находящихся на более низком экономическом уровне.
Факторы отбора действуют и в других институционных выборках, например, в выборках заключенных, пациентов психиатрических больниц или интернатов для умственно отста­лых. Благодаря конкретным причинам, определившим помещение индиви­дуума в специальное учреждение, упомянутые группы не репрезентативны
87
reнеральной совокупности преступников, душевнобольных или умственно
отсталых. Так, умственно отсталые, страдающие физическими недостатка­ми чаще оказываются в специальном учреждении, чем физически полно­ценные. Аналогично этому доля лиц с глубокой умственной отсталостью будет намного больше в выборке такого типа, чем в соответствующей ге­неральной совокупности.
С вопросом репрезентативности выборки тесно связана потребность точного определения совокупности, на которую можно распространить полученные нормы. Очевидно, одним из способов обеспечения репрезен­тативности выборки является ограничение совокупности в соответствии с техническими характеристиками выборки. Например, если генеральная со­вокупность определяется так, чтобы включать не всех вообще 14-летних детей, а только 14-летних школьников, то при таких ограничениях школь­ная выборка могла бы быть репрезентативной. В идеале, разумеется, же­лаемая совокупность должна определяться заранее, исходя из целей теста, а уж затем формироваться выборка. Невозможность привлечь нужных ис­пытуемых может, однако, сделать эту цель недостижимой. В таком случае лучше переопределить более узко изучаемую совокупность, чем распро­странять нормы на генеральную совокупность, которая не была адекватно представлена выборкой стандартизации. На самом деле лишь очень малое число тестов стандартизовано на таких широких совокупностях, как это обычно представляется непрофессионалам.
Сомнительно также, чтобы по какому-либо тесту имелись адекват­ные нормы для таких широко определяемых совокупностей, как «взрослые американцы-мужчины», «американские дети 10-летнего возраста» и т. п. Следовательно, выборки, получаемые различными создателями тестов, мо­гут и не представлять в полной мере предполагаемые ими совокупности, обнаруживая смещенность в тех или иных отношениях. Отсюда и несопос­тавимость получаемых норм.
При интерпретировании тестовых показателей пользователю теста следует принимать во внимание специфические факторы, которые могли повлиять на нормативную выборку, использовавшуюся при стандартиза­ции данного конкретного теста.
88
Ретестовая надежность
2.4. Психометрические критерии научности психодиагностических методик
2.4.1. Надежность. Виды надежности
Надежность в психометрии означает согласованность показателей, полученных у тех же самых испытуемых при повторном тестировании тем же самым тестом или его эквивалентной формой. Выделяется несколько видов надежности: ретестовая, параллельных (взаимозаменяемых) форм, внутренней согласованности, расщепления, Кьюдера-Ричардсона, надеж­ность оценщика. Многообразие видов надежности обусловлено разнооб­разием видов тестов и диагностических методик.
Самый очевидный и понятный метод оп-
ределения надежности результатов теста — его
повторное проведение. В этом случае коэффициент надежности (rn) просто ра­вен корреляции между показателями, полученными теми же испытуемыми в каждом из двух случаев проведения теста. Дисперсия ошибок соответствует случайным колебаниям в выполнении заданий от одного сеанса тестирования к другому. Эти колебания могут отчасти быть результатом неконтролируемых условий тестирования — таких, как резкие изменения погоды, внезапные шу­мы и другие отвлекающие факторы или, скажем, сломавшийся некстати ка­рандаш. В какой-то степени они могут быть вызваны и изменениями в со­стоянии самих тестируемых — например, болезнью, утомлением, эмоцио­нальным напряжением, беспокойством, недавними приятными или неприят­ными переживаниями и т. д. Ретестовая надежность показывает, в какой степени результаты теста можно распространить на различные случаи его применения. Чем выше надежность, тем менее чувствительны тестовые пока­затели к случайным суточным изменениям состояния тестируемых и обста­новки тестирования.
Приводя в руководстве к тесту его ретестовую надежность, всегда следует указывать, в каком интервале времени она измерена. Поскольку ретестовые корреляции постепенно снижаются по мере увеличения этого интервала, для любого теста существует не один, а бесконечное множество ретестовых коэффициентов надежности. Желательно также давать неко­торые сведения о событиях, произошедших за время между двумя сеанса­ми тестирования с теми, на ком измерялась надежность теста, и касающих­ся их учебы, работы, семейной жизни, консультирования, психотерапии и т. д.
89
Кроме желательности сообщения длины интервала между двумя тес­тированиями, хорошо бы знать, какими соображениями направлялся выбор именно этого интервала? Можно привести немало примеров тестов, надеж­ность которых остается высокой в течение нескольких дней или недель, но спустя десять-пятнадцать лет их результаты уже практически не коррели­руют с первоначальными. Так, многие из тестов интеллекта для дошколь­ников дают достаточно устойчивые показатели на протяжении дошколь­ного периода, но совершенно бесполезны в качестве инструментов предска­зания IQ в позднем детстве или во взрослости. На практике, однако, чаще всего следуют простому правилу в установлении границ ретестового интер­вала. Обычно дисперсия ошибок тестового показателя определяется крат­ковременными, случайными колебаниями, происходящими в интервалах от нескольких часов до нескольких месяцев. Поэтому при проверке этого типа тестовой надежности стараются придерживаться небольших времен­ных интервалов. При тестировании маленьких детей этот период должен быть еще короче, чем у испытуемых старшего возраста, поскольку в первые годы жизни связанные с возрастным развитием изменения наблюдаются ежемесячно и даже быстрее. В целом, для любого типа обследуемых лиц ре­тестовый интервал, по-видимому, редко превышает шесть месяцев.
Какие-либо дополнительные изменения в относительном выполнении
теста одними и теми же людьми, происходящие в более длительные проме­жутки времени, уместнее относить к кумулятивным и прогрессирующим, а не к чисто случайным. Кроме того, такие изменения, вероятно, характери­зуют более широкую сферу поведения, чем ту, которая проявляется при выполнении данного теста. Так, общий уровень способности человека к обучению, пониманию технических устройств или искусства мог за 10 лет существенно измениться вследствие каких-то произошедших с ним неорди­нарных событий. Его статус с годами мог заметно возрасти или упасть от­носительно статуса других людей того же возраста вследствие обстоятельств жизни дома, в школе или условий социального окружения, а также по та­ким причинам, как физическая болезнь или эмоциональное расстройство.
Степень влияния таких факторов на психологическое развитие чело­века является важной исследовательской проблемой. Однако этот вопрос не следует смешивать с вопросом надежности конкретного теста. Напри­мер, при измерении надежности тестов Стэнфорда-Бине обычно вычисляется корреляция между показателями, полученными с интервалом не в десять лет и даже не в один год, а в несколько недель. Конечно, с этими тестами проводи- лись и долгосрочные ретестовые испытания, но их результаты обычно обсуж-
90
Методика повторного тести-
рования применима только к
тем тестам, на которые их по- вторное проведение на одних и тех же испытуемых не ока­зывает заметного влияния. К
этой категории относится ряд моторных тестов и тестов сен­сорного различения. Однако для подавляющего большинства психологических тестов эта ме­тодика определения коэффици­ента надежности оказывается неприменимой.
даются с точки зрения предсказуемости уровня интеллекта взрослого на основе выполнения теста в детском возрасте, а не с точки зрения надежности конкрет­ного теста. Понятие надежности в основном ограничивается сферой кратко­срочных случайных изменений, характеризующих технические характеристи­ки самого теста, а не тестируемую область поведения.
Следует отметить, что различные поведенческие функции сами могут различаться по степени обнаруживаемых суточных колебаний. Например, на отточенности движений пальцев рук могут сказаться самые незначительные изменения в состоянии человека, никак не влияющие на понимание им речи. Если хотят получить полную оценку характера движений пальцев, свойствен­ного конкретному человеку, то, по всей видимости, придется провести повтор­ные тесты в течение нескольких дней; в то же время для оценки уровня его вербального понимания достаточно было бы одного сеанса тестирования. Вся­кий раз мы должны обращаться к анализу целей теста и всестороннему осмыс­лению того поведения, для предсказания которого предназначен данный тест.
Несмотря на кажущуюся простоту и очевидность методики повторного тестирования, ее применение к большинству психологических тестов пред­ставляет немалые трудности. Улучшение показателей как результат трениров­ки при повторении теста будет, вероятно, различным у разных людей. Кроме того, если промежуток времени между первым и вторым тестированием дос­таточно мал, испытуемые могут при­помнить многие из своих прежних от­ветов. Иными словами, та же картина правильных и ошибочных ответов, ве­роятно, воспроизводится благодаря работе одной только памяти. Следова­тельно, результаты двух предъявлений теста не будут независимыми, и корре­ляция между ними окажется обманчи­во высокой. К тому же повторное про­ведение может изменить саму сущ­ность теста. В первую очередь это от­носится к задачам, требующим логи­ческих рассуждений или сообрази­тельности. Испытуемый, однажды ухватив принцип решения или построив всю цепь рассуждений, в дальнейшем может воспроизводить правильный ответ, минуя промежуточные ступени.
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]