- •Предмет психометрики. Требования к психометрической подготовке психолога
- •25 Ячеек (например, 4x4,4x5,5x4 или 5x5) считается идеальной для той длины теста, который вполне реально сконструировать, предъявить и обработать.
- •Дискриминативность задания теста. Индекс дискриминативности задания теста.
- •Валидность психологического теста. Виды валидности.
- •Валидность психологического теста. Эмпирическая валидность (валидность по критерию).
- •Валидность психологического теста. Конструктная валидность.
- •Надёжность психологического теста. Коэффициент надёжности. Требуемая степень надёжности.
- •Техники проверки надёжности психологического теста: анализ внутренней согласованности теста.
- •Тестовые нормы.
- •Надёжность психологического теста. Стандартная ошибка измерения психологического теста.
- •Стандартные показатели. Принципы построения стандартных шкал
25 Ячеек (например, 4x4,4x5,5x4 или 5x5) считается идеальной для той длины теста, который вполне реально сконструировать, предъявить и обработать.
Далее необходимо определить, сколько заданий, например вопросов, должно быть создано для каждой из ячеек. При решении этой задачи следует руководство- ваться тем, насколько важным представляется исследователю измерение одного из параметров сравнительно с другим или другими
Следующий шаг состоит в том, чтобы решить, какое количество заданий должно быть включено в тест. При этом необходимо учитывать такие факторы, как размер решетки и время, предполага- емое для выполнения заданий. Хорошо известно, что в определении количества заданий перед исследователем возникает дилемма: обеспечение, с одной стороны, надежности теста, что требует увеличения заданий, а с другой стороны — мини- мизация количества заданий для обеспечения эффективной работы испытуемого с ними, подразумевающей прежде всего поддержание концентрации внимания в ходе обследования. Так, для достижения удовлетворительной надежности опрос- ника требуется не менее 20 заданий, выполнение которых обычно занимает не более 10 минут. Наконец, важную роль в определении количества заданий теста играют особенности того контингента, который предполагается обследовать. Обычно при проводимом разработчиками пилотажном исследовании количество зада- ний предварительного варианта теста должно быть по крайней мере на 50 % боль- ше числа тех, которые будут включены в окончательную версию.
После того как определен процентный вес каждой из ячеек решетки и установ- лено общее количество заданий для пилотажной версии теста, нетрудно подсчи- тать, сколько заданий должно быть разработано для каждой ячейки.
Прежде всего нужно указать на то, что в каждом задании может быть задан толь- ко один вопрос или сформулировано одно утверждение. Нельзя допускать появ- ления заданий, в которых присутствуют формулировки типа: «для этого человека и других людей», «как и другие» и т. п. Каждое задание (вопрос) должны быть сформулированы предельно ясно и просто. Необходимо избегать двусмысленных формулировок и придерживаться, насколько это возможно, наиболее простых вариантов ответов. В то же время необходимо стремиться к тому, чтобы обследуе- мые не могли догадаться о том, для измерения какой черты предназначено то или иное задание. В противном случае ответы будут отражать их точку зрения на вы- раженность у себя этой черты, а не реальное положение дел.
Задания должны отражать конкретные, а не общие аспекты изучаемой обла- сти поведения.
Везде, где только возможно, следует избегать употребления таких слов, как
«часто», «редко» и т. п. Иначе говоря, в формулировке заданий нужно очень осто- рожно прибегать к словам, указывающим на частоту действий. То, что одним ис- пытуемым интерпретируется как «часто», для другого совсем не так. Примером может служить вопрос «Часто ли вы употребляете спиртные напитки?», ответ на этот вопрос не отражает реального положения дел, а характеризует субъективное мнение обследуемого (разумеется, в ряде случаев именно это мнение и интересутисследователя!).Такжеследуетизбегатьтерминов,выражающих чувства.Луч- ше представить задание в контексте поведения. Например, задание «Нравится ли вам чтение художественной литературы» лучше заменить на «Читаете ли вы ху- дожественную литературу постоянно?».
После разработки всех заданий к ним следует вернуться через некоторое вре- мя и попытаться еще раз оценить их формулировки, еще раз убедиться в том, что все они легко понимаются и не содержат двусмысленностей. Для этого рекомен- дуется привлечь хотя бы двух-трех экспертов. В личностных опросниках, как пра- вило, используют три типа заданий: дихотомические, трихотомические и задания с рейтинговыми шкалами1.
. Обычно не рекомендуется использование более семи в опросниках, использующих рейтинговые шкалы. Важно обеспечить достаточное количество градаций ответа, с тем чтобы обследуемые были в состоянии адекватно выразить самих себя. Следует помнить и о том, что в разрабатываемом опроснике желатель- но использовать только один тип заданий.
Основные проблемы, возникающие при разработке заданий личностных опрос- ников, касаются актуализации факторов, имеющих установочную природу
Шкалы оценок: достоинства и недостатки.
В эмпирических психологических исследованиях шкалы оценок служат вспомогательным средством при вынесении суждений о степени выраженности признака. В качестве основных форм оценок различают числовые, вербальные и графические шкалы.
Виды:
1)числовая. это форма фиксации данных посредством их числовых значений. Она представляет собой упорядоченное ограниченное множество чисел (обычно целых положительных количественных числительных). В отдельных случаях их называют формальными шкалами интенсивности.
Применение упорядоченных чисел имеет ряд преимуществ. Заданный масштаб числовой шкалы является системой отсчета для количественного суждения. Следовательно, заданному масштабу с большей степенью вероятности отвечает существующий "субъективный" масштаб испытуемого. В зависимости от того, учитывается ли требование равных интервалов, числовая шкала оценок по уровню измерения должна рассматриваться как интервальная или только как порядковая.
Для испытуемых оценивание и формулировка ответов по "абсолютной" числовой шкале представляет значительную субъективную сложность.
2)вербальная. это форма фиксации данных, опирающаяся на набор суждений о наличии или степени выраженности изучаемого психологического признака. По своей организации вербальные шкалы могут быть монополярными и биполярными. Вербальные количественные обозначения в таких шкалах составляют систему отсчета для формирования суждений средствами обиходной речи. Это обстоятельство приводит к известным погрешностям вербальных шкал, т.к. неопределенность и неоднозначность понимания и толкования затрудняет их применение в качестве точного психометрического инструмента. Во - первых, заданный вербальной шкалой масштаб, в зависимости от возраста, пола, опыта, социокультурных и других признаков испытуемых, воспринимается ими с позиций субъективного масштаба и, следовательно интерпритируется отнють не одинаковым образом. Так, например, заданная по шкале позиция - "высокий уровень" - различными испытуемыми может быть субъективно охарактеризована и пониматься как " выше среднего" или "средний". Во - вторых интервалы, образуемые упорядоченными количественными высказываниями не однообразны, вследствии чего вербальные шкалы оценок относятся к разряду порядковых шкал. И, наконец, в - третьих, результаты, получаемые посредством вербальных шкал, неустойчивы по отношению к измерениям объектов и размерности суждений. Одному и тому же количественному суждению о различных объектах может придаваться разное значение. Поэтому в чистом виде вербальные шкалы применяются достаточно редко, и на практике о них, как правило, объединяются с числовыми и графическими.
Вместе с тем недостатки вербальных шкал могут быть уменьшены за счет определенных приемов оптимального построения пунктов шкалы
3)графическая. Графическая шкала это форма фиксации данных при помощи наглядного отображения развития признака в виде непрерывной линии или определенной фигуры. Линия или фигура делится как правило на равные отрезки и снабжается вербальными или числовыми обозначениями. Поэтому графические способы отображения измеряемых признаков объема используются в комплексе с вербальными и числовыми шкалами.
Как уже отмечалось, достоинство графических шкал состоит в большой дифференцируемости суждений, обеспечиваемой непрерывным масштабом по сравнению с "только" ступенчатыми или числовыми шкалами, а также в простоте использования и облегчения процесса вынесения оценки.
Трудность задания теста. Индекс трудности задания теста. Анализ распределения индексов трудности заданий в тесте. ТРУДНОСТЬ ЗАДАНИЙ характеристика задачи (пункта) теста, отражающая статистический уровень ее решаемости в данной выборке стандартизации. Вместе с анализом дискриминативности пунктов, внутренней согласованности, характера распределения тестовых оценок анализ трудности заданий теста является одной из базовых процедур разработки и проверки диагностических качеств тестовой методики. В психологии разделяются субъективно-психологическая и статистическая (объективная) трудности. Субъективная трудность задачи связана с индивидуально-психологическим барьером, величина которого определяется как обстоятельствами (лимитом времени, доступностью инструкции и т.д.), так и уровнем формирования необходимых для решений знаний, умений и навыков, психическим состоянием испытуемого и рядом других факторов.
Трудность задания U является традиционным показателем при анализе задания. Трудность заданий теста – это характеристика задачи (пункта) теста, отражающая статистический уровень ее решаемости в данной выборке стандартизации. Обычно она оценивается при сравнении числа испытуемых, правильно выполнивших задание, к общему числу испытуемых. Этот показатель меняется в пределах от 0 до 1. Его значения тем больше, чем выше трудность задания. При разработке критериально-ориентированных тестов показатель трудности используется с целью конструирования тестов с желаемым уровнем трудности. Для повышения трудности теста в него включают больше заданий высокой трудности, а для понижения трудности – больше заданий низкой трудности.
Принято выделять субъективную и статистическую (объективную) трудности. Субъективная трудность задания связана с индивидуальным барьером, величина которого определяется как обстоятельствами (лимитом времени, доступностью инструкции и т. д.), так и уровнем сформированности необходимых для решения знаний, умений и навыков, психическим состоянием испытуемого и рядом других факторов. Воздействие комплекса этих факторов на результат выполнения теста снижает надежность и достоверность данных, поэтому важно принимать меры для выравнивания их воздействия с помощью направленного комплектования выборки и стандартной процедуры проведения тестирования.
Показателем трудности заданий как статистической трудности является доля лиц выборки, решивших и не решивших задание. Например, если только 15% учащихся решили задачу, ее можно оценить как трудную для данной группы, если 85% - как легкую. Трудность заданий теста является относительной характеристикой, поскольку, зависит от особенностей выборки (возрастные, профессиональные, социально-культурные различия).
Подбор заданий попоказателю трудности важен для успешного применения диагностической методики. Так, при выборе слишком трудных заданий валидность и надежность теста резко снизятся (ухудшение статистических характеристик оценивания из-за небольшого числа правильных решений, вероятность случайной оценки, влияние неудач на работу испытуемых). Слишком простые задания приведут к однообразию результатов (большинство справляется со всем набором пунктов теста), их незначительной вариативности, затрудняющей оценивание, могут вызвать негативное отношение к тесту.
Основная задача анализа трудности заданий теста сводится к выбору оптимальных по сложности пунктов теста, а значит, и упорядочиванию, отдельных заданий в нем. Обычно, если задачу решает большинство учащихся, ее (как легкую) помещают в начале теста, если задачу решает незначительный процент испытуемых, то ее (как трудную) помещают в конце теста. Одну - две самых легких задач ставят перед основными задачами теста и используют в качестве примера. Расположение заданий по возрастанию степеней трудности, выраженных долей или процентом лиц данной выборки, решивших соответствующую задачу, позволяет примерно определить порог трудности для индивидуального испытуемого, характеризующий его место в группе.
Основным показателем трудности заданий теста является индекс трудности (Ui), вычисляемый по формуле:
Ui = (1 - Np/N)*100%,
где Ui - индекс трудности задания в процентах; Np – число учащихся, правильно решивших задачу; N - общее число учащихся.
Практика педагогического тестирования свидетельствует, что максимум информации об индивидуальном уровне знаний, навыков и умений учащихся обеспечивают задания средней трудности (50%).
Различающая способность задания при разработке педагогических тестов является особенно важной характеристикой, так как от нее в значительной степени зависит валидность теста. Эта характеристика показывает, насколько эффективно тестовое задание различает учащихся, овладевших и не овладевших учебным материалом.
Показатели различающей способности задания также вычисляются на основании проведения пилотажного тестирования. Эти показатели требуют для расчета проведения двух серий измерений: повторного тестирования одной группы учащихся или проведения теста на двух разных группах. При разработке теста для одной или небольшого количества групп удобнее всего получить две серии измерений путем формирования контрастных групп. Эксперт выбирает из группы только тех учащихся, про которых он может определенно утверждать, что они овладели или не овладели учебным материалом. Овладевшие материалом составляют "высокую" контрастную группу, а не овладевшие - "низкую" контрастную группу. Учащиеся, находящиеся в промежуточной стадии, не включаются в контрастные группы. Важно, чтобы контрастные группы были, по возможности, эквивалентны по составу. Это значит, что в них в одинаковой пропорции должны быть представлены учащиеся разных возрастов, оба пола, с разным уровнем одаренности, представители разных социальных групп населения и т.д.
Самый простой и известный показатель различающей способности задания по отношению к обучению D вычисляется как разность между долей испытуемых из "высокой" группы, правильно выполнивших задание и долей испытуемых из "низкой" группы, тоже правильно выполнивших задание. Данный показатель высчитывается по следующей формуле
D = n1/N1 - n2/N2,
где D – показатель различающей способности; N1, N2 – количество испытуемых, попавших соответственно в"высокую" и "низкую" контрастные группы; n1 и n2 – количество испытуемых, правильно выполнивших задание, соответственно из "высокой" и "низкой" групп.
Показатель может принимать значения от -1 до +1. D - равный «+1» означает, что задание обладает максимальной различающей способностью. D равный «0» означает,что задание совершенно не различает испытуемых, овладевших и не овладевших учебным материалом. Если D - равный «–1», что встречается очень редко, то задание различает испытуемых, но инверсированно: правильно отвечают не овладевшие материалом, а овладевшие материалом отвечают неправильно. Существование таких заданий может свидетельствовать о своеобразной не адекватной структуре знаний у учащихся.
