Российский национальный стандарт тестирования

Друзья, в индустриально продвинутых странах существуют национальные стандарты тестирования персонала.У нас тоже был такой разработан ведущими экспертами, и опубликован в журнале "Организационная психология": Организационная психология. 2013. Т. 3. №3. Его легко найти.

Он никогда не был установлен как основополагающий какими-либо законами и прочими ЛНА. Однако, все серьёзные разработчики тестов ориентируются на него. Мы в SkillCode ему следуем.

Он будет полезен в первую очередь пользователями тестов, чтобы они могли задать разработчику адекватные вопросы.
Это объёмный документ, поэтому  привожу выдержки. За остальным обращайтесь к первоисточнику. 

Популярное по теме
90 чек-листов по всем направлениям для HR и бизнес-тренеров: подборка от экспертов hrtime.ru
Полезные инструменты по подбору, оценке персонала, обучению, консалтингу, разработке СОТ, корпоративной культуре, коучингу, кадровому учету и карьерному консультированию в одном месте.

Глава 2. Понятие теста, классификация тестов и ситуаций тестирования
2.1. Определение теста
2.3. Психометрические требования к качеству тестов
2.3.1. Тест считается качественным измерительным инструментом, если:
• имеются данные, подтверждающие надежность тестовых шкал на количественном уровне;
• имеются данные, подтверждающие валидность тестовых шкал как на качественном, так и на количественном уровне;
• имеются данные, подтверждающие репрезентативность тестовых норм (правил присвоения определенным тестовым результатам заданных оценочных категорий для той выборки, на которой применяется тест);
• имеются формализованные процедуры, позволяющие устанавливать достоверность отдельного протокола тестирования.
Измерительные тесты, направленные на диагностику психических свойств работников (интеллектуальные способности, личностные черты, поведенческие установки, мотивационные предпочтения и др.) и отвечающие перечисленным требованиям к их качеству, называются психометрическими .
Один из наиболее важных признаков измерительных (психометрических ) тестов — это наличие калибровки (разметки) шкалы тестовых баллов, которая обосновывается статистически (при нормативно-ориентированном тестировании ) или экспертно (при критериально-ориентированном тестировании ).
2.4. Классификация тестов
Методическое руководство к тесту (руководство пользователя) должно содержать достаточно точное отнесение тестовой методики к определенному классу.
2.4.1. По содержательной направленности (что измеряется) тесты делятся на:
• методики оценки когнитивных (познавательных, интеллектуальных) способностей;
• методики оценки психомоторных способностей и навыков (в частности, на точность восприятия, скорость, силу, выносливость и координацию движений и ручных операций);
• методики психологической и психофизиологической диагностики функциональных и эмоциональных состояний работника;
• методики оценки личностных черт, мотивов и социальных установок (личностные, мотивационные и иные);
• методики оценки профессиональных знаний и уровня усвоения должностных обязанностей (в частности, для контроля степени усвоения знаний по результатам производственного обучения);
• методики решения ситуационных задач (в частности, диагностика практических профессиональных умений, оценка сформированности управленческих и иных навыков, уровня развития производственных компетенций, кейс–тесты);
• методики измерения управленческого потенциала, индивидуального стиля делового общения и взаимодействия, межличностных отношений (в частности, диагностика стиля управления, командных ролей);
• социально-психологические и социологические методики (в частности, методики измерения уровня удовлетворенности работой, тест–опросники профессиональных ценностей).
2.5. Нетестовые оценочные процедуры и методики
Глава 4. Требования к методикам тестирования
4.1. Принципы объективности и стандартизации
Двумя базовыми требованиями к методикам тестирования выступают объективность и стандартизация. Объективность подразумевает исключение человеческого фактора из цикла тестирования: два пользователя методики должны получать для одного и того же тестируемого одинаковый результат. Стандартизация предполагает такие структуру и процедуру проведения методики тестирования, которые обеспечивают максимально возможное равенство условий для всех участников.
4.2. Оценка качества тестовой методики
4.2.1. Полностью универсальных тестовых методик не существует, более того, применение методики в неподходящей для нее ситуации может принести больше вреда, чем пользы. Пользователи методик обязаны уточнить возможности применения конкретной методики: а) в данных условиях (организационном контексте); б) в данной ситуации (ситуация консультирования или ситуация экспертизы); в) для решения данной практической задачи; г) для данных участников; д) для принятия определенных управленческих решений на основе ее результатов.
4.2.2. Для оценки качества тестовой методики и ограничений интерпретации ее результатов следует обратить внимание на требования к ее качеству. Требования к качеству тестов носят комплексный и контекстно-зависимый характер, то есть оценивать применимость методики тестирования следует для каждого конкретного оценочного мероприятия отдельно.
4.2.3. Существует четыре группы общих (основных) требований к качеству тестовых методик (психометрических требований): требования к надежности, валидности, репрезентативности и достоверности, причем последнее в большей степени относится к ситуации применения теста, чем к методике как таковой.
– при прочих равных условиях предпочтение следует отдавать тем тестам, которые в большей степени удовлетворяют психометрическим требованиям.
4.3. Вероятностный смысл результатов и погрешность измерения
Тестовые измерения дают результаты с вероятностной точностью: истинный результат находится не в точке, а в определенном интервале на шкале, и содержит в себе заранее заданную степень погрешности (ошибку измерения). Перед проведением тестирования пользователь должен определиться с пониманием того, каким диапазоном точности (степенью погрешности) будет обладать полученная информация во избежание неправильного или излишне прямолинейного толкования результатов тестирования.
4.4. Требования к надежности
Показателем степени погрешности измерения является надежность теста: чем выше надежность, тем ниже погрешность (меньше ошибка измерения). Формула расчёта ошибки измерения представлена в Приложении 3.
4.4.1. В прилагаемой разработчиком методической (технической) документации к методике тестирования должна быть приведена информация об исследованных видах надежности, полученных результатах и их следствиях для интерпретации тестовых баллов. Крайне желательна проверка надежности на уровне каждого отдельного тестового задания, то есть наличие в методической документации результатов анализа «коэффициентов дискриминативности» (различающей способности) для каждого задания. В отсутствие высокой дискриминативности отдельных заданий не могут быть достигнуты высокая надежность и валидность целого теста.
4.4.2. Минимально необходимая информация о надежности представляет собой данные о внутренней согласованности теста и отдельных тестовых шкал (коэффициент «альфа Кронбаха» или его эквиваленты). Для методик личностной диагностики рекомендуемый показатель надежности не должен быть ниже 0,6, для тестов способностей — 0,7, а для тестов профессиональных знаний и умений должен принимать значение в диапазоне 0,8–0,9. Надежность может превышать показатель 0,9 в случае использования узкоспециальных методик. Неправдоподобно высокие показатели надежности могут говорить о нарушениях в процедуре разработки (например, о слишком высокой однородности тестовых заданий, которые ограничивают область применения методики).
4.4.4. Разработчик обязан указывать размер выборки, на которой исследовалась надежность. В общем случае при разработке тестовой методики размер выборки для исследования одного вида надежности не должен составлять меньше 100 человек. При этом чем более разнородна выборка (то есть чем больше возрастные, профессиональные и другие подгруппы различаются по измеряемой характеристике), тем большего размера она должна быть.
4.4.5. Если в тестовой методике используются параллельные формы (версии, одинаковые по структуре, но включающие разные по содержанию тестовые задания), разработчиком должны быть представлены количественные подтверждения эквивалентности этих форм.
4.4.6. При разработке тестовой методики крайне желательна также проверка ретестовой надежности: тот же самый тест проводится на той же самой выборке повторно через заданный промежуток времени, и исследуется корреляция (взаимосвязь) между результатами этих двух серий тестирования. В таком случае минимально приемлемой границей надежности является коэффициент 0.5. Близкие к границе 0.5 показатели допустимы для методик, оценивающих менее устойчивые качества, и при наличии большого интервала времени между двумя тестированиями (6 месяцев и более). Для менее длительных интервалов времени (в пределах 2–4 недель) и для более устойчивых качеств (например, для тестов способностей) рекомендуемый уровень ретестовой надежности составляет 0.6–0.7.
4.4.7. Если при разработке методики тестирования разработчиком используются психометрические подходы, альтернативные классической теории тестов (например, IRT), параметры надежности должны быть «переведены» на классический язык (например, должна быть оценена величина, эквивалентная надежности, или стандартная ошибка измерения, соответствующая параметру информативности теста в IRT). Так обеспечивается возможность ориентировки в уровне надежности измерения для широкого круга пользователей. Следствием этого положения является требование к сопутствующей технической (методической) документации, в которую разработчикам тестов рекомендуется либо включать информацию о психометрических свойствах разработанного теста на языке классических показателей, либо ограничивать круг пользователей данной методики теми лицами, которые готовы воспринимать термины и процедуры современной (неклассической) теории тестов.
4.5. Требования к валидности
О валидной методике можно говорить, если методика измеряет именно то, для чего она предназначена. Валидность, как и надежность, никогда не достигает 100 процентов, поэтому можно говорить о более валидной или менее валидной методике. Некоторые надежные методики оказываются невалидными, если они применяются для тех целей, для которых они не предназначены (не пригодны): например, надежная методика на скорость устного счета не является валидным инструментом для измерения креативности (изобретательности).
4.5.1. В прилагаемой разработчиком методической (технической) документации к методике тестирования должна быть приведена информация об исследованных разработчиком видах валидности. Подтверждения валидности могут быть более или менее полными и убедительными, подразделяясь на три группы, которые обозначаются как содержательная, конструктная и критериальная валидность.
4.5.2. Содержательная валидность в плане обоснования должна содержать отсылки на процедуру разработки и отвечать на следующие вопросы:
– Какой конструкт (тестируемое свойство) лежит в основе методики тестирования?
– Как это свойство концептуально соотносится с другими похожими свойствами?
– Какова структура методики?
– Какие компоненты входят в конструкт (какие субшкалы входят в шкалу измеряемого свойства)?
– Почему были выделены именно эти компоненты (субшкалы)?
– Какова содержательная область методики?
– Какие виды деятельности тестируемого покрываются содержанием заданий тестовой методики?
– Насколько полно задания методики отражают целевую содержательную область?
Существуют количественные процедуры, позволяющие измерить содержательную валидность путем применения коэффициента согласованности экспертных оценок, но чаще всего содержательная валидность обосновывается с помощью качественных характеристик.
4.5.3. Статистические доказательства, характеризующие конструктную валидность, следует искать в результатах специально организованных исследований. Ими могут выступать: взаимосвязь результатов методики тестирования с результатами других тестовых методик (содержательно близких или, наоборот, отличных); внутренняя структура методики (статистическая структура взаимосвязей тестовых заданий между собой, коэффициенты интеркорреляций между шкалами); результаты исследований, проведенных с применением данной методики тестирования (эксперименты, результаты сравнения групп и т.д.).
4.5.4. При исследовании и описании указанных взаимосвязей необходимо соблюдение следующих принципов. Выборка для исследования валидности включает в себя не менее 100 человек (либо достаточность размера выборки для получения надежных результатов обосновывается с помощью специальных статистических процедур, таких как вычисление статистической мощности). Полученные коэффициенты корреляции (либо эквивалентные статистические показатели) при измерении конструктной валидности должны быть сопоставлены с изначальными теоретическими ожиданиями, при этом корреляции 0.1–0.3 расцениваются как «слабые», 0.3–0.5 как «умеренные», 0.5–0.7 как «сильные», выше 0.7 — как «очень сильные» или даже «настораживающие». Очень высокие значения показателя валидности могут говорить о методических ошибках при ее проверке или о недобросовестности разработчика . Если между результатами исследования и исходными теоретическими ожиданиями обнаружены расхождения, им должно быть дано содержательное объяснение, а также должны быть описаны следствия этих расхождений для интерпретации результатов методики в следующих случаях:
– если взаимосвязь теоретически предполагалась, но оказалась «слабой»;
– если взаимосвязь не предполагалась, но оказалась выше 0.3;
– если взаимосвязь оказалась выше 0.7 (в этом случае должно быть дано обоснование преимуществ разрабатываемой методики тестирования по отношению к уже существующей, с которой обнаруживается высокая корреляция).
4.5.5. В методической (технической) документации к тестовой методике должно содержаться описание соответствующих исследований (если они были проведены), а также должно быть описано, какие из наблюдаемых взаимосвязей с результатами других методик соответствуют теоретическим ожиданиям, а какие — нет. На основании этих исследований должно осуществляться взвешенное заключение об ограничениях в интерпретации тестового балла или тестового профиля.
4.5.6. Критериальная, или прагматическая, валидность методики тестирования представляет собой взаимосвязь ее результатов с внешними объективными критериями (показателями эффективности деятельности или КПЭ), в том числе отсроченными по времени. Для методик тестирования, использующихся в оценке персонала, данный вид валидности признается наиболее важным.
4.5.7. Внешний критерий должен быть максимально объективным и максимально связанным с предполагаемыми целями тестирования. Например, в качестве критерия может выступать «процент годных изделий», «объем продаж», «уровень заработной платы при сдельных расценках», «количество новых клиентов (сделок)», «количество патентов» и другие показатели эффективности профессиональной деятельности. Ожидаемые взаимосвязи между критерием и результатами теста должны быть также обоснованы в методической (технической) документации.
4.5.8. Критерий должен быть независимым от процедуры проведения тестирования и от способа формирования выборки тестируемых. Использование критериев, не являющихся независимыми, приводит к ошибочному завышению показателя валидности. Например, если в качестве критерия выступает экспертная оценка сотрудника руководителем, и при этом экспертная оценка проводится по бланку, аналогичному тому, который получали сами сотрудники для самооценки, только переформулированному из первого лица в третье.
Наоборот, сужение выборки по критерию приводит к ошибочному занижению показателя валидности. Например, если был объявлен добровольный принцип участия в тестировании и согласились на него только успешные сотрудники, а низкоэффективные отказались принять в нем участие. В этом случае корреляция результатов теста с параметрами успешности в исследуемой группе окажется искусственно заниженной. Ещё одним случаем, когда показатель валидности ошибочно занижается, является случай, когда тестирование проходят кандидаты на позицию, а критериальные данные собираются только по успешно прошедшим тестирование и принятым на работу сотрудникам.
4.5.9. Необходимая для рентабельного профотбора величина взаимосвязи между методикой и внешним критерием определяется либо экспертным путем, либо с помощью расчетных формул. Для корректного эмпирического измерения критериальной (прагматической) валидности требуется обследовать корпоративную нормативную выборку объемом не менее 300 человек. При этом корреляции для одношкальных тестов в размере 0.15–0.25 расцениваются как «слабые», 0.25–0.35 как «умеренные», 0.35–0.5 как «сильные», выше 0.5 — как «очень сильные» и «настораживающие». Корреляции выше 0.5 чаще всего являются результатом расчета множественной корреляции для многошкальных (многофакторных) тестов. При высокой массовости применение тестов с валидностью 0.15 часто оказывается оправданным (рентабельным), так как применять более глубокие методы оценки в этих условиях экономически нецелесообразно.
При оценке и интерпретации величины корреляции между методикой и внешним критерием следует опираться на сравнение с данными опубликованных мета-анализов (усредненных результатов нескольких независимых исследований) о взаимосвязях результатов родственных тестовых методик с объективными критериями эффективности профессиональной деятельности.
4.5.10. Следует различать ситуации, в которых внешний критерий измерялся одновременно с проведением тестирования, и ситуации, в которых он измерялся позже (например, через несколько лет). В первом случае результаты исследования не могут являться подтверждением того, что методика тестирования способна спрогнозировать эффективность будущей деятельности и измерить профессиональный потенциал сотрудника, а во втором случае подобная интерпретация возможна. При этом существуют ситуации тестирования, в которых прогноз эффективности профессиональной деятельности не требуется, и большее значение имеет оценка достигнутого уровня (например, при аттестации или оценке профессионального соответствия).
4.5.11. Данные о критериальной валидности тестовой методики часто не могут быть предоставлены разработчиком теста в документации сразу, но могут быть получены с участием пользователей методики только спустя некоторое время после ее фактического применения (см. раздел 9.4). При наличии организационных возможностей пользователям методики рекомендуется продумывать программы и технологии сбора данных совместно с разработчиком, что позволяет производить отсроченную проверку критериальной валидности теста.
4.5.12. Особенно ценные данные о критериальной валидности дает схема проверки «прогностической валидности»: сначала проводится тест, а критериальная информация о протестированных (например, о КПЭ) собирается спустя несколько месяцев или даже лет. Реализация такой схемы в серьезных статистических масштабах оказывается невозможной без тесного сотрудничества разработчиков и пользователей теста.
4.6. Требования к тестовым нормам и репрезентативности
4.6.1. В методической (технической) документации к тесту должны быть указаны тестовые нормы. Тестовые нормы рассматриваются как критические точки или интервалы на шкале тестовых баллов, которые разделяют статистически различные группы тестируемых (то есть группы, к которым целесообразно применять различные управленческие решения). В документации к тесту должно содержаться подробное описание выборки нормирования, с результатами которой будут сопоставляться результаты участника тестирования.
4.6.2. Выборка нормирования (или выборка стандартизации) должна быть представительной (репрезентативной) по отношению к множеству потенциальных участников тестирования (то есть соответствовать основным существенным особенностям контингента участников по демографическим параметрам: по полу, возрасту, образованию, принадлежности к профессиональной или языковой группе, государственно–национальной принадлежности, уровню должности или социо–экономическому статусу).
4.6.3. Репрезентативность выборки нормирования обосновывается как концептуально (через описание состава этой выборки с точки зрения основных демографических параметров), так и эмпирически. Эмпирические процедуры проверки репрезентативности могут включать в себя исследование устойчивости тестовых норм при расщеплении выборки на две независимые половины и последующее сравнение норм для этих двух половин.
4.6.4. Необходимый размер выборки нормирования для стандартизованных методик тестирования зависит от степени однородности предполагаемой группы участников тестирования. Чем более разнородны участники тестирования, тем больше необходима выборка нормирования . В общем случае минимально приемлемая выборка нормирования состоит из 200 человек, а рекомендуемый размер выборки нормирования для универсальных тестов, претендующих на возможность применения в различных организациях и в различных отраслях, составляет 500 человек.
4.6.5. Для тестов, ориентированных на локальное применение в конкретной организации, выборка нормирования может быть ограничена ее сотрудниками. В этом случае участники тестирования сравниваются внутри своей группы, что определяет специфику интерпретации результатов. Результаты подобной локальной методики при ее использовании в другой организации не могут быть признаны без проведения дополнительных исследований.
4.6.6. Тестовые нормы должны периодически обновляться и уточняться как разработчиками тестов, так и пользователями тестов. Рекомендуемая частота обновления тестовых норм составляет один раз в три года.
4.7. Требования к достоверности
Достоверность является требованием, которое в большей степени характеризует не тест, а процедуру его применения. Нарушения в процедуре тестирования не могут непосредственно контролироваться разработчиком, поэтому соблюдение требования достоверности в основном обеспечивается пользователем методики. Но разработчик должен предупредить пользователя, в каких ситуациях возникают искажения, и как их обнаружить.
4.7.1. Разработчиком методики в методической (технической) документации должны быть описаны основные риски, присущие методике с точки зрения тактики выполнения теста участниками. Также должны быть описаны предпринятые способы снижения этих рисков.
4.7.2. К нарушениям достоверности тестирования в тестах-опросниках могут относиться мотивационные искажения (стремление выглядеть в лучшем свете, или социальная желательность, либо, напротив, стремление выглядеть в худшем свете — аггравация), установка на согласие, установка на нейтральный ответ, установка на крайние, а также случайные ответы.
4.7.3. К нарушениям достоверности тестирования в тестах знаний или способностей относится угадывание ответов, которое может провоцироваться структурой теста (например, правильные ответы содержат самые длинные формулировки). Но самый серьезный риск при тестировании знаний несет рассекречивание правильных ответов (использование шпаргалок).
4.7.4. Требования к достоверности методики тестирования становятся особенно актуальными в ситуации экспертизы, предполагающей принятие серьезных управленческих решений. В данной ситуации у участников тестирования появляются реальные мотивы к фальсификации результатов. Попытки фальсификации результатов в ситуации консультирования возникают реже в силу личной заинтересованности тестируемого в достоверности результатов.
4.7.5. Достоверность методики тестирования может учитываться, обеспечиваться и контролироваться с помощью:
– особых способов контроля, заложенных в структуру методики (например, сочетания «прямых» и «обратных» утверждений, шкал лжи, повторяющихся одинаковых вопросов, ипсативной технологии, специально нацеленной на то, чтобы смоделировать вынужденный выбор между суждениями, имеющими одинаковый балл на шкале социальной желательности);
– специальных исследований (например, сравнения с результатами тестирования, проведенного с инструкцией на намеренное искажение результатов);
– технических и статистических средств (например, видеонаблюдения, формирования случайной выборки заданий из широкого банка заданий, обнаружения статистически нетипичного паттерна ответов);
– сопоставления результатов тестирования с результатами, полученными в рамках иных оценочных процедур (например, интервью или деловых игр).
4.7.6. Помимо описания всех способов обеспечения и контроля достоверности методики тестирования, при чтении тестовой документации пользователю рекомендуется обращать внимание на возможные уровни ошибки (погрешности) измерения, указанные разработчиком как ожидаемые в определенных ситуациях тестирования в связи с нарушениями достоверности.
4.8. Требования к лицензионной чистоте методик тестирования
Особым требованием к тестовым методикам выступает требование лицензионной чистоты. Пользователям тестов следует избегать применения: а) тестовых методик, авторы которых неизвестны; б) тестовых методик, размещенных на пиратском сайте в Интернете или опубликованных в нелицензионном печатном или электронном сборнике тестов; в) тестовых методик, авторы которых не приводят в сопутствующей методической (технической) документации подтверждений осуществления проверки их психометрических свойств.
Нарушение прав интеллектуальной собственности при использовании тестовой методики может быть оспорено реальным правообладателем в суде. Без письменного запроса и письменного разрешения автора возможно использование методик, материалы которых опубликованы в научно-методической литературе с пометкой «методика для свободного распространения» или снабжены символом СС (creative commons). Наличие символа копирайта © в отсутствие символа СС следует трактовать как разрешение правообладателя на знакомство с методикой и наличие запрета на ее массовое использование. Тиражирование тестовых материалов с символом копирайта © возможно только с разрешения правообладателя. Тиражированием в данном случае называется изготовление десяти (и более) копий с материалами тестовой методики для тестирования десяти (и более) человек. При этом число 10 следует считать условным пороговым значением. Для судебного иска истцу достаточно предъявить в суд один незаконный (контрафактный) экземпляр методики, после чего ответчик должен предоставить для уничтожения все контрафактные экземпляры.
Глава 7. Обработка, интерпретация и анализ результатов
Интерпретация результатов, как правило, применяется в отношении стандартизированных баллов, поэтому различение сырых и стандартизированных баллов является одним из важных условий квалифицированного использования тестовых методик в оценке персонала.
7.1. «Сырые баллы»
«Сырые баллы» — это первичные показатели, вычисляемые согласно правилам, указанным разработчиками тестовой методики.
7.1.1. Простейшим случаем сырого балла является количество правильных ответов в тесте способностей или тесте знаний. В этом случае понятие «ключевой ответ» совпадает с «правильным ответом». Если тестовая методика содержит несколько шкал, то сырой балл рассчитывается для каждой из шкал по специальным правилам («подсчет по ключам»).
7.1.2. В тест–опросниках ключевыми называются ответы, соответствующие максимальной выраженности тестируемого показателя. При этом чем больше его выраженность, тем выше балл.
7.1.3. Выполнение компьютерных тестов, как правило, предполагает автоматический подсчет сырого балла. В этом случае ключи к тесту в большинстве случаев неизвестны не только тестируемым, но и пользователям методики.
7.2. Стандартизация тестовой шкалы
Пересчёт сырых баллов в стандартизированные баллы позволяет сравнить результаты данного тестируемого с результатами других тестируемых, а также результаты данного тестируемого по разным тестовым шкалам.
7.2.1. Пересчет сырых баллов в проценты к максимальному возможному баллу не является стандартизацией, хотя и приводит к унифицированному масштабированию шкал, так как один и тот же результат (например, 70%) в данном случае может означать как высокий, так и низкий результат для различных по трудности тестов.
7.2.2. Пересчёт сырых баллов в стандартизированные производится путём сравнения сырых баллов респондента с показателями нормативной группы (см. раздел 4.6). Если разработчиками теста предлагаются для сравнения несколько нормативных групп, для определения стандартизированного балла конкретного тестируемого необходимо выбрать нормативную группу, соответствующую его демографическим характеристикам и цели данного тестирования.
7.2.3. Для методик, предполагающих проведение очного бланкового тестирования с последующей самостоятельной обработкой результатов, разработчики обязаны указать:
• рекомендуемую стандартную шкалу;
• среднее значение сырого балла каждой шкалы по каждой из нормативных групп,
• стандартное отклонение каждой шкалы для каждой из нормативных групп;
• формулу или таблицу перевода сырых баллов в стандартизированные (см. приложение 3).
7.2.4. Компьютерные тестовые программы в ряде случаев автоматически рассчитывают стандартизированный балл по всей группе лиц, протестированных в данной организации. Если при этом выявляются значимые различия в показателях средних значений для нормативной выборки и обследованной группы, то применять стандартную интерпретацию, предложенную разработчиком в руководстве, следует с осторожностью: возможно, более правильным для организационных целей является использование новых тестовых норм или их корректировка (см. подробнее раздел 7.5).
7.3. Стандартные шкалы
Двумя наиболее часто используемыми стандартными шкалами являются стэны (от англ. StandardTen — стандартная десятка) и Т–баллы. В тестах интеллекта часто используют IQ–шкалу. Реже в практике оценки персонала используются стэнайны (от англ. StandardNine — стандартная девятка), тысячебалльная Т–шкала и Z–шкала. Вместе с основными категориями результатов данные шкалы представлены в Таблице 7.1.
Таблица 7.1. Основные стандартные шкалы и основные категории результатов по ним
Шкала Среднее Стандартное откл. Могут принимать значения Результаты
Низкие Ниже среднего Средние Выше среднего Высокие
Стэны 5,5 2 1–10 1 2–3 4–7 8–9 10
Стэнайны 5 2 1–9 1 2–3 4–6 7–8 9
Т–баллы 50 10 0–100 0–9 30–39 40–60 61–70 71–100
1000-балльная
Т–шкала 500 100 0–1000 0–299 300–399 400–600 601–700 701–1000
IQ–шкала 100 15 больше 0 40–70 71–85 86–115 116–130 131–160
Z–баллы 0 1 любые Меньше
(-2) (-2)–(-1) (-1)–(+1) (+1)–(+2) Больше (+2)
7.4. Процентили
7.4.1. Использование стандартных шкал основывается на предположении, что оцениваемый признак (например, способности к работе с различной информацией, уровень знаний, личностная черта) распределен в соответствии с законом нормального распределения. В тех случаях, когда разработчики теста предполагают, что оцениваемый признак распределен в выборке нормирования иначе, может использоваться шкала процентилей.
Процентиль — это процент протестированных респондентов из нормативной группы, показавших результат ниже или такой же по сравнению с данным респондентом. Использование процентилей влечёт за собой определённые ограничения в интерпретации и анализе результатов. Например, вычисление среднего арифметического процентиля по нескольким шкалам не является корректной процедурой, в то время как допустимо вычисление среднего арифметического стандартного балла по нескольким шкалам, когда показатели по всем шкалам измерены в одноименных стандартных баллах. Процентильные границы часто используются для определения «крайних групп» на шкале тестовых баллов — «низкой» и «высокой» (по 25% или 33% от нормативной выборки).
7.4.2. В большинстве случаев шкала процентилей имеет вспомогательное значение и служит промежуточным звеном для перевода сырых баллов в стандартизированные в соответствии с так называемыми конверсионными таблицами.
7.4.3. Шкала процентилей часто оказывается наиболее понятной для тестируемого по сравнению с другими стандартными шкалами и в некоторых случаях рекомендуется для предоставления обратной связи (в частности, по тестам способностей).
7.5. Использование локальных нормативных групп
7.5.1. В практике тестирования персонала в крупных организациях периодически используются так называемые корпоративные нормативные группы, состоящие только из сотрудников данной организации. Корпоративная нормативная группа должна включать не менее 100 сотрудников (оптимальное количество — 300 и более). Использование корпоративных нормативных групп величиной менее 100 человек признается нежелательным в силу отсутствия возможности обеспечить статистически достоверные результаты и выводы.
7.5.2. Преимуществом использования корпоративной нормативной группы является бόльшая простота и, во многих случаях, точность принятия решений по итогам тестирования (например, кандидат на позицию сравнивается с результатами сотрудников, уже работающих на этой позиции).
7.5.3. Ограничением использования корпоративной нормативной группы является риск неверной интерпретации абсолютного уровня результатов . Переход на корпоративные и иные локальные нормы в настоящем стандарте рекомендуется производить не автоматически, но путем их анализа и сравнения с нормами, которые получены разработчиком теста на нормативной выборке и сообщаются в методической (технической) документации.
7.6. Погрешность измерения
Точность выводов при тестировании ограничена степенью погрешности (или ошибкой измерения), которая должна учитываться пользователем методики (см. Приложение 3). В зависимости от качества методики она может варьироваться от минимальной до достаточно серьёзной (например, более одного балла по шкале стэнов) и оказывать существенное воздействие на правомерность тех или иных решений, принимаемых на основе результатов тестирования .
7.7. Интерпретация результатов тестирования
Интерпретация предполагает построение содержательных выводов на базе стандартизированных баллов по отдельным шкалам и их сочетаниям.
7.7.1. В практике тестирования персонала существует два типа выводов, относящихся к двум основным этапам интерпретации. Первый тип: оценка степени выраженности измеряемой характеристики у респондента (например, «обладает более высокими способностями к работе с числовой информацией, чем 8% менеджеров аналогичного уровня»; «склонен брать на себя лидерские функции в той же мере, что и большинство других людей»; «усвоил 90% знаний по вопросам, связанным с проведением гидроразрыва пласта»). Второй тип: прогноз рабочего поведения респондента на основе степени выраженности измеряемой характеристики (например, «может допускать серьёзные ошибки при работе с числовой информацией»; «будет эпизодически брать на себя лидерские функции в знакомой обстановке и при отсутствии других претендентов»; «будет успешно моделировать проведение гидроразрыва пласта за исключением особо сложных случаев»).
Выводы первого типа базируются на знании пользователем теста свойств используемых стандартных шкал и прямо следуют из результатов теста с поправкой на возможную погрешность измерения. Выводы второго типа требуют аналитической работы со стороны пользователя теста и могут опираться либо на его личный опыт и квалификацию, либо на шаблоны интерпретации, предоставленные разработчиками теста, либо на статистические данные о том, как справляются с работой обладатели определенного тестового балла. Наличие развёрнутых шаблонов интерпретации позволяет обеспечить унификацию выводов всех пользователей теста, сократить число неверных выводов и ошибок в интерпретациях.
При принятии решений на базе результатов тестирования необходимо чётко разделять выводы двух указанных типов, а для выводов второго типа четко разделять:
• выводы, которые основаны на личном суждении пользователя;
• выводы, которые основаны на рекомендациях разработчиков теста;
• выводы, которые базируются на исследованиях и реальных производственных показателях.
7.7.2. Качество интерпретации существенно повышается при прохождении пользователями сертификационного обучения на право использования методики, проводимого разработчиком теста. Некоторые наиболее сложные тесты способностей и многофакторные личностные тест-опросники не могут использоваться без прохождения такого обучения.
7.7.3. Выводы по большинству тестов выносятся на базе стандартизированных, а не сырых баллов. Исключением могут служить тесты знаний и умений, для которых указаны пороговые значения в абсолютных показателях — в сырых баллах, масштабированных к 100 процентам (подробнее о критериально-ориентированном тестировании см. в разделе 2.3).
7.8. Различные подходы к анализу результатов тестирования
Анализ результатов тестирования предполагает построение содержательных выводов и сравнение тестируемых между собой. Как правило, основной целью такого анализа является составление рекомендаций на основе всей совокупности имеющейся информации.
7.8.1. Существует несколько основных подходов к анализу результатов тестирования:
– качественный подход, при котором результаты тестируемых сравниваются между собой без применения каких-либо статистических методов;
– расчёт интегрального рейтинг–балла (по одной или нескольким методикам) для каждого тестируемого и ранжирование всех тестируемых в соответствии с их рейтингбаллами;
– разделение тестируемых на группы в соответствии с результатами тестирования (по одной или нескольким методикам);
– сравнение профиля тестируемого с предварительно составленным «идеальным профилем».
7.8.2. Вне зависимости от применяемого подхода точность и качество анализа могут существенно повышаться, если наряду с результатами тестирования учитывается информация о тестируемом, полученная из других источников. В частности, результаты оценки сотрудников рекомендуется дополнять объективными данными о текущей эффективности их работы, экспертными (субъективными) оценками со стороны руководителей, других сотрудников, специалистов по оценке и т.п. (см. главу 9).
7.9. Расчёт интегрального рейтинг-балла
Для принятия решений по итогам тестирования часто вычисляют интегральный рейтинг-балл на основе результатов тестируемого по различным тестовым методикам и шкалам внутри одной методики.
7.9.1. Интегральный рейтинг–балл представляет собой сумму результатов тестируемого по разным методикам, выраженным в одной и той же стандартизованной шкале, или усредненный стандартизированный балл, что облегчает его интерпретацию. Результатам тестирования по разным методикам могут присваиваться разные веса, которые зависят от: а) цели тестирования; б) специфики профессиональной деятельности тестируемого; в) производственных задач или обобщенных должностных функций тестируемого; г) типа выбранных для тестирования методик и их качества.
7.9.2. Расчёт интегрального (суммарного) рейтинг-балла является корректным только при использовании в качестве слагаемых стандартизированных баллов на линейных шкалах (стэны, Т–баллы, IQ–баллы, Z–баллы и т.д.). При этом важно, чтобы все показатели были измерены в одноименных шкалах. Расчет интегрального рейтинга путем суммирования и последующего усреднения некорректен при использовании процентов или процентилей (и тем более при использовании «процентованных сырых баллов» — баллов, выраженных в процентах к максимальному баллу).
7.10. Разделение тестируемых на группы
В случае использования процентилей наиболее корректным приемом является их перевод в оценочные категории (например, градации — A, B, С, D). Например, если D — это 25 процентов с самыми низкими баллами, С — это следующая четверть от нормативной выборки (от 26 до 50 процентиля), то после перевода результатов нескольких методик в оценочные категории можно их скомбинировать (сочетание из двух категорий А и одной категории В может давать общую категорию А по трем тестам и т.д.). Указанным комбинациям показателей по нескольким методикам будут соответствовать различные интерпретации и рекомендации. Правила перевода первичных результатов в оценочные категории определяются в соответствии с целями и задачами тестирования и при участии экспертов. Более подробно о схемах сопряжения результатов различных методик см. раздел 9.2.
7.11. Сравнение с «идеальным профилем»
Зачастую при анализе результатов тестирования используется так называемый «идеальный профиль», описывающий усредненные показатели эффективного работника для данной должности.
7.11.1. Идеальный профиль состоит из набора конкретных целевых показателей или областей целевых значений и может составляться несколькими способами: а) на основе результатов тестирования наиболее эффективных работников; б) на основе сравнения результатов тестирования наиболее и наименее эффективных работников; в) на основе экспертной оценки значимости различных характеристик.
7.11.2. Идеальный профиль может представлять собой:
• набор точечных целевых значений по различным шкалам и/или методикам;
• диапазоны целевых значений по различным шкалам и/или методикам; • диапазоны недопустимых значений по различным шкалам и/или методикам.
7.11.3. В случае использования идеального профиля с ним сравниваются результаты каждого тестируемого. В зависимости от типа профиля могут использоваться как более простые способы определения сходства с ним (например, подсчёт количества попаданий в коридор из диапазонов допустимых значений), так и более точные статистические показатели. В последнем случае также могут использоваться весовые коэффициенты для различных шкал и/или методик.

Поделиться статьей
Нужна оценка персонала?
Ответьте на несколько вопросов и я пришлю вам расчет бесплатно
avatar-default-icon
HR-эксперт, бизнес-консультант, бизнес-тренер
PRO В топ 10 Автор статей
Стаж работы Более 15 лет
Отзывов от клиентов 12
Публикаций 57
Рейтинг в профразделах
Оценка 4 место
KPI 7 место
Консалтинг 11 место
Рейтинг в номинациях
Лучший экспертный ответ 10 место
Мастер лидов 10 место
Вас также может заинтересовать
HRTime_faces
163 специалиста сейчас на сайте Опишите задачу. Исполнители откликнутся сами.
Мы используем файлы cookie и рекомендательные технологии. Это позволяет нам анализировать взаимодействие посетителей с сайтом и делать его лучше. Продолжая пользоваться сайтом, вы соглашаетесь с использованием файлов cookie (подробнее), а также с пользовательским соглашением.
Согласен
X
Файлы cookie представляют собой файлы или фрагменты информации, которые могут быть сохранены на Вашем компьютере или других интернет-совместимых устройствах конечного пользователя (например, смартфонах и планшетах) при посещении Вами наших веб-сайтов или использовании наших веб-сервисов. Эта информация в большинстве случаев представлена в виде алфавитно-цифровых строк, которые однозначно идентифицируют Ваш компьютер или конечное пользовательское устройство, однако может содержать и иные сведения. На наших веб-сайтах или веб-сервисах мы используем различные типы «cookies» (небольшие текстовые файлы, которые размещаются на Вашем устройстве). Перечень используемых нами файлов cookie, описание целей их использования и дополнительная информация о соответствующих файлах cookie представлена в Инструменте управления файлами cookie, размещенных на соответствующих веб-сайтах и в веб-сервисах нашей компании либо в представленных в них текстах согласий или договоров.