③总体(populations):两个测验测试的总体及解释所参照的总体的相似性程度。
④测量条件(measurementconditions):两个测验测量条件的相似性程度,如测验长度、测验模式、施测条件等。
根据这些情形条件的不同,在进行量表化时就可能需要使用不同的方案和方法。比如,对于“等值”所处理的情形,应该是两个测验经等值后的分数可以进行相同的推断解释,两个测验测量了相同的特质结构,测验结果解释的参照总体相同,在相同的测量条件下进行施测。对于“一致化”所处理的情形,就要求两个测验测量的特质结构相似,测量条件相似,相同的测验分数可以进行近似的推断和解释,测验结果解释的参照总体相似。而对于我国分省高考的情形,测试的结构可能存在很大差异,施测的条件存在差异,测验分数的参照总体存在差异,两省高考之间相同的测验分数不能进行相似的推断。当然,我们还是希望能够建立不同省份之间高考分数的比较关系,只是需要应用不同的量表化方案。
虽然有这么多的术语,它们分别代表了不同的应用情境,它们之间有着不同的具体目标,但最后的目的是一样的,那就是建立不同测验分数或不同被试群体之间比较系统的关系,即进行统一量表化。而且有些量表化方案在具体实施时,可能会使用相同的数据采集设计方式,甚至使用相同的数据统计分析方法。比如,垂直量表化和等值在数据采集设计和建立比较关系的统计分析方法上就有许多相同或相似之处。
下面的内容主要是关于等值的设计模式及等值转换方法的介绍。在国内,关于等值概念的应用似乎比较宽泛,基本与这里讲到的链接(linking)一词的指代范围一致。本章以下内容将会遵照国内的传统叫法,只是读者自己需要明白各种情境下的等值需要注意的问题,并逐步建立自己关于量表化概念、方法的正确认识和交流习惯。等值一般包括被试分数等值、被试能力水平参数等值和项目参数等值。本章最后还会讲到现在及将来在教育及心理评价中具有非常重要应用价值前景的垂直量表化(verticalscaling)或叫垂直链接(verticallinking)的模式和方法问题。
一、等值
等值是将测量同一心理特质的不同测验分数或项目参数,通过一定的设计和数学模型,转换到统一的单位系统中去的过程。
等值是进行大规模评价中经常用到的测量技术。在大规模评价活动中,经常会用到多个测验测量不同的被试群体,但是,又希望最终的测试结果是可以进行相互比较的。在我国,高考应该是较大规模的全国统一考试,现在是各个省份进行自主命题考试,虽然考试大纲是统一的,但不同省份命制的具体题目千差万别,如果不进行等值设计,各个高校在招生时就只能按照在各省分配名额的方式进行,因为各省考试分数之间不可比较。现在,我国也开始重视教育质量进步的评价问题,除定性分析之外,用测试分数进行评价应该是一个重要手段,教育质量进步评价涉及纵向评价问题,而根据不同年份的不同测验结果如何能够评价学生成绩的进步情况呢?这也需要进行等值设计,以保证测验分数的可比性。
另外,考试安全是考试组织者最为关心的问题之一,为了保证考试的安全,组织者几乎想尽了各种办法。其实,如果能够建立大型题库,并实行计算机化自适应考试,测试组织者几乎不用花多少心思就可以解决考试的安全问题。有些考试单位已经开始研究尝试建立题库。不过,题库的建设如果离开了项目参数等值过程,这个题库几乎就没有多大价值,至少没有充分发挥它应有的价值。
(一)进行等值的条件
在两个测验之间进行等值必须具备一定的条件。根据洛德的观点,等值一般应当具备以下条件。
1.测验内容同质