校准(calibration)这个术语是指建立两个结构相同,但难度分布或信度指标可能不一致的测验分数之间的统一分数量表。比如,为了追踪了解小学生在数学课程上的进步状况,需要建立不同年级间数学分数的比较系统,以便了解当某个学生从三年级升入四年级之后,其数学水平是否得到提高,这种比较关系的建立过程就是垂直量表化(verticalscaling)。在这种情形下,不同年级的数学测验虽然目标领域是一样的,但测验难度分布却是不一样的。另外一种实际情形就是,由于某智力测验完整版的测试时间太长,容易导致被试作答疲劳,因此同时编制了一个简缩版,简缩版与完整版所测量的结构是一样的,题型也是一样的,难度分布等统计学指标也保持一致,只是题目量减少了。随着题目量的减少,测验的信度指标也就发生了变化,测验开发者当然希望建立完整版测验与简缩版测验分数之间的比较关系,这样才能让使用者无论作答了哪个测验,均能得到相似的结果解释,这个关系的建立过程也叫作校准。
一致化(concordance)这个术语一般是指建立两个测量目标相近(similar)的测验之间的比较关系。所谓测量目标相近,就是测验目标内容之间有较高的相关,但却并不完全一样(identical)。比如,建立韦氏智力量表分数与瑞文测验分数之间的比较关系的过程,就可以称为一致化过程。
调谐(moderation)一词一般是指两个测量目标或结构不同的测验上的分数建立比较关系的过程。其中一种典型的设计方法是,两个测验通过分别建立与第三个测验(调谐测验)之间的关系,来达到相互比较的目的。典型的过程是,一组被试作答第一个测验与调谐测验,另外一组被试作答第二个测验与调谐测验,这种设计可以对两组被试在不同测验上的得分进行比较。另外一种更简单的设计,就是两个测验施测于同一批被试或两个随机等组的被试,从而建立两组分数之间的等值关系,这个其实就是观察分数等值方法。
预测(projection)一词一般指的是在两个测试不同目标或结构的测验之间建立分数的比较关系的过程。在建立比较关系时,预测一般是用一个测验上的得分去预测另一个测验上的得分,具体的方法通常是用回归分析(regressionanalysis)建立同一组被试在两个测验上的得分之间的关系。
调谐和预测两种方案所处理的测验一般都是测量不同的目标或结构。比如,一般能力倾向测验经常是以分测验(subtest)的形式成组编制的(testbattery),每个分测验所测量的结构之间有很大的差异,但是通过这种测验,可以了解被试在不同领域之间的优势和劣势。当然,在编制这类测验时,需要考虑分别建立总测验和各个分测验的比较系统,以便比较被试在不同分测验上所处的位置。另外,通过调谐这种方案所建立的分数比较关系是对称的,但通过预测这种方案所建立的比较关系却不是一一对称的。
为什么文献上会出现这么多相关术语,就是因为对测验进行量表化时可能会涉及各种不同的情形,以及量表化的目的可能不同。科龙和布雷南指出,在对测验进行量表化时,至少需要对以下四个方面的情形特征加以考虑。
①推断(inferences):在根据被试两个测验上的分数所蕴含的意义进行推断性解释时的相似性程度。如果在做出推断性解释时的相似性程度越高,那么,这两个测验所测内容结构就应该非常一致,适应的参照总体也越相似,测试条件也应该一致。那么,相应的量表化方法也应该越严格。
②结构(constructs):两个测验所测结构和内容的相似性程度。相似性程度的高低会影响我们应该选择什么样的量表化方法。