第三种方法是检查相同作答模式被试的分布比例。对于1、0记分题目,一个测验包含30多个项目是非常正常的。从理论上来说,30个项目组成的测验将有230种作答模式,也就是有超过10亿种被试作答反应模式。当然,在正常情形下,有些作答模式是不可能出现的,如高难度项目答对,而容易项目答错的作答模式,还有些作答模式本来就有更多的出现可能。其实,如果把被试作答模式与被试能力水平对应的话(很多测量学研究者就是这样处理测验作答数据的),那么各种作答模式出现的概率就应该服从与能力水平一样的分布。在这种情况下,如果按测验总分排序的作答模式分布偏离正常分布太大,我们就可以有理由怀疑测验中可能存在非正常作答情形,因为非正常作答模式经常只出现在几个孤立的分布点上。因此,在探查非正常作答模式时,经常需要首先对分布进行平滑化处理,然后比较某个点上的正常分布与实际分布之间的差异。当然,这种探查方法对大规模测验中可能出现的集中舞弊现象可能会比较有效。
不过,用统计分析手段对非正常作答被试进行探查,在有些情形下很难有效。因为在实际测试中,被试一般是对在自己能力水平范围内的题目自己独立作答,而对较难的项目才借助外部力量。这样的话,其作答结果仍然会呈现出比较合理的模式。因此,统计分析过程需要仔细、谨慎,综合多方面信息进行判断。
从项目的角度检验其局部独立性,主要是要确定各个项目之间是否存在内容相依或结果关联。一方面,我们可以通过专家分析的方法,判断测验中的各个项目之间是否存在相互依存关系。另外,项目之间的局部独立性有时候还可能会受到测验题目形式的影响。比如,关于相同题干下的多个设问题型,被试对题干的不同理解可能就会影响该题干下所有问题的作答结果,语文和英语阅读理解就是这类题型的典型例子,而相同题干下的多步骤解答记分题型,除了会受到相同题干的影响之外,后续步骤的解答还会受到前面步骤解答正确与否的影响。另一方面,我们也可以通过统计分析的方法,判断测验项目之间是否存在相依关系。现在把经常用于检验项目相依关系的统计量称为Q3统计量,该统计量的定义过程如下:
首先,定义
其中,uik为第k个被试在第i个题目上的得分,Pi(θk)为被试正确反应概率。根据这个式子的定义,可以计算出每个被试在每个项目上的d值。然后,定义
r为两个题目i和j之间的相关系数,其相关系数的计算是基于式(4-5)所定义的d值的,也就是说,在计算相关系数之前,首先需要把得分矩阵中的各个0和1形式的分数转换为d值。当我们所选择的项目反应模型与测验数据拟合良好时,Q3统计量的相关系数r按照Fisher转换为z值后,将服从正态分布,其平均数为0。对于三参数逻辑模型,其方差为1/(n-3),其中,n为参与相关系数计算的被试样本容量。相关系数r按照Fisher转换为z值的式子如式(4-7)所示:
ln为取自然对数符号。当然,读者也可以通过查表的方式获得转换值,许多应用类统计书都会提供这类转换表。
有研究者又指出,使用Q3统计量对项目相依性进行检验的实际应用,很少基于正态分布理论对其Fisher转换值进行检验,而是直接给Q3统计量的绝对值划定一个临界值,根据经验,该临界值定为0.2。如果Q3统计量的绝对值大于该临界值,则可以认为这两个项目之间可能存在相依关系。
三、补偿性检验
