其实,即使是连续变量的积分,在计算机实现的过程中,也总是会转换为加权累加的形式。比如,对项目反应理论中的连续变量——被试能力水平进行积分时,在计算机实际实现过程中,无穷积分一般就会采用基于有限积点(quadraturepoints)和相应积点系数(coefficients)或权重(weight)的高斯-厄米特(Gauss-Hermite)数值积分算法进行近似估计。对于正态密度函数,经验上一般会在某个合理范围内,采集40个积点,包括20个正积点、20个负积点,对积分进行近似计算。于是,式(7-10)总是可以转换成如式(7-12)所示的用高斯-厄米特数值积分算法进行的近似估计:
其中,Xk为在连续变量上选择的代表性积点,在此例中代替具体的θ取值,q为积点个数,A(Xk)为积点对应的系数或权重,且有:
其实,从几何解释的角度,定积分就是求概率函数曲线在某个区间内与横轴所围成的区域面积,如图7-2所示。
图7-2 函数的定积分解析图
对于连续型随机变量来说,其概率函数曲线也是连续的,这时,概率函数曲线在某个区间内与横轴所围成的区域面积的求取,就可以通过以下方式得到:首先,把这个区间分成有限个更小的区间;然后,求取这些小区间的面积,并累加后得到整个面积的值。如果这些小区间的间距足够小,那么,这个区间横轴的中值就可以作为该区间的代表值(积点),这个区间的面积就可以作为这个代表值的权重(积点系数)。这个区间的面积经常可以通过查相关变量的函数分布表来得到,从而用这些积点和积点系数代替积分过程进行运算。
二、边际极大似然估计及其EM算法
有了以上这些认识基础之后,我们就可以开始对边际极大似然估计进行具体的介绍。接下来的内容将分成两个部分:首先,介绍边际极大似然估计及其EM算法的提出;其次,结合认知诊断评价理论中的DINA模型,解释边际极大似然估计及其EM算法在DINA模型项目参数估计中的应用。
按照被试参数作为已知条件的呈现模式,可以把估计项目参数的方法分为两种:①把被试看作来自某个已知分布总体的代表性随机样本,于是可以通过基于对该已知分布进行积分的方式来估计项目参数;②把被试看作一个未知分布的随意(arbitrary,注意不是随机)样本,按照联合极大似然估计的方式同时估计被试参数和项目参数。在这两种方法中,第二种方法在实际应用中可能存在很大问题。在参数估计中,项目参数被认为是结构参数(structuralparameter),根据某个测试规划命制好的测验一般不会随意改动,其结构和参数是相对固定的,可以当作稳定参照的工具,测验的项目数量一般也是固定的且规模较小。而被试参数被认为是讨厌参数(nuisanceparameter),如果被试是一个随意样本,那么,每增加一个被试就会增加一个随意参数,导致项目参数无法获得稳定的一致性估计,这就违反了项目反应理论参数不变性的特性。基于第一种方法的极大似然估计,称为边际极大似然估计,它能够保证关于项目参数的一致性估计,因此成为现在参数估计中应用较广的方法之一。
要实现参数的边际极大似然估计,首先需要构建基于边际分布的似然函数。