一般论文式考试,只能提供列出答案要点的参考答案而无固定的标准答案,因而不同的评分者对同一份试卷往往给分不同,甚至有很大的悬殊。在作文测验、投射测验、品德测验、创造力测验等的评分中,都存在这个问题。评分者之间的评分不一致,说明评分的信度不高,评分者所评的分数越一致,评分的信度越高。
要计算评分者评分的一致性系数,需区分评分者的人次数。若只有两人评N份试卷,或一人先后两次评N份试卷,可用斯皮尔曼(Spearman)等级相关的公式计算;若三个以上的评分者评N份试卷时,则需计算肯德尔和谐系数(KendallCoefficientofConcordance)。
①斯皮尔曼等级相关。评分者为两人时,将两人的评分转化为等级,求等级相关系数。
式中rR为等级相关系数,D为两人评分的等级之差,N为试卷数。
例16:甲、乙两位教师评阅10份作文试卷,结果如下,问两位教师的评分是否一致?
将表中数据代入等级相关公式,求得
可见,两位教师评分的一致性系数比较大,评分基本可靠。
②肯德尔和谐系数。有多名评分者,将评分转化为等级,求肯德尔和谐系数。
式中W为和谐系数,K为评分者人数,N为被评对象数,Ri为被评等级总和。
例17:有5位教师对8篇作文进行等级评定,结果如下,问5位教师的评定结果是否一致?
解:由表中数据可求得
于是有:
可见,5位教师评分的和谐系数很大,评分可靠。
一般来说,W大于0.90时,可认为评分者信度较好。
3.测验的适宜信度
信度系数究竟以多大为好,没有明确的标准,要看测验的目的和类型。对于学科测验,信度系数要求达到0.90以上,智力测验要求达到0.80以上,人格测验能达到0.60以上就很不错了。
4.提高测验信度的措施[10]
(1)适当增加测验项目的数量。一般而言,测验越长,信度值越高。原因在于:第一,测验加长,就可能改进项目取样的代表性,从而更好地反映被试的真实水平;第二,测验的项目越多,在每个项目上的随机误差就可以互相抵消。
(2)测验的难度要适中。过难或过易都会使个体间得分差异减小,降低信度。只有当测验难度水平使测验分布范围最大时,测验的信度才会最高,通常这个难度水平为0.50。
(3)测验要有良好的区分度[11]。测验的信度与项目的区分度有密切的关系,整个测验中各项目的区分度的平均值越大,测验的信度就越高。表6-5说明了区分度与信度的关系。
表6-5 区分度与信度的关系
(4)测验的时间要充分。测验的时间限制也会影响信度的高低,如果安排的时间不够,考生不能从容回答所有问题,也就不能真实地反映被试的实际水平。因此,测验的时间要充分。当然,这里不是说,要保证所有被试都能做完试题,而是以大多数被试为标准来设定考试的时间。
(5)测验的程序应统一。测验程序直接关系到信度的高低。测验的程序统一包括试卷统一、测验开始时的指导语、回答问题的方式、分发及收回试卷的办法、测验时间的掌握等。
(6)评分要尽量做到客观化、减少评分误差。评分是测验的一个重要环节,如果这一关把握不好,测验就等于前功尽弃了。信度系数是根据实得分数算出的,如果评分不准确,信度也就不准了。因此,要求评分要尽量做到客观,减少评分误差。
(二)效度
一个好的测验,信度高是必要条件,但并非充要条件。不可信的测验肯定没有效,但可信的测验未必有效,而有效的测验必定可信,因此,对教育测量而言,效度显得更为重要。
1.效度的概念
效度是指测量结果的准确性和有效性的程度,即一个测验对所要测量的目标准确测量的程度。通俗地说,测验能否测量到我们所要测量的东西的程度就是效度。
我们可以从以下几方面来理解效度[12]。