总结性评价主要是在教学和学习后进行的评价,是对教学和学习全过程的检验。[5]
“总结性评定,形成性评定和诊断性评定之间的区别,在于所涉及问题的类型各不相同。总结性评定所关心的是最后结果,形成性评定是提供学生进步的描述,而诊断性评定描绘的则是学生成绩的轮廓。”[6]诊断性评价、形成性评价和总结性评价存在于学生评价的全过程,并各有侧重地发挥着各自的作用和功能,而且这三种评价类型在实践中是互为提供信息和依据,因此这种划分是相对而言的。“在形成性与总结性评价之间没有基本逻辑和方法论上的差别。两者都是为了检验某个实体的价值的。只有按不同时机、评价的听取人,以及使用评价结果的方法,才能区分在什么情况下的评价是形成性的,或是总结性的。而且对于同一评价来讲,在一个需求者说来可以是形成性的,而另一个看来却是总结性的。”[7]
表8-1 诊断性评价、形成性评价和总结性评价的异同表
资料来源:[日] 筑波大学教育学研究会编:《现代教育学基础》,上海教育出版社,1986年,第400页。
三、教育评价的发展历程
纵观历史的发展脉络,美国教育评价专家印第安纳大学教育学院的古巴(Guba,E.G.)和林肯(Lincoln,Y.S.)把教育评价的发展历程划分为四个阶段。第一代教育评价被称之为测量时期。最早在学校里的测试是以口试的形式进行的,学生以小论文式的方式来回答问题,以此测量学生的各种特性,主要测量学生对知识的记忆方面。第一代评价盛行于19世纪末至20世纪30年代,法国比奈量表(Binetscale)是当时测量风行一时的典型代表,在这个时期测量与评价(evaluation)这两个词是混用的。这种测量趋势的产生主要受两个因素的影响,一个是当时兴起的把科学方法应用于社会科学研究的运动,另一个是在工商业盛行起来的科学管理运动。[8]第二代教育评价被称为描述时期。一战后美国社会对课程改革的呼声非常高,人们要求进行课程改革来适应学生的需求,如何检测新开发出的课程与其预定目标是否一致也随之成为一个备受关注的问题。而第一代评价单纯提供针对学生的评价信息这个特点显然不能满足这个需要。当美国一些中学进行课程改进活动时,泰勒(Tyler,L.B.)也同时收集针对这些项目达到预期目标的程度的信息,开始了历史上著名的1933~1941年的“八年研究”。第二代教育评价以泰勒的目标模式为主要代表。古巴和林肯把泰勒提出的评价模式称为是目标导向的描述性评价。这代评价认为,评价在本质上是“描述”(description)——描述教育结果与教育目标相一致的程度。[9]古巴和林肯把第三代教育评价定义为判断时期,认为评价在本质上是“判断”(judgment)。这个时期开始于1957年苏联人造卫星发射成功之后。这个时期把评价视为价值判断的过程,评价不只是根据预定目标对结果的描述,预定目标本身也需要进行价值判断;既然目标并非评价的固定不变的铁的标准,那么评价就应当走出预定目标的限制,过程本身的价值也应当是评价的有机构成。[10]
