求函数极值问题经常会转化为求函数的一阶导问题。类似地,在求使似然函数值达到极值时对应的参数值时,也经常把该问题转换为求似然函数对该未知参数的一阶导并令函数值为0时对应的方程的根,而求这个根的过程就经常使用牛顿迭代算法。当然,如果可以直接解出一阶导方程的根,那就不需要经历迭代过程。
三、贝叶斯估计、先验分布、后验分布
学习贝叶斯估计首先需要了解先验分布和后验分布的概念。
贝叶斯估计是基于贝叶斯统计思想的估计方法。先验分布是贝叶斯统计的基础概念。贝叶斯统计理论认为,关于总体参数的任何统计推断,除了使用试验样本所提供的信息之外,还必须规定一个关于该参数的先验分布,它是在进行总体参数统计推断时不可或缺的信息。先验分布是在获得试验样本数据信息之前就已经掌握了的关于对总体参数分布的认识。
所谓参数的后验分布,是根据试验样本数据信息和未知参数的先验分布信息,用概率论中的贝叶斯定理求条件概率分布,求出在已有试验样本数据信息的情况下,关于未知参数的条件分布。由于关于未知参数的条件分布是在已经获得试验样本数据信息之后才求得的,因此称为未知参数的后验分布。贝叶斯统计推断的基础就是,关于未知参数的任何统计推断都必须且只能根据该参数的后验分布进行,而不能只涉及其样本信息。贝叶斯统计模型如下:
式(7-7)中,P(A)表示未知事件A的先验分布信息,P(B)表示试验样本B的分布信息,P(B|A)表示在事件A发生的条件下,试验样本B的发生概率。P(A|B)表示在获得了试验样本数据信息的条件下,可以对与该结果相关联的未知事件A发生的概率重新进行调整估计。
贝叶斯统计模型综合了先验分布信息和通过试验获得的实际样本数据信息,从而获得后验分布信息,并以后验概率P(A|B)的形式体现出来。因此,贝叶斯统计模型反映了在获得了实际试验数据信息的条件下,先验分布向后验分布的转化过程。试验样本信息在这里的唯一作用就是把对未知参数的认识由仅有的先验分布向后验分布转化。
根据以上介绍可以了解到,关于参数的认识,传统统计推断理论是基于大样本理论的,认为要估计的参数是一个未知但却是确定的唯一值,并不具有随机性,估计的任务就是把这个值找出来。而基于贝叶斯理论的估计方法把要估计的未知参数看作一个随机变量,这个变量可能取各种不同的值,同时,这个随机变量有一个伴随的已知的先验分布信息,也就是关于该随机变量取各种值的概率信息。贝叶斯统计推断方法关于参数的估计完全是基于后验分布的,而后验分布中的关键因素就是试验样本数据信息和参数的先验分布信息。在实际进行参数估计时,未知参数的试验样本信息一般是已经准备好的,是确定已知的,而对未知参数的先验分布信息的选择就需要深入思考,谨慎对待。只有关于未知参数的正确的先验分布信息,才能保证构造出正确的后验分布,而正确的后验分布才能保证得出正确的参数估计结果。比如,关于被试能力水平参数的先验分布一般认为是正态分布,如果在构造后验分布时选择偏态分布,那么可能会导致贝叶斯方法做出错误的统计推断。
贝叶斯估计相对于经典学派的估计方法有什么优势呢?经典统计学派认为概率是事件在大量独立重复试验基础上所发生的频率的稳定值。贝叶斯学派当然也承认这一观点,但他们更加强调主体主观认知的作用。因此,在拥有大规模试验样本数据的情况下,传统统计估计方法的结果可以得到比较好的保障。然而,在实践当中,我们经常无法保证进行大规模的重复试验能获得大规模的试验样本数据,经常的情况是我们只能拥有小样本观察数据。在小样本的情况下,传统统计估计方法就无法保障得到的结果是准确的,因此需要探索一种更加稳定的估计方法。结合人们过去对未知参数的经验,根据人们过去积累的认识给出关于未知参数的较稳定合理的解释,是一种比较好的做法。其实,在日常判断决策中,人们也经常是在面对当前情形时,还会根据以往的经验认识做出决定。
总之,贝叶斯估计是根据某个随机变量的样本观测信息,并结合其先验信息,通过后验分布估计其可能取值的过程。