因此,互信息反映了随机变量X和Y共享信息的程度。也就是已知一个变量的条件下,能够消除关于另一个变量的不确定度的大小。如果变量X和Y相互独立,那么,X对于了解Y不会提供任何信息,反之亦然,这时两个变量之间的互信息为0。而当变量X是变量Y的确定性函数或变量Y是变量X的确定性函数时,那么两个变量之间共享所有信息,通过X就能够完全了解Y。其实在这种情形下,变量X和Y的互信息就等于各自的信息熵。
根据以上描述,互信息还可以描述如下(具体推导过程请参看相关文献资料):
式子中,H(X|Y)和H(Y|X)称为条件熵,它表示已知Y(或X)以后,对X(或Y)仍存在的不确定度;与互信息相对应,有时候也称信息熵H(X)或H(Y)为自信息(self-information)或边际熵;H(X,Y)称为联合熵(jointentropy),定义如下:
互信息具有以下三个基本性质。
①非负性:I(X;Y)≥0,即H(X)>H(X|Y),仅当变量Y与变量X统计独立时,互信息才为0。
②互信息不大于信息源的熵:I(X;Y)≤H(X),即接收者从信息源中所获得的信息必不大于信息源本身的熵。
③对称性:I(X;Y)=I(Y;X),即Y隐含X和X隐含Y的互信息是相等的。
描述信息贡献关系及其大小的方式还有很多种。除了上面介绍的信息熵、互信息以及本书前面介绍的AIC统计量、BIC统计量和DIC统计量外,下面再介绍几种在心理测量学理论中比较常见的一些有关衡量信息量的概念。
二、自信息
上面已经提到自信息(self-information)的概念,然而,与自信息的规范的定义有些差异。自信息反映了对某个随机变量进行抽样时的惊异度(surprise)。如果信息接收者预先完全掌握了接收的信息,那么,当你再次传递该信息时,对信息接收者来说就没有任何信息价值了。只有当信息接收者对即将接收的信息不完全了解时,该信息才有价值,才会产生惊异。自信息用来衡量某变量中单一事件发生时所包含的信息量的多少。
对于某变量X,事件xi∈X,其发生概率为P(xi),那么该事件的自信息定义为:
由此可知,事件xi发生的概率越小,那么,当该事件真实发生时,其传递的自信息量就越大。因此,自信息有时可叫惊异(surprisal)。
对于离散型随机变量,某个事件的自信息的期望(expectedvalue)就是信息熵,它反映了对一个随机变量进行抽样时产生的平均惊异(不确定度)。有时候,信息熵本身也会叫自信息,这可能是因为信息熵满足以下条件:H(X)=I(X;X),I(X;X)代表了变量X自身的互信息。
三、KL散度
KL散度(Kullback-Leiblerdivergence,相对熵,relativeentropy, & ,1951) 是用于描述两个概率分布差异的一种方法,它描述了某概率分布拟合理论真实概率分布的程度。概率分布Q拟合理论真实概率分布P的KL散度一般表示为DKL(P‖Q)。从贝叶斯推理理论来说,DKL(P‖Q)可以表示用后验概率分布P代替先验概率分布Q所获得的增量信息,也就是当用Q来估计P时可能带来的信息损失量,在这里,P代表了真实的数据观察,而Q代表了一个理论估计或P的近似估计。在信息论中,DKL(P‖Q)表示当用概率分布Q来拟合真实分布P时,产生的信息损耗。
对于两个离散变量概率分布Q和P,KL散度定义为:
对于两个连续变量概率分布Q和P,KL散度定义为: