[6] 具体细节可参见黄宜华:《大数据机器学习系统研究进展》,载《大数据》,2015(1);陈康、向勇、喻超:《大数据时代机器学习的新趋势》,载《电信科学》,2012(12);何清、李宁、罗文娟、史忠植:《大数据下的机器学习算法综述》,载《模式识别与人工智能》,2014(4)。
[7] 陈冬华、李真、杨贤、俞俊利:《诗歌、道德与治理——基于唐代科举的量化历史实证研究》,载《文学研究》,2017(1)。
[8] 陈冬华、李真、杨贤、俞俊利:《诗歌、道德与治理——基于唐代科举的量化历史实证研究》,载《文学研究》,2017(1)。
[9] ImmanuelKant,CritiqueofPracticalReason,KritikderpraktischenVernunft,1788.
[10] 陈冬华、李真、李贤、俞俊利:《诗歌、道德与治理——基于唐代科举的量化历史实证研究》,载《文学研究》,2017(1)。
[11] 陈冬华、李真、李贤、俞俊利:《诗歌、道德与治理——基于唐代科举的量化历史实证研究》,载《文学研究》,2017(1)。
[12] 陈冬华、李真、杨贤、俞俊利:《诗歌、道德与治理——基于唐代科举的量化历史实证研究》,载《文学研究》,2017(1)。
[13] 所谓线性模型,就是说这里的我们假设y和x是线性的关系。事实上,这个假设并不是必需的。我们可以假设y和x、z之间满足任何一种函数关系,比如y=f(x,z)+ε。我们可以对函数f的形式做出任意的假设,或者不做任何假设。统计学中已经发展出一套成熟的工具帮助我们利用数据估算出f(x,z)的具体表达形式。具体技术细节可以参见李子奈、潘文卿:《计量经济学(第3版)》,北京,高等教育出版社,2010。Hayashi,,2011;以及Greene,,2011。
[14] 在陈冬华等人的研究中,y表示的是是否被认为道德高尚,因此是一个非0即1的变量。同时x表示所写诗歌是否被《唐诗三百首》收录,也是非0即1的变量。一个诗歌造诣高的官员的道德情操y(x=1)=a+bz+ε,而一个诗歌造诣较低(没有被《唐诗三百首》收录)的官员的道德情操y(x=0)=bz+ε。两者之差,y(x=1)-y(x=0)=a就刻画了一个官员的诗歌是否被《唐诗三百首》收录这个事件对其道德情操的影响。而这也是在回归分析的模型框架下系数a的一种阐释。详见陈冬华、李真、杨贤、俞俊利:《诗歌、道德与治理——基于唐代科举的量化历史实证研究》,载《文学研究》,2017(1)。