自然语言处理中大量涉及常识知识问题。20世纪70年代以后,专家系统等人工智能技术的发展,使研究者们逐步认识到常识知识在智能系统中的重要作用,但要通过构建海量常识知识库来实现人工智能是不现实的。在没有搞清楚人类是如何组织常识知识的前提下,如何组织如此庞大的海量常识知识是难以跨越的鸿沟。从认识论的角度来看,常识知识的形式化是人工智能的核心任务,其特点是基于某个透视域对世界进行抽象描述,具有不完全性和不确定性。从本体论的角度来看,常识知识表述形式是对世界的近似表征,必然会忽略某些方面,并且关注的是世界的本质内容而非语言形式,因此所构建的本体具有一定的相对性。从方法论的角度来看,常识知识库将常识知识形式化地表征为一类数据结构,并在其上进行常识推理等运算,且由于应用的可实现性而专注于对某些特定领域知识的描述,具有某种程度的随意性。从现有的常识知识库来看,普遍关注常识知识的表征形式而常常忽略其本质内容,这也是造成语义网研究进度缓慢的原因之一。
基于上述考虑,需要在构建大规模语义知识库的过程中,针对某些有实用价值且应用相对普遍的领域进行构建工作,避免构建大而全的海量常识知识库,从而率先实现在特定应用领域的突破。这一从整体到局部的思想转变,已引起某些人工智能专家的注意,它将是下一阶段自然语言处理能否取得突破的关键所在。
从目前各大型语义知识库的构建工程中可以看出,试图完成所有常识知识的语义描述是不可能的,要想有实用价值,只有针对特定领域才有可能有所突破。以汉语框架语义知识库(ChineseFrameNet,简称CFN)为例,需要做的不是描述汉语全部词语的语义框架,而是着力开发针对一定应用领域的语义框架和应用系统,诸如网上购书系统、旅游问答系统、天气预报系统、法律法规系统等多个应用领域。这些领域的共同特点是有很强的应用价值,并且领域相关的词汇量不是很大,可以在较短的时间内完成研发工作并投入使用,获得可观的社会效益。
(2)尝试在特定领域突破自下而上的经验主义研究路径,实现自上而下的基于篇章语境描写的框架技术。
通过对旅游问答系统、网上购书系统、医疗系统、行政系统及法律法规系统中的真实语料进行词元提取操作,可以发现,在特定领域数据库中,某类词或短语在文章中出现的频率较其他类别的词语高许多,并且它们在文章中的位置相对固定,用法也较为一致。更为可喜的是,这些领域数据库中的文章在体裁、结构甚至表述方法上都有很强的相似性。由此可以大胆提出,完全有可能突破现有的基于词语来分析单句语义的描写方式,转而通过对高频词与核心词的提取,直接针对一些特殊领域的数据库,构建基于篇章的语境描写框架。这就使计算机在对文章中具体的句子进行语义分析之前,首先对整篇文章有一个语义上的整体认识,构建一个篇章级别的语境,进而再通过对具体语句的语义分析,纠正并完善对该篇文章的意义理解。
应当看到,虽然这是一种机会主义的分析方法,但它突破了原有的从词汇开始进行语义分析的自下而上的技术路线。因为它采取了对整篇文章自上向下的分析视角,排除了在单个词语分析过程中不符合整篇文章意义的歧义内容,使文章中的句子之间产生连贯的语义关系。在此基础之上进行的推理势必可以达到更好的理解效果。现阶段,无论从语言学方面还是计算机技术方面,我们都不可能实现针对某种语言的全部应用构造篇章级别的理解框架。只有在特定的应用领域,才有可能提前实现更具智能化的全文机器翻译。这一思路在自然语言处理的很多特定领域中,都有着广泛的应用前景,可以为许多公共领域实现更具智能化的信息提供服务。