因此,对自然语言进行的处理可以分解为:针对输入的自然语言理解和针对输出的自然语言生成两个过程。在输入过程中,系统通过解构文本实现对自然语言的理解;在输出过程中,系统又通过构造生成完整的句子来表达处理结果。这种前提假设从一开始就决定了自然语言处理必须先从分词、句法等语形处理方式入手,而后再通过语义及语用分析来完成对文本意义的理解。然而,目前相关科学的发展,尚不能确定人类在使用语言的过程中是否存在着这种层次关系。不过这种对语言层次的划分,却直接决定了自然语言处理,必然要经历从对词法和句法所进行的语形分析阶段向语义分析阶段发展的路径。
(2)在缺乏词一级的语义知识库的前提下,现阶段的语义分析系统更多程度上主要依赖于统计学等浅层方法,有待于从理论上和实践上进一步完善和突破。词网和框架网络等大型语义知识库工程也主要以词语为描述对象,致力于构建一个词一级的、具有一定层级关系的抽象化的语义网络,无法从理论上突破句法对语义的限制,从而进行段落或篇章一级的语义分析。总的来说,这一现象始终贯穿于自然语言处理发展的两个阶段中:
第一阶段主要建立在对词类和词序分析的基础之上。20世纪40年代末开展的机器翻译试验,大多采用特殊的格式系统来实现人机对话。到了60年代,乔姆斯基的转换生成语法得到广泛认可。在这一理论的基础上,开发了一批语言处理系统。基于层次化的前提假设,自然语言处理从一开始就致力于对语言形式的处理,分析过程中以统计方法为主,主要在分词基础上对单个语词进行处理。这些基于语形规则的分析方法,可以称之为自然语言处理中的“理性主义”。
第二阶段则开始引进语义甚至语用和语境的分析,构建了一批大规模语义知识库,试图抛开对统计方法的依赖,采用了与“理性主义”相对的“经验主义”研究思路。20世纪70年代以后,随着认知科学的发展,人们认识到转换生成语法缺少表示语义知识的手段,因而相继提出了语义网络、概念依存理论、格语法等语义表征理论,试图将句法与语义、语境相结合,逐步实现由语形处理向语义处理的转变。但仍然不能摆脱句法形式的限定,无法灵活地处理自然语言。到了80年代,一批新的语法理论脱颖而出,主要通过对单句中核心词的分析,进而完成对整个单句的语义分析。[85]但是,在缺乏词一级的语义知识库的前提下,要实现对自然语言的语义分析是不可能的。此外,造成自然语言处理困难的根本原因,在于自然语言的语形与其语义之间是一种多对多的关系,从而造成歧义现象广泛存在。这就要求计算机进行大量的基于常识知识的推理,由此给语言学的研究带来了巨大困难,致使自然语言处理在大规模真实文本的系统研制方面成绩并不显著。已研制出的一些系统大多是小规模的、研究性的演示系统,远远不能满足实用的要求。因此,构建基于真实语料的大规模语义知识库(或语义词典),就成为实现自然语言语义处理的必要条件。
基于以上认识,20世纪90年代以来,自然语言处理中的概率和约束问题,引发了新一轮对语言理论问题的思考,出现了一批有实用价值的大型语义知识库。这些大型语义知识库在应用领域取得了一定的成绩,但仍然无法突破单句的限制,过多地依赖于统计学方法,这也是现阶段自然语言处理中最主要的瓶颈之一。然而,从理论方法角度看,基于规则的“理性主义”方法,虽然一定程度上制约了建立在“经验主义”基础之上的语义知识库的发展,但是日益出现在“经验主义”方法中的不足,也需要依靠“理性主义”的方法来弥补,两类方法的融合也正是当前自然语言处理发展的趋势。[86]