分词技术研究报告.docx-得力文库

资源描述

《分词技术研究报告.docx》由会员分享，可在线阅读，更多相关《分词技术研究报告.docx（8页珍藏版）》请在得力文库 - 分享文档赚钱的网站上搜索。

1、分词技术研究报告探讨内容目前，国内的每个行业、领域都在飞速发展，这中间产生了大量的中文信息资源，为了能够刚好精确的获得最新的信息，中文搜寻引擎是必定的产物。中文搜寻引擎与西文搜寻引擎在实现的机制和原理上大致雷同，但由于汉语本身的特点，必需引入对于中文语言的处理技术，而汉语自动分词技术就是其中很关键的部分。汉语自动分词究竟对搜寻引擎有多大影响？对于搜寻引擎来说，最重要的并不是找到全部结果，最重要的是把最相关的结果排在最前面，这也称为相关度排序。中文分词的精确与否，经常干脆影响到对搜寻结果的相关度排序。分词精确性对搜寻引擎来说非常重要，但假如分词速度太慢，即使精确性再高，对于搜寻引擎来说也是不行

2、用的，因为搜寻引擎须要处理数以亿计的网页，假如分词耗用的时间过长，会严峻影响搜寻引擎内容更新的速度。因此对于搜寻引擎来说，分词的精确性和速度，二者都须要达到很高的要求。探讨汉语自动分词算法，对中文搜寻引擎的发展具有至关重要的意义。快速精确的汉语自动分词是高效中文搜寻引擎的必要前提。本课题探讨中文搜寻引擎中汉语自动分词系统的设计与实现，从目前中文搜寻引擎的发呈现状动身，引出中文搜寻引擎的关键技术-汉语自动分词系统的设计。首先探讨和比较了几种典型的汉语自动分词词典机制，指出各词典机制的优缺点，然后分析和比较了几种主要的汉语自动分词方法，阐述了各种分词方法的技术特点。针对课题的详细应用领域，提出改进

3、词典的数据结构，依据汉语中二字词较多的特点，通过快速推断二字词来优化速度；分析中文搜寻引擎下歧义处理和未登陆词处理的技术，提出了适合本课题的自动分词算法，并给出该系统的详细实现。最终对系统从分词速度和分词精确性方面进行了性能评价。本课题的探讨将促进中文搜寻引擎和汉语自动分词新的发展。二、汉语自动分词系统的探讨现状1、几个早期的自动分词系统自80年头初中文信息处理领域提出了自动分词以来，一些好用性的分词系统逐步得以开发，其中几个比较有代表性的自动分词系统在当时产生了较大的影响。CDWS分词系统是我国第一个好用的自动分词系统，由北京航空航天高校计算机系于年设计实现，它采纳的自动分词方法为最大匹配法

4、，协助以词尾字构词纠错技术。其分词速度为5-10字/秒，切分精度约为1/625。ABWS是山西高校计算机系研制的自动分词系统，系统运用“两次扫描联想-回溯”方法，运用了较多的词法、句法等学问。其切分正确率为98.6%(不包括特别用、未登录的专用名词)，运行速度为48词/分钟。CASS是北京航空航天高校于1年实现的分词系统。它运用正向增字最大匹配，运用学问库来处理歧义字段。其机械分词速度为200字/秒以上，学问库分词速度150字/秒（没有完全实现）。书面汉语自动分词专家系统是由北京师范高校现代教化探讨所于1991前后研制实现的，它首次将专家系统方法完整地引入到分词技术中。2、清华高校SEG分词系

5、统此系统供应了带回溯的正向、反向、双向最大匹配法和全切分-评价切分算法，由用户来选择合适的切分算法。其特点则是带修剪的全切分-评价算法。经过封闭试验，在多遍切分之后，全切分-评价算法的精度可以达到99%左右。3、清华高校SEGTAG系统此系统着眼于将各种各类的信息进行综合，以便最大限度地利用这些信息提高切分精度。系统运用有向图来集成各种各样的信息。通过试验，该系统的切分精度基本上可达到99%左右，能够处理未登录词比较密集的文本,切分速度约为30字/秒。4、国家语委文字所应用句法分析技术的汉语自动分词此分词模型考虑了句法分析在自动分词系统中的作用，以更好地解决切分歧义。切词过程考虑到了全部的切分

6、可能，并运用汉语句法等信息从各种切分可能中选择出合理的切分结果。5、复旦分词系统此系统由四个模块构成。一、预处理模块，利用特别的标记将输入的文本分割成较短的汉字串，这些标记包括标点符号、数字、字母等非汉字符，还包括文本中常见的一些字体、字号等排版信息。二、歧义识别模块，运用正向最小匹配和逆向最大匹配对文本进行双向扫描，假如两种扫描结果相同，则认为切分正确，否则就判别其为歧义字段，须要进行歧义处理；三、歧义字段处理模块，此模块运用构词规则和词频统计信息来进行排歧。最终，此系统还包括一个未登录词识别模块，试验过程中，对中文姓氏的自动辨别达到了70%的精确率。系统对文本中的地名和领域专有词汇也进行了

7、肯定的识别。6、哈工大统计分词系统此系统能够利用上下文识别大部分生词，解决一部分切分歧义。经测试，此系统的分词错误率为1.5%，速度为236字/秒。7、杭州高校改进的MM分词系统系统的词典采纳一级首字索引结构，词条中包括了“非连续词”（形如C1*Cn）。系统精度的试验结果为95%，低于理论值99.73%，但高于通常的MM、RMM、DMM方法。8、MicrosoftResearch汉语句法分析器中的自动分词微软探讨院的自然语言探讨所在从90年头初起先开发了一个通用型的多国语言处理平台NLPWin，据报道，NLPWin的语法分析部分运用的是一种双向的ChartParsing，运用了语法规则并以概率

8、模型作导向，并且将语法和分析器独立开。试验结果表明，系统可以正确处理85%的歧义切分字段，在Pentium200PC上的速度约600-900字/秒。9、北大计算语言所分词系统本系统由北京高校计算语言学探讨所研制开发，属于分词和词类标注相结合的分词系统。系统的分词连同标注的速度在Pentium133Hz/16MB内存机器上的达到了每秒3千词以上，而在PentiumII/64MB内存机器上速度高达每秒5千词。三、主要的自动分词算法现有的分词算法主要可分为三大类：基于字符串匹配的分词方法、基于理解的分词方法和基于统计的分词方法。1、基于字符串匹配的分词方法这种方法又叫做机械分词方法，它是根据肯定的策

9、略将待分析的汉字串与一个“充分大的”机器词典中的词条进行配，若在词典中找到某个字符串，则匹配胜利（识别出一个词）。根据扫描方向的不同，串匹配分词方法可以分为正向匹配和逆向匹配；根据不同长度优先匹配的状况，可以分为最大（最长）匹配和最小（最短）匹配；根据是否与词性标注过程相结合，又可以分为单纯分词方法和分词与标注相结合的一体化方法。常用的几种机械分词方法如下；1正向最大匹配2逆向最大匹配3最少切分（使每一句中切出的词数最小）还可以将上述各种方法相互组合，例如，可以将正向最大匹配方法和逆向最大匹配方法结合起来构成双向匹配法。由于汉语单字成词的特点，正向最小匹配和逆向最小匹配一般很少运用。一般说来，

10、逆向匹配的切分精度略高于正向匹配，遇到的歧义现象也较少。统计结果表明，单纯运用正向最大匹配的错误率为1/169，单纯运用逆向最大匹配的错误率为1/245。但这种精度还远远不能满意实际的须要。由于分词是一个智能决策过程，机械分词方法无法解决分词阶段的两大基本问题：歧义切分问题和未登录词识别问题。实际运用的分词系统，都是把机械分词作为一种初分手段，还需通过利用各种其它的语言信息来进一步提高切分的精确率。一种方法是改进扫描方式，称为特征扫描或标记切分，优先在待分析字符串中识别和切分出一些带有明显特征的词，以这些词作为断点，可将原字符串分为较小的串再来进机械分词，从而削减匹配的错误率。另一种方法是将分

11、词和词类标注结合起来，利用丰富的词类信息对分词决策供应帮助，并且在标注过程中又反过来对分词结果进行检验、调整，从而极大地提高切分的精确率。对于机械分词方法，可以建立一个一般的模型，形式地表示为ASM(d,a,m)，即AutomaticSegmentationModel。其中，d：匹配方向，+1表示正向，-1表示逆向；a：每次匹配失败后增加/削减字串长度（字符数），+1为增字，-1为减字；m：最大/最小匹配标记，+1为最大匹配，-1为最小匹配。例如，ASM(+,-,+)就是正向减字最大匹配法（即MM方法），ASM(-,-,+)就是逆向减字最大匹配法(即RMM方法)，等等。对于现代汉语来说，只有m

12、=+1是好用的方法。用这种模型可以对各种方法的困难度进行比较，假设在词典的匹配过程都运用依次查找和相同的计首字索引查找方法，则在不记首字索引查找次数（最小为log<汉字总数>»1214）和词典读入内存时间的状况下，对于典型的词频分布，减字匹配ASM(d,-,m)的困难度约为12.3次，增字匹配ASM(d,+,m)的困难度约为10.6。2、基于理解的分词方法通常的分析系统，都力图在分词阶段消退全部歧义切分现象。而有些系统则在后续过程中来处理歧义切分问题，其分词过程只是整个语言理解过程的一小部分。其基本思想就是在分词的同时进行句法、语义分析，利用句法信息和语义信息来处理歧义现象。它通常包括三个部分：分词子系统、句法语义子系统、总控部分。在总控部分的协调下，分词子系统可以获得有关词、句子等的句法和语义信息来对分词歧义进行推断，即它模拟了人对句子的理解过程。这种分词方法须要运用大量的语言学问和信息。由于汉语语言学问的笼统、困难性，难以将各种语言信息组织成机器可干脆读取的形式，因此目前基于理解的分词系统还处在试验阶段。

展开阅读全文