location: Current position: Home >> Scientific Research >> Paper Publications

基于最长次长匹配分词的一体化中文词法分析

Hits:

Indexed by:期刊论文

Date of Publication:2010-11-15

Journal:大连理工大学学报

Included Journals:EI、PKU、ISTIC、CSCD、Scopus

Volume:50

Issue:6

Page Number:1028-1034

ISSN No.:1000-8608

Key Words:中文词法分析;一体化模型;最长次长匹配;未登录词;切分有向图

Abstract:针对当前大多数词法分析系统"流水线"式处理方式存在的不足,提出一种一体化同步词法分析机制.在最长次长匹配分词的基础上,在切分有向图中增加词性信息和候选未登录词节点,并拓展隐马尔可夫模型,在切分有向图内同步完成分词、歧义消解、未登录词识别和词性标注等词法分析任务.实现了分词与词性标注的一体化、未登录词识别与分词的一体化以及不确定词性未登录词处理的一体化.一体化机制使词法分析中各步骤实现真正意义上的同步完成,充分利用上下文词法信息提高整体精度并保证了系统的高效性,避免了各步骤间的冲突.开放测试表明,系统综合测试的F值为98.03%.

Pre One:Chinese POS tagging employing maximum entropy and word clustering

Next One:基于SVM和CRF的双层模型中文机构名识别