论文类型:期刊论文
发表刊物:大连理工大学学报
收录刊物:Scopus、CSCD、ISTIC、PKU、EI
卷号:50
期号:6
页面范围:1028-1034
ISSN号:1000-8608
关键字:中文词法分析;一体化模型;最长次长匹配;未登录词;切分有向图
摘要:针对当前大多数词法分析系统"流水线"式处理方式存在的不足,提出一种一体化同步词法分析机制.在最长次长匹配分词的基础上,在切分有向图中增加词性信息和候选未登录词节点,并拓展隐马尔可夫模型,在切分有向图内同步完成分词、歧义消解、未登录词识别和词性标注等词法分析任务.实现了分词与词性标注的一体化、未登录词识别与分词的一体化以及不确定词性未登录词处理的一体化.一体化机制使词法分析中各步骤实现真正意义上的同步完成,充分利用上下文词法信息提高整体精度并保证了系统的高效性,避免了各步骤间的冲突.开放测试表明,系统综合测试的F值为98.03%.
