宋明秋

个人信息Personal Information

副教授

硕士生导师

主要任职:Associate Professor

其他任职:中国软件行业协会系统安全工程分会主任,国际注册信息安全专家CISSP,国际注册信息系统审计师CISA

性别:女

毕业院校:大连理工大学

学位:博士

所在单位:系统工程研究所

学科:管理科学与工程. 系统工程

办公地点:D526, Management Building,No.2 Linggong Road,Dalian China 116024

联系方式:songmq at dlut.edu.cn,

扫描关注

论文成果

当前位置: 中文主页 >> 科学研究 >> 论文成果

网页正文信息抽取新方法

点击次数:

论文类型:期刊论文

发表时间:2009-07-15

发表刊物:大连理工大学学报

收录刊物:EI、PKU、ISTIC、CSCD、Scopus

卷号:49

期号:4

页面范围:594-597

ISSN号:1000-8608

关键字:包装器;HTML树;网页信息提取

摘要:基于包装器的信息抽取方法只能处理一种特定的信息源,而且对网页结构的依赖性强.基于此提出了一种将中文标点符号和HTML树结构作为识别网页正文内容重要特征的网页分析方法,通过统计中文标点符号确定部分正文信息,然后根据正文信息在结构上的相似性确定其他正文信息内容.实验结果表明该方法能有效地剔除网页噪音并提取网页正文,具有较好的通用性和较高的准确性.