李文立
个人信息Personal Information
教授
博士生导师
硕士生导师
性别:男
毕业院校:大连理工大学
学位:博士
所在单位:信息管理与信息系统研究所
学科:管理科学与工程
办公地点:管理与经济学部D501
电子邮箱:wlli@dlut.edu.cn
扫描关注
网页正文信息抽取新方法
点击次数:
论文类型:期刊论文
发表时间:2009-07-15
发表刊物:大连理工大学学报
收录刊物:EI、PKU、ISTIC、CSCD、Scopus
卷号:49
期号:4
页面范围:594-597
ISSN号:1000-8608
关键字:包装器;HTML树;网页信息提取
摘要:基于包装器的信息抽取方法只能处理一种特定的信息源,而且对网页结构的依赖性强.基于此提出了一种将中文标点符号和HTML树结构作为识别网页正文内容重要特征的网页分析方法,通过统计中文标点符号确定部分正文信息,然后根据正文信息在结构上的相似性确定其他正文信息内容.实验结果表明该方法能有效地剔除网页噪音并提取网页正文,具有较好的通用性和较高的准确性.