Hits:
Indexed by:期刊论文
Date of Publication:2007-10-05
Journal:计算机工程
Included Journals:PKU、ISTIC、CSCD
Volume:33
Issue:19
Page Number:276-278
ISSN No.:1000-3428
Key Words:信息检索;网页噪音;页面框架
Abstract:提出了一种基于网页框架和规则的网页去除噪音的新方法,该方法根据网页中HTML标签,<table>将网页分成若干部分,对各个table的长宽比属性进行比较,去掉长宽比很大的部分,并对其余table中的内容进行分析,根据内部是否存在和段落文字有关的标签<p>或<br>等来区分主题内容和噪音内容,在此基础上去除噪音内容.对来自CWT200G语料的132 559个网页进行测试后的结果表明,该方法可以有效地去除网页噪音,使索引文件减少约75%,大大地提高了检索速度,准确度也得到一定提高.