location: Current position: Home >> Scientific Research >> Paper Publications

基于网页框架和规则的网页噪音去除方法

Hits:

Indexed by:期刊论文

Date of Publication:2007-10-05

Journal:计算机工程

Included Journals:PKU、ISTIC、CSCD

Volume:33

Issue:19

Page Number:276-278

ISSN No.:1000-3428

Key Words:信息检索;网页噪音;页面框架

Abstract:提出了一种基于网页框架和规则的网页去除噪音的新方法,该方法根据网页中HTML标签,<table>将网页分成若干部分,对各个table的长宽比属性进行比较,去掉长宽比很大的部分,并对其余table中的内容进行分析,根据内部是否存在和段落文字有关的标签<p>或<br>等来区分主题内容和噪音内容,在此基础上去除噪音内容.对来自CWT200G语料的132 559个网页进行测试后的结果表明,该方法可以有效地去除网页噪音,使索引文件减少约75%,大大地提高了检索速度,准确度也得到一定提高.

Pre One:Improving the performance of bio-entity name recognition in biomedical literature via the contextual cues

Next One:Opinion mining in e-learning system