Current position: Home >> Scientific Research >> Paper Publications

网页正文信息抽取新方法

Release Time:2019-03-10  Hits:

Indexed by: Journal Article

Date of Publication: 2009-07-15

Journal: 大连理工大学学报

Included Journals: Scopus、CSCD、ISTIC、PKU、EI

Volume: 49

Issue: 4

Page Number: 594-597

ISSN: 1000-8608

Key Words: 包装器;HTML树;网页信息提取

Abstract: 基于包装器的信息抽取方法只能处理一种特定的信息源,而且对网页结构的依赖性强.基于此提出了一种将中文标点符号和HTML树结构作为识别网页正文内容重要特征的网页分析方法,通过统计中文标点符号确定部分正文信息,然后根据正文信息在结构上的相似性确定其他正文信息内容.实验结果表明该方法能有效地剔除网页噪音并提取网页正文,具有较好的通用性和较高的准确性.

Prev One:Local Isolation Coefficient-Based Outlier Mining Algorithm

Next One:HTML Tree Parsing Algorithm Based on Pre-extracted Data