首页 | 本学科首页   官方微博 | 高级检索  
     

分块布局下的主题型网页的内容抽取
引用本文:聂卉,张津华. 分块布局下的主题型网页的内容抽取[J]. 情报学报, 2012, 31(1). DOI: 10.3772/j.issn.1000-0135.2012.01.005
作者姓名:聂卉  张津华
作者单位:中山大学资讯管理学院,广州,510275
摘    要:本篇论文以去除网页噪声,整合网页内容为目标,提出了面向主题型网页,根据网页规划布局抽取网页内容的方法.算法首先分析原始网页的DOM结构生成标签树,再根据标签分类和对应节点的信息对标签树自底向上进行划分,并依据划分块的文字密度,链接密度及图片密度,分类信息块.进一步,提炼网页主题的文本特征向量,采用基于词条空间的文本相似度计算,获取划分块的主题相关度,以主题相关度为量化基准剔除噪声,识别网页主旨内容,重构页面描述.这一算法被应用于面向人才资讯的信息采集项目中,实验表明,算法适用于主题型网页的"去噪"及内容提取,具体应用中有较理想的表现.

关 键 词:网页内容抽取  网页分块  网页去噪

Page Content Extraction Based on Web Page Segmentation
Nie Hui,Zhang Jinhua. Page Content Extraction Based on Web Page Segmentation[J]. Journal of the China Society for Scientific andTechnical Information, 2012, 31(1). DOI: 10.3772/j.issn.1000-0135.2012.01.005
Authors:Nie Hui  Zhang Jinhua
Abstract:
Keywords:
本文献已被 万方数据 等数据库收录!
设为首页 | 免责声明 | 关于勤云 | 加入收藏

Copyright©北京勤云科技发展有限公司  京ICP备09084417号