基于分块和统计相结合的新闻正文抽取
2010-01-30分类号:TP391.1
【部门】南京师范大学教育科学院
【摘要】本文提出一种结合网页分块与统计的方法来抽取新闻类网页中的正文。首先,在网页解析的基础上根据标签信息对网页进行分块处理,并计算出每一个内容块的实际长度;其次,在得到内容块的长度集合后,计算这些内容块长度的均值,同时利用方差能反映一组数据的波动大小的特性,按内容块长度降序排列并依次计算去掉最大内容块后的方差变化情况,寻找最有可能的正文内容块;最后随机选取了一些新闻网页进行测试,结果显示准确率可达96%,充分证明了该方法的有效性。
【关键词】数据挖掘 网页分块 数学期望 正文抽取
【基金】全国教育科学“十一五”规划2009年度教育部青年专项课题“网络课程使用现状自动量化评价系统研究”的成果之一,项目编号:ECA090441
【所属期刊栏目】情报理论与实践
文献传递