结合语义知识的藏文网页主题句抽取算法研究

2017-08-30分类号：TP391.1

【作者】艾金勇

【部门】西藏民族大学图书馆

【摘要】通过分析总结藏文网页的结构特征,在借鉴汉语主题句抽取方法的基础上,提出了结合语义信息的藏文网页主题句抽取算法。该方法根据藏文文本特征实现了网页内容的智能识别,同时,在对识别的文本块进行自动分词后,利用改进TF-IDF方法结合主题词的语义相关性确定了网页文本的主题词,并据此构建了候选主题句集,再通过候选主题句的重要度和分布度计算得到了候选主题句的权值。最后对所有候选主题句按权值大小排序并确定了文本的主题句。

【关键词】藏文网页语义信息主题句抽取

【基金】西藏自治区高校青年教师创新支持计划项目“基于藏文Web文本的关联知识挖掘方法研究”(项目编号:QCZ2016—44);; 西藏自治区自然科学基金项目“基于语义的藏文百科知识问答系统关键技术的研究”(项目编号:2016ZR-MY-04)的阶段性研究成果

【所属期刊栏目】图书馆理论与实践

文献传递