标题
  • 标题
  • 作者
  • 关键词

融合语义知识的藏文网页关键词提取方法研究

2017-02-15分类号:TP391.1;TP393.092

【作者】艾金勇  
【部门】西藏民族大学图书馆  
【摘要】文章归纳整理了藏文网页的结构特征,在借鉴中英文关键词抽取方法的基础上,设计实现了融合语义知识的藏文网页关键词抽取算法。该算法利用藏文文本特征实现了网页内容模块的智能识别,在对识别的文本块进行自动分词后,采用改进的TF-IDF算法得到基础词集,然后根据词向量特征进行基础词的语义扩展构建候选关键词集,最后利用候选关键词之间的语义相关度值,确立藏文网页的关键词。藏文网页的实验测试结果表明该方法提取的藏文网页关键词具有较高的准确率。
【关键词】藏文网页  TF-IDF  语义扩展  关键词抽取
【基金】西藏自治区高校青年教师创新支持计划项目“基于藏文Web文本的关联知识挖掘方法研究”(No:QCZ2016—44);; 西藏自治区自然科学基金项目“基于语义的藏文百科知识问答系统关键技术的研究”(No:2016ZR-MY-04)的阶段性成果
【所属期刊栏目】图书馆学研究
文献传递