基于λ-主动学习方法的中文微博分词

2018-03-15分类号：TP391.1

【作者】张婧黄德根黄锴宇刘壮孟祥主

【部门】大连理工大学计算机科学与技术学院

【摘要】由于面向中文微博的分词标注语料相对较少,导致基于传统方法和深度学习方法的中文分词系统在微博语料上的表现效果很差。针对此问题,该文提出一种主动学习方法,从大规模未标注语料中挑选更具标注价值的微博分词语料。根据微博语料的特点,在主动学习迭代过程中引入参数λ来控制所选的重复样例的个数,以确保所选样例的多样性;同时,根据样例中字标注结果的不确定性和上下文的多样性,采用Max、Avg和AvgMax这3种策略衡量样例整体的标注价值;此外,用于主动学习的初始分词器除使用当前字的上下文作为特征外,还利用字向量自动计算当前

【关键词】文字信息处理中文分词主动学习样例多样性微博语料

【基金】

【所属期刊栏目】清华大学学报(自然科学版)

文献传递