期刊文献+
共找到1篇文章
< 1 >
每页显示 20 50 100
基于λ-主动学习方法的中文微博分词 被引量:2
1
作者 张婧 黄德根 +2 位作者 黄锴宇 刘壮 孟祥主 《清华大学学报(自然科学版)》 EI CAS CSCD 北大核心 2018年第3期260-265,共6页
由于面向中文微博的分词标注语料相对较少,导致基于传统方法和深度学习方法的中文分词系统在微博语料上的表现效果很差。针对此问题,该文提出一种主动学习方法,从大规模未标注语料中挑选更具标注价值的微博分词语料。根据微博语料的... 由于面向中文微博的分词标注语料相对较少,导致基于传统方法和深度学习方法的中文分词系统在微博语料上的表现效果很差。针对此问题,该文提出一种主动学习方法,从大规模未标注语料中挑选更具标注价值的微博分词语料。根据微博语料的特点,在主动学习迭代过程中引入参数λ来控制所选的重复样例的个数,以确保所选样例的多样性;同时,根据样例中字标注结果的不确定性和上下文的多样性,采用Max、Avg和AvgMax这3种策略衡量样例整体的标注价值;此外,用于主动学习的初始分词器除使用当前字的上下文作为特征外,还利用字向量自动计算当前字成为停用字的可能性作为模型的特征。实验结果表明:该方法的F值比基线系统提高了0.84%~1.49%,比目前最优的基于词边界标注(wordboundaryannotation,wBA)的主动学习方法提升效果更好。 展开更多
关键词 文字信息处理 中文分词 主动学习 样例多样性 微博语料
原文传递
上一页 1 下一页 到第
使用帮助 返回顶部