期刊文献+

融合全局词语边界特征的中文命名实体识别方法 被引量:6

Chinese Named Entity RecognitionIncorporating Global Word Boundary Features
下载PDF
导出
摘要 目前在中文命名实体识别的任务中经常采用有监督的字序列标注模型。我们在实际应用中发现,基于字序列标注模型的中文命名实体识别模型对于词语边界的识别错误是影响识别效果的主要因素之一,边界错误平均占错误结果中的47.5%。该文通过在平均感知机模型中引入全局的词语边界特征,使得人名、地名、机构名识别的F值平均提升了0.04并降低了边界错误占错误结果的比例。 Supervised character sequence labeling model is a popular method in Chinese named entity recognition (NER) task. It is found in practice suffering from word boundary error, covering roughly 47.5% of all errors. This paper incorporates global words boundary features in averaged perceptron model. Experiments indicate that the F value of recognizing people name, location names and organization names is improved by 0.04, reducing the proportion of boundary errors in overall errors.
出处 《中文信息学报》 CSCD 北大核心 2017年第2期86-91,共6页 Journal of Chinese Information Processing
基金 国家自然科学基金(61232010 61100083) 国家973课题(2012CB316303) 国家863课题(2012AA011003) 国家科技支撑计划(2012BAH46B04) 国家安全专项(2013A140)
关键词 命名实体识别 字序列标注 全局特征 词语边界特征 named entity recognition sequence labeling global feature word boundary feature
  • 相关文献

同被引文献47

引证文献6

二级引证文献87

相关作者

内容加载中请稍等...

相关机构

内容加载中请稍等...

相关主题

内容加载中请稍等...

浏览历史

内容加载中请稍等...
;
使用帮助 返回顶部