提出了一种基于条件随机场(Conditional Random Fields,简称CRF)的中文分词方法。CRF模型利用词的上下文信息,对歧义词和未登陆词进行分词统计处理取得了理想的效果。以SIGHAN2006 Chinese Language ProcessingBakeoff提供的数据作为实...提出了一种基于条件随机场(Conditional Random Fields,简称CRF)的中文分词方法。CRF模型利用词的上下文信息,对歧义词和未登陆词进行分词统计处理取得了理想的效果。以SIGHAN2006 Chinese Language ProcessingBakeoff提供的数据作为实验数据。实验数据表明,基于CRF的中文分词方法取得了很好的效果,在Uppen,Msra两种语料的封闭测试中准确率分别达到了95.8%和95.9%。展开更多
文摘提出了一种基于条件随机场(Conditional Random Fields,简称CRF)的中文分词方法。CRF模型利用词的上下文信息,对歧义词和未登陆词进行分词统计处理取得了理想的效果。以SIGHAN2006 Chinese Language ProcessingBakeoff提供的数据作为实验数据。实验数据表明,基于CRF的中文分词方法取得了很好的效果,在Uppen,Msra两种语料的封闭测试中准确率分别达到了95.8%和95.9%。