期刊文献+
共找到13篇文章
< 1 >
每页显示 20 50 100
汉字种子混淆集的构建方法研究 被引量:7
1
作者 施恒利 刘亮亮 +3 位作者 王石 符建辉 张再跃 曹存根 《计算机科学》 CSCD 北大核心 2014年第8期229-232,253,共5页
汉字混淆集是错别字识别中的重要资源之一。在本项研究中,首先手工整理了11935个汉字的可能的错别字,然后以这些汉字为节点、"可错成"关系为边,将混淆集构造成一个错别字混淆集图。由于人工总结错别字具有很大的局限性,因此... 汉字混淆集是错别字识别中的重要资源之一。在本项研究中,首先手工整理了11935个汉字的可能的错别字,然后以这些汉字为节点、"可错成"关系为边,将混淆集构造成一个错别字混淆集图。由于人工总结错别字具有很大的局限性,因此在种子错别字混淆集图的基础上,设计了自扩展算法和开源外部补充算法来对错别字混淆集图进行扩展,以发现新的错别字对。根据实验,新发现了15133组错别字对。经过随机抽样校对,准确率达到87.35%。 展开更多
关键词 错别字混淆集 自扩展 开源数据 基于规则和统计
下载PDF
基于指针网络融入混淆集知识的中文语法纠错 被引量:3
2
作者 李嘉诚 沈嘉钰 +2 位作者 龚晨 李正华 张民 《中文信息学报》 CSCD 北大核心 2022年第4期29-38,共10页
在中文语法纠错(CGEC)任务上,虽然替换类错误在数据集中占比最多,但还没有研究者尝试过将音近和形近知识融入基于神经网络的语法纠错模型中。针对这一问题,该文做了两方面的尝试。首先,该文提出了一种基于指针网络融入混淆集知识的语法... 在中文语法纠错(CGEC)任务上,虽然替换类错误在数据集中占比最多,但还没有研究者尝试过将音近和形近知识融入基于神经网络的语法纠错模型中。针对这一问题,该文做了两方面的尝试。首先,该文提出了一种基于指针网络融入混淆集知识的语法纠错模型。具体而言,该模型在序列到编辑(Seq2Edit)语法纠错模型基础上,利用指针网络融入汉字之间的音近和形近知识。其次,在训练数据预处理阶段,即从错误-正确句对抽取编辑序列过程中,该文提出一种混淆集指导的编辑距离算法,从而更好地抽取音近和形近字的替换类编辑。实验结果表明,该文提出的两点改进均能提高模型性能,且作用互补;该文所提出的模型在NLPCC 2018评测数据集上达到了目前最优性能。实验分析表明,与基准Seq2Edit语法纠错模型相比,该文模型的性能提升大部分来自于替换类错误的纠正。 展开更多
关键词 语法纠错 混淆集 指针网络
下载PDF
基于RoBERTa-wwm-ext与混淆集的中文文本校对模型
3
作者 徐久珺 黄国栋 马传香 《湖北大学学报(自然科学版)》 CAS 2023年第5期712-718,共7页
中文文本自动校对技术是自然语言处理领域中的主要任务之一.针对中文文本中字粒度级别的错误(音似、形似和义似替换错误),提出一种基于RoBERTa-wwm-ext与混淆集的中文文本校对模型.该模型在RoBERTa-wwm-ext结构的基础上,利用transforme... 中文文本自动校对技术是自然语言处理领域中的主要任务之一.针对中文文本中字粒度级别的错误(音似、形似和义似替换错误),提出一种基于RoBERTa-wwm-ext与混淆集的中文文本校对模型.该模型在RoBERTa-wwm-ext结构的基础上,利用transformer结构中的encoder机制读取整段中文文本序列,然后通过softmax函数计算当前字符权重分布来判断该字符是否错误,并在纠错任务中引入混淆集,使用混淆集找到该错字对应的候选字符,最后结合掩码语言模型给出的修改建议,完成文本校对.在SIGHAN2014与SIGHAN2015中文拼写检查数据集上,设计字粒度级别的中文文本校对实验,对比模型性能.实验结果表明,与当前主流的中文文本校对模型相比,该模型的中文文本校对效果表现更佳,文本校对的准确率、召回率、F1值均有所提升. 展开更多
关键词 自然语言处理 掩码语言模型 RoBERTa-wwm-ext 混淆集 transformer结构
下载PDF
英文作文的自动拼写检查研究 被引量:5
4
作者 李斌 姚建民 朱巧明 《郑州大学学报(理学版)》 CAS 2008年第3期48-51,共4页
基于自动拼写检查的研究现状,将英文作文中的拼写错误进行了分类,并分别采用规则匹配和统计建模的方法对单词的非词错误和真词错误进行了研究,从而扩大了对英文单词进行拼写检查的研究范围.真词错误检查主要是利用贝叶斯定理,并通过建... 基于自动拼写检查的研究现状,将英文作文中的拼写错误进行了分类,并分别采用规则匹配和统计建模的方法对单词的非词错误和真词错误进行了研究,从而扩大了对英文单词进行拼写检查的研究范围.真词错误检查主要是利用贝叶斯定理,并通过建立一些特定的混淆集的方法来实现.通过实验数据分析,该系统的准确率达到了80%以上. 展开更多
关键词 拼写检查 真词错误 非词错误 贝叶斯定理 混淆集
下载PDF
基于局部上下文特征的组合的中文真词错误自动校对研究 被引量:8
5
作者 刘亮亮 曹存根 《计算机科学》 CSCD 北大核心 2016年第12期30-35,共6页
中文的真词错误类似于英文的真词错误,指一个中文词错成另一个词典中的词。提出一种基于混淆集的真词错误发现方法,通过对目标词的局部特征的提取,形成局部左邻接二元、右邻接二元及3个三元特征,然后通过和目标词对应的混淆集中的混淆... 中文的真词错误类似于英文的真词错误,指一个中文词错成另一个词典中的词。提出一种基于混淆集的真词错误发现方法,通过对目标词的局部特征的提取,形成局部左邻接二元、右邻接二元及3个三元特征,然后通过和目标词对应的混淆集中的混淆词来估计二元概率和三元概率。最后提出一种多特征融合的模型,然后利用规则来判断中文文本中的真词错误。将查错结果分为标记错误和更改错误两种类型,采用18组混淆集,构造2万行的测试语料进行实验。实验表明,该方法能有效地发现中文文本中的真词错误,并且能给出真词错误的修改建议。该方法是一种集自动查错和自动纠错于一体的中文文本自动校对方法。 展开更多
关键词 真词错误 混淆集 上下文特征 NGram模型
下载PDF
基于BiLSTM-CRF的中文分组单字错误识别方法研究 被引量:5
6
作者 曹阳 曹存根 +1 位作者 资康莉 王石 《中文信息学报》 CSCD 北大核心 2023年第4期156-165,共10页
近十多年来,中文自动校对取得了许多重要进展,但是单字错别字识别精度和召回率低一直是该领域的一个重要问题。该文提出一种基于BiLSTM-CRF的神经网络模型和单字分组策略识别中文错别字的方法。首先,该文提出一种构建分组单字混淆集的方... 近十多年来,中文自动校对取得了许多重要进展,但是单字错别字识别精度和召回率低一直是该领域的一个重要问题。该文提出一种基于BiLSTM-CRF的神经网络模型和单字分组策略识别中文错别字的方法。首先,该文提出一种构建分组单字混淆集的方法,并根据采集的分组单字混淆集自动生成错别字识别训练语料,构造了一个含有13组的汉字单字错别字识别训练语料。其次,针对传统的错别字识别方法在单字错别字召回率较低的问题,该文对错别字识别训练语料中错别字采用多标签标记的策略。再次,针对训练样本存在的数据稀疏问题,该文对训练数据集中的人名、地名、时间和机构名称这四类词语进行抽象。最后,该文利用BiLSTM-CRF的模型在错别字识别训练语料上进行训练。实验结果表明,该文提出的单字错别字识别方法在13组单字上的平均识别精确率为87.30%,平均召回率为84.36%。 展开更多
关键词 BiLSTM-CRF 分组策略 分组单字混淆集 错别字识别训练语料
下载PDF
面向新媒体领域的错别字自动校对 被引量:3
7
作者 龚永罡 汪昕宇 +1 位作者 付俊英 王蕴琪 《信息技术与信息化》 2018年第10期73-75,共3页
新媒体平台每天原创新闻发布量巨大,采用人工审核内容中的错别字已经不切实际。本文提出了一种基于n-gram模型与规则相结合的方法,采集上亿篇新闻文章作为训练语料,对分词后的语料进行统计分析形成三元n-gram模型库,基于上下文语境构建... 新媒体平台每天原创新闻发布量巨大,采用人工审核内容中的错别字已经不切实际。本文提出了一种基于n-gram模型与规则相结合的方法,采集上亿篇新闻文章作为训练语料,对分词后的语料进行统计分析形成三元n-gram模型库,基于上下文语境构建错别字混淆集,通过最优化方法计算混淆词在目标场景中的支持度,有效实现错别字的自动检查与纠错。实验结果显示,文章查错召回率为78.9%,准确率为85.1%,具有重要的实际意义和广泛的应用领域。 展开更多
关键词 N-GRAM模型 混淆集 支持度 错别字
下载PDF
基于上下文的真词错误检查及校对方法 被引量:5
8
作者 陆玉清 洪宇 +2 位作者 陆军 姚建民 朱巧明 《中文信息学报》 CSCD 北大核心 2011年第1期85-90,共6页
英文文本中的真词错误即输入的错词是和原词相似的另一个有效词。该文主要研究了对该类错误的检测。通过从所要检测的单词的上下文中提取句法和语义两个方面的特征,运用文档频率和信息增益进行特征筛选,实现了对上下文特征的有效提取。... 英文文本中的真词错误即输入的错词是和原词相似的另一个有效词。该文主要研究了对该类错误的检测。通过从所要检测的单词的上下文中提取句法和语义两个方面的特征,运用文档频率和信息增益进行特征筛选,实现了对上下文特征的有效提取。最终把判断该单词使用的正确与否看作分类问题,使用Winnow分类算法进行训练和测试。通过5阶交叉验证,所收集的61组混淆集的平均正确率与召回率分别为96%,79.47%。 展开更多
关键词 真词错误 特征筛选 混淆集 WINNOW算法
下载PDF
基于CSSCI的文本自动校对系统的构建与实现 被引量:2
9
作者 王斯宇 邵波 《高校图书馆工作》 CSSCI 2014年第6期50-54,共5页
随着计算机技术的发展与数字资源建设的不断跟进,大量的纸质文献需要进行数字转化为电子文献,电子文献逐渐成为信息资源的重要组成部分。电子文献的普及和广泛应用,使得针对电子文献的自动校对系统的研究应运而生。文章在调研了国内外... 随着计算机技术的发展与数字资源建设的不断跟进,大量的纸质文献需要进行数字转化为电子文献,电子文献逐渐成为信息资源的重要组成部分。电子文献的普及和广泛应用,使得针对电子文献的自动校对系统的研究应运而生。文章在调研了国内外相关的文本自动校对相关研究之后,结合CSSCI数据库的实际情况,构建了一个基于混淆集和上下文特征分析的文本自动校对系统模型,并进行了其相关的实验。 展开更多
关键词 CSSCI 文本自动校对 上下文特征分析 混淆集
下载PDF
一种中文真词错误检测与修复方法 被引量:3
10
作者 叶俊民 徐松 +2 位作者 罗达雄 王志锋 陈曙 《计算机工程》 CAS CSCD 北大核心 2019年第8期178-183,共6页
在线学习社区中的中文真词错误会给中文文本语义的理解带来困难,从而影响基于在线学习社区文本的学习分析效果。为此,提出一种针对在线学习社区短文本的真词错误检测与修复方法。构建混淆词集和混淆词对应的固定搭配知识库,基于n-gram... 在线学习社区中的中文真词错误会给中文文本语义的理解带来困难,从而影响基于在线学习社区文本的学习分析效果。为此,提出一种针对在线学习社区短文本的真词错误检测与修复方法。构建混淆词集和混淆词对应的固定搭配知识库,基于n-gram概率统计模型、上下文语境模型和固定搭配知识库,分别计算每一个混淆词的 n-gram得分、上下文语境得分和固定搭配得分,对其加权求和作为判断原文是否出错的依据,并将最高得分的混淆词作为修复意见。实验结果表明,该方法召回率、准确率与修复率分别为85.6 %、86.3 %、92.9 %,能准确有效检测与修复学习社区中的中文真词错误。 展开更多
关键词 真词错误 混淆 n-gram概率统计模型 上下文语境 中文固定搭配
下载PDF
基于字串切分统计词典的繁体中文拼写检错方法
11
作者 王勇 顾磊 《计算机应用研究》 CSCD 北大核心 2016年第5期1370-1373,1378,共5页
针对繁体中文拼写检错的问题进行了研究,提出一种基于字串切分统计词典的检错方法。利用语料库中字串出现的频率信息作为检错依据,根据字串及其频率信息来建立统计词典,并设计了基于统计规则评判的检错算法。以SIGHAN7会议中文拼写校验... 针对繁体中文拼写检错的问题进行了研究,提出一种基于字串切分统计词典的检错方法。利用语料库中字串出现的频率信息作为检错依据,根据字串及其频率信息来建立统计词典,并设计了基于统计规则评判的检错算法。以SIGHAN7会议中文拼写校验任务中用于检错评测的1 000句测试集作为实验测试集,并与此会议提交的结果进行比较,实验结果表明,与基于复杂语言模型的检错方法相比,该方法在实现简单的同时也有很好的检错效果,获得了较高的准确率和精确率以及较低的误报率。 展开更多
关键词 中文语言处理 繁体中文拼写检错 中文分词 字串切分 统计词典 混淆集
下载PDF
基于统计和特征相结合的查询纠错方法研究 被引量:3
12
作者 段建勇 关晓龙 《现代图书情报技术》 CSSCI 2016年第2期34-42,共9页
【目的】提高搜索引擎查询纠错过程中的准确率和召回率,改善用户的检索体验。【方法】提出一种基于统计和特征相结合的查询纠错模型,建立混淆集生成模型,将用户输入的查询关键字生成其对应的混淆集;建立混淆集排序模型,对混淆集中的词... 【目的】提高搜索引擎查询纠错过程中的准确率和召回率,改善用户的检索体验。【方法】提出一种基于统计和特征相结合的查询纠错模型,建立混淆集生成模型,将用户输入的查询关键字生成其对应的混淆集;建立混淆集排序模型,对混淆集中的词条进行排序,选出混淆集中最佳的词条与用户输入的查询关键字对照,以此达到查错纠错的目的。【结果】实验结果证明该模型在搜索引擎查询时具有较好的效果,测试集在110k时的准确率和召回率分别达到92.2%和95%,相对于N-gram纠错模型准确率和召回率分别提高13.6%和8.3%。【局限】该模型中混淆集的生成规则有限、模型的训练需要大量的计算。【结论】本模型能够提高搜索引擎查询的准确率及效率,改善用户的检索体验。 展开更多
关键词 查询纠错 混淆集 N-GRAM模型 N-gram相似度 编辑距离 点击词频
原文传递
自动校对渐入佳境 被引量:1
13
作者 杜飞龙 《微电脑世界》 2001年第7期24-26,共2页
中文自动校对是近几年兴起的一个热门研究课题。随着出版业电子化的迅猛发展,校对环节的工作量大大增加,自动校对的课题因此被提到日程上来。除了出版业之外,自动校对的技术还可以应用在语音输入、汉字识别、文本编辑和计算机辅助教学... 中文自动校对是近几年兴起的一个热门研究课题。随着出版业电子化的迅猛发展,校对环节的工作量大大增加,自动校对的课题因此被提到日程上来。除了出版业之外,自动校对的技术还可以应用在语音输入、汉字识别、文本编辑和计算机辅助教学等领域。 展开更多
关键词 自动校对 课题 真词错误 中文文本 字串 混淆集 特征模板 语言模型
原文传递
上一页 1 下一页 到第
使用帮助 返回顶部