期刊文献+
共找到10篇文章
< 1 >
每页显示 20 50 100
基于局部上下文特征的组合的中文真词错误自动校对研究 被引量:8
1
作者 刘亮亮 曹存根 《计算机科学》 CSCD 北大核心 2016年第12期30-35,共6页
中文的真词错误类似于英文的真词错误,指一个中文词错成另一个词典中的词。提出一种基于混淆集的真词错误发现方法,通过对目标词的局部特征的提取,形成局部左邻接二元、右邻接二元及3个三元特征,然后通过和目标词对应的混淆集中的混淆... 中文的真词错误类似于英文的真词错误,指一个中文词错成另一个词典中的词。提出一种基于混淆集的真词错误发现方法,通过对目标词的局部特征的提取,形成局部左邻接二元、右邻接二元及3个三元特征,然后通过和目标词对应的混淆集中的混淆词来估计二元概率和三元概率。最后提出一种多特征融合的模型,然后利用规则来判断中文文本中的真词错误。将查错结果分为标记错误和更改错误两种类型,采用18组混淆集,构造2万行的测试语料进行实验。实验表明,该方法能有效地发现中文文本中的真词错误,并且能给出真词错误的修改建议。该方法是一种集自动查错和自动纠错于一体的中文文本自动校对方法。 展开更多
关键词 真词错误 混淆集 上下文特征 NGram模型
下载PDF
一种中文真词错误检测与修复方法 被引量:3
2
作者 叶俊民 徐松 +2 位作者 罗达雄 王志锋 陈曙 《计算机工程》 CAS CSCD 北大核心 2019年第8期178-183,共6页
在线学习社区中的中文真词错误会给中文文本语义的理解带来困难,从而影响基于在线学习社区文本的学习分析效果。为此,提出一种针对在线学习社区短文本的真词错误检测与修复方法。构建混淆词集和混淆词对应的固定搭配知识库,基于n-gram... 在线学习社区中的中文真词错误会给中文文本语义的理解带来困难,从而影响基于在线学习社区文本的学习分析效果。为此,提出一种针对在线学习社区短文本的真词错误检测与修复方法。构建混淆词集和混淆词对应的固定搭配知识库,基于n-gram概率统计模型、上下文语境模型和固定搭配知识库,分别计算每一个混淆词的 n-gram得分、上下文语境得分和固定搭配得分,对其加权求和作为判断原文是否出错的依据,并将最高得分的混淆词作为修复意见。实验结果表明,该方法召回率、准确率与修复率分别为85.6 %、86.3 %、92.9 %,能准确有效检测与修复学习社区中的中文真词错误。 展开更多
关键词 真词错误 混淆词集 n-gram概率统计模型 上下文语境 中文固定搭配
下载PDF
面向油田领域的中文真词错误自动校对方法研究 被引量:1
3
作者 王辉 Marius Petrescu +3 位作者 潘俊辉 王浩畅 张强 张岩 《计算技术与自动化》 2021年第1期140-143,共4页
中文真词错误自动校对是自然语言理解的一项重要的基础研究课题,油田数字化过程中利用图像识别及人工录入产生的中文真词错误会直接影响后期数据综合分析准确度。对中文真词错误成因和统计语言模型进行分析,提出一种面向油田领域的中文... 中文真词错误自动校对是自然语言理解的一项重要的基础研究课题,油田数字化过程中利用图像识别及人工录入产生的中文真词错误会直接影响后期数据综合分析准确度。对中文真词错误成因和统计语言模型进行分析,提出一种面向油田领域的中文真词错误自动校对方法。该方法首先构建通用领域和油田领域混淆集,再引入同义词集丰富知识库,对语料分词后,综合统计分析目标词与混淆词、周边词的同义词之间关系,自动校对真词错误。实验表明,提出的方法能有效校对油田领域的中文真词错误。 展开更多
关键词 真词错误 N-GRAM 文本自动校对 知识库构建
下载PDF
基于上下文的真词错误检查及校对方法 被引量:5
4
作者 陆玉清 洪宇 +2 位作者 陆军 姚建民 朱巧明 《中文信息学报》 CSCD 北大核心 2011年第1期85-90,共6页
英文文本中的真词错误即输入的错词是和原词相似的另一个有效词。该文主要研究了对该类错误的检测。通过从所要检测的单词的上下文中提取句法和语义两个方面的特征,运用文档频率和信息增益进行特征筛选,实现了对上下文特征的有效提取。... 英文文本中的真词错误即输入的错词是和原词相似的另一个有效词。该文主要研究了对该类错误的检测。通过从所要检测的单词的上下文中提取句法和语义两个方面的特征,运用文档频率和信息增益进行特征筛选,实现了对上下文特征的有效提取。最终把判断该单词使用的正确与否看作分类问题,使用Winnow分类算法进行训练和测试。通过5阶交叉验证,所收集的61组混淆集的平均正确率与召回率分别为96%,79.47%。 展开更多
关键词 真词错误 特征筛选 混淆集 WINNOW算法
下载PDF
基于介词向量的英语真词错误检查算法
5
作者 霍娟娟 吴敏 +3 位作者 吴桂兴 郭燕 陈朝才 杜一民 《计算机系统应用》 2015年第3期193-196,共4页
在基于Winnow算法的基础上引入混淆词和介词搭配的方法.首先通过混淆集获得训练集,对训练集进行预处理后利用文本特征提取方法获得特征词集,然后对特征词集进行Winnow训练得到带有权重的特征词集并把出现在混淆词后的介词提取出来生成... 在基于Winnow算法的基础上引入混淆词和介词搭配的方法.首先通过混淆集获得训练集,对训练集进行预处理后利用文本特征提取方法获得特征词集,然后对特征词集进行Winnow训练得到带有权重的特征词集并把出现在混淆词后的介词提取出来生成介词向量,最后从测试集提取特征并进行结合Winnow算法和混淆词与介词搭配方法的测试得到真词错误检查的结果.混淆词与介词搭配方法的加入使得某些混淆词的正确率、召回率以及F1测度提高了10%~20%,有的甚至提高到了100%. 展开更多
关键词 真词错误 介词 WINNOW
下载PDF
领域问答系统中的文本错误自动发现方法 被引量:19
6
作者 刘亮亮 王石 +2 位作者 王东升 汪平仄 曹存根 《中文信息学报》 CSCD 北大核心 2013年第3期77-83,共7页
文本自动校对是自然语言处理的一个挑战性的研究课题,也是一个难题。该文对中文的错误类型和原因进行分析,提出了一种基于领域问答系统用户问题日志的错别字自动发现方法。该方法首先对语料进行分词,然后对分词的结果中出现的散串进行合... 文本自动校对是自然语言处理的一个挑战性的研究课题,也是一个难题。该文对中文的错误类型和原因进行分析,提出了一种基于领域问答系统用户问题日志的错别字自动发现方法。该方法首先对语料进行分词,然后对分词的结果中出现的散串进行合并,对分词中的多字词和合并的串进行相似词串聚类,对相似词串的上下文语境进行统计分析,从中自动获取错别字对。实验表明,该系统获得71.32%的召回率,82.6%的准确率。 展开更多
关键词 文本自动校对 问答系统 非词错误 真词错误 错别字对
下载PDF
现代藏文音节字自动校对研究 被引量:16
7
作者 关白 才科扎西 《计算机工程与应用》 CSCD 2012年第29期151-156,共6页
在现代藏文自动校对中,对音节字(■)的校对是其基础。现代藏文二维的书写格式和独特的文法,还有格助词的黏着现象、音节字搭配规则和音节字中真词和非词错误等众多问题,使得对藏文自动校对的研究有别于英语和汉语的自动校对。针对现代... 在现代藏文自动校对中,对音节字(■)的校对是其基础。现代藏文二维的书写格式和独特的文法,还有格助词的黏着现象、音节字搭配规则和音节字中真词和非词错误等众多问题,使得对藏文自动校对的研究有别于英语和汉语的自动校对。针对现代藏文中音节字的特点,通过音节字预处理、字表匹配、混淆集匹配、二元接续关系、最小编辑距离法等方法对现代藏文音节字的自动校对进行详细论述。 展开更多
关键词 藏文自动校对 音节字 真词错误 黏着性格助词
下载PDF
英文作文的自动拼写检查研究 被引量:5
8
作者 李斌 姚建民 朱巧明 《郑州大学学报(理学版)》 CAS 2008年第3期48-51,共4页
基于自动拼写检查的研究现状,将英文作文中的拼写错误进行了分类,并分别采用规则匹配和统计建模的方法对单词的非词错误和真词错误进行了研究,从而扩大了对英文单词进行拼写检查的研究范围.真词错误检查主要是利用贝叶斯定理,并通过建... 基于自动拼写检查的研究现状,将英文作文中的拼写错误进行了分类,并分别采用规则匹配和统计建模的方法对单词的非词错误和真词错误进行了研究,从而扩大了对英文单词进行拼写检查的研究范围.真词错误检查主要是利用贝叶斯定理,并通过建立一些特定的混淆集的方法来实现.通过实验数据分析,该系统的准确率达到了80%以上. 展开更多
关键词 拼写检查 真词错误 非词错误 贝叶斯定理 混淆集
下载PDF
词汇语法拼写校对软件——功能语法的应用实例
9
作者 许庆欣 《天津外国语学院学报》 2007年第2期49-54,共6页
真词错误拼写校对是自然语言处理领域中的一个难题。真词错误具有出现频率高、种类多样的特点。现有的计算机拼写校对软件不足以侦别所有的真词错误。词汇语法拼写校对软件模型以系统功能语言学理论为指导,有四个处理单元,分别对应语言... 真词错误拼写校对是自然语言处理领域中的一个难题。真词错误具有出现频率高、种类多样的特点。现有的计算机拼写校对软件不足以侦别所有的真词错误。词汇语法拼写校对软件模型以系统功能语言学理论为指导,有四个处理单元,分别对应语言的四个级阶,可以侦别出词汇层、局域性句法层、整体性句法层和语义层次上的拼写错误。词汇语法拼写校对模型在进行真词错误纠错工作的时候充分考虑了文本的语境知识,最终产生按照盖然率大小排列的校正参考。 展开更多
关键词 真词错误 词汇语法 拼写校对
下载PDF
自动校对渐入佳境 被引量:1
10
作者 杜飞龙 《微电脑世界》 2001年第7期24-26,共2页
中文自动校对是近几年兴起的一个热门研究课题。随着出版业电子化的迅猛发展,校对环节的工作量大大增加,自动校对的课题因此被提到日程上来。除了出版业之外,自动校对的技术还可以应用在语音输入、汉字识别、文本编辑和计算机辅助教学... 中文自动校对是近几年兴起的一个热门研究课题。随着出版业电子化的迅猛发展,校对环节的工作量大大增加,自动校对的课题因此被提到日程上来。除了出版业之外,自动校对的技术还可以应用在语音输入、汉字识别、文本编辑和计算机辅助教学等领域。 展开更多
关键词 自动校对 课题 真词错误 中文文本 字串 混淆集 特征模板 语言模型
原文传递
上一页 1 下一页 到第
使用帮助 返回顶部