期刊文献+
共找到139篇文章
< 1 2 7 >
每页显示 20 50 100
新疆少数民族语言文字信息处理研究与应用 被引量:26
1
作者 吐尔根·依布拉音 袁保社 《中文信息学报》 CSCD 北大核心 2011年第6期149-156,共8页
该文主要对国内开展维吾尔、哈萨克、柯尔克孜等少数民族语言信息处理以来的相关研究工作进行了介绍和评价。在此基础上对维吾尔、哈萨克、柯尔克孜文信息处理的进一步发展进行了展望。目的是为了探讨如何加速推进维吾尔、哈萨克、柯尔... 该文主要对国内开展维吾尔、哈萨克、柯尔克孜等少数民族语言信息处理以来的相关研究工作进行了介绍和评价。在此基础上对维吾尔、哈萨克、柯尔克孜文信息处理的进一步发展进行了展望。目的是为了探讨如何加速推进维吾尔、哈萨克、柯尔克孜文信息处理技术的发展。通过对维、哈、柯文操作系统、信息技术标准、语言信息处理及综合应用等四个方面历史和现状的介绍及简单评价,对维、哈、柯语信息处理的发展方向做了相关描述。 展开更多
关键词 维吾尔文 哈萨克文 柯尔克孜文 信息处理 操作系统 自然语言 标准
下载PDF
多语种二分查找类库及文件生成工具的实现
2
作者 艾山·吾买尔 帕肉克·司地克 +1 位作者 亚森·伊明 吐尔根·伊布拉音 《电脑知识与技术》 2013年第11期6996-6998,共3页
该文,为了满足汉维机器翻译系统、汉维词典、维文字转换等系统中对文件的快速访问,使用C#设计与实现了基于二分查找的检索类和该类可访问的文件生成工具。
关键词 二分查找 内容 C#
下载PDF
采用CRF模型的哈萨克语信息技术术语自动抽取技术研究 被引量:3
3
作者 木合亚提.尼亚孜别克 古力沙吾利.塔里甫 达吾勒.阿布都哈依尔 《西北师范大学学报(自然科学版)》 CAS 北大核心 2016年第1期53-56,共4页
研究哈萨克语信息技术术语自动识别方法.采用基于条件随机场(CRF)的方法,针对哈萨克语信息技术术语的组成形式、定界规则等术语自动识别标注问题,结合哈萨克语本身词性、词边界、术语类别标注的特征,分析不同特征组合对术语识别的影响,... 研究哈萨克语信息技术术语自动识别方法.采用基于条件随机场(CRF)的方法,针对哈萨克语信息技术术语的组成形式、定界规则等术语自动识别标注问题,结合哈萨克语本身词性、词边界、术语类别标注的特征,分析不同特征组合对术语识别的影响,并探讨最有效的组合.结果表明,CRF模型正确识别率为83.08%,召回率为80.13%,F值为80.57%. 展开更多
关键词 哈萨克语 信息技术 术语抽取 条件随机场
下载PDF
基于多特征融合的新疆旅游领域关系抽取研究
4
作者 骆铭 古丽拉·阿东别克 +1 位作者 马雅静 陈赟 《东北师大学报(自然科学版)》 CAS 北大核心 2023年第1期88-96,共9页
通过结合2738个领域词汇组成的词典对新疆旅游领域语料进行预处理操作,对文本信息进行实体关系抽取研究,提出基于旅游领域的词典信息,融合多级特征的Bi-LSTM、CNN和Attention机制的领域级关系抽取模型.该模型首先使用预训练模型生成含... 通过结合2738个领域词汇组成的词典对新疆旅游领域语料进行预处理操作,对文本信息进行实体关系抽取研究,提出基于旅游领域的词典信息,融合多级特征的Bi-LSTM、CNN和Attention机制的领域级关系抽取模型.该模型首先使用预训练模型生成含较强的语义表征能力的词向量;再使用Bi-LSTM获取更好的语义信息和词向量拼接以捕获长距离的语义特征;用CNN进行特征提取,加强局部特征的学习,并使用注意力池化层(Attentive-pooling)用以强化特征的表达;最后通过Softmax完成关系抽取任务.结果表明:该模型在SemEval-2010 Task 8公开数据集中F1值达到83.46%,证明了其有效性.且模型在新疆旅游领域语料的关系抽取任务中的F1值达到92.73%,优于目前的主流关系抽取模型. 展开更多
关键词 新疆旅游领域 关系抽取 Bi-LSTM CNN Attentive-pooling
下载PDF
基于改进Conformer的新闻领域端到端语音识别
5
作者 张济民 早克热·卡德尔 +2 位作者 艾山·吾买尔 申云飞 汪烈军 《中文信息学报》 CSCD 北大核心 2024年第4期156-164,共9页
目前,开源的中文语音识别数据集大多面向通用领域,缺少面向新闻领域的开源语音识别语料库,因此该文构建了面向新闻领域的中文语音识别数据集CH_NEWS_ASR,并使用ESPNET-0.9.6框架的RNN、Transformer和Conformer等模型对数据集的有效性进... 目前,开源的中文语音识别数据集大多面向通用领域,缺少面向新闻领域的开源语音识别语料库,因此该文构建了面向新闻领域的中文语音识别数据集CH_NEWS_ASR,并使用ESPNET-0.9.6框架的RNN、Transformer和Conformer等模型对数据集的有效性进行了验证,实验表明,该文所构建的语料在最好的模型上CER为4.8%,SER为39.4%。由于新闻联播主持人说话语速相对较快,该文构建的数据集文本平均长度为28个字符,是Aishell_1数据集文本平均长度的2倍;且以往的研究中训练目标函数通常为基于字或词水平,缺乏明确的句子水平关系,因此该文提出了一个句子层级的一致性模块,与Conformer模型结合,直接减少源语音和目标文本的表示差异,在开源的Aishell_1数据集上其CER降低0.4%,SER降低2%;在CH_NEWS_ASR数据集上其CER降低0.9%,SER降低3%,实验结果表明,该方法在不增加模型参数量的前提下能有效提升语音识别的质量。 展开更多
关键词 端到端语音识别 CONFORMER 句子层级一致性
下载PDF
融合方面语义和网格标记的多语言意见元组抽取
6
作者 古文霞 早克热·卡德尔 +1 位作者 杨乾 艾山·吾买尔 《计算机科学》 CSCD 北大核心 2024年第4期324-333,共10页
面向方面的细粒度意见抽取(Aspect-oriented Fine-grained Opinion Extraction,AFOE)任务的目的是以意见对的形式抽取文本评论中的方面和意见词或者再抽取情感极性,形成意见三元组。以往的研究通常以管道方式抽取意见元素,容易出现错误... 面向方面的细粒度意见抽取(Aspect-oriented Fine-grained Opinion Extraction,AFOE)任务的目的是以意见对的形式抽取文本评论中的方面和意见词或者再抽取情感极性,形成意见三元组。以往的研究通常以管道方式抽取意见元素,容易出现错误传播的问题,而且大多数只关注方面词和意见词的单个子任务抽取,忽略了不同意见元素之间的相互影响和指示信息,导致意见挖掘任务不完整。此外,面向中文的意见元素抽取任务的研究较少。针对以上问题,文中提出了融合方面语义和网格标记的多语言意见元组抽取模型。首先,使用向内LSTM(Inward-LSTM)和向外LSTM(Outward-LSTM)编码方面词及其对应的上下文信息建立方面和候选意见词的关联,再结合全局信息生成特定方面语义特征的上下文表示,有利于提高下游意见元素抽取的性能。其次,使用网格标记方案的推理策略,利用方面和意见词之间的依赖指示信息进行更准确的抽取,以端到端的方式处理AFOE任务。相比基线模型,对于方面意见对抽取任务,改进的模型在中英文数据集上的F1值提高了0.89%~4.11%,对于三元组抽取任务提高了1.36%~3.11%,实验结果表明,改进的模型能有效地对中英文评论的意见元素进行抽取,性能显著优于基线模型。 展开更多
关键词 方面意见对抽取 三元组抽取 网格标记方案 方面语义 面向方面的细粒度意见抽取
下载PDF
旅游领域意图识别和槽位填充联合建模方法研究
7
作者 厉雯 古丽拉·阿东别克 +1 位作者 樊诗雨 任方日 《东北师大学报(自然科学版)》 CAS 北大核心 2024年第2期75-82,共8页
构建了基于BERT的双向连接模式BERT-based Bi-directional Association Model(BBAM)以实现在意图识别和槽位填充之间建立双向关系的目标,来实现意图识别与槽位填充的双向关联,融合两个任务的上下文信息,对意图识别与槽位填充两个任务之... 构建了基于BERT的双向连接模式BERT-based Bi-directional Association Model(BBAM)以实现在意图识别和槽位填充之间建立双向关系的目标,来实现意图识别与槽位填充的双向关联,融合两个任务的上下文信息,对意图识别与槽位填充两个任务之间的联系进行深度挖掘,从而优化问句理解的整体性能.为了验证模型在旅游领域中的实用性和有效性,通过远程监督和人工校验构建了旅游领域问句数据集TFQD(Tourism Field Question Dataset),BBAM模型在此数据集上的槽填充任务F 1值得分为95.21%,意图分类准确率(A)为96.71%,整体识别准确率(A_(sentence))高达89.62%,显著优于多种基准模型.所提出的模型在ATIS和Snips两个公开数据集上与主流联合模型进行对比实验后,结果表明其具备一定的泛化能力. 展开更多
关键词 自然语言理解 口语理解 问句理解 旅游领域 智能问答 意图识别 槽位填充 联合建模
下载PDF
基于MHSA和GCN的方面级情感分析模型
8
作者 杨乾 艾山·吾买尔 +1 位作者 孙伟伟 古文霞 《东北师大学报(自然科学版)》 CAS 北大核心 2024年第2期69-74,共6页
针对目前大多数现有的基于图卷积网络的模型只考虑了特定方面和上下文之间的交互关系,忽略了方面之间的交互情感特征的问题,本文提出了一种利用预训练BERT和多头自注意力机制(MHSA)结合图卷积网络的模型(MHSAGCN-BERT).用方面词与上下... 针对目前大多数现有的基于图卷积网络的模型只考虑了特定方面和上下文之间的交互关系,忽略了方面之间的交互情感特征的问题,本文提出了一种利用预训练BERT和多头自注意力机制(MHSA)结合图卷积网络的模型(MHSAGCN-BERT).用方面词与上下文的句法依赖和方面之间的相互情感关系来推导出特定方面的情感极性,以此增强模型学习特征能力.在Restaurant14、Restaurant15、Restaurant16公开数据集上进行了实验,结果表明,本文模型与其他方面级情感分析模型相比有较明显的提升. 展开更多
关键词 方面级情感分析 多头自注意力机制 图卷积网络 方面交互 句法依赖树
下载PDF
基于WebGIS的维吾尔文天气信息服务 被引量:3
9
作者 郑江华 阿地力肉孜 《计算机工程》 CAS CSCD 2012年第6期288-290,共3页
针对维吾尔语用户对基于地理信息技术的服务需求,提出一种基于WebGIS的维吾尔文天气信息服务系统。以天气信息服务为应用领域,集成Google Maps API地图服务组件与实时Yahoo Weather RSS天气信息,利用网页自定义字体技术解决维吾尔文的... 针对维吾尔语用户对基于地理信息技术的服务需求,提出一种基于WebGIS的维吾尔文天气信息服务系统。以天气信息服务为应用领域,集成Google Maps API地图服务组件与实时Yahoo Weather RSS天气信息,利用网页自定义字体技术解决维吾尔文的表达问题,使用VS2005开发工具实现系统。应用结果表明,该系统能提供多种内置工具,实现维吾尔文天气信息的实时查询。 展开更多
关键词 地理信息系统 封装 信息查询 天气信息
下载PDF
高并发汉英信息抽取系统的设计与实现 被引量:4
10
作者 张少迪 艾山·吾买尔 +1 位作者 郑炅 石刚 《现代电子技术》 北大核心 2019年第16期104-107,111,共5页
随着大数据时代的来临,如何从海量数据中抽取出最有效的信息成为人们最迫切的需要。为了能够在大数据的环境下更好更快地进行汉英文本的信息抽取,文中采用Python编程语言,Django+uWSGI+Nginx框架,基于TextRank的图排序算法实现汉英文本... 随着大数据时代的来临,如何从海量数据中抽取出最有效的信息成为人们最迫切的需要。为了能够在大数据的环境下更好更快地进行汉英文本的信息抽取,文中采用Python编程语言,Django+uWSGI+Nginx框架,基于TextRank的图排序算法实现汉英文本信息抽取系统。该系统包含文本关键词提取,文本关键短语提取以及文本摘要提取。测试结果表明,该系统能够实现大规模数据的高并发稳定调用,在兼顾抽取质量的同时,还能实现超高效率的信息抽取,具有很好的实际应用价值。 展开更多
关键词 大数据 高并发 信息抽取 TextRank uWSGI NGINX DJANGO
下载PDF
基于互信息的维吾尔文自适应组词算法 被引量:6
11
作者 吐尔地.托合提 艾克白尔.帕塔尔 艾斯卡尔.艾木都拉 《计算机应用研究》 CSCD 北大核心 2013年第2期429-431,435,共4页
传统的分词方法将一个维吾尔文语义词(多词关联模式)拆分成与词意义不符的若干个片段,因此在维吾尔语文本分析及文本处理过程中导致许多问题,严重影响文本处理效率。提出了一种维吾尔文组词的全新概念,用互信息作为相邻单词间关联程度... 传统的分词方法将一个维吾尔文语义词(多词关联模式)拆分成与词意义不符的若干个片段,因此在维吾尔语文本分析及文本处理过程中导致许多问题,严重影响文本处理效率。提出了一种维吾尔文组词的全新概念,用互信息作为相邻单词间关联程度的度量,实现了基于分段式策略和增量式策略的两种自适应组词算法,并与传统的分词方法得到的词汇表进行对比分析。实验结果表明,组词算法能够非常有效地提取文本中的语义词,两种算法在大规模文本集上的组词准确率分别达到了84.31%和88.24%。 展开更多
关键词 维吾尔文 传统分词 语义词 互信息 组词
下载PDF
场景文字识别技术研究综述 被引量:16
12
作者 王德青 吾守尔·斯拉木 许苗苗 《计算机工程与应用》 CSCD 北大核心 2020年第18期1-15,共15页
对文字检测和识别技术进行了全面的介绍。介绍了自然场景文字识别技术的研究背景、应用领域、技术难点等;介绍了场景文字识别的预处理技术及流程,介绍了近年来出现的基于深度学习的通用检测网络、维吾尔文和中英文的深度学习文字检测网... 对文字检测和识别技术进行了全面的介绍。介绍了自然场景文字识别技术的研究背景、应用领域、技术难点等;介绍了场景文字识别的预处理技术及流程,介绍了近年来出现的基于深度学习的通用检测网络、维吾尔文和中英文的深度学习文字检测网络、场景文字识别深度学习网络、端到端场景文字检测与识别深度学习网络,并总结了各类网络的结构特点、优势、局限性、应用场景以及实现成本,接着进行了综合分析;最后介绍了公开数据集,并探讨了场景文字识别技术的发展趋势及可能的研究方向。 展开更多
关键词 场景文字检测 文本识别 深度学习 端到端检测识别
下载PDF
壮、蒙古、维、哈、柯、朝语信息处理研究进展 被引量:6
13
作者 刘连芳 海银花 +3 位作者 那顺乌日图 黄家裕 吐尔根·依布拉音 玄龙云 《广西科学院学报》 2018年第1期18-26,共9页
少数民族语言文字处理是中国语言文字信息处理的重要组成部分。自20世纪80年代以来,少数民族语言文字处理在各民族科研、产业工作者的共同努力下,在操作系统、输入输出、编辑排版、标准化、语言资源建设、机器翻译、软件平台、人才培养... 少数民族语言文字处理是中国语言文字信息处理的重要组成部分。自20世纪80年代以来,少数民族语言文字处理在各民族科研、产业工作者的共同努力下,在操作系统、输入输出、编辑排版、标准化、语言资源建设、机器翻译、软件平台、人才培养等各个方面取得了长足的进展。本文综述壮、蒙古、维吾尔、哈萨克、柯尔克孜、朝鲜6个少数民族的语言文字信息处理历史、现状及存在问题,并对其未来发展方向进行展望。 展开更多
关键词 壮文 蒙古文 维哈柯文 朝鲜文 信息处理
下载PDF
用于双语科技术语对齐的汉维文可比语料库构建 被引量:2
14
作者 彭飞 吐尔根.依布拉音 +1 位作者 艾山.吾买尔 米尔夏提.力提甫 《新疆大学学报(自然科学版)》 CAS 北大核心 2017年第3期316-321,共6页
面向汉文维吾尔文(以下简称汉维)双语科技术语抽取这一应用目标,本文提出新闻科技领域的汉维可比语料库设计方案并进行实验.将网络采集的汉维语料利用机器翻译系统进行初加工后映射到向量空间中并使用LSI算法计算出各向量间的相关性,利... 面向汉文维吾尔文(以下简称汉维)双语科技术语抽取这一应用目标,本文提出新闻科技领域的汉维可比语料库设计方案并进行实验.将网络采集的汉维语料利用机器翻译系统进行初加工后映射到向量空间中并使用LSI算法计算出各向量间的相关性,利用计算后的向量建立索引并依次计算出源文本与候选文本的相似值.本文设计两种实验进行对比,对选取的可比语料进行评估、筛选,最终达到构建汉维可比语料库的目的. 展开更多
关键词 可比语料库 汉维可比语料库构建 双语术语抽取 LSI
下载PDF
基于TextRank算法和互信息相似度的维吾尔文关键词提取及文本分类 被引量:8
15
作者 阿力甫.阿不都克里木 李晓 《计算机科学》 CSCD 北大核心 2016年第12期36-40,共5页
针对维吾尔语文本的分类问题,提出一种基于TextRank算法和互信息相似度的维吾尔文关键词提取及文本分类方法。首先,对输入文本进行预处理,滤除非维吾尔语的字符和停用词;然后,利用词语语义相似度、词语位置和词频重要性加权的TextRank... 针对维吾尔语文本的分类问题,提出一种基于TextRank算法和互信息相似度的维吾尔文关键词提取及文本分类方法。首先,对输入文本进行预处理,滤除非维吾尔语的字符和停用词;然后,利用词语语义相似度、词语位置和词频重要性加权的TextRank算法提取文本关键词集合;最后,根据互信息相似度度量,计算输入文本关键词集和各类关键词集的相似度,最终实现文本的分类。实验结果表明,该方案能够提取出具有较高识别度的关键词,当关键词集大小为1250时,平均分类率达到了91.2%。 展开更多
关键词 维吾尔语 文本分类 关键词提取 TextRank算法 互信息相似度
下载PDF
文本信息检索系统的设计与实现 被引量:1
16
作者 李高鹏 艾山·吾买尔 +1 位作者 郑炅 王路路 《现代电子技术》 北大核心 2019年第16期62-66,共5页
随着信息化的发展,互联网上出现了越来越多的文档信息,如何根据用户的需要从海量的文档中快速获取相关信息成为了研究的热点。采用Python编程语言、DjangoWeb应用框架、UWSGIWeb服务器、Nignx代理服务器,基于Tex-tRank关键词提取算法、... 随着信息化的发展,互联网上出现了越来越多的文档信息,如何根据用户的需要从海量的文档中快速获取相关信息成为了研究的热点。采用Python编程语言、DjangoWeb应用框架、UWSGIWeb服务器、Nignx代理服务器,基于Tex-tRank关键词提取算法、倒排索引结构、Jaccard相似度计算以及MySQL数据库技术构建了汉英文本信息检索系统。该系统包含文本注册、文本检索和文本注销三个模块,可实现千万量级文本数量上的快速注册和快速检索功能,为构建舆情分析系统提供服务,并可根据人们特定的需求,扩展文本检索服务。 展开更多
关键词 信息检索 算法介绍 倒排索引 检索系统构建 快速注册 快速检索
下载PDF
医院骨科随访信息处理软件的设计与实现 被引量:4
17
作者 瓦力斯江·帕尔哈提 瓦依提·阿不力孜 +2 位作者 买合木提·买买提 王路路 古丽尼格尔·阿不都外力 《电脑知识与技术》 2018年第4期80-83,共4页
为了提高患者病例数据收集的速度和质量,该文以新疆维吾尔自治区胸科医院骨科为调研对象,采用Visual Studio2010开发工具以及SQL Server 2005数据库管理工具,在HIS的基础上开发并实现了基于C/S架构的随访系统处理软件。通过该系统与医院... 为了提高患者病例数据收集的速度和质量,该文以新疆维吾尔自治区胸科医院骨科为调研对象,采用Visual Studio2010开发工具以及SQL Server 2005数据库管理工具,在HIS的基础上开发并实现了基于C/S架构的随访系统处理软件。通过该系统与医院HIS系统的无缝衔接的同时,实现了对患者病例以及随访记录的信息化处理,从而解决了医护人员科研数据手工收集问题,且对医疗科研工作提供了更扎实的基础。 展开更多
关键词 电子病历 HIS系统 患者病例 数据采集
下载PDF
基于词序统计组合的中文文本关键词提取技术 被引量:10
18
作者 苏祥坤 吾守尔.斯拉木 买买提依明.哈斯木 《计算机工程与设计》 北大核心 2015年第6期1647-1651,共5页
为进一步改善关键词提取的效果,提出一种基于词序统计组合的关键词提取方法。通过词序统计、词性标注、停用词过滤、词语组合等步骤,实现短语或组合词的生成和候选关键词的过滤;通过其它特征项的引入,进一步提高最终提取关键词的准确度... 为进一步改善关键词提取的效果,提出一种基于词序统计组合的关键词提取方法。通过词序统计、词性标注、停用词过滤、词语组合等步骤,实现短语或组合词的生成和候选关键词的过滤;通过其它特征项的引入,进一步提高最终提取关键词的准确度。实验结果表明,该方法对中文文本的关键词提取具有良好的效果。 展开更多
关键词 权重 词序 关键词 单文本 词语组合
下载PDF
面向大数据短文本的高并发语种识别系统的设计与实现 被引量:1
19
作者 伊克拉木·伊力哈木 艾山·吾买尔 +1 位作者 王路路 麦麦提依明·巴吾顿 《现代计算机》 2020年第20期7-13,共7页
在如今大数据环境中包含大量不同语种的网络短文本数据,尤其是在国内多民族地区的网络环境中多种语言混杂的情况普遍存在。为了解决此类易混淆短文本的识别问题,设计一种基于编码区间判断,特征字符检测和基于N-Gram的朴素贝叶斯分类器... 在如今大数据环境中包含大量不同语种的网络短文本数据,尤其是在国内多民族地区的网络环境中多种语言混杂的情况普遍存在。为了解决此类易混淆短文本的识别问题,设计一种基于编码区间判断,特征字符检测和基于N-Gram的朴素贝叶斯分类器相结合的多策略方法,并在此基础上设计一套结合Nginx、uWSGI和Django的语种识别系统,提升系统的高并发能力。实验结果表明,该系统能高效识别网络中各类易混淆短文本的所属语种信息。 展开更多
关键词 大数据 高并发 语种识别 N-GRAM 朴素贝叶斯 uWSGI NGINX DJANGO
下载PDF
信息交换用维哈柯文代码标准研究 被引量:1
20
作者 吾守尔.斯拉木 胡尔西丹 +1 位作者 艾尼宛尔.托乎提 刘俊 《信息技术与标准化》 2011年第6期30-32,36,共4页
对现有条件下维哈柯文代码标准存在的问题进行分析,阐述了维哈柯文编码字符集标准研究及技术特点、维吾尔文界面术语标准研究及技术特点、古维吾尔文编码技术研究,该标准的研究加快并推进了新疆少数民族语言文字的信息化及民文软件的产... 对现有条件下维哈柯文代码标准存在的问题进行分析,阐述了维哈柯文编码字符集标准研究及技术特点、维吾尔文界面术语标准研究及技术特点、古维吾尔文编码技术研究,该标准的研究加快并推进了新疆少数民族语言文字的信息化及民文软件的产业化,具有巨大的社会经济效益。 展开更多
关键词 维哈柯文 标准 编码
下载PDF
上一页 1 2 7 下一页 到第
使用帮助 返回顶部