期刊导航
期刊开放获取
河南省图书馆
退出
期刊文献
+
任意字段
题名或关键词
题名
关键词
文摘
作者
第一作者
机构
刊名
分类号
参考文献
作者简介
基金资助
栏目信息
任意字段
题名或关键词
题名
关键词
文摘
作者
第一作者
机构
刊名
分类号
参考文献
作者简介
基金资助
栏目信息
检索
高级检索
期刊导航
共找到
2
篇文章
<
1
>
每页显示
20
50
100
已选择
0
条
导出题录
引用分析
参考文献
引证文献
统计分析
检索结果
已选文献
显示方式:
文摘
详细
列表
相关度排序
被引量排序
时效性排序
基于多策略的新浪微博大数据抓取及应用
被引量:
16
1
作者
孙晓
叶嘉麒
+1 位作者
唐陈意
任福继
《合肥工业大学学报(自然科学版)》
CAS
CSCD
北大核心
2014年第10期1210-1215,共6页
微博数据处理属于大数据范畴,其前提是获取大量的微博数据,而由于商业利益以及安全方面的考虑,获取微博数据的途径越来越少。同时随着新浪官方API的逐步更新,数据获取的限制也日益增加。文章尝试利用现有资源,基于多策略获取机制,设计...
微博数据处理属于大数据范畴,其前提是获取大量的微博数据,而由于商业利益以及安全方面的考虑,获取微博数据的途径越来越少。同时随着新浪官方API的逐步更新,数据获取的限制也日益增加。文章尝试利用现有资源,基于多策略获取机制,设计出可稳定获得新浪微博数据的挖掘方案,并给出情感分析应用实例。实验表明,所设计的挖掘方案可以根据需要获取微博上的数据,并可以应用于微博情感分析中。
展开更多
关键词
新浪微博API
大数据
数据挖掘
网络爬虫
多策略
下载PDF
职称材料
基于重复字串的微博新词非监督自动抽取
被引量:
4
2
作者
孙晓
李承程
+1 位作者
叶嘉麒
任福继
《合肥工业大学学报(自然科学版)》
CAS
CSCD
北大核心
2014年第6期674-678,724,共6页
文章基于重复字串的统计特征,同时分析微博中存在的口语化语言特点制定相应的语言规则,采用统计和规则相结合的方法,首先对微博的语料进行分词,然后从分词碎片中提取重复出现2次及2次以上的新词,通过多层过滤,得到最终的候选新词。实验...
文章基于重复字串的统计特征,同时分析微博中存在的口语化语言特点制定相应的语言规则,采用统计和规则相结合的方法,首先对微博的语料进行分词,然后从分词碎片中提取重复出现2次及2次以上的新词,通过多层过滤,得到最终的候选新词。实验结果证明,该方法有效地保证了较高的准确率和召回率,同时保证了新词的抽取速度。
展开更多
关键词
自然语言处理
中文分词
重复字串
分词碎片
下载PDF
职称材料
题名
基于多策略的新浪微博大数据抓取及应用
被引量:
16
1
作者
孙晓
叶嘉麒
唐陈意
任福继
机构
合肥工业大学计算机与信息学院
出处
《合肥工业大学学报(自然科学版)》
CAS
CSCD
北大核心
2014年第10期1210-1215,共6页
基金
国家自然科学基金资助项目(61203315)
国家高技术研究发展计划(863计划)资助项目(2012AA011103)
安徽省科技攻关计划资助项目(1206c0805039)
文摘
微博数据处理属于大数据范畴,其前提是获取大量的微博数据,而由于商业利益以及安全方面的考虑,获取微博数据的途径越来越少。同时随着新浪官方API的逐步更新,数据获取的限制也日益增加。文章尝试利用现有资源,基于多策略获取机制,设计出可稳定获得新浪微博数据的挖掘方案,并给出情感分析应用实例。实验表明,所设计的挖掘方案可以根据需要获取微博上的数据,并可以应用于微博情感分析中。
关键词
新浪微博API
大数据
数据挖掘
网络爬虫
多策略
Keywords
Sina microblogging API
big data
data mining
Web crawler
multi-strategy
分类号
TP391 [自动化与计算机技术—计算机应用技术]
下载PDF
职称材料
题名
基于重复字串的微博新词非监督自动抽取
被引量:
4
2
作者
孙晓
李承程
叶嘉麒
任福继
机构
合肥工业大学计算机与信息学院
情感计算与先进智能机器安徽省重点实验室
出处
《合肥工业大学学报(自然科学版)》
CAS
CSCD
北大核心
2014年第6期674-678,724,共6页
基金
国家自然科学基金资助项目(61203315)
国家高技术研究发展计划(863计划)资助项目(2012AA011103)
安徽省科技攻关计划资助项目(1206c0805039)
文摘
文章基于重复字串的统计特征,同时分析微博中存在的口语化语言特点制定相应的语言规则,采用统计和规则相结合的方法,首先对微博的语料进行分词,然后从分词碎片中提取重复出现2次及2次以上的新词,通过多层过滤,得到最终的候选新词。实验结果证明,该方法有效地保证了较高的准确率和召回率,同时保证了新词的抽取速度。
关键词
自然语言处理
中文分词
重复字串
分词碎片
Keywords
natural language processing
Chinese word segmentation
repeated string
sub-word fragment
分类号
TP391 [自动化与计算机技术—计算机应用技术]
下载PDF
职称材料
题名
作者
出处
发文年
被引量
操作
1
基于多策略的新浪微博大数据抓取及应用
孙晓
叶嘉麒
唐陈意
任福继
《合肥工业大学学报(自然科学版)》
CAS
CSCD
北大核心
2014
16
下载PDF
职称材料
2
基于重复字串的微博新词非监督自动抽取
孙晓
李承程
叶嘉麒
任福继
《合肥工业大学学报(自然科学版)》
CAS
CSCD
北大核心
2014
4
下载PDF
职称材料
已选择
0
条
导出题录
引用分析
参考文献
引证文献
统计分析
检索结果
已选文献
上一页
1
下一页
到第
页
确定
用户登录
登录
IP登录
使用帮助
返回顶部