期刊文献+
共找到356篇文章
< 1 2 18 >
每页显示 20 50 100
Semi-supervised Document Clustering Based on Latent Dirichlet Allocation (LDA) 被引量:2
1
作者 秦永彬 李解 +1 位作者 黄瑞章 李晶 《Journal of Donghua University(English Edition)》 EI CAS 2016年第5期685-688,共4页
To discover personalized document structure with the consideration of user preferences,user preferences were captured by limited amount of instance level constraints and given as interested and uninterested key terms.... To discover personalized document structure with the consideration of user preferences,user preferences were captured by limited amount of instance level constraints and given as interested and uninterested key terms.Develop a semi-supervised document clustering approach based on the latent Dirichlet allocation(LDA)model,namely,pLDA,guided by the user provided key terms.Propose a generalized Polya urn(GPU) model to integrate the user preferences to the document clustering process.A Gibbs sampler was investigated to infer the document collection structure.Experiments on real datasets were taken to explore the performance of pLDA.The results demonstrate that the pLDA approach is effective. 展开更多
关键词 latent dirichlet allocation(lda) semi-supervised learning document clustering
下载PDF
基于LDA主题模型的智慧健康养老服务与管理人才岗位需求分析
2
作者 达朝锦 吴臣 +4 位作者 蔡婷婷 吉珍颖 陈佳琳 苗晓琦 袁长蓉 《护士进修杂志》 2024年第6期664-669,共6页
目的应用潜在狄利克雷分配(LDA)主题模型挖掘养老服务与管理人才的岗位需求,为相关人才培养提供依据。方法采用Python程序软件抓取前程无忧、智联招聘、猎聘网、养老网、丁香人才网等网站上与养老服务与管理人才相关的招聘信息,并进行... 目的应用潜在狄利克雷分配(LDA)主题模型挖掘养老服务与管理人才的岗位需求,为相关人才培养提供依据。方法采用Python程序软件抓取前程无忧、智联招聘、猎聘网、养老网、丁香人才网等网站上与养老服务与管理人才相关的招聘信息,并进行数据清洗,借助LDA主题模型对数据进行主题识别,分析岗位需求。结果共采集招聘信息3684条。数据清洗后获得2120条有效数据,包含健康照护类1161条,经营与管理类959条。招聘信息主要分布在华东、华北和华南地区。2类岗位各自析出8个岗位需求主题,按照主题强度,健康照护岗位析出的需求主题依次为:性格品质、生活及心理照料能力、疾病照料能力、职业礼仪和态度、急救与安全照料能力、职业通用能力、活动组织及服务管理能力、信息技术和老年政策法规知识;经营与管理岗位析出的需求主题依次为:机构运营管理能力、性格品质、市场开发与定位能力、客户维护与产品销售能力、职业礼仪和态度、职业通用能力、活动组织和策划能力、信息技术和老年政策法规知识。结论健康照护和经营与管理岗位知识和技能需求存在差异,但两者均重视养老服务与管理人才的人文素养和信息化应用能力,上述需求特征可为相关人才培养提供一定参考。 展开更多
关键词 lda主题模型 养老服务与管理 网络招聘 岗位需求
下载PDF
基于LDA和ISM模型的疫苗接种意愿研究
3
作者 马丽荣 洪小娟 +1 位作者 郑惠莉 吴林海 《江苏科技大学学报(自然科学版)》 CAS 2024年第1期104-110,共7页
从信息化语境中挖掘社交媒体平台中的舆情数据,尝试更加系统地分析新冠疫苗接种意愿多重影响因素间的关系.利用网络爬虫技术抓爬社交媒体Twitter平台中的数据,借助潜在狄利克雷分配(latent Dirichlet allocation,LDA)模型识别影响新冠... 从信息化语境中挖掘社交媒体平台中的舆情数据,尝试更加系统地分析新冠疫苗接种意愿多重影响因素间的关系.利用网络爬虫技术抓爬社交媒体Twitter平台中的数据,借助潜在狄利克雷分配(latent Dirichlet allocation,LDA)模型识别影响新冠疫苗接种意愿的因素,并运用解释结构模型方法(interpretative structural modeling method,ISM)辅助建模,构建多级层次递阶结构模型,梳理和分析各项影响因素之间的逻辑层次关系.结果表明:通过LDA和ISM模型可以对获取到的因素集进行结构化处理,并根据ISM模型的逻辑结构,将影响新冠疫苗接种意愿的4个层级划分为深层、中间层和表层,不同层级对疫苗接种意愿的影响程度不同.研究结果可为提升民众对新冠疫苗的接受意愿和接种倾向提供相应的决策支持和参考价值. 展开更多
关键词 新冠疫苗 接种意愿 潜在狄利克雷分配 解释结构模型
下载PDF
Fuzzy Based Latent Dirichlet Allocation for Intrusion Detection in Cloud Using ML
4
作者 S.Ranjithkumar S.Chenthur Pandian 《Computers, Materials & Continua》 SCIE EI 2022年第3期4261-4277,共17页
The growth of cloud in modern technology is drastic by provisioning services to various industries where data security is considered to be common issue that influences the intrusion detection system(IDS).IDS are consi... The growth of cloud in modern technology is drastic by provisioning services to various industries where data security is considered to be common issue that influences the intrusion detection system(IDS).IDS are considered as an essential factor to fulfill security requirements.Recently,there are diverse Machine Learning(ML)approaches that are used for modeling effectual IDS.Most IDS are based on ML techniques and categorized as supervised and unsupervised.However,IDS with supervised learning is based on labeled data.This is considered as a common drawback and it fails to identify the attack patterns.Similarly,unsupervised learning fails to provide satisfactory outcomes.Therefore,this work concentrates on semi-supervised learning model known as Fuzzy based semi-supervised approach through Latent Dirichlet Allocation(F-LDA)for intrusion detection in cloud system.This helps to resolve the aforementioned challenges.Initially,LDA gives better generalization ability for training the labeled data.Similarly,to handle the unlabelled data,Fuzzy model has been adopted for analyzing the dataset.Here,preprocessing has been carried out to eliminate data redundancy over network dataset.In order to validate the efficiency of F-LDA towards ID,this model is tested under NSL-KDD cup dataset is a common traffic dataset.Simulation is done inMATLAB environment and gives better accuracy while comparing with benchmark standard dataset.The proposed F-LDAgives better accuracy and promising outcomes than the prevailing approaches. 展开更多
关键词 Cloud security fuzzy model latent dirichlet allocation PREPROCESSING NSL-KDD
下载PDF
一种新的目标检测方法:Latent Dirichlet classification 被引量:3
5
作者 丁轶 郭乔进 李宁 《南京大学学报(自然科学版)》 CSCD 北大核心 2012年第2期214-220,共7页
图像目标检测的任务是通过对图像分块或者分区域提取特征,进行学习和分类,从而检测出目标在图像中的位置.基于潜在迪利克雷分布模型,提出一种应用于目标检测的主题模型latentDirichlet classification(LDC),结合图像连续值局部特征和共... 图像目标检测的任务是通过对图像分块或者分区域提取特征,进行学习和分类,从而检测出目标在图像中的位置.基于潜在迪利克雷分布模型,提出一种应用于目标检测的主题模型latentDirichlet classification(LDC),结合图像连续值局部特征和共生关系来进行目标检测.LDC模型将latentDirichlet allocation(LDA)生成的主题信息作为权重赋予样本,生成多份样本,然后利用多份样本训练多个分类器进行集成分类.实验结果表明利用LDC模型能有效提高检测精度. 展开更多
关键词 潜在迪利克雷分布 目标检测 变分推理 主题模型
下载PDF
基于无监督LDA的水电工程施工安全事故致因分析 被引量:1
6
作者 陈述 孙孟文 +3 位作者 陈云 聂本武 李智 刘文濯 《中国安全科学学报》 CAS CSCD 北大核心 2023年第10期79-85,共7页
为实现水电工程施工安全事故报告中致因的智能挖掘,首先,利用Jieba库分词处理1206条事故分析报告,提出事故分析文本词频-逆文档频率(TF-IDF)关键词处理算法,确定词频权重并构建事故文本词向量;然后,基于TF-IDF特征,训练无监督隐含狄利... 为实现水电工程施工安全事故报告中致因的智能挖掘,首先,利用Jieba库分词处理1206条事故分析报告,提出事故分析文本词频-逆文档频率(TF-IDF)关键词处理算法,确定词频权重并构建事故文本词向量;然后,基于TF-IDF特征,训练无监督隐含狄利克雷分布(LDA)主题模型,提取事故主题及主题词;最后,对主题词进行社会网络分析,揭示事故要素间的潜在关系,智能输出水电工程施工安全事故成因。结果表明:LDA主题模型能快速挖掘出大量有效事故数据信息,并计算出安全意识、事故隐患、违章行为等5个事故主题。致因自动分析结果显示,违规违章操作、未掌握安全操作技术、材料设备问题、违反施工程序、作业环境条件不良是导致水电工程施工安全事故的最主要原因。加强施工人员的行为监管,提高事故主要致因的预防能力,有助于提升水电工程施工安全管控水平。 展开更多
关键词 水电工程 施工安全事故 无监督隐含狄利克雷分布(lda)主题模型 事故致因 社会网络分析 因子分析
下载PDF
基于LDA主题模型的网络问答社区妊娠合并糖尿病孕产妇健康信息需求分析 被引量:5
7
作者 马誉萁 侯小妮 +4 位作者 段红梅 徐杨 陈延亭 李博文 金宁宁 《护理学杂志》 CSCD 北大核心 2023年第7期86-89,124,共5页
目的 应用LDA主题模型挖掘妊娠合并糖尿病孕产妇信息需求,为医护人员开展有效信息服务提供参考。方法 采用网络爬虫程序获取网络问答社区妊娠合并糖尿病板块的用户问答数据,采用LDA主题模型对数据进行主题识别,分析信息需求。结果 通过... 目的 应用LDA主题模型挖掘妊娠合并糖尿病孕产妇信息需求,为医护人员开展有效信息服务提供参考。方法 采用网络爬虫程序获取网络问答社区妊娠合并糖尿病板块的用户问答数据,采用LDA主题模型对数据进行主题识别,分析信息需求。结果 通过对126 616条数据的LDA主题分析,妊娠合并糖尿病孕产妇的信息需求包括8类:母儿危害与检查,母儿自我监护,营养体质量控制与胎儿生长发育,筛查与产检,病友经验分享与情感支持,细分食物类别的选择与升糖效应,分娩及产后母婴健康管理,血糖调控与餐食、胰岛素用药。结论 妊娠合并糖尿病孕产妇的信息需求多元、专业、精细化,包括认知、生理、情感等多个维度,医护人员应发挥医患共同信息服务主体作用,针对妊娠合并糖尿病孕产妇提供专业、精细、全面的信息服务。 展开更多
关键词 妊娠合并糖尿病 健康信息需求 网络问答社区 lda主题模型 孕期保健 围生期护理
下载PDF
基于LDA主题模型的湖泊公园生态系统文化服务公众感知研究 被引量:2
8
作者 张怡 裘鸿菲 《中国园林》 CSCD 北大核心 2023年第7期121-126,共6页
湖泊公园是城市蓝绿空间的重要类型之一,开展湖泊公园生态系统文化服务感知量化研究,对保护生态环境和提升游憩空间质量具有重要意义。以武汉市8个典型湖泊公园为研究对象,爬取公园网络评论数据,利用LDA主题模型挖掘潜在主题,结合社会... 湖泊公园是城市蓝绿空间的重要类型之一,开展湖泊公园生态系统文化服务感知量化研究,对保护生态环境和提升游憩空间质量具有重要意义。以武汉市8个典型湖泊公园为研究对象,爬取公园网络评论数据,利用LDA主题模型挖掘潜在主题,结合社会网络分析法和情感分析模型,并对比问卷调查结果,探讨湖泊公园生态系统文化服务感知差异。结果表明:湖泊公园生态系统文化服务公众感知维度有休闲娱乐、审美体验、运动健康、社交互动、历史文化和科普教育;主导服务类型是休闲娱乐和审美体验,而科普教育是最不易被感知的;公园可达性、周边文化建设、园内基础设施及自身特色是影响感知频率和满意度的主要因素;不同年龄段人群的使用需求和活动类型差异对感知满意度有一定影响。因此,未来湖泊公园的建设可在科普主题活动举办、特色湖泊文化景观、公园配套服务设施、生态环境治理等方面进一步完善,并关注多年龄段人群需求,从而提升公园服务品质。 展开更多
关键词 风景园林 生态系统文化服务 公众感知 lda主题模型 情感分析 湖泊公园
下载PDF
基于LDA模型的专利文本主题分析——以国内元宇宙领域为例 被引量:2
9
作者 陆振昇 马超 《科技和产业》 2023年第11期85-88,共4页
为了探究元宇宙作为新兴产业的热点,解决国内元宇宙领域研究重点不明确的问题,提出使用LDA主题模型的专利文本分析方法。将LDA主题模型运用到国内元宇宙领域相关专利文本分析中,结合人为判断和主题困惑度的方法,实现了对专利技术主题的... 为了探究元宇宙作为新兴产业的热点,解决国内元宇宙领域研究重点不明确的问题,提出使用LDA主题模型的专利文本分析方法。将LDA主题模型运用到国内元宇宙领域相关专利文本分析中,结合人为判断和主题困惑度的方法,实现了对专利技术主题的识别和划分。通过实验分析得出结论:人工智能、区块链、云计算等是当前中国元宇宙产业应用专利的热点技术;通过LDA主题模型分析国内元宇宙的专利文本,可以实现其技术热点主题的分类和细分判别,可以为未来的行业发展提供建议。 展开更多
关键词 lda主题模型 元宇宙 专利文本分析
下载PDF
政策工具视域下我国省级数字经济政策文本的量化分析——基于LDA的主题社会网络分析 被引量:2
10
作者 陈美 孙瑞乾 《情报杂志》 北大核心 2023年第11期174-182,共9页
[研究目的]数字经济发展如火如荼,各地方政府纷纷颁布数字经济发展的地方法规和规范性文件。开展省级层面数字经济政策的研究,力图为我国数字经济发展和政策制定提供参考。[研究方法]基于政策工具理论,采用效词分析法,运用LDA主题模型,... [研究目的]数字经济发展如火如荼,各地方政府纷纷颁布数字经济发展的地方法规和规范性文件。开展省级层面数字经济政策的研究,力图为我国数字经济发展和政策制定提供参考。[研究方法]基于政策工具理论,采用效词分析法,运用LDA主题模型,对截至2022年12月现行有效的24个省份综合性政策文本进行无监督的机器学习分析,以厘清各政策文本隐含关系。同时,借助社会网络分析计算主题特征词的关联程度,从可视化层面佐证LDA模型结果。[研究结论]现有数字经济政策辐射社会各领域,既包括常规性发展重点,也关注新兴社会问题和现行制度漏洞,但存在对供给型政策工具依赖过多,导致政策工具使用比例失衡和“强制性”治理理念主导。为此,优化配置政策工具、避免政府为中心的公共政策范式、促进政策目标、执行与体系的良性耦合和转变政策监管态度成为我国省级层面数字经济政策的未来发展路径。 展开更多
关键词 数字经济 政策工具 政策文本 lda主题模型 文本挖掘 社会网络分析
下载PDF
基于LDA主题模型的杭州市公园季节性公共服务价值
11
作者 侯力丹 卢群 林帅君 《中国城市林业》 2023年第3期109-116,132,共9页
季节对公园的公共服务价值具有显著影响,明确游客对于公园季节性公共服务价值的关注度及态度有助于提高公园的服务质量。文章以“大众点评”上游客对杭州市公园的评价文本为研究对象,基于LDA主题模型对公园季节性公共服务价值属性及游... 季节对公园的公共服务价值具有显著影响,明确游客对于公园季节性公共服务价值的关注度及态度有助于提高公园的服务质量。文章以“大众点评”上游客对杭州市公园的评价文本为研究对象,基于LDA主题模型对公园季节性公共服务价值属性及游客的关注度进行研究,并利用SnowNLP对评价文本中游客的情感变化进行分析。结果表明:春季和秋季游客主要关注以自然风光为主的游赏价值,夏季游客对公园的功能服务价值具有最高的关注度,冬季公园的休闲娱乐价值是游客最在意的方面,此外,游客对于不同季节的公园的公共服务价值普遍给予较为积极的评价,其中游赏价值、功能服务价值和休闲娱乐价值对游客的情感具有显著的影响。因此,公园的建设与发展应充分考虑公共服务价值随季节的变化,并根据游客诉求进行灵活调整。 展开更多
关键词 潜在狄利克雷分布主题模型 网络文本 简体中文文本处理 季节性公共服务价值 杭州市公园
下载PDF
基于词嵌入的科研主题排序研究
12
作者 何东彬 陶莎 +1 位作者 任延昭 朱艳红 《北方工业大学学报》 2024年第1期136-149,共14页
为准确把握科研领域内文献主题的发展变化,常利用隐式语义特征提取科研主题分布。但由于主题挖掘技术本身的限制,并非所有主题都具有同等重要性或意义。有些主题可能包含太多背景词,信息空泛,或者主题词之间缺乏连贯性,导致主题缺乏实... 为准确把握科研领域内文献主题的发展变化,常利用隐式语义特征提取科研主题分布。但由于主题挖掘技术本身的限制,并非所有主题都具有同等重要性或意义。有些主题可能包含太多背景词,信息空泛,或者主题词之间缺乏连贯性,导致主题缺乏实际意义。针对上述问题,在已有研究基础上,基于词嵌入,提出一种新的多维度评估主题质量算法;针对科研文档的特点,利用语料库的统计特征对无意义主题距离评估方法进行优化,并最终将二者融合到一个统一的主题排序框架中。实验结果表明,本文提出的方法可以有效提高主题排序整体效果,能够识别出非重要和质量差的主题,主题排序的整体效果优于现有方法。 展开更多
关键词 主题模型 潜在狄利克雷分配(lda) 主题排序 科研主题 词嵌入
下载PDF
民航管制安全风险主题时空分布规律研究
13
作者 陈芳 温抗抗 +1 位作者 张亚博 邹汶倩 《安全与环境学报》 CAS CSCD 北大核心 2024年第2期587-595,共9页
为了探究民航管制安全风险的时空分布规律,基于潜在迪利克雷分布(Latent Dirichlet Allocation,LDA)主题模型识别出民航管制安全风险主题,定义民航管制安全风险主题强度的定量测度指标,运用全局空间自相关分析和冷热点分析对民航管制安... 为了探究民航管制安全风险的时空分布规律,基于潜在迪利克雷分布(Latent Dirichlet Allocation,LDA)主题模型识别出民航管制安全风险主题,定义民航管制安全风险主题强度的定量测度指标,运用全局空间自相关分析和冷热点分析对民航管制安全风险主题的时空分布规律进行研究。结果表明:利用LDA主题模型识别出“管制员指令错误风险”等10个管制安全风险主题;“管制员指令错误风险”主题存在较弱的全局空间自相关性,在2018—2021年,全局Moran’s I总体呈现波动增长的趋势;在2018—2021年,“管制员指令错误风险”主题强度高值聚集的区域由西南向东南转移,高值聚集区域数量变少,且不稳定,低值聚集区域发生转移并在2020年后保持稳定。通过全局空间自相关分析和冷热点分析确定了2018—2021年中国民航不同管制区域的管制安全风险的时空分布格局,为局方进行差异化的安全监管提供决策支持。 展开更多
关键词 安全工程 文本挖掘 时空分布规律 潜在迪利克雷分布(lda) 空间自相关 空中交通管制
下载PDF
一种改进的LDA主题模型 被引量:47
14
作者 张小平 周雪忠 +3 位作者 黄厚宽 冯奇 陈世波 焦宏官 《北京交通大学学报》 CAS CSCD 北大核心 2010年第2期111-114,共4页
由于文档中的词符合幂律分布,使得LDA模型的主题分布向高频词倾斜,导致能够代表主题的多数词被少量的高频词淹没使得主题表达能力降低.通过一种高斯函数对特征词加权,改进LDA主题模型的主题分布.实验显示加权LDA模型获得的主题间的相关... 由于文档中的词符合幂律分布,使得LDA模型的主题分布向高频词倾斜,导致能够代表主题的多数词被少量的高频词淹没使得主题表达能力降低.通过一种高斯函数对特征词加权,改进LDA主题模型的主题分布.实验显示加权LDA模型获得的主题间的相关性以及复杂度(Perplexity)值都降低,说明改进模型在主题表达和预测性能方面都有所提高. 展开更多
关键词 lda dirichlet分布 加权主题模型
下载PDF
基于LDA模型的文本分割 被引量:54
15
作者 石晶 胡明 +1 位作者 石鑫 戴国忠 《计算机学报》 EI CSCD 北大核心 2008年第10期1865-1873,共9页
文本分割在信息提取、文摘自动生成、语言建模、首语消解等诸多领域都有极为重要的应用.基于LDA模型的文本分割以LDA为语料库及文本建模,利用MCMC中的Gibbs抽样进行推理,间接计算模型参数,获取词汇的概率分布,使隐藏于片段内的不同主题... 文本分割在信息提取、文摘自动生成、语言建模、首语消解等诸多领域都有极为重要的应用.基于LDA模型的文本分割以LDA为语料库及文本建模,利用MCMC中的Gibbs抽样进行推理,间接计算模型参数,获取词汇的概率分布,使隐藏于片段内的不同主题与文本表面的字词建立联系.实验以汉语的整句作为基本块,尝试多种相似性度量手段及边界估计策略,其最佳结果表明二者的恰当结合可以使片段边界的识别错误率远远低于其它同类算法. 展开更多
关键词 文本分割 lda模型 相似性度量 边界识别
下载PDF
基于Labeled-LDA模型的文本分类新算法 被引量:103
16
作者 李文波 孙乐 张大鲲 《计算机学报》 EI CSCD 北大核心 2008年第4期620-627,共8页
LDA(Latent Dirichlet Allocation)模型是近年来提出的一种能够提取文本隐含主题的非监督学习模型.通过在传统LDA模型中融入文本类别信息,文中提出了一种附加类别标签的LDA模型(Labeled-LDA).基于该模型可以在各类别上协同计算隐含主题... LDA(Latent Dirichlet Allocation)模型是近年来提出的一种能够提取文本隐含主题的非监督学习模型.通过在传统LDA模型中融入文本类别信息,文中提出了一种附加类别标签的LDA模型(Labeled-LDA).基于该模型可以在各类别上协同计算隐含主题的分配量,从而克服了传统LDA模型用于分类时强制分配隐含主题的缺陷.与传统LDA模型的实验对比表明:基于Labeled-LDA模型的文本分类新算法可以有效改进文本分类的性能,在复旦大学中文语料库上micro-F1提高约5.7%,在英文语料库20newsgroup的comp子集上micro-F1提高约3%. 展开更多
关键词 文本分类 图模型 隐含狄利克雷分配 变分推断
下载PDF
基于LDA主题模型的文本相似度计算 被引量:91
17
作者 王振振 何明 杜永萍 《计算机科学》 CSCD 北大核心 2013年第12期229-232,共4页
LDA(Latent Dirichlet Allocation)模型是近年来提出的一种具有文本表示能力的非监督学习模型。提出了一种基于LDA主题模型的文本相似度计算方法,该方法利用LDA为语料库建模,利用MCMC中的Gibbs抽样进行推理,间接计算模型参数,挖掘隐藏... LDA(Latent Dirichlet Allocation)模型是近年来提出的一种具有文本表示能力的非监督学习模型。提出了一种基于LDA主题模型的文本相似度计算方法,该方法利用LDA为语料库建模,利用MCMC中的Gibbs抽样进行推理,间接计算模型参数,挖掘隐藏在文本内的不同主题与词之间的关系,得到文本的主题分布,并以此分布来计算文本之间的相似度,最后对文本相似度矩阵进行聚类实验来评估聚类效果。实验结果表明,该方法能够明显提高文本相似度计算的准确率和文本聚类效果。 展开更多
关键词 主题模型 lda 文本相似度 GIBBS抽样
下载PDF
基于LDA模型的音乐推荐算法 被引量:15
18
作者 李博 陈志刚 +1 位作者 黄瑞 郑祥云 《计算机工程》 CAS CSCD 北大核心 2016年第6期175-179,184,共6页
互联网的普及以及音乐资源的电子化使得人们可以更方便地获得音乐资源。但随着音乐库变得越来越大、资源越来越丰富,人们已经很难准确及时地找到自己喜欢的音乐。因此,对于音乐网站而言,需要一个合适的音乐推荐算法向用户推荐音乐。根... 互联网的普及以及音乐资源的电子化使得人们可以更方便地获得音乐资源。但随着音乐库变得越来越大、资源越来越丰富,人们已经很难准确及时地找到自己喜欢的音乐。因此,对于音乐网站而言,需要一个合适的音乐推荐算法向用户推荐音乐。根据已有的基于音频信息的音乐推荐以及协同过滤方法,分析用户的音乐试听数据以及下载数据,并结合Latent Dirichlet分配(LDA)主题挖掘模型,提出一种音乐推荐算法。实验结果表明,与基于用户的协同过滤算法以及基于项目的协同过滤算法相比,该算法可以更加高效地向用户推荐感兴趣的音乐。 展开更多
关键词 协同过滤 音乐推荐 主题挖掘 latent dirichlet分配模型 吉布斯抽样 基于lda模型的音乐推荐
下载PDF
一种词聚类LDA的商品特征提取算法 被引量:11
19
作者 彭云 万常选 +2 位作者 江腾蛟 刘德喜 刘喜平 《小型微型计算机系统》 CSCD 北大核心 2015年第7期1458-1463,共6页
商品评论中经常会使用一些词义近似或上下文相关的中低频词来描述商品特征,如何有效辨识这些中低频词是商品特征抽取的一个难点.由于缺乏先验知识,主题模型难以发现并抽取中低频特征词.提出基于词义相似度和上下文相关度相结合的词聚类... 商品评论中经常会使用一些词义近似或上下文相关的中低频词来描述商品特征,如何有效辨识这些中低频词是商品特征抽取的一个难点.由于缺乏先验知识,主题模型难以发现并抽取中低频特征词.提出基于词义相似度和上下文相关度相结合的词聚类度量算法,在此基础上构建了一种基于词聚类先验知识的潜在狄利克雷分配的商品主题特征提取模型.首先对词项按词义相似度、上下文相关度进行聚类;然后在商品主题特征抽取中引入词聚类因素作为权重影响因子,使得同一个聚类簇中的词项属于同一主题的概率增加.相关实验结果表明,本文提出的词聚类和特征提取算法具有较好的效果. 展开更多
关键词 词聚类 上下文相关 lda模型 特征提取
下载PDF
一种并行LDA主题模型建立方法研究 被引量:12
20
作者 王旭仁 姚叶鹏 +1 位作者 冉春风 何发镁 《北京理工大学学报》 EI CAS CSCD 北大核心 2013年第6期590-593,共4页
针对潜在狄利克雷分析(LDA)模型分析大规模文档集或语料库中潜藏的主题信息计算时间较长问题,提出基于MapReduce架构的并行LDA主题模型建立方法.利用分布式编程模型研究了LDA主题模型建立方法的并行化实现.通过Hadoop并行计算平台进行... 针对潜在狄利克雷分析(LDA)模型分析大规模文档集或语料库中潜藏的主题信息计算时间较长问题,提出基于MapReduce架构的并行LDA主题模型建立方法.利用分布式编程模型研究了LDA主题模型建立方法的并行化实现.通过Hadoop并行计算平台进行实验的结果表明,该方法在处理大规模文本时,能获得接近线性的加速比,对主题模型的建立效果也有提高. 展开更多
关键词 MapReduce架构 并行计算 潜在狄利克雷分布模型 主题建模
下载PDF
上一页 1 2 18 下一页 到第
使用帮助 返回顶部