-
题名面向短文本的增强上下文神经主题模型
- 1
-
-
作者
刘刚
王同礼
唐宏伟
战凯
杨雯莉
-
机构
哈尔滨工程大学计算机科学与技术学院
哈尔滨工程大学电子政务建模仿真国家工程实验室
澳大利亚普华永道公司普华永道数字化部
-
出处
《计算机工程与应用》
CSCD
北大核心
2024年第1期154-164,共11页
-
基金
黑龙江省高等教育教学改革研究项目(SJGZ20200044)
黑龙江省自然科学基金(LH2021F015)
国家高端外国专家引进计划项目(G2021180008L)。
-
文摘
目前的主题模型大多数基于自身文本的词共现信息进行建模,并没有引入主题的稀疏约束来提升模型的主题抽取能力,此外短文本本身存在词共现稀疏的问题,该问题严重影响了短文本主题建模的准确性。针对以上问题,提出了一种增强上下文神经主题模型(enhanced context neural topic model,ECNTM)。ECNTM基于主题控制器对主题进行稀疏性约束,过滤掉不相关的主题,同时模型的输入变成BOW向量和SBERT句子嵌入的拼接,在高斯解码器中,通过在嵌入空间中将单词上的主题分布处理为多元高斯分布或高斯混合分布,显式地丰富了短文本有限的上下文信息,解决了短文本词共现特征稀疏问题。在WS、Reuters、KOS、20 NewsGroups四个公开数据集上的实验结果表明,该模型在困惑度、主题一致性以及文本分类准确率上相较基准模型均有明显提升,证明了引入主题稀疏约束特性以及丰富的上下文信息到短文本主题建模的有效性。
-
关键词
神经主题模型
短文本
稀疏约束
变分自编码器
主题建模
-
Keywords
neural subject model
short text
sparsity constraint
variational auto-encoder
topic modeling
-
分类号
TP391
[自动化与计算机技术—计算机应用技术]
-