多标记众包学习被引量：4

Multi-label Crowdsourcing Learning

下载PDF

导出

摘要传统的多标记学习任务要求训练数据拥有完整的或者至少部分的真实标记,而真实标记耗费昂贵并且难以获取.不同于由昂贵受限的专家标注真实标记,众包环境下,多标记任务被分配给多个容易获取的非专家标注,学习目标是从有错误的非专家标注中估计样本的真实标记.这一问题的关键在于如何融合非专家标注.以往的众包学习主要集中在单标记任务上,忽视了多标记任务的标记相关性;而多标记任务上的众包工作集中在局部标记相关性的利用如标记共同出现的概率,标记间条件相关性,其估计很敏感地受到标记数量和质量的影响.考虑到多标记任务上多个标注者的标注结果整体上存在低秩结构关系,提出一种基于低秩张量矫正的方法.首先,将标注结果组织成三维的张量(样本,标记,标注者),用低秩张量补全的方法对收集到的标注做预处理,以同时达到两个目的:1)优化已有标注;2)补全标注者在其未标注的标记上的标注结果.然后,对所有标注融合,测试了3种融合方法,分别从不同的方面考虑标注的置信度.真实数据上的实验结果验证了所提方法的有效性. Previous multi-label learning requires that all or at least a subset of ground truth labels is given for the training example. This study investigates how to utilize the wisdom of crowds for multi-label tasks, where rather than high cost ground truth labels, imperfect annotations from crowds are collected for learning. The target is to infer the instances’ ground truth labels. The key challenge lies in how to aggregate the noisy annotations. Different from previous crowdsourcing works on single-label problems which ignore the correlation between labels, and multi-label works which consider local label correlations whose estimation heavily depends on the annotations’ quality and quantity, this study proposes an approach considering the global low rank structure of the crowds’ annotations. Regarding the crowds’ annotations for multi-label tasks as a three-way tensor(instance, label, worker), the crowds’ annotations are firstly preconditioned using low rank tensor completion, such that it is able to simultaneously correct the observed noisy annotations and at the same time predict the unobserved annotations. After that, the preconditioned annotations are aggregated through some heuristic methods. Three aggregation methods taking into account the crowds’ annotation confidence from different perspectives are tested. Experimental results on real world multi-label crowdsourcing data sets demonstrate the superiority of the proposed approach.

作者李绍园姜远 LI Shao-Yuan;JIANG Yuan(State Key Laboratory for Novel Software Technology(Nanjing University),Nanjing 210023,China)

机构地区计算机软件新技术国家重点实验室(南京大学)

出处《软件学报》 EI CSCD 北大核心 2020年第5期1497-1510,共14页 Journal of Software

基金国家自然科学基金(61673201)。

关键词多标记学习众包低秩张量近似融合 multi-label learning crowdsourcing low rank tensor approximation aggregation

分类号 TP181 [自动化与计算机技术—控制理论与控制工程]

引文网络
相关文献

同被引文献11

1于进,钱锋.基于粒子群优化的高斯核函数聚类算法[J].计算机工程,2010,36(14):22-23. 被引量：10
2史加荣,郑秀云,魏宗田,杨威.低秩矩阵恢复算法综述[J].计算机应用研究,2013,30(6):1601-1605. 被引量：72
3冯剑红,李国良,冯建华.众包技术研究综述[J].计算机学报,2015,38(9):1713-1726. 被引量：125
4赵江华,穆舒婷,王学志,林青慧,张兮,周园春.科学数据众包处理研究[J].计算机研究与发展,2017,54(2):284-294. 被引量：14
5冯洋,王祎,房春荣,郭楠楠,陈振宇.高可信众包群体构建方法[J].中国科学：信息科学,2019,49(11):1412-1427. 被引量：2
6陈长建,姜流,雷娜,刘世霞.基于众包学习的交互式特征选择方法[J].中国科学：信息科学,2020,50(6):794-812. 被引量：4
7Shao-Yuan LI,Sheng-Jun HUANG,Songcan CHEN.Crowdsourcing aggregation with deep Bayesian learning[J].Science China(Information Sciences),2021,64(3):42-52. 被引量：4
8门昌骞,孟晓超,姜高霞,王文剑.一种利用SPXY采样的标签噪声主动清洗方法[J].小型微型计算机系统,2021,42(9):1865-1870. 被引量：5
9赵海燕,曹杰,陈庆奎,曹健.层次多标签文本分类方法[J].小型微型计算机系统,2022,43(4):673-683. 被引量：9
10张琳,姜高霞,王文剑.众包标签的双重置信度推断算法[J].国防科技大学学报,2022,44(3):77-84. 被引量：1

引证文献4

1李绍园,韦梦龙,黄圣君.利用标注者相关性的深度生成式众包学习[J].软件学报,2022,33(4):1274-1286.
2陈志光.众包学习研究与应用相关进展[J].福建电脑,2022,38(6):62-67.
3王春雪,徐琳琳,俞天秀.基于自适应图正则化与联合低秩矩阵分解的数字文化遗产多标签众包答案聚合方法[J].计算机应用研究,2023,40(4):1119-1129.
4刘昕雨,张琳,姜高霞,王文剑.标记相关性修正的多标记众包标签推断方法[J].小型微型计算机系统,2024,45(5):1025-1031.

1余鹰,吴新念,王乐为,张应龙.基于标记相关性的多标记三支分类算法[J].山东大学学报（理学版）,2020,55(3):81-88. 被引量：1
2王一宾,吴陈,程玉胜,江健生.不平衡标记差异性多标记特征选择算法[J].深圳大学学报（理工版）,2020,37(3):234-242. 被引量：2
3王一宾,裴根生,程玉胜.基于标记密度分类间隔面的组类属属性学习[J].电子与信息学报,2020,42(5):1179-1187. 被引量：1
4孙鑫亮,杨涛,章颖,董海艳,胡孔法,史话跃,谢佳东.基于加权有向图的中医量化诊断方法研究[J].中华中医药杂志,2020,35(4):2014-2017.
5戴万斌.土地规划管理中测绘技术的应用探讨[J].写真地理,2020,0(2):0056-0056.
6匡征凌,匡远凤,郭凯文,方瑾.日、韩新型冠状病毒肺炎疫情分析与趋势预测[J].中国人兽共患病学报,2020,36(5):410-415. 被引量：2
7曾祺.基于机器学习的故意伤害案件风险分析[J].现代计算机,2020,26(12):82-85. 被引量：1
8陈军,刘晟源,赵羚,姜驰,张力行,杨莉.基于组合赋权法和雷达图法的电能计量设备质量评估体系[J].能源工程,2020(2):7-14. 被引量：2
9吴兵,罗雪,李林波.考虑驾驶风格的模糊控制跟驰模型[J].同济大学学报（自然科学版）,2020,48(5):694-701. 被引量：8
10解小东,陈治华.基于kNN-DBSCAN的缺失数据填补优化算法[J].工业控制计算机,2020,33(4):58-60. 被引量：4

软件学报

2020年第5期

浏览历史

内容加载中请稍等...

多标记众包学习被引量：4

同被引文献11

引证文献4

相关作者

相关机构

相关主题

浏览历史

多标记众包学习 被引量：4

同被引文献11

引证文献4

相关作者

相关机构

相关主题

浏览历史

多标记众包学习被引量：4