期刊文献+
共找到1篇文章
< 1 >
每页显示 20 50 100
显式知识推理和深度强化学习结合的动态决策 被引量:1
1
作者 张昊迪 陈振浩 +4 位作者 陈俊扬 周熠 连德富 伍楷舜 林方真 《软件学报》 EI CSCD 北大核心 2023年第8期3821-3835,共15页
近年来,深度强化学习在序列决策领域被广泛应用并且效果良好,尤其在具有高维输入、大规模状态空间的应用场景中优势明显.然而,深度强化学习相关方法也存在一些局限,如缺乏可解释性、初期训练低效与冷启动等问题.针对这些问题,提出了一... 近年来,深度强化学习在序列决策领域被广泛应用并且效果良好,尤其在具有高维输入、大规模状态空间的应用场景中优势明显.然而,深度强化学习相关方法也存在一些局限,如缺乏可解释性、初期训练低效与冷启动等问题.针对这些问题,提出了一种基于显式知识推理和深度强化学习的动态决策框架,将显式的知识推理与深度强化学习结合.该框架通过显式知识表示将人类先验知识嵌入智能体训练中,让智能体在强化学习中获得知识推理结果的干预,以提高智能体的训练效率,并增加模型的可解释性.将显式知识分为两种,即启发式加速知识与规避式安全知识.前者在训练初期干预智能体决策,加快训练速度;而后者将避免智能体作出灾难性决策,使其训练过程更为稳定.实验表明,该决策框架在不同强化学习算法上、不同应用场景中明显提高了模型训练效率,并增加了模型的可解释性. 展开更多
关键词 知识表示与推理 可解释性 深度强化学习 动态序列决策
下载PDF
上一页 1 下一页 到第
使用帮助 返回顶部