维普中文期刊产品整合服务
共被期刊论文引用了4次 您的检索式:您选中1篇文献正在查看引证文献汇总
    题名 作者 年代 出处 被引量
1基于强化学习的路径规划技术综述显示文摘路径规划作为移动机器人自主导航的关键技术,主要是使目标对象在规定范围内找到一条从起点到终点的无碰撞安全路径。阐述基于常规方法和强化学习方法的路径规划技术,将强化学习方法主要分为基于值和基于策略两类,对比时序差分、Q-Learning等基于值的代表方法与策略梯度、模仿学习等基于策略的代表方法,并分析其融合策略和深度强化学习方法方法的发展现状。在此基础上,总结各种强化学习方法的优缺点及适用场合,同时对基于强化学习的路径规划技术的未来发展方向进行展望。闫皎洁 张锲石 胡希平 2021计算机工程2021,47,10:33
2Q-learning强化学习制导律显示文摘在未来的战场中,智能导弹将成为精确有效的打击武器,导弹智能化已成为一种主要的发展趋势。本文以传统的比例制导律为基础,提出基于强化学习的变比例系数制导算法。该算法以视线转率作为状态,依据脱靶量设计奖励函数,并设计离散化的行为空间,为导弹选择正确的制导指令。实验仿真验证了所提算法比传统的比例制导律拥有更好的制导精度,并使导弹拥有了自主决策能力。张秦浩 敖百强 张秦雪 2020系统工程与电子技术2020,42,2:18
3基于MDP框架的飞行器隐蔽接敌策略显示文摘基于近似动态规划(approximate dynamic programming,ADP)对空战飞行器隐蔽接敌决策问题进行研究。基于作战飞行器的战术使用原则,提出了隐蔽接敌过程中的优势区域与暴露区域;构建了基于马尔科夫决策过程(Markov decision process,MDP)的隐蔽接敌策略的强化学习方法;通过态势得分函数对非连续的即时收益函数进行修正,给出了基于ADP方法的策略学习与策略提取方法。分别针对对手在有无信息源支持情况下的不同机动对策进行了仿真验证。仿真结果表明,将ADP方法应用于隐蔽接敌策略的学习是可行的,在不同态势下可获得较为有效的接敌策略。徐安 于雷 寇英信 徐保伟 李战武 2011系统工程与电子技术2011,33,5:11
4基于改进Q学习算法的“货到人”系统AGV路径规划显示文摘随着智慧物流的发展,AGV在现代化智能仓库中的作用愈发重要,并衍生出了“货到人”这一拣选模式。以kiva仓库为研究背景,针对单AGV的局部路径规划进行研究,对传统Q学习“探索-利用”这一困境进行改进,通过引入反正弦函数动态调整贪婪因子ε,满足AGV在前期探索时的随机性,避免陷入局部最优解;后期减少ε保证AGV寻路的目的性,通过栅格方法建立仿真模型。仿真结果表明,改进后的Q学习能够在仓库中找到最优路径,并且运行时间相较于传统Q学习减少了约28%,有效提升了算法的效率。张祥来 江尚容 罗芹 2022现代计算机2022,28,2:0
返回顶部 每页显示:
共1页 首页 上一页 第1页 下一页 末页 /1 跳转

网站首页 | 关于我们 | 联系我们 | 产品服务 | 客服中心 | 广告服务 | 版权声明 | 网站联盟 | 友情链接 | 售卡网点

版权所有© 渝B2-20050021-1 渝公网安备 50019002500403号 违法和不良信息举报中心

互联网出版许可证 新出网证(渝)字10号 全国400电话 - 免长途话费