维普中文期刊产品整合服务
共被期刊论文引用了8次 您的检索式:您选中1篇文献正在查看引证文献汇总
    题名 作者 年代 出处 被引量
1Relevant experience learning:A deep reinforcement learning method for UAV autonomous motion planning in complex unknown environments显示文摘Unmanned Aerial Vehicles(UAVs)play a vital role in military warfare.In a variety of battlefield mission scenarios,UAVs are required to safely fly to designated locations without human intervention.Therefore,finding a suitable method to solve the UAV Autonomous Motion Planning(AMP)problem can improve the success rate of UAV missions to a certain extent.In recent years,many studies have used Deep Reinforcement Learning(DRL)methods to address the AMP problem and have achieved good results.From the perspective of sampling,this paper designs a sampling method with double-screening,combines it with the Deep Deterministic Policy Gradient(DDPG)algorithm,and proposes the Relevant Experience Learning-DDPG(REL-DDPG)algorithm.The REL-DDPG algorithm uses a Prioritized Experience Replay(PER)mechanism to break the correlation of continuous experiences in the experience pool,finds the experiences most similar to the current state to learn according to the theory in human education,and expands the influence of the learning process on action selection at the current state.All experiments are applied in a complex unknown simulation environment constructed based on the parameters of a real UAV.The training experiments show that REL-DDPG improves the convergence speed and the convergence result compared to the state-of-the-art DDPG algorithm,while the testing experiments show the applicability of the algorithm and investigate the performance under different parameter conditions.Zijian HU Xiaoguang GAO Kaifang WAN Yiwei ZHAI Qianglong WANG 2021Chinese Journal of Aeronautics2021,34,12:10
2基于复杂地块凸划分优化的多无人机覆盖路径规划显示文摘全覆盖路径规划是无人系统路径规划的重要内容之一。伴随无人机(UAV)技术的不断发展,无人机全覆盖路径规划在较多领域中已有重要运用,但在此过程中,往往会出现禁飞区和障碍物,需要进行路径规划保证飞行安全及效率。为此,基于凸划分优化,提出了一种针对含有复杂障碍物的复杂地块的全覆盖路径规划方法,减少了覆盖路径长度,降低了覆盖路径总时间。复杂地块往往含有光滑曲线或崎岖的内凹边界轮廓,首先采用改进Douglas-Peucker算法,将复杂的地块边界压缩为复杂多边形边界,再用凹凸点检验标记顶点凹凸性。之后通过旋转主线找出最短主线方向,再使用随机路标法(PRM)寻找最短的辅线,并采用四种凸划分策略对于复杂地块进行凸划分优化,使得无人机在全覆盖过程中路径更短,工作效率更高。最后,对测试地块进行计算机仿真,达到整体路径比67.6%和54.9%的性能指标,并与其他凸划分优化算法在相同地块上进行比较,验证了本文算法在路径长度以及规划时间上相对更优。薛镇涛 陈建 张自超 刘旭赞 苗宪盛 胡贵 2022航空学报2022,43,12:6
3基于深度确定性策略梯度强化学习算法的航迹规划研究显示文摘航迹规划是无人机走向智能化的重要组成部分。目前已有的传统航迹规划算法存在实时规划能力差、无法处理动态场景、航迹不平滑等问题,现有的强化学习算法虽然能够实时规划,但是大多数算法主要应用在二维场景下,且存在容易碰撞障碍物、到达率低、航迹不平滑和航迹质量低等问题。针对上述问题,提出基于改进深度确定性策略梯度的强化学习算法,该算法融合自注意力机制,提取障碍物特征,躲避障碍,解决到达率低、实时规划能力差的问题,重新设计奖励函数,惩罚无人机“后退”行为,引入方向向量夹角引导机制,解决航迹不平滑问题。仿真验证结果表明,提出的改进算法在复杂动态场景下达到93.5%的到达率,平均飞行距离减少7.3%,推理时间减少26.2%,推理时间短,航迹符合无人机的飞行要求。杨友波 张目 唐俊 雷印杰 2023现代计算机2023,29,5:0
4基于IMM-PPO的无人机机动目标追踪显示文摘针对无人机在复杂障碍物环境下追踪机动目标的问题,提出了一种基于IMM-PPO的导航跟踪策略,估计多模型混合的机动目标状态信息,设计基于目标跟踪性能、追踪逼近时间以及障碍物约束的奖惩函数,并在Actor-Critic网络结构下设计近端策略优化的算法框架,通过智能体与环境交互,训练出奖励最大化下的网络参数。训练后的决策网络能够根据环境信息完成避障导航并实现对机动目标的稳定跟踪。仿真结果表明,相比于传统避障跟踪算法,基于IMM-PPO的导航跟踪策略具有更好的跟踪性能、更快的追踪速度以及更短的避障导航路径,且在初始条件改变的情况下仍具有一定的自主追踪能力,在应用于无人机机动目标追踪任务中时具备更大的优势。成旭明 丛玉华 欧阳权 王志胜 2022弹箭与制导学报2022,42,6:0
5基于多智能体深度强化学习的无人机路径规划显示文摘为解决多无人机(unmanned aerial vehicle, UAV)在复杂环境下的路径规划问题,提出一个多智能体深度强化学习UAV路径规划框架.该框架首先将路径规划问题建模为部分可观测马尔可夫过程,采用近端策略优化算法将其扩展至多智能体,通过设计UAV的状态观测空间、动作空间及奖赏函数等实现多UAV无障碍路径规划;其次,为适应UAV搭载的有限计算资源条件,进一步提出基于网络剪枝的多智能体近端策略优化(network pruning-based multi-agent proximal policy optimization, NP-MAPPO)算法,提高了训练效率.仿真结果验证了提出的多UAV路径规划框架在各参数配置下的有效性及NP-MAPPO算法在训练时间上的优越性.司鹏搏 吴兵 杨睿哲 李萌 孙艳华 2023北京工业大学学报2023,49,4:0
6高超声速滑翔飞行器多禁飞区再入机动航迹优化显示文摘针对高超声速滑翔飞行器航迹规划中面临的复杂环境约束问题,提出了一种结合几何-动力学的航路点跟踪方法并设计了一种禁飞区约束简化策略。首先,在通过飞行走廊确定飞行过程中航向角变化范围的基础上,以角度为指标设计代价函数,并基于此对飞行状态进行预测寻优,得到了倾侧角自适应搜索的横向机动模型;其次,将几何平面上的虚拟航路点生成策略拓展到地球曲面,并基于图论思想和动力学评估模型,获得了全局最佳虚拟航路点生成策略;最后,将2种方法结合得到解决多禁飞区约束的航迹规划方法。仿真结果表明,所提方法能够快速有效获得最佳虚拟航路点,并且降低航迹规划中的倾侧角优化难度;蒙特卡洛仿真实验表明,本方法具有较好的鲁棒性。雷刚 罗炜 李云舒 赖灿辉 2023航空学报2023,44,15:0
7连续状态空间下机器人避障方法研究显示文摘针对机器人避障研究在连续状态空间下的环境泛化问题,提出一种基于深度强化学习的机器人避障方法。该方法引入像素点碰撞检测模块,并结合像素点碰撞模拟距离传感器,获得机器人与任意形态障碍物之间的距离和是否碰撞等信息。在深度强化学习过程中,移动机器人面对未知环境,通过行走获得经验数据训练神经网络,更新网络参数,优化机器人行为决策,实现避障任务。实验结果表明,在机器人避障过程中引入像素点碰撞检测能有效解决环境泛化问题,且动静态环境中训练出的网络模型具有较好的泛化能力。顾玉宛 杨秋媛 竺智华 徐守坤 2023常州大学学报(自然科学版)2023,35,1:0
8基于引导Minimax-DDQN的无人机空战机动决策显示文摘针对无人机(UAV)空战环境信息复杂、对抗性强所导致的敌机机动策略难以预测,以及作战胜率不高的问题,设计了一种引导Minimax-DDQN(Minimax-Double Deep Q-Network)算法。首先,在Minimax决策方法的基础上提出了一种引导式策略探索机制;然后,结合引导Minimax策略,以提升Q网络更新效率为出发点设计了一种DDQN(Double Deep Q-Network)算法;最后,提出进阶式三阶段的网络训练方法,通过不同决策模型间的对抗训练,获取更为优化的决策模型。实验结果表明,相较于Minimax-DQN(Minimax-DQN)、Minimax-DDQN等算法,所提算法追击直线目标的成功率提升了14%~60%,并且与DDQN算法的对抗胜率不低于60%。可见,与DDQN、Minimax-DDQN等算法相比,所提算法在高对抗的作战环境中具有更强的决策能力,适应性更好。王昱 任田君 范子琳 2023计算机应用2023,43,8:0
返回顶部 每页显示:
共1页 首页 上一页 第1页 下一页 末页 /1 跳转

网站首页 | 关于我们 | 联系我们 | 产品服务 | 客服中心 | 广告服务 | 版权声明 | 网站联盟 | 友情链接 | 售卡网点

版权所有© 渝B2-20050021-1 渝公网安备 50019002500403号 违法和不良信息举报中心

互联网出版许可证 新出网证(渝)字10号 全国400电话 - 免长途话费