|
|
|
题名
|
作者
|
年代
|
出处
|
被引量
|
| 1 | 深度强化学习在需求响应中的应用显示文摘随着中国电力市场化改革的推进,需求响应业务在向着多元化、常态化发展,新环境对需求响应的可靠性与精准性的要求越来越高,亟须完善的技术支撑。深度强化学习能够对复杂的外部环境做出较为准确的识别,并做出最优决策,能够满足需求响应的相关要求。基于此,文中对深度强化学习技术在需求响应中的应用进行了研究与探讨。首先对深度强化学习的发展历程及研究现状进行了梳理,同时分析了需求响应的研究现状与未来发展需求。在此基础上,对深度强化学习应用于需求响应业务的可行性与方法进行了探讨。提出了基于深度强化学习的需求响应业务开展架构,并对深度强化学习的实现流程进行了较为深入的分析,为需求响应技术的发展提供了参考。 | 孙毅 刘迪 李彬 徐永海 | 2019 | 电力系统自动化2019,43,5: | 34 |
| 2 | 基于改进U-net的遥感影像建筑物提取显示文摘针对在遥感影像建筑物提取过程中,建筑物与周围环境信息混淆导致提取精度下降的问题,提出了一种低维特征信息增强的改进U型卷积神经网络(U-net)模型,用于遥感影像建筑物的提取。借鉴医学影像分割中应用广泛的U-net模型对建筑物进行提取;考虑到在网络传播过程中低维细节信息逐级削弱,在特征金字塔中的特征图与扩张路径同级上的特征融合前,先与上一层级的特征图进行融合,进一步优化了提取结果的边缘提取精度。在覆盖范围约340km^2的遥感影像数据集上进行实验,结果表明本文提出的方法在交并比、像素精度和Kappa系数3个指标上的均值分别达到83.9%、92.8%和83.6%,均优于模糊C均值、全卷积网络与经典U-net方法。 | 任欣磊 王阳萍 杨景玉 高德成 | 2019 | 激光与光电子学进展2019,56,22: | 22 |
| 3 | 基于强化学习的多微电网分布式二次优化控制显示文摘针对微电网中分布式电源下垂一次控制产生的系统频率和电压静态偏差问题,提出了一种基于强化学习就地反馈方法的分布式二次优化控制,利用本地信息可兼顾频率恢复和电压调整的需求。首先,针对微电网经济性、频率及电压控制需求和各分布式电源综合性能(环境效益、经济效益、技术效益),定义了本地奖励,协调多微电网的频率恢复和电压调节。其次,针对电网实际运行情况,在满足供需平衡的同时,使用多智能体强化学习算法对全局奖励反馈优化修正,使各分布式电源协同出力渐近消除频率偏差,保证微电网的稳定运行。最后,通过实例验证了所提出控制的有效性和适应性。 | 沈珺 柳伟 李虎成 李娜 温镇 殷明慧 | 2020 | 电力系统自动化2020,44,5: | 22 |
| 4 | 深度逆向强化学习研究综述显示文摘深度逆向强化学习是机器学习领域的一个新的研究热点,它针对深度强化学习的回报函数难以获取问题,提出了通过专家示例轨迹重构回报函数的方法。首先介绍了3类深度强化学习方法的经典算法;接着阐述了经典的逆向强化学习算法,包括基于学徒学习、最大边际规划、结构化分类和概率模型形式化的方法;然后对深度逆向强化学习的一些前沿方向进行了综述,包括基于最大边际法的深度逆向强化学习、基于深度Q网络的深度逆向强化学习和基于最大熵模型的深度逆向强化学习和示例轨迹非专家情况下的逆向强化学习方法等。最后总结了深度逆向强化学习在算法、理论和应用方面存在的问题和发展方向。 | 陈希亮 曹雷 何明 李晨溪 徐志雄 | 2018 | 计算机工程与应用2018,54,5: | 18 |
| 5 | 知识和数据协同驱动的群体智能决策方法研究综述显示文摘群体智能(Collectire intelligence,CI)系统具有广泛的应用前景.当前的群体智能决策方法主要包括知识驱动、数据驱动两大类,但各自存在优缺点.本文指出,知识与数据协同驱动将为群体智能决策提供新解法.本文系统梳理了知识与数据协同驱动可能存在的不同方法路径,从知识与数据的架构级协同、算法级协同两个层面对典型方法进行了分类,同时将算法级协同方法进一步划分为算法的层次化协同和组件化协同,前者包含神经网络树、遗传模糊树、分层强化学习等层次化方法;后者进一步总结为知识增强的数据驱动、数据调优的知识驱动、知识与数据的互补结合等方法.最后,从理论发展与实际应用的需求出发,指出了知识与数据协同驱动的群体智能决策中未来几个重要的研究方向. | 蒲志强 易建强 刘振 丘腾海 孙金林 李非墨 | 2022 | 自动化学报2022,48,3: | 16 |
| 6 | 基于深度强化学习的自动态势估计研究显示文摘自动态势估计是作战指挥智能决策过程的基础环节,人工智能的发展为自动态势估计提供新的技术支撑。详细阐述了深度强化学习方法针对自动态势估计问题的适用性,分析了信息融合、态势理解、态势预测等态势估计的一般过程,研究了Actor-Critic深度强化学习模型。在此基础上,提出基于深度强化学习的自动态势估计技术实现框架,可为解决此类问题提供方法借鉴。 | 吴志强 张俊峰 | 2018 | 军事运筹与系统工程2018,32,2: | 13 |
| 7 | 基于近端策略优化的作战实体博弈对抗算法显示文摘针对一种大地图和稀疏奖励的兵棋推演对抗环境下,单纯的深度强化学习算法会导致训练无法快速收敛以及智能体对抗特定规则智能体胜率较低的问题,提出了一种基于监督学习和深度强化学习相结合以及设置额外奖励的方法,旨在提升智能博弈的训练效果。使用监督学习训练智能体;研究基于近端策略优化(Proximal policy optimization,PPO)的对抗算法;改进强化学习训练过程的额外奖励设置。以某在研兵棋推演环境为例的实验结果表明,该博弈对抗算法能使智能体在对抗其他智能体时的胜率稳步提升并在较短时间内达到收敛。 | 张振 黄炎焱 张永亮 陈天德 | 2021 | 南京理工大学学报2021,45,1: | 13 |
| 8 | 生成式自动文摘的深度学习方法综述显示文摘自动文摘是文本挖掘的主要任务之一。相比于抽取式自动文摘,生成式自动文摘在思想上更接近人工摘要的过程,具有重要研究意义。近几年伴随着深度学习方法的发展,基于深层神经网络模型的生成式自动文摘也有了令人瞩目的发展。为了更全面地理解该类方法的思想和研究现状,本文从生成式自动文摘的任务描述入手,梳理了基于RNN (recurrent neural network,循环神经网络)的模型、基于CNN (convolutional neural network,卷积神经网络)的模型、基于RNN+CNN的模型、融合注意力机制的模型和融合强化学习的模型共五大类生成式自动文摘的深度学习方法。这类方法表明,在深层神经网络的训练下,特别是融合注意力机制和强化学习后,摘要效果得以明显提升。在生成式自动文摘研究的未来发展中,除深度学习方法本身的不断应用和改进外,还需关注如何有效实现篇章级语义理解下的摘要、面向不同文本对象特点的摘要和摘要结果自动评价等问题。此外,如何结合传统摘要研究中的成熟方法进一步提高摘要效果,也是一个很有价值的研究方向。 | 赵洪 | 2020 | 情报学报2020,39,3: | 12 |
| 9 | 基于强化学习的机械臂关节高精度控制方法研究显示文摘为提高空间机械臂自主操作能力,满足在多种不确定场景下的智能化精细操作需要,本文提出一种基于概率推断式强化学习的关节控制方法,在传统关节控制的基础上实现了控制参数的自主学习与优化.该方法主要包含两层循环,外循环通过学习交互数据在线辨识关节模型,内循环依据更新后的关节模型优化控制参数,经过数代学习逐渐使控制性能达到最优.该方法学习效率高,且相较于传统PID方法,对环境的适应能力更强,能有效提高复杂条件下机械臂关节的控制精度.数值仿真结果证明了该方法的有效性. | 徐意钧 张强 吕振华 张猛 | 2020 | 空间控制技术与应用2020,46,1: | 10 |
| 10 | 基于深度强化学习DDPG算法的投资组合管理显示文摘将深度强化学习技术应用于投资组合管理,采用深度强化学习中的深度确定性策略梯度DDPG(Deep Deterministic Policy Gradient)算法,通过限制单只股票的投资权重,分散风险,并采用丢弃算法(Dropout),即在训练模型时随机丢弃节点,解决过拟合问题。以中国股市为例,选取16只中证100指数成分股作为风险资产进行实验。结果表明,本文基于深度强化学习方法构建的投资组合,在实验期间的价值增幅显著高于对照组(等权重组合),2年达到65%,约为对照组的2.5倍,表明了本文方法的有效性。而且通过进一步实验,表明了当用于训练的数据离测试数据时间越近,则本文构建的投资组合表现越好。 | 齐岳 黄硕华 | 2018 | 计算机与现代化2018,,5: | 9 |
| 11 | 智能制造中的计算机视觉应用瓶颈问题显示文摘计算机视觉在智能制造工业检测中发挥着检测识别和定位分析的重要作用,为提高工业检测的检测速率和准确率以及智能自动化程度做出了巨大的贡献。然而计算机视觉在应用过程中一直存在技术应用难点,其中3大瓶颈问题是:计算机视觉应用易受光照影响、样本数据难以支持深度学习、先验知识难以加入演化算法。这些瓶颈问题使得计算机视觉在智能制造中的应用无法发挥最佳效能。因此,需要系统地加以分析和解决。本文总结了智能制造和计算机视觉的概念及其重要性,分析了计算机视觉在智能制造工业检测领域的发展现状和需求。针对计算机视觉应用存在的3大瓶颈问题总结分析了问题现状和已有解决方法。经过深入分析发现:针对受光照影响大的问题,可以通过算法和图像采集两个环节解决;针对样本数据难以支持深度学习的问题,可以通过小样本数据处理算法和样本数量分布平衡方法解决;针对先验知识难以加入演化算法的问题,可以通过机器学习和强化学习解决。上述解决方案中的方法不尽相同,各有优劣,需要结合智能制造中具体应用研究和改进。 | 雷林建 孙胜利 向玉开 张悦 刘会凯 | 2020 | 中国图象图形学报2020,25,7: | 9 |
| 12 | 基于强化学习与神经网络的动态目标分配算法显示文摘针对传统的目标分配算法未考虑作战过程的实时变化情况,只按分配时刻的作战态势对多目标进行分配,导致火力单元分配过多或过少的问题。本文提出一种基于强化学习与深度神经网络的动态目标分配算法,根据不同想定剧情中的敌我目标状态,采用强化学习方式完成多步动态推演,利用专家经验和评估算法对分配数据进行评判,根据最优回报确立确定分配方案,通过利用训练好的深度神经网络为态势中的敌方目标分配我方武器进行的仿真实验结果可看出,与传统算法相比,本文算法在显著提升拦截成功率同时节省了分配时间。 | 丁振林 刘冠龙 谢艺 刘钦 吴建设 | 2020 | 电子设计工程2020,28,13: | 8 |
| 13 | 基于加权密集连接卷积网络的深度强化学习方法显示文摘针对深度强化学习中卷积神经网络(CNN)层数过深导致的梯度消失问题,提出一种将密集连接卷积网络应用于强化学习的方法。首先,利用密集连接卷积网络中的跨层连接结构进行图像特征的有效提取;然后,在密集连接卷积网络中加入权重系数,加权密集连接卷积网络中的每一层都接收到前面几层产生的所有特征图,且之前所有层在跨层连接中被赋予不同的初始权重;最后,在训练中动态调整每层的权重,从而更加有效地提取特征。与常规深度强化学习方法相比,在GridWorld仿真实验中,在相同训练步数内的平均奖励值提升了85.67%;在FlappyBird仿真中,平均奖励值提升了55.05%。实验结果表明所提方法能在不同难度的游戏仿真实验中获得更好的性能。 | 夏旻 宋稳柱 施必成 刘佳 | 2018 | 计算机应用2018,38,8: | 8 |
| 14 | 数据–知识融合的机器学习(2):泛化风险显示文摘该文首先概述数据驱动的机器学习模型(data-drivenmodel,DDM)的有关理论研究成果。在此基础上,论证数据–知识融合的学习模型(knowledge-guiding&data-drivenmodel,KDM)在问题的局部学习空间和全域学习空间的泛化性能。结果表明,在有限样本和一定的假设前提下,KDM在局部学习空间的泛化误差以接近概率1收敛于某泛化误差界;在全域学习空间的泛化误差以概率1-δ收敛于某泛化误差界,该界比DDM的泛化误差上界更紧。因此,与单纯DDM相比,KDM的学习过程更加高效、可靠,能够更好地应对实际问题中的少样本学习问题。 | 尚宇炜 郭剑波 吴文传 苏剑 刘伟 庄晟阳 周莉梅 | 2019 | 中国电机工程学报2019,39,16: | 8 |
| 15 | 基于Double Deep Q Network的无人机隐蔽接敌策略显示文摘基于深度强化学习的连续状态空间无人机隐蔽接敌问题,提出了基于马尔可夫决策过程的隐蔽接敌双深度Q网络(DDQN)方法。利用DDQN生成目标值函数的方法解决了传统DQN的过拟合问题;采用按优先级随机抽样的方法获取训练样本,加速了神经网络的训练速度;设定贪婪系数按照指数下降的方法,解决了传统强化学习的“探索利用窘境”;在势函数奖赏函数设计中引入角度因子,使其更加符合实际作战情况。仿真实验结果表明,DDQN具有较好的收敛性,能有效生成隐蔽接敌策略。 | 何金 丁勇 高振龙 | 2020 | 电光与控制2020,27,7: | 8 |
| 16 | 元学习研究综述显示文摘深度学习和强化学习严重受限于小样本数据集,容易发生过拟合,无法实现类似于人类强泛化性的学习能力。元学习为此应运而生,以累积经验的方式形成“价值观”,基于本身的认知和价值判断能力对模型进行调整或优化,让智能体在实际环境中能快速学会各项复杂新任务,实现真正意义上的人工智能。首先概述了元学习的基本原理,然后根据其所采用的不同元知识形式,深入分析各类方法的研究现状,再探讨了元学习在少镜头学习、机器人学习和无监督学习等领域上的应用潜能,最后对其未来的发展趋势做出展望。 | 朱应钊 李嫚 | 2021 | 电信科学2021,37,1: | 7 |
| 17 | 未知环境下基于PF-DQN的无人机路径规划显示文摘为解决无人机无模型路径规划的问题,提出一种环境信息未知情况下基于势函数(PF)奖赏的DQN路径规划方法。建立无人机在环境中的连续状态空间,将360°等分成若干个角度作为航向角建立无人机的动作空间,设计目标和障碍物对无人机的势函数奖赏,刻画不同动作对无人机的影响,并进行仿真实验。实验结果表明:PF-DQN算法能较好地实现无人机在环境信息未知下的无碰撞路径规划,且势函数奖赏能加快无人机路径规划网络的训练速度。 | 何金 丁勇 杨勇 黄鑫城 | 2020 | 兵工自动化2020,39,9: | 6 |
| 18 | 基于生态演化的通用智能系统结构模型研究显示文摘从系统论、认知神经科学和生态演化的角度看,智能是指生物体根据环境、条件、目标,自适应地调整自身或调度各种资源实现目标的能力,智能起源于生命,智能是生物的基本特征.借助于脑神经系统演化的历史,展示了自然智能的演化过程,并由此构建了一个基于生态演化的通用智能系统结构模型,系统地分析了一般智能系统的普遍性、开放性、动态演化性、相对稳定性、功能性、结构性、依附性、相对独立性、可延续性等基本特征.论文根据智能演化进程将智能系统分为7级,利用智能系统结构模型分类探索专用人工智能和通用人工智能的发展方向以及有关智能系统的学习方法.这些工作对人工智能和智能科学基础理论研究与应用具有一定的启发意义. | 王晓峰 杨亚东 | 2020 | 自动化学报2020,46,5: | 4 |
| 19 | 智能装备试验与测试的挑战与对策思考显示文摘人工智能加速应用于武器装备,催生了新的武器装备类型。在分析智能装备新特征基础上,总结提出了智能装备试验与测试存在两方面挑战,一方面是硬件实体及其控制系统存在“可用、好用”的试验与测试挑战,另一方面是智能装备实际应用的智能算法存在“敢用、实用”的试验与测试挑战;给出了应对智能装备试验与测试挑战的建议,包括注重智能装备试验与测试新特性研究,探索适应智能装备试验与测试的新技术,针对不同领域智能装备特点建立健全测评数据集和试验标准规范,以及构建能够对智能装备进行高效、可信测评的新试验环境与测试平台。希望能够为智能装备试验与测试技术的发展提供一定的借鉴作用。 | 韦正现 | 2021 | 测控技术2021,40,2: | 4 |
| 20 | Ⅰ型神经纤维瘤病26例临床回顾性研究显示文摘目的探讨Ⅰ型神经纤维瘤病的诊断及治疗。方法自2009年1月至2017年4月,我们共收治26例Ⅰ型神经纤维瘤病患者,结合近期国内外文献报告,分析其临床发病特点,筛选可靠治疗方法。结果本组26例中14例有家族史,占53.8%;12例散发,占46.2%。其中24例行手术治疗,病理诊断结合临床诊断为Ⅰ型神经纤维瘤病。术后随访23例,时间为3-102个月,平均42个月,1例恶性病例死亡,1例非原位复发行二次手术,余无复发。结论Ⅰ型神经纤维瘤病为常染色体显性遗传病,临床表现以体表牛奶咖啡斑和外周神经纤维瘤为特征,以骨及眼的发育障碍为表征,手术治疗是矫正畸形、修复组织结构的首选治疗方法。 | 贾雪原 黄东旭 余欣 蒋子平 路来金 | 2018 | 中华手外科杂志2018,34,2: | 4 |