“欢迎访问北京理工大学学报自然科学中文版网站!”
加入收藏 | 地图 | 联系方式      
 
面向覆盖与撤离协同的强化学习路径规划
Reinforcement Learning for Collaborative Coverage and Evacuation Path Planning
投稿时间:2026-07-14  修订日期:2026-08-06
DOI:
中文关键词:  深度强化学习  区域覆盖路径规划  撤离边界  课程学习
English Keywords:deep reinforcement learning  coverage path planning  evacuation boundaries  curriculum learning
基金项目:
作者单位邮编
洪晓通 北京理工大学机电学院 100081
王正杰 北京理工大学机电学院 100081
王玥* 北京理工大学机电学院 100081
魏浩明 北京理工大学机电学院 100081
薛超 北京理工大学机电学院 100081
徐钦洋 北京工商大学 100048
摘要点击次数: 60
全文下载次数: 0
中文摘要:
      针对覆盖路径规划终止位置不可控、跨区域转移航程增加等问题,构建了覆盖与撤离协同决策模型。将撤离边界编码为条件观测,设计融合感知障碍、局部视野、访问历史、位置与撤离目标的五通道观测,采用近端策略优化和两阶段课程学习联合优化覆盖与方向性撤离策略。随机障碍环境下实验结果表明,EBCC-PPO后期平均回报较PPO提高69.70%;多障碍场景下平均覆盖率和撤离成功率达到92.30%、90.64%,综合效能值达88.60,均优于对比方法。该方法能在保持高覆盖率的同时实现方向可控撤离,提升复杂障碍环境任务完成质量。
English Summary:
      A collaborative coverage-evacuation decision model is developed to address uncontrollable terminal positions and additional inter-regional transfer distance in coverage path planning. Four directional evacuation boundaries are encoded as conditional observations, and a five-channel observation representation is designed by fusing perceived obstacles, local view, visitation history, agent position, and evacuation target. Proximal policy optimization and two-stage curriculum learning are used to jointly optimize area coverage and directional evacuation. Random-obstacle experiments show that EBCC-PPO improves late-stage average return by 69.70% compared with PPO. In multi-obstacle scenarios, the average coverage rate, evacuation success rate, and comprehensive effectiveness reach 92.30%, 90.64%, and 88.60, respectively. The results indicate that EBCC-PPO achieves high-coverage path planning with controllable terminal evacuation in complex obstacle environments.
  查看/发表评论  下载PDF阅读器

您是第18046984位访问者  今日共有 2661访问者
版权所有:北京理工大学学术期刊办公室
主管单位:中华人民共和国工业和信息化部 主办单位:北京理工大学 地址:北京海淀区中关村南大街5号
技术支持:北京勤云科技发展有限公司