Page 304 - 《软件学报》2026年第3期
P. 304

李晓锋 等: 空间飞行器控制软件在轨自适应可信演化框架                                                     1267


                 扩展性较差, 航空航天技术应综合考虑可扩展性、动态、柔性等要求, 因此仅使用该方法难以满足航天领域要求.
                    在基于搜索的决策方面, 刘道文等人            [25] 提出了一种基于混沌局部搜索的粒子群算法, 并将其应用于选址问题
                 的决策. 该算法利用混沌优化进行粒子群局部搜索, 避免陷入局部极小值, 并实现在全局范围上搜索目标函数的最
                 优值. 王璐等人    [26] 提出一种基于并行搜索优化的自适应决策方法, 将自适应决策视作在调整策略组成的搜索空间
                 中, 评价并选择最优策略的搜索优化问题. 航天领域需要稳定的计算资源和高效的计算效率, 以便航天飞行器能顺
                 利完成更多要求严苛的任务. 但该类方法在效率提升与策略选择方面仍有待改进, 其计算效率受搜索空间规模影
                 响, 且当针对多目标进行权衡决策时, 会产生一个最优策略集合, 需从集合中选择出当下最适用策略, 因此应优化
                 该方法使其符合航天领域资源受限的场景特征.
                    基于学习的决策技术主要从基于强化学习、深度学习和迁移学习的决策方法开展研究. Wu                              等人  [27] 提出了一
                 种基于强化学习的自适应演化方法, 该方法通过生成新的策略来处理未知情况. 深度学习将软件自适应调整等任
                 务转化为回归问题      [28,29]  , 当获得了自适应软件的相关原始数据, 即可采用深度学习模型进行求解. Wang                 等人  [30] 在
                 EWS  系统中使用强化学习方法确定运行时的最佳策略. 将深度学习与控制论结合, 能在外界发生变化时将软件系
                 统自动调整到设定的运行状态. 常见的深度强化学习网络有                   DQN  网络等  [31] . 迁移学习可以在数据不足时, 利用在
                 训练数据充分问题上的已训练模型, 通过迁移操作使模型适合于新的问题                        [32] . 将软件自适应决策方法与强化学习、
                 深度学习和迁移学习结合是未来软件自适应演化发展的重要方向. 在目前航天领域中, 空间飞行器提供可靠、稳
                 定、高性能的算力仍是一个巨大挑战, 但是该类方法对硬件要求高, 模型选择依赖于先验知识或基本假设, 因此,
                 现阶段还很难拓展到航空航天应用场景.
                    针对空间飞行器控制软件强实时及硬件资源受限等实际应用需求, 基于搜索与学习的方法存在资源要求高、
                 无法实时决策等缺点, 因此现阶段很难直接采用此类方法进行在轨决策. 而基于规则的决策技术通过使用既定规
                 则匹配演化事件来调整软件, 虽然决策迅速, 但是需要引入学习机制不断更新规则以适应非预期情况.
                    近年来, 在   CPS  系统的其他典型应用领域, 自适应决策技术取得了诸多进展. 例如, Aravind                 等人  [33] 针对自动
                 驾驶车辆中复杂电子机械系统的维护问题, 提出融合物理建模与人工智能的预测性维护框架, 通过构建振动-旋转
                 关节等物理退化模型, 联合多模态传感数据与带宽动态调整策略, 实现了对突发性硬件老化与非线性扰动的提前
                 感知与系统优化调度. 在工业机器人领域, Yokoyama 等人             [34] 提出了自适应技能协调      (ASC) 方法, 通过构建导航、
                 抓取、放置等预训练技能库, 并引入混合专家模型与在线纠正策略, 在未知环境中实现了高鲁棒性的动作协调与
                 零样本迁移部署. 在无人机系统中, Abbaspour 等人         [35] 面向非线性六自由度飞行模型, 设计了结合神经网络自适应
                 结构  (NNAS) 与非线性动态逆控制器        (NDI) 的主动容错控制方案, 结合扩展卡尔曼滤波实现故障信号识别与反馈
                 补偿, 在执行器故障场景下实现了亚弧度级的精确控制. 这些方法在运行机制上呈现出明显的共性, 均通过引入学
                 习、自适应调整与推理控制机制, 提升系统对未知扰动或突发故障的容错与动态恢复能力.
                    然而, 上述方法多部署于地面或资源相对充足的运行平台, 具备宽裕的计算能力、传感器与通信带宽, 能够支
                 持复杂神经网络结构、多模态数据融合以及延迟容忍度较高的推理过程. 相比之下, 空间飞行器控制软件在轨运
                 行面临极端资源受限、强实时性与高度可靠性等综合约束, 决策策略必须以毫秒级时间进行响应, 并保障系统在
                 长时间任务中的持续稳定性, 因而难以直接应用复杂模型或高度依赖数据驱动的                          CPS  方案.
                    因此, 本文聚焦航天控制软件面向未知事件的策略演化问题, 提出将                     ECA  规则机制的快速响应能力、启发式
                 搜索策略的灵活组合能力与强化学习方法的动态适应能力相融合, 构建适用于空间飞行器资源条件的软件自适应
                 演化机制. 该机制在吸收       CPS  系统中已有方法共性的基础上, 结合航天系统运行环境的特殊性, 实现了具备快速
                 响应、策略优化与运行时修复能力的轻量级自适应控制策略框架, 为航天领域在轨软件的演化与自治提供了关键
                 技术支撑.
                  2.3   自适应过程可信性保障方法
                    自适应软件可信性保障的目标是对软件系统的演化策略和演化结果进行验证与评估. 当前验证的研究已经有
                 很多成果, 按模型的获得方式可分为静态验证              (static verification) 和运行时验证  (runtime verification) 两种方法.
   299   300   301   302   303   304   305   306   307   308   309