Page 330 - 《软件学报》2026年第4期
P. 330
吴益露 等: 基于分类检索的操作规划方法 1771
信息时, 模型能够准确判断煎饼是否仍在锅中, 从而生成更为准确的操作序列. 这一结果表明, 结合视觉信息可以
显著提升模型在处理复杂场景时的判断能力.
CPP 仅检索方法
将混合物
倒进锅里
加糖 翻动煎饼
把煎饼
从锅里拿出
CPP 混合预测方法 (真实结果)
将混合物
加糖 翻动煎饼
倒进锅里
图 5 混合规划模块有效性可视化
在图 6 中, 我们展示了操作规划序列长度为 3、4 的可视化结果, 并且与其他方法 (PDPP) 的结果进行对比. 每
个样本包含开始与结束视觉状态以及规划结果. 我们 CPP 的规划结果第 1 行表示动作序列, 第 2 行是分类的事件
类别. 由于 PDPP 没有事件分类模块, 所以只有一行动作序列. 其中绿色框表示正确结果, 红色框表示错误结果. 两
个样本中我们的方法准确预测了完整的动作序列, 而 PDPP 在样本 1 中最后一个动作发生错误, 在样本 2 中对于
事件判断错误, 导致大部分动作都不正确. 我们还提供了序列长度为 3 时的失败的规划结果. 图 7 样本 1 展示了我
们混合规划模块出错的示例, 其中开始和结束动作是正确的, 但模型规划了错误的中间动作. 图 7 样本 2 中, 我们
展示了即使没有得到正确的开始或结束动作, 也有可能规划出正确的中间动作, 但这种情况非常少见. 图 7 样本 3
描述了整个序列完全错误的示例, 由于事件类别错误, 模型在错误的动作子空间中进行了规划, 导致整个序列
错误.
样本1: CPP 规划结果 (真实结果)
把面包 面包翻面 从锅中
放入锅中 取走面包
制作法式吐司
样本1: PDPP 规划结果
把面包
放入锅中 面包翻面 面包翻面
样本2: CPP 规划结果 (真实结果)
加盐 倒醋 加糖 加调料
制作酸黄瓜片
样本2: PDPP 规划结果
搅拌 倒醋 倒油 搅拌
图 6 正确样本的可视化结果

