Page 295 - 《软件学报》2026年第3期
P. 295
1258 软件学报 2026 年第 37 卷第 3 期
所示, 其中, FV=(有效输出数量/输出总数量), MV=(专家验证为正确的提取结果数量/经审核的提取结果总数量),
RCC=(由生成代码片段覆盖的代码行数/原始代码总行数). 实验结果表明, 知识模型提取方法通过了 FV 验证, 并
且基于上下文学习的提示词模板 (ICP) 在 MV 和 RCC 指标上表现更为优秀.
表 1 软件 IP 知识模型提取结果评估 (%)
提示词模板 FV MV RCC
BP 100.00 82.00 43.69
ICP 100.00 88.00 45.74
软件 IP 契约的提取工具中 LLM 使用的提示和参数如下所示: (1) 模型温度: 固定为 0.3, 以确保输出的稳定性
和一致性; (2) 迭代次数: 0 表示不进行迭代, 3 表示进行迭代优化; 使用 3 次迭代是基于先前的测试, 测试表明虽然
迭代优化提高了准确性, 但超过 3 次迭代后准确性的增益十分微小, 表明存在收益递减; (3) 提示词模板: 本实验考
虑两种提示词: ① 基本提示词 (BP): 最简单的指令, 不提供上下文的指导; ② 增强提示词 (EP): 优化的模板, 包含
结构化的设计和逐步推理. 表 2 展示了软件 IP 契约的提取结果, 其中 SCR=(语法正确规约的数量/生成规约的总数
量), 表示语法正确率; SVR=(有效规约的数量/语法正确规约的数量),表示规约有效率; TCR=(SCR×SVR), 表示总体
正确率. 该实验采用两阶段设计: 在第 1 阶段, 使用 GPT-4o-mini, 证明了提示词和迭代优化都能独立地提高性能
(第 1–4 行). 它们的结合应用导致了性能的进一步增强 (第 3, 4 行), 这表明了这两种策略之间的协同增强作用; 在
第 2 阶段, 使用两种模型 GPT-4o 和 DeepSeek-V3, 它们都达到了 90% 的 SCR 值 (第 5, 6 行). 然而, 所有模型的语
义理解都达到了一个平台期, GPT-4o 和 DeepSeek-V3 的 SVR 值仅略高于 GPT-4o-mini.
表 2 软件 IP 契约提取结果评估
模型 提示词模板 迭代 SCR (%) SVR (%) TCR (%)
0 4.00 64.52 2.58
BP
3 18.00 71.43 12.86
GPT-4o-mini
0 20.00 79.01 15.80
EP
3 64.00 48.11 30.79
GPT-4o 94.00 57.83 54.36
EP 3
DeepSeek-V3 90.00 58.87 52.98
总之, 通过对太搜这一复杂案例开展实验研究, 我们验证了本节提出的软件 IP 提取方法在应对复杂嵌入式软
件时的有效性和可行性. 该实验结果表明, 该方法具备高效处理复杂嵌入式软件的能力, 能够为文献 [14] 中提出
的 IPESIS 的落地应用提供有力的技术支撑, 推动其从理论走向实际.
9 总 结
由于嵌入式系统实现功能越来越多, 软件规模变得越来越庞大和复杂, 安全攸关领域对软件可靠性要求越来
越高, 因而如何高效开发可靠嵌入式软件是一个重大挑战. 为了提高嵌入式软件开发效率和质量保障, 文献 [14]
提出了软件 IP 的概念和基于软件 IP 的嵌入式软件智能合成开发模式及其框架. 在此基础上, 本文提出了嵌入式
软件 IP 通用模型及其不同层次的视图表示, 进一步丰富了软件 IP 的语义. 与现有方法相比, 本文提出的软件 IP
模型的优势主要体现在以下 3 点.
(1) 中间知识制品. 现有的方法缺乏对嵌入式软件设计与开发过程中产生的中间知识的表示, 因此会给二次开
发带来困难. 软件 IP 模型包含了嵌入式软件开发过程中的所有必要领域知识以及中间产品, 支持软件 IP 的自动
搜索与适配, 为软件智能合成奠定知识基础.
(2) 组合正确性. MDD 和 CBD 缺乏对嵌入式环境的假设以及支撑平台的约束, 这使得组装变得很困难, 特别
是组装后的系统正确性很难由模型或者构件的正确性保证. 软件 IP 模型吸取了 DbC 思想, 它对嵌入式环境以及
平台都有明确的假设和约束, 所以嵌入式系统的正确性在一定程度上可以由组成它的软件 IP 的正确性来保证. 因

