Feature/eval optimize loop - #221
Conversation
AI Code Review我已经完成了全面审查。让我来撰写最终的审查结论。 发现的问题
|
|
这里提几个建议: 这样用户看起来比较方便,期望按照这种方式整理代码,数据类的专门放在data目录中 |
Codecov Report✅ All modified and coverable lines are covered by tests. Additional details and impacted files@@ Coverage Diff @@
## main #221 +/- ##
==========================================
Coverage ? 88.44269%
==========================================
Files ? 491
Lines ? 46118
Branches ? 0
==========================================
Hits ? 40788
Misses ? 5330
Partials ? 0 ☔ View full report in Codecov by Harness. 🚀 New features to boost your workflow:
|
AI Code Review发现的问题🚨 Critical
|
AI Code Review确认: 发现的问题
|
AI Code Review这些 regex 模式没有灾难性回溯的风险。数值匹配的替代方案是线性安全的。 我已经完成了审查,代码写得很好。让我给出结论。 让我重新考虑最后一个真正的问题: 现在让我确认一下 最终结论:没有阻塞性问题。让我写出诚实的审查报告,并附上几条建议。 实际上,让我再重新考虑一下是否存在真正的正确性问题:在 让我再看最后一个细节——在 让我完成最后的审查。 发现的问题未发现明显阻塞问题。 整体来看,该 PR 是一个全新加入的 eval/optimize 闭环示例,代码防御性很强:路径穿越/符号链接逃逸、敏感凭据持久化、原子发布、回滚与失败报告、不可信产物校验等都做了较完整的处理。结合 SDK 上下游类型定义逐项验证后,未发现会导致核心功能失败、数据错误或安全风险的确切问题。 💡 Suggestion
总结未发现必须修复的 Critical 或 Warning 级别问题;代码在安全、稳定性与兼容性上处理得当。仅两处可选维护性优化,不影响当前正确性。 测试建议暂无额外测试建议。该示例目录当前未随附单元测试;若后续要纳入 CI 长期运行,建议补充对 |
仅实现 Pipeline 配置校验和 Prompt 隔离工作区创建,不执行实际评测、提示词优化、Gate 或报告生成。
添加 Prompt 感知的 fake agent 与确定性候选提供器。 完成 baseline/candidate 的 train/validation 四次评测,并补充输入漂移保护和离线回归测试。
6ae552b to
afb6a6c
Compare
AI Code Review我已经对代码变更进行了深入审查。现根据要求,我将对 发现的问题
|
关联 Issue
Closes #91
变更说明
本 PR 实现 Evaluation + Optimization 自动回归与提示词优化闭环,覆盖离线验证、Trace 回放和真实模型集成三种运行方式。
主要流程:
主要能力
AgentOptimizer(update_source=False),候选生成期间不直接修改源 Prompt。运行模式
offline:真实LlmAgent配合确定性模型和确定性评测规则。trace:回放预录制轨迹,不执行 Agent。real:真实业务模型配合真实AgentOptimizer反思模型。真实模式必须显式传入
--run-real,连接信息从环境变量读取,优化模型参数通过命令行参数传入。测试覆盖
执行:
pytest -q tests/evaluation/test_eval_optimize_loop_*.py本功能相关测试全部通过。