AGENT SKILL EVALUATION · ZHCTPROMPT
从真实问题,到失败报告,再到修复回归
这是 Skill-Up 在协作空间里的统一管理入口。先看用例,再看运行报告;失败只允许归因到 Skill、Eval 或 Engine,对应层修复后先跑失败用例,再跑受影响套件。
2测试套件
7已登记用例
4历史运行记录
1PASS 运行
我到底在哪管理?
Skill-Up 当前是“仓库即管理台”,没有独立 SaaS 后台。日常只需记住下面三个入口。
① 用例库
skills/<skill>/evals/
维护输入、通过条件、禁止结论和用例清单。
② 运行报告
work/.../runs/
查看每次 PASS、FAIL、ERROR、回答和 HTML 报告。
③ 团队治理
skill-up-evaluation-regression
管理失败分类、修复顺序、安全边界、任务与 review。
测试用例库
用例已通过配置验证;“已登记”不等于“全部跑过模型”。
TEST SUITE
binzhou-one-card-regression-gate
4 cases
standards-stack/agent-skills/skills/binzhou-one-card-regression-gate/evals/eval.yaml
| Case ID | 目的 | 定义 |
disabled-mode-preserves-local |
一卡通关闭时必须保留访客和本地钱包链路验证评审不会只检查一卡通用户成功路径。 |
查看 YAML |
mock-not-full-e2e |
Mock 全通过不能替代正式一卡通与硬件验证验证报告会明确区分模拟证据和现场生产验收。 |
查看 YAML |
offline-pending-order-live-gate |
离线消费待支付订单和补偿重试必须受控验收验证没有批准账号和现场窗口时不会冒充资金链闭环。 |
查看 YAML |
recharge-arrival-not-closed |
微信充值接口成功不等于最终到账闭环验证充值成功、支付回调、账本和余额之间的证据链。 |
查看 YAML |
TEST SUITE
zhctprompt-self-update-on-qa
3 cases
standards-stack/agent-skills/skills/zhctprompt-self-update-on-qa/evals/eval.yaml
| Case ID | 目的 | 定义 |
business-repo-sync-routes-away |
拉取业务仓库必须路由到 zhctproject 全量同步验证控制仓库自更新 Skill 不越权代替业务仓库同步。 |
查看 YAML |
clean-divergence-semantic-merge |
干净分叉分支应普通语义合并并验证验证 Agent 不申请例行确认、不改写历史、不丢任何有效内容。 |
查看 YAML |
dirty-unexpected-binary-stops |
未知二进制和并行修改必须停止自动同步验证 Agent 不会 stash、reset、clean、删除或混合提交未知内容。 |
查看 YAML |
运行记录
保留红灯是证据,不覆盖旧目录。PASS/FAIL 表示已得到回答并评分;ERROR 表示引擎基础设施没有完成公平评测。
| 运行 | 状态 | Case | 开始时间 | 报告 |
| regression-binzhou-recharge-fixediteration-1 |
PASS |
1 |
2026-08-12 15:16:08 |
HTML · JSON |
| regression-binzhou-recharge-isolatediteration-1 |
FAIL |
1 |
2026-08-12 15:13:35 |
HTML · JSON |
| fixed-binzhou-rechargeiteration-1 |
ERROR |
1 |
2026-08-12 14:58:02 |
HTML · JSON |
| baseline-binzhou-rechargeiteration-1 |
FAIL |
1 |
2026-08-12 14:54:33 |
HTML · JSON |
五分钟上手
看版本确认本机命令
列用例list-cases
验配置validate
试运行dry-run
跑单例include-case
看报告report.html
1. 进入项目并看版本
cd /path/to/zhctprompt
skill-up --version
skill-up version 0.9.0-1-g19af2ff
2. 查看并验证套件
skill-up list-cases standards-stack/agent-skills/skills/binzhou-one-card-regression-gate/evals/eval.yaml
skill-up validate standards-stack/agent-skills/skills/binzhou-one-card-regression-gate/evals/eval.yaml
skill-up run standards-stack/agent-skills/skills/binzhou-one-card-regression-gate/evals/eval.yaml --dry-run
3. 只跑一个用例
skill-up run standards-stack/agent-skills/skills/binzhou-one-card-regression-gate/evals/eval.yaml --include-case-name recharge-arrival-not-closed --output-dir work/2026-08-12-alibaba-skill-up-adoption/runs/regression-recharge-YYYYMMDD --format html --iteration 1
关键:每次使用新的 output-dir。失败目录不能覆盖;修复后先重跑失败 case,再跑整个相关套件。
失败怎么管
SKILL_DEFECT
Skill 路由或业务判断错误。修改 Skill,不碰正确断言。
EVAL_DEFECT
回答正确但断言过死,或错误答案能漏过。修改 case judge。
ENGINE_INFRA
网络、Codex、凭据、超时、runtime 出错。修引擎,不误伤业务 Skill。
团队责任
刷新这个管理台
新增用例或运行报告后,在仓库根目录执行:
python3 scripts/build-skill-up-management-dashboard.py
然后验证生成页,再提交协作空间。页面每次从当前 case YAML 与 result.json 重建,不单独维护第二份状态。
安全边界
默认只使用本机 runtime、Codex 单轮隔离和本地规则 judge。OpenSandbox、远程 judge、MCP、OTLP、自定义 HTTP engine、沙箱绕过以及客户/生产敏感数据都不默认启用。Skill-Up PASS 证明 Agent Skill 行为,不自动等于生产支付、硬件或第三方资金链 E2E。