golden-set-integrity.spec.ts
2.82 KB
-
feat(助手): P6 提示词减法 + golden set 用例集 · 77e84aaf
25 提示词减法 —— 重点不是删多少行,而是修掉**三处已经变成错的** (留着它们模型会照着告诉主管错的东西): - 「两个基数都自动沿用主管上一次的值」+ 首次估法 `在岗 × 20` → P1 已改成 `在岗 × 15 × D` 且不再沿用 - 「
⛔ 不许拿上一轮的数字回答」→ 与 P3 之后的第 1 条**直接矛盾** (现在是"条件对得上就能用",而参数就写在 〔调用 …〕 摘要行里) - 「转述那三句依据(原话)」→ P2 之后那三句成品句子已经不喂给模型了 外加清掉五处「照抄 xxxNote」残留;重写文件顶部方法论注释 —— 原文写的是「凡是靠模型算对的约束一律降级成照抄」,P2 已经把这条推翻了。 26 golden set: - tests/golden/assignment-golden.ts —— 9 条用例,每条都来自**真实踩过的坑** 且写明由来。🔴 判定标准是**工具调用**不是文字:最贵的那类失败恰恰是 「话说得挺好、工具一次没调」(实测栽过两次,两次文字读起来都完全正常)。⚠ ️ 用「必须调到 / 必须没调」两个集合,⛔ 不锁完整顺序 —— 多查一次不算错, 锁死顺序会让每次合理优化都变成红。 - golden-set-integrity.spec.ts(**进 CI**)—— 防腐:用例引用的工具还在不在、 每条有没有写由来、id 有没有重复、mustNotSay 有没有被拿去锁措辞偏好。 -⬜ **跑批 runner 未做**,dev-plan 里如实标了。它要真调模型(花钱/慢/有波动)、 刻意不进 CI,且开工前要先定:拿哪套凭据、用哪个诊所的数据、多少失败率算回归。⛔ 不做一个跑不起来的 runner 然后宣称 P6 完成。 1247 passed;web 20 passed;type-check(含 tests)干净。 Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>luoqi committed