feat(实验): 把「一类一调」的纪律搬到事实层,紧挨着它管的那几条
`show_guidance` 的「讲完一类紧接着调一次、⛔ 别攒着一起调」工具描述里已经有一份, 但它离「这一版到底有哪几类」隔着整个上下文。这一版在 `modelFacts` 里再放一份到 **紧挨着那几组清单前面**的位置(键名「开放方式」),看模型的排布行为会不会变。⚠ ️ 这是**对照实验**,⛔ 不是"多说一遍更保险": · 措辞与工具描述同源(都用「开放」这个动词、都说「一类」)—— 两处打架时模型只会各取一半 ·⛔ 不写工具名:事实层是给模型的中文事实,代码标识符进来早晚被念给主管听 · 两段各带一份 —— 「要你定的」跟另外两组隔着整段,"离得近不近"正是被测的变量 · 没有可开放的引导时一份都不给(多一条纪律是纯噪音,噪音也占注意力)🔴 破了事实层「⛔ 一个字的指令都不许有」那条边界,所以破得可查、可撤: · 禁词测试改成**摘掉这个键再扫**,⛔ 不是把禁词减了 —— 删掉常量测试自动恢复严格 · 例外只放行"一句指令",那几个禁词字面照旧不许出现(有测试盯着) · promptVersion bump 到 -b:不 bump 就分不出哪些调用带了这句纪律,实验白做 ⇒ 怎么看结果:`agent_invocations.output.steps`(stepShapes)—— 几条引导落在各自独立、且 textLen>0 的步里 = 守住了;挤在同一步 = 没守住。 ⇒ 结论出来后二选一:删掉常量,或升进工具描述并删掉那边的旧句。⛔ 别两处各留半句。 Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
Showing