a641a1fc11
193 次真实运行报了 9 处击穿,核下来是判据的错不是库的错:动作被拒绝或环境故障时,库 刻意不把执行器给的观察回填进历史,而是换成合成观察那一段。两个字段承载的本来就不是同 一件事——一个是执行器原文的留痕,一个是真正喂给模型的文本。 改判据时顺着源码发现被替换的是三列不是一列:观察文本、是否合成、截断字符数在那两档下 全部由库填。所以旧判据在环境故障那一档上必然也会误报,只是这 193 次里没撞上真的环境 故障;截断数那一列则是恰好两边都是 0,潜伏着没炸。 现在 executed 档三列仍然逐字比对,另两档改成断言步记录的「是否合成」标记确实立起来了—— 库既然替换了观察,不立这个标记才是真出了问题。 Co-Authored-By: Claude Opus 5 (1M context) <noreply@anthropic.com>