AI Agent 可靠性实验入口

先看清系统怎么失败,再讨论能不能信。

一个模型可以回答正确,却忽略自己改变了什么;可以承认错误,却在下一轮重复;也可以在证据没有闭合时获得真实行动权限。这里把四类问题分开检查。

观察者效应重复失败行动权限失败记忆
从表层决策到均衡推理的四层观察者深度图。

四类问题

不能压成一个“安全分数”。

观察者深度、失败复发、证据闭合和记忆治理测量的是不同对象。把它们加权成一个总分,会掩盖真正的故障位置。

公开边界

公开的是可检查接口,不是生产控制核心。

公开层包括场景、schema、固定样例、验证器、汇总结果、主张边界和贡献入口;不包括客户数据、私有编排、生产阈值、策略权重、部署凭据或未公开研究。

公开检查通过,只能说明某个工件在已发布条件下符合其规范。它不等于安全认证、部署授权或通用可靠性证明。

论文与代码

每个判断都能落回公开对象。