itsjustmarsel/axb-formal-defeater
GitHub: itsjustmarsel/axb-formal-defeater
一项预注册的跨模型测量研究,测试 LLM 在对话中遇到显式形式化逻辑反驳时是否会真正遵循并传播该规则,而非仅在表面上翻转答案。
Stars: 0 | Forks: 0
# LLM 如何响应显式形式化反驳因子?
**一项预注册的跨模型测量 —— 以及一种“这是自欺欺人”的框架,它让一位红队成员
促使我退回到数字实际支持的内容。**
在对话进行中,注入一个显式的逻辑规则,该规则**反驳模型刚刚给出的答案**
(例如 `RULE: this relation is NOT transitive`),并测量模型的反应。在一个预注册的
6 个**虚构**领域测试集上(因此记忆不能作为解释 —— 构造上 `knows_rate = 0`),横跨
**5 个模型**,在两个干净且无混淆的维度上:
- **β_formal** — 模型是否*仅*在有效的**演绎**反驳因子上反转,而在弱 /
无关 / 非演绎反驳因子上不会反转?
- **Pr** — 被接受的规则是否**传播**到一个*未绑定的下游推论*,或者
模型只是翻转了表面的答案?
## 结果 —— 一种任务属性,而非特定模型的怪癖
- **所有 5 个模型都在演绎反驳因子上反转,而在弱反驳因子上无一反转**(β_formal),并且
**所有 5 个模型都将规则传播到了下游推论**(Pr > 0)。因此,追踪显式
形式化反驳因子*并将其保持*是该**任务的一项属性**,而“无信念的附和”
假设(翻转表面答案但不传播)在**整个阵容中被驳回**。
- **β_social ≈ 0**(仅在 deepseek 上出现了 +0.167 的微弱效应)→ 这**不是**对权威的阿谀奉承。
查看 [`RESULTS.md`](RESULTS.md) 获取各模型的详细表格。
## 诚实的重新标记(真正的重点)
这项研究最初是为了测量**“自欺欺人”**。一次红队测试和稳健性审计移除了该
标签。原因:反驳因子是**显式**注入的(`RULE: not transitive`),因此所
测量的内容是**对显式形式化规则的遵循 —— 即逻辑可塑性 —— 而不是自欺欺人,也
不是硬性信念修正。** 数字并没有改变;改变的是*解释*,且已被纠正。在
同一阶段,一个桥接假设(持续性 × 严重性)被**以 0/3 驳回**,并且一个“隐藏反驳因子”
的变体被**撤回**。主张被退回到测试集所能支持的确切范围。
## 边界 / 公认的混淆因素(未作掩饰)
- **泛化维度 `G` 存在混淆。**“在已经反转之后保留”这一表述存在歧义 — 一个
刚刚反转过的模型会将“*你会反转吗?*”理解为“*又要反转?不。*”因此 `G` 测量的是解释的
一致性,而不是规则的泛化;`llama` 不明确的结论就是这个**度量伪影**,而不是
“llama 在进行合理化”。两个干净的维度(β_formal, Pr)无论如何都是 5/5 全票通过。
- **反驳因子*非常*显式**,因此追踪它是一种**简单形式让步,而不是硬性
信念修正。** 这**并不**表明模型“克服了自欺欺人”。
- 玩具构造,6 个领域,temp = 0,单次采样(bootstrap 单元 = 领域)。`b4/b5`
“硬性押注”的脆弱性是**deepseek 特有的**(与其他模型的 Jaccard 为 0)—— 这是单一
模型的伪影,而不是任务的问题。
- **预测失败。**预注册的模态预测有两次错误;论点和
标准**并未**被重写(严格的 xfail)。
## 复现 / 来源
- 5 个模型(`deepseek-chat`, `qwen-2.5-7b/72b`, `llama-3.3-70b`, `mistral-small-24b`),temp = 0,
记录与重放。得出的结论(无模型文本)即为凭证;原始的响应缓存和
模型调用测试工具是私有的。
*摘自一个私有研究仓库;此提取仅复制了结果,而非研究
过程。独立工作。MIT。*
*作为人类与 AI 协作公开构建 —— Marsel,与 Claude (Anthropic) 合作。*标签:DLL 劫持, 人工智能, 可解释性, 大模型评测, 大语言模型, 用户模式Hook绕过, 逆向工具, 逻辑推理, 鲁棒性审计