itsjustmarsel/axb-formal-defeater

GitHub: itsjustmarsel/axb-formal-defeater

一项预注册的跨模型测量研究,测试 LLM 在对话中遇到显式形式化逻辑反驳时是否会真正遵循并传播该规则,而非仅在表面上翻转答案。

Stars: 0 | Forks: 0

# LLM 如何响应显式形式化反驳因子? **一项预注册的跨模型测量 —— 以及一种“这是自欺欺人”的框架,它让一位红队成员 促使我退回到数字实际支持的内容。**
在对话进行中,注入一个显式的逻辑规则,该规则**反驳模型刚刚给出的答案** (例如 `RULE: this relation is NOT transitive`),并测量模型的反应。在一个预注册的 6 个**虚构**领域测试集上(因此记忆不能作为解释 —— 构造上 `knows_rate = 0`),横跨 **5 个模型**,在两个干净且无混淆的维度上: - **β_formal** — 模型是否*仅*在有效的**演绎**反驳因子上反转,而在弱 / 无关 / 非演绎反驳因子上不会反转? - **Pr** — 被接受的规则是否**传播**到一个*未绑定的下游推论*,或者 模型只是翻转了表面的答案? ## 结果 —— 一种任务属性,而非特定模型的怪癖 - **所有 5 个模型都在演绎反驳因子上反转,而在弱反驳因子上无一反转**(β_formal),并且 **所有 5 个模型都将规则传播到了下游推论**(Pr > 0)。因此,追踪显式 形式化反驳因子*并将其保持*是该**任务的一项属性**,而“无信念的附和” 假设(翻转表面答案但不传播)在**整个阵容中被驳回**。 - **β_social ≈ 0**(仅在 deepseek 上出现了 +0.167 的微弱效应)→ 这**不是**对权威的阿谀奉承。 查看 [`RESULTS.md`](RESULTS.md) 获取各模型的详细表格。 ## 诚实的重新标记(真正的重点) 这项研究最初是为了测量**“自欺欺人”**。一次红队测试和稳健性审计移除了该 标签。原因:反驳因子是**显式**注入的(`RULE: not transitive`),因此所 测量的内容是**对显式形式化规则的遵循 —— 即逻辑可塑性 —— 而不是自欺欺人,也 不是硬性信念修正。** 数字并没有改变;改变的是*解释*,且已被纠正。在 同一阶段,一个桥接假设(持续性 × 严重性)被**以 0/3 驳回**,并且一个“隐藏反驳因子” 的变体被**撤回**。主张被退回到测试集所能支持的确切范围。 ## 边界 / 公认的混淆因素(未作掩饰) - **泛化维度 `G` 存在混淆。**“在已经反转之后保留”这一表述存在歧义 — 一个 刚刚反转过的模型会将“*你会反转吗?*”理解为“*又要反转?不。*”因此 `G` 测量的是解释的 一致性,而不是规则的泛化;`llama` 不明确的结论就是这个**度量伪影**,而不是 “llama 在进行合理化”。两个干净的维度(β_formal, Pr)无论如何都是 5/5 全票通过。 - **反驳因子*非常*显式**,因此追踪它是一种**简单形式让步,而不是硬性 信念修正。** 这**并不**表明模型“克服了自欺欺人”。 - 玩具构造,6 个领域,temp = 0,单次采样(bootstrap 单元 = 领域)。`b4/b5` “硬性押注”的脆弱性是**deepseek 特有的**(与其他模型的 Jaccard 为 0)—— 这是单一 模型的伪影,而不是任务的问题。 - **预测失败。**预注册的模态预测有两次错误;论点和 标准**并未**被重写(严格的 xfail)。 ## 复现 / 来源 - 5 个模型(`deepseek-chat`, `qwen-2.5-7b/72b`, `llama-3.3-70b`, `mistral-small-24b`),temp = 0, 记录与重放。得出的结论(无模型文本)即为凭证;原始的响应缓存和 模型调用测试工具是私有的。 *摘自一个私有研究仓库;此提取仅复制了结果,而非研究 过程。独立工作。MIT。* *作为人类与 AI 协作公开构建 —— Marsel,与 Claude (Anthropic) 合作。*
标签:DLL 劫持, 人工智能, 可解释性, 大模型评测, 大语言模型, 用户模式Hook绕过, 逆向工具, 逻辑推理, 鲁棒性审计