AmsonntagChow/ratemyharness

GitHub: AmsonntagChow/ratemyharness

为 AI Agent 运行底座提供基于证据的发布前系统性审查,跨组件验证 runtime 不变量并给出上线决策。

Stars: 1 | Forks: 0

# RateMyHarness 为 AI Agent 运行底座提供基于证据的发布审查。 [![MIT License](https://img.shields.io/badge/license-MIT-2f855a.svg)](LICENSE) [![Agent Skills](https://img.shields.io/badge/Agent%20Skills-compatible-5b5bd6.svg)](https://agentskills.io/) RateMyHarness 审查 AI Agent 周围的 runtime:循环、工具分发、context、状态、记忆、权限、沙盒、审批、重试、预算、取消、终止、追踪、评估和恢复。 中文一句话:我做了一个给 AI Agent 运行底座做上线体检的 Skill。 ## 它是什么 - **模型** 提议下一步操作。 - **循环** 重复调用模型和工具。 - **Harness**(运行底座)包含该循环并执行周围的 runtime 规则。 - **Skill** 塑造宿主 harness 内部的行为;它不能授予权限或替代沙盒。 所以没错:循环是 harness 的一部分。RateMyHarness 可以审查一个孤立的循环,但它会将该结论标记为组件受限的,而不是假装已经审查了整个 runtime。 ## 安装 选择一种方法。不要在同一个客户端和范围内安装重复的副本。 对于 Codex,将此代码库添加为插件市场: ``` codex plugin marketplace add AmsonntagChow/ratemyharness ``` 然后在 Codex CLI 中打开 `/plugins`,或在桌面应用中打开 Plugins 目录,安装 **RateMyHarness**,并开启一个新会话。你也可以运行: ``` codex plugin add ratemyharness@ratemyharness ``` 对于 Claude Code: ``` /plugin marketplace add AmsonntagChow/ratemyharness /plugin install ratemyharness@amsonntagchow-ratemyharness /reload-plugins ``` 对于 Cursor、Codex、Claude Code 或其他通过便携式 `skills` CLI 连接的 Agent Skills 客户端: ``` npx skills add AmsonntagChow/ratemyharness --skill ratemyharness ``` 也可以通过将 `skills/ratemyharness` 复制到 agent 使用的 skills 目录来手动安装该 Skill。 ## 开始审查 给它一个真实的 harness 代码库、runtime 文件夹、配置、trace 集合、部署或可运行的 fixture。如果 prompt 中尚未指定它们,RateMyHarness 会首先询问两个设置并等待: ``` 1. 角色:Agent 产品负责人 / Staff Agent Runtime 工程师 / 红队审查员 / SRE 运行负责人 / 答辩老师 2. 程度:快速体检 / 严格评审 / 上线门禁 / 特权审查 / 生死审查 ``` 它绝不会默默默认采用工程师角色或最严苛的程度。例如: ``` As a Staff agent-runtime engineer, audit ./runtime for privileged production. Do not edit it or call external services. Give me the three fastest fixes. ``` | 角色 | 主要判断标准 | |---|---| | Agent 产品负责人 | 该 harness 是否足以提升任务成功率,从而值得用户投入精力、延迟和成本? | | 资深 Agent runtime 工程师 | 循环、分发、状态、context、并发、重试和终止的语义是否正确? | | 红队审查者 | 不可信的内容、过高的权限、机密、记忆、工具或副作用是否会导致其不安全? | | SRE/运维人员 | 运维人员能否对该 runtime 进行限制、观察、取消、恢复、发布和回滚? | | 答辩教授 | 作者是否真正理解此交付物中实际存在的风险? | 对作者理解的评分是独立的。薄弱的回答不能抹除已验证的 runtime 行为,而华而不实的解释也不能使不安全的 harness 变得安全。 ## 审查内容 1. 任务和循环的正确性,包括工具调用/结果的相关性以及真实的完成状态。 2. 工具执行、授权、并发、幂等性和部分副作用。 3. Context 排序、来源、截断、持久状态、记忆和会话隔离。 4. 超时、重试预算、取消、检查点、恢复和确定性终止。 5. 权限、沙盒、审批、不可信输入、机密、网络和租户边界。 6. 队列、背压、发布、回滚、追踪、故障恢复、延迟和成本。 7. 相对于最简单可靠的基础循环或先前 runtime 基准,可衡量的任务提升。 它对以下情况使用严格的否决机制:权限绕过、跨边界数据泄露、不可信的内容控制 runtime、失控的执行、重复的不可逆副作用、捏造的完成状态、不安全的代码执行、隐藏的网络行为、核心 runtime 路径中断以及许可证违规。优秀的平均分不能抵消其中的任何一个失败项。 ## 结论 ``` Requested target: Maximum safe target: Decision: READY | READY WITH CONDITIONS | NOT READY | BLOCKED | INSUFFICIENT EVIDENCE Harness score: optional Runtime evidence: Failure and recovery evidence: Authority evidence: Operational value: Confidence: Blockers: Verified findings: Unverified risks: Top 3 actions: Retest plan: ``` 每项发现都包含精确的复现步骤、预期和实际行为、证据强度、影响、最小安全修复方案、验收测试以及相邻的回归用例。 ## 为什么这不是又一个代码审查工具 代码审查工具可以发现局部 bug。RateMyHarness 会跨越组件追踪 runtime 不变量:从审批到分发,从工具调用到结果,从重试到外部影响,从会话到记忆,从取消到清理,从检查点到恢复,以及从 trace 到终端声明。 有效的配置只能证明结构,不能证明价值。公开或特许的审批需要全新的端到端运行、故障注入、部署证据、权限测试,以及与更简单的基准进行比较。 ## 评分 可选的评分器是确定性的,并且仅使用 Python 标准库: ``` python3 skills/ratemyharness/scripts/score_review.py --pretty evals/scorecards/blocked-release.json ``` 它会验证证据链接和权重,强制执行特定目标的检查,对评分规则进行指纹识别以供重新审查,并且总是将活动的否决状态转换为 `BLOCKED`。 ## 信任与安全 首次审查是只读的。RateMyHarness 不会授予工具、部署服务、安装依赖项、削弱沙盒、读取凭证、发送遥测数据或调用真实的外部系统。它的 fixture 使用合成值和内存中的副作用。 RateMyHarness 本身只是一个运行在宿主 harness 内部的 Skill。宿主的沙盒、权限和审批系统仍然是真正的安全边界。请参阅 [SECURITY.md](SECURITY.md)、[PRIVACY.md](PRIVACY.md) 和 [TERMS.md](TERMS.md)。 ## 仓库布局 ``` .claude-plugin/ Claude Code plugin and marketplace manifests .agents/plugins/ Codex repository marketplace plugins/ratemyharness/ self-contained universal plugin and listing assets skills/ratemyharness/ canonical portable Skill, references, UI metadata, scorer evals/trigger_cases.json positive and near-miss selection evals evals/execution_cases.json with-Skill versus without-Skill behavior evals evals/fixtures/ safe synthetic runtime failure cases submission/ public directory listing copy and review tests scripts/ package synchronization and repository validation tests/ deterministic scorer tests ``` ## 开发 ``` python3 scripts/sync_codex_plugin.py --check python3 scripts/validate_repo.py python3 -m unittest discover -s tests -v claude plugin validate . --strict python3 /path/to/plugin-creator/scripts/validate_plugin.py plugins/ratemyharness ``` 贡献必须包含行为证据,而不仅仅是文档描述的改动。请阅读 [CONTRIBUTING.md](CONTRIBUTING.md)。 此代码库的创作方法受到了 [从零做一个高质量 Agent Skill,并把它当开源项目运营](https://research.xishe.ai/skill-authoring-and-oss) 的启发,特别是关于描述优先的发现机制、渐进式信息披露、分离触发和执行评估、引用完整性、零依赖脚本以及开源分发的指导。 ## 许可证 [MIT](LICENSE) © 2026 AmsonntagChow
标签:AI安全, Chat Copilot, SOC Prime, 开发工具, 测试与审计, 逆向工具