Poesitor/orchestrate-dispute-agent

GitHub: Poesitor/orchestrate-dispute-agent

一个模拟 HackerRank Orchestrate 挑战的练习项目,要求构建 LLM Agent 对交易纠纷进行策略合规分诊与裁决,包含检索grounding与对抗性输入防护。

Stars: 0 | Forks: 0

# HackerRank Orchestrate — 练习模拟(七月版) **这是一个非官方的练习模拟**,高度还原了真实的 HackerRank Orchestrate 2026 年 5/6 月版本(支持工单分类和 损害索赔验证)。形式相同:输入混乱的真实世界记录,输出基于事实的 结构化决策,包含对抗性数据行,并采用 AI 评判式评分标准。 ## 如何运行你的模拟 1. 启动一个 24 小时计时器(或给自己 6-8 小时进行压缩测试)。 2. 在你的 AI 编码工具(Claude Code、Cursor 等)中打开此仓库,并让 它读取 `AGENTS.md` — 那就是任务说明。严格按照书面要求执行,包括 日志记录契约。 3. 构建 agent,构建 `evaluation/run_eval.*`,在 8 个带标签的 样本案例上进行迭代,然后为 24 个实际案例生成 `output.csv`。 4. 完成后,根据 `SPOILERS_ANSWER_KEY.md` 进行自我评分(在完成之前绝对不要 打开它),并大声排练 AGENTS.md §8 中的评审面试问题。 ## 仓库地图 - `AGENTS.md` — 挑战任务说明和规则(从这里开始) - `data/policies/` — 8 份策略文档,这是你的 agent 的唯一事实来源 - `dispute_cases/dispute_cases.csv` — 24 个实际案例(无标签) - `dispute_cases/sample_cases.csv` — 用于你的 eval harness 的 8 个带标签案例 - `code/` — 你的解决方案(python 或 node 入口点) - `evaluation/` — 你的 eval harness - `output.csv` — 你的 agent 必须填充的仅包含表头的模板 - `log.txt` — 根据 AGENTS.md §6.4 的追加式工作日志 - `SPOILERS_ANSWER_KEY.md` — 预期答案 + 原理说明。请先完成测试。 ## 与真实活动的区别 - 真实语料库要大得多(700+ 文档) — 请据此设计检索架构。 - 真实数据集和评分标准是隐藏的;此处包含了答案供自学使用。 - 真实活动以 30 分钟的语音 AI 评审面试结束,并有严格的 提交门户截止期限。 # orchestrate-dispute-agent
标签:MITM代理, 开发测试模拟, 提示词注入防御, 检索增强生成, 自动化分类, 逆向工具, 金融风控