MKurdi21/Agentic-Web-Crawlers

GitHub: MKurdi21/Agentic-Web-Crawlers

一个精心整理的代理化 Web Agent 学术论文合集,包含 48 篇论文、详细总结和结构化研究文档,覆盖能力系统、评估基准、抽取探索与安全保障四大方向。

Stars: 0 | Forks: 0

# 代理化 Web Agent、爬取、抽取、评估与安全 本仓库是在本地精心整理的 48 篇关于 AI 系统的论文合集,这些系统涉及从网络中进行搜索、遍历、操作或抽取,以及紧密相关的工作,包括工具使用、移动端 agent、Web 应用探索和 agent 安全。它包含 24 篇核心/根论文,`Security/` 中有 17 篇论文,`Borderline/` 中有 7 篇相关论文。每篇论文都在 `Summaries/` 中有对应的详细 Markdown 总结。 最好将此合集理解为四个相互交叉的研究体系: 1. **能力:** 用于推理、浏览、导航、交互和多步信息搜寻的系统与训练方法。 2. **评估:** 基准测试、环境、任务验证器、评判 agent 和可复现性基础设施。 3. **抽取与探索:** 可重用的爬虫生成、多模态记录抽取、面向任务的爬取,以及有状态的 Web 应用探索。 4. **安全与保障:** 针对 agent 和搜索系统的攻击、安全基准测试、经过实际评估的防御措施、爬虫可观测性,以及用于 Web 安全测试的 agent。 这些标签描述的是论文在本合集中的主要角色,而非互斥的主题。例如,WebArena 既是环境也是能力测试;WASP 是一个攻击基准测试而非防御;而 AWE、EvoCrawl 和 YURASCANNER 是利用自动化来发现 Web 漏洞,而不是研究针对 Web agent 的攻击。 ## 仓库结构图 | 位置 | 内容 | |---|---| | [`Summaries/`](Summaries/) | 48 份详尽的论文总结;本 README 的主要证据基础 | | 仓库根目录 | 24 篇核心 PDF 文件、`README.md` 以及文献搜索报告 | | [`Security/`](Security/) | 17 篇安全与保障相关的 PDF 文件 | | [`Borderline/`](Borderline/) | 7 篇相关 PDF 文件,涉及移动端 agent、工具使用、爬取、后门及安全基础 | | [`docs/papers.md`](docs/papers.md) | 论文清单及简短的主题描述 | | [`docs/problem_approach_matrix.md`](docs/problem_approach_matrix.md) | 研究问题到解决方法的映射 | | [`docs/gaps_and_research_directions.md`](docs/gaps_and_research_directions.md) | 差距分析与可能的研究方向 | | [`docs/citation_clusters_and_reading_order.md`](docs/citation_clusters_and_reading_order.md) | 引用聚类与扩展阅读路径 | | [`docs/metadata_verification.md`](docs/metadata_verification.md) | 会议/来源验证说明及未解决的元数据不确定性 | ### 合集统计 | 统计单元 | 数量 | |---|---:| | 核心/根 PDF 文件 | 24 | | `Security/` PDF 文件 | 17 | | `Borderline/` PDF 文件 | 7 | | **PDF 文件总计** | **48** | | `Summaries/` Markdown 文件 | **48** | 这些数量是文件系统上的实际统计数,并不意味着所有 48 篇论文都专门探讨浏览器 agent。这 7 篇边缘论文被刻意保留,是因为移动端控制、API/工具选择、有状态爬取、持久化后门以及系统级 agent 安全,能够为 Web agent 继承的机制提供启发。 ## 领域概述 一个代理化的 Web 系统会反复观察环境、解读自然语言目标、选择动作、接收新的观察结果,并持续循环直到停止。视系统而定,观察结果可以是 HTML、DOM 或无障碍树、截图、搜索结果、检索到的文档、工具描述或对话。动作可能包括搜索、链接遍历、点击、输入、滚动、表单提交、标签页控制、引用收集、结构化抽取或外部工具调用。 这与传统的爬虫不同,后者的主循环是在固定策略下进行 URL 发现和抓取。EvoCrawl 和 YURASCANNER 展示了为什么这种边界是可渗透的:在现代应用中访问到代码和表单可能需要有序的、改变状态的交互,而不仅仅是跟随链接。它也不同于经典的抓取。AutoScraper 会生成可重用的抽取程序,而 Webscraper 使用多模态浏览器 agent 加上解析和合并工具来收集索引内容记录。在这两种情况下,目标都是重复进行结构化抽取,而不仅仅是完成一项浏览器任务。 本合集中关于能力的工作,从推理与行动及工具使用的基础(ReAct、Toolformer、Gorilla),经过基于事实的购物和浏览(WebShop、WebGPT),发展到通用的网站控制(Mind2Web、SeeAct、AutoWebGLM、WebVoyager、WebLINX、LASER)、结构化探索与训练(Go-Browse),以及更长周期的搜索或遍历(WebWalker、WebDancer、WebSailor)。这些系统探索了文本/HTML 表示、截图、集合标记定位、特定状态的动作空间、示范、合成轨迹、拒绝采样和强化学习。 评估工作越来越侧重于检查结果,而不是模仿精确的动作序列。WebArena 在自托管站点中使用可编程验证器;VisualWebArena 增加了基于视觉事实的任务;WorkArena 和 WorkArena++ 测试企业工作流;BrowserGym 和 AgentLab 统一了接口、执行、轨迹和基准集成;MMInA 评估跨站点的多跳多模态工作;BrowseComp 强调对晦涩事实的持久发现;BEARCUBS 测试真实 Web 计算机使用;Mind2Web 2 使用特定任务的量规树和评判 agent。离线数据集提高了稳定性,但无法复现实时交互,而实时 Web 测试则面临漂移、速率限制、内容变化和评估器可复现性的挑战。 安全工作必须考虑到 agent 在拥有权限的同时会消费不受信任的内容。本地的论文展示了导致失败的几种不同途径: - **指令通道受损:** 网页、文档、消息或检索项目中的间接 prompt injection(Not What You've Signed Up For;Formalizing and Benchmarking Prompt Injection;WASP;Overcoming the Retrieval Barrier)。 - **证据与推荐操纵:** 捏造的事实、虚假共识、来源多样性和被污染的推荐页面可以在没有明确恶意指令的情况下改变或制造认可(SearchGEO;FORGE)。 - **工具、插件与集成受损:** 恶意的工具描述或破坏的角色/来源边界会影响选择和执行(ToolHijacker;When AI Meets the Web;Unsafe LLM-Based Search)。 - **持久化与供应链受损:** 触发器可以进入规划、记忆、观察、工具或可重用的可执行技能中,并在整个工作流中存活(BackdoorAgent;SkillTrojan)。 - **不安全的用户引导动作与策略失效:** agent 可能会遵从有害请求,或在违反同意、隐私或组织规则的情况下完成名义上的任务(SafeArena;ST-WebAgentBench)。 只有一部分安全论文评估了所提出的防御措施。WARD 训练并测试了多模态 prompt injection 防护;RENNERVATE 使用注意力特征检测并移除可疑的注入 token;ACE 在与不受信任的应用交互之前修复已定义类型的计划,并强制执行隔离和信息流检查;Unsafe LLM-Based Search 评估了答案和页面检查的 pipeline。Formalizing and Benchmarking Prompt Injection 测试了十种现有的防御措施,但发现没有一种是可靠的;WASP 是一个攻击基准测试;Overcoming the Retrieval Barrier 评估并自适应地绕过了简单的检索阶段防御。不应将它们视为已验证有效的防御方案。 ## 论文分类 以下映射表涵盖了所有 48 份总结。即使某篇论文对多个领域都有贡献,它也只会在其主要角色下出现一次。 | 系列 | 论文 | 贡献 | |---|---|---| | 推理与工具使用基础 | ReAct; Toolformer; Gorilla | 推理/动作循环、自监督工具调用以及检索到的 API 文档 | | 浏览器 agent 系统与训练 | WebGPT; WebShop; Mind2Web; AutoWebGLM; SeeAct; LASER; WebLINX; WebVoyager; Go-Browse; WebDancer; WebSailor | 浏览、基于事实的控制、示范、结构化探索以及信息搜寻训练 | | 基准测试与评估基础设施 | WebArena; VisualWebArena; WorkArena; WorkArena++; BrowserGym; MMInA; BrowseComp; BEARCUBS; Mind2Web 2; WebWalker | 功能性任务评估、视觉与企业任务、跨站点工作流、高难度搜索、遍历、评估与可复现性 | | 抽取与有状态探索 | AutoScraper; Webscraper; EvoCrawl; YURASCANNER | 可重用 wrapper 生成、多模态抽取、演化式爬取和面向任务的 Web 扫描 | | Prompt injection 攻击与攻击基准测试 | Not What You've Signed Up For; Formalizing and Benchmarking Prompt Injection; WASP; Overcoming the Retrieval Barrier | 真实世界攻击案例、形式化、端到端 Web agent 受损以及检索优化 | | 证据、搜索、工具与集成威胁 | SearchGEO; FORGE; ToolHijacker; When AI Meets the Web | 认可操纵、Web 内容污染、恶意工具检索以及聊天机器人插件信任边界失效 | | 安全性与有害动作评估 | SafeArena; ST-WebAgentBench | 有害请求遵从评估及感知策略的企业任务评估 | | 经评估的防御系统 | WARD; RENNERVATE; ACE; Unsafe LLM-Based Search | 多模态防护、token 级净化、计划/隔离架构以及恶意结果过滤 | | 持久化与供应链攻击 | BackdoorAgent; SkillTrojan | 轨迹阶段后门和恶意可重用技能 | | Web 安全测试 agent | AWE | 专门的、记忆增强的 Web 渗透测试,具有浏览器后端验证 | | 爬虫可观测性与治理证据 | Identifying AI Web Scrapers Using Canary Tokens | 聊天机器人检索路径的经验归因及收集后阻断的局限性 | | 相邻的评估与安全综合 | AndroidWorld; Toward Secure LLM Agents | 动态移动端 agent 评估及针对 247 篇 agent 安全论文的系统级综述 | ## 精选定量发现 这些数字是具有选择性的参考锚点,并非可以直接比较的排行榜条目。这些论文在任务构建、模型访问权限、观察模态、评分、日期以及环境是实时的、缓存的还是自托管的等方面都有所不同。 | 论文 | 报告的发现 | 解读与注意事项 | |---|---|---| | WebArena | 最佳报告的 GPT-4 设置:总体成功率 **14.41%**;人类在 812 个任务上:**78.24%** | 在可复现的自托管站点中的功能性成功率;依然存在巨大的能力差距 | | VisualWebArena | 最佳原始基线,GPT-4V + 集合标记:**16.37%**;人类:**88.70%** | 视觉访问有所帮助,但视觉定位和长周期控制仍然是瓶颈 | | WebVoyager | 在 643 个实时站点任务上,**59.1%** 的人类评判成功率,而其纯文本变体为 **40.1%** | 强于纯文本消融实验,但实时站点的状态和内容可能会发生漂移;该论文分别验证了基于模型的可扩展轨迹判定与人类的对比 | | MMInA | GPT-4V:完全任务成功率约 **21.8%**;人类:**96.25%** | 单站点能力无法可靠地转化为多跳、多站点的任务完成能力 | | WorkArena++ | 人类在采样课程上:**93.9%**;GPT-4o 在匹配的 L2 任务上:**2.1%**,在 L3 上:**0%** | 组合性的企业工作比原子化的浏览器任务要困难得多 | | BrowseComp | Deep Research:**51.5%**;64 选 1 策略:约 **78%**;人类解决了 **29.2%** 的尝试问题 | 增加浏览尝试和并行尝试会有所帮助;该系统经过相关训练,且基准测试针对的是极其冷门的事实 | | AutoScraper | 在 SWDE 上的 GPT-4-Turbo:**88.69 F1**,**71.56%** 完全正确,**4.06%** 无法执行;平均速度盈亏平衡点在 **19.5 个页面** | 可重用的 wrapper 可以在规模上发挥作用,但结果很大程度上依赖于模型和稳定的页面结构 | | ST-WebAgentBench | 在 375 个任务中要求策略合规时,平均名义完成率从 **24.3%** 下降到 **15.0%** | 传统的完成度得分可能会掩盖同意、策略和可靠性方面的失败 | | WASP | 在一种配置中,中间劫持达到约 **85.7%**;完全达成攻击者目标的成功率峰值约为 **16.7%** | 未能完成攻击往往是因为 agent 自的能力不足,而不是因为防御抵抗 | | Overcoming the Retrieval Barrier | 在报告的表格中,十个 token 的触发器平均达到了 **94.1% Recall@5**;在一种多 agent 设置中,在 **8/10** 次运行中泄露了一个私有 SSH 文件 | 检索是攻击面的一部分;总结指出表格/正文之间存在微小差异(94.1% 对比 95.6%) | | SearchGEO | 在 13 个后端中,整体明确认可攻击的成功率从 **0.0% 到 31.4%** 不等 | 后端的选择影响极大,而失败的攻击仍然可能引发语义偏移 | | ACE | 阻止了所有 **1,054 次 INJECAGENT** 攻击及该论文提出的三种新攻击 | 这是一种经过评估的架构防御,但其基准测试使用的是模拟应用,且其实施缺乏完整的形式化可靠性保证 | 其他有用的规模标志包括 Mind2Web 广泛的离线任务集合、WebLINX 在 155 个站点上的 2,337 次示范、SafeArena 配对的 250 个有害和 250 个安全任务,以及 WARD 包含 177,585 个样本的训练集。单凭规模并不能证明具有真实性、安全性或泛化能力。 ## 本合集支持什么——以及不支持什么 本合集支持以下广泛结论: - 基于结果的长周期、视觉、多站点和感知策略的评估,能够暴露出被步骤级或名义完成度指标所掩盖的失败。 - 更好的页面表示和定位很重要:HTML 剪枝、无障碍树、截图和集合标记在不同设置下各有帮助,但没有一种方法能消除定位瓶颈。 - 结构化探索、示范和环境实践能提高能力,但向陌生站点和不断变化的实时页面迁移的效果仍然参差不齐。 - Agent 安全不仅仅是 prompt injection。检索排名、来源出处、虚假共识、工具描述、记忆、已安装技能、委派的权限以及外部副作用都至关重要。 - 高度的常规任务实用性并不意味着安全,较低的攻击者目标完成率也不意味着防御是可靠的。 ## 本合集揭示的研究空白 这些是在这 48 篇论文语料库中可见的空白,而不是对所有已发表工作的详尽普查: 1. **爬虫与抽取同 agent 评估的结合较弱。** AutoScraper 和 Webscraper 衡量抽取,而 EvoCrawl 和 YURASCANNER 衡量状态发现和安全可达性;很少有共享任务将覆盖率、抽取正确性、成本、抗变更能力和任务完成度联系起来。 2. **对抓取治理的评估不足。** Canary token 研究揭示了不确定且持久存在的检索路径,但对于代理化抽取的同意、出处、删除、速率限制或可执行的站点策略,本合集几乎没有提供实验性的研究。 3. **真实 Web 的真实性与可复现性仍然存在冲突。** 自托管环境能稳定状态;实时和缓存 Web 评估能更好地暴露漂移、搜索行为和对抗性内容,但更难进行版本控制和审计。 4. **轨迹质量衡量不全面。** 最终的成功可能会掩盖不必要的动作、不安全的中间状态、缺乏支持的证据、隐私暴露、策略违规或攻击者的部分控制。 5. **长周期安全比单步检测要薄弱。** BackdoorAgent、SkillTrojan 和安全综述强调了持久化、记忆、组合、撤销和多 agent 传播,但评估仍然支离破碎。 6. **防御措施很少被组合起来。** WARD、RENNERVATE、ACE 和搜索结果过滤在不同的层进行干预;本合集并未确立防护、出处、权限、信息流控制、沙盒和人工审批作为一个完整堆栈是如何运作的。 7. **经过能力调整的安全评估需要更广泛的应用。** SafeArena 将有害和良性能力配对,ST-WebAgentBench 将完成度与策略合规性相结合,WASP 将转移与已完成的有害行为区分开来;这些区别在能力基准测试中尚未标准化。 8. **证据完整性需要一级指标。** Mind2Web 2 评估归因,而 SearchGEO 和 FORGE 展示了认可操纵。更多的评估应该追踪来源独立性、对每个声明的支持、时间敏感性以及证据谱系。 9. **企业及具有重大影响的动作需要更强的授权模型。** WorkArena++、ST-WebAgentBench、ACE 和安全 agent 综述指出了未解决的审批、最小权限、审计、回滚和异常处理需求。 10. **报告的收益通常缺乏不确定性或稳定的可比性。** 几份总结指出缺乏显著性检验、样本量小的子集、专有模型的漂移、对评估器的依赖或来源不一致;基准维护和报告标准仍然是重要的研究基础设施。 请参阅 [`docs/gaps_and_research_directions.md`](docs/gaps_and_research_directions.md) 获取本仓库更长篇幅的综合分析,同时将 48 份详尽总结视为当前的审计基础。 ## 建议阅读路径 作为常规入口: 1. **基础:** ReAct、WebGPT 和 WebShop。 2. **通用 Web 控制:** Mind2Web、WebArena、SeeAct、VisualWebArena 和 WebVoyager。 3. **评估成熟度:** BrowserGym、WorkArena++、MMInA、BEARCUBS、BrowseComp 和 Mind2Web 2。 4. **遍历与深度研究:** WebWalker、Go-Browse、WebDancer 和 WebSailor。 5. **抽取与爬取:** AutoScraper、Webscraper、YURASCANNER 和 EvoCrawl。 6. **安全威胁:** Not What You've Signed Up For、Formalizing and Benchmarking Prompt Injection、WASP、Overcoming the Retrieval Barrier、SearchGEO、FORGE、ToolHijacker、BackdoorAgent 和 SkillTrojan。 7. **安全与防御:** SafeArena、ST-WebAgentBench、WARD、RENNERVATE、ACE 和 Unsafe LLM-Based Search。 8. **系统综合:** Toward Secure LLM Agents。 其他专注路径: - **构建或评估浏览器 agent:** ReAct → Mind2Web → WebArena → VisualWebArena → BrowserGym → WorkArena++。 - **研究信息搜寻 agent:** WebGPT → WebWalker → BrowseComp → WebDancer/WebSailor → Mind2Web 2。 - **研究抽取:** AutoScraper → Webscraper → YURASCANNER → EvoCrawl → Identifying AI Web Scrapers Using Canary Tokens。 - **研究 agent 安全(避免混淆攻击与防御):** Not What You've Signed Up For → Formalizing Prompt Injection → WASP → Overcoming the Retrieval Barrier → SearchGEO/FORGE → WARD/RENNERVATE/ACE → Toward Secure LLM Agents。 请参阅 [`docs/citation_clusters_and_reading_order.md`](docs/citation_clusters_and_reading_order.md) 获取扩展的引用聚类。 ## 证据与审计方法 本 README 是在不进行网络浏览的情况下,对照 `Summaries/` 中的 48 个文件进行审计的。过程如下: 1. 直接从仓库文件系统统计 PDF 和总结的数量。 2. 阅读当前的 README 和本地总结,了解论文的目标、方法、报告的发现、贡献和局限性。 3. 将每份总结分配到一个主要类别,同时允许在行文中存在概念上的交叉。 4. 保留可以在本地验证的仓库链接和合集元数据。 5. 仅在相应的总结报告了该数值时使用精确的定量发现,并保留诸如基准测试范围、评估器类型、训练暴露情况、实时 Web 漂移或内部来源差异等重要的注意事项。 6. 区分攻击演示、攻击基准测试、安全评估和经评估的防御措施。只有当一篇论文实施并评估了某种防御措施时,才将其描述为提供了防御。 ### 本次审计的局限性 - 这些总结是本 README 的主要事实来源;审计并非对论文实验的独立复现。 - 总结的准确性取决于本地存储的 PDF 及其抽取质量。一些总结明确记录了来自原始论文的标签缺失、计数不一致、表格/正文差异或不平等的对比。 - 这些论文跨越了不同的日期、环境、模型版本、指标和威胁模型。它们的百分比不应像来自共享测试集那样进行排名。 - 会议和发表状态可能会发生变化。本 README 不会推断超出 [`docs/metadata_verification.md`](docs/metadata_verification.md) 中本地验证说明之外的元数据。 - 本合集是经过挑选的。这 48 篇论文中的空白只能证明本仓库的覆盖范围情况,并不能证明在其他地方不存在相关工作。 添加论文时,请将其 PDF 添加到相应的合集文件夹中,添加一份匹配的详尽总结,更新文件系统计数,然后重新审视类别、定量锚点、差距和阅读路径。
标签:AI智能体, Web自动化, 人工智能安全, 信息提取, 合规性, 学术论文集, 防御加固