作者:互联网 时间: 2026-07-27 20:00:02
先给大家把结论说在前头:web-access 可不是让 AI Agent 凭感觉瞎点网页,而是把网页相关的任务拆成了路由、观察、动作、校验四个环节。它适合需要登录状态、动态 DOM 或者真实交互的场景;要是只是抓取公开静态页面,还是优先用搜索、WebFetch 或者 curl 成本更低,也更稳定。
你在浏览器里能看到网页内容,可不代表这些内容本来就写在首屏的 HTML 里。前端脚本可能等登录后才去拉取数据,列表得滚动才会加载更多,点按钮才弹出的面板甚至可能藏在 Shadow DOM 或者 iframe 里。这时候用静态请求拿到的就是个空壳子,再怎么重复抓取也出不来浏览器运行后才有的状态。

CDP 全称是 Chrome DevTools Protocol,是 Chromium 浏览器对外开放的调试协议。web-access 会在 Agent 和浏览器之间跑一个本地代理:Agent 不会直接控制鼠标,而是调用一套可检查的 HTTP 接口。
/targets 获取标签页信息,通过 /info 和 /eval 读取 URL、标题、DOM 结构与元素状态。/click、/scroll、表单填写或者 /navigate 来推进页面状态。新版接口要求 /new 与 /navigate 把 URL 放进 POST body,免得查询字符串把目标 URL 给截断了。/screenshot 核对页面视觉状态。要是操作完没达到预期效果,可不能一个劲连点。
| 任务信号 | 优先路径 | 切换条件 |
|---|---|---|
| 公开文章、文档、已知 URL | WebSearch / WebFetch / curl | 正文缺失、返回登录墙或者拿到的是前端空壳 |
| 账号后台、私有内容 | CDP | 先确认登录状态与目标域名 |
| 滚动列表、弹窗、标签切换 | CDP | 每次动作后检查 DOM 或截图确认 |
| 图片、验证码、画布承载关键信息 | CDP + screenshot | 视觉证据仅用于读取,不绕过站点安全管控 |

工程上至少得有三道闸:页面内容只当数据看,不当成高优先级指令;发帖、付款、删除、提交表单这类有副作用的操作,必须先拿到明确授权;对敏感站点做自动化操作可能触发风控,账号风险可不是靠技术包装就能消掉的。任务完成后只关闭 Agent 自己创建的标签页,不碰读者原有页面。判断标准很简单:每一步都有来源、有目标、有可观察的结果,才是一条可审计的网页操作链。