三组真实实验,探索 WebMCP 的潜力
让一次探索,
成为下一次的能力。
Agent 已经学会的操作,能否留给下一次任务?我们用选书、读帖和评论整理,测试把网站操作保存为 WebMCP 工具之后,会发生什么。
查看实测结果工作流程示意 · 以下实验测量已安装工具的复用
批量选书耗时
两组均成功 5/5;Token 减少 52.0%
02 / X−10.3%简单读帖耗时
两组均成功 5/5;Token 增加 8.4%
03 / HACKER NEWS3/3WebMCP 完整交付
普通 CU 组 0/3;正文取回率 73.3%
耗时为中位数。不同实验的普通组能力不同,不合并总胜率;HN 两组不同期且完成度不同。
THE RESULTS
看见差异,也看清条件。
切换任务与指标,查看最终有效对照。相同模型,新会话,按最终交付逐项核验。
每轮中位数 · 数值越低越少
Books to Scrape
同批各 5 轮;普通组允许 DevTools 和临时浏览器脚本。展示已安装工具的复用,构建与准备时间不计入。
BOOKS TO SCRAPE
批量读取 / 同批各 5 轮
重复的读取,
可以一次完成。
遍历 Fiction 四页、65 本书,找出最便宜的三本,再取回价格、UPC、库存和链接。
五轮 WebMCP 都主动选择了批量详情工具,没有额外导航。普通组已允许临时浏览器脚本;两组均完成全部字段。
规则明确、可以批量读取的任务,更容易把重复操作转化为可复用工具的收益。
- 完整成功
- 5/5 → 5/5
- 工具调用中位数
- 5 → 3
- 总 Token 中位数
- 92,559 → 44,440
普通浏览器 → WebMCP · 2026-09-10
X / THREE FIXED POSTS
简单读取 / 同批各 5 轮
简单读取,
也能直接调用。
读取三条固定帖子的作者、日期、完整原帖正文和链接,排除引用帖、回复与推荐内容。
两组全部成功 5/5。WebMCP 五轮均直接完成读取,没有使用 DevTools 兜底;普通组允许临时浏览器脚本。
WebMCP 耗时减少 10.3%,总 Token 增加 8.4%。简单任务中的收益体现在耗时,是否节省 Token 仍取决于调用步骤和上下文。
- 完整成功
- 5/5 → 5/5
- 耗时中位数
- 62.176s → 55.748s
- 总 Token 中位数
- 134,038 → 145,301
- 工具调用中位数
- 7 → 8
普通浏览器 → WebMCP · 2026-09-12
HACKER NEWS / TEN DISCUSSIONS
复杂整理 / 最终各 3 轮
读到正文,
还要读懂关系。
十个站内讨论,每帖前十条有效评论。除了正文,还要准确说明:每条评论回复了谁。
普通组只用 Computer Use 采集网页,但允许文件笔记与离线脚本。最后两轮都读齐了正文;多数父关系没有确认,因此完整成功仍为 0/3。
WebMCP 直接返回评论、父关系和耗尽状态,并提供站内导航。三轮共 282 条目标评论,内容、父关系与字符格式全部正确。
完整任务成功次数
已返回评论的父关系:普通组 55/220 确认,165 条未知;WebMCP 282/282 确认。普通组另有 80 条未采集。
固定的是帖子 ID,评论仍实时变化:WebMCP 当时每轮 94 条,普通组后来每轮 100 条。普通组还出现导航、焦点和元素失效问题,三轮均在 30 分钟上限前自行结束。结果反映本次 Harness 接入与执行,不代表所有 Computer Use 的能力上限。
WHAT BECOMES POSSIBLE
把验证过的操作,
留给更多次任务。
三组实验指向同一个机会:让 Agent 少做重复探索,直接得到任务需要的能力与信息。收益取决于工具如何设计。
批量完成重复工作
把多次详情读取合并,让模型专注于选择和判断。
明确表达任务信息
返回关系、顺序和完成状态,让最终结果可以核验。
只携带必要上下文
工具目录按需发现,源码按需读取,避免每一步重复负担。
METHOD & EVIDENCE
结论有依据,也有边界。
这是三个具体只读任务的实测记录。它展示潜力,不承诺所有网站都有相同收益。
普通组是否允许脚本和记笔记?
Book 和 X 普通组允许 DevTools、临时浏览器脚本。HN 最终普通组仅通过 Computer Use 取得网页内容,允许文件读写和离线脚本处理已读记录。禁止保存记录的旧组已被替换;Python 直接 HTTP 抓取组不计为 Computer Use。
成功、耗时和 Token 如何统计?
成功要求所有字段和执行条件满足,不以“访问过页面”或部分正确代替。耗时按每轮实际开始到结束计算,准备和轮间锁屏等待不计入。表中为中位数;总 Token 含缓存读取和重复输入,不等于费用。
为什么不提供一个总成功率或总加速倍数?
三类普通组能力不同,不能混算。Book 和 X 同批交错执行;HN 采用不同时间的历史对照,实时评论数量不同且普通组未完整完成,不能算同等工作加速。每组仅 3–5 轮,缓存和服务负载未完全控制,不宣称统计显著性。
哪些结果没有放进主对照?
X Following 曾出现空页面和不同样本,不能据此比较效率,也没有证实反爬。中断的 HN 笔记尝试、旧禁笔记条件和直接联网脚本组单独保留。Book 早期只记录一次首次构建,不与后续复用结果拼算回本次数。全部实验都是只读任务,未验证写入操作或任意 PC 软件。
用数据,了解每一项结果。
下载完整中文报告与公开汇总数据,查看三组实验结果及比较条件。
EXPLORE WITH DEEPDECK