# WebMCP 的潜力：三组真实实验

DeepDeck · 2026 年 9 月 · 本报告展示三组实验的最终对照结果。

## 主要发现

- **Book 批量选书：**两组均成功 5/5。WebMCP 耗时减少 36.2%，总 Token 减少 52.0%。
- **X 三帖读取：**两组均成功 5/5。WebMCP 耗时减少 10.3%，总 Token 增加 8.4%。
- **HN 十帖评论整理：**普通 Computer Use 组完整成功 0/3，正确取回 73.3% 的目标评论；WebMCP 完整成功 3/3。

可复用工具的潜力，来自批量处理、明确的结构化字段和精简的上下文。具体收益取决于任务和工具设计。

## 最终对照数据

耗时、总 Token 和工具调用均为每组中位数。

| 实验 / 方案 | 完整成功 | 耗时（秒） | 总 Token | 工具调用 |
|---|---:|---:|---:|---:|
| Book 普通浏览器 | 5/5 | 46.807 | 92,559 | 5 |
| Book WebMCP | 5/5 | 29.855 | 44,440 | 3 |
| X 普通浏览器 | 5/5 | 62.176 | 134,038 | 7 |
| X WebMCP | 5/5 | 55.748 | 145,301 | 8 |
| HN Computer Use＋离线处理 | 0/3 | 968.067 | 9,582,590 | 69 |
| HN WebMCP | 3/3 | 407.268 | 1,184,254 | 32 |

Book 和 X 的普通组允许 DevTools 与临时浏览器脚本；HN 的普通组只用 Computer Use 取得网页内容，允许文件读写和离线脚本整理已读记录。不同实验不合并计算总成功率。

HN 两组运行不同期，实时评论数量和任务完成度不同。这里并列展示耗时与 Token，不能解释为完成同等工作的加速倍数。总 Token 包含缓存读取与重复输入，不等于费用。

## Book：批量读取

从 Books to Scrape 首页遍历 Fiction 分类四页、65 本书，按英镑价格升序、完整书名升序打破同价排序，选出最便宜三本。返回书名、价格、UPC、库存、产品链接和分类总数。

9 月 10 日两组各五轮，同批交错执行。参考答案由独立 HTML 核验，测试前后稳定。十次正式运行全部成功。

五次 WebMCP 均使用批量详情工具，均没有导航调用。普通组允许临时脚本，两组都完成全部字段。WebMCP 工具调用中位数从 5 次降到 3 次，模型步骤从 6 步降到 4 步。

本任务说明：规则明确、数据稳定且可批量读取的任务，可以减少模型组织重复操作的步骤与上下文。

## X：简单读取

读取三条固定公开帖子的 ID、永久链接、作者名、账号、发布日期与完整原帖正文；按输入顺序返回，归一化连续空白，排除引用帖正文、回复、推荐内容及互动计数。

9 月 12 日两组各五轮，同批交错执行。参考字段来自独立原生无障碍树观察，测试前后保持一致。两组均完整成功 5/5，WebMCP 五轮均没有使用 DevTools 兜底。

WebMCP 耗时中位数为 55.748 秒，普通组为 62.176 秒，减少 10.3%。总 Token 中位数分别为 145,301 与 134,038，增加 8.4%。工具调用分别为 8 次与 7 次。

普通组一次临时浏览器脚本即可读取一帖，任务没有复杂分页或聚合。本次观察到小幅耗时优势，没有总 Token 优势。

## Hacker News：正文和回复关系

仅访问 HN 站内，冻结十个讨论 ID，按页面显示顺序读取每帖前十条有作者、非空且未删除的评论，包括嵌套和简短评论；不足十条须确认耗尽。返回评论 ID、作者、空白归一后的前 80 个 Unicode 字符、父评论 ID 或明确状态、评论链接，以及帖子身份、计数和耗尽状态。

普通组三轮均为绑定 Browser 的真实 Harness 新会话。网页内容通过 Computer Use 获取，文件工具和脚本只处理本轮已经读取的内容；没有脚本联网、DOM/CDP 或 WebMCP 采集。

| 普通组轮次 | 正确取回评论 | 已确认父关系 / 返回评论 | 父关系未知 | 耗时 | 完整成功 |
|---|---:|---:|---:|---:|---|
| 1 | 20/100 | 14/20 | 6 | 7 分 30 秒 | 否 |
| 2 | 100/100 | 25/100 | 75 | 16 分 45 秒 | 否 |
| 3 | 100/100 | 16/100 | 84 | 16 分 8 秒 | 否 |
| 合计 | 220/300（73.3%） | 55/220 | 165 | — | 0/3 |

已返回的 220 条内容和字符格式全部正确，另有 80 条没有采集。第二、三轮读齐了全部目标正文，但未补齐父关系，因此不满足完整成功。

普通组实际使用了 137 次 Computer Use、25 次文件工具、17 次终端调用，保存、重读和离线处理均生效。第一轮导航恢复失败；其他轮次出现焦点和元素失效等问题。三轮都在 30 分钟上限前自行结束。这是本次 Harness 接入及执行的结果，不能概括为浏览器无法读取内容或所有 Computer Use 无法完成。

WebMCP 提供站内导航、精简评论、明确父关系、耗尽状态及快照续读。三轮各 94 条，共 282/282 条目标评论的内容、父关系和字符格式全部正确，完整成功 3/3。每轮 32 次调用、零工具错误，耗时中位数 6 分 47 秒。每轮仅开始时有一次原生状态读取，实际导航使用 WebMCP。

两组固定的是帖子 ID，评论仍随时间变化。WebMCP 运行时有一帖仅四条，每轮目标 94 条；普通组后来运行时每帖均至少十条，每轮目标 100 条。这是相同规则下的历史对照，不是同一静态评论集上的配对实验。

## 方法与比较边界

- 模型路由统一为 openai-codex / gpt-6-astra，默认推理设置，每轮使用新会话。
- 完整成功要求所有字段及执行条件满足，不能用部分正确、访问数量或工具返回数量代替最终交付核验。
- 耗时为正式任务开始到结束；工具准备、构建、独立验证、页面重置与轮间等待不计入。普通组当轮编写离线脚本的时间包含在任务耗时中。
- 主结果衡量已安装工具的复用，不包含首次构建和维护成本，不据此计算回本次数。
- 每组仅 3–5 轮，缓存、后台负载及服务响应未完全控制；不宣称统计显著性或普遍可靠性。
- 三类任务都是只读。没有验证写入操作、所有网站或任意 PC 软件。
- 额外限制保存笔记的运行、不符合 CU 采集条件的直接 HTTP 抓取、被中断的尝试和样本不一致的时间线任务，不纳入本报告的主对照。

## 数据来源

本报告依据 DeepDeck 本地归档的 Book 9 月 10 日、X 9 月 12 日最终对照，以及 HN 9 月 13 日最终普通组和 WebMCP 三轮核验材料整理。

公开汇总数据见同目录 results.json。原始会话和独立核验材料本地归档保存，本页不公开原始会话日志。
