Claude Code 抓网页老失败?补个工具就好

用 Claude Code 建应用、整理文件夹都挺顺,可一旦让它去网上查资料,问题就来了:拿回来的常常是过时或不相关的搜索摘要,遇到动态内容的站点更是抓瞎。MakeUseOf 撰稿人 Abhijith N Arjunan 说得直白——这么聪明的工具,偏偏在「打开网页」这件基础事上不行。

原因不难理解。它并非不能上网,而是能力有限:读静态 HTML 页面没问题,碰上 JavaScript 渲染或反爬系统就卡住。查论坛讨论时,它只能依赖搜索摘要,而摘要本身往往陈旧。内置工具也不返回结构化数据,模型只能自己从一段概述里连蒙带猜,想精确取某个数值时基本用不上。

该撰稿人的解法是接入一个叫 Firecrawl 的服务:它负责处理 JavaScript 渲染和动态内容,把网页转成大模型能直接消化的结构化内容,免费额度下就能看出差别。

一、给 Claude Code 接上 Firecrawl

  1. 先到 Firecrawl 官网创建一个 API 密钥
  2. 终端执行一条命令即可(密钥换成自己的):claude mcp add --transport http firecrawl https://mcp.firecrawl.dev/v2/mcp --header "Authorization: Bearer 你的密钥"
  3. claude mcp list 确认服务已添加,或在会话里输入 /mcp 查看连接状态和详情
  4. 也可以走账号登录的方式,地址改成 https://mcp.firecrawl.dev/v2/mcp-oauth,由客户端拉起浏览器完成授权
  5. 密钥放进环境变量或客户端自带的密钥存储,官方明确提醒:不要把它拼进 MCP 地址里

网页版 Claude 的接法不同:在 Connectors 列表里添加 Firecrawl,之后用输入框旁的加号按钮选中它触发。

二、接上之后多了哪些工具

  1. firecrawl_scrape:已知网址时取页面内容或结构化字段,想按提示词、按 JSON 结构取数据也是用它的 JSON 格式
  2. firecrawl_search:只有关键词、没有具体网址时用
  3. firecrawl_map:先摸清一个站点有哪些页面,再决定抓哪几个
  4. firecrawl_crawl:成批遍历整站或某个板块
  5. firecrawl_parse:解析 PDF、文档、表格和 HTML 文件

有一处需要留意:原文提到的 Extract 工具,官方文档已标注弃用,现在改用 Scrape 配 JSON 格式,或交给自动检索多个来源的 Agent 工具。

三、变化体现在哪

该撰稿人给出三点实际感受:查论坛近期讨论不再返回半成品答案或错误码;非 HTML 构建的页面也读得动,不必再把网页转成 PDF 或 Markdown 上传一遍;批量从多个网页取数据时,明显比内置抓取快。做文献综述和事实核对时,因为工具确实访问了页面,结果也更可信。

注意事项

它不是万能的。需要过验证码或防护很强的站点进不去,需要多步登录的页面也无能为力,这两种情况仍要靠 Claude 桌面版的内置浏览器。

另外要清楚不同接入方式的差别:不配密钥的免费模式只有搜索、抓取、解析这三个工具,登录或配好密钥才是完整工具集。遇到 401 报错先查配置的地址——填的是 /v2/mcp 就换密钥,填的是 /v2/mcp-oauth 就重新登录,改完记得新开一个会话。

来源:MakeUseOf