<?xml version="1.0" encoding="UTF-8"?><rss version="2.0"
	xmlns:content="http://purl.org/rss/1.0/modules/content/"
	xmlns:wfw="http://wellformedweb.org/CommentAPI/"
	xmlns:dc="http://purl.org/dc/elements/1.1/"
	xmlns:atom="http://www.w3.org/2005/Atom"
	xmlns:sy="http://purl.org/rss/1.0/modules/syndication/"
	xmlns:slash="http://purl.org/rss/1.0/modules/slash/"
	>

<channel>
	<title>网页抓取 &#8211; mylogs.cn</title>
	<atom:link href="https://mylogs.cn/tag/%e7%bd%91%e9%a1%b5%e6%8a%93%e5%8f%96/feed/" rel="self" type="application/rss+xml" />
	<link>https://mylogs.cn</link>
	<description>发现、记录、分享</description>
	<lastBuildDate>Sun, 16 Aug 2026 12:47:06 +0000</lastBuildDate>
	<language>zh-Hans</language>
	<sy:updatePeriod>
	hourly	</sy:updatePeriod>
	<sy:updateFrequency>
	1	</sy:updateFrequency>
	
	<item>
		<title>Claude Code 抓网页老失败？补个工具就好</title>
		<link>https://mylogs.cn/claude-code-%e6%8a%93%e7%bd%91%e9%a1%b5%e8%80%81%e5%a4%b1%e8%b4%a5%ef%bc%9f%e8%a1%a5%e4%b8%aa%e5%b7%a5%e5%85%b7%e5%b0%b1%e5%a5%bd/</link>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Sun, 16 Aug 2026 12:47:06 +0000</pubDate>
				<category><![CDATA[经验与技巧]]></category>
		<category><![CDATA[AI工具]]></category>
		<category><![CDATA[Claude Code]]></category>
		<category><![CDATA[Firecrawl]]></category>
		<category><![CDATA[MCP]]></category>
		<category><![CDATA[效率工具]]></category>
		<category><![CDATA[网页抓取]]></category>
		<guid isPermaLink="false">https://mylogs.cn/claude-code-%e6%8a%93%e7%bd%91%e9%a1%b5%e8%80%81%e5%a4%b1%e8%b4%a5%ef%bc%9f%e8%a1%a5%e4%b8%aa%e5%b7%a5%e5%85%b7%e5%b0%b1%e5%a5%bd/</guid>

					<description><![CDATA[用 Claude Code 建应用、整理文件夹都挺顺，可一旦让它去网上查资料，问题就来了：拿回来的常常是过时或 [&#8230;]]]></description>
										<content:encoded><![CDATA[
<p class="wp-block-paragraph">用 Claude Code 建应用、整理文件夹都挺顺，可一旦让它去网上查资料，问题就来了：拿回来的常常是过时或不相关的搜索摘要，遇到动态内容的站点更是抓瞎。MakeUseOf 撰稿人 Abhijith N Arjunan 说得直白——这么聪明的工具，偏偏在「打开网页」这件基础事上不行。</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6a81b53e889dc&quot;}" data-wp-interactive="core/image" data-wp-key="6a81b53e889dc" class="wp-block-image size-large aligncenter wp-lightbox-container"><img fetchpriority="high" decoding="async" width="1200" height="675" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/08/816e749654d97a7bd2e718b56d1dfa56_header.webp" alt="Claude Code 抓网页老失败？补个工具就好" class="wp-image-5088" style="max-width:100%;height:auto;" srcset="https://mylogs.cn/wp-content/uploads/2026/08/816e749654d97a7bd2e718b56d1dfa56_header.webp 1200w, https://mylogs.cn/wp-content/uploads/2026/08/816e749654d97a7bd2e718b56d1dfa56_header-300x169.webp 300w, https://mylogs.cn/wp-content/uploads/2026/08/816e749654d97a7bd2e718b56d1dfa56_header-1024x576.webp 1024w, https://mylogs.cn/wp-content/uploads/2026/08/816e749654d97a7bd2e718b56d1dfa56_header-768x432.webp 768w" sizes="(max-width: 1200px) 100vw, 1200px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">图片来源：MakeUseOf</figcaption></figure>





<p class="wp-block-paragraph">原因不难理解。它并非不能上网，而是能力有限：读静态 HTML 页面没问题，碰上 JavaScript 渲染或反爬系统就卡住。查论坛讨论时，它只能依赖搜索摘要，而摘要本身往往陈旧。内置工具也不返回结构化数据，模型只能自己从一段概述里连蒙带猜，想精确取某个数值时基本用不上。</p>



<p class="wp-block-paragraph">该撰稿人的解法是接入一个叫 Firecrawl 的服务：它负责处理 JavaScript 渲染和动态内容，把网页转成大模型能直接消化的结构化内容，免费额度下就能看出差别。</p>



<h2 class="wp-block-heading">一、给 Claude Code 接上 Firecrawl</h2>



<ol class="wp-block-list"><li>先到 Firecrawl 官网创建一个 API 密钥</li><li>终端执行一条命令即可（密钥换成自己的）：<code>claude mcp add --transport http firecrawl https://mcp.firecrawl.dev/v2/mcp --header "Authorization: Bearer 你的密钥"</code></li><li>用 <code>claude mcp list</code> 确认服务已添加，或在会话里输入 <code>/mcp</code> 查看连接状态和详情</li><li>也可以走账号登录的方式，地址改成 <code>https://mcp.firecrawl.dev/v2/mcp-oauth</code>，由客户端拉起浏览器完成授权</li><li>密钥放进环境变量或客户端自带的密钥存储，官方明确提醒：不要把它拼进 MCP 地址里</li></ol>



<p class="wp-block-paragraph">网页版 Claude 的接法不同：在 Connectors 列表里添加 Firecrawl，之后用输入框旁的加号按钮选中它触发。</p>



<h2 class="wp-block-heading">二、接上之后多了哪些工具</h2>



<ol class="wp-block-list"><li><code>firecrawl_scrape</code>：已知网址时取页面内容或结构化字段，想按提示词、按 JSON 结构取数据也是用它的 JSON 格式</li><li><code>firecrawl_search</code>：只有关键词、没有具体网址时用</li><li><code>firecrawl_map</code>：先摸清一个站点有哪些页面，再决定抓哪几个</li><li><code>firecrawl_crawl</code>：成批遍历整站或某个板块</li><li><code>firecrawl_parse</code>：解析 PDF、文档、表格和 HTML 文件</li></ol>



<p class="wp-block-paragraph">有一处需要留意：原文提到的 Extract 工具，官方文档已标注弃用，现在改用 Scrape 配 JSON 格式，或交给自动检索多个来源的 Agent 工具。</p>



<h2 class="wp-block-heading">三、变化体现在哪</h2>



<p class="wp-block-paragraph">该撰稿人给出三点实际感受：查论坛近期讨论不再返回半成品答案或错误码；非 HTML 构建的页面也读得动，不必再把网页转成 PDF 或 Markdown 上传一遍；批量从多个网页取数据时，明显比内置抓取快。做文献综述和事实核对时，因为工具确实访问了页面，结果也更可信。</p>



<h2 class="wp-block-heading">注意事项</h2>



<p class="wp-block-paragraph">它不是万能的。需要过验证码或防护很强的站点进不去，需要多步登录的页面也无能为力，这两种情况仍要靠 Claude 桌面版的内置浏览器。</p>



<p class="wp-block-paragraph">另外要清楚不同接入方式的差别：不配密钥的免费模式只有搜索、抓取、解析这三个工具，登录或配好密钥才是完整工具集。遇到 401 报错先查配置的地址——填的是 <code>/v2/mcp</code> 就换密钥，填的是 <code>/v2/mcp-oauth</code> 就重新登录，改完记得新开一个会话。</p>



<p class="wp-block-paragraph">来源：MakeUseOf</p>
]]></content:encoded>
					
		
		
			</item>
	</channel>
</rss>
