<?xml version="1.0" encoding="UTF-8"?><rss version="2.0"
	xmlns:content="http://purl.org/rss/1.0/modules/content/"
	xmlns:wfw="http://wellformedweb.org/CommentAPI/"
	xmlns:dc="http://purl.org/dc/elements/1.1/"
	xmlns:atom="http://www.w3.org/2005/Atom"
	xmlns:sy="http://purl.org/rss/1.0/modules/syndication/"
	xmlns:slash="http://purl.org/rss/1.0/modules/slash/"
	>

<channel>
	<title>AI检索 &#8211; mylogs.cn</title>
	<atom:link href="https://mylogs.cn/tag/ai%e6%a3%80%e7%b4%a2/feed/" rel="self" type="application/rss+xml" />
	<link>https://mylogs.cn</link>
	<description>发现、记录、分享</description>
	<lastBuildDate>Wed, 05 Aug 2026 22:56:14 +0000</lastBuildDate>
	<language>zh-Hans</language>
	<sy:updatePeriod>
	hourly	</sy:updatePeriod>
	<sy:updateFrequency>
	1	</sy:updateFrequency>
	
	<item>
		<title>4B 小模型叫板 GPT-5.6 Sol，省 100 倍的说法只对一半</title>
		<link>https://mylogs.cn/4b-open-model-retrieval-vs-gpt56-sol-cost/</link>
					<comments>https://mylogs.cn/4b-open-model-retrieval-vs-gpt56-sol-cost/#respond</comments>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Wed, 05 Aug 2026 22:55:59 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[AI检索]]></category>
		<category><![CDATA[GPT-5.6]]></category>
		<category><![CDATA[大模型成本]]></category>
		<category><![CDATA[开源模型]]></category>
		<category><![CDATA[强化学习]]></category>
		<category><![CDATA[模型后训练]]></category>
		<guid isPermaLink="false">https://mylogs.cn/4b-open-model-retrieval-vs-gpt56-sol-cost/</guid>

					<description><![CDATA[8 月 5 日，数据库厂商 Neon 与后训练创业公司 Castform 联合发布了一篇博客，抛出一个足够吸睛 [&#8230;]]]></description>
										<content:encoded><![CDATA[
<p class="wp-block-paragraph">8 月 5 日，数据库厂商 Neon 与后训练创业公司 Castform 联合发布了一篇博客，抛出一个足够吸睛的结论：一个 40 亿参数的开源权重模型，经过强化学习后训练，在智能体检索任务上的准确度可以追平 OpenAI 的旗舰模型 GPT-5.6 Sol，成本却只有后者的百分之一。文章在几小时内冲上 Hacker News 首页。</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6a73bfa1c4f64&quot;}" data-wp-interactive="core/image" data-wp-key="6a73bfa1c4f64" class="wp-block-image size-large aligncenter wp-lightbox-container"><img fetchpriority="high" decoding="async" width="1200" height="630" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/08/b838c28c4405fa16510622fc48171f3a_header.webp" alt="4B 小模型叫板 GPT-5.6 Sol，省 100 倍的说法只对一半" class="wp-image-3749" style="max-width:100%;height:auto;" srcset="https://mylogs.cn/wp-content/uploads/2026/08/b838c28c4405fa16510622fc48171f3a_header.webp 1200w, https://mylogs.cn/wp-content/uploads/2026/08/b838c28c4405fa16510622fc48171f3a_header-300x158.webp 300w, https://mylogs.cn/wp-content/uploads/2026/08/b838c28c4405fa16510622fc48171f3a_header-1024x538.webp 1024w, https://mylogs.cn/wp-content/uploads/2026/08/b838c28c4405fa16510622fc48171f3a_header-768x403.webp 768w" sizes="(max-width: 1200px) 100vw, 1200px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">图片来源：Neon</figcaption></figure>





<p class="wp-block-paragraph">在技术社区看来，这个结论里可信的部分和站不住的部分，需要分开来看。</p>



<h2 class="wp-block-heading">先说可信的一半：这笔账确实算得过来</h2>



<p class="wp-block-paragraph">检索早就不是&#8221;查一次就完事&#8221;了。2022 年前后，行业普遍押注向量嵌入检索，几乎每家数据库厂商都补上了这项能力，pgvector 一度是 Neon 下载量最高的扩展。工程师手工搭建检索增强生成流水线，本质上就是做一次相似度匹配。</p>



<p class="wp-block-paragraph">到了 2025 年，智能体开始流行，开发者转向多跳检索：把大问题拆成小问题，模型规划一次查询、读取结果、判断信息不够、重新组织问题、再查一次，最后带引用汇总成答案。检索从一次性系统变成了循环系统，而循环的每一轮都意味着又一次调用前沿模型，且携带着不断累积的上下文。</p>



<p class="wp-block-paragraph">成本压力就出在这里。Neon 给出的数字是：一次典型的多轮检索请求交给 GPT-5.6 Sol 处理，端到端耗时超过 10 秒，费用约 0.03 美元。按 Sol 每百万输入词元（token）5 美元、每百万输出词元 30 美元的公开定价推算，这个数字是站得住的，不属于营销注水。</p>



<p class="wp-block-paragraph">把量放大就更直观：每月一百万次请求——对企业内部搜索或客服自助这类场景来说算不上大流量——账单就是每月三万美元，还要忍受两位数秒级的延迟。而这项工作的实质，不过是&#8221;在自家文档里找到那一段话&#8221;。同样的请求交给一个 40 亿参数的小模型在通用推理设施上跑，成本是几分之一美分。这个差距，正是这类产品存在的理由。</p>



<h2 class="wp-block-heading">Castform 究竟做了什么</h2>



<p class="wp-block-paragraph">强化学习后训练要跑起来，需要三样东西：一个任务、一个供智能体活动的环境、一个奖励函数。三者齐备之后，训练就是一轮轮试错——模型带着工具尝试任务，奖励函数给这次尝试打分，反馈信号指引模型一步步爬向更优表现。</p>



<p class="wp-block-paragraph">问题在于，绝大多数公司手里并没有现成的任务集和奖励函数。它们有的是大量私有资料：内部文档、产品记录、支持文章、客户沟通记录、维基和业务数据库。知识确实在里面，但把这些原始资料变成可用的训练集，通常需要大量数据工程和人工标注。于是很多团队直接放弃了后训练，理由无非两个：没有训练数据，或者微调太难、缺少基础设施。</p>



<p class="wp-block-paragraph">Castform 的做法是把这两步一起包掉：先把已有语料自动转成训练任务，再托管整个强化学习循环。官方举的例子是一份差旅政策文档——原文规定&#8221;通过 Navan 预订的火车票由 GitLab 差旅卡支付，必须选标准舱且提前 14 天预订&#8221;，系统据此抽出标准答案，再合成出一个自然语言问题去考模型。</p>



<p class="wp-block-paragraph">奖励函数被拆成三部分：是否检索到正确的文档片段、是否引用了正确的来源、最终答案是否正确。Neon 在其中承担基础设施角色：原始文档存放在 Neon 上的 Postgres 里，训练任务生成、每一轮回放的检索调用以及最终上线推理，全部走同一套 Lakebase 检索扩展。数千条并行回放会造成极其突发的负载峰值，Neon 的动态算力伸缩把这些尖峰吸收掉，空闲时再缩回去。Neon 是 Databricks 在 2025 年收购的无服务器 Postgres 部门，Castform 则在今年 6 月才开放测试。</p>



<h2 class="wp-block-heading">争议在于：整篇文章没有一个准确率数字</h2>



<p class="wp-block-paragraph">对这套说法的质疑同样具体。这篇博客始终没有点名所用的基座模型是哪一个，也没有给出任何准确率数据，全文唯一的图表是训练过程中的平均奖励曲线——用自己写的评分标准给自己的作业打分。Hacker News 上有评论直接追问：既然结论是&#8221;追平前沿模型&#8221;，为什么不跑一个像 BrowseComp-Plus 这样的公开检索基准？在有人这么做之前，&#8221;和 GPT-5.6 Sol 一样准&#8221;只是一句主张，不是一个结果。</p>



<p class="wp-block-paragraph">对比基准的选择也偏向有利。Sol 是 GPT-5.6 家族的旗舰档位，而同系列的 Luna 正是为工具调用循环这类任务准备的高速低价档，GPT-5.4 的价格是 Sol 的一半，缓存输入更是低至每百万词元 0.50 美元——而智能体循环恰恰充满了重复上下文。真正诚实的比法，是拿&#8221;能达到准确率要求的最便宜配置&#8221;来比，这么一算，&#8221;100 倍&#8221;会明显缩水。有评论说得很干脆：跟 Luna 比。</p>



<p class="wp-block-paragraph">技术路线本身也算不上新鲜。2025 年的 Search-R1 系列工作已经证明，带可验证奖励的强化学习能教会 30 亿到 70 亿参数的模型把推理和检索调用交替进行；DeepSeek 的 GRPO 方案则把相关工具链推向开源。这个赛道甚至已经开始整合：OpenPipe 被 CoreWeave 收入，Predibase 归入 Rubrik。真正新的地方不在算法，而在于需要自己搭建的部分变得很少。</p>



<h2 class="wp-block-heading">两个更深的隐患</h2>



<p class="wp-block-paragraph">即便未来跑出一份公允的基准成绩，还有两个问题绕不过去。</p>



<p class="wp-block-paragraph">第一，从自家语料里蒸馏出来的奖励函数，会一并继承语料本身的陈腐内容。过期的政策文档不会被识别为过期，只会变成&#8221;言之凿凿并附上引用&#8221;的错误答案——而且这次是训练进模型权重里，不再是提示词里可以随时改掉的东西。</p>



<p class="wp-block-paragraph">第二是维护成本。Castform 一位作者在 Hacker News 上回应称，换一个新的开源权重基座重跑流水线很容易。这话没错，但也略微偏离了要点：流水线可以重跑，业务语料却在持续变化，模型需要多久重训一次、由谁负责判断该重训了，这些问题目前都没有答案。</p>



<p class="wp-block-paragraph">对国内团队而言，这套思路的参考价值大于结论本身：垂直检索任务并不需要动用最贵的前沿模型，把小模型针对自家语料做一轮后训练，往往能在准确率和成本之间找到更合理的位置。但在公开基准数据出来之前，&#8221;便宜 100 倍且一样准&#8221;这句话，最好只当作一个待验证的假设。</p>



<p class="has-small-font-size wp-block-paragraph">来源：Neon 官方博客 / Pranav Aurora、Ying Hang Seah、Angel Pan，SourceFeed 分析报道，Hacker News 讨论</p>

]]></content:encoded>
					
					<wfw:commentRss>https://mylogs.cn/4b-open-model-retrieval-vs-gpt56-sol-cost/feed/</wfw:commentRss>
			<slash:comments>0</slash:comments>
		
		
			</item>
	</channel>
</rss>
