<?xml version="1.0" encoding="UTF-8"?><rss version="2.0"
	xmlns:content="http://purl.org/rss/1.0/modules/content/"
	xmlns:wfw="http://wellformedweb.org/CommentAPI/"
	xmlns:dc="http://purl.org/dc/elements/1.1/"
	xmlns:atom="http://www.w3.org/2005/Atom"
	xmlns:sy="http://purl.org/rss/1.0/modules/syndication/"
	xmlns:slash="http://purl.org/rss/1.0/modules/slash/"
	>

<channel>
	<title>程序化工具调用 &#8211; mylogs.cn</title>
	<atom:link href="https://mylogs.cn/tag/%e7%a8%8b%e5%ba%8f%e5%8c%96%e5%b7%a5%e5%85%b7%e8%b0%83%e7%94%a8/feed/" rel="self" type="application/rss+xml" />
	<link>https://mylogs.cn</link>
	<description>发现、记录、分享</description>
	<lastBuildDate>Sat, 15 Aug 2026 04:24:17 +0000</lastBuildDate>
	<language>zh-Hans</language>
	<sy:updatePeriod>
	hourly	</sy:updatePeriod>
	<sy:updateFrequency>
	1	</sy:updateFrequency>
	
	<item>
		<title>GPT-5.6 构建者指南：把智能体成本压到原来的零头</title>
		<link>https://mylogs.cn/gpt-5-6-%e6%9e%84%e5%bb%ba%e8%80%85%e6%8c%87%e5%8d%97%ef%bc%9a%e6%8a%8a%e6%99%ba%e8%83%bd%e4%bd%93%e6%88%90%e6%9c%ac%e5%8e%8b%e5%88%b0%e5%8e%9f%e6%9d%a5%e7%9a%84%e9%9b%b6%e5%a4%b4/</link>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Sat, 15 Aug 2026 04:23:59 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[AI 智能体]]></category>
		<category><![CDATA[API 成本]]></category>
		<category><![CDATA[GPT-5.6]]></category>
		<category><![CDATA[OpenAI]]></category>
		<category><![CDATA[多智能体]]></category>
		<category><![CDATA[模型选择]]></category>
		<category><![CDATA[程序化工具调用]]></category>
		<guid isPermaLink="false">https://mylogs.cn/gpt-5-6-%e6%9e%84%e5%bb%ba%e8%80%85%e6%8c%87%e5%8d%97%ef%bc%9a%e6%8a%8a%e6%99%ba%e8%83%bd%e4%bd%93%e6%88%90%e6%9c%ac%e5%8e%8b%e5%88%b0%e5%8e%9f%e6%9d%a5%e7%9a%84%e9%9b%b6%e5%a4%b4/</guid>

					<description><![CDATA[OpenAI 近日发布了一份面向开发者的《GPT-5.6 构建者指南》，核心不是又亮出一组更高的基准分数，而是 [&#8230;]]]></description>
										<content:encoded><![CDATA[
<p class="wp-block-paragraph">OpenAI 近日发布了一份面向开发者的《GPT-5.6 构建者指南》，核心不是又亮出一组更高的基准分数，而是讲清楚一件事：同样的智能体任务，用更聪明的模型选择加上新的接口能力，成本可以压到原来的零头。指南基于 Hex、Hypha、Browser Use、PlayerZero 等多家初创公司的生产环境实战数据整理而成。</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6a80195666df8&quot;}" data-wp-interactive="core/image" data-wp-key="6a80195666df8" class="wp-block-image size-large aligncenter wp-lightbox-container"><img fetchpriority="high" decoding="async" width="1200" height="821" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/08/58dba2340446fe0a1ede7dfe4be854b5_header.webp" alt="GPT-5.6 构建者指南：把智能体成本压到原来的零头" class="wp-image-4919" style="max-width:100%;height:auto;" srcset="https://mylogs.cn/wp-content/uploads/2026/08/58dba2340446fe0a1ede7dfe4be854b5_header.webp 1200w, https://mylogs.cn/wp-content/uploads/2026/08/58dba2340446fe0a1ede7dfe4be854b5_header-300x205.webp 300w, https://mylogs.cn/wp-content/uploads/2026/08/58dba2340446fe0a1ede7dfe4be854b5_header-1024x701.webp 1024w, https://mylogs.cn/wp-content/uploads/2026/08/58dba2340446fe0a1ede7dfe4be854b5_header-768x525.webp 768w" sizes="(max-width: 1200px) 100vw, 1200px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">AI生成配图</figcaption></figure>





<h2 class="wp-block-heading">小模型档位，正在顶替旗舰</h2>



<p class="wp-block-paragraph">过去处理长周期任务，开发者几乎没有选择，只能上旗舰模型、开最高推理强度——原因在于成本优化型模型在长上下文和工具调用上的差距太大。GPT-5.6 改变了这个格局。在同样的测试框架下，Luna 和 Terra 这两档较小的模型，往往能接近 GPT-5.4、5.5 的表现，价格却低得多。</p>



<p class="wp-block-paragraph">几个数据很能说明问题。文档智能公司 Hypha 的工程师表示，Luna 在保持 GPT-5.5 约 98% 提取精度的同时，成本只有后者的十八分之一。在 BrowseComp 这项考察冷门事实检索能力的基准上，三个月前 GPT-5.5（超高推理）得分 84.36%、花费 33.27 美元；GPT-5.6 的 Luna（超高推理）得分 84.04%、花费仅 1.33 美元——性能几乎一致，成本差了约 25 倍。浏览器自动化公司 Browser Use 的联合创始人给出的数字更具体：他们用 Luna 跑了 106 个最难的浏览器任务，完成率 78%，总花费约 14 美元；而当前最强模型跑到 80% 要花大约 235 美元。</p>



<p class="wp-block-paragraph">工程分析平台 PlayerZero 的创始人则报告，在一个关键的代码探索任务上，Luna 把推理成本降低了 64%，响应时间缩短 90%，F1 分数还提升了 5 个点。</p>



<h2 class="wp-block-heading">推理强度，不是越高越好</h2>



<p class="wp-block-paragraph">指南里另一个反直觉的发现是：降低推理强度，有时反而得到更好的结果。在 Agents&#x27; Last Exam 测试中，当测试框架保持不变时，GPT-5.6 的 Sol 档在「低」推理强度下的表现，超过了 GPT-5.5 在「高」推理强度下的表现。生产环境里也有类似反馈——多家初创公司表示，把推理强度从默认值调低后，多种工作流都看到了明显的成本改善。</p>



<p class="wp-block-paragraph">数据分析公司 Hex 的 AI 研究负责人描述得很形象：把 GPT-5.6 放进现有框架后，低推理强度反而给出了最好的结果——模型知道数据不存在时就停下来，不追错误线索，用更少的 token 得到正确答案。</p>



<h2 class="wp-block-heading">三个接口原语，把确定性工作交给代码</h2>



<p class="wp-block-paragraph">除了模型本身，OpenAI 还给 Responses API 引入了三个新的架构原语，分别对应智能体工作流里的几类效率问题。</p>



<p class="wp-block-paragraph">第一是推理复用与原生压缩：通过把推理结果跨模型轮次持久化保存，并对长对话做原生压缩，模型能在更长任务周期内保持连贯，而不必反复重建上下文。在 ARC-AGI-3 基准上，Sol 用标准框架得分 13.3%；开启推理持久化与压缩后，得分跃升至 38.3%，输出 token 只有标准框架的约六分之一。</p>



<p class="wp-block-paragraph">第二是原生多智能体编排：对可并行的复杂任务，把行动和推理分发给多个智能体并行推进。这也是 ChatGPT 里「ultra」能力设置的运作方式。研究公司 Quadrillion 的创始人评价，GPT-5.6 的 Sol 在开放式研究问题的多智能体协作上表现突出，相比 5.5 有明显提升，完成速度也几乎是最快的。</p>



<p class="wp-block-paragraph">第三是程序化工具调用：让 GPT-5.6 编写 JavaScript 来编排工具、并行执行独立调用，并在上下文窗口之外处理输出，模型只专注于真正需要判断力的部分。金融研究公司 Rogo 的负责人表示，在评估中，使用程序化工具调用的 GPT-5.6 在质量标准上达到同等水平，同时输入 token 减少了 21%——这正是「能讨论金融研究」和「能真正执行金融研究」之间的区别。</p>



<h2 class="wp-block-heading">缓存窗口拉长，也能省一笔</h2>



<p class="wp-block-paragraph">在整个 GPT-5.6 模型家族里，提示缓存的存活时间已延长到至少 30 分钟，并且可以在上下文窗口内确定性地设置缓存断点。AI 工程公司 Ploy 的工程师报告，他们在一个共享的 2.9 万 token 提示里加入缓存断点和专属密钥，把未缓存输入减少了 28%；30 分钟的缓存窗口让智能体能在多次运行间复用同一段上下文，而不是每次从头开始。</p>



<p class="wp-block-paragraph">指南传递的信号很清晰：企业客户对 token 成本的敏感，已经到了必须正面回应的程度。过去那种「每一步都用最强模型」的做法，正在被更精细的分层调度取代。对开发团队而言，真正可操作的做法有两条——把高频、简单的任务下沉到便宜档位，把旗舰留给最难的部分；以及在选型时，用「单位任务成本」而不是「单价」来做横向比较。</p>



<p class="wp-block-paragraph">来源：OpenAI 官方博客《The builder’s guide to GPT-5.6》</p>

]]></content:encoded>
					
		
		
			</item>
	</channel>
</rss>
