<?xml version="1.0" encoding="UTF-8"?><rss version="2.0"
	xmlns:content="http://purl.org/rss/1.0/modules/content/"
	xmlns:wfw="http://wellformedweb.org/CommentAPI/"
	xmlns:dc="http://purl.org/dc/elements/1.1/"
	xmlns:atom="http://www.w3.org/2005/Atom"
	xmlns:sy="http://purl.org/rss/1.0/modules/syndication/"
	xmlns:slash="http://purl.org/rss/1.0/modules/slash/"
	>

<channel>
	<title>多智能体 &#8211; mylogs.cn</title>
	<atom:link href="https://mylogs.cn/tag/%E5%A4%9A%E6%99%BA%E8%83%BD%E4%BD%93/feed/" rel="self" type="application/rss+xml" />
	<link>https://mylogs.cn</link>
	<description>发现、记录、分享</description>
	<lastBuildDate>Sat, 15 Aug 2026 04:24:17 +0000</lastBuildDate>
	<language>zh-Hans</language>
	<sy:updatePeriod>
	hourly	</sy:updatePeriod>
	<sy:updateFrequency>
	1	</sy:updateFrequency>
	
	<item>
		<title>GPT-5.6 构建者指南：把智能体成本压到原来的零头</title>
		<link>https://mylogs.cn/gpt-5-6-%e6%9e%84%e5%bb%ba%e8%80%85%e6%8c%87%e5%8d%97%ef%bc%9a%e6%8a%8a%e6%99%ba%e8%83%bd%e4%bd%93%e6%88%90%e6%9c%ac%e5%8e%8b%e5%88%b0%e5%8e%9f%e6%9d%a5%e7%9a%84%e9%9b%b6%e5%a4%b4/</link>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Sat, 15 Aug 2026 04:23:59 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[AI 智能体]]></category>
		<category><![CDATA[API 成本]]></category>
		<category><![CDATA[GPT-5.6]]></category>
		<category><![CDATA[OpenAI]]></category>
		<category><![CDATA[多智能体]]></category>
		<category><![CDATA[模型选择]]></category>
		<category><![CDATA[程序化工具调用]]></category>
		<guid isPermaLink="false">https://mylogs.cn/gpt-5-6-%e6%9e%84%e5%bb%ba%e8%80%85%e6%8c%87%e5%8d%97%ef%bc%9a%e6%8a%8a%e6%99%ba%e8%83%bd%e4%bd%93%e6%88%90%e6%9c%ac%e5%8e%8b%e5%88%b0%e5%8e%9f%e6%9d%a5%e7%9a%84%e9%9b%b6%e5%a4%b4/</guid>

					<description><![CDATA[OpenAI 近日发布了一份面向开发者的《GPT-5.6 构建者指南》，核心不是又亮出一组更高的基准分数，而是 [&#8230;]]]></description>
										<content:encoded><![CDATA[
<p class="wp-block-paragraph">OpenAI 近日发布了一份面向开发者的《GPT-5.6 构建者指南》，核心不是又亮出一组更高的基准分数，而是讲清楚一件事：同样的智能体任务，用更聪明的模型选择加上新的接口能力，成本可以压到原来的零头。指南基于 Hex、Hypha、Browser Use、PlayerZero 等多家初创公司的生产环境实战数据整理而成。</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6a8164396f825&quot;}" data-wp-interactive="core/image" data-wp-key="6a8164396f825" class="wp-block-image size-large aligncenter wp-lightbox-container"><img fetchpriority="high" decoding="async" width="1200" height="821" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/08/58dba2340446fe0a1ede7dfe4be854b5_header.webp" alt="GPT-5.6 构建者指南：把智能体成本压到原来的零头" class="wp-image-4919" style="max-width:100%;height:auto;" srcset="https://mylogs.cn/wp-content/uploads/2026/08/58dba2340446fe0a1ede7dfe4be854b5_header.webp 1200w, https://mylogs.cn/wp-content/uploads/2026/08/58dba2340446fe0a1ede7dfe4be854b5_header-300x205.webp 300w, https://mylogs.cn/wp-content/uploads/2026/08/58dba2340446fe0a1ede7dfe4be854b5_header-1024x701.webp 1024w, https://mylogs.cn/wp-content/uploads/2026/08/58dba2340446fe0a1ede7dfe4be854b5_header-768x525.webp 768w" sizes="(max-width: 1200px) 100vw, 1200px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">AI生成配图</figcaption></figure>





<h2 class="wp-block-heading">小模型档位，正在顶替旗舰</h2>



<p class="wp-block-paragraph">过去处理长周期任务，开发者几乎没有选择，只能上旗舰模型、开最高推理强度——原因在于成本优化型模型在长上下文和工具调用上的差距太大。GPT-5.6 改变了这个格局。在同样的测试框架下，Luna 和 Terra 这两档较小的模型，往往能接近 GPT-5.4、5.5 的表现，价格却低得多。</p>



<p class="wp-block-paragraph">几个数据很能说明问题。文档智能公司 Hypha 的工程师表示，Luna 在保持 GPT-5.5 约 98% 提取精度的同时，成本只有后者的十八分之一。在 BrowseComp 这项考察冷门事实检索能力的基准上，三个月前 GPT-5.5（超高推理）得分 84.36%、花费 33.27 美元；GPT-5.6 的 Luna（超高推理）得分 84.04%、花费仅 1.33 美元——性能几乎一致，成本差了约 25 倍。浏览器自动化公司 Browser Use 的联合创始人给出的数字更具体：他们用 Luna 跑了 106 个最难的浏览器任务，完成率 78%，总花费约 14 美元；而当前最强模型跑到 80% 要花大约 235 美元。</p>



<p class="wp-block-paragraph">工程分析平台 PlayerZero 的创始人则报告，在一个关键的代码探索任务上，Luna 把推理成本降低了 64%，响应时间缩短 90%，F1 分数还提升了 5 个点。</p>



<h2 class="wp-block-heading">推理强度，不是越高越好</h2>



<p class="wp-block-paragraph">指南里另一个反直觉的发现是：降低推理强度，有时反而得到更好的结果。在 Agents&#x27; Last Exam 测试中，当测试框架保持不变时，GPT-5.6 的 Sol 档在「低」推理强度下的表现，超过了 GPT-5.5 在「高」推理强度下的表现。生产环境里也有类似反馈——多家初创公司表示，把推理强度从默认值调低后，多种工作流都看到了明显的成本改善。</p>



<p class="wp-block-paragraph">数据分析公司 Hex 的 AI 研究负责人描述得很形象：把 GPT-5.6 放进现有框架后，低推理强度反而给出了最好的结果——模型知道数据不存在时就停下来，不追错误线索，用更少的 token 得到正确答案。</p>



<h2 class="wp-block-heading">三个接口原语，把确定性工作交给代码</h2>



<p class="wp-block-paragraph">除了模型本身，OpenAI 还给 Responses API 引入了三个新的架构原语，分别对应智能体工作流里的几类效率问题。</p>



<p class="wp-block-paragraph">第一是推理复用与原生压缩：通过把推理结果跨模型轮次持久化保存，并对长对话做原生压缩，模型能在更长任务周期内保持连贯，而不必反复重建上下文。在 ARC-AGI-3 基准上，Sol 用标准框架得分 13.3%；开启推理持久化与压缩后，得分跃升至 38.3%，输出 token 只有标准框架的约六分之一。</p>



<p class="wp-block-paragraph">第二是原生多智能体编排：对可并行的复杂任务，把行动和推理分发给多个智能体并行推进。这也是 ChatGPT 里「ultra」能力设置的运作方式。研究公司 Quadrillion 的创始人评价，GPT-5.6 的 Sol 在开放式研究问题的多智能体协作上表现突出，相比 5.5 有明显提升，完成速度也几乎是最快的。</p>



<p class="wp-block-paragraph">第三是程序化工具调用：让 GPT-5.6 编写 JavaScript 来编排工具、并行执行独立调用，并在上下文窗口之外处理输出，模型只专注于真正需要判断力的部分。金融研究公司 Rogo 的负责人表示，在评估中，使用程序化工具调用的 GPT-5.6 在质量标准上达到同等水平，同时输入 token 减少了 21%——这正是「能讨论金融研究」和「能真正执行金融研究」之间的区别。</p>



<h2 class="wp-block-heading">缓存窗口拉长，也能省一笔</h2>



<p class="wp-block-paragraph">在整个 GPT-5.6 模型家族里，提示缓存的存活时间已延长到至少 30 分钟，并且可以在上下文窗口内确定性地设置缓存断点。AI 工程公司 Ploy 的工程师报告，他们在一个共享的 2.9 万 token 提示里加入缓存断点和专属密钥，把未缓存输入减少了 28%；30 分钟的缓存窗口让智能体能在多次运行间复用同一段上下文，而不是每次从头开始。</p>



<p class="wp-block-paragraph">指南传递的信号很清晰：企业客户对 token 成本的敏感，已经到了必须正面回应的程度。过去那种「每一步都用最强模型」的做法，正在被更精细的分层调度取代。对开发团队而言，真正可操作的做法有两条——把高频、简单的任务下沉到便宜档位，把旗舰留给最难的部分；以及在选型时，用「单位任务成本」而不是「单价」来做横向比较。</p>



<p class="wp-block-paragraph">来源：OpenAI 官方博客《The builder’s guide to GPT-5.6》</p>

]]></content:encoded>
					
		
		
			</item>
		<item>
		<title>不想交月费的 AI 搭档，能装自己电脑上</title>
		<link>https://mylogs.cn/%e4%b8%8d%e6%83%b3%e4%ba%a4%e6%9c%88%e8%b4%b9%e7%9a%84-ai-%e6%90%ad%e6%a1%a3%ef%bc%8c%e8%83%bd%e8%a3%85%e8%87%aa%e5%b7%b1%e7%94%b5%e8%84%91%e4%b8%8a/</link>
					<comments>https://mylogs.cn/%e4%b8%8d%e6%83%b3%e4%ba%a4%e6%9c%88%e8%b4%b9%e7%9a%84-ai-%e6%90%ad%e6%a1%a3%ef%bc%8c%e8%83%bd%e8%a3%85%e8%87%aa%e5%b7%b1%e7%94%b5%e8%84%91%e4%b8%8a/#respond</comments>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Sun, 09 Aug 2026 15:51:43 +0000</pubDate>
				<category><![CDATA[经验与技巧]]></category>
		<category><![CDATA[AI 助手]]></category>
		<category><![CDATA[多智能体]]></category>
		<category><![CDATA[开源]]></category>
		<category><![CDATA[效率工具]]></category>
		<category><![CDATA[本地部署]]></category>
		<guid isPermaLink="false">https://mylogs.cn/%e4%b8%8d%e6%83%b3%e4%ba%a4%e6%9c%88%e8%b4%b9%e7%9a%84-ai-%e6%90%ad%e6%a1%a3%ef%bc%8c%e8%83%bd%e8%a3%85%e8%87%aa%e5%b7%b1%e7%94%b5%e8%84%91%e4%b8%8a/</guid>

					<description><![CDATA[这两年，AI 协作类应用成了不少人的日常工具。Claude Cowork、Codex、Antigravity  [&#8230;]]]></description>
										<content:encoded><![CDATA[
<p class="wp-block-paragraph">这两年，AI 协作类应用成了不少人的日常工具。Claude Cowork、Codex、Antigravity 这类产品都要登录账号、按月付费，还会读取用户的使用行为。当越来越多的工作流迁到这些平台，订阅成本和隐私顾虑就会叠加在一起。开源项目 Eigent 打出了&#8221;免费的本地替代&#8221;旗号——安装即用，模型还能在本地和云端之间随便换，正好切中这两点痛点。</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6a81643971891&quot;}" data-wp-interactive="core/image" data-wp-key="6a81643971891" class="wp-block-image size-large aligncenter wp-lightbox-container"><img decoding="async" width="1200" height="800" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/08/4ab5bdb5c4fc00c2b9cee2ecdbf846c9_header.webp" alt="不想交月费的 AI 搭档，能装自己电脑上" class="wp-image-4202" style="max-width:100%;height:auto;" srcset="https://mylogs.cn/wp-content/uploads/2026/08/4ab5bdb5c4fc00c2b9cee2ecdbf846c9_header.webp 1200w, https://mylogs.cn/wp-content/uploads/2026/08/4ab5bdb5c4fc00c2b9cee2ecdbf846c9_header-300x200.webp 300w, https://mylogs.cn/wp-content/uploads/2026/08/4ab5bdb5c4fc00c2b9cee2ecdbf846c9_header-1024x683.webp 1024w, https://mylogs.cn/wp-content/uploads/2026/08/4ab5bdb5c4fc00c2b9cee2ecdbf846c9_header-768x512.webp 768w" sizes="(max-width: 1200px) 100vw, 1200px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">图片来源：XDA Developers</figcaption></figure>





<h2 class="wp-block-heading">一、下载安装并选择模型</h2>



<ol class="wp-block-list"><li>到 GitHub 的 eigent-ai/eigent 仓库下载安装包，按提示完成安装。它采用 Electron 前端加 Python 后端的架构，开箱即用，无需自己搭环境。</li><li>打开设置页选模型：本地方案可选 Ollama、LM Studio、vLLM、SGLang、LLaMA.cpp；云端则填入自备密钥，支持 Gemini、Anthropic、OpenAI、Grok、Qwen、DeepSeek、Moonshot 等。切换只是下拉框里选一下，小显卡跑本地模型卡顿时也能随时退回云端。</li></ol>



<h2 class="wp-block-heading">二、用内置智能体与技能干活</h2>



<ol class="wp-block-list"><li>开箱自带五类专用智能体：Developer（拥有终端、代码执行、文件操作）、Search、Document、Multi-Modal、Social Media，各自带着工具箱，不必从零搭工作流。</li><li>系统内置 200 多个 MCP 工具（Notion、Google Calendar、Slack、GitHub 等），也能自行接入更多。</li><li>用 Skills 沉淀个人流程：新建一个文件夹，写入 SKILL.md 描述触发条件与行为（结构与 Claude Skills 一致），之后一条命令就能触发。例如写一个读取心愿单、比价本地零售商并生成带日期报告的任务。</li></ol>



<h2 class="wp-block-heading">三、隔离浏览器与访问本机文件</h2>



<ol class="wp-block-list"><li>浏览器工具会在应用内通过 Playwright 拉起独立的 Chromium 实例，每次任务都从全新无痕会话开始，不携带本机浏览器的 Cookie、登录态和历史，避免身份泄露。</li><li>默认每个任务被沙箱到自己工作目录；若要操作目录外的文件夹，在应用里新建一个指向该文件夹的 Space（下拉一次即可），否则会拒绝访问。</li></ol>



<p class="wp-block-paragraph">注意事项：Eigent 基于 CAMEL-AI 多代理框架，适合做知识管理、调研和自动化，并非只给开发者用。首次访问沙箱外目录记得先建 Space，否则任务会被拒。</p>



<p class="wp-block-paragraph">来源：XDA Developers</p>
]]></content:encoded>
					
					<wfw:commentRss>https://mylogs.cn/%e4%b8%8d%e6%83%b3%e4%ba%a4%e6%9c%88%e8%b4%b9%e7%9a%84-ai-%e6%90%ad%e6%a1%a3%ef%bc%8c%e8%83%bd%e8%a3%85%e8%87%aa%e5%b7%b1%e7%94%b5%e8%84%91%e4%b8%8a/feed/</wfw:commentRss>
			<slash:comments>0</slash:comments>
		
		
			</item>
		<item>
		<title>3.7 万个 AI 智能体组队做药，默克数月后做出同款</title>
		<link>https://mylogs.cn/stanford-37000-ai-agents-virtual-biotech-merck/</link>
					<comments>https://mylogs.cn/stanford-37000-ai-agents-virtual-biotech-merck/#respond</comments>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Sun, 09 Aug 2026 07:10:04 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[AI 制药]]></category>
		<category><![CDATA[AI 智能体]]></category>
		<category><![CDATA[人工智能]]></category>
		<category><![CDATA[多智能体]]></category>
		<category><![CDATA[斯坦福大学]]></category>
		<category><![CDATA[药物研发]]></category>
		<category><![CDATA[默克]]></category>
		<guid isPermaLink="false">https://mylogs.cn/stanford-37000-ai-agents-virtual-biotech-merck/</guid>

					<description><![CDATA[在编程领域，眼下的默认假设是「一个工程师配一个智能体」，Claude Code 这类工具就是典型代表。但在 V [&#8230;]]]></description>
										<content:encoded><![CDATA[
<p class="wp-block-paragraph">在编程领域，眼下的默认假设是「一个工程师配一个智能体」，Claude Code 这类工具就是典型代表。但在 VB Transform 2026 大会上，斯坦福大学生物医学数据科学副教授 James Zou 提出了一个不同的方向：下一个突破口不是让单个智能体更聪明，而是让数万个智能体协同工作。VentureBeat 记者 Ben Dickson 在 8 月 7 日的报道中，完整记录了这套系统的构建逻辑与验证结果。</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6a81643972685&quot;}" data-wp-interactive="core/image" data-wp-key="6a81643972685" class="wp-block-image size-large aligncenter wp-lightbox-container"><img decoding="async" width="800" height="533" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/08/17c81ee09287_header.webp" alt="3.7 万个 AI 智能体组队做药，默克数月后做出同款" class="wp-image-4168" style="max-width:100%;height:auto;" srcset="https://mylogs.cn/wp-content/uploads/2026/08/17c81ee09287_header.webp 800w, https://mylogs.cn/wp-content/uploads/2026/08/17c81ee09287_header-300x200.webp 300w, https://mylogs.cn/wp-content/uploads/2026/08/17c81ee09287_header-768x512.webp 768w" sizes="(max-width: 800px) 100vw, 800px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">图片来源：Michael O Donnell Photography / VentureBeat</figcaption></figure>





<h2 class="wp-block-heading">从「虚拟实验室」到「虚拟药企」</h2>



<p class="wp-block-paragraph">这个项目的起点规模很小。Zou 最初搭建的「虚拟实验室」只有 5 到 8 个智能体，结构完全对照他在斯坦福的真实实验室：一个 AI 教授担任项目负责人，若干各有专长的 AI 学生，定期召开组会。团队还为智能体复制了一所「斯坦福」——一个智能体学校，让它们在其中接受监督微调，提升各自领域的专业能力。</p>



<p class="wp-block-paragraph">「我们为智能体建了一所斯坦福的复制品，一所智能体学校，它们可以在那里上学，通过监督微调来提升自己在特定领域的专业水平。」Zou 这样描述。</p>



<p class="wp-block-paragraph">这个小规模系统交出的第一份成果，是针对新近新冠变异株设计的纳米抗体蛋白。「真正让我们兴奋的是，这些由 AI 设计的纳米抗体在结合近期几种病毒方面，表现远好于此前由人类设计的版本。」Zou 说。这一结论经过了湿实验验证。</p>



<p class="wp-block-paragraph">有了实验室层面的验证，团队把目标从模拟一个研究组，扩大到模拟一家公司。由此诞生的系统被称为「虚拟生物科技公司」，由数万个专业智能体组成，顶层是一个首席科学官智能体，下设与真实药企对应的各个部门——靶点发现、分子设计、临床试验等。部门内部还会进一步细分：「在靶点发现部门下面，会有一个智能体专门看所有遗传学数据，另一个专门看基因组学和单细胞数据，以此类推。」</p>



<h2 class="wp-block-heading">为什么不是一个更强的模型</h2>



<p class="wp-block-paragraph">随着基础模型能力不断提升，开发者面临一个核心的架构选择：为什么要把任务拆给数万个专业智能体，而不是把算力全部投给一个无所不知的大模型？</p>



<p class="wp-block-paragraph">Zou 团队用同一个科研难题做了对照实验，让多智能体团队与单个智能体正面对决。结果显示，多智能体生态中产生的摩擦与互动，反而带来了更好的方案，也更能抵抗误差的层层累积。</p>



<p class="wp-block-paragraph">「在这些科研虚拟实验室里，智能体之间真的会争论、会产生分歧。它们必须说服其他 AI 科学家接受自己的想法，而这一切激发出的推理，比单个模型独自从零解决问题要更有创造性、也更稳健。」Zou 说。</p>



<h2 class="wp-block-heading">卡点不在模型，在数据接口</h2>



<p class="wp-block-paragraph">规模一旦扩大到数万个智能体，真正的瓶颈就变成了编排。系统需要一个统一的上下文层，让智能体能够从各种工具、数据集和历史记录中整合知识。</p>



<p class="wp-block-paragraph">不少企业团队试图用给现有数据库套一层 MCP（模型上下文协议）的方式解决数据打通问题，但 Zou 认为这治标不治本——老系统对智能体并不友好。比如把一篇论文的 PDF 直接丢进智能体的上下文窗口，效率极低，而标准文本模型很难读懂复杂的图和表，进而产生幻觉。</p>



<p class="wp-block-paragraph">「即使你在现有数据库和 API 外面包一层 MCP，也没有解决底层问题：这些接口和 API 本来就不是为智能体设计的。」Zou 表示。它们的服务对象，是人类或者前 AI 时代的算法。</p>



<p class="wp-block-paragraph">团队为此开发了名为 Paperclip 的平台。它利用了当代大模型的一项固有强项——写代码和操作文件系统的能力。Paperclip 不再强迫智能体去调用脆弱且各不相同的数据库 API，而是把非结构化数据数字化，并将分散的数据库映射成一个统一的、面向 AI 的虚拟文件系统。智能体由此可以用标准的文件系统操作，去访问数百万篇论文中的知识。</p>



<p class="wp-block-paragraph">「结果表明，用了 Paperclip 准确率会高得多，同时相比没有这类 AI 原生科研基础设施的智能体，时间和成本能降低一个数量级以上。」Zou 说。</p>



<h2 class="wp-block-heading">默克独立做出了同一套方案</h2>



<p class="wp-block-paragraph">为检验这套架构的实际产出，虚拟生物科技公司启动了 3.7 万个「临床试验智能体」，用于整合零散的临床试验数据。这些智能体识别出了一批可预测试验成功率的单细胞特征——有这些特征支撑的药物靶点，最终走向市场的概率比同类药物高出约 50%。</p>



<p class="wp-block-paragraph">随后，系统自主设计了一款靶向 CD276 蛋白的抗体偶联药物，用于治疗肺癌。整个设计过程由智能体独立完成，且只依赖 2025 年 1 月之前公开发表的数据。</p>



<p class="wp-block-paragraph">数月之后，制药公司默克（Merck，在中国大陆的商号为默沙东）独立开发并验证了同样的治疗方案，该方案后来获得了美国食品药品监督管理局的突破性疗法认定。Zou 将此称为「对虚拟生物科技智能体所给出的治疗设计的第三方外部验证」。</p>



<h2 class="wp-block-heading">管理对象从流程变成环境</h2>



<p class="wp-block-paragraph">当多智能体系统的规模持续扩大，管理这批数字劳动力的方式也需要重新思考。Zou 主张从设计刚性工作流，转向搭建开放环境。工作流规定智能体每一步该做什么，更像是在管理一名初级员工；而环境提供的是基础设施、护栏和激励机制，让智能体围绕开放式问题自行协作。</p>



<p class="wp-block-paragraph">「在工作流里，我们试图告诉智能体该做什么、该怎么做。但在环境里，我们提供基础设施、激励和护栏，其余部分保持开放，用激励促成智能体之间的协作。」Zou 说。</p>



<p class="wp-block-paragraph">这也意味着规模化的优化对象发生了转移——不再是微调单个模型，而是设计整个环境。单个智能体固然可以通过强化学习或在智能体学校里做监督微调来提升，但大规模多智能体系统能否成功，取决于调整那些支配协作的参数。</p>



<p class="wp-block-paragraph">「在多智能体这一侧，我们其实不再微调和改动单个模型了，而是在优化环境。」Zou 解释道，「环境本身就是我们用来提升智能体的优化对象。」</p>



<p class="has-small-font-size wp-block-paragraph">来源：VentureBeat</p>

]]></content:encoded>
					
					<wfw:commentRss>https://mylogs.cn/stanford-37000-ai-agents-virtual-biotech-merck/feed/</wfw:commentRss>
			<slash:comments>0</slash:comments>
		
		
			</item>
		<item>
		<title>四个智能体互相通气，正确率从 32% 翻到 62%</title>
		<link>https://mylogs.cn/agentradio-multi-agent-coordination/</link>
					<comments>https://mylogs.cn/agentradio-multi-agent-coordination/#respond</comments>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Sat, 08 Aug 2026 08:05:39 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[AgentRadio]]></category>
		<category><![CDATA[AI智能体]]></category>
		<category><![CDATA[代码智能体]]></category>
		<category><![CDATA[协同机制]]></category>
		<category><![CDATA[多智能体]]></category>
		<category><![CDATA[大模型]]></category>
		<category><![CDATA[软件工程]]></category>
		<guid isPermaLink="false">https://mylogs.cn/agentradio-multi-agent-coordination/</guid>

					<description><![CDATA[企业代码库越长越大，被派去分析代码的人工智能智能体正在被压垮。这类任务动辄需要几十轮交互和大量工具调用，属于典 [&#8230;]]]></description>
										<content:encoded><![CDATA[
<p class="wp-block-paragraph">企业代码库越长越大，被派去分析代码的人工智能智能体正在被压垮。这类任务动辄需要几十轮交互和大量工具调用，属于典型的长周期作业。把活拆给一队智能体分头干，看上去是最自然的解法，可现实中大多数多智能体系统都有一个致命缺陷：智能体之间没法在任务执行中途实时沟通。</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6a816439738e6&quot;}" data-wp-interactive="core/image" data-wp-key="6a816439738e6" class="wp-block-image size-large aligncenter wp-lightbox-container"><img loading="lazy" decoding="async" width="1200" height="750" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/08/d63a8e582c8de39342173e0b006df29e_header.webp" alt="四个智能体互相通气，正确率从 32% 翻到 62%" class="wp-image-4083" style="max-width:100%;height:auto;" srcset="https://mylogs.cn/wp-content/uploads/2026/08/d63a8e582c8de39342173e0b006df29e_header.webp 1200w, https://mylogs.cn/wp-content/uploads/2026/08/d63a8e582c8de39342173e0b006df29e_header-300x188.webp 300w, https://mylogs.cn/wp-content/uploads/2026/08/d63a8e582c8de39342173e0b006df29e_header-1024x640.webp 1024w, https://mylogs.cn/wp-content/uploads/2026/08/d63a8e582c8de39342173e0b006df29e_header-768x480.webp 768w" sizes="auto, (max-width: 1200px) 100vw, 1200px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">图片来源：VentureBeat</figcaption></figure>





<p class="wp-block-paragraph">针对这个问题，Coral AI Labs 与多所高校的研究者提出了 AgentRadio——一个异步消息传递层，让智能体在各自的执行步骤之间互相传话，同时又不打断手头的正事。在一项针对生产环境代码仓库的长周期问答基准测试中，用上 AgentRadio 的四个智能体团队，把任务准确率提升到了独立作业时的近两倍，并且超过了单个智能体搭载更强模型时的成绩。这项研究由 VentureBeat 记者本·迪克森（Ben Dickson）报道，论文已公开在预印本平台 arXiv 上。</p>



<h2 class="wp-block-heading">单个智能体为什么会卡住</h2>



<p class="wp-block-paragraph">理解代码库是长周期任务中最极端的一种。智能体需要把软件构建起来、运行它、跨多个文件追踪执行路径，还要在很长的时间跨度内把证据综合到一起。在这种条件下，单智能体系统通常会栽在&#8221;覆盖问题&#8221;上。</p>



<p class="wp-block-paragraph">论文的三位共同作者任新星（Xinxing Ren）、凯勒姆·福德（Caelum Forder）和彼得·卡罗尔（Peter Carroll）向 VentureBeat 解释说，单个智能体只能沿着仓库里的一条串行路径往下走，随着上下文不断膨胀，最初制定的计划越来越难修改，调查后期的新发现也未必能反向传导回去。模型执行单个步骤通常没问题，难点在于&#8221;让每一项待办、每一处依赖、每一条互相矛盾的证据，在漫长的调查过程中始终保持活跃&#8221;。</p>



<p class="wp-block-paragraph">衡量这类能力的一个基准是 SWE-Atlas QnA，题目全部是针对真实生产仓库提出的长周期自然语言问题。这些题不是靠读代码就能答出来的，智能体必须把软件跑起来、执行多条命令才能找到答案。研究团队的实验显示，单个搭载 Opus 4.6 的编码智能体只能解决其中 32.3% 的任务；换成更先进的 Opus 4.8，成功率也只有 57.2%。</p>



<p class="wp-block-paragraph">把工作量分摊给多个智能体，让每个智能体面对更小、更干净的上下文，是顺理成章的下一步。问题在于，多智能体方案带来显著收益的前提是任务&#8221;可以干净地拆分&#8221;——各部分能独立解决、最后合并即可。代码库理解恰恰很少满足这个前提，子任务之间高度互相依赖：某个智能体挖出的一个关键配置文件或一个缺陷，可能会彻底改写另一个智能体的整条探索路线。</p>



<p class="wp-block-paragraph">研究者指出，现有多智能体系统大体落进三种有缺陷的模式：</p>



<ul class="wp-block-list"><li><strong>并行但彼此隔离</strong>：智能体同时开工，全程零沟通。</li><li><strong>并行但按轮同步</strong>：能沟通，但只能在严格对齐的轮次边界上进行。这迫使智能体停下来等同伴跑完一轮，才能交换中间发现。轮次制隐含了一个昂贵的假设——重要发现可以等到下一个通信阶段再说。</li><li><strong>有名无实的异步</strong>：只提供有限的异步能力，比如自上而下派活，没有智能体之间的横向点对点通道，共享记忆也需要智能体主动暂停工作去读取更新。</li></ul>



<p class="wp-block-paragraph">按照论文的说法，当前多智能体系统的主要瓶颈就一句话：一个正在干活的智能体，没办法同时在听。研究者写道，就他们所知，还没有哪个系统能让并发工作的智能体通过一条横向的自然语言通道，获得对彼此的被动感知。</p>



<h2 class="wp-block-heading">AgentRadio 怎么运作</h2>



<p class="wp-block-paragraph">为了打破&#8221;干活&#8221;与&#8221;倾听&#8221;之间的互斥，研究者做出了 AgentRadio。它是一层异步消息传递机制，可以直接插进现有的编码智能体框架里，为智能体提供三个原语：</p>



<ul class="wp-block-list"><li><code>create_thread</code>：在参与的智能体之间开启一个会话线程。</li><li><code>send_message</code>：向线程追加一条消息，发出后立即返回，不阻塞发送方。</li><li><code>wait_for_mention</code>：阻塞进程，直到收到一条提及调用方的消息；消息送达时会附带所有线程的完整快照，让智能体立刻拿到上下文。</li></ul>



<p class="wp-block-paragraph">三者组合起来，智能体就进入了一种&#8221;被动感知&#8221;状态：可以继续做主线任务，同时在后台收发消息、更新自己掌握的信息。</p>



<p class="wp-block-paragraph">AgentRadio 的代码以 Apache 2.0 协议开源在 GitHub 上，设计上足够轻量，不需要改动底层的 Claude Code、Codex CLI 等智能体框架。架构分两部分：一是消息服务器，作为独立进程充当中心枢纽，存放所有活跃线程、消息和提及记录；二是框架侧集成，智能体通过三个简单的 shell 脚本与服务器交互，每个脚本对应一个原语。</p>



<p class="wp-block-paragraph">系统运行的唯一硬性要求，是智能体框架能把 shell 命令作为后台任务运行。智能体会在系统提示词里被要求常驻一个监听进程，并通过提供的脚本发消息。把 <code>wait_for_mention</code> 脚本放到后台跑，智能体就能一边继续工作一边异步收到通知。要接进现有技术栈，团队仍需写一个&#8221;轻量适配层，负责启动工作进程、分配身份、连接共享服务器并管理最终综合&#8221;，但这部分工作位于编码智能体的外围，不必改动底层模型。</p>



<h2 class="wp-block-heading">实测：翻倍的准确率，和翻了六倍的账单</h2>



<p class="wp-block-paragraph">研究者在 SWE-Atlas QnA 基准的 124 个任务上验证了这套框架，覆盖系统设计、根因分析、安全和接口集成等领域。骨干模型选用 Claude Opus 4.6 和 DeepSeek V4 Pro，框架配置从单个编码智能体（B0）、经典分工的智能体团队（L1），一直排到使用 AgentRadio 异步协同的团队（L3）。</p>



<p class="wp-block-paragraph">结果是：Opus 4.6 单智能体只解决 32.3% 的任务，完整的 AgentRadio 配置把这个数字提到 62.1%，接近翻倍，并且越过了 Opus 4.8 单智能体 57.2% 的成绩；DeepSeek V4 Pro 的成绩也从 29.0% 提升到 50.8%。</p>



<p class="wp-block-paragraph">论文里有一个 MinIO 系统的真实案例很能说明问题。解题需要逐请求检查服务器日志，而智能体在初始规划阶段没预料到这一点。在只能协作、不能异步通信的 L2 配置下，两个智能体在执行命令时各自意识到需要这些日志，但因为无法在执行中途共享发现，一个默默放弃了，另一个也没向团队提出；到了评审阶段，整个团队一致同意了错误答案，丢掉五个评分项。启用 AgentRadio 之后，智能体做出了同样的中途发现，但其中一个立刻把服务端日志证据广播到共享工作日志上，其余智能体因为处在被动监听状态，马上吸收了这条新证据。最终这道题从不及格变成了 16 分满分。</p>



<p class="wp-block-paragraph">研究者对此的总结是，关键差别在于时机：团队不需要多一个智能体，也不需要多一轮评审，它需要的只是让某个智能体的发现在其操作价值过期之前传到该传的人手里。</p>



<p class="wp-block-paragraph">代价也是真金白银。固定规模的多智能体团队必然成倍推高 token 开销，研究者承认&#8221;这笔税是实实在在的&#8221;：平均每个任务的接口调用花费，从单个 Opus 智能体的 2.96 美元涨到 AgentRadio 完整方案的 19.45 美元。</p>



<p class="wp-block-paragraph">不过更关键的对照实验证明，这不是单纯靠砸钱换来的。当研究者用 17.76 美元跑六次独立的 Opus 任务做算力对齐时，模型只解决了 37.9% 的任务，远低于 AgentRadio 的 62.1%。这说明 AgentRadio 的收益来自架构本身，而不是暴力堆规模。</p>



<h2 class="wp-block-heading">什么时候该上多智能体</h2>



<p class="wp-block-paragraph">研究者同时给出了明确的边界：固定的多智能体团队不该成为所有工程任务的默认答案。判断是否需要多智能体，更有效的标准是任务里有没有&#8221;责任断点&#8221;——也就是那些&#8221;一名称职的工程师会主动叫上另一个人&#8221;的位置：工作跨越了归属边界、需要一个独立假设，或者风险高到值得单独验证。</p>



<p class="wp-block-paragraph">按照他们的说法，当任务可以被拆解、拆出来的部分之间仍然互相依赖、单智能体成功率不稳定，而且答案不完整会带来实质的下游代价时，协同机制就非常合适。典型场景包括仓库级架构问题、陌生的遗留系统、跨服务的事故排查、安全分析、依赖迁移和多模块重构。反过来，对&#8221;边界清晰、影响局部、可以回滚&#8221;的活——比如一处已知的单文件改动或样板代码生成——单个智能体依然是更干净的选择。研究者的建议是：只要一份上下文还能诚实地扛住整个问题，就继续用一个智能体；只有当现有智能体不得不压缩掉证据、跨越独立的归属边界，或者需要自己验证自己的高影响结论时，才引入新的责任方。</p>



<p class="wp-block-paragraph">未解的难题集中在&#8221;注意力治理与验证&#8221;上。被动感知让通信在执行期间随时可用，但它并不决定应该存在哪些智能体、哪条发现值得打断别人、该通知谁、证据强到什么程度才可以推翻原计划。如果每个智能体都收到每一条更新，通信层就退化成噪声；如果几个智能体本来就共享同一个错误假设，更快的通信只会让错误扩散得更快。</p>



<p class="wp-block-paragraph">论文中一个基于 Grafana 平台的案例正好印证了这个局限：九项评分标准中有四项需要得出否定性结论，比如观察到某个数据源选择器不会自动选中。智能体跑完了相关测试，却没有一个形成那个缺失的否定假设，两种配置都在这四项上失分。研究者的评价是，被动感知能扩散某个人已经提出的想法，但它没法凭空供给一个团队里从未出现过的构想。</p>



<p class="wp-block-paragraph">按照研究者的判断，下一代系统需要的是自适应的责任分配、基于证据的路由、冲突解决机制、明确的成本上限、权限管理、故障恢复，以及清晰的人工升级节点；最重要的是可追溯的来源记录，好让工程负责人能查清是哪个智能体给出了某项断言、某个动作为何被采纳。用他们的原话说：运行时间越长的智能体，让沟通变得越重要，也让追责变得更难作假。</p>



<p class="wp-block-paragraph">AgentRadio 目前仍是一个使用固定四智能体团队和五阶段协议的受控研究实现，其中的原理正被改造成一款名为 Coral Code 的商业产品，思路从自上而下的刚性协议转为自下而上——工程师从自己现有的编码智能体起步，只有当证据本身需要时，才引入仓库范围的调查、专职责任分工和通信机制。</p>



<p class="has-small-font-size wp-block-paragraph">来源：VentureBeat《Four AI agents coordinating in real time outperformed Claude Opus 4.8 on enterprise coding tasks》，作者 Ben Dickson；论文数据来自 arXiv 预印本</p>

]]></content:encoded>
					
					<wfw:commentRss>https://mylogs.cn/agentradio-multi-agent-coordination/feed/</wfw:commentRss>
			<slash:comments>0</slash:comments>
		
		
			</item>
	</channel>
</rss>
