<?xml version="1.0" encoding="UTF-8"?><rss version="2.0"
	xmlns:content="http://purl.org/rss/1.0/modules/content/"
	xmlns:wfw="http://wellformedweb.org/CommentAPI/"
	xmlns:dc="http://purl.org/dc/elements/1.1/"
	xmlns:atom="http://www.w3.org/2005/Atom"
	xmlns:sy="http://purl.org/rss/1.0/modules/syndication/"
	xmlns:slash="http://purl.org/rss/1.0/modules/slash/"
	>

<channel>
	<title>软件架构 &#8211; mylogs.cn</title>
	<atom:link href="https://mylogs.cn/tag/%e8%bd%af%e4%bb%b6%e6%9e%b6%e6%9e%84/feed/" rel="self" type="application/rss+xml" />
	<link>https://mylogs.cn</link>
	<description>发现、记录、分享</description>
	<lastBuildDate>Wed, 05 Aug 2026 20:32:34 +0000</lastBuildDate>
	<language>zh-Hans</language>
	<sy:updatePeriod>
	hourly	</sy:updatePeriod>
	<sy:updateFrequency>
	1	</sy:updateFrequency>
	
	<item>
		<title>智能体总翻车？生产级方案多了这 6 个零件</title>
		<link>https://mylogs.cn/advanced-agentic-harness-production/</link>
					<comments>https://mylogs.cn/advanced-agentic-harness-production/#respond</comments>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Wed, 05 Aug 2026 18:35:43 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[AI Agent]]></category>
		<category><![CDATA[LLM]]></category>
		<category><![CDATA[大模型工程]]></category>
		<category><![CDATA[智能体]]></category>
		<category><![CDATA[生产级AI]]></category>
		<category><![CDATA[软件架构]]></category>
		<guid isPermaLink="false">https://mylogs.cn/advanced-agentic-harness-production/</guid>

					<description><![CDATA[一个能调用工具的大语言模型，加上一个“循环调用直到完成任务”的代码框架，就能做出一个能干的 AI 智能体吗？在 [&#8230;]]]></description>
										<content:encoded><![CDATA[
<p class="wp-block-paragraph">一个能调用工具的大语言模型，加上一个“循环调用直到完成任务”的代码框架，就能做出一个能干的 AI 智能体吗？在演示环境里可以，但在生产环境里往往不行。Data For Science 最近发布的一套“高级智能体 Harness”方案，把问题说得很直接：真正可靠的智能体，不是让单个 LLM 更聪明，而是给它套上六个结构性组件。</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6a73bf76ca2d6&quot;}" data-wp-interactive="core/image" data-wp-key="6a73bf76ca2d6" class="wp-block-image size-large aligncenter wp-lightbox-container"><img fetchpriority="high" decoding="async" width="1131" height="1711" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/08/ae3c9bf6b175bd21bbcb1442cf4ccd24_header.webp" alt="智能体总翻车？生产级方案多了这 6 个零件" class="wp-image-3727" style="max-width:100%;height:auto;" srcset="https://mylogs.cn/wp-content/uploads/2026/08/ae3c9bf6b175bd21bbcb1442cf4ccd24_header.webp 1131w, https://mylogs.cn/wp-content/uploads/2026/08/ae3c9bf6b175bd21bbcb1442cf4ccd24_header-198x300.webp 198w, https://mylogs.cn/wp-content/uploads/2026/08/ae3c9bf6b175bd21bbcb1442cf4ccd24_header-677x1024.webp 677w, https://mylogs.cn/wp-content/uploads/2026/08/ae3c9bf6b175bd21bbcb1442cf4ccd24_header-768x1162.webp 768w, https://mylogs.cn/wp-content/uploads/2026/08/ae3c9bf6b175bd21bbcb1442cf4ccd24_header-1015x1536.webp 1015w" sizes="(max-width: 1131px) 100vw, 1131px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">图片来源：Data For Science</figcaption></figure>





<p class="wp-block-paragraph">这套方案的出发点是一个简单的问题——如何把单次 LLM 调用扩展成一个能规划、能执行、能恢复、能自证的系统。答案是“组合”：用多个小而可测的原语，通过一个很薄的编排层串起来。每个原语都对应一种“幼稚智能体”的典型失败模式。</p>



<p class="wp-block-paragraph"><strong>类型化工具。</strong> LLM 经常会编造不存在的工具参数。与其在提示词里写死参数格式，不如用 Pydantic 这类数据模型给每个工具声明参数结构，让模型输出自动校验。工具注册时还要带上成本提示，方便后续做预算控制。</p>



<p class="wp-block-paragraph"><strong>规划 DAG。</strong>  naive 智能体按顺序执行工具调用，但很多子任务其实互不依赖。方案让 Planner 先输出一个依赖图（DAG），把可以并行的节点同时跑起来。以“对比三座城市”为例，人口、时区、城市摘要这九次查询彼此独立，可以并发执行，最后由聚合节点汇总报告。并发能显著缩短等待时间，但方案也加了信号量限制最大并发数，避免一次性触发太多 LLM 调用导致限流或成本暴涨。</p>



<p class="wp-block-paragraph"><strong>分层记忆 + 检索预算。</strong> 把所有历史记录、工具输出都塞进上下文，既浪费 token，也会稀释模型对当前目标的关注。方案把记忆分为工作记忆、语义记忆和情景记忆，并设定一个字符预算硬上限。检索时优先拉取与当前目标最相关的情景记忆，预算耗尽时显式截断，而不是悄悄丢掉关键信息。对语义相似度，使用 384 维的句向量，而不是简单的词袋匹配，因为“法国著名地标”和“埃菲尔铁塔”在字面上几乎没有重叠。</p>



<p class="wp-block-paragraph"><strong>多级验证。</strong> 不是每个错误都值得让 LLM 当“裁判”。方案把验证拆成两层：先跑廉价、确定性的结构检查（比如报告是否遗漏了请求的城市），只有幸存者才进入昂贵的 LLM 评审。这样可以在零 token 开销的情况下拦截大量常见错误。</p>



<p class="wp-block-paragraph"><strong>角色分离。</strong> 同一个提示词既做规划又做执行又做反思，容易互相干扰。方案把任务拆给三个角色：Planner 负责根据目标和工具列表生成 DAG；Worker 负责执行；Critic 负责判断结果是否合格。每个角色有独立的系统提示词和职责边界。</p>



<p class="wp-block-paragraph"><strong>多维预算。</strong> 成本、延迟、token 用量都可能失控。方案给每个节点标注成本提示，并在运行时监控多个维度，超过阈值时触发优雅降级，而不是等到账单爆炸才反应过来。</p>



<p class="wp-block-paragraph">为了让这套系统可测试、不绑定厂商，方案还引入了一个 LLMProvider 抽象层和一个 MockProvider。前者可以接入 Anthropic、OpenAI 等不同后端；后者在测试时返回确定性的伪输出，让开发者分清到底是编排逻辑出错，还是模型本身规划得太差。</p>



<p class="wp-block-paragraph">这些组件单独看都不算新奇，但组合起来的思路很清晰：智能体的可靠性不是模型的“智商”问题，而是工程的“结构”问题。</p>



<p class="has-small-font-size wp-block-paragraph">来源：Data For Science / Bruno Gonçalves</p>

]]></content:encoded>
					
					<wfw:commentRss>https://mylogs.cn/advanced-agentic-harness-production/feed/</wfw:commentRss>
			<slash:comments>0</slash:comments>
		
		
			</item>
	</channel>
</rss>
