<?xml version="1.0" encoding="UTF-8"?><rss version="2.0"
	xmlns:content="http://purl.org/rss/1.0/modules/content/"
	xmlns:wfw="http://wellformedweb.org/CommentAPI/"
	xmlns:dc="http://purl.org/dc/elements/1.1/"
	xmlns:atom="http://www.w3.org/2005/Atom"
	xmlns:sy="http://purl.org/rss/1.0/modules/syndication/"
	xmlns:slash="http://purl.org/rss/1.0/modules/slash/"
	>

<channel>
	<title>软件工程 &#8211; mylogs.cn</title>
	<atom:link href="https://mylogs.cn/tag/%e8%bd%af%e4%bb%b6%e5%b7%a5%e7%a8%8b/feed/" rel="self" type="application/rss+xml" />
	<link>https://mylogs.cn</link>
	<description>发现、记录、分享</description>
	<lastBuildDate>Sun, 16 Aug 2026 06:28:19 +0000</lastBuildDate>
	<language>zh-Hans</language>
	<sy:updatePeriod>
	hourly	</sy:updatePeriod>
	<sy:updateFrequency>
	1	</sy:updateFrequency>
	
	<item>
		<title>免费「隐形」AI 模型 SWE Atlas 跑赢商业对手</title>
		<link>https://mylogs.cn/big-pickle-swe-atlas-50-8/</link>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Sun, 16 Aug 2026 06:28:04 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[AI 编程]]></category>
		<category><![CDATA[DeepSeek]]></category>
		<category><![CDATA[SWE Atlas]]></category>
		<category><![CDATA[大模型评测]]></category>
		<category><![CDATA[开源模型]]></category>
		<category><![CDATA[软件工程]]></category>
		<guid isPermaLink="false">https://mylogs.cn/big-pickle-swe-atlas-50-8/</guid>

					<description><![CDATA[一款身份未公开的免费 AI 编程模型，在业内最难啃的软件工程评测之一上，跑出了超越同脚手架类别所有商业模型的成 [&#8230;]]]></description>
										<content:encoded><![CDATA[
<p class="wp-block-paragraph">一款身份未公开的免费 AI 编程模型，在业内最难啃的软件工程评测之一上，跑出了超越同脚手架类别所有商业模型的成绩。</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6a819a5b3fff2&quot;}" data-wp-interactive="core/image" data-wp-key="6a819a5b3fff2" class="wp-block-image size-large aligncenter wp-lightbox-container"><img fetchpriority="high" decoding="async" width="1200" height="600" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/08/7338c497162cd577258ccd8fce2f0407_header.webp" alt="免费「隐形」AI 模型 SWE Atlas 跑赢商业对手" class="wp-image-5059" style="max-width:100%;height:auto;" srcset="https://mylogs.cn/wp-content/uploads/2026/08/7338c497162cd577258ccd8fce2f0407_header.webp 1200w, https://mylogs.cn/wp-content/uploads/2026/08/7338c497162cd577258ccd8fce2f0407_header-300x150.webp 300w, https://mylogs.cn/wp-content/uploads/2026/08/7338c497162cd577258ccd8fce2f0407_header-1024x512.webp 1024w, https://mylogs.cn/wp-content/uploads/2026/08/7338c497162cd577258ccd8fce2f0407_header-768x384.webp 768w" sizes="(max-width: 1200px) 100vw, 1200px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">图片来源：GitHub／PhillipChaffee/big-pickle-swe-atlas 项目页</figcaption></figure>





<h2 class="wp-block-heading">一次非官方的越级挑战</h2>



<p class="wp-block-paragraph">big-pickle 是 OpenCode Zen 平台上处于「隐形」（stealth）期的免费模型，其真实身份至今没有官方确认。从泄露的提供方报错与接口签名看，它背后很可能由 DeepSeek 的基础设施在支撑。一名开发者（GitHub 账号 PhillipChaffee）在 2026 年 8 月 11 日用它完整跑完了 Scale AI 的 SWE Atlas Codebase QnA 评测：全部 124 道任务解出 63 道，任务解决率达到 50.8%。</p>



<p class="wp-block-paragraph">SWE Atlas 的 Codebase QnA 任务要求模型在读懂一整个大型代码库的基础上回答工程问题，比单纯写函数更接近真实研发场景。该评测严格遵循 Scale 公开的协议——使用官方开源框架 Harbor v0.18.0、与排行榜上非第一方模型一致的 mini-swe-agent 2.4.6 极简脚手架，并以 Scale 指定的 claude-opus-4-5 作为裁判模型。整轮消耗的 6.74 亿个输入 token、430 万个输出 token 全部免费。</p>



<h2 class="wp-block-heading">横向对比：免费模型的越级表现</h2>



<p class="wp-block-paragraph">放在 SWE Atlas QnA 官方排行榜（2026 年 7 月 28 日更新）中，big-pickle 的成绩意味着：在相同的 Mini-SWE-Agent 脚手架类别里，它压过了榜单上所有条目，包括 GLM 5.2（48.12%）与 GPT-5.6-Sol（46.00%）。在整个榜单中，只有运行在原生 Claude Code 脚手架上的 Opus 5（63.17%）与 Opus 4.8（57.26%）略高。</p>



<p class="wp-block-paragraph">分语言看，TypeScript 解决率 58.1%（18/31）、Python 55.2%（16/29）、Go 50.0%（19/38）、C 语言 38.5%（10/26）；分任务类型看，代码上手（Code Onboarding）60.7%、架构与系统设计 52.3%、根因分析 45.9%、安全类 45.5%。</p>



<h2 class="wp-block-heading">结果可以独立核查</h2>



<p class="wp-block-paragraph">开发者在仓库中放出了逐任务的裁判日志、运行配置与复现脚本，任何人都能审计。需要说明的局限包括：每个任务只跑了一次（官方协议跑三次取均值，单次标准误约正负 4.5 个百分点）；沙箱资源被主动调低至 4 CPU / 8 GB（而非声明的 16/16），但 124 条轨迹的扫描显示零超时、零内存溢出，说明这只会压低而非抬高分数；模型身份未知，结果只是 2026 年 8 月 11 日当天该别名的快照。即便把两道未评分任务按「不通过」计，严格下界 49.2% 仍高于所有 Mini-SWE-Agent 榜单条目。</p>



<p class="has-small-font-size wp-block-paragraph">来源：GitHub（PhillipChaffee/big-pickle-swe-atlas）、Scale AI SWE Atlas</p>

]]></content:encoded>
					
		
		
			</item>
		<item>
		<title>DeepSeek V4 Pro 转正：软件工程跑分涨 5 倍</title>
		<link>https://mylogs.cn/deepseek-v4-pro-0813-formal-release/</link>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Thu, 13 Aug 2026 04:12:45 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[AI模型]]></category>
		<category><![CDATA[DeepSeek]]></category>
		<category><![CDATA[大模型]]></category>
		<category><![CDATA[开源模型]]></category>
		<category><![CDATA[智能体]]></category>
		<category><![CDATA[跑分]]></category>
		<category><![CDATA[软件工程]]></category>
		<guid isPermaLink="false">https://mylogs.cn/deepseek-v4-pro-0813-formal-release/</guid>

					<description><![CDATA[8 月 12 日深夜，DeepSeek 在官方 API 文档中把 deepseek-v4-pro 对应的模型版 [&#8230;]]]></description>
										<content:encoded><![CDATA[
<p class="wp-block-paragraph">8 月 12 日深夜，DeepSeek 在官方 API 文档中把 deepseek-v4-pro 对应的模型版本换成了 DeepSeek-V4-Pro-0813，旗舰模型由此结束近四个月的预览期，正式转入通用可用状态。调用方式没有变化，开发者仍用原来的模型名即可拿到新版本，不需要改动一行代码。模型聚合平台 OpenRouter 的页面同步把这一版标记为正式发布，上线日期记为 2026 年 8 月 12 日。</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6a819a5b40db4&quot;}" data-wp-interactive="core/image" data-wp-key="6a819a5b40db4" class="wp-block-image size-large aligncenter wp-lightbox-container"><img decoding="async" width="1200" height="630" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/08/0fff65fdb6ee25896dd2f7396606fe52_header.webp" alt="DeepSeek V4 Pro 转正：软件工程跑分涨 5 倍" class="wp-image-4652" style="max-width:100%;height:auto;" srcset="https://mylogs.cn/wp-content/uploads/2026/08/0fff65fdb6ee25896dd2f7396606fe52_header.webp 1200w, https://mylogs.cn/wp-content/uploads/2026/08/0fff65fdb6ee25896dd2f7396606fe52_header-300x158.webp 300w, https://mylogs.cn/wp-content/uploads/2026/08/0fff65fdb6ee25896dd2f7396606fe52_header-1024x538.webp 1024w, https://mylogs.cn/wp-content/uploads/2026/08/0fff65fdb6ee25896dd2f7396606fe52_header-768x403.webp 768w" sizes="(max-width: 1200px) 100vw, 1200px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">图片来源：OpenRouter</figcaption></figure>





<p class="wp-block-paragraph">官方这次没有发布博客，只在 API 文档的模型与价格页面更新了参数，随后从官方群流出的一张评测对比表成了外界了解新版能力的主要依据。</p>



<h2 class="wp-block-heading">规格：百万上下文，38.4 万输出</h2>



<p class="wp-block-paragraph">DeepSeek-V4-Pro-0813 支持 100 万 token 上下文长度，最大输出长度达到 38.4 万 token，同时提供思考模式与非思考模式，其中思考模式默认开启。对于需要一次性读入长代码仓库、处理大规模文档，或者连续执行大量步骤的智能体任务，这样的规格意味着单次调用能承载的内容量相当可观，多轮拆分与拼接的开销随之减少。</p>



<p class="wp-block-paragraph">接口能力上，新版支持 JSON 结构化输出、工具调用与 Responses API，同时兼容 OpenAI 与 Anthropic 两套请求格式，对话前缀续写处于测试阶段，FIM 补全同样是测试功能且仅限非思考模式使用。换句话说，DeepSeek 在接口层已经基本对齐了当下主流的智能体开发工具链，切换成本被压到很低。</p>



<p class="wp-block-paragraph">架构方面，V4 Pro 沿用此前公开的混合专家设计，总参数规模 1.6 万亿，每次推理激活约 490 亿参数。并发限制上，Pro 版为 500，轻量的 Flash 版为 2500，产品分层意图明确：高频轻量任务走 Flash，复杂长任务走 Pro。</p>



<h2 class="wp-block-heading">跑分：智能体项目全面拉升，四项超过 Opus 4.8</h2>



<p class="wp-block-paragraph">官方评测表最直观的信号是与预览版的落差。在考察模型在真实终端环境中执行命令、解决系统问题的 Terminal Bench 2.1 上，正式版拿到 87.9 分，预览版为 72.1 分，三个月抬升 15.8 分。面向长周期真实软件工程任务的 DeepSWE 变化更剧烈，从预览版的 12.8 分跃升至 62.7 分，接近原来的五倍——预览版在这项测试上基本处于「做不完任务」的状态。</p>



<p class="wp-block-paragraph">横向对比中，V4-Pro-0813 有四个项目超过 Anthropic 上一代旗舰 Opus 4.8：</p>



<ul class="wp-block-list"><li>Terminal Bench 2.1：87.9 对 85.0</li><li>网络安全攻防基准 Cybergym：83.3 对 78.3</li><li>DeepSWE：62.7 对 58.0</li><li>工作流智能体基准 AutomationBench：31.8 对 27.2</li></ul>



<p class="wp-block-paragraph">另有 Agents&#8217; Last Exam 一项两者打平，均为 25.7。</p>



<p class="wp-block-paragraph">与更强的 Fable 5 相比，差距仍在，但个别项目已经反超。Cybergym 上 V4 Pro 以 83.3 略微领先 83.1，AutomationBench 上 31.8 高于 29.1，是表中三个模型的最高分。Terminal Bench 2.1 几乎追平，87.9 对 88.0，只差 0.1 分。需要留意的是，表中对 Fable 5 的标注是带回退机制的成绩。</p>



<p class="wp-block-paragraph">短板同样清楚。代码仓库生成任务 NL2Repo 上 V4 Pro 为 61.5，落后 Opus 4.8 的 69.7；工具调用综合测试 Toolathlon-Verified 为 74.1，低于 Opus 的 76.2 与 Fable 5 的 77.9；数据科学任务 DSBench-Hard 为 67.2，不及 Opus 的 71.7；DSBench-FullStack 为 71.1，略低于 Opus 的 71.6，与 Fable 5 的 77.2 差距更明显。知识推理测试 HLE 的表现比较特殊：不带工具时 V4 Pro 只有 42.7，明显低于 Opus 的 49.8 和 Fable 5 的 53.3；一旦允许调用工具，成绩升至 60.0，反超 Opus 的 57.9，逼近 Fable 5 的 63.0。</p>



<p class="wp-block-paragraph">这组数字勾勒出的画像是：单纯拼静态知识储备，V4 Pro 不占优势；一旦进入需要动手、需要连续调用工具推进的场景，它的位置明显靠前。</p>



<h2 class="wp-block-heading">价格：输出每百万 token 6 元，未跟随涨价</h2>



<p class="wp-block-paragraph">计费标准方面，deepseek-v4-pro 每百万 token 的价格为缓存命中输入 0.025 元、缓存未命中输入 3 元、输出 6 元。同系列的 deepseek-v4-flash 对应为 0.02 元、1 元和 2 元，两项主要计费项上 Pro 恰好是 Flash 的三倍。</p>



<p class="wp-block-paragraph">放到国际同类产品的价目表里，这个数字的分量会更清楚。按每百万输出 token 折算，Fable 5 定价 50 美元，GPT-5.6 Sol Max 为 30 美元，同一晚发布的 Grok 4.6 为 6 美元，而 V4 Pro 约为 0.87 美元。0.1 分的跑分差距背后，是数十倍的价格落差。</p>



<p class="wp-block-paragraph">值得注意的是，DeepSeek 官网此前挂出的「计划近期整体上调 API 服务定价，预计涨幅较大」提示仍未撤下，而这次正式版并没有跟着调价。对开发者而言，这更像是一个窗口期，而非长期承诺。</p>



<p class="has-small-font-size wp-block-paragraph">来源：OpenRouter、DeepSeek 官方 API 文档</p>

]]></content:encoded>
					
		
		
			</item>
		<item>
		<title>四个智能体互相通气，正确率从 32% 翻到 62%</title>
		<link>https://mylogs.cn/agentradio-multi-agent-coordination/</link>
					<comments>https://mylogs.cn/agentradio-multi-agent-coordination/#respond</comments>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Sat, 08 Aug 2026 08:05:39 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[AgentRadio]]></category>
		<category><![CDATA[AI智能体]]></category>
		<category><![CDATA[代码智能体]]></category>
		<category><![CDATA[协同机制]]></category>
		<category><![CDATA[多智能体]]></category>
		<category><![CDATA[大模型]]></category>
		<category><![CDATA[软件工程]]></category>
		<guid isPermaLink="false">https://mylogs.cn/agentradio-multi-agent-coordination/</guid>

					<description><![CDATA[企业代码库越长越大，被派去分析代码的人工智能智能体正在被压垮。这类任务动辄需要几十轮交互和大量工具调用，属于典 [&#8230;]]]></description>
										<content:encoded><![CDATA[
<p class="wp-block-paragraph">企业代码库越长越大，被派去分析代码的人工智能智能体正在被压垮。这类任务动辄需要几十轮交互和大量工具调用，属于典型的长周期作业。把活拆给一队智能体分头干，看上去是最自然的解法，可现实中大多数多智能体系统都有一个致命缺陷：智能体之间没法在任务执行中途实时沟通。</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6a819a5b41f15&quot;}" data-wp-interactive="core/image" data-wp-key="6a819a5b41f15" class="wp-block-image size-large aligncenter wp-lightbox-container"><img decoding="async" width="1200" height="750" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/08/d63a8e582c8de39342173e0b006df29e_header.webp" alt="四个智能体互相通气，正确率从 32% 翻到 62%" class="wp-image-4083" style="max-width:100%;height:auto;" srcset="https://mylogs.cn/wp-content/uploads/2026/08/d63a8e582c8de39342173e0b006df29e_header.webp 1200w, https://mylogs.cn/wp-content/uploads/2026/08/d63a8e582c8de39342173e0b006df29e_header-300x188.webp 300w, https://mylogs.cn/wp-content/uploads/2026/08/d63a8e582c8de39342173e0b006df29e_header-1024x640.webp 1024w, https://mylogs.cn/wp-content/uploads/2026/08/d63a8e582c8de39342173e0b006df29e_header-768x480.webp 768w" sizes="(max-width: 1200px) 100vw, 1200px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">图片来源：VentureBeat</figcaption></figure>





<p class="wp-block-paragraph">针对这个问题，Coral AI Labs 与多所高校的研究者提出了 AgentRadio——一个异步消息传递层，让智能体在各自的执行步骤之间互相传话，同时又不打断手头的正事。在一项针对生产环境代码仓库的长周期问答基准测试中，用上 AgentRadio 的四个智能体团队，把任务准确率提升到了独立作业时的近两倍，并且超过了单个智能体搭载更强模型时的成绩。这项研究由 VentureBeat 记者本·迪克森（Ben Dickson）报道，论文已公开在预印本平台 arXiv 上。</p>



<h2 class="wp-block-heading">单个智能体为什么会卡住</h2>



<p class="wp-block-paragraph">理解代码库是长周期任务中最极端的一种。智能体需要把软件构建起来、运行它、跨多个文件追踪执行路径，还要在很长的时间跨度内把证据综合到一起。在这种条件下，单智能体系统通常会栽在&#8221;覆盖问题&#8221;上。</p>



<p class="wp-block-paragraph">论文的三位共同作者任新星（Xinxing Ren）、凯勒姆·福德（Caelum Forder）和彼得·卡罗尔（Peter Carroll）向 VentureBeat 解释说，单个智能体只能沿着仓库里的一条串行路径往下走，随着上下文不断膨胀，最初制定的计划越来越难修改，调查后期的新发现也未必能反向传导回去。模型执行单个步骤通常没问题，难点在于&#8221;让每一项待办、每一处依赖、每一条互相矛盾的证据，在漫长的调查过程中始终保持活跃&#8221;。</p>



<p class="wp-block-paragraph">衡量这类能力的一个基准是 SWE-Atlas QnA，题目全部是针对真实生产仓库提出的长周期自然语言问题。这些题不是靠读代码就能答出来的，智能体必须把软件跑起来、执行多条命令才能找到答案。研究团队的实验显示，单个搭载 Opus 4.6 的编码智能体只能解决其中 32.3% 的任务；换成更先进的 Opus 4.8，成功率也只有 57.2%。</p>



<p class="wp-block-paragraph">把工作量分摊给多个智能体，让每个智能体面对更小、更干净的上下文，是顺理成章的下一步。问题在于，多智能体方案带来显著收益的前提是任务&#8221;可以干净地拆分&#8221;——各部分能独立解决、最后合并即可。代码库理解恰恰很少满足这个前提，子任务之间高度互相依赖：某个智能体挖出的一个关键配置文件或一个缺陷，可能会彻底改写另一个智能体的整条探索路线。</p>



<p class="wp-block-paragraph">研究者指出，现有多智能体系统大体落进三种有缺陷的模式：</p>



<ul class="wp-block-list"><li><strong>并行但彼此隔离</strong>：智能体同时开工，全程零沟通。</li><li><strong>并行但按轮同步</strong>：能沟通，但只能在严格对齐的轮次边界上进行。这迫使智能体停下来等同伴跑完一轮，才能交换中间发现。轮次制隐含了一个昂贵的假设——重要发现可以等到下一个通信阶段再说。</li><li><strong>有名无实的异步</strong>：只提供有限的异步能力，比如自上而下派活，没有智能体之间的横向点对点通道，共享记忆也需要智能体主动暂停工作去读取更新。</li></ul>



<p class="wp-block-paragraph">按照论文的说法，当前多智能体系统的主要瓶颈就一句话：一个正在干活的智能体，没办法同时在听。研究者写道，就他们所知，还没有哪个系统能让并发工作的智能体通过一条横向的自然语言通道，获得对彼此的被动感知。</p>



<h2 class="wp-block-heading">AgentRadio 怎么运作</h2>



<p class="wp-block-paragraph">为了打破&#8221;干活&#8221;与&#8221;倾听&#8221;之间的互斥，研究者做出了 AgentRadio。它是一层异步消息传递机制，可以直接插进现有的编码智能体框架里，为智能体提供三个原语：</p>



<ul class="wp-block-list"><li><code>create_thread</code>：在参与的智能体之间开启一个会话线程。</li><li><code>send_message</code>：向线程追加一条消息，发出后立即返回，不阻塞发送方。</li><li><code>wait_for_mention</code>：阻塞进程，直到收到一条提及调用方的消息；消息送达时会附带所有线程的完整快照，让智能体立刻拿到上下文。</li></ul>



<p class="wp-block-paragraph">三者组合起来，智能体就进入了一种&#8221;被动感知&#8221;状态：可以继续做主线任务，同时在后台收发消息、更新自己掌握的信息。</p>



<p class="wp-block-paragraph">AgentRadio 的代码以 Apache 2.0 协议开源在 GitHub 上，设计上足够轻量，不需要改动底层的 Claude Code、Codex CLI 等智能体框架。架构分两部分：一是消息服务器，作为独立进程充当中心枢纽，存放所有活跃线程、消息和提及记录；二是框架侧集成，智能体通过三个简单的 shell 脚本与服务器交互，每个脚本对应一个原语。</p>



<p class="wp-block-paragraph">系统运行的唯一硬性要求，是智能体框架能把 shell 命令作为后台任务运行。智能体会在系统提示词里被要求常驻一个监听进程，并通过提供的脚本发消息。把 <code>wait_for_mention</code> 脚本放到后台跑，智能体就能一边继续工作一边异步收到通知。要接进现有技术栈，团队仍需写一个&#8221;轻量适配层，负责启动工作进程、分配身份、连接共享服务器并管理最终综合&#8221;，但这部分工作位于编码智能体的外围，不必改动底层模型。</p>



<h2 class="wp-block-heading">实测：翻倍的准确率，和翻了六倍的账单</h2>



<p class="wp-block-paragraph">研究者在 SWE-Atlas QnA 基准的 124 个任务上验证了这套框架，覆盖系统设计、根因分析、安全和接口集成等领域。骨干模型选用 Claude Opus 4.6 和 DeepSeek V4 Pro，框架配置从单个编码智能体（B0）、经典分工的智能体团队（L1），一直排到使用 AgentRadio 异步协同的团队（L3）。</p>



<p class="wp-block-paragraph">结果是：Opus 4.6 单智能体只解决 32.3% 的任务，完整的 AgentRadio 配置把这个数字提到 62.1%，接近翻倍，并且越过了 Opus 4.8 单智能体 57.2% 的成绩；DeepSeek V4 Pro 的成绩也从 29.0% 提升到 50.8%。</p>



<p class="wp-block-paragraph">论文里有一个 MinIO 系统的真实案例很能说明问题。解题需要逐请求检查服务器日志，而智能体在初始规划阶段没预料到这一点。在只能协作、不能异步通信的 L2 配置下，两个智能体在执行命令时各自意识到需要这些日志，但因为无法在执行中途共享发现，一个默默放弃了，另一个也没向团队提出；到了评审阶段，整个团队一致同意了错误答案，丢掉五个评分项。启用 AgentRadio 之后，智能体做出了同样的中途发现，但其中一个立刻把服务端日志证据广播到共享工作日志上，其余智能体因为处在被动监听状态，马上吸收了这条新证据。最终这道题从不及格变成了 16 分满分。</p>



<p class="wp-block-paragraph">研究者对此的总结是，关键差别在于时机：团队不需要多一个智能体，也不需要多一轮评审，它需要的只是让某个智能体的发现在其操作价值过期之前传到该传的人手里。</p>



<p class="wp-block-paragraph">代价也是真金白银。固定规模的多智能体团队必然成倍推高 token 开销，研究者承认&#8221;这笔税是实实在在的&#8221;：平均每个任务的接口调用花费，从单个 Opus 智能体的 2.96 美元涨到 AgentRadio 完整方案的 19.45 美元。</p>



<p class="wp-block-paragraph">不过更关键的对照实验证明，这不是单纯靠砸钱换来的。当研究者用 17.76 美元跑六次独立的 Opus 任务做算力对齐时，模型只解决了 37.9% 的任务，远低于 AgentRadio 的 62.1%。这说明 AgentRadio 的收益来自架构本身，而不是暴力堆规模。</p>



<h2 class="wp-block-heading">什么时候该上多智能体</h2>



<p class="wp-block-paragraph">研究者同时给出了明确的边界：固定的多智能体团队不该成为所有工程任务的默认答案。判断是否需要多智能体，更有效的标准是任务里有没有&#8221;责任断点&#8221;——也就是那些&#8221;一名称职的工程师会主动叫上另一个人&#8221;的位置：工作跨越了归属边界、需要一个独立假设，或者风险高到值得单独验证。</p>



<p class="wp-block-paragraph">按照他们的说法，当任务可以被拆解、拆出来的部分之间仍然互相依赖、单智能体成功率不稳定，而且答案不完整会带来实质的下游代价时，协同机制就非常合适。典型场景包括仓库级架构问题、陌生的遗留系统、跨服务的事故排查、安全分析、依赖迁移和多模块重构。反过来，对&#8221;边界清晰、影响局部、可以回滚&#8221;的活——比如一处已知的单文件改动或样板代码生成——单个智能体依然是更干净的选择。研究者的建议是：只要一份上下文还能诚实地扛住整个问题，就继续用一个智能体；只有当现有智能体不得不压缩掉证据、跨越独立的归属边界，或者需要自己验证自己的高影响结论时，才引入新的责任方。</p>



<p class="wp-block-paragraph">未解的难题集中在&#8221;注意力治理与验证&#8221;上。被动感知让通信在执行期间随时可用，但它并不决定应该存在哪些智能体、哪条发现值得打断别人、该通知谁、证据强到什么程度才可以推翻原计划。如果每个智能体都收到每一条更新，通信层就退化成噪声；如果几个智能体本来就共享同一个错误假设，更快的通信只会让错误扩散得更快。</p>



<p class="wp-block-paragraph">论文中一个基于 Grafana 平台的案例正好印证了这个局限：九项评分标准中有四项需要得出否定性结论，比如观察到某个数据源选择器不会自动选中。智能体跑完了相关测试，却没有一个形成那个缺失的否定假设，两种配置都在这四项上失分。研究者的评价是，被动感知能扩散某个人已经提出的想法，但它没法凭空供给一个团队里从未出现过的构想。</p>



<p class="wp-block-paragraph">按照研究者的判断，下一代系统需要的是自适应的责任分配、基于证据的路由、冲突解决机制、明确的成本上限、权限管理、故障恢复，以及清晰的人工升级节点；最重要的是可追溯的来源记录，好让工程负责人能查清是哪个智能体给出了某项断言、某个动作为何被采纳。用他们的原话说：运行时间越长的智能体，让沟通变得越重要，也让追责变得更难作假。</p>



<p class="wp-block-paragraph">AgentRadio 目前仍是一个使用固定四智能体团队和五阶段协议的受控研究实现，其中的原理正被改造成一款名为 Coral Code 的商业产品，思路从自上而下的刚性协议转为自下而上——工程师从自己现有的编码智能体起步，只有当证据本身需要时，才引入仓库范围的调查、专职责任分工和通信机制。</p>



<p class="has-small-font-size wp-block-paragraph">来源：VentureBeat《Four AI agents coordinating in real time outperformed Claude Opus 4.8 on enterprise coding tasks》，作者 Ben Dickson；论文数据来自 arXiv 预印本</p>

]]></content:encoded>
					
					<wfw:commentRss>https://mylogs.cn/agentradio-multi-agent-coordination/feed/</wfw:commentRss>
			<slash:comments>0</slash:comments>
		
		
			</item>
		<item>
		<title>规范没人读，AI 一口气揪出 23 万处违规</title>
		<link>https://mylogs.cn/cloudflare-codex-ai-engineering-standards/</link>
					<comments>https://mylogs.cn/cloudflare-codex-ai-engineering-standards/#respond</comments>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Wed, 05 Aug 2026 00:36:33 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[AI代码审查]]></category>
		<category><![CDATA[AI智能体]]></category>
		<category><![CDATA[Cloudflare]]></category>
		<category><![CDATA[工程规范]]></category>
		<category><![CDATA[研发效能]]></category>
		<category><![CDATA[软件工程]]></category>
		<guid isPermaLink="false">https://mylogs.cn/cloudflare-codex-ai-engineering-standards/</guid>

					<description><![CDATA[过去四个月，Cloudflare 的 AI 代码审查器标记了近 23 万处不符合公司工程规范的写法，其中近 1 [&#8230;]]]></description>
										<content:encoded><![CDATA[
<p class="wp-block-paragraph">过去四个月，Cloudflare 的 AI 代码审查器标记了近 23 万处不符合公司工程规范的写法，其中近 1.6 万处严重到直接拦下了合并请求。另一个专门审设计文档的智能体，则在代码动工之前评估了将近 600 份技术方案。</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6a819a5b4304f&quot;}" data-wp-interactive="core/image" data-wp-key="6a819a5b4304f" class="wp-block-image size-large aligncenter wp-lightbox-container"><img loading="lazy" decoding="async" width="1200" height="628" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/08/38d0ec89ba6d427090ac3e321ba961c2_header.webp" alt="规范没人读，AI 一口气揪出 23 万处违规" class="wp-image-3603" style="max-width:100%;height:auto;" srcset="https://mylogs.cn/wp-content/uploads/2026/08/38d0ec89ba6d427090ac3e321ba961c2_header.webp 1200w, https://mylogs.cn/wp-content/uploads/2026/08/38d0ec89ba6d427090ac3e321ba961c2_header-300x157.webp 300w, https://mylogs.cn/wp-content/uploads/2026/08/38d0ec89ba6d427090ac3e321ba961c2_header-1024x536.webp 1024w, https://mylogs.cn/wp-content/uploads/2026/08/38d0ec89ba6d427090ac3e321ba961c2_header-768x402.webp 768w" sizes="auto, (max-width: 1200px) 100vw, 1200px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">图片来源：Cloudflare</figcaption></figure>





<p class="wp-block-paragraph">支撑这两套系统的是同一样东西：Cloudflare Codex——一套同时写给人和智能体看的工程规范。</p>



<h2 class="wp-block-heading">问题不是没规范，是规范找不着</h2>



<p class="wp-block-paragraph">在 Codex 之前，Cloudflare 的开发指引散落在各处：正式文档、代码仓库里的说明文件、聊天记录，以及资深工程师脑子里的经验。工程师花在找规矩上的时间，常常超过花在解决问题上的时间。更糟的是，就算翻到了某条说法，也未必能判断它是否还有效、是否权威、是否适用于眼下的情况。</p>



<p class="wp-block-paragraph">公司规模越大，这套模式越撑不住。没有哪个工程师能读完所有规范，评审者也不可能逐条核对每项要求。人员在团队之间流动，沉淀下来的经验越来越难被找回，而那些没被持续提示和执行的指引，最终导致各个项目各行其是。</p>



<p class="wp-block-paragraph">Cloudflare 的做法是把这些知识重建成 Codex：一套有治理机制的工程规范，智能体可以在工程师干活的当下，把相关条款调取出来并应用。</p>



<h2 class="wp-block-heading">规范怎么写，又怎么生效</h2>



<p class="wp-block-paragraph">Codex 按领域切分，涵盖架构类（例如前端、控制平面）、横切关注点（安全、可靠性）、具体语言（TypeScript、Rust）等方向，每个领域设一名负责人，对内容、一致性和整体质量负责。</p>



<p class="wp-block-paragraph">规范采用 RFC（征求意见稿）格式撰写，要求用 RFC 2119 定义的 SHOULD（建议）与 MUST（必须）关键字表述，并在文件头部保留领域、状态等元数据。任何员工只要对某个领域有兴趣和相应能力，都可以按规定结构提交合并请求发起一份 RFC，经过多轮逐步扩大范围的评审，最后由领域负责人拍板，纳入 Codex 并发布到内部站点。</p>



<p class="wp-block-paragraph">关键设计在于两段式生效。RFC 进入「已批准」状态后，智能体就会开始标记违规，但只提示、不拦截；只有当它被显式提升到「已强制」状态，MUST 类要求才真正具备拦下合并的效力。这个额外的推进步骤给了团队消化新要求的时间，也照顾了那些在执行层面还需要额外准备的情况。</p>



<p class="wp-block-paragraph">还有一个绕不开的工程问题：Codex 已经积累了 60 多份 RFC 且仍在增加，如果原封不动全部喂给大模型，光是语料体量就会挤爆上下文窗口，反而拉低输出质量。Cloudflare 的解法是用一个专门的智能体，自动把所有 SHOULD 和 MUST 语句抽取压缩成 JSON 结构，并附上支持惰性发现和渐进披露的元数据。每条语句都有一个稳定的标识符，即便所属 RFC 被修订也不会变化——这让同一条要求能够在不同系统间被长期追踪，对监控、分析和例外处理都是必需的。团队最初把语句抽成更简洁的 Markdown 文件，后来才换成结构化程度更高的 JSON，好让智能体能更精准地筛选自己需要的内容。</p>



<h2 class="wp-block-heading">三个正在用它的地方</h2>



<p class="wp-block-paragraph">目前有三个智能体在日常工作中消费 Codex。</p>



<p class="wp-block-paragraph">第一个是 AI 代码审查器。它从多个维度评估合并请求，Codex 合规性是其中之一。每次审查时，它先取出相关 RFC 并解析其中的语句，只有在模型或协调器需要更多上下文时才加载 RFC 全文——多数情况下，抽取出的语句已足够解释一处违规。SHOULD 与 MUST 的区别加上 RFC 的状态，共同决定审查器的反应：来自「已批准」RFC 的发现只是不阻塞的建议；一旦 RFC 进入「已强制」状态，未满足的 MUST 要求会让审查器拒绝批准或直接拦下合并，具体取决于严重程度。自今年年初 Codex 建立以来，这个审查器累计标记了近 23 万处违规，其中近 1.6 万处导致合并未获批准。</p>



<p class="wp-block-paragraph">它也有明显的体验短板：受协调器框架和子智能体执行的拖累，跑完一轮通常要几分钟，工程师抱怨等待时间和返工带来的额外往返。Cloudflare 为此补了两条路。对那些可以机械校验的语言类要求，提供与 Codex 规范对齐的定制 linter（静态检查工具）配置包，毫秒级出结果；TypeScript 率先支持，并统一使用 oxlint——其维护团队 VoidZero 近期已加入 Cloudflare，Rust 版本正在开发，Go 随后跟进。此外，AI 代码审查器现在也可以通过命令行在本地运行，功能与持续集成环境中的协调器一致，结果直接打在终端里。</p>



<p class="wp-block-paragraph">第二个是设计文档审查器，面向工程师在动手前撰写的技术方案。它跑在 Cloudflare Worker 上，结果和状态存进 D1 数据库，模型请求走 AI Gateway，由定时触发器发起扫描。运行时它先按领域和章节过滤 Codex，把语言特性、实现细节一类与设计无关的 RFC 排除在外，再依据严重程度对发现分级。自 2026 年 5 月初以来，它已审查近 600 份独立的开放设计文档，算上按需重跑和文档变更触发的重跑，累计调用超过 3200 次。绝大多数发现属于「重要」（65%）或「次要」（29%）级别，「严重」级别只占 6%。</p>



<p class="wp-block-paragraph">第三个是事故报告审查器，把同一套方法用在事故复盘上。除了检查报告是否完整，它还评估报告有没有讲清楚发生了什么、有没有识别出促成因素、有没有记录处置过程、有没有提出有意义的后续行动项。自 2026 年 5 月以来，它已评估 200 多份事故报告，指出过遗漏后续行动项、时间线不完整、漏记检测信号等问题。这些报告中有 93% 对应的是低影响、仅限内部或预防性声明的事故；对于高危事故，这道审查已被设为强制流程的一部分，所有发现被处理完毕之前，报告不算完成。</p>



<h2 class="wp-block-heading">下一步</h2>



<p class="wp-block-paragraph">Cloudflare 表示将把这套模式扩展到整个软件开发生命周期，让智能体在设计、实现和运维各环节一致地暴露问题。更长期的目标是让智能体不只发现问题，还能以越来越高的自主性提出修复方案，而审阅和批准仍由工程师负责。</p>



<p class="wp-block-paragraph">Codex 的适用范围也在往工程之外延伸，产品、安全、合规以及信任与安全团队已开始加入各自的标准。</p>



<p class="wp-block-paragraph">用负责这项工作的工程师 Timo Reimann 的话说，AI 最有用的地方，是在工程师真正动手的那个节点，把对的指引送到他面前。</p>



<p class="has-small-font-size wp-block-paragraph">来源：Cloudflare 官方博客，作者 Timo Reimann</p>

]]></content:encoded>
					
					<wfw:commentRss>https://mylogs.cn/cloudflare-codex-ai-engineering-standards/feed/</wfw:commentRss>
			<slash:comments>0</slash:comments>
		
		
			</item>
		<item>
		<title>COBOL 迁 Java，bug 一起搬</title>
		<link>https://mylogs.cn/cobol-%e8%bf%81-java%ef%bc%8c%e8%bf%9e-bug-%e9%83%bd%e8%a6%81%e4%b8%80%e8%b5%b7%e6%90%ac/</link>
					<comments>https://mylogs.cn/cobol-%e8%bf%81-java%ef%bc%8c%e8%bf%9e-bug-%e9%83%bd%e8%a6%81%e4%b8%80%e8%b5%b7%e6%90%ac/#respond</comments>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Mon, 03 Aug 2026 07:09:35 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[AI编程]]></category>
		<category><![CDATA[COBOL]]></category>
		<category><![CDATA[Java]]></category>
		<category><![CDATA[代码迁移]]></category>
		<category><![CDATA[软件工程]]></category>
		<category><![CDATA[遗留系统]]></category>
		<category><![CDATA[金融科技]]></category>
		<guid isPermaLink="false">https://mylogs.cn/?p=3412</guid>

					<description><![CDATA[你公司那套跑了几十年、没人敢动的老系统，可能正在被 AI 盯上。 2026 年 7 月 30 日，一项发布在  [&#8230;]]]></description>
										<content:encoded><![CDATA[
<p class="wp-block-paragraph">你公司那套跑了几十年、没人敢动的老系统，可能正在被 AI 盯上。</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6a819a5b43ca5&quot;}" data-wp-interactive="core/image" data-wp-key="6a819a5b43ca5" class="wp-block-image size-large aligncenter wp-lightbox-container"><img loading="lazy" decoding="async" width="996" height="854" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/08/55cd0cb19648468a0c6c8e3c0fb04426_header.webp" alt="COBOL 迁 Java，连 bug 都要一起搬" class="wp-image-3417" style="max-width:100%;height:auto;" srcset="https://mylogs.cn/wp-content/uploads/2026/08/55cd0cb19648468a0c6c8e3c0fb04426_header.webp 996w, https://mylogs.cn/wp-content/uploads/2026/08/55cd0cb19648468a0c6c8e3c0fb04426_header-300x257.webp 300w, https://mylogs.cn/wp-content/uploads/2026/08/55cd0cb19648468a0c6c8e3c0fb04426_header-768x659.webp 768w" sizes="auto, (max-width: 996px) 100vw, 996px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">图片来源：arXiv:2607.28271</figcaption></figure>





<p class="wp-block-paragraph">2026 年 7 月 30 日，一项发布在 arXiv 的研究提出了一种叫“锁匠循环”的方法，用来验证把遗留 COBOL 程序自动迁移成 Java 后，两者是否真的一致。研究团队为 COBOL 源码和生成的 Java 目标各准备一套模拟运行环境，在普通服务器上并行执行；再用智能体自动构造测试输入，逐层探索程序分支；遇到“锁住的段落”就分析条件、生成等价变异，直到打开新路。</p>



<p class="wp-block-paragraph">他们试了三个真实案例，代码量从 430 行到 4114 行不等，两个开源程序几乎被测满，一个接近生产规模的内部程序也达到了 91.90% 的分支覆盖率。</p>



<h2 class="wp-block-heading">兼容性真，不等于正确性真</h2>



<p class="wp-block-paragraph">有意思的是，论文专门强调：这种验证保证的是“兼容性真”，不是“语义正确真”。也就是说，Java 不仅要复现 COBOL 的原有功能，连它自带的 bug 都要一起搬过去，否则下游业务可能把“错误结果”当规则用了好几年，一改反而引发连锁故障。</p>



<p class="wp-block-paragraph">说白了，银行、保险公司用 AI 迁移老代码时，最怕的不是“改对了没有”，而是“改完之后哪儿悄悄地不一样了”。锁匠循环的价值，就是把这种“不一样”在上线前自动抓出来。</p>



<h2 class="wp-block-heading">给迁移团队的一句话</h2>



<p class="wp-block-paragraph">如果你的团队也在考虑让 AI 重写祖传代码，建议先别急着全量替换，而是拿一个小模块做这种并排验证。毕竟老系统的命根子不是代码多先进，而是业务连续性。</p>



<p class="wp-block-paragraph">来源：Agentic Method for Deterministic Validation of Legacy Code Migration（arXiv:2607.28271，作者 Andras Ferenczi 等）</p>

]]></content:encoded>
					
					<wfw:commentRss>https://mylogs.cn/cobol-%e8%bf%81-java%ef%bc%8c%e8%bf%9e-bug-%e9%83%bd%e8%a6%81%e4%b8%80%e8%b5%b7%e6%90%ac/feed/</wfw:commentRss>
			<slash:comments>0</slash:comments>
		
		
			</item>
		<item>
		<title>荷兰弟回归！《蜘蛛侠：崭新之日》本周三内地上映</title>
		<link>https://mylogs.cn/%e8%8d%b7%e5%85%b0%e5%bc%9f%e5%9b%9e%e5%bd%92%ef%bc%81%e3%80%8a%e8%9c%98%e8%9b%9b%e4%be%a0%ef%bc%9a%e5%b4%ad%e6%96%b0%e4%b9%8b%e6%97%a5%e3%80%8b%e6%9c%ac%e5%91%a8%e4%b8%89%e5%86%85%e5%9c%b0%e4%b8%8a/</link>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Mon, 27 Jul 2026 12:16:25 +0000</pubDate>
				<category><![CDATA[娱乐]]></category>
		<category><![CDATA[护肤]]></category>
		<category><![CDATA[消费品牌]]></category>
		<category><![CDATA[软件工程]]></category>
		<category><![CDATA[集体行动]]></category>
		<guid isPermaLink="false">https://mylogs.cn/%e8%8d%b7%e5%85%b0%e5%bc%9f%e5%9b%9e%e5%bd%92%ef%bc%81%e3%80%8a%e8%9c%98%e8%9b%9b%e4%be%a0%ef%bc%9a%e5%b4%ad%e6%96%b0%e4%b9%8b%e6%97%a5%e3%80%8b%e6%9c%ac%e5%91%a8%e4%b8%89%e5%86%85%e5%9c%b0%e4%b8%8a/</guid>

					<description><![CDATA[漫威与索尼联合出品的超级英雄巨制《蜘蛛侠：崭新之日》将于7月29日（本周三）在中国内地上映，比北美7月31日的 [&#8230;]]]></description>
										<content:encoded><![CDATA[
<p class="wp-block-paragraph">漫威与索尼联合出品的超级英雄巨制《蜘蛛侠：崭新之日》将于7月29日（本周三）在中国内地上映，比北美7月31日的档期提前两天。这是该系列自2021年《蜘蛛侠：英雄无归》缺席内地院线后，时隔多年重返中国大银幕。</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6a819a5b445da&quot;}" data-wp-interactive="core/image" data-wp-key="6a819a5b445da" class="wp-block-image size-large aligncenter wp-lightbox-container"><img loading="lazy" decoding="async" width="600" height="337" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/07/spiderman_header.webp" alt="荷兰弟回归！蜘蛛侠崭新之日本周三内地上映" class="wp-image-1613" style="max-width:100%;height:auto;" srcset="https://mylogs.cn/wp-content/uploads/2026/07/spiderman_header.webp 600w, https://mylogs.cn/wp-content/uploads/2026/07/spiderman_header-300x169.webp 300w" sizes="auto, (max-width: 600px) 100vw, 600px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">图片来源：索尼影业/哥伦比亚影片公司</figcaption></figure>





<p class="wp-block-paragraph">影片由德斯汀·克里顿执导，汤姆·赫兰德回归主演蜘蛛侠彼得·帕克。赞达亚、雅各布·巴塔隆等原班人马悉数回归，马克·鲁法洛（绿巨人布鲁斯·班纳）、乔·博恩瑟（惩罚者）重磅加盟。</p>



<p class="wp-block-paragraph">故事承接《英雄无归》结局——奇异博士的咒语让全世界遗忘了彼得·帕克的身份，包括挚友MJ和内德。四年过去，已成年的彼得独自在纽约以&#8221;全职蜘蛛侠&#8221;身份默默守护城市。长期孤身作战的巨大压力引发了他身体的&#8221;基因进化&#8221;，自产有机蛛丝的同时能力面临失控风险。与此同时，蝎子、墓石等街头反派轮番来袭，&#8221;惩罚者&#8221;弗兰克·卡塞尔也卷入其中，陷入绝境的彼得将迎来破茧重生的终极考验。</p>



<p class="wp-block-paragraph">本片在动作设计上迎来重大突破：成家班受邀担任动作指导团队，将中国传统武术的写实风格与超级英雄战斗体系融合，大量使用威亚实拍与实景搭建，力求让每一次腾跃和出拳都充满真实质感。马克·鲁法洛饰演的布鲁斯·班纳将为陷入困境的彼得提供关键支援。</p>



<p class="wp-block-paragraph">据灯塔专业版数据，截至7月20日该片预售总票房已突破1000万元人民币，暑期档期待值持续走高。荷兰弟在接受采访时表示：&#8221;我们打造出了有史以来最棒的一版蜘蛛侠电影。&#8221;</p>



<p class="wp-block-paragraph">来源：综合多家媒体报道</p>

]]></content:encoded>
					
		
		
			</item>
		<item>
		<title>软件工程师如何应对AI时代：学习新技能、回归基础与集体行动</title>
		<link>https://mylogs.cn/%e8%bd%af%e4%bb%b6%e5%b7%a5%e7%a8%8b%e5%b8%88%e5%a6%82%e4%bd%95%e5%ba%94%e5%af%b9ai%e6%97%b6%e4%bb%a3%ef%bc%9a%e5%ad%a6%e4%b9%a0%e6%96%b0%e6%8a%80%e8%83%bd%e3%80%81%e5%9b%9e%e5%bd%92%e5%9f%ba%e7%a1%80/</link>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Mon, 13 Jul 2026 01:09:43 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[人工智能]]></category>
		<category><![CDATA[就业市场]]></category>
		<category><![CDATA[计算机基础]]></category>
		<category><![CDATA[软件工程]]></category>
		<category><![CDATA[集体行动]]></category>
		<guid isPermaLink="false">https://mylogs.cn/%e8%bd%af%e4%bb%b6%e5%b7%a5%e7%a8%8b%e5%b8%88%e5%a6%82%e4%bd%95%e5%ba%94%e5%af%b9ai%e6%97%b6%e4%bb%a3%ef%bc%9a%e5%ad%a6%e4%b9%a0%e6%96%b0%e6%8a%80%e8%83%bd%e3%80%81%e5%9b%9e%e5%bd%92%e5%9f%ba%e7%a1%80/</guid>

					<description><![CDATA[据《卫报》报道，面对人工智能对软件开发领域的深刻变革，软件工程师群体正在通过三种主要方式主动适应：积极学习新技 [&#8230;]]]></description>
										<content:encoded><![CDATA[
<p class="wp-block-paragraph">据《卫报》报道，面对人工智能对软件开发领域的深刻变革，软件工程师群体正在通过三种主要方式主动适应：积极学习新技能、回归计算机科学基础原理，以及推动行业内的集体行动。

文章指出，随着AI编码助手和自动化工具的快速发展，软件工程师的传统工作模式正经历显著变化。一些工程师选择拥抱新技术，将AI视为提升效率的工具而非威胁；另一些人则认为，过度依赖AI工具可能导致基础能力的退化，因此强调回归算法、数据结构和系统架构等核心知识。

在学习新技能方面，工程师们正在拓展AI无法轻易替代的能力领域，包括复杂系统设计、跨团队协作、业务理解以及伦理判断等软技能。同时，部分工程师开始深入研究AI系统本身的工作原理，以便更好地驾驭这些工具。

&#8220;回归基础&#8221;的趋势则反映出对技术本质的重新审视。一些资深工程师认为，无论工具如何演进，扎实的计算机科学基础始终是应对技术变革的根本保障。

此外，集体行动的呼声也在上升。部分工程师通过行业组织、工会或开源社区等平台，推动建立AI使用的伦理准则、保障就业权益，以及确保技术发展的成果能够更公平地分配。

《卫报》指出，软件工程师的适应策略不仅关乎个人职业发展，也在一定程度上塑造着整个科技行业面对AI变革的路径选择。</p>
]]></content:encoded>
					
		
		
			</item>
	</channel>
</rss>
