把一套运行多年、多达 25 万行的气象模拟程序迁移到 GPU 上加速,过去往往要耗费资深工程师数月。一篇 2026 年 8 月提交到 arXiv 的论文,展示了如何用大语言模型驱动的命令行智能体,把这件苦活系统化地完成,并且在过程中意外揪出了几处藏得很深的数值隐患。

主角:25 万行的 CReSS 气象代码
论文的案例对象是 CReSS,一套用 Fortran 写成的遗留天气模拟代码,规模超过 25 万行。这类程序不是普通的旧代码——它们是长期通过与观测数据反复比对、在领域研究中积累起科学可信度的资产。把它们搬到以 GPU 为核心的高性能计算系统,既要适配新架构,又不能丢掉原有的科学有效性。
工作流:先验证,再移植
研究团队设计了一套「以验证为中心」的 AI 辅助工作流。智能体先抽取代码里的 OpenMP 并行区域,再从有物理意义的模拟状态生成基于数据转储的内核基准,接着施加 OpenACC 变换完成 GPU 化,最后通过和参考数据的逐元素比对做数值校验。
换句话说,每一步移植都要能「对账」:新代码算出来的结果,必须和原来的老代码逐点一致,否则就不算成功。
结果:162 个内核通过验证,整体提速 5.1 倍
在以真实台风模拟为案例的测试中,这套工作流为 162 个目标内核产出了通过数值验证的 GPU 实现,并在可接受的工时范围内,拿到了应用级 5.1 倍的加速。
这意味着,原本在 CPU 上跑得很吃力的长期天气模拟,有望在不牺牲科学准确性的前提下显著提速。
意外收获:揪出 5 处数值隐患
更值得关注的是,工作流在验证环节发现了 5 个内核出现了数值偏差——根源在于浮点运算与内建函数的差异,包括阈值敏感的分支发散,以及相消效应带来的精度损失。这些问题在肉眼比对下极难发现,却被「逐元素对账」机制捕捉到,并反馈给了程序开发者。
启示:AI 移植不只是写代码
论文指出,大规模科学代码的 AI 辅助移植,难点不在代码生成本身,而在贯穿多轮会话的上下文管理、运行时状态的重建,以及从微小的静态分析疏漏中恢复。
对这类需要严格数据对账的遗产系统来说,真正关键的不是「让 AI 把代码改完」,而是设计一套以验证为先的工作流。AI 在这里更像是严谨的工程搭档,而不是甩手就用的自动转换器。
来源:arXiv:2608.13122(Tetsuya Hoshino 等,2026)







