韩国芯片设计服务企业 SEMIFIVE 当地时间 9 月 8 日宣布,由韩国人工智能芯片初创企业 HyperAccel 设计的数据中心 AI 推理加速器”Bertha”,已在三星晶圆代工的 4nm 制程节点实现量产。

500mm² 大芯片,专攻大模型推理
SEMIFIVE 表示,Bertha 的面积达到 500mm²。结合”数据中心”这一定位来看,本次量产版本应为 HyperAccel 官网公示的 Bertha 500;该公司另有一款面向端侧部署的产品 Bertha 100。
规格方面,Bertha 500 拥有 768 TFLOPS 的 FP8 算力,支持 FP16、FP8、FP4 以及 INT8、INT4 数据格式,集成 256MB 片上 SRAM 缓存,片外可连接 128GB 或 256GB 的 LPDDR5X 内存,带宽为 546GB/s(推测为 512-bit 8533MT/s 配置)。芯片 TDP 为 250W,采用双槽 PCIe AIC 外形规格。
HyperAccel 宣称,该芯片在吞吐量、成本效益、能效三个方面分别可达到英伟达 H100 的 2 倍、19 倍和 12 倍。不过这组数据来自厂商自身表述,目前尚无独立的第三方可复现基准测试结果。
从设计到量产,比原计划晚了半年
Bertha 项目合作始于 2024 年 10 月。当时双方签订开发与量产合同,计划基于 4nm 制程开发,并目标在 2026 年第一季度量产。实际量产时间落在第三季度,比原计划有所延后。
2026 年 5 月,SEMIFIVE 在圣何塞举行的三星先进代工生态论坛上表示,已基于三星晶圆代工 4nm SF4X 工艺完成 Bertha 大芯片的设计与验证工作。
据 SEMIFIVE 介绍,公司为该项目提供了覆盖前端设计、验证、封装、测试到量产供应的交钥匙服务,这也是其在三星 4nm 工艺上的首个大规模量产项目。芯片面积超过 500mm² 之后,功耗、散热与良率管理的难度显著上升,这也是先进制程大芯片量产的主要门槛。
LPU 架构:为 Transformer 推理而生
HyperAccel 将 Bertha 定位为”大模型处理单元”(LPU),架构围绕三个方向展开:可编程的 AI 专用核心、让内存带宽与算力相匹配的数据流设计(模型参数可跨核心复用),以及在模型规模扩大时让通信与计算重叠的多芯片扩展能力。
对大模型推理而言,权重与中间数据的搬运效率往往与算力同等重要,内存带宽、互联行为、批处理策略和调度方式都会影响最终的实际吞吐与延迟。这也是专用推理架构与通用 GPU 设计路线的差异所在。
SEMIFIVE 订单半年翻倍
Bertha 是 SEMIFIVE 近一年第三个进入量产的项目。此前,该公司已在 2025 年第三季度为韩华视觉的安防摄像头量产 Wisenet 9 AI 专用芯片,并在 2026 年第二季度为一家日本客户量产高性能计算 AI 芯片。
订单数据同步走高。SEMIFIVE 在 2026 年上半年获得 4230 亿韩元的新增量产订单,接近 2025 年全年 2120 亿韩元的两倍;季度订单额从第一季度的 156 亿韩元增至第二季度的 267 亿韩元,环比增长 71%,其中海外订单占第二季度订单的 45%。
SEMIFIVE 首席执行官表示,随着 AI 产业重心从训练转向推理,数据中心对专用加速器的需求正在快速上升,此次量产验证了公司在先进制程上的执行能力。







