SEMIFIVE Bertha 开始量产,但客户部署才是真正考验
- Sophie Larsen

- 1小时前
- 讀畢需時 14 分鐘
SEMIFIVE Bertha 已开始采用 Samsung Foundry 的 4nm 工艺量产,推动 HyperAccel 的 LLM 推理加速器从样片阶段迈入初步规模化制造。
9 月 8 日的公告之所以重要,是因为 Bertha 瞄准的市场仍由 Nvidia GPU 及其成熟的软件生态主导。HyperAccel 押注于专为语言模型推理设计的处理器,认为其能够带来更高的资源利用率、能效和运营经济性。
然而,制造并不等同于客户部署。HyperAccel 仍须将成品芯片转化为通过认证的加速卡,在生产工作负载下验证软件能力,并争取后续订单。这一区别正是此次消息真正意义所在。
SEMIFIVE Bertha 量产迈出原型阶段
眼下的变化是商业化制造,而非又一项芯片规格发布或实验室基准测试。
根据这份量产公告,SEMIFIVE 已开始生产 HyperAccel 的数据中心推理加速器。两家公司将该芯片称为 Bertha,而 HyperAccel 则将完整产品命名为 Bertha 500。
SEMIFIVE 表示,这是其首个采用 Samsung Foundry 4nm 工艺的大规模制造项目。该公司还称,随着 HyperAccel 扩展服务,首份生产合同预计将带来额外采购订单。
这些后续订单只是预期,而非保证。公告未披露 Bertha 的晶圆产量、出货数量、客户验收率或合同金额,也没有公布正式上市日期。
这一制造里程碑之前,双方曾于 2024 年 10 月宣布开发协议。该开发合同最初将量产目标定在 2026 年第一季度。
因此,9 月的公告晚于最初目标。不过,它仍代表着有实质意义的进展,因为生产一款大型加速器远不只是完成其逻辑设计。
据 SEMIFIVE 介绍,Bertha 的裸片面积超过 500 平方毫米。裸片是从加工完成的硅晶圆上切割出的单颗芯片。更大的裸片意味着更大面积可能暴露于缺陷之下,通常也会带来更严苛的功耗、散热、封装和良率要求。
良率衡量的是制造出的裸片中符合既定运行标准的比例。它直接影响成本,因为缺陷裸片会占用宝贵的晶圆面积,却无法成为可销售产品。
SEMIFIVE 表示,其负责了前端设计、验证、封装、测试及批量供应。这一交钥匙角色使该公司处于 HyperAccel 的处理器架构与 Samsung 制造设施之间。
这一位置在商业上颇为重要。许多 AI 初创公司能够设计专用处理器,但能够管理从设计文件到经过测试的系统这一高成本过渡过程的公司更少。
SEMIFIVE 此前已将其他定制芯片推向量产。该公司列举了 Hanwha Vision 的 Wisenet 9 安防处理器,以及一家未具名日本客户的高性能计算芯片。
Bertha 将这一业绩延伸至数据中心推理领域,也为 SEMIFIVE 增添了一个涉及先进制程大型裸片的参考项目。
该公司报告称,2026 年上半年新增量产订单达到 423 亿韩元。该数字涵盖 SEMIFIVE 的更广泛业务,而非仅指 Bertha。
Bertha 的贡献将取决于后续订单。目前的里程碑表明制造流程已经运转,但尚未证明存在持续性需求。
这也是为何该公告带来了张力,而非化解了不确定性。HyperAccel 现在已有芯片进入生产,但更艰难的商业验证仍在前方。
为什么 Bertha 瞄准 LLM 推理的经济性
HyperAccel 并非试图打造通用 GPU 的替代品;它瞄准的是提供语言模型服务时的内存和利用率成本。
推理是运行已训练模型以回答提示词或生成 token 的过程。与训练不同,只要 AI 产品持续为用户提供服务,推理就会成为一项持续性支出。
语言模型在生成输出时会反复从内存中读取权重。这种特性可能使内存带宽,而非原始数学计算能力,成为实际瓶颈。
通用 GPU 包含面向多种工作负载的资源。这些能力让 GPU 保持灵活,但在受内存限制的 token 生成过程中,部分计算单元可能处于闲置状态。
HyperAccel 将其设计称为 LPU,即延迟处理单元。该架构围绕 transformer 推理来分配硬件与数据移动,而非支持 GPU 更广泛的工作负载范围。
该公司公开的设计通过精简内存访问,让模型权重持续流向执行单元。它还试图在核心之间复用参数,并减少闲置计算能力。
HyperAccel 的架构论文描述了一种可扩展的同步互连,用于协调多个处理器。该设计将通信与计算重叠进行,从而减少处理器彼此等待的时间。
当单个模型无法装入一张加速器的内存时,这一特性尤为重要。大型部署会将模型分散到多个设备上,使同步成为重要的延迟来源。
该论文还介绍了 HyperAccel 的编译器与运行时环境 HyperDex。HyperDex 旨在将熟悉的模型接口与该公司的自定义指令集连接起来。
仅有硬件无法支撑应用服务。运营方还需要驱动程序、编译器、模型支持、监控工具、调度能力,以及与现有服务框架的集成。
HyperAccel 表示,HyperDex 支持 PyTorch、ONNX、vLLM,以及类似 Hugging Face 工具的接口。这些兼容性主张回应了考虑非 GPU 基础设施的客户所关心的核心问题。
Bertha 500 将 LPU 架构与八个 LPDDR5X 内存通道及 PCIe Gen5 连接能力结合。相较于旗舰加速器常用的 HBM,LPDDR5X 提供更低的成本和功耗。
这一内存选择确立了 Bertha 的核心取舍。HyperAccel 接受低于基于 HBM 的 GPU 的峰值带宽,继而尝试利用更高比例的可用带宽。
公开的Bertha 规格列出其内存带宽为每秒 546 GB,同时列出 128 GB 内存、可扩展至 256 GB,以及 250 瓦热设计功耗。
HyperAccel 标称其 FP16 性能为每秒 384 万亿次运算,FP8 性能为每秒 768 万亿次运算。在模型能够在这些设置下保持可接受精度时,低精度格式可减少内存使用并提高吞吐量。
据该公司介绍,这款加速器支持从 1 到 1,024 的批处理大小。批处理大小衡量系统同时处理多少请求或序列。
较大的批处理可提升总体吞吐量,但交互式应用同样关注响应延迟。因此,有价值的生产级比较必须披露工作负载、模型、精度、批处理大小、序列长度和延迟目标。
HyperAccel 声称,在其比较中,Bertha 可达到每秒 1,645 个 token,而 Nvidia H100 为 804 个 token。该公司还声称其成本效率高出 19 倍,能效高出 12 倍。
这些数字属于公司基准测试。公开产品页面没有提供足够的测试方法细节,因此不能将其视为独立比较结果。
较早的架构论文给出了更为克制的结果。论文报告称,在运行 OPT 66B 模型时,其能效为双 H100 服务器的 1.33 倍。
这一差异并不必然意味着任一结果有误。论文评估的是建模架构和较早的服务器配置,而产品页面描述的是 Bertha 500。
不过,这一差距也说明精确测试方法为何重要。买家需要的是来自已交付系统、可复现的结果,而不是从不同配置中抽取出的孤立比率。
主要对手是 Nvidia 的软件优势
Bertha 所竞争的是围绕 Nvidia 建立起来的运行环境,而不是某一款 GPU 的规格。
Nvidia 的地位不仅建立在处理器性能之上。开发者已经在使用 CUDA 库、优化内核、部署框架、管理工具和成熟的云服务。
这种既有生态降低了运营风险。基础设施团队了解 GPU 系统的行为方式,软件供应商也会例行在 Nvidia 硬件上测试其产品。
专用加速器可能赢得基准测试,却仍可能输掉采购决策。迁移工作、模型覆盖范围、调试工具、可靠性和员工熟悉程度都会影响总体运营成本。
HyperAccel 的回应是兼容,而非孤立。该公司表示,HyperDex 支持广泛使用的模型框架,并提供用于部署、优化和性能分析的软件开发工具。
该公司还列出对 Llama、Qwen、Mistral、DeepSeek、Falcon 和 Gemma 等 transformer 系列的支持。实际支持情况可能因模型版本、算子、量化方法和上下文长度而异。
客户需要通过自身工作负载验证这些细节。运行检索增强生成的采购团队,与为长上下文推理模型提供服务的供应商有着不同要求。
不过,Bertha 的专注方向确实为其提供了清晰切入点。拥有稳定推理工作负载的云服务商,可能会比最大化架构灵活性更看重可预测的吞吐量和能耗。
私有化部署同样构成一种合理的使用场景。企业可以在专用服务器上运行一组固定的内部模型,而无需通用 GPU 平台的全部能力。
高吞吐量的消费服务则创造了另一种机会。当系统生成数十亿个 token 时,能耗或服务器密度的微小改善也会累积放大。
但专用化也缩小了容错空间。如果模型架构的变化速度快于 HyperAccel 硬件和编译器的适配速度,GPU 的灵活性就会更具价值。
Nvidia 同样可以通过软件、更低精度和新一代加速器优化推理。因此,Bertha 面对的是一个持续移动的目标。
HyperAccel 并非唯一追求专用推理的公司。Google 在自有服务和云平台中使用 TPU。Amazon 提供 Inferentia 芯片,而 Groq 则借助自身处理器架构强调确定性的 token 生成。
这些替代方案验证了 AI 基础设施能够支持多种处理器类型的理念,同时也加剧了对同一批愿意超越 GPU 的客户的竞争。
Bertha 的差异化核心在于高效内存利用、LPDDR5X 容量和面向 transformer 的执行能力。这一组合需要在扣除软件和迁移成本后,依然能够带来节省。
最有力的证据将来自客户在匹配服务级别目标的条件下运行同一模型。此类测试应涵盖延迟、吞吐量、正常运行时间、能耗和工程投入。
如果没有这些证据,Bertha 仍是一种可信的技术替代方案,而非已获验证的经济替代品。量产阶段让客户拥有可供测试的真实硬件,这相比模拟仍是显著进步。
近期压力不仅落在 Nvidia 身上,也同样落在其他新兴加速器厂商身上。初创公司如今必须与已进入制造阶段的 Bertha 产品竞争。
如果 HyperAccel 获得重复部署,它就能为 LLM 专用处理器建立一个参考标杆。如果部署停滞,GPU 兼容性仍将是决定性优势。
Samsung 4nm 化解一项风险,却带来另一项考验
成熟的 4nm 制造路径降低了制程不确定性,但 Bertha 的大尺寸芯片仍使良率和散热表现成为核心商业问题。
Samsung 将 4nm FinFET 描述为一个成熟平台,定位于先进性能与量产稳定性之间。与较早的平面设计相比,FinFET 采用凸起的晶体管沟道,可提升电气控制能力。
Samsung 的 4nm 工艺概览明确将人工智能和高性能计算列为目标工作负载,同时强调了供电、热管理和大芯片良率。
这一定位与 Bertha 相符。该芯片面积超过 500 平方毫米,将大量处理、内存控制和连接功能集成于单一硅片之上。
大型单片芯片可以提供快速的内部通信,但每片晶圆可产出的芯片数量少于较小设计,也让每颗芯片暴露于更多潜在制造缺陷之下。
这使良率具有重要的经济意义。即使设计本身能够正常工作,若过多芯片未能通过认证或只能以较低工作频率运行,产品也可能难以定价。
SEMIFIVE 和 HyperAccel 均未披露 Bertha 的量产良率,也没有公布封装产能、预计月产量或初始订单涵盖的加速器数量。
对于私营制造合同而言,这类未披露情况很常见。但它们仍限制了外部观察者能从“量产”一词中得出的结论。
这项公告也带来了时间节点上的疑问。HyperAccel 的 CEO 此前曾表示,Bertha 500 的量产和客户供货目标时间为 2027 年初。
一篇 3 月采访称,首批芯片将进入调试阶段,随后进行 PCIe 卡集成和概念验证测试。该采访将 Naver Cloud 列为计划中的首批客户。
SEMIFIVE 现在表示,芯片生产于 2026 年第三季度开始。若两者指向不同阶段,这两条时间线可以同时成立。
SEMIFIVE 可能会在 HyperAccel 完成卡级验证和更广泛的产品制造之前,生产通过认证的芯片。HyperAccel 可能将“量产”保留用于已准备好交付客户部署的系统。
两家公司没有明确协调这些定义。因此,读者应区分晶圆和芯片生产,与加速器可用性之间的差别。
这种区分很重要,因为数据中心产品不只有处理器。它还需要电路板、供电、散热、固件、驱动程序、服务器认证和生产级软件。
根据 HyperAccel 的规格表,Bertha 的 250 瓦额定功耗低于许多旗舰数据中心 GPU。实际系统功耗还将包括内存、网络、主机处理器、风扇和电源转换。
散热表现会随工作负载和服务器密度变化。在多张卡上持续进行 token 生成,比短暂的基准测试运行更能检验其性能。
可靠性构成另一道门槛。云运营商期望加速器能够持续运行,同时应对故障、更新和可变需求。
HyperAccel 必须证明 HyperDex 能够管理这样的环境。在生产事故期间,稳定的驱动程序和可预测的恢复行为可能比峰值吞吐量更重要。
供应连续性同样值得关注。Samsung 4nm 的成熟度应能降低制程风险,但 HyperAccel 仍依赖晶圆厂产能、封装、测试和电路板组件。
SEMIFIVE 的交钥匙模式可能简化这些阶段之间的协调。但它也将责任集中在一段尚未经过多年大规模交付验证的新兴供应关系中。
这些问题都不会否定这一量产里程碑。它们界定了将其转化为持久产品业务所需完成的工作。
Bertha 性能主张仍需证明什么
最大的未知并非 Bertha 能否运行 LLM,而是其效率主张能否经受条件匹配、独立且面向量产的测试。
HyperAccel 的架构论证在技术上是连贯的。自回归生成需要反复读取模型权重,因此高效的数据移动非常重要。
其研究报告显示,在部分大模型测试中,带宽利用率超过 90%。对应配置下的 GPU 测量结果约为 65% 至 71%。
该论文还报告其建模 LPU 服务器的功耗更低。然而,ASIC 评估的大部分内容采用了综合、模拟和基于 FPGA 的系统组件,而非最终的 Bertha 500 产品。
这项研究支持其设计方向,但并不能独立验证 HyperAccel 当前产品页面上的每一项主张。
在买家能够有把握地解读产品对比前,仍需要披露若干信息。确切模型、输入长度、输出长度、数值格式、批处理大小和延迟目标都会影响结果。
成本效率主张还需要额外假设。硬件采购、利用率、支持服务、软件工程、折旧、电力、散热和更换周期都可能改变结论。
采用 LPDDR5X 的芯片可能降低内存成本,并以更经济的方式扩大容量。但其原始带宽也低于 HBM,这给 HyperAccel 的利用率策略带来更大压力。
这一策略在受内存限制的 token 生成期间看起来最具说服力。计算密集型提示词处理、多模态模型、推测解码和新的注意力机制都可能改变平衡。
Bertha 必须处理推理的两个主要阶段。Prefill 处理用户提示词,而 decode 按顺序生成输出 token。
系统可以针对这两个阶段采用不同优化方式。一些运营商甚至会将它们拆分至不同硬件资源池,这既为专用加速器带来机会,也带来兼容性挑战。
模型演进增加了另一项变量。混合专家模型会激活选定的参数组,而多模态系统则将文本与图像、音频或视频结合。
HyperAccel 表示,其软件支持 transformer 和多模态模型。生产试验必须证明这种支持的覆盖范围究竟有多广。
准确性同样重要。更低精度的 FP8、FP4、INT8 或 INT4 处理可以提升吞吐量,但运营商必须在量化后验证模型质量。
对比应使用等效的准确性目标。若更快的结果建立在实质不同的输出质量之上,就不能构成公平优势。
客户还应评估尾部延迟,即分布边缘较慢响应的表现。平均吞吐量可能掩盖影响真实用户的延迟。
并发性也存在类似问题。Bertha 列出的支持上限为 1,024 个并发请求,但高批处理量可能增加单个请求的等待时间。
有用的运行点取决于服务类型。离线文档处理流水线可容忍的延迟与交互式编程助手不同。
软件成熟度将影响每一项基准测试。内核质量、内存分配、请求调度、缓存和持续批处理,往往决定了多少硬件容量能够真正投入使用。
HyperAccel 通过与处理器同步构建 HyperDex,迈出了正确的战略一步。剩余的问题是,外部开发者能否无需大量厂商协助便运行它。
独立测试还应涵盖故障恢复、可观测性和升级。这些特性很少出现在产品规格页面上,却会强烈影响实际基础设施成本。
Bertha 无需在每一种工作负载上击败 H100。它需要在具有价值的一部分推理部署中,提供可靠的优势。
原则上,这一更狭窄的目标可以实现。证据必须来自已交付的卡、客户工作负载和可重复的测量结果。
三项信号将决定量产能否转化为采用
客户认证、重复制造订单和透明基准测试,将显示 SEMIFIVE Bertha 的量产是否打造出了可持续的平台。
第一项信号是与已明确客户完成成功的系统认证。HyperAccel 此前将 Naver Cloud 列为计划中的首批接收方,并提及概念验证测试。
得到确认的部署将把 Samsung 制造的硅片与真实云工作负载连接起来。它应明确模型类别、服务环境以及 Bertha 所扮演的角色。
生产环境的使用比演示更重要。它将长期检验可用性、软件集成、延迟、能耗和运营支持。
延迟或范围狭窄的试验会削弱对这项制造公告的商业解读。这将表明卡集成或软件仍未完成。
第二项信号是后续采购订单。SEMIFIVE 明确预计,随着 HyperAccel 服务扩张,将获得额外订单。
重复订单将表明初始生产交付了可用设备,且客户需要更大规模的供货。它还将支持 SEMIFIVE 的主张:量产能够产生经常性收入。
该订单的规模将很重要,尽管私营公司可能不会披露。即使只是确认扩大产量,也会比另一项设计合作更具信息价值。
没有后续订单并不能立即证明失败。认证周期可能持续数月,尤其对于新的数据中心硬件而言。
然而,若客户测试后长期沉默,将降低市场对快速采用的信心。只有当客户消耗产出时,制造产能才会创造价值。
第三项信号是使用最终 Bertha 500 卡进行的可复现基准测试。HyperAccel 当前的主张包括:相较 H100,吞吐量达到两倍、成本效率达到 19 倍、能效达到 12 倍。
这些比例需要透明的测试条件。一项可信结果应报告模型、精度、批处理大小、上下文长度、延迟、系统功耗和软件版本。
独立参与将增强证据力度。客户、研究实验室或获得认可的基准测试机构,可以在 Bertha 与 GPU 系统之间进行条件匹配的测试。
结果无需证实每一个营销比例。在有用工作负载下,更小但可重复的优势仍可支撑一项可行的业务。
更广泛的启示超越了单一韩国加速器。AI 基础设施正从以训练为中心的市场,转向更为多样化的推理环境。
这种转变为专用处理器创造了空间,因为模型服务涉及不同的工作负载形态、延迟目标和成本约束。没有任何一种架构会自动赢得所有部署场景。
SEMIFIVE 现已完成这项实验中的关键部分。其设计和制造流程已将 Bertha 从开发阶段推进至 Samsung 4nm 上的初始生产。
HyperAccel 必须完成下一部分。它需要证明,其 LPU 架构能够成为一种可获得、可管理且在经济上具吸引力的数据中心产品。
开发者应关注模型兼容性和工具链,而不应只看算力宣传。基础设施采购方在接受笼统的效率宣称前,应要求基于匹配工作负载的测试结果。
评估 Bertha 的团队应先明确服务级别目标,再在相同条件下比较吞吐量、延迟、功耗、准确性、集成工作量和故障恢复表现。
下一次值得信赖的更新,应包含部署证据,而不是又一个理论比率。在此之前,SEMIFIVE Bertha 的量产是可信的制造里程碑,但其商业价值仍有待验证。


