top of page

SEMIFIVE Berthaの量産開始、しかし真の試金石は顧客導入

Samsung Foundryの4nmプロセスを採用したSEMIFIVE Berthaの量産が始まり、HyperAccelのLLM推論アクセラレータはサンプル段階を越え、初期の量産フェーズへと進んだ。

9月8日の発表が重要なのは、BerthaがNvidia GPUとその成熟したソフトウェア環境が依然として支配する市場を狙っているためだ。HyperAccelは、言語モデル推論に特化したプロセッサが、より高い利用効率、電力効率、運用面の経済性を実現できると見込んでいる。

ただし、製造開始は顧客導入を意味しない。HyperAccelは、完成したシリコンを認定済みのアクセラレータカードに仕上げ、本番ワークロードでソフトウェアを実証し、追加受注を確保する必要がある。この違いこそが、今回のニュースの本当の意味を決定づける。

SEMIFIVE Berthaの量産、試作段階を脱却

直近の変化は、新たなチップ仕様や研究室ベンチマークではなく、商業生産の開始だ。

量産開始の発表によると、SEMIFIVEはHyperAccelのデータセンター向け推論アクセラレータの生産を開始した。両社はこのチップをBerthaと呼び、HyperAccelは製品全体をBertha 500として展開している。

SEMIFIVEは、Samsung Foundryの4nmプロセスを用いた初の大規模製造プロジェクトだと説明している。また、HyperAccelがサービスを拡大するにつれ、初期生産契約が追加の発注につながる見通しだとしている。

ただし、追加受注は見込まれているものの保証されてはいない。発表にはBerthaのウェハー生産量、出荷台数、顧客受入率、契約額は示されていない。一般提供開始の時期も明らかにしていない。

この製造上の節目に先立ち、2024年10月には開発契約が発表されていた。その開発契約では、当初2026年第1四半期の生産開始を目標としていた。

したがって、9月の発表は当初目標より遅れて到着した。それでも、大型アクセラレータの生産には論理設計の完了以上の工程が必要なため、意義ある進展を示している。

SEMIFIVEによると、Berthaのダイ面積は500平方ミリメートルを超える。ダイとは、加工済みシリコンウェハーから切り出される個々のチップを指す。ダイが大きいほど潜在的な欠陥にさらされる面積が増え、通常は電力、冷却、パッケージング、歩留まりに関する要求も厳しくなる。

歩留まりは、製造されたダイのうち必要な動作基準を満たす割合を示す。欠陥ダイは販売可能な製品にならないまま貴重なウェハー面積を消費するため、コストに直接影響する。

SEMIFIVEは、フロントエンド設計、検証、パッケージング、テスト、量産供給を担当したとしている。このターンキーの役割により、同社はHyperAccelのプロセッサアーキテクチャとSamsungの製造施設の間に位置することになる。

この立場は商業面で重要だ。AIスタートアップの多くは専用プロセッサを設計できるが、設計データからテスト済みシステムへの高コストな移行を管理できる企業はそれより少ない。

SEMIFIVEはすでに他のカスタムチップも量産へ移行させている。同社は、Hanwha VisionのWisenet 9セキュリティプロセッサと、非公開の日本顧客向け高性能コンピューティングチップを例に挙げている。

Berthaは、その実績をデータセンター推論へと広げるものだ。また、先端製造ノード上の大型ダイに関わるリファレンスプロジェクトをSEMIFIVEにもたらす。

同社は2026年上半期に423億ウォンの新規量産受注を報告した。この数字はBertha単独ではなく、SEMIFIVEのより広範な事業を対象とする。

Berthaの寄与は、その後の受注に左右される。現時点の節目は製造パイプラインが機能することを示すが、継続的な需要はまだ立証していない。

これが、今回の発表が緊張感を生む理由であり、それを解消するものではない。HyperAccelは現在、生産に入るシリコンを手にしている一方、より困難な商業的実証はこれからだ。

BerthaがLLM推論の経済性を狙う理由

HyperAccelは汎用GPUの代替を目指しているのではなく、言語モデル提供に伴うメモリコストと利用効率の問題に挑んでいる。

推論とは、学習済みモデルを実行してプロンプトに応答したり、トークンを生成したりするプロセスだ。トレーニングとは異なり、AI製品がユーザーにサービスを提供する限り、推論は継続的なコストとなる。

言語モデルは出力を生成する際、重みをメモリから繰り返し移動させる。この挙動により、生の演算能力ではなくメモリ帯域幅が実質的なボトルネックになることがある。

汎用GPUには、多様なワークロード向けのリソースが含まれている。こうした能力はGPUに柔軟性を与える一方、メモリ帯域に制約されるトークン生成中には、一部の演算ユニットが十分に使われない場合がある。

HyperAccelは自社設計をLPU、すなわちレイテンシ処理ユニットと呼ぶ。このアーキテクチャは、GPUの幅広いワークロードをサポートするのではなく、transformer推論を中心にハードウェアとデータ移動を割り当てる。

同社が公開した設計は、モデル重みを実行ユニットへ継続的に移動させるため、効率化されたメモリアクセスを採用している。また、コア間でパラメータを再利用し、アイドル状態の演算能力を減らすことも目指している。

HyperAccelのアーキテクチャ論文では、複数プロセッサを協調させるための拡張可能な同期リンクが説明されている。この設計は通信と演算を重ね合わせ、プロセッサ同士の待機時間を短縮する。

この機能は、単一アクセラレータのメモリに1つのモデルが収まらない場合に重要となる。大規模な導入ではモデルを複数デバイスに分割するため、同期が重要な遅延要因になる。

同論文は、HyperAccelのコンパイラおよびランタイム環境であるHyperDexも紹介している。HyperDexは、使い慣れたモデルインターフェースと同社独自の命令セットを接続することを目的としている。

ハードウェアだけではアプリケーションを提供できない。運用者には、ドライバー、コンパイラ、モデルサポート、監視ツール、スケジューリング、既存のサービングフレームワークとの統合も必要だ。

HyperAccelによると、HyperDexはPyTorch、ONNX、vLLM、およびHugging Faceツールに似たインターフェースをサポートする。こうした互換性の主張は、GPU以外のインフラを検討する顧客にとって中心的な懸念に応えるものだ。

Bertha 500は、LPUアーキテクチャに8チャネルのLPDDR5XメモリとPCIe Gen5接続を組み合わせる。LPDDR5Xは、フラッグシップアクセラレータで一般的に使われるHBMよりも低コストかつ低消費電力だ。

このメモリ選択は、Berthaの中心的なトレードオフを示している。HyperAccelはHBMベースGPUより低いピーク帯域幅を受け入れる一方、利用可能な帯域幅のより高い割合を活用しようとしている。

公開されたBerthaの仕様には、毎秒546GBのメモリ帯域幅が記載されている。また、128GBのメモリ(256GBまで拡張可能)と、250ワットの熱設計電力も掲載されている。

HyperAccelは、FP16で毎秒384兆回、FP8で毎秒768兆回の演算性能を掲げる。低精度フォーマットは、モデルがその設定で許容できる精度を維持できる場合、メモリ使用量を減らし、スループットを高める。

同社によると、このアクセラレータは1から1,024までのバッチサイズをサポートする。バッチサイズは、システムがまとめて処理するリクエストまたはシーケンスの数を示す。

大規模なバッチは総スループットを高められるが、対話型アプリケーションでは応答レイテンシも重要だ。したがって、有用な本番比較では、ワークロード、モデル、精度、バッチサイズ、シーケンス長、レイテンシ目標を開示する必要がある。

HyperAccelは、比較においてBerthaが毎秒1,645トークンを生成し、Nvidia H100の804トークンを上回ると主張している。また、コスト効率は19倍、電力効率は12倍高いともしている。

これらの数値は同社ベンチマークだ。公開製品ページには、独立した比較として扱うのに十分なテスト手法が示されていない。

先行するアーキテクチャ論文は、より抑制的な結果を提示している。OPT 66Bモデルの実行時に、2基のH100を搭載したサーバーと比べて電力効率が1.33倍だったと報告している。

この違いは、いずれかの結果が誤っていることを必ずしも意味しない。論文はモデル化されたアーキテクチャと以前のサーバー構成を評価した一方、製品ページはBertha 500を説明している。

しかし、この差は正確な方法論が重要である理由を示す。購入者に必要なのは、異なる構成から導かれた単独の比率ではなく、出荷システムによる再現可能な結果だ。

最大の競合相手はNvidiaのソフトウェア優位性

Berthaが競合するのは単一のGPU仕様ではなく、Nvidiaを中心に構築された運用環境だ。

Nvidiaの地位は、プロセッサ性能だけに依存しているわけではない。開発者はすでにCUDAライブラリ、最適化カーネル、デプロイメントフレームワーク、管理ツール、確立されたクラウドサービスを利用している。

この導入基盤は運用リスクを下げる。インフラチームはGPUシステムの挙動を理解しており、ソフトウェアベンダーは日常的に自社製品をNvidiaハードウェアでテストしている。

専用アクセラレータはベンチマークで勝っても、購買判断では敗れる可能性がある。移行作業、モデル対応範囲、デバッグツール、信頼性、スタッフの習熟度は、すべて総運用コストに影響する。

HyperAccelの答えは、孤立ではなく互換性だ。同社は、HyperDexが広く使われるモデルフレームワークをサポートし、デプロイメント、最適化、プロファイリングのためのソフトウェア開発ツールを提供するとしている。

同社は、Llama、Qwen、Mistral、DeepSeek、Falcon、Gemmaを含むtransformerファミリーへの対応も掲げている。実際のサポートは、モデルバージョン、演算子、量子化手法、コンテキスト長によって異なる可能性がある。

顧客は、自らのワークロードを通じてそれらの詳細を検証する必要がある。検索拡張生成を運用する調達チームと、長文コンテキストの推論モデルを提供する事業者とでは、求めるものが異なる。

それでもBerthaの焦点は、明確な機会をもたらす。安定した推論ワークロードを持つクラウドプロバイダーは、最大限のアーキテクチャ柔軟性よりも、予測可能なスループットと消費電力を重視するかもしれない。

プライベート環境への導入も、もっともらしいユースケースとなる。企業は、汎用GPUプラットフォームのあらゆる機能を必要とせず、専用サーバー上で固定された一連の社内モデルを実行できる。

大規模な消費者向けサービスも別の機会を生む。システムが数十億トークンを生成する場合、消費電力やサーバー密度の小さな改善でも効果が積み重なる可能性がある。

一方で、特化は許容できる誤差の幅も狭める。モデルアーキテクチャの変化がHyperAccelのハードウェアとコンパイラの適応速度を上回れば、GPUの柔軟性はさらに価値を増す。

Nvidiaもソフトウェア、低精度、新世代アクセラレータを通じて推論を最適化できる。したがって、Berthaは動き続ける標的と競争している。

HyperAccelだけが専用推論を追求している企業ではない。Googleは自社サービスとクラウドプラットフォーム全体でTPUを使用している。AmazonはInferentiaチップを提供し、Groqは独自のプロセッサアーキテクチャを通じて決定論的なトークン生成を重視している。

こうした代替手段は、AIインフラが複数のプロセッサタイプをサポートし得るという考えを裏付ける。同時に、GPUを越える選択肢へ移行しようとする同じ顧客を巡る競争も激化させる。

Berthaの差別化は、効率的なメモリ利用、LPDDR5Xの容量、transformer特化の実行にある。この組み合わせは、ソフトウェアと移行にかかる費用を差し引いた後にも節約効果を生み出す必要がある。

最も強力な証拠は、同じモデルを一致したサービスレベル目標の下で運用する顧客から得られるだろう。そのようなテストには、レイテンシ、スループット、稼働率、エネルギー、エンジニアリング工数を含めるべきだ。

その証拠がない限り、Berthaは実証済みの経済的代替品ではなく、信頼できる技術的選択肢にとどまる。量産段階への移行により、顧客は実機ハードウェアを試験できるようになり、これはシミュレーションに比べて依然として大きな前進である。

短期的な圧力は、Nvidiaだけでなく、他の新興アクセラレータにも及ぶ。スタートアップ企業は今後、製造段階に入ったBertha製品と競合しなければならない。

HyperAccelが継続的な導入を確保できれば、LLM特化型プロセッサの基準点を確立できる可能性がある。導入が停滞すれば、GPU互換性が引き続き決定的な優位性となる。

Samsung 4nmは一つのリスクを解消する一方で、別の検証課題を生む

成熟した4nm製造プロセスは製造上の不確実性を低減するが、Berthaの大規模ダイでは歩留まりと熱特性が依然として商業面の中心的な課題となる。

Samsungは、4nm FinFETを、先端的な性能と生産安定性の間に位置する成熟したプラットフォームとして説明している。FinFETは、旧来のプレーナ設計と比べて電気的制御を改善する、立体的に形成されたトランジスタチャネルを採用している。

Samsungの4nmプロセス概要では、人工知能とハイパフォーマンスコンピューティングをターゲットワークロードとして明示している。また、電力供給、熱管理、大規模ダイの歩留まりも強調している。

この位置付けはBerthaに合致する。同チップの面積は500平方ミリメートルを超え、多数の処理、メモリ制御、接続機能を一枚のシリコン上に統合している。

大規模なモノリシックダイは高速な内部通信を実現できる。一方で、小型設計よりもウェハ1枚当たりのチップ数は少なく、各ダイはより多くの潜在的な製造欠陥にさらされる。

このため、歩留まりは経済的に重要になる。機能する設計であっても、多数のダイが認定に失敗したり、より低い動作周波数を必要としたりすれば、価格設定が難しくなり得る。

SEMIFIVEもHyperAccelも、Berthaの生産歩留まりを公表していない。パッケージング能力、想定月産量、初回受注の対象となるアクセラレータ数も公開していない。

こうした非開示は、非公開の製造契約では通常のことである。それでも、「量産」という表現から外部の観察者が導ける結論を限定する。

この発表は、時期に関する疑問も生じさせる。HyperAccelのCEOは以前、Bertha 500の量産と顧客供給の目標時期を2027年初頭として説明していた。

3月のインタビューでは、初期チップが立ち上げ検証に入り、その後PCIeカード統合と概念実証テストが続くとしていた。同インタビューは、Naver Cloudを当初の想定顧客として挙げている。

SEMIFIVEは現在、チップ生産が2026年第3四半期に始まったとしている。この二つのスケジュールは、異なる段階を指しているなら両立し得る。

SEMIFIVEは、HyperAccelがカードレベルの検証とより広範な製品製造を完了する前に、認定済みダイを生産している可能性がある。HyperAccelは、「量産」を顧客導入の準備が整ったシステム向けに使っている可能性がある。

両社はこれらの定義を明示的に整理していない。したがって読者は、ウェハおよびチップの生産と、アクセラレータの提供可能性を区別すべきである。

この区別が重要なのは、データセンター製品にはプロセッサ以外にも多くの要素が含まれるためだ。基板、電力供給、冷却、ファームウェア、ドライバー、サーバー認定、生産向けソフトウェアが必要になる。

HyperAccelの仕様書によれば、Berthaの定格電力は250ワットで、多くのフラッグシップ・データセンターGPUより低い。実際のシステム消費電力には、メモリ、ネットワーク、ホストプロセッサ、ファン、電力変換も含まれる。

熱特性は、ワークロードやサーバー密度によって変化し得る。複数カードにわたる継続的なトークン生成は、短時間のベンチマーク実行より優れた検証となる。

信頼性も別の障壁になる。クラウド事業者は、障害、更新、変動する需要に対応しながら、アクセラレータが継続的に動作することを期待している。

HyperAccelは、HyperDexがこの環境を管理できることを示す必要がある。本番インシデント時には、安定したドライバーと予測可能な復旧動作が、ピークスループットより重要になる場合がある。

供給継続性にも注意を払うべきだ。Samsungの4nm成熟度はプロセスリスクを低減するはずだが、HyperAccelは依然としてファウンドリ能力、パッケージング、試験、基板部品に依存している。

SEMIFIVEのターンキーモデルは、これらの段階にまたがる調整を簡素化できる。一方で、長年にわたる量産供給実績をまだ示していない若い供給関係に、責任を集中させることにもなる。

これらの疑問はいずれも、生産マイルストーンを無効にするものではない。それらは、この成果を持続可能な製品事業へ変えるために必要な作業を示している。

Berthaの性能主張がなお証明すべきこと

最大の不確実性はBerthaがLLMを実行できるかどうかではなく、その効率性に関する主張が、条件を揃えた独立した本番テストでも維持されるかどうかである。

HyperAccelのアーキテクチャ上の主張には技術的な一貫性がある。自己回帰型生成ではモデルの重みを繰り返し読み込むため、効率的なデータ移動が重要になる。

同社の研究では、一部の大規模モデル試験で90%を超える帯域幅利用率を報告している。対応するGPU測定値は、これらの構成でおよそ65%から71%だった。

この論文は、モデル化されたLPUサーバーでの消費電力低下も報告している。ただし、ASIC評価の多くは、最終的なBertha 500製品ではなく、合成、シミュレーション、FPGAベースのシステムコンポーネントを用いている。

この研究は設計の方向性を裏付ける。しかし、HyperAccelの現行製品ページにあるすべての主張を独立して検証するものではない。

購入者が製品比較を確信を持って解釈するには、いくつかの情報開示が必要になる。正確なモデル、入力長、出力長、数値フォーマット、バッチサイズ、レイテンシ目標はいずれも結果に影響する。

コスト効率の主張には追加の前提条件も必要だ。ハードウェア取得費、稼働率、サポート、ソフトウェアエンジニアリング、減価償却、電力、冷却、更新サイクルによって結論は変わり得る。

LPDDR5Xを使用するチップは、メモリコストを抑え、経済的に容量を拡張できる可能性がある。一方で、HBMより生の帯域幅は小さく、HyperAccelの利用率戦略により大きな負荷をかける。

この戦略は、メモリ帯域に制約されるトークン生成時に最も説得力を持つ。計算負荷の高いプロンプト処理、マルチモーダルモデル、投機的デコーディング、新しいアテンション機構は、バランスを変える可能性がある。

Berthaは推論の二大フェーズの両方を処理しなければならない。Prefillはユーザーのプロンプトを処理し、decodeは出力トークンを順次生成する。

システムはこれらのフェーズを異なる方法で最適化できる。一部の事業者は、これらを別々のハードウェアプールに分離しており、特化型アクセラレータにとって機会と互換性上の課題の双方を生み出している。

モデルの進化も別の変数を加える。Mixture-of-expertsモデルは選択されたパラメータ群を有効化し、マルチモーダルシステムはテキストと画像、音声、動画を組み合わせる。

HyperAccelは、自社ソフトウェアがトランスフォーマーおよびマルチモーダルモデルに対応するとしている。本番トライアルでは、その対応範囲がどこまで広がるかを示す必要がある。

精度も同様に重要だ。低精度のFP8、FP4、INT8、INT4処理はスループットを高められるが、事業者は量子化後のモデル品質を検証しなければならない。

比較では同等の精度目標を使うべきである。出力品質が大きく異なることで得られた高速な結果は、公平な優位性を示すものではない。

顧客は、分布の端に近い遅い応答を測るテールレイテンシも評価すべきである。平均スループットは、実際のユーザーに影響する遅延を隠し得る。

同時実行性も同様の問題を生む。Berthaは最大1,024件の同時リクエストへの対応を掲げるが、大規模なバッチ処理は個々のリクエストの待機時間を増やす可能性がある。

有用な動作点はサービスによって異なる。オフラインの文書処理パイプラインが許容できるレイテンシは、対話型コーディングアシスタントとは異なる。

ソフトウェアの成熟度はすべてのベンチマークに影響する。カーネル品質、メモリ割り当て、リクエストスケジューリング、キャッシュ、継続的バッチ処理が、ハードウェア能力のどこまでを利用可能にできるかを左右することが多い。

HyperAccelは、プロセッサと並行してHyperDexを構築するという正しい戦略的な一歩を踏み出している。残る問題は、外部開発者が広範なベンダー支援なしにこれを運用できるかどうかだ。

独立したテストでは、障害復旧、可観測性、アップグレードも対象にすべきである。これらの特性は製品仕様ページにはほとんど現れないが、実際のインフラコストに大きく影響する。

Berthaは、すべてのワークロードでH100を上回る必要はない。価値のある推論導入の一部で、信頼できる優位性を提供すればよい。

このより狭い目標は、原理的には達成可能である。証拠は、出荷済みカード、顧客ワークロード、再現可能な測定から得られなければならない。

生産が採用へつながるかを決める三つのシグナル

顧客認定、継続的な製造発注、透明性のあるベンチマークが、SEMIFIVEによるBertha量産が持続可能なプラットフォームを生んだかどうかを示す。

最初のシグナルは、特定された顧客によるシステム認定の成功である。HyperAccelは以前、Naver Cloudを当初の想定導入先として挙げ、概念実証テストについて説明していた。

確認された導入は、Samsung製造のシリコンを実際のクラウドワークロードと結び付けることになる。モデルの種類、サービス環境、Berthaが担う役割を明らかにすべきだ。

デモンストレーションよりも本番利用の方が重要である。それは、可用性、ソフトウェア統合、レイテンシ、エネルギー消費、運用サポートを時間をかけて検証することになる。

遅延した、または範囲が極めて限定されたトライアルは、製造発表の商業的解釈を弱める。カード統合またはソフトウェアが未完成であることを示唆するだろう。

二つ目のシグナルは、追加の発注書である。SEMIFIVEは、HyperAccelのサービス拡大に伴って追加注文を見込むと明言している。

再注文は、初期生産で実用的なデバイスが提供され、顧客がより大きな数量を必要としていることを示す。また、量産が継続的な収益を生み出せるというSEMIFIVEの主張も裏付ける。

その注文規模は重要になるが、非公開企業はそれを開示しない可能性がある。数量拡大の確認だけでも、新たな設計提携より多くの情報をもたらす。

追加注文がないことは、直ちに失敗を意味しない。特に新しいデータセンターハードウェアでは、認定サイクルに数カ月かかることがある。

しかし、顧客テスト後も沈黙が続けば、急速な採用への信頼は低下する。製造能力は、顧客がその出力を消費して初めて価値を生む。

三つ目のシグナルは、最終版Bertha 500カードを使った再現可能なベンチマークである。HyperAccelの現在の主張は、H100に対してスループット2倍、コスト効率19倍、電力効率12倍に及ぶ。

こうした比率には透明な条件が求められる。信頼できる結果は、モデル、精度、バッチサイズ、コンテキスト長、レイテンシ、システム電力、ソフトウェアバージョンを報告すべきである。

独立した参加があれば証拠は強まる。顧客、研究機関、または認知されたベンチマーク組織が、BerthaとGPUシステムで条件を揃えたテストを実施できる。

結果がマーケティング上の比率すべてを確認する必要はない。有用なワークロードでより小さくても再現可能な優位性が示されれば、実行可能な事業を支えることはできる。

より広い教訓は、一つの韓国製アクセラレータにとどまらない。AIインフラは、学習中心の市場から、より多様な推論環境へ移行している。

この変化は、モデル提供には異なるワークロード形状、レイテンシ目標、コスト制約が伴うため、特化型プロセッサの余地を生み出す。すべての導入で自動的に勝利する単一アーキテクチャは存在しない。

SEMIFIVEは現在、この実験の不可欠な部分を完了した。同社の設計・製造パイプラインは、Berthaを開発段階からSamsung 4nmでの初期生産へと移行させた。

HyperAccelは次の段階を完了しなければならない。LPUアーキテクチャが、提供可能で、管理しやすく、経済的に魅力的なデータセンター製品として機能することを示す必要がある。

開発者は、見出しを飾る計算能力だけでなく、モデル互換性とツール群にも注目すべきだ。インフラ導入を検討する企業は、広範な効率向上の主張を受け入れる前に、対象ワークロードに対応したテスト結果を求めるべきである。

Berthaを評価するチームは、まずサービスレベル目標を定める必要がある。そのうえで、同一条件下でスループット、レイテンシー、消費電力、精度、統合に要する工数、障害復旧時の挙動を比較できる。

信頼に値する次の更新は、また別の理論上の比率ではなく、導入実績の証拠を含むものになるだろう。それまでは、SEMIFIVE Berthaの量産は信頼できる製造上の節目ではあるものの、商業面での評価はなお結論が出ていない。

 
 

無料で始めましょう

ローカルファーストのパーソナル知識管理付きAIアシスタント

より良いAI体験のために、

remio は現在、 Windows 10+ (x64)M-Chip Mac のみをサポートしています。

仕事のAIパートナー
remioでもっと仕事が進む

計画・作成・仕上げまで
すべてをひとつに

bottom of page