Nvidia DGX Spark vs AMD Strix Halo:128GBローカルAI対決

2025年後半までに、大規模パラメータモデルをローカルで実行するための参入障壁は変化しました。もはやゲーミングカードのVRAM容量だけを見ているのではありません。データセンター級の仕様をデスク上にもたらすユニファイドメモリアーキテクチャに注目しています。市場はついに、産業用クラスターの5桁価格なしで128GBの高速メモリを実現する、2つの異なる選択肢を私たちに提供しました:the Nvidia DGX Spark と AMD Strix Halo。
両者の選択はブランドへの忠誠心の問題ではありません。根本的に異なる2つの思想を理解することが重要です。一方はGrace Blackwellアーキテクチャを1リットルのボックスに収めるために設計された専用アプライアンスです。もう一方は、ハイエンドデスクトップとAIワークステーションの境界を曖昧にする、力任せのAPUです。
この分析では、初期導入者が直面している直近の摩擦点から始めて、両者の実世界での有用性を分解します。
重要なユーザー体験:Nvidia DGX SparkとAMD Strix Haloの癖を解消する

生のスループットを見る前に、これらのマシンと実際に暮らすとはどういうことかを知る必要があります。どちらのデバイスにも、対処法を知らなければ体験を台無しにしかねない独特の挙動があります。
Nvidia DGX Sparkの遅いロード時間を解決する(mmap修正)
もし Nvidia DGX Spark を箱から出し、環境をインストールし、llama.cpp経由でgpt-oss-120bのようなモデルをロードしようとすると、ユニットが故障していると思うかもしれません。初回ロード時間は1分半以上(約100秒)に及ぶことがあります。GB10 Grace Blackwellスーパーチップを搭載するデバイスとしては、これは鈍く感じられます。
コミュニティは原因を特定しました:メモリマッピング(mmap)です。多くの推論エンジンのデフォルト動作は、Sparkがユニファイドメモリプールを処理する方法と衝突します。
解決策: llama.cppの起動引数でmmapを無効にする必要があります。
このフラグをオフにすることで、ユーザーはロード時間が100秒から約22秒へ短縮されたと報告しています。この簡単な調整により、Sparkは競合製品と同等、あるいはそれ以上の速度になります。さらに、mmapを無効にすると、プロンプト処理速度とトークン生成の安定性も改善されるようです。このボックスを所有しているなら、これは任意ではありません。必須の設定手順です。
AMD Strix Haloの最適化とハードウェア上の制約
このAMD Strix Halo(特にRyzen AI Max+ 395のバリアント)は、Windowsや標準的なLinuxディストリビューションに慣れた人にとって、よりスムーズなソフトウェア導入体験を提供しますが、独自の物理的・ソフトウェア上の注意点もあります。
ソフトウェア面では、ROCmは成熟してきたものの、推論用の標準バックエンドでは性能を十分に引き出せないことがあります。llama.cppで純粋な推論タスクを行う場合、Vulkanバックエンドに切り替えると、Strix Haloアーキテクチャではデフォルト構成を上回る測定可能な性能向上が示されています。
ハードウェアのメンテナンスは、AMD Strix Haloがグリーンチームのライバルと比べて優れている点です。HP Z2 Mini G1aのようなユニットは、工具不要のアクセス機構を備えています。ケースをスライドして開け、標準的な2280 NVMeドライブを数秒で交換できます。
これを Nvidia DGX Spark と比較してください。 Sparkのインダストリアルデザインは、いら立つほどミニマルです。電源LEDはもちろん、ネットワークポート用のアクティビティライトすらありません。電源が入っているか確認するためだけに、デバイスへpingを打たなければならないことがよくあります。さらに悪いことに、内部ストレージスロットはM.2 2242フォームファクタを採用しています。これは一般的な2280より短く、希少な規格です。2242サイズで高性能な4TBまたは8TB SSDを見つけるのは難しく、高価です。Sparkに大規模データセットを保存する予定なら、外部ネットワークストレージに頼るか、希少なドライブを探し回る覚悟が必要です。
性能を深掘り:Nvidia DGX Sparkの能力

このNvidia DGX Sparkは本質的に「箱の中のAIラボ」です。価格は約$3,999と高めですが、そのコストには他では得られない特定の能力が含まれています。
Nvidia DGX Sparkの画像生成とINT4のパワー
どちらのマシンも大規模言語モデル(LLM)を十分に処理できますが、the Nvidia DGX Sparkは画像生成において競合を圧倒します。FLUX.1 Dev(BF16)を実行するテストでは、Sparkは約120 TFLOPSを実現します。
視点を置くと、Sparkは画像をおよそ2.5倍の速さで生成します。AMD Strix Haloは類似のワークロードで約46 TFLOPSにとどまります。ワークフローにディフュージョンモデルの多用が含まれるなら、Sparkはその価格プレミアムを即座に正当化します。
このアーキテクチャはネイティブNVFP4(4ビット浮動小数点)もサポートします。SparkのINT4における理論スループットは112 TOPSと巨大で、Haloをほぼ9倍上回ります。しかし、これは現時点では「現実」ではなく「可能性」です。エンタープライズ級Nvidiaツール以外のソフトウェアエコシステムは、消費者が利用できるローダーでこの精度を効果的に活用する段階にまだ完全には追いついていません。Sparkを購入するのはCUDA 13で今日できることのためですが、将来のソフトウェアがそのINT4の余力を解放することにも賭けることになります。
もう1つの際立った機能はネットワーキングです。SparkにはConnectX-7 200GbEカードが含まれます。単独ユーザーには過剰です。しかし、400Bパラメータモデルを実行するために3台または4台のユニットをクラスター化したい小規模ラボにとって、このインターコネクトは非常に価値があります。
万能王:AMD Strix Halo分析
このAMD Strix Haloは大幅に安価で、価格は$2,300から$2,500の間です。サーバーノードになろうとはせず、究極のワークステーションになろうとしています。
AMD Strix HaloのCPU性能と日常的な使いやすさ
このAMD Strix Haloは16個のZen 5 CPUコアを活用します。一般的なコンピューティングタスク、コンパイル、データ前処理では、Sparkに搭載されるARMコアを大幅に上回ります。
Linpackのような高性能コンピューティングベンチマークでは、Strix Haloは倍精度性能で1.6 TFLOPSを実現し、Sparkの708 GFLOPSの2倍以上です。AIワークフローにCPU側での重い前処理が含まれる場合、またはマシンを強力なLinux開発デスクトップとしても使いたい場合、Strix Haloは理にかなった選択です。
LLMのトークン生成に関しては、戦いは驚くほど接戦です。LLM推論は純粋な計算能力よりもメモリ帯域幅に制約されることが多いため、Haloの128GB LPDDR5X-8000(約256 GB/s)はSpark(約273 GB/s)に追随します。多くのテキスト生成シナリオでは、差は無視できるほどです。
Strix Haloはシームレスな移行パスを提供します。データセンターで使われるものと同じROCmおよびHIPスタックを使用するため、ここで開発されたコードは容易にスケールアップできますが、マシン自体は標準的な高出力PCのように感じられます。
RTX 5090がこの議論に当てはまらない理由

必然的に、次の疑問が生じます:「RTX 5090を買えばいいのでは?」
標準のRTX 5090は生の計算能力における怪物であり、両方の Nvidia DGX Spark と AMD Strix Haloは、ドルあたりのFLOPSという点で優れています。 しかし、32GBのVRAMという高い壁にぶつかります。
ローカルLLMの世界では、メモリは酸素です。32GBのビデオメモリでは、70Bパラメータのモデルを高精度で、あるいは120Bモデルを妥当な量子化で読み込むことは到底できません。5090は小規模モデルではより高速ですが、大規模モデルでは完全に機能しません。
「128GB RTX 5090」カードの噂やプロトタイプがエンジニアリングラボで出回っており、中には$13,000を大幅に上回る法外な価格のものもあります。これらは消費者向け製品ではありません。現在128GBのメモリを必要とするユーザーにとって、GPUルートでは複数のカードと複雑なPCIeレーン管理が必要になります。SparkとHaloは、その容量を単一の一貫したメモリブロックで提供します。
最終評価:あなたの128GBワークステーションを選ぶ

次の場合は、Nvidia DGX Sparkを選んでください。
NVFP4の研究またはエンタープライズCUDA検証のために専用アプライアンスが必要。
ワークフローで画像生成(Flux、Stable Diffusion)の比重が大きい。
200GbE接続を使用して複数のユニットをクラスタリングする予定がある。
「ヘッドレスサーバー」体験とLinux管理に抵抗がない。
次の場合はAMD Strix Haloを選んでください。
ドルあたりで最高の価値を求める(Sparkのほぼ半額)。
テキスト生成だけでなくコードのコンパイルもこなす、汎用性の高い日常使いのマシンが必要。
容易なハードウェアアップグレード(標準SSD)を優先する。
主な焦点がLLMのテキスト推論であり、その点ではSparkと同等の実用性を持つ。
どちらのマシンも、2025年が128GBのローカルAIが身近になった年であることを証明しています。緑のチームの洗練されたアプライアンスを選ぶにせよ、赤のチームの強力なAPUを選ぶにせよ、メモリ不足に悩まされる時代は終わりました。
よくある質問
Q: Nvidia DGX Sparkでゲームをプレイできますか?
A: いいえ、Sparkは厳密にはAIアプライアンスです。 DisplayPort(HDMIのみ)のようなディスプレイ出力がなく、ARMベースのアーキテクチャとデータセンターGPUドライバーの組み合わせにより、標準的なPCゲームには適していません。
Q: Nvidia DGX SparkのSSDはアップグレード可能ですか?
A: はい、ただし困難です。底面からユニットを分解し、M.2 2242フォームファクターのSSDを見つける必要があります。これは、ほとんどのPCで使用される標準的な2280ドライブよりも珍しく、しばしば高価です。
Q: AMD Strix HaloはWindowsをサポートしていますか?
A: はい、Strix Haloはx86ベースで、Windows 11をネイティブにサポートしています。 ただし、最大のAIパフォーマンスと完全なROCmスタックへのアクセスのためには、一般的にLinux環境が推奨されます。
Q: 負荷時のNvidia DGX Sparkはどの程度うるさいですか?
A: ファンノイズは聞こえ、コンパクトな1リットルサイズのため金属製シャーシはかなり熱くなることがあります。 一部の高RPMミニPCよりは静かですが、無音ではなく、騒音に敏感な場合はすぐ近くの作業スペースから離して設置するのが最適です。
Q: これらのデバイスでLLMにおける主なボトルネックは何ですか?
A: メモリ帯域幅が主なボトルネックです。128GBの容量があるにもかかわらず、メモリから計算コアへデータが移動する速度(帯域幅)が1秒あたりのトークン数を制限するため、Sparkの計算上の優位性にもかかわらず、SparkとHaloはテキスト生成で同様の性能を示します。



