引退したNvidia Tesla V100でゲーミングPCが高速なローカルAIリグに
2017年のNvidiaハードウェアが、意外な結果を出した。270億パラメータのローカル言語モデルで毎秒32トークンを実現したのだ。Nvidia Tomの記事では、ゲーミングPC内でRTX 4080の隣にTesla V100サーバーアクセラレータを搭載した事例を紹介している。
この実験では、合計32GBのビデオメモリを確保できた。量子化された27Bモデルと長いコンテキストウィンドウをGPU上に保持するには十分な容量だ。この結果は、ローカルAIハードウェアに関する中心的な前提に疑問を投げかける。最も有用なアクセラレータが、必ずしも最新製品とは限らない。
ただし、この構成は消費者向けの手軽な近道ではない。異なる2つのGPUアーキテクチャ、非公式アダプタ、Linuxの設定、独自の冷却作業、そして縮小しつつあるソフトウェアサポートを組み合わせている。元のファンは82デシベルにも達し、騒々しい屋外機器に匹敵する音量だった。
したがって、本当の比較対象は古いNvidiaハードウェアと特定の新型GPUではない。安価で豊富なメモリ容量と、現代的なコンシューマーハードウェアの互換性・利便性の対比である。
Tesla V100構成が実際に達成したこと
重要なのは、引退したデータセンター向けハードウェアを、実用的なローカル推論システムへと転用した点だ。
開発者のOscar Molnarは、16GBのVRAMを搭載したRTX 4080から始めた。この容量は多くのゲームや小規模な言語モデルには対応できるが、より大きなモデルを完全にGPU上に置けるかどうかには制約がある。
モデルの一部をシステムメモリへ移すことは可能だが、CPUオフロードは通常、生成速度を低下させる。長いコンテキストウィンドウも、過去のトークンから得られたアテンションデータを保存するキー・バリューキャッシュを通じてメモリを消費する。
Molnarは、さらに16GBのHBM2メモリを備えたTesla V100 SXM2を追加した。SXM2は、通常のデスクトップPCIeスロットに挿すのではなく、専用ボードに搭載するサーバー向けモジュール形式だ。
非公式のSXM2-to-PCIeアダプタが、物理的・電気的な橋渡しを担った。完成したマシンでは、RTX 4080とV100にまたがる合計32GBのVRAMを利用できた。ただし、このメモリが単一の統合プールになったわけではない。
Molnarの詳細なV100構築ログによると、llama.cppはモデルを2つのアクセラレータに分割した。ソフトウェアはワークロードの一部を各GPUに配置し、推論時にPCIe経由でデータを移動させた。
このマシンは、Q5_K_M量子化を用いたQwen3.6-27B-MTPを実行した。量子化は、モデルの重みを低精度表現に圧縮する手法であり、有用な出力品質を維持しながらメモリ需要の削減を図る。
生成されたモデルファイルは約19GBだった。Molnarは128,000トークンのコンテキストウィンドウを設定し、全99モデルレイヤーをオフロードしたうえで、ワークロードを2つのGPUに均等に分割した。
同氏は、生成速度がおよそ毎秒32トークンだったと報告している。プロンプト処理は、およそ毎秒133〜160トークンに達した。
これらの測定値は、独立した研究所のベンチマークではなく、1人の愛好家によるシステムから得られたものだ。性能はモデル、量子化、プロンプト、ソフトウェアのリビジョン、コンテキスト長、GPU分割手法に左右される。
こうした条件を踏まえても、毎秒32トークンは対話的な文章作成やコーディングに十分応答性の高い速度だ。多くのユーザーは、マシンが生成する速度よりはるかに遅くテキストを読む。
特に注目すべきなのは、どちらのGPUも相手と組み合わせて動作するよう設計されていなかったことだ。一方はNvidiaの2022年Ada Lovelaceアーキテクチャを採用し、もう一方は2017年のVoltaアーキテクチャを採用している。
これは、32GBのVRAMを搭載した単一カードを所有することとは同じではない。GPU間通信には遅延が生じ、各アクセラレータはシステムインターコネクト経由で情報を移動させなければ、ローカルに割り当てられたデータにしかアクセスできない。
それでも、この実験は多くのローカルAIユーザーにとって最も重要な閾値を越えた。高性能な27BモデルがGPUメモリの合計容量に完全に収まり、トークンごとに非実用的な待ち時間を挟まず応答した。
この点で、Nvidia Tomの事例は単なる珍しいハードウェアの話にとどまらない。データセンターがすでに引退させたアクセラレータから、ソフトウェアが有用な推論能力を引き出せることを示している。
古いNvidiaメモリがローカルLLMでなお重要な理由
ローカル言語モデルの推論では、最新のゲーミング機能よりも、メモリ容量と帯域幅が重視されることが多い。
すべての言語モデルは、テキスト生成中に重みをどこかに保存する必要がある。重みがVRAMに収まれば、GPUは低速なシステムメモリに大きく依存せず、繰り返し読み出せる。
270億パラメータのモデルを完全な16ビット精度で扱うには、どちらのカードが提供する容量よりもはるかに多くのメモリが必要になる。量子化では、各重みをより少ないビット数で保存することで、この要求量を削減する。
この処理にはトレードオフがある。より積極的な量子化はメモリを節約する一方、出力品質や互換性に影響する可能性がある。量子化を抑えた形式はより多くのモデル情報を保持できるが、追加のVRAMを必要とする。
V100が依然として重要である理由は、Nvidiaが第2世代の高帯域幅メモリであるHBM2を搭載したことにある。Nvidia公式のV100仕様では、メモリ帯域幅は毎秒900GBとされている。
引退したアクセラレータとしては、この数値は依然として大きい。トークン生成では、生成する各トークンごとにモデルの重みをメモリ経由で移動させることが多く、帯域幅は単一ユーザー向け推論における重要な制約となる。
V100には、5,120個のCUDAコアと640個の第1世代Tensor Coreも搭載されている。Tensor Coreはニューラルネットワークで使われる一般的な行列演算を高速化するが、Voltaが対応する現代的な数値形式は新しいアーキテクチャより少ない。
本来の用途は、その強みと問題点の両方を説明する。Nvidiaはこのアクセラレータを、ゲーミングデスクトップ向けではなく、AIトレーニング、科学計算、高密度サーバー配置のために開発した。
SXM2モデルは最大300ワットの電力枠に対応し、強力なシャーシエアフローを前提として設計されている。ディスプレイ出力、一般的なデスクトップ向けクーラー、標準PCIeエッジコネクタは備えていない。
しかし、こうした消費者向け機能の欠如こそが、廃止されたユニットが実験者を引き付ける理由でもある。ホストプロセッサや別のGPUがデスクトップを処理するなら、ローカル推論サーバーにディスプレイ出力は不要だ。
周辺プラットフォームが時代遅れになっても、メモリは有用であり続ける。データセンターがアクセラレータを交換するのは、効率、密度、サポート、運用の一貫性のためであり、古いチップのすべてが突然計算できなくなるからではない。
ローカルユーザーは同じハードウェアを異なる視点で評価する。マシンが望むモデルをプライベートに実行できるなら、愛好家は手作業によるセットアップ、低い密度、古いソフトウェア環境を受け入れられる。
これにより、企業における陳腐化が技術的な無用さとイコールではない二次市場が生まれる。サーバー所有者には保守上の負債に見えるものが、実験者にはメモリ帯域幅とCUDA互換性に見える。
この乖離は、コンシューマーGPUの位置付けに圧力をかける。新しいゲーミングカードの多くは優れたグラフィックス性能を提供する一方で、ローカルAIユーザーがより大きなモデルに求めるほどのメモリを搭載していない。
最新カードにも複数の利点がある。現行ドライバ、より優れた効率、新しい精度形式、ビデオエンジン、ディスプレイ出力、静かな冷却、サポートされた物理設計を提供する。
しかし、こうした機能ではカードの利用可能なメモリ容量を超えるモデルを読み込めない。一部のローカル推論ワークロードでは、容量は性能上の好みではなく、越えられない条件となる。
V100の実験は、この不一致を浮き彫りにする。AIに関心を持つコンシューマー購入者は、ゲーマーとは異なる方法でVRAMを評価するかもしれないが、両者はしばしば同じ製品群から選ぶことになる。
Appleのユニファイドメモリシステムや新しいワークステーション向けアクセラレータは、より大きなメモリプールへの代替経路を提供する。AMDカードも競争力のある容量を提供できるが、ソフトウェア互換性はモデルや推論エンジンによって異なる。
中古のV100が、あらゆる尺度でこれらの選択肢を上回るわけではない。ローカルAIによって、主流のデスクトップ製品が一貫して満たしていない構成に市場が生まれていることを示しているにすぎない。
Nvidia Tomの結果はシリコンと同じくらいソフトウェアに依存する
このハードウェアが機能するのは、llama.cppが従来型のサーバープラットフォームを必要とせず、不一致なGPU間に量子化モデルを分散できるためだ。
llama.cppは、CPUおよび複数のGPUバックエンドで言語モデルを効率的に実行するために設計されたオープンソース推論エンジンである。ポータブルなローカル推論向けに作られたモデルファイル形式GGUFをサポートする。
プロジェクトのマルチGPUドキュメントでは、レイヤー分割とテンソル分割を区別している。これらの手法では、異なる方法で複数デバイスに処理を配置する。
レイヤー分割では、連続したモデルレイヤーを個々のGPUに割り当てる。各トークンはこれらのレイヤーを順に通過するため、より細粒度なテンソル並列処理と比べ、デバイス間通信量を抑えられる。
テンソル分割では、レイヤー内の演算を分割する。インターコネクトが高速であれば生成レイテンシを改善できるが、参加するGPU間でより多くの通信が必要になる。
Molnarは、モデルを均等に分散するためテンソル分割設定を使った。2枚のカードは、V100本来のサーバークラスNVLink構成ではなく、デスクトッププラットフォームを通じて通信した。
この違いは重要だ。VRAMの合計容量が自動的に役立つわけではない。ソフトウェアは、どちらのデバイスの容量も超えずに、モデルの重み、キャッシュ、中間値をどう配置するかを理解する必要がある。
GPUの性能特性も異なる。RTX 4080は大幅に新しい一方、V100は旧世代の演算ユニットと高帯域幅メモリを提供する。
不均衡な組み合わせでは、高速なカードが低速なカードを待つことがある。そのため、選択する分割比は、モデルアーキテクチャ、メモリ使用量、実測スループットに基づく調整が必要になる場合がある。
Molnarの構成では、量子化モデル全体をGPUメモリに保持した。これにより、複数のレイヤーをCPUに送ることで生じる大きな速度低下を避けた。
同氏はまた、モデルのマルチトークン予測アーキテクチャをサポートするソフトウェアリビジョンを使用した。マルチトークン予測では、モデルが複数の将来トークンを提案し、その後にどの提案が妥当かを検証できる。
この手法は、特に構造化された出力や予測しやすい出力で、予測が成功した場合にスループットを改善できる。ただし、サポートはモデルと推論エンジンに依存し、実際の向上幅はプロンプトによって異なる。
この詳細は、すべてのV100が報告された速度ですべての27Bモデルを実行できる、という単純な結論を防ぐ。異なる量子化、コンテキストサイズ、バックエンド、モデルアーキテクチャでは、まったく異なる結果が出る可能性がある。
同じモデルを読み込んでも、同一の性能が保証されるわけではない。長いプロンプトはキー・バリューキャッシュの使用量を増やし、同時リクエストはメモリ負荷とスケジューリング動作を変化させる。
Nvidia Tomの実験では、NixOSと独自にビルドしたllama.cppも使われた。NixOSはシステム構成を宣言的に定義するため、運用者はバージョン管理されたファイルからパッケージやサービスを再現しやすい。
これは、変更後に特殊な構成を復元しやすくする可能性がある。しかし、そのハードウェア組み合わせが公式サポートされることを意味するものではない。
元の構築では、Windowsでより大きな困難が報告されている。V100はウォームリブート後に認識されなくなることもあり、再検出するにはマシンを完全にシャットダウンする必要があった。
こうした不便は、そのシステムを構築した実験者には受け入れられるだろう。しかし、毎朝確実に起動することが求められるワークステーションでは、深刻な信頼性問題となる。
それでもこの構成は、ローカルAIにおけるより大きな変化を示している。オープンなモデル形式と適応性の高い推論エンジンは、本来の導入目的を超えてハードウェアの実用寿命を延ばせる。
最も重要な要素は、もはやアクセラレータ単体ではない。実用的なシステムには、モデル形式、量子化、ランタイム、ドライバー、オペレーティングシステム、冷却、インターコネクトが含まれる。
中古のエンタープライズ向けハードウェアを検討する購入者は、このスタック全体を評価しなければならない。VRAM容量は入口を開くが、モデルがそこを通れるかどうかを決めるのはソフトウェアだ。
芝刈り機のような騒音が、本当のトレードオフを明らかにする
引退したサーバーGPUは、洗練された所有体験と引き換えに容量を提供する。そして、その取引を無視できなくするのが冷却システムだ。
このアダプターに元から搭載されていたファンは、Apple Watchで82デシベルを記録した。この測定は校正済みの音響テストではないが、問題の本質を明確に捉えている。
サーバーハードウェアは、熱の排出が騒音より重要な管理環境を前提としている。コンパクトなラックでは高速ファンを使える。誰も一日中その隣に座ることを想定していないからだ。
ゲーミングPCでは、同じ気流が耳障りな騒音になる。このアダプターのファンは、元のコネクターが通常のデスクトップ向けファン制御に対応していなかったため、常時フルスピードで動作していたと報告されている。
Molnarは配線を調査し、カスタムケーブルを介してファンをマザーボードのヘッダーに接続した。その後、パルス幅変調により、マザーボード側で回転数を下げられるようにした。
報告によれば、ファン設定を10パーセントにしても、テスト負荷下でV100は摂氏50度未満を維持した。Molnarは、音が聞き取りにくくなったと述べている。
この解決策は巧妙だが、読者はこれを普遍的な熱設計上の保証と受け取るべきではない。ケース内のエアフロー、室温、ファン形状、GPU負荷、センサーの配置はいずれも冷却に影響する。
誤配線されたファンはヘッダーを損傷させたり、予期せず停止したりする恐れがある。温度を監視せずにエアフローを減らせば、アクセラレータ、アダプター、メモリー、電源供給部品が過熱する可能性がある。
電力要件も別のリスクを生む。SXM2モジュールは、Nvidiaがコンシューマー向け導入を想定して設計していないハードウェアを通じて、大きな電力を供給しなければならない非公式アダプターに依存している。
このカードには、通常のデスクトップ製品に期待される安全性や利便性の前提がない。購入者は電源接続、アダプターの品質、物理的なクリアランス、ファームウェアの挙動、電源ユニットの容量を確認する必要がある。
次に問題となるのが消費電力だ。中古アクセラレータは導入時には魅力的に見えても、毎日の長時間運用後には魅力が薄れる可能性がある。
Molnarは、自身のワークロードにおいてV100の消費電力が最大で約150ワットだったと観測した。NvidiaはSXM2設計の最大消費電力を300ワットとしており、ワークロードと構成によって大きな差が生じる。
最新GPUなら、一部のタスクをより少ない電力と発熱で完了できる場合がある。また、より速く完了することで、ピーク電力が似ていても総消費エネルギーを抑えられる可能性がある。
したがって、比較は稼働率に左右される。プライベートなコーディングセッションで時折使うマシンと、継続的にリクエストへ応答するサーバーでは、コスト構造が異なる。
サポートの持続性は、さらに切実な懸念となる。Voltaのコンピュートケイパビリティは7.0であり、新しいAIカーネルはますますAmpere以降のアーキテクチャを対象にしている。
NvidiaのCUDA 13 notesによると、Volta向けのオフラインコンパイルとライブラリーサポートはCUDA 13ツールキットから削除された。これらのアーキテクチャを対象とするビルドパスとしては、CUDA 12.xが引き続きサポートされている。
これは既存のV100システムを無効化するものではない。新しいライブラリーが徐々に先へ進む中で、運用者が互換性のあるツールチェーンを維持しなければならないことを意味する。
将来の推論エンジンのリリースでは、Voltaでは利用できない新しいCUDAライブラリーやカーネルが必要になるかもしれない。ユーザーは古いバージョンに固定できるが、その分メンテナンスとセキュリティ対応の負担が増える。
最新モデルは、FP16より広い数値範囲を持つ16ビット浮動小数点形式であるBF16を前提にする場合もある。VoltaのTensor CoresはネイティブなBF16アクセラレーションを提供しない。
一部のランタイムは、未対応の演算を変換したり、低速なパスを使用したり、互換性のない構成を拒否したりする。正確な挙動はモデルとフレームワークに依存する。
新しいアテンションカーネルも同様の隔たりを生む。Ampere、Hopper、Blackwell向けに最適化されたソフトウェアは、実用的なVolta実装を提供しない可能性がある。
こうした制約により、V100は固定プラットフォームへの投資となる。所有者は、現在固定したスタックが動作し続けていても、互換性は縮小していくと見込むべきだ。
この実験で示された毎秒32トークンという結果は、その正確なマシン上で独立に再現されてはいない。保証された製品仕様ではなく、記録された個人ベンチマークとして理解すべきだ。
また、この構成はRTX 4080とV100を組み合わせている。古いアクセラレータ単体が32GBのVRAMや、報告された完全な結果を生み出したわけではない。
この区別は重要だ。見出しだけを見ると、V100が最新の大容量メモリーカードを完全に置き換えられるように見える場合がある。より正確には、慎重に構成されたシステム内の拡張デバイスと理解すべきだ。
適切な運用者にとって、この取引は依然として魅力的だ。一方、静音運用、公式サポート、予測可能なアップデート、最小限のトラブルシューティングを必要とする人にとっては、価値の低い選択となる。
旧世代データセンターGPUがコンシューマーAI市場に圧力をかけている
この実験は、デスクトップGPUベンダーが依然として十分には満たせていない需要、すなわちローカルモデル推論向けの手頃なメモリー容量を浮き彫りにしている。
ゲーミングベンチマークでは通常、フレームレート、レイトレーシング、アップスケーリング、電力効率が優先される。ローカルAIは異なる購入優先順位をもたらす。
モデルは利用可能なメモリーに収まるか、収まらないかのどちらかだ。選択したモデルとコンテキストがVRAM容量を超える場合、より高速な演算性能では補えない。
ユーザーは、より強い量子化、より短いコンテキストウィンドウ、より小さなモデル、またはCPUオフロードを選択できる。それぞれの選択は品質、機能、応答性を変化させる。
そのため、旧世代のエンタープライズカード、マルチGPU構成、統合メモリーを持つコンピューターへの需要が生まれる。いずれも、豊富なVRAMを備えた現行コンシューマーGPUほどの完全な利便性は提供しない。
Nvidiaは、AIフレームワーク全体でCUDAが広くサポートされているため、依然として中心的な存在だ。V100は公式ツールチェーンの進化が止まりつつある中でも、このエコシステムの恩恵を受けている。
AMDは大容量メモリー構成のカードを提供しているが、ユーザーは好みのモデルやランタイムがROCmやその他のバックエンドを通じて十分に動作するか確認する必要がある。互換性は改善しているものの、アプリケーション間で同一ではない。
Appleの統合メモリーでは、CPUとGPUが一つの大きなメモリープールにアクセスできる。これによりより大きなモデルを扱える場合があるが、帯域幅、持続的なスループット、ソフトウェアサポート、アップグレードできないメモリーは依然として重要な考慮事項だ。
新しいNvidiaのワークステーション向けおよびデータセンター向け製品は、現行機能とともに大容量を提供する。それらは、ホームユーザーの愛好家とは異なる予算と運用要件を持つ購入者を対象としている。
Tesla P40も、中古サーバー向けの選択肢の一つだ。24GBのメモリーを備えるが、より古いPascal世代に属し、Tensor Coresを搭載していない。
P40は16GBを超えるモデルを読み込めるが、低いメモリー帯域幅と旧世代の演算パスにより、生成性能が低下する可能性がある。容量だけでは結果を決められない。
中古のV100カードは、独特の中間的な位置を占める。HBM2帯域幅、第1世代Tensor Cores、成熟したCUDA 12サポートを組み合わせる一方、明確な陳腐化リスクも抱えている。
したがってNvidia Tomの報告は、特定の競合他社ではなく製品セグメンテーションに圧力をかけるものだ。一部のユーザーが、低いVRAM上限から逃れるために大きな不便を受け入れることを示している。
このシグナルはGPUメーカーにとって重要であるべきだ。AIワークロードは、メモリーをプロ向け購入者だけのニッチな関心事ではなく、消費者にも見える仕様へと変えつつある。
これはモデル開発者にとっても重要だ。効率的な量子化とローカルランタイムは、モデルを実行できる導入済みハードウェアの基盤を広げる。
最新の精度形式を必要とするモデルは、本来なら十分な性能を持つアクセラレータを除外してしまう。移植性のあるGGUFリリースなら、旧世代のNvidia、AMD、Apple、またはCPUのみのシステムを使うユーザーにも届く。
これは、開発者が旧式チップに合わせてソフトウェアを固定すべきという意味ではない。互換性の選択が、誰がモデルをプライベートに実行でき、誰がホスト型サービスを使わなければならないかを左右するということだ。
ローカル運用には複数の利点がある。プロンプトをユーザーのマシン内に保持でき、生成はネットワークの可用性に依存せず、運用者がモデル更新を管理できる。
その一方で、運用者はあらゆるインフラ責任を引き継ぐ。ドライバー、モデルファイル、認証、リモートアクセス、冷却、監視、バックアップがこれに含まれる。
クラウドサービスは逆の取引を行う。ハードウェア保守の大半を取り除く一方で、ユーザーには可用性、ポリシー、データ処理について外部サービスを信頼することを求める。
V100構成はこの議論に決着をつけるものではない。利便性より制御を重視する、技術に自信のあるユーザーにとって、ローカル側の選択肢をより現実的にしている。
ローカルAIビルダーが次に注視すべきこと
V100の再評価が持続的なニッチになるのか、それとも新しいハードウェアへの短い中継地点にとどまるのかは、三つのシグナルが決める。
一つ目のシグナルは、Voltaにおけるllama.cppのサポートだ。このプロジェクトは、新しいモデルアーキテクチャ、量子化形式、GPUカーネルの登場に合わせて急速に変化している。
V100の所有者は、重要なモデルが機能するCUDA 12のビルドパスを維持するか注視すべきだ。互換性が継続すれば、これらのシステムを維持する根拠は強まる。
より新しいコンピュートケイパビリティを必要とするカーネルへの移行は、その根拠を弱める。バージョンの固定はその結果を遅らせられるが、新しいモデルのサポートを無期限に提供することはできない。
二つ目のシグナルは、異なる27Bモデル間で再現可能な性能だ。Molnarの結果は、特定のモデル、量子化、コンテキスト構成、混在GPU構成を用いている。
独立したテストでは、生成速度、プロンプト処理、コンテキスト長、消費電力、温度、正確なソフトウェアバージョンを報告すべきだ。毎秒トークン数という単一の数値だけでは、あまりに多くの変数が隠れてしまう。
密なモデルの結果も、Mixture-of-Expertsモデルと安易に比較すべきではない。Mixture-of-Experts設計では、各トークンに対して総パラメーターの一部しか有効化されない。
複数のテスターが安価なV100構成で応答性の高い27B推論を再現できれば、中心的な主張はより強くなる。大きなばらつきが見られれば、元の結果が専門的な構成に大きく依存していることを示す。
三つ目のシグナルは、今後登場するコンシューマーGPUとワークステーションにおけるメモリー容量だ。より手頃な位置付けの大容量メモリー製品が増えれば、即席のサーバー転用への需要は減少する。
コンシューマーカードが強力な演算性能と制限的なVRAMを組み合わせ続けるなら、二次市場のアクセラレータは魅力を保つ。ユーザーはモデル容量のために、効率とサポートを引き換えにし続けるだろう。
ソフトウェアベンダーも対応する可能性がある。より優れた異種マルチGPUスケジューリングは、性能の異なるアクセラレータを組み合わせやすくする一方、より厳しいカーネル要件はその道を閉ざす可能性がある。
構築を検討する人は、まずGPUを探すのではなく、使用したいモデルから始めるべきだ。モデルサイズ、量子化の選択肢、コンテキスト要件、ランタイムサポート、想定される同時実行数を確認しよう。
また、実験と信頼性が必要な本番利用を区別すべきだ。ときどきコールドリブートが必要になるリグは、自宅では楽しいかもしれないが、ビジネスワークフローでは受け入れられない。
すべてのドライバー、アダプター、ファン設定、ファームウェアの選択、モデル改訂を記録することが不可欠だ。検索可能なengineering knowledge baseは、トラブルシューティングで得た知見を再現可能な仕組みに変えられる。
Nvidia Tomのハードウェアに関する記事は、結局のところ普遍的な推奨でも、無意味なスタントでもない。ソフトウェア、冷却、そして運用者の忍耐がかみ合えば、引退したシリコンでも有用なローカル推論を提供できることを示している。
より大規模なモデルをローカルで動かすために、古いCUDAスタック、独自の配線、そして手動での復旧作業を受け入れられるでしょうか。どのベンチマークよりも、その答えこそがTesla V100を次のAIマシンに採用すべきかどうかを決めます。



