アリエクスプレスで2.2万円のNVIDIA Tesla V100を買って分かった、データセンター用GPUと普通のグラボの違い

YouTubeで開く ↗
概要

アリエクスプレスでNVIDIAのデータセンター向けGPU「Tesla V100」を見つけた話者は、それを実際に購入した。一般的なグラフィックボードと比べると、形状、電源回路、部品、メモリの接続方法がどう違うのかを実物を見ながら確認している。最初は鑑賞用のサンプルのつもりで買ったが、調べるうちに別の使い道も見えてきたという。

7分で読めます

2017年世代のGPUを2.2万円で入手

購入したのはTesla V100である。話者の説明では、2017年頃のVoltaアーキテクチャの製品で、「9年前なので結構古い」世代にあたる。

入手のきっかけは、アリエクスプレスを見ていてたまたま出てきたことだった。価格は2.2万円である。話者自身は、この価格が相場と比べて高いのか安いのかは分からないと述べている。それでも、普通のグラボを持っている人はいても、データセンター用GPUを持っている人はいないだろうと考えて購入を決めた。

Tesla V100 SXM2 16GBという製品

手元に届いたのは「Tesla V100 SXM2 16GB」、つまりメモリ16GBのモデルである。同じV100には32GBモデルもある。ただし32GBモデルは価格が10万円を超えており、手が出しにくいため今回は16GBモデルを選んだという。

多くの人がGPUと聞いて思い浮かべるのは、自作パソコンのマザーボードに挿すグラフィックボードの形だろう。V100はデータセンター向けで、SXM2というフォームファクターを採用している。PCIeのソケットはない。代わりに裏面にはピンがたくさん並んだコネクタがあり、外部との信号のやり取りと電源の供給はすべてここで行う。

グラボに付いているような補助電源ピンはない。HDMIやDisplayPortといった映像出力もない。話者はこれを、本当に計算を行うためだけに作られたものだと説明している。

SXM、HGX、DGXの関係

話者はデータセンター向けGPUの構成単位も整理している。SXMはGPUの最小単位となるモジュールである。このSXMを8基載せたベースボードをHGXと呼び、話者はこれを「マザボみたいな感じ」とたとえている。

さらにHGXを筐体に収めたものがDGXである。話者によれば、これはNVIDIA自身が計算機をターンキー的に使えるようにしたAIシステムだ。V100の場合は、過去にDGX-1としてNVIDIAからリリースされていた。

コンシューマー向けグラボとの性能比較

V100の性能をイメージしやすくするため、話者は同じNVIDIAのコンシューマー向けグラボと比べている。結果は、指標によってRTX 3060 TiからRTX 3090クラスまでと幅が大きい。

幅が出るのは、演算性能のわりにメモリ帯域が広いからだ。FP32の単精度演算は15.7TFLOPSで、これはRTX 3060 Ti相当になる。一方でメモリ帯域は900GB/sあり、こちらはRTX 3090相当である。

話者は、最近流行しているLLMの推論ではメモリ帯域とVRAM容量が重要だと言われている点を挙げる。そのうえで、2.2万円で買えるGPUアクセラレーターとしては「結構良さそう」だと評価している。

電源回路:16フェーズと大型インダクタ

ここからは、V100と通常のグラボの違いを部分ごとに見ていく。最初は電源まわりである。

話者は、電源部の仕様はGPUの消費電力によって多少変わると前置きしている。そのうえで、V100は高性能なGPUなので電源フェーズ数が多く、16フェーズあると指摘する。インダクタもそれなりに大きなものが載っている。

理由として話者は次のように計算している。このモジュールの最大消費電力は300W、入力電圧は12Vである。これをGPUのコア電圧である1V程度まで下げる必要がある。単純計算すると、GPUには300A程度の電流が流れることになる。この大電流を分担するためにフェーズ数が増え、インダクタも大きくなる、という説明である。

余談として、最近のデータセンター向けGPUの話も出てくる。話者によれば、最近の製品は消費電力が1000Wほどまで上がっている。そのため、モジュールに届くまでの導通損失とケーブルに使う銅の量を減らす目的で、入力電圧は48Vまで上げられているようだという。

電源回路について、話者は詳細なリバースエンジニアリングまではしていないと断っている。そのうえで、使われている部品から降圧コンバーターを構成していると判断している。PWMコントローラーはMonolithic Power SystemsのMP2888Aである。MOSFETはonsemiのFDMF3170で、ゲートドライバーとMOSFETが一体になった2in1タイプの部品だという。

周辺部品:円筒形コンデンサからチップ部品へ

周辺回路の部品にも違いがある。グラボでは、円筒形の高分子系アルミ電解コンデンサが使われている。これに対してV100はチップ形状のコンデンサが中心で、基本的にはMLCCが多用されている。

基板上には比較的大きな黒いチップ部品もある。話者は最初これをタンタルコンデンサだと思ったという。しかし内部を見ると積層構造になっていたため、電解コンデンサだと判断した。バルクコンデンサとして使われている導電性高分子アルミ電解コンデンサだろうと推測しており、メーカーについては「パナソニックとか村田製作所あたり」と見当をつけている。ただし特定はしていない。

V100は裏面にもバルクの電解コンデンサを備えている。話者によれば、最近のデータセンター向けGPUではこの配置が少し変わっており、GPUの裏側に置かれるのは主にMLCCになっているという。

いちばんの違い:GPUとメモリの接続(CoWoS)

話者が最大の違いとして挙げるのは、GPUとメモリの接続方法である。

一般的なグラボでは、GPUのダイの下に緑色のパッケージ基板があり、その下に黒色のプリント基板がある。GDDRメモリとの信号は、このパッケージ基板とプリント基板を通してやり取りされる。

V100を見ると、一見メモリが見当たらない。実際には、中央にあるのがGPUのダイで、その横にメモリのダイが4つ並んでいる。これらのダイはシリコンインターポーザーの上に載って互いに接続されている。その下に深緑色のパッケージ基板があり、さらにその下で黒色のプリント基板につながる構造だ。メモリの種類も異なり、V100ではHBMという高帯域なメモリが使われている。

このような実装方式をCoWoSと呼ぶ。話者はシリコンインターポーザーを使う理由を次のように説明している。メモリ帯域を広げるには、メモリのバス幅、つまりメモリから出ているピンの数を増やす必要がある。しかしプリント基板では微細な加工が難しく、バス幅には限界がある。そこでシリコンのインターポーザーを配線層として使う。シリコンならパッケージ基板やPCBよりはるかに細かい加工ができるので、バスの本数を多く取れる。

今後:PC接続キットでローカルLLM推論機を作る計画

購入後にアリエクスプレスを見ていた話者は、V100をパソコンに接続するためのキットが売られていることに気づいた。V100を買った時点ではそこまで考えていなかったという。しかし、こうしたキットが使えるなら、自宅でコストパフォーマンスよくローカルでLLM推論ができるマシンを組めるのではないかと考えている。現在はキット類を調達する方向で進めている段階で、実際に動かした結果はまだ示されていない。

まとめとして話者は、データセンター向けGPUと普通のグラボの一番の違いは、GPUとメモリの接続方法と、使っているメモリの種類だと述べている。今回購入した個体はさらに分解するために保管しておき、LLM推論マシン用のV100は別に調達する予定だという。