アリエクスプレスで2.2万円のNVIDIA Tesla V100を買って分かった、データセンター用GPUと普通のグラボの違い
イチケン / ICHIKENアリエクスプレスでNVIDIAのデータセンター向けGPU「Tesla V100」を見つけた話者は、それを実際に購入した。一般的なグラフィックボードと比べると、形状、電源回路、部品、メモリの接続方法がどう違うのかを実物を見ながら確認している。最初は鑑賞用のサンプルのつもりで買ったが、調べるうちに別の使い道も見えてきたという。
2017年世代のGPUを2.2万円で入手
購入したのはTesla V100である。話者の説明では、2017年頃のVoltaアーキテクチャの製品で、「9年前なので結構古い」世代にあたる。
入手のきっかけは、アリエクスプレスを見ていてたまたま出てきたことだった。価格は2.2万円である。話者自身は、この価格が相場と比べて高いのか安いのかは分からないと述べている。それでも、普通のグラボを持っている人はいても、データセンター用GPUを持っている人はいないだろうと考えて購入を決めた。
Tesla V100 SXM2 16GBという製品
手元に届いたのは「Tesla V100 SXM2 16GB」、つまりメモリ16GBのモデルである。同じV100には32GBモデルもある。ただし32GBモデルは価格が10万円を超えており、手が出しにくいため今回は16GBモデルを選んだという。
多くの人がGPUと聞いて思い浮かべるのは、自作パソコンのマザーボードに挿すグラフィックボードの形だろう。V100はデータセンター向けで、SXM2というフォームファクターを採用している。PCIeのソケットはない。代わりに裏面にはピンがたくさん並んだコネクタがあり、外部との信号のやり取りと電源の供給はすべてここで行う。
グラボに付いているような補助電源ピンはない。HDMIやDisplayPortといった映像出力もない。話者はこれを、本当に計算を行うためだけに作られたものだと説明している。
SXM、HGX、DGXの関係
話者はデータセンター向けGPUの構成単位も整理している。SXMはGPUの最小単位となるモジュールである。このSXMを8基載せたベースボードをHGXと呼び、話者はこれを「マザボみたいな感じ」とたとえている。
さらにHGXを筐体に収めたものがDGXである。話者によれば、これはNVIDIA自身が計算機をターンキー的に使えるようにしたAIシステムだ。V100の場合は、過去にDGX-1としてNVIDIAからリリースされていた。
コンシューマー向けグラボとの性能比較
V100の性能をイメージしやすくするため、話者は同じNVIDIAのコンシューマー向けグラボと比べている。結果は、指標によってRTX 3060 TiからRTX 3090クラスまでと幅が大きい。
幅が出るのは、演算性能のわりにメモリ帯域が広いからだ。FP32の単精度演算は15.7TFLOPSで、これはRTX 3060 Ti相当になる。一方でメモリ帯域は900GB/sあり、こちらはRTX 3090相当である。
話者は、最近流行しているLLMの推論ではメモリ帯域とVRAM容量が重要だと言われている点を挙げる。そのうえで、2.2万円で買えるGPUアクセラレーターとしては「結構良さそう」だと評価している。
電源回路:16フェーズと大型インダクタ
ここからは、V100と通常のグラボの違いを部分ごとに見ていく。最初は電源まわりである。
話者は、電源部の仕様はGPUの消費電力によって多少変わると前置きしている。そのうえで、V100は高性能なGPUなので電源フェーズ数が多く、16フェーズあると指摘する。インダクタもそれなりに大きなものが載っている。
理由として話者は次のように計算している。このモジュールの最大消費電力は300W、入力電圧は12Vである。これをGPUのコア電圧である1V程度まで下げる必要がある。単純計算すると、GPUには300A程度の電流が流れることになる。この大電流を分担するためにフェーズ数が増え、インダクタも大きくなる、という説明である。
余談として、最近のデータセンター向けGPUの話も出てくる。話者によれば、最近の製品は消費電力が1000Wほどまで上がっている。そのため、モジュールに届くまでの導通損失とケーブルに使う銅の量を減らす目的で、入力電圧は48Vまで上げられているようだという。
電源回路について、話者は詳細なリバースエンジニアリングまではしていないと断っている。そのうえで、使われている部品から降圧コンバーターを構成していると判断している。PWMコントローラーはMonolithic Power SystemsのMP2888Aである。MOSFETはonsemiのFDMF3170で、ゲートドライバーとMOSFETが一体になった2in1タイプの部品だという。
周辺部品:円筒形コンデンサからチップ部品へ
周辺回路の部品にも違いがある。グラボでは、円筒形の高分子系アルミ電解コンデンサが使われている。これに対してV100はチップ形状のコンデンサが中心で、基本的にはMLCCが多用されている。
基板上には比較的大きな黒いチップ部品もある。話者は最初これをタンタルコンデンサだと思ったという。しかし内部を見ると積層構造になっていたため、電解コンデンサだと判断した。バルクコンデンサとして使われている導電性高分子アルミ電解コンデンサだろうと推測しており、メーカーについては「パナソニックとか村田製作所あたり」と見当をつけている。ただし特定はしていない。
V100は裏面にもバルクの電解コンデンサを備えている。話者によれば、最近のデータセンター向けGPUではこの配置が少し変わっており、GPUの裏側に置かれるのは主にMLCCになっているという。
いちばんの違い:GPUとメモリの接続(CoWoS)
話者が最大の違いとして挙げるのは、GPUとメモリの接続方法である。
一般的なグラボでは、GPUのダイの下に緑色のパッケージ基板があり、その下に黒色のプリント基板がある。GDDRメモリとの信号は、このパッケージ基板とプリント基板を通してやり取りされる。
V100を見ると、一見メモリが見当たらない。実際には、中央にあるのがGPUのダイで、その横にメモリのダイが4つ並んでいる。これらのダイはシリコンインターポーザーの上に載って互いに接続されている。その下に深緑色のパッケージ基板があり、さらにその下で黒色のプリント基板につながる構造だ。メモリの種類も異なり、V100ではHBMという高帯域なメモリが使われている。
このような実装方式をCoWoSと呼ぶ。話者はシリコンインターポーザーを使う理由を次のように説明している。メモリ帯域を広げるには、メモリのバス幅、つまりメモリから出ているピンの数を増やす必要がある。しかしプリント基板では微細な加工が難しく、バス幅には限界がある。そこでシリコンのインターポーザーを配線層として使う。シリコンならパッケージ基板やPCBよりはるかに細かい加工ができるので、バスの本数を多く取れる。
今後:PC接続キットでローカルLLM推論機を作る計画
購入後にアリエクスプレスを見ていた話者は、V100をパソコンに接続するためのキットが売られていることに気づいた。V100を買った時点ではそこまで考えていなかったという。しかし、こうしたキットが使えるなら、自宅でコストパフォーマンスよくローカルでLLM推論ができるマシンを組めるのではないかと考えている。現在はキット類を調達する方向で進めている段階で、実際に動かした結果はまだ示されていない。
まとめとして話者は、データセンター向けGPUと普通のグラボの一番の違いは、GPUとメモリの接続方法と、使っているメモリの種類だと述べている。今回購入した個体はさらに分解するために保管しておき、LLM推論マシン用のV100は別に調達する予定だという。
この動画はご覧のスポンサーの提供でお送りします。
こんにちは。今日はNVIDIAのデータセンター向けGPUを手に入れたので紹介していきます。こちらです。NVIDIA Tesla V100というGPUです。世代的には結構古くて、2017年頃のVoltaという9世代のアーキテクチャです。9年前なので結構古いですね。
そもそもこれをどうやって見つけたかなんですけども、AliExpressをさまよっていたらたまたま出てきました。しかも価格は2.2万円です。正直価格が高いのか安いのかという相場感はわからないんですけど、通常のグラボのGPUを持っている人はいても、データセンター用のGPUを持っている人はいないだろうということで購入してみました。
購入した当初は鑑賞用のサンプルとして使うつもりだったんですけども、実はそれ以外の用途にもいろいろと使えそうだということがわかったので、そのあたりも含めて今回の動画ではいろいろと見ていきます。その前に今日のスポンサーの紹介です。どうぞ。
皆さん、NPUを積んだAIマイコンもう触ってみましたか。こちらがそのボード、NXPの最新のAIマイコンです。なんとAIの処理をCPUではなく専用のNPUでこなせるんです。そしてこのボードの実機を動かしながら学べるハンズオン講座をCQ出版が開催します。
テーマは、リアルタイムOSのZephyr、OTAアップデート、AI異常検知、CAN通信の4つです。今時の組み込み開発に必要な内容が手を動かしながら学べます。
会場は巣鴨にあるCQ出版で実施。オンライン参加はなんと無料です。しかも抽選で5名様にこのボードが当たります。応募するしかないですね。会場参加なら5000円の費用はかかるのですが、このボードはそのまま持ち帰れます。気になる回があれば概要欄のリンクから申し込んでみてください。
まずは実物をよく見ていきます。Tesla V100 SXM2 16GBです。16GBのメモリーのモデルです。スペックについてはこの表にあるので、一時停止で確認お願いします。
今回はメモリー16GBのモデルを購入しましたが、32GBのモデルもあります。ただそれを買うとなると価格は10万円超えとなっていて、ちょっと手が出にくくなってしまったので、今回は16GBモデルを購入しています。
皆さんが想像するGPU、というかグラボですね。それは自作パソコンのマザボに挿して使うようなグラフィックボード形状を想像すると思います。ですがこちらはデータセンター向けとなっており、SXM2というフォームファクターを採用しています。
PCIeのソケットがない代わりに裏面を見てみると、このようにピンがたくさん生えているコネクタがあります。このコネクターから外部との信号のやり取り、電源供給を行います。グラボについているような補助電源ピンはついていませんし、HDMIやディスプレイポートなどの映像出力もついていません。なので本当に計算を行うためだけに作られたものです。
一応このSXMというのが、このGPUの最小単位のモジュールとなっています。このSXMを8機搭載したものがHGXと呼ばれるベースボードです。わかりやすく言うとマザボみたいな感じですね。さらにHGXを箱の中に収めたDGXというものがあります。これはNVIDIA自身がターンキー的にAIシステム(計算機)ですね、それを使えるようにしたものです。このV100 GPUの場合はDGX-1として過去にNVIDIAからリリースされていました。
このグラボが持っている性能がもう少しわかりやすくなるように、コンシューマー向けグラボとの性能も比較してみます。少し振れ幅は大きいのですが、同じNVIDIAから出ているRTX 3060 TiからRTX 3090クラスとなっています。
振れ幅が大きくなってしまう理由なんですけども、演算性能の割にメモリー帯域が広いのでこのようになります。例えばFP32の単精度演算ですと15.7TFLOPSとなっていて、これはRTX 3060 Ti相当です。一方でメモリの帯域については900GB/sありまして、これはRTX 3090相当です。
ここ最近流行っているLLMの推論ですと、帯域とVRAMの容量が重要と言われているので、2.2万円で購入できるGPUアクセラレーターとしては結構良さそうです。
ここからはV100グラボを主役として見つつ、通常のグラボとの違いを見ていきます。まずは電源周りですね。正直電源部分についてはGPUの消費電力によって仕様が少し変わってしまうのですが、やっぱりGPU自体が高性能なこともあって電源のフェーズ数は多いです。16フェーズあります。そしてインダクタもそこそこでかいものを積んでいます。
このモジュールの最大消費電力は300Wなので、それを支えるだけの電力変換回路が必要となっています。このモジュールへの入力電圧は12Vで、それをGPUのコア電圧である1V程度まで降圧する必要があります。単純計算でGPUには300A程度の電流が流れることになります。なのでその電流を適切に分担するためにフェーズ数も多くなりますし、インダクタのサイズも大きくなります。
ちなみに電源フェーズ数については以前動画を作成しているので、興味のある人はぜひそちらもチェックをお願いします。
余談になりますが、このモジュールの入力電圧は12Vです。最近のデータセンター向けのGPUですと消費電力が上がりすぎて1000Wぐらいあります。このモジュールにたどり着くまでの導通損失と、使用するケーブルの銅の量を減らすために、入力電圧は48Vまで上がっているようです。
電源回路の部分については詳細なリバースエンジニアリングをしていないので詳細はわからないのですが、使っている部品から見るに降圧コンバーターを構成しています。PWMコントローラーはMonolithic Power SystemsのMP2888Aです。MOSFETはonsemiのFDMF3170です。これはゲートドライバー入力、MOSFETも2in1タイプのものです。
周辺回路に使われている部品も見ていきます。グラボの方ですと円筒形状の高分子系のアルミ電解コンデンサが使われています。一方でV100ですとチップ形状のコンデンサが使われています。基本的にはMLCCが多用されていますね。
ただこちらにある結構大型の黒いチップ部品ありますよね。実はこれも電解コンデンサーです。一瞬タンタルコンデンサーかと思ったのですが、内部を見てみると積層構造となっていて、電解コンデンサーであることがわかります。これはバルクのコンデンサーとして使われていて、導電性高分子アルミ電解コンデンサーが使われているのかと思います。パナソニックとか村田製作所あたりのものですかね。
こちらのGPUを見てみると裏面にもバルクの電解コンデンサーがありますが、最近のデータセンター向けGPUですとこのあたりの配置はもう少し変わっていて、GPUの裏側にあるのは主にMLCCとなっています。
次は一番の違いである、GPUとメモリー周りの接続について見ていきます。一般的なグラボとデータセンター向けGPUの違いわかりますか。グラボの方はGPUのダイがあって、その下に緑色のパッケージ基板、そして黒色のプリント基板を通してGDDRメモリにつながっています。グラフィックボードだとよくある構成ですね。
一方でデータセンター向けのものはどうでしょうか。あれ、メモリないじゃんって思いますよね。実はあるんですね。この真ん中にあるのがGPUのダイ、そしてその横にあるのがメモリーのダイです。4つあります。
これらのGPUダイ、メモリーダイがシリコンインターポーザーの上に乗っかって接続されています。さらにその下に深緑色のパッケージ基板があって、黒色のプリント基板に接続されるというようになっています。さらにメモリー自体にも違いがありまして、こちらはHBMメモリーという高帯域なメモリーが使われています。
まとめるとこんな感じです。一般的なグラフィックボードは、GPUがパッケージ基板の上に乗っていて、そのメモリとの信号のやり取りというのは、パッケージ基板とプリント基板を通して接続されて信号をやり取りすると。一方でV100の場合はどうかというと、シリコンインターポーザーの上にGPUとHBMのメモリが乗っていて、それらがこんな感じでつながっているという様になります。
このように接続されるパッケージのやり方のことをCoWoSと言います。メモリーの帯域を広くするために、メモリーのバス幅、つまりメモリーから出ているピンの数を多くしているんですけども、プリント基板を使う場合ですと微細な加工というのが結構難しくて、バス幅に限界があります。ですのでシリコンのインターポーザーを使って、その部分を配線層として使っています。シリコンですので、パッケージ基板やPCBと比べても非常に微細な加工ができて、バスの本数を広く取れるわけです。
このようにパッと見ただけでもいろいろな違いがあります。
これからこのGPUを使って何をしたいかなんですけども、GPUを手に入れた後にAliExpressを見ていたら、パソコンに接続できるキットが売られていることが分かりました。V100 GPUを買った時は何も考えていなかったんですけども、こういったキットが使えるのであれば、自宅でコスパ良くローカルでLLM推論ができるマシンを構築できるのではないかと思います。ですので一旦キット類を調達する方向で現在は進めています。
というわけで、データセンター向けGPUを購入して、普通のグラボGPUと何が違うのかを見てきました。一番の違いはGPUとメモリーの接続、そして使っているメモリーの種類の違いかなと思いました。今回購入したものはさらに分解するものとして保管しておいて、LLM推論マシン用のものはまた別途調達していきたいと思います。
というわけで、この動画が役に立ちましたら高評価・チャンネル登録よろしくお願いします。何か気になることがありましたら、ぜひコメントも残してみてください。それでは最後まで動画のご視聴ありがとうございました。
記事公開
