ラズパイCM5を7台つないだミニスパコンの性能を測る

YouTubeで開く ↗
概要

Raspberry Piで「ミニスーパーコンピュータ」は作れるのか。この動画では、Raspberry Pi Compute Module 5(CM5)を7台使ってクラスタを組み、円周率計算、LINPACK、HPCGの3種類で性能を測っている。さらに電力効率を最先端のスパコンと比べている。話者の結論は、性能と効率では専用設計のスパコンに遠く及ばないものの、汎用ボードでここまでできるのは面白く、学習用としても価値がある、というものだ。

8分で読めます

CM5とはどんなボードか

CM5は、通常のRaspberry Pi 5よりかなり小さいボードである。産業用途や組み込み用途を想定していて、RAM容量、ストレージ容量、無線通信機能の有無を選べる。コストとスペックを調整しやすくするための仕組みだと話者は説明する。Raspberry Pi 5に標準で付いているUSB、有線LAN、HDMI端子は、CM5にはない。

話者が選んだのは、RAM 16GB、ストレージ64GB、無線機能付きのモデルで、選択肢の中で最も高いスペックのものだ。今後ほかのプロジェクトでも使うことを考えて、この構成にしたという。

価格については、RAMやストレージの品不足の影響でRaspberry Piも公式に値上げしていると話者は述べる。2025年12月に購入したときは税抜き約2.1万円だったが、動画の時点では税抜き約3.5万円になっていた。最上位モデルであることも理由の一つだが、かなり値上がりしており、早めに買っておいて良かったと話している。購入時には技適の表記がなかった。そのため、ミニスパコンのような用途なら、無線機能をオフにするか、最初から無線なしのモデルを選ぶのが良いと話者は勧める。無線なしのほうが安く済むという理由もある。

Raspberry Pi 5と並べると、CM5が小さい理由は、有線LAN・USB・HDMI端子とGPIOピンがないことにある。プロセッサなどもコンパクトにまとまる配置になっている。Raspberry Pi 5はストレージを搭載しておらず、SDカードかSSDを別に用意する必要がある。一方CM5はストレージ付きのモデルを選べて、裏面にストレージが実装されている。

I/Oボードではなくクラスタキットを選んだ理由

CM5を単体で使うのは難しく、マザーボードのようなものに挿して使うことになる。裏面には200ピンを引き出せるコネクタがあり、自作のマザーボード、サードパーティ製のマザーボード、Raspberry Pi財団公式のCM5用I/Oボードのいずれかに接続する。I/Oボードに挿せば、通常のRaspberry Pi 5と同じように使える。

ただ、スパコン用途でCM5の台数分だけI/Oボードを買うのは、費用面でもったいないと話者は考えた。ミニスパコンとして動かすだけなら、各ノードのHDMI、USB、GPIOは使わないからだ。そこで、もっと安くクラスタを組める製品を探し、SipeedのNanoClusterというキットを使うことにした。

NanoClusterでは、まずCM5を変換基板に載せ、その変換基板をマザーボードに挿す。変換基板にはmicroSDカードスロット、SSDスロット、電源用のUSB-C端子がある。SSDスロットがあることで、ストレージを増やせる点を話者は評価している。また、確認はしていないと断ったうえで、無線付きのCM5なら変換基板に挿すだけでも使えそうだと話している。この構成で7台のCM5をクラスタ化した。

起動時の消費電力と温度

電源のUSBケーブルを挿すと起動する。冷却ファンの音はかなりうるさいという。何も計算していないアイドル時の消費電力は約21Wで、温度は30℃台前半だった。計算していない状態でこの温度なので、計算を始めればもっと上がる。このくらいの規模のミニスパコンでも冷却ファンは必須だと話者は述べている。

モンテカルロ法による円周率計算

最初のベンチマークは、モンテカルロ法による円周率の計算である。試行回数は2億回とした。1ノードでは約20秒かかった。2ノードにすると計算時間は半分になり、ノードを増やすほど短くなった。7ノードでは2.9秒で、話者は、もともと20秒かかった計算が1/7の時間で終わったとして、並列化の効果がよく見えていると評価する。モンテカルロ法のような計算では、ノードを増やしてスパコンのように使う効果がよくわかる、というのが話者の見方だ。

LINPACK:最大85.9GFLOPS、ただし台数に比例しない

次に実行したのはLINPACKである。結果は数十GFLOPSで、1ノードで38.8GFLOPS、7ノードで85.9GFLOPSだった。ノード数を7倍にしても性能は7倍にはならず、LINPACKでは台数を増やした分だけ性能が上がるわけではなさそうだと話者は述べる。

話者によれば、この性能は1993〜1994年ごろの最先端スパコンと同じくらいだという。30年前のスパコンに相当する性能が手のひらサイズに収まる点を、話者は「すごい」と表現している。

HPCG:数値は低いが、ノード数に比例して伸びた

一方で話者は、LINPACKは演算性能の比重が高いベンチマークで、実際の科学計算アプリケーションのようなメモリアクセスを含めた性能は見ていない、とも言われていると紹介する。実際のアプリケーションでは、CPUとメモリの間のデータのやり取りも多いはずだという考えから、次にHPCGを試した。

話者の説明では、HPCGは実際の科学計算アプリケーションに近いメモリアクセスや通信のパターンを含むベンチマークである。LINPACKでは見えないメモリ帯域やノード間通信の性能がスコアに大きく影響するため、LINPACKで高い性能を出す計算機でも、HPCGではスコアが大きく下がることがある。

結果は、1ノードで1.10GFLOPS、7ノードで6.54GFLOPSだった。LINPACKと比べて大幅に低く、話者は、メモリアクセスなども考慮したこの数値がラズパイスパコンの実力ということだろうか、と述べている。ただしLINPACKとは違い、HPCGではノード数に比例して演算性能が上がった。なお、これはクラスタ1台だけでの結果である。このクラスタを複数台つないだときに同じ傾向になるかはわからない、と話者は留保している。

全7ノードで計算しているときの消費電力は62Wだった。約60W分の熱が出るのでかなり熱くなり、最高温度は約70℃に達した。ラズパイで作るスパコンでも冷却は必須だと話者は改めて強調する。

電力効率:富岳と比べても約1/10

最後に電力効率を検討している。話者によれば、最先端のスパコンの消費電力は数MWから数十MWであることが多く、電気代だけで年間数十億円になることもある。消費電力が大きいほど冷却も難しくなるため、計算能力を上げようとしても、先に電力と冷却が限界に達することがある。だから、同じ電力でどれだけ多く計算できるかという電力効率が、スパコンの性能を見るうえで重要になる、と話者は説明する。

動画で示されたグラフは、1Wあたり何GFLOPS計算できるかを比べたものだ。電力効率で現在世界1位のKAIROSは73.3GFLOPS/W、LINPACKスコアで現在世界1位のEl Capitanは60.9GFLOPS/W、日本の富岳は15.4GFLOPS/Wである。今回のCM5ミニスパコンは実測で1.4GFLOPS/Wだった。

ここで話者は比較の前提に注意を促す。KAIROSとEl CapitanはGPUアクセラレータを搭載し、計算のほとんどをGPUに任せることで電力効率を高めている。一方、富岳はCPUだけで動いている。今回のラズパイクラスタもCPUだけで計算しているので、比べるなら富岳のほうが適切だという。それでも今回のミニスパコンの電力効率は富岳の1/10ほどしかない。話者はその理由を、富岳がスパコン専用に設計されたプロセッサと高速なメモリを積んでいるのに対し、CM5は汎用のシングルボードコンピュータだからだと説明し、「そりゃそうなるよね」という話だとしている。

話者の結論

話者は結果を次のようにまとめている。LINPACKでは7ノードで85.9GFLOPSとなり、1993〜1994年ごろの最先端スパコンに匹敵する。30年前のスパコンと同等の性能が手のひらサイズに収まることには「ロマンがある」という。HPCGでは7ノードで6.54GFLOPSで、LINPACKとは大きな開きがあったが、ノード数に比例して性能がスケールしたことは良い結果だと評価している。電力効率は最先端のスパコンと大きな差があったものの、汎用のラズパイでここまでできるのは面白いという。そして、性能を追い求めるだけでなく、勉強用にこうしたミニスパコンのクラスタを組んでみるのも面白いと締めくくっている。