ジム・ケラーはNVIDIAにどう挑むのか:Tenstorrentの設計思想と、シリコンバレーで学ぶ日本人研修生

YouTubeで開く ↗
概要

ものづくり太郎チャンネルのものづくり太郎氏が、米Tenstorrentを訪れ、同社を率いるジム・ケラー氏と対談した。テーマは、AI半導体市場で圧倒的な地位にあるNVIDIAにどう挑むかである。後半では、日本の設計人材育成プログラム「ADIP」でTenstorrentに派遣されている2人の学生にインタビューしている。ケラー氏の主張は、ネットワークでつながる汎用AIプロセッサとオープンなRISC-Vを組み合わせれば、高価なメモリにもCUDAにも依存せずに戦えるというものだ。太郎氏はこの主張を自身の解説で補強し、日本のエンジニアが最先端の設計現場に出ていくべきだと訴えている。

21分で読めます

「ミスター半導体」ジム・ケラーという人物

太郎氏はまず、ケラー氏の経歴を紹介する。iPhoneのAシリーズ(Bionic)チップを設計し、それを土台にMac向けの半導体も作られたことから、太郎氏はAppleの省エネと高性能の基盤を作った人物と位置づける。PC向けではAMD Ryzenなどのx86系CPU、64ビット化(AMD64)に関わり、Teslaの自動運転(オートパイロット)用半導体も手がけた。Intelではチップレット、つまり複数のダイを統合する技術とダイ間通信の設計思想、開発体制の刷新を主導したと太郎氏は説明する。

そのケラー氏が「NVIDIAは俺たちが倒す、当たり前だろう」と語ったことを、太郎氏は冒頭で強調する。世界一の企業を倒すと言い切るところに、シリコンバレーの挑戦の文化とアメリカ産業の強さが表れている、というのが太郎氏の見方である。

ネットワークでつながるAIプロセッサ

対談で太郎氏は、Tenstorrentの強みを問うた。ケラー氏は2点を挙げる。1つはソフトウェア、もう1つはスケールである。同社のAIチップはいずれも400ギガビットのEthernetポートを12個備えている。そのためネットワーク帯域が大きく、多数のチップをつないで非常に大きなモデルを多くの計算要素に分散できる。十分なSRAM、DRAM、ネットワーク帯域があるので高速に動かせる、というのがケラー氏の説明だ。

太郎氏は続けて、NVIDIAが採用する広帯域メモリ(HBM)を使わずにどう対抗するのかを尋ねた。ケラー氏の答えは、メモリへの書き込み頻度がそれほど高くない設計であること、そしてAIプロセッサ同士が大きなモデル上で直接通信して協調することである。そのうえで、自社はまだ新しいスタートアップだが、生産の立ち上げが始まり製品を販売している段階だと付け加えた。

アーキテクチャそのものが違うのか、という質問には、ケラー氏は計算機の系譜から答えた。汎用CPUがあり、ゲームを動かすアクセラレータとしてGPUが生まれた。その後GoogleがTPU(テンソルプロセッサ)を発明して最初に製品化した。NVIDIAは「GPUとテンソルプロセッサの組み合わせ」だという。これに対してTenstorrentのチップはGPUではなくテンソルプロセッサであり、さらに「ネットワーク化されたAIプロセッサ」である。チップの中にネットワークインターフェースを持ち、ホストプロセッサを介さずにチップ同士を直接つなげられる。チップを増やすほど強力になるのかという太郎氏の確認には、そうだという趣旨で応じている。

NVLinkと光接続への見方

太郎氏は、NVIDIAには高速なチップ間接続のNVLinkがあり、Tenstorrentは通信面をあまり重視していないように見えると問うた。ケラー氏によれば、NVLinkは高速なインターコネクトだが一般的にスケールするものではない。2つのプロセッサがNVLinkで通信するとき、一方が相手のRAMにデータを送る形になる。Tenstorrentはコアとコアの間を何も介さず直接つなぐ、というのがケラー氏の説明である。

サーバーラックをまたぐ接続についても質問があった。ラック間の接続はEthernetだという。太郎氏がさらに、NVIDIAは光電融合(CPO)で高速化を進めているが、普通のEthernetではレイテンシが問題にならないかと尋ねた。ケラー氏は、NVIDIAも光ケーブルを使い始める計画だとしたうえで、本当の論点は低コストの光ケーブルだと述べた。Ethernetは光につながり、光部品の価格は下がってきていて、光はもはや特別なものではなくなりつつある。光は今後面白くなる、というのがケラー氏の見立てだ。

推論特化ではなく「汎用AIコンピュータ」

今後は推論(インファレンス)が重要になるのに、なぜ学習用チップも開発しているのか。この質問に対し、ケラー氏は専用化の流れそのものに懐疑的な立場を示した。CPUは汎用であり、ゲーム用GPUはAMDでもNVIDIAでもよく似ていて、AppleのGPUも汎用だ。いまは推論と学習、LLMのプリフィルとデコードでまったく違うコンピュータが必要だと言われているが、それは長くは続かないという。

Tenstorrentが目指すのは「汎用AIコンピュータ」である。1チップでも、32チップを載せた箱でも、現在1152個のAIチップからなるスーパークラスタでも、常に1台のAIコンピュータに見えるようにする。ケラー氏は「専用化は基本的に、何か問題があることのサインだ」と述べ、AIは非常に汎用的になると予測した。誰もが大規模言語モデルを動かし、ファインチューニングも行い、非常に大きなプロンプトとコンテキストを扱う。それらが1か所に集約されていく、という見立てである。

汎用チップで専用チップを設計力で超えようとしているのか、という問いには、数学は同じだと答えた。行列積、ベクトル演算、各種の演算、そしてデータの移動である。1個のプロセッサから数千個のプロセッサまで、それは変わらないという。

「CUDAなんて誰が気にする?」

太郎氏が最も踏み込んだのは、NVIDIAのCUDAエコシステムをどうするのかという質問だった。ケラー氏は、ちょうど顧客と話したばかりだが誰もCUDAを気にしていない、ただ翻訳するだけだ、と答えた。AnthropicやGemini、GLM、Kimi K2といったAIに、CUDAのプログラムを示して書き換えを頼めば書いてくれる。Tenstorrentには数千の数学演算カーネルがあり、コードをそれらに翻訳する作業はいまやAIへのプロンプトで済む。好きなAIエンジンに「CUDAからTenstorrentへ翻訳するためのプログラミングガイドを書いてくれ」と頼めば、やり方を正確に教えてくれるという。

ケラー氏は、数学的な部分は難しいが多くの企業が解決に取り組んでいるとも述べた。演算子をスケールするよう作れば多数のテンソルプロセッサが協調でき、その上にPyTorchやJAXのような言語がAPIを定義する。プログラムはそのどれでも構わない。同社はこうした内容を論文としてPDFにまとめ、オンラインで公開したという。

太郎氏は「それならTenstorrentがソフトウェアを拡充する意味はあまりないのでは」と、意地悪な質問だと断りつつ尋ねた。ケラー氏の回答は字幕上では断片的だが、必要なところはやらなければならないという趣旨で、AMDやTPUなどにも言及している。

後の解説で太郎氏は、この場面を印象深く振り返っている。日本のエンジニアならCUDAの強さを認めて少し謙遜しそうな場面で、ケラー氏は真顔で「誰が気にするんだ」と言い、笑っていたという。太郎氏の解釈はこうだ。NVIDIAの社員の6〜7割がソフトウェアエンジニアだと言われるほど、CUDAはNVIDIAの強みの源泉だった。ところが、NVIDIAのGPUで学習されたClaudeやCodexのようなコーディングに強いAIが、CUDAの代わりを作れるようになった。NVIDIAが育てたAIによって、ソフトウェアの壁がほぼなくなりつつある。CUDAを使わなくても、1日後には同じようにTenstorrentの半導体を動かせるようになる、というのが太郎氏の理解である。

Rapidus、日本のエンジニア、RISC-V

TSMCでもよいのに、なぜRapidusと協業したのか。ケラー氏の答えは日本での事業に関わるものだった。Tenstorrentは東京にオフィスを持ち、人を採用しており、日本に多くの顧客がいる。その中には日本でシリコンを製造したい顧客もいるという。

日本のエンジニアについてケラー氏は「素晴らしい、もっといればいいのに」と語る。受け入れた日本人エンジニアはAIモデルの仕事だけでなく、CPU設計、AIのテスト用ソフトウェア、基本的なRTLにも取り組んでおり、非常に優秀で意欲的だと評価した。

RISC-Vのオープン戦略を採る理由について、ケラー氏はRISC-Vが新しいアーキテクチャで、優秀な人なら誰でも設計できる点を挙げた。世界にはRISC-Vの採用を求める地域もあり、中国はすでにサーバーを作っていて、インドやEUも強い関心を持っているという。Tenstorrentは仕様をオープンにし、リファレンスモデルもソフトウェアスタックも公開している。重要な顧客の中にはCPUに手を加える企業もあるため、CPUとAIのIPを「イノベーション・ライセンス」と呼ぶ形でライセンスし、改変を認めている。そしてAIを使えば、その改変が本当に堅牢かをテストできるという。

過去の自分のチップにどう勝つか

太郎氏は、ケラー氏がかつて自ら作ったAppleのMシリーズやAMDのZenコアとも戦うことになるのでは、と問うた。ケラー氏は、AIを使ってより速く設計すると答えた。社内には最高のアーキテクトが2人おり、ここ数年はAI、AIソフトウェア、それが設計に与える影響について考えてきた。全エンジニアにAIを効果的に使う訓練をしているとも言う。AIで混乱を生むのは簡単だが、改善の余地は大きい。「CPUはこれ以上速くならない」というのは「制限的な思い込み」であり、常に良くできる。ケラー氏はロケットの例にも触れ、誰もが無理だと思っていたことが実現された話と重ねている。

日本のエンジニアへの期待と、大学時代の話

日本の設計者への期待を問われると、ケラー氏は検証、アーキテクチャ、物理設計、ソフトウェアといった仕事の幅を挙げた。そこで自分の得意分野を知り、多くのスキルを得られる。受け入れ側も日本の人々を知ることができる。今後10年で設計の方法やCADツールの在り方は大きく変わり、Rapidusはその良い例だという。より少ない日数でチップを作れるようになれば世界は変わる。AIで設計を生成し検証することも大きな変化だ。いまは若いエンジニアが良い機会を得るのが難しい時期なので、履歴書を送ってほしい、空きはある、とも語っている。

最後の質問は、好きな人を追って大学を選んだという話は本当か、というものだった。ケラー氏は笑いながら認めた。父親は機械エンジニアだった。ある女の子がペンシルベニア州立大学に行くと聞いて願書を取り寄せ、専攻を選ぶ際に化学工学、機械工学、電気工学などを並べて検討し、電気工学を選んだ。大学ではコンピュータではなく電磁場と半導体物理を学び、それが好きで得意だったという。

太郎氏の解説:Blackholeはなぜ安く速いのか

対談を受けて、太郎氏はTenstorrentの主張を独自に整理した。太郎氏によれば、同社はNVIDIAのGPUと比べて性能は3〜4倍、価格は4分の1から5分の1だと言っている。それがどういう論理で成り立つのかを説明するのが、この解説の狙いである。

1つ目は製造プロセスの差である。太郎氏がNVIDIAの「Vera Rubin」と比較したところ、Vera RubinのGPUとCPUはTSMCの3nmプロセスで作られるのに対し、TenstorrentのBlackholeは6nmである。太郎氏の説明では、6nmと3nmではウェハ1枚あたりの価格が2〜3倍、開発コストが4〜5倍違う。加えてフォトマスクの価格も高くなり、プロセスが複雑な3nmより6nmのほうが歩留まりも良い。太郎氏は、Tenstorrentで渡されたシールも紹介している。Blackholeが NVIDIAのロゴを吸い込んでいる図柄だという。

2つ目はメモリである。Vera RubinにはHBMが16スタック載り、さらに256GBのDRAMが8個あると太郎氏は述べ、メモリを大量に使う構成だと指摘する。一方、BlackholeはHBMより安いGDDRを使う。それも最新のGDDR7ではなく、1世代前のGDDR6だ。ただし太郎氏は、NVIDIAがHBMによって圧倒的な処理を実現しているのも事実だと認めている。Vera Rubinの1枚のボードは、5GBのハイビジョン動画に換算すると1秒間に1万本分のデータを処理できるという例を挙げている。そこで問題になるのが、HBMなしでどう処理するかだ。

太郎氏が挙げる答えは、Blackholeの各Tensixコア内部にあるSRAMである。SRAMは最も高速なメモリで、1コアあたり1〜1.5MB程度載っていると言われる。太郎氏の試算では、チップ全体でVera Rubinの数倍のSRAMを積んでいる。外部メモリに頼らず、コア内のL1キャッシュで推論を回せるという説明だ。さらに各コアには5つのRISC-V CPUが載っている。これらがメモリの管理や次の計算の準備といった、演算を支える制御を担う。

処理方式も違う。太郎氏によれば、BlackholeはMIMD(複数命令・複数データ)方式で、各コアが独立して異なるプログラムを実行でき、連続した複雑な演算を行える。NVIDIAのGPUはSIMD(単一命令・複数データ)方式で、SRAMが比較的少ないため外部のHBMとの間で何度もデータを出し入れする必要がある。Blackholeは各コアの中である程度処理を済ませ、容量が足りなくなったときに外部のGDDRを使う。そのため外部メモリの使用量はNVIDIAの8分の1程度で、コストも安く、AI演算に最適化された構成になっている、というのが太郎氏の説明である。

なぜNVIDIAはMIMDにしないのか。太郎氏は、NVIDIAがもともと画像を1つずつ処理するGPUの会社で、その構造を引き継いでいるため、AI専用として最適化しきれていないと見る。SRAMを大量に積む半導体企業Groqを仲間に引き入れたのもそのためだ、というのが太郎氏の解釈である。

RISC-Vの利点とGalaxyサーバー

太郎氏はRISC-Vの利点にも触れている。x86などの従来のCPUは命令セットがレガシー化し、命令が数百もある。RISC-Vはそれを40程度に集約したオープンな命令セットで、回路がシンプルになる。チップ上で動くコードまでオープンなので、問題が起きたときに原因の階層を掘り下げられる。自分のコードのバグなのか、コンパイラの最適化ミスなのか、ハードウェアの挙動なのかを判断できるため、エンジニアにとって非常に使いやすい。最適化はChatGPTやClaudeにプロンプトを出せばやってくれる。太郎氏は、今の時代に合った半導体エコシステムを作ったのだと評している。

製品面では、Blackholeを32個搭載した「Galaxy」サーバーがあり、これを16台積み重ねればサーバーラックになる。コストについて太郎氏は、話題の「K3」を動かすにはNVIDIAのGPUだと12億円ほどかかるが、Galaxyサーバーなら1台程度で動かせ、3億円以下で済むだろうと見積もる。

また太郎氏によれば、Tenstorrentのサーバーを世界で最も多く買っている国は日本だという。このアーキテクチャは自動運転、ロボット、AIサーバーで同じ構成を流用できる。用途ごとに専用半導体を作る必要はなく、ソフトウェアもCUDAでなくてよい。太郎氏はこれを「打倒NVIDIA」の中身としてまとめている。

ADIP研修生インタビュー(1):RTL設計に「いきなり実戦投入」

半導体を製造できるだけでなく、産業につながる半導体を設計できるエンジニアが日本に必要だ。太郎氏はそう述べて、NEDOのプログラムであるADIP(最先端デジタルSoC設計人材育成)を紹介し、Tenstorrentに派遣されている学生2人に話を聞いた。

1人目の響さん(後に「渡辺さん」と呼ばれている)は、東京の大学の修士2年である。化学と物理を両方学ぶ学科に在籍し、研究室は応用物理系で光エレクトロニクスを扱っている。半導体設計とは直接関係がなく、研究室の先輩は東京エレクトロン、SCREEN、ディスコといった半導体製造装置メーカーに就職することが多い。半導体設計の職を目指して就職活動をしていたところ、フォローしていたXのアカウントでこのプログラムの紹介を見つけ、すぐに応募した。学生は指導教官の許可が必要なため、その日のうちに相談した。研究の途中で抜けることになったが、「行きたいなら行ってみれば」と、どちらかといえば前向きに送り出されたという。

2025年10月に渡米し、海外生活も一人暮らしも初めてだった。後から来る安藤さんと同居する予定があったため長期契約ができず、短期の住まいを転々として最初は大変だったという。休日は会社の人と日本の曲が入ったカラオケに行くこともある。

仕事は、Tenstorrentの次世代CPUのいくつかのコンポーネントで、論理回路を記述するRTL設計を担当している。大学の研究とは無関係だが、個人的に勉強はしていた。響さんによれば、ハードウェアは一度作ると変えられないため、他社でも社内の他部門でも新人をいきなりRTLに回すことは少ない。しかしスーパーバイザーは「できるだろう」と任せてくれた。無理やりステップアップさせられた形で、約半年で大企業出身のベテランエンジニアと普通に議論できる水準に達したという。

渡米して感じたのは、もっといろいろなことに挑戦してくればよかったということだという。新しい情報を吸収して、できることが増えていくのが楽しい。身についたのは、議論やスケジュール管理、共同作業での分担といったコミュニケーション面のスキルと、ハードウェアを作るための考え方だ。いま一番難しいのは、回路の規模感や必要なハードウェアリソースを見積もる感覚だという。コンパイルのようにして後から確認はできるが、ある程度は肌感覚で進めなければならない。

去年の自分に声をかけるなら「絶対来た方がいい」と響さんは答えた。経済産業省がTenstorrentにプロジェクト資金を出しており、そこからベイエリアのインターンの一般的な水準の給与が支払われている。仕事仲間と遊びに行くこともあり、人脈は将来とんでもなく役に立つと思うという。日本の設計人材へのメッセージとしては、2期・3期には企業から派遣された人も多く、現地のエンジニアと変わらないほど優秀だと話した。日本企業では最先端のCPU設計の機会がないだけなので、ここで経験を積んで日本企業に還元してほしいという。

ADIP研修生インタビュー(2):アウト・オブ・オーダーコアの中核を書く

2人目の安藤さんは東京大学大学院を休学中の修士1年で、この年の3月に渡米した。学部時代の卒業研究はRISC-Vで、東大で開かれたRISC-V Dayでこのプログラムの説明を聞き、第2期に応募した。第2期は2025年5月に募集が始まり、10〜12月にプリトレーニングを受けた。1月開始の予定だったが、ビザ取得などで遅れて3月開始になったという。

安藤さんが関わっているのは、TenstorrentのRISC-VサーバーCPUの次世代品である。現行品のAscalonはすでに発表されている。担当はアウト・オブ・オーダーコアのうち「ミッドコア」と呼ばれる部分のRTLだ。

安藤さんは中学生にも分かるようにと求められ、CPUの仕組みを説明した。CPUはレジスタの値を演算し、メモリとの間ではロードとストアでやりとりする。命令を順番どおりにパイプラインで処理するのがイン・オーダーCPUで、1990年代頃まで主流だった。これに対してアウト・オブ・オーダーは、依存関係のない命令を前の命令の完了を待たずに実行する。たとえば「x1=x2+x3」の次に「x4=x5+x1」が来れば、後の命令は前の結果に依存するので待つ必要があるが、依存しなければ先に実行できる。現在はアウト・オブ・オーダーが一般的で、イン・オーダーは低消費電力でゆっくり処理すればよいマイコンなどに使われるという。

フロントエンドからは命令が順番どおりに流れてくる。ミッドコアはそれをリオーダーバッファ(ROB)に入れ、準備ができた命令から実行ユニットに流し、ライトバックしてROBに完了ビットを立てる。そしてプログラム順に完了した命令をリタイアさせる。安藤さんはこの一連の処理を書いている。

設計の目的について、安藤さんはインターンの立場として断言は避けた。そのうえで、SPECのような業界で使われるCPU性能指標で世界トップを取り、RISC-Vのサーバー級CPUで覇権を狙う意思があるのだろうと話した。強いCPUはAIアクセラレータを動かすのにも使える。ただ、いま取り組んでいるのはAI向けというよりサーバー向けだという。

世界最速なら顧客のコストが下がるのかという問いには、「微妙」と答えた。ただし、x86はIntelとAMDしか作れず、Armはライセンス料がかかる。オープンなRISC-Vにはそうした縛りがないので安くなる可能性はあるという。RISC-Vはカリフォルニア大学バークレー校で、x86やArmの失敗を学んだうえで開発されており、アウト・オブ・オーダーで実行しやすい命令になっているとも説明した。Tenstorrentは現在、AscalonなどのCPUコアをIPとして販売しており、設計図を売るビジネスである。

アーキテクチャレベルの設計はシニアエンジニアが担い、安藤さんはその上で、最も速く、最もハードウェアコストの小さい実装を追求するマイクロアーキテクチャのレベルを担当している。CPUの歴史は長いが、まだ改善の余地はあるのかと問われると、「あります」と答えた。

安藤さんは卒業研究で、RISC-Vのベクトル命令を使って逆行列演算を高速化するイン・オーダーCPUを自作した。その過程で、実際の最高性能のCPUがキャッシュやアウト・オブ・オーダーをRTLでどう書いているのかを知りたくなったという。いまは大企業から来たシニアエンジニアのノウハウを間近に見ながら、仕様をもとに自分でRTLを書けていて楽しいと語る。シミュレーションに加えて論理合成でゲートレベルのロジック量を確認し、配置配線も自分で回す。ロジックが少なくても距離があると時間がかかるため、配置を意識して書く必要があるという。

苦労を聞かれると、始まって4か月近く、ずっと楽しいと答えた。実装に悩み、土日もRTLを書くが、それもやりたいことだという。大変だったのはむしろ生活面で、アパート契約、銀行口座の開設、給与受け取りに必要なソーシャルセキュリティナンバー取得の面接などに時間を取られたことだった。応募を考える人には、CPUに興味があればRISC-Vコースに、AIコースもあるのでそちらにも挑戦してほしいと語った。学生は生活に困らないだけの資金が出るのでノーリスクで集中でき、社会人は上司に相談してみるとよいという。

太郎氏の問題提起:日本のエンジニアは未来から逆算しているか

インタビューを終えた太郎氏は、ADIPの上級コースはシリコンバレーの最先端企業で実践研修を行うもので、面接があり一定の設計知識が必要だと補足した。そのうえで、ケラー氏が「なぜ日本のエンジニアがここに来ないのか分からない」と語っていたことを紹介し、学生たちの輝いた表情がその答えだと述べる。

太郎氏は、Rapidusを扱った回でも言われていた、産業を生まなければ意味がないという話を引いた。日本に産業がなければサービス業や観光業、下請けしか残らなくなる、というのが太郎氏の懸念だ。そして自分の見方として、日本のメーカーのエンジニアは既存製品を伸ばすことばかり考えている、と語る。AI時代にどんな半導体が必要かを逆算し、そのための設計者を育てることをしなくなった、という指摘である。国が支援し、ケラー氏のもとで働ける機会があるのに、各メーカーの第一線のエンジニアが応募しないでよいのか。日産やホンダですら危うくなっている今、20代に挑戦しなくて20〜30年後も食べていけるのか。太郎氏はそう問いかけ、企業にもこのプログラムで人材を育ててほしいと呼びかけて本編を締めくくった。