フィジカルAIはロボットだけではない:動画を言語化する「VSS」が製造業・建設業にもたらす変化

YouTubeで開く ↗
概要

「フィジカルAI」という言葉は最近バズワードになっているが、製造業の現場にいる人の多くは「Unitreeのロボットが踊っているだけだろう」と受け止めているのではないか。ものづくり太郎氏はこの動画で、そうした見方はフィジカルAIを過小評価していると強い言葉で批判する。そのうえで、フィジカルAIとは何か、日本企業にとってどこに機会があるのかを、自作のプレゼン資料を使って説明している。議論の中心にあるのは、NVIDIAが示す「VSS(Video Search and Summarization、ビデオサーチ・サマライゼーション)」という仕組みである。

16分で読めます

VSSとは何か:動画に映る出来事を文章にする

最初に紹介されるのはNVIDIAのデモ動画だ。サーバーラックを組み立てる様子や倉庫の映像が流れ、画面上に「今どのフェーズにあるのか」「どんな事象が起きているのか」を要約した文章が表示される。太郎氏によれば、これがサマライゼーションであり、動画に対して状況の要約を生成できるようになったという。

太郎氏は計算基盤の規模にも触れる。GTCで撮影したVera Rubinを例に挙げ、1秒間に50TB、ハイビジョン動画1万本分に相当する情報を推論(インファレンス)で処理できると説明している。ただ、太郎氏がより強調するのは処理能力よりも、AIが扱える対象の変化である。これまで多くの人が思い浮かべてきたAIは言語対話のモデルであり、その範囲を超える進化はあまりなかった、というのが太郎氏の見立てだ。

言語モデルの仕組みと、画像・動画にあった「ラベル貼り」の壁

VSSの意義を示すために、太郎氏はまずAIの基礎を解説する。大規模言語モデルは言葉の意味の近さをベクトルで表し、高次元のベクトル空間を構築している。たとえば犬と猫は近い方向を向き、猫とチーターも同じ方向性を持つが、スケートボードはまったく違う方向を向く。このベクトルをもとに次に来る言葉を推論するため、言語については人がいちいち意味付けをしなくても、ある意味で答えを出せていた。

一方、画像や動画では事情が違った。物流倉庫の写真を例にとると、人間なら「40歳前後の男性が倒れている」「女性が心配そうに駆け寄っている」「後ろの同僚が助けを呼んでいる」と、1枚から多くの意味を読み取れる。しかし従来のAIでこれを認識させるには、人が倒れている画像を何千枚、何万枚も集め、「これは人が倒れている」と正解ラベルを貼って学習させる必要があった。専用モデルにはこのアノテーションが必須で、複雑な状況や珍しいシーンは認識できなかった、と太郎氏は述べる。

具体例として挙げられるのが自動運転だ。太郎氏がモデレーターを務めたイベントでの話として、「車が走っている」「横断歩道がある」「人が渡ってきそうだ」といった場面に、1秒あたり2枚程度のペースで意味付けのラベルを貼っていたという。その作業を経て、ようやく車は横断歩道の手前で減速すべきだと認識できるようになる。

製造業の改善分野でも同じ構造があった。太郎氏が以前チャンネルで紹介した作業分析ソリューションは、ストップウォッチで測っていた作業の区分、つまり正味作業、付随作業、手待ちの無駄、段取り替えといった判別を動画から行うものだった。ただしこれも、作業ごとにアノテーションをしていたのだろうと太郎氏は推測している。サーバー組み立ての様子や倉庫内のフォークリフトの動きを理解させ、「生産性が悪い」「次はここへ行け」といった判断につなげることは、以前は難しかったという。

アノテーションなしのテキスト化とマルチモーダル化

これに対してVSSは、あらゆる動画や画像をアノテーションなしでテキスト化できる。太郎氏はこれをイノベーションだと評価する。加えて、今のAIはマルチモーダルになっている。従来は、画像認識、契約書(NDAや業務委託契約書)のチェック、会話と、それぞれが1対1の対応だった。それが統合的に判断できるようになったという。

事例として、太郎氏はGTCやハノーバーメッセで展示されていた「チューリップ」という企業を挙げる。工場の10台程度の監視カメラから1秒単位で映像を切り出し、「人が倒れた」といった事象をリアルタイムに言語化する。VSSに少しソリューションを載せた程度のものだが、時価総額は2000億円に達していると太郎氏は紹介し、日本のエンジニアにもできそうではないかと問いかける。

ここから太郎氏は、フィジカルAIの定義を広げる。ヒューマノイドロボットに限らず、動くもの全般を統合的・マルチモーダルに認識し、そこで意思決定まで行える技術がフィジカルAIだ、という立場である。

SCADAは不要になるのか:生産システムへの影響

太郎氏は、VSSがSCADAとして使われる日も遠くないと述べる。SCADAとは、工作機械などの設備が稼働しているかどうかの情報を集約し、稼働率を表示するソフトウェアである。各工作機械にカメラさえ付けておけばVSSで状況がわかるので、SCADAの機能はいらなくなるのではないか、というのが太郎氏の問題提起だ。

太郎氏は生産システム全体の流れも図解する。ERPの側でフォーキャスト、ソース、プラン、デリバリーが決まり、APS(アドバンスト・プランニング・スケジューリング)でスケジュールを組み、MESが設備や人に指示を出す。その指示をPLCなどが受けて工作機械、ロボット、プレス、SMTを動かし、実績をSCADAで表現する。このサイクルを改善で回し、標準化してスループットを最適化するのが日本の強みだった、と太郎氏は整理する。

この構造にVSSが入ると、画像や動画から動体を認識できる。さらにE-BOM、M-BOM、CADモデルといった他のデータと組み合わせれば、「この製品は作りにくい。原因は設計やBOMにある」といった判断もできるのではないか、と太郎氏は述べる。画像検査装置と連携すれば、不良品が出たときに各設備や計測機のカメラ映像をさかのぼり、どの工程で問題が起きたかを判断できる。AIはCADも認識できるようになっているので、どのモデルが悪いのかもおそらくAIで判断できるようになるだろう、と太郎氏は見込む。QCDを管理するPLMも大きく進化するはずだとし、その話は別の動画で扱うとしている。

太郎氏は、海外の展示会に行っても「VSSの意味に気づいていない担当者が多すぎる」とも語る。わかった気になっている担当者が多い、というのが太郎氏の現状認識である。

清水建設の事例:施工管理の日報が5分で

次に太郎氏は、建設業もフィジカルAIの対象になると主張する。「職人ばかりの建設現場にフィジカルAIは関係ない」と考える人は多いが、そうではないという。取り上げるのは、NVIDIAのホームページで公開されている清水建設の動画である。

コンクリートを打設している現場の映像を1分ほど読み込ませると、「複数の作業員がコンクリート打設現場で活動している。1名がコンクリートポンプ車のホースを持ち、鉄筋上にコンクリートを打設している」といった細かい記述が時間区切りで生成される。太郎氏は施工管理者の立場から、この価値を説明する。職人が帰った後に日報をまとめる作業は面倒で、居残り作業になっていた。それが、その日どんな施工をしたかを5分で展開できるようになった。残業がいらなくなるではないか、というわけだ。

RAGで自社の知見を載せる

清水建設の事例で太郎氏が重視するのは、VSSにRAG(Retrieval-Augmented Generation)を組み合わせている点である。RAGは、AIが推論する際にデータを参照しながら応答する仕組みで、特定分野の資料を読み込ませるとその分野に最適化される、と太郎氏は説明する。

たとえば「現場で高所作業をするときのルールは?」と聞いた場合を考える。RAGなしでは公開情報から「一般的には安全帯を使う必要がある」程度の答えになる。これに対し、社内の安全規格や手順を読み込ませたRAGありの場合は、「当社の安全管理基準では、高さ2m以上の作業ではフルハーネス型安全帯の着用が必要。足場上では作業前に接続確認を行う必要がある」といった回答になる。社内の技術要領やノウハウ、過去の知見を前提にカスタマイズでき、そこに動画もラベル貼りなしで扱えるようになった、と太郎氏は述べる。

太郎氏は製造業の保全にも当てはめる。新人がSMTの修理に行っても、何もわからない。しかし故障したモジュールの情報さえ届けば、E-BOM、M-BOM、CAD、仕様書、組図などを読み込んだAIがRAGで直し方を示してくれるので、親方に聞かなくても済むのではないか、というイメージだ。

建設業の文脈では、BIM(Building Information Modeling)、当日のカメラ映像、安全マニュアルなどを組み合わせることで、一般的なVSSとは質がまったく違うものになるという。当日の作業内容のまとめ、工期250日のうち今どこにいるのかという進捗確認、今のコンクリート作業に問題がないかの判断に加え、人員不足を1週間前から知らせて派遣会社への連絡を促すといった使い方も挙げられている。VSSが前提になれば、仕事や教育のやり方から変わる、と太郎氏は述べる。

さらに太郎氏は、清水建設自身が自社を過小評価しているとも指摘する。RAGで強化した「清水建設モデル」のVSSを全国の建設現場に売れば、サービタイゼーション企業になれるポテンシャルがある、という見方である。

ジェンスン・フアンの発言の意図

太郎氏は、北京で撮影したロボットの写真を示しながら、「動くロボットこそフィジカルAI」という理解は違うと繰り返す。国内の展示会だけを見ていると、Unitreeが映っていてすごい、という感想しか出てこない、と手厳しい。ジェンスン・フアン氏はロボット工学に言及しているが、動きのある企業、ものづくり企業はすべてフィジカルAI企業になる、という趣旨の発言もしている、と太郎氏は解釈する。工作機械や産業用ロボットだけでなく、コマツやクボタが得意とする建設機械、新幹線などもVSSを適用すれば、サービスのレベルを一段上げられるというのが太郎氏の主張だ。

ドクターイエローの引退と交通インフラへの応用

鉄道の例として、太郎氏はドクターイエローの引退を挙げる。ニュースでは涙の別れとして報じられたが、実際には既存の営業車両でドクターイエロー以上の監視ができるようになったから不要になったのだ、と太郎氏は解釈している。ネット上の公開情報によれば、車輪まわりにはIMU(慣性計測ユニット)などのセンサーが多数付いており、パンタグラフもカメラで見てトロリー線の摩耗具合がわかるようになっているという。

太郎氏は、1編成の新幹線だけで考えてはいけないと述べる。川崎重工や日立は鉄道・交通システムをグローバルに展開している。そのすべての交通システムにVSSを載せ、各種センサーや映像の情報を統合すれば、オペレーションルームで「この車両は保守のタイミングに入った」と判断し、最適な保守や部品供給ができるようになる。VSSを提供できる交通インフラ企業とできない企業の間には大きな差がつき、製造業のレベルを一段上げられる、というのが太郎氏の見立てである。

NVIDIAはすでにVSSの活用例を公開しており、バスケットボールの試合の状況説明や、風力発電所での作業員の安全確認などが紹介されている。風力発電の例では、「作業員は安全ハーネスでしっかり固定されている」「極端な気象条件などの環境上の危険はない」「保護具の使用に明らかな不備は見られない」といった文章が生成される。

トヨタとInvisible AI:製造現場ではすでに使われている

製造現場での導入例として、太郎氏はInvisible AIを紹介する。トヨタがオンプレミス、オフラインの環境でVSSを完結させたという事例である。動きのデータを処理し、高ストレスで怪我につながりそうな作業員を特定したり、特定工程でのパーツ取りに2秒のタイムロスが出ていることを見つけたりといった使い方について、太郎氏は「ここから想像」と前置きしたうえで、こういうことができるだろうと述べている。トヨタ以外にフォードやGMも導入しているとホームページに書かれていた、とも紹介する。Invisible AIはNVIDIAの招待講演でもVSSを積極的に使っていると語っており、製造現場での利用はすでに始まっている、と太郎氏は述べる。

組み合わせ次第の活用:切削条件の最適化

太郎氏は「あとは組み合わせ次第」だと強調し、自身の構想を示す。以前の動画で扱ったNCクラウドのサービスでは、CADモデルをアップロードすると、1分もたたないうちに生成AIがGコードを出力した。CADモデルからクラウド上でCAMを生成し、実際に切削して測定し、フィードバックをかければ、切削コードの最適化が加速度的に進む。

ここにVSSを組み合わせる、というのが太郎氏の提案だ。切削工具のCADデータ、材質の合金やコーティング、工作機械や三次元測定機の機器情報をRAGで構築し、さらに振動データを実際に取得してフィジカルなデータとして統合する。そうすれば切削条件やCAMを最適化できるのではないか、と太郎氏は述べる。これは実証済みの事例ではなく、可能性として示された活用アイデアである。

なぜ日本はフィジカルAIに賭けるべきか

太郎氏は、日本はフィジカルAIに全力を注ぐべきだと主張し、その理由を国際競争の構図から説明する。AI競争は、巨額の営業利益を上げるGAFAMのような米国の巨大テック企業と、それを迎え撃つ中国企業の争いになっている。中国企業の背後には国がついている。太郎氏の説明では、DeepSeekはもともと金融テック企業で、余った計算リソースで生成AIを作った。そのDeepSeekに6月3日、中国の半導体ファンドが出資し、DeepSeekでさえ中国政府側になったという。それを見たトランプ大統領も、米国もメガテックの株を買うべきではないかという反応を示している、と太郎氏は述べる。

投資規模も桁が違う。太郎氏によれば、Alphabetが発表した2026年の年間設備投資は1750億ドル、日本円で約26兆円に達する。一方、日本がAIに付けている予算は3年で1兆円程度にとどまる。太郎氏は、高齢者向けの支出を優先する政治構造への不満も口にしている。米国側の動き(字幕では「ミトス」やClaudeの使用停止に言及)を受けて、日本もガバメントAIを持つしかないという判断になるかもしれないとしつつ、日本はAIのすべての領域で戦える土俵に立てていない、と太郎氏は見る。だからこそ選択と集中が必要だという。

その根拠として太郎氏が挙げるのが、経済産業省の方針である。報道によれば、政府はAI・半導体を戦略分野に指定して官民投資の工程表を作成しており、その案ではフィジカルAIについて、2040年に世界市場の3割、約20兆円の市場を獲得する目標を掲げている。太郎氏は、国が方向性を示して資金も付けると言っている以上、日本で勝ち筋が残っているのはまだ力のある製造業であり、国もそこに賭けた、と解釈する。そして、新聞記事を眺めているだけでなく、自社の製造業をフィジカルAIで強化しようと思えるかどうかの瀬戸際だと訴える。

イノベーションは要素技術の統合で起きる

太郎氏は、半年前の動画で紹介したNVIDIAのロボットデモを振り返る。「ヘルシーなものを取ってきて」とプロンプトで指示すると、ロボットが歩いて自動販売機のある場所へ行き、カメラで確認してヘルシーそうなものを選び、戻ってきて人に渡す。周囲の人たちは笑って見ていたという。

これはフィジカルAIの中のロボットという一分野の例だが、太郎氏はここに複数の技術の統合を見ている。30軸以上あるロボットをモーションコントローラーのラダーで制御するのは無理なので、デジタルツイン上で何万回も動作を繰り返して多軸の運動制御を育てる。チャットボットのインターフェースとロボットをつなぎ、どこに目的の物がありそうかを知るためにデジタルツインを読み込み、カメラの画像認識で「どれがヘルシーか」を判断する。異なる技術要素を統合して新しい価値を生むのがイノベーションの99%以上だ、と太郎氏は述べる。VSSを取り入れて清水建設のように次の段階に進めるかどうかも同じ話だ、という位置付けである。

AIの進化は断続的で、ゴールポストが動く

なぜAIの将来は読みにくいのか。太郎氏は、自動車産業のように「この技術は5年後に実現するから、それに合わせて開発する」という世界で日本企業は生きてきたと述べ、AIの進化の速さと比べる。太郎氏の整理では、GPT-3の登場が2020年頃、ChatGPT(GPT-3.5)による汎用チャットの爆発的普及が2022年、テキスト・画像・音声・コードを同時に扱うマルチモーダル化が2023年、Soraのような動画生成AIが2024年、そして2025年は自律的なエージェントの時代になっている。

新しい方法論が次々と出てくるため、キャッチアップは難しい。目標を設定して開発を進めても、2年後には新しい技術が出てゴールポストがずれ、そのイノベーションを取り入れなければゴールできなくなる。走りながら技術をつなぎ、ソリューションやプロダクトを出し続けなければならない、と太郎氏は述べる。それでもやらなければその時点で負けが確定する、として、展示会を見て感心しているだけの姿勢を強い言葉で批判している。

PLMの進化と日立の宣言、そして結論

太郎氏は、自身の専門であるPLMについても触れる。VSSを適用したPLMシステムの紹介があり、マルチモーダル化によって設計や企画の進め方も大きく変わるはずだという。この内容は別の動画で公開するとしている。太郎氏自身もPLMコンサルタントとして事業を行っており、数年後にどうなるかを想像しながら事業を進めていると語る。

また、日立がフィジカルAIに全力で取り組むと宣言したことにも触れ、日立のように変革しなければ大きく後れを取ることがはっきりした、と述べる。デフレ期には資金を残しておけば評価されたが、インフレの今はリスクを取って投資し、新しいプロダクトを出してマーケティングし、かつての日本企業のように良いものをどんどん出していかなければ負ける、というのが太郎氏の主張だ。

太郎氏の結論は、フィジカルAIは名前からヒューマノイドや産業用ロボットのような「身体を持つAI」を連想されがちだが、実際には製造業全体が対象だ、というものである。これに気づけない経営者は脱落していくだろう、と太郎氏は締めくくっている。VSSを適用したPLMがどう変わるのかは、次回の動画で扱う予定とされている。