AI時代を見据えた研究データ基盤をどう支えるか:大学・NII・ベンダーが語るストレージ戦略とRDM支援

YouTubeで開く ↗
概要

学術情報基盤オープンフォーラム2026で、AXIES RDM部会との合同セッション「RDMのためのストレージ基盤の現状と課題」の締めくくりとしてパネル討論が行われた。モデレータは京都大学の渥美紀寿氏が務めた。パネリストは、同セッションで事例を紹介した国立情報学研究所(NII)の下山武司氏、東北大学の中村隆喜氏、大阪大学の甲斐尚人氏の3人に、ストレージベンダーNetAppの脇昌弘氏を加えた4人である。

16分で読めます

討論の論点は3つあった。予算や人員に余裕のない大学も含めて研究データの保存環境をどう整えるか。各機関が個別に作っているRDM(研究データ管理)支援サービスを機関の枠を越えて共有できるか。そして「AI for Science」の時代にRDMをどう広げるか。パネリストの意見は、単独の大学で抱え込まず、複数の機関で共同運用することと、メタデータの整備をAIの支援で進めることの2点でおおむね一致した。一方で、予算、権利関係、データ利用の制御については、具体的な解決策はまだ出ていない。

脇氏の問題提起:AIが自ら動き出すとき、今のRDMで足りるのか

討論の前に、脇氏が1枚のスライドで短く問題提起をした。脇氏は2019年にAXIESのRDM部会に加わり、それから8年間在籍している。以前はソニーでストレージ事業に携わり、HPやIBMへのOEM供給や海外での事業開発も経験した。

脇氏によると、この話はもともとストレージソリューションカタログを作る過程で書き始めたものだが、まず議論の場を設けたほうがよいと考えて持ち込んだという。参加者の多くはすでにChatGPT、Claude、Geminiなどを使っているだろうし、最近はClaude CodeやCodexもかなり優秀になっている。脇氏は、AIのない世界にはもう戻らないとの見方を示した。

そのうえで脇氏は、現在のRDMの中心にあるのは、データの保存、保護、所在の管理、再現性など、人が理解するための仕組みだと整理した。AIが自律的に動き出すなら、それだけで十分なのかと脇氏は問う。データの管理から一歩進んで、知識基盤をどう管理するかへ広げる必要がある。AI自身が発見し、理解し、再利用できる「AIレディなデータ」、つまり「AIレディなRDM」が求められるのではないか、というのが脇氏の視点である。

脇氏はさらに、学術に限らず民間でも、AIプロジェクトの6〜7割はうまくいっていないと述べ、最大の原因はデータが「レディ」になっていないことだとした。だからこそ基盤を担う人々にとってRDMは今後いっそう重要になる、というのが脇氏の主張である。

論点1:地方・小規模大学を含めたストレージ整備

渥美氏はまず、ストレージ戦略の論点を整理した。一部の研究機関では、ストレージを使ったサービスが研究活動の中心になりつつある。一方で、地方大学や小規模大学など予算に余裕のないところでは、そもそも基盤が整っていない場合がある。

整備が進んでいる大学にも課題は残っている。渥美氏がとくに強調したのは、継続的な維持・更新のための予算である。現在整備できている機関でも一時的な予算措置で賄っているにすぎず、今後も維持できるかはまだわからない。遠隔バックアップを考えれば必要な容量はさらに増える。データを保護するには、本体と同じものではなく、別の機能を持つストレージ基盤が必要になることもある。多様な研究者を抱える機関では、さまざまな用途に対応できる仕組みが求められる。こうした状況を踏まえて、渥美氏は地方大学も含めた保存・蓄積環境を今後どうしていくべきかを各パネリストに尋ねた。

甲斐氏:保存のコストを経営層に説明することと、近隣大学との共同運用

甲斐氏は、自分はストレージを導入する側ではなく利用する側だと前置きしたうえで、学ぶうちに認識が変わったことを話した。データ量が小さかった頃なら、ハードディスクを組み合わせてRAIDを組めば済むと思っていた。しかし、データが大量になると、1台が故障したあとの復旧に時間がかかり、その間に残りのディスクまで壊れればデータを復元できなくなる。そうした話を聞いて、データを保存するにはそれなりの予算が必要だと改めて認識したという。

そのため甲斐氏は、この事情をかみ砕いて大学の幹部に理解してもらえるように説明することが大きな課題だと考えている。あわせて、近隣の大学とのストレージの相互運用・共有をちょうど始めようとしているところだと明かした。用意できる大学とできない大学は必ず出てくる。中心となる大学が周辺の大学を支援する形もありうる、というのが甲斐氏の見方である。

中村氏:グループ単位の共同運用と、グループ間でのデータの持ち合い

中村氏も甲斐氏とほぼ同じ意見だと断ったうえで、小規模な大学が自前のストレージを整備するのは、予算の面でも、運用する人員の面でも非常に難しいと述べた。中村氏が自身の発表でも触れた「分散化と集中化」の議論に沿って言えば、ある程度のグループで共同運用するのが一つの選択肢になる。どのグループにも加われない大学については、NIIが中心となって受け皿になればよく、現在のGakuNin RDMもそうした形になっているはずだ、と中村氏は個人的な考えとして話した。

データ保護については、共同運用のグループがいくつかできたら、グループ同士でデータを持ち合って保護できるとよいと中村氏は述べた。その中にはNIIも含まれると考えており、そうすることで共通のエコシステムを作れればよいという。

下山氏:GakuNin RDMは220機関超が利用、機関ストレージを独自に設けるのは一桁

全国の大学にサービスを提供する立場から、下山氏はGakuNin RDMの現状を説明した。現在、220を超える機関が利用している。GakuNin RDMでは、機関が用意する「機関ストレージ」、NIIが提供する「標準ストレージ」、プロジェクトや個人ごとに用意する「拡張ストレージ」を使い分けられる。ただし、機関ストレージを独自に設定している機関はまだ一桁程度で、大半はNIIのストレージを使っている。

下山氏は、ある程度の研究活動であればGakuNin RDMで研究データ管理を賄えるとの考えを示した。ただ、大学やプロジェクトの事情によってはそれでは足りないという声も届いている。NIIの財源も無限ではないため、サービスとしては全体に提供できる部分に集中せざるをえない。そこから漏れる需要については、各大学やプロジェクトが拡張ストレージを接続して賄うという方針だという。下山氏は、GakuNin RDMを土台に各機関の研究データ管理が円滑に回る環境を提供していきたいと述べた。

脇氏:SSD値上がり下での階層化と、論理分割されたデータレイク

ベンダーの立場から、脇氏は2点を挙げた。1つ目はデータの階層化である。SSDの値上がりが続いている。そのため、頻繁に使うデータと使わないデータを区別し、使い方に応じて置き場所を変える。高頻度で高速なアクセスが必要なものはSSDに、そうでないものはHDDなど低コストの媒体に置き、場合によってはディープアーカイブも使う。こうした配置を自動化して管理することが一つの手だという。

2つ目は、甲斐氏と中村氏が挙げた共通化に関わる話である。大きなデータレイクを作って論理的に分割し、各利用者がそれぞれの区画を管理しながら使うやり方が、産業界でも広がっていると脇氏は紹介した。日本では人口動態が変わりつつあることもあり、ストレージに限らず、単独では調達が難しいGPUもまとめて共同で持とうという動きがあるという。脇氏は、こうした取り組みには技術面で支援できると述べた。

モデレータの整理

渥美氏は、解決法はいろいろあるものの、共同運用にもさまざまな課題が出てくるので簡単ではないと受けた。そのうえで、全国に地域ごとのコンソーシアムができつつあることを挙げ、その中で議論しながら最適なやり方を探っていくことになるとの見通しを示した。NIIのサービスやストレージの共同調達なども活用し、コストを抑えながら複数の機関で協力する環境を作らなければ、個別の大学だけで維持するのはつらい状況になっている、と渥美氏は第1の論点を締めくくった。

論点2:RDM支援サービスを機関の枠を越えて共有できるか

2つ目の論点について、渥美氏は現状をこう整理した。GakuNin RDMや各機関のRDM関連の管理サービスとストレージとの連携は進んでいる。しかし、サービス同士がシームレスに連携しているとは言いがたい。研究のライフサイクルに沿ったワークフローも一応はできているが、細かいところまで行き届かない。

メタデータの問題も大きいと渥美氏は指摘する。必要なのは、研究報告のためのメタデータやデータ公開時のメタデータだけではない。データがどこから生まれ、どう処理され、どんな結果に至ったかという過程のメタデータも要る。ところが、この部分はほとんど自動化されておらず、研究者が手で記録しなければならない。記録を忘れて問題が起きることもある。研究者が意識しなくてもデータが残っていく仕組みと、研究者にとって使いやすいサービスがなければ、こうした活動は広がらない、というのが渥美氏の問題意識である。

現状では、各機関がNIIのサービスを使いつつ、独自にサービスを構築して学内の研究者に提供している。しかし、開発できる人材も協力できるベンダーも限られており、運用サポートの人員にも費用がかかる。渥美氏が具体例として挙げたのは、今回事例を紹介した京大、阪大、東北大がいずれも同じNextcloudを使っているにもかかわらず、その上に作ったアプリケーションはまったく共有できていないことだった。Nextcloudではプラグインとして機能を開発できるので、連携できる部分は共有するのも一つの手である。オープンソースの活用も含めて、機関をまたいだサービス展開やツールの共有の可能性について、渥美氏は各パネリストに意見を求めた。

甲斐氏:ONIONは閉じたサービスではなく「ゲートウェイ」

甲斐氏は、大阪大学が運用するONIONについて、もともと学内に閉じたストレージとして作ったものではなく、閉じる必要もないと考えていると述べた。ONIONはゲートウェイとしての役割を意識している。データが集まれば、共同利用の基盤であるスーパーコンピュータにつながっているのですぐに解析できる。コアファシリティの測定データを集約して共同研究者と共有することもできる。このように各研究機関とつながることを意識しており、その中核になっているのがS3だという。甲斐氏は、機関をまたいだ展開の可能性は大いにあると考えている。

中村氏:事例共有にはすでに価値があるが、横展開には権利の壁がある

中村氏はまず、各大学がどんな取り組みをしているかという考え方自体は、このような場ですでに共有できており、それだけでも価値があると述べた。東北大学の取り組みはAXIESの論文誌でも発表されており、ONIONについても論文誌で共有されていたはずだとして、各大学の先行事例を参考にしてもらえるとの考えを示した。

一方で、各大学が開発した機能そのものを横展開するには権利関係が絡むと中村氏は指摘した。たとえば保守ベンダーが開発したものは、そのまま他大学に渡すのは難しいだろう。東北大学は内製にこだわっており、自分たちでできることは自分たちで開発している。中村氏が自身の発表で紹介した申請フォームについても、製品に近い部分はベンダーに頼まざるをえないが、境界となるポイントを決めて、大学側でもかなりの部分を開発しているという。ただし、それが共有の機会につながるかどうかはわからないと中村氏は留保した。

個別の例として中村氏が挙げたのは、コアファシリティとの連携である。この分野では阪大と東大が先行していると中村氏は認識しており、東北大学としては課題意識を持っている。このパネルの前にも甲斐氏と少し話をしたといい、少なくとも考え方については議論し、一緒にできることは進めたいと述べた。

下山氏:大多数の大学には「何のためのデータ管理か」から説明が要る

下山氏は、京大、阪大、東北大のように個別の事情に合わせて研究データ管理を進めている事例は先進的でありがたいとしたうえで、NIIとしてはそれ以外の大多数の大学にも目を向けなければならないと述べた。そうした大学では、研究データ管理そのもののモチベーションを高める必要がある。実際、何のためにデータ管理をするのかと説明を求められることがよくあるという。

その説明にあたって、下山氏はオープンサイエンスの原点に立ち返り、研究成果の利活用という観点から考えたいとした。研究データを利活用するには、データを貯めるだけでなく、その先のリポジトリ登録まで視野に入れる必要がある。NIIはいま、ローカルなデータをオープンなデータへつなぐ橋渡しに取り組んでいるという。下山氏は宣伝と断ったうえで、クローズドなデータをオープンにするためのGakuNin RDMとJAIRO Cloudの連携を扱うセッションを翌日に開くと案内した。

脇氏:AXIESで合意を形成し、実装は企業が支える形を

脇氏は、ストレージベンダーとしてではなく、民間企業も参加するAXIESという場の意義に触れて話した。NetAppはアメリカの会社で外資系なので、保守などを直接長く続けることはできない。そこで脇氏が提案したのは、AXIESである程度の合意を形成し、ポリシーや運用はアカデミアが主導し、実装技術を企業が支えるという役割分担である。そこには日本の企業にも加わってほしいという。

例として脇氏は、研究者がDMP(データマネジメントプラン)の作成などに余計な労力を取られているのであれば、大きなデータレイクにデータを置いておくだけで、システム側がフォーマットに沿ってある程度作ってくれる、といった双方にとってメリットのある仕組みを挙げた。こうした要望をAXIESのような場で総意としてまとめ、文部科学省やベンダーに作れないか相談するようにすれば、物事がもっと前に進むのではないか、と脇氏は述べた。

渥美氏は、権利関係の問題も当然出てくるので、機関間での共有は簡単にはいかないと受けた。そのうえで、どう進めるべきかは今後も継続して議論したいとまとめた。

論点3:AI for Science時代のRDM支援

最後の論点は、脇氏の冒頭の問題提起を受けて、AI for Science時代のRDM支援として何ができるかである。

甲斐氏:データの質と、公開後の「制御」の問題

甲斐氏は、何ができるかというより考えなければならないこととして、AIレディなデータには、データを貯めること、貯める際に適切なメタデータが付いているかといった質、そして集めたデータに対する制御の3つが必要だと述べた。

制御の例として甲斐氏が挙げたのは、最近知ったという人文系データの話である。データを公開すると、AIは公開されたデータをどんどん取り込む。公開者が意図してライセンスを付けていても、そのライセンスが外れたまま「AIのご飯」として使われていくことがある。甲斐氏はこれを課題として認識したと話した。AIレディなデータを作る際に考えるべきことは、学ぶたびに新たに出てくるという。甲斐氏自身、答えにはなっていないと断ったうえでの発言だった。

中村氏:AIレディにするにはAIが要るという「鶏と卵」

中村氏は、この問いは個人的には「鶏と卵」だと述べた。データをAIレディにするには、そもそもAIを活用しなければならない。たとえばセッション中に何度か話題に出たメタデータ付与の自動化のように、AIを使ってデータをAIレディにするところから始める必要があるという。

甲斐氏の話に重なる点として、中村氏はアクセス制御の設定にもAIの支援がほしいと述べた。コンテンツの中身に基づいて、このコンテンツならこういうアクセス制御がよい、と提案してくれるようなものである。それが実現した先にデータカタログのようなものができてくるとよいが、やはり鶏と卵の関係になっている、と中村氏は話した。まとまりのない話で申し訳ないとも付け加えた。

下山氏:出自やライセンスが書かれていなければ「使えるものも使えない」

下山氏は、AIにデータをどう渡すかを考えるとき、データについての情報であるメタデータと、それを付与する仕組みの重要性が一層高まっていると述べた。ライセンスはもちろん、元データがどこにあるのか、そもそも誰が作ったのかがきちんと記載されていなければ、使えるものも使えない。研究データ管理をきちんと行わなければ、正確で使えるAIにはならないだろう、というのが下山氏の考えである。

AI時代のRDMとは、具体的にはメタデータをどう付けていくかという問題であり、AIの進化は速いので、人間がいちいち入力するのではなくAIに支援してもらうことを十分に視野に入れて進めたいと下山氏は述べた。例として、フォーラム初日に黒橋所長が紹介したNIIのLLM-jpの話の中に、メタデータの自動付与の事例があったことを挙げ、こうした技術が進めばAI for Scienceに使いやすいデータになっていくとの見方を示した。

脇氏:ガバナンス、分散データの安全な連携、AIによるRDM作業の自動化

最後に、問題提起をした脇氏が議論をまとめた。AIの進展は待ったなしである。人口が変わり人手が足りない中でデータを管理していくには、AIをうまく使っていくしかない。そのためにはまずデータを整える必要があり、何でもAIに食べさせてはいけないという面もあるので、ガバナンスを含めた基盤整備が非常に大事だと脇氏は述べた。

脇氏が挙げたのは3点である。第一に、機械やAIがそのまま理解できるデータであること。第二に、AIがアクセスできる基盤である。データは研究室、HPC、クラウド、外部機関などにまだ分散しているため、それらをAIが横断的に使えるように、データ連携、メタデータ連携、ID/PIDによる紐付けなどを通じて安全につなぐことが本質的に大事だという。第三に、AIで高度化したRDM支援である。DMPやメタデータの品質管理といった負荷の高い作業のうち、人ができないことをAIに担ってもらえば、研究者はもっと研究に没頭でき、支援する側も楽になる。そのための基盤を整えることが重要であり、そのための技術はさまざまな形で出てきている、と脇氏は締めくくった。

結び:AIの進化は読めないが、自動化と科学への貢献に向けて

終了時刻の合図が出たため、渥美氏が議論を閉じた。AIの活用はこれから必要になるが、どう進化するかは読めない。そのうえで、うまく使ってさまざまな自動化を実現し、科学の発展に貢献できるようにしたいと渥美氏は述べた。議論はまだ尽きないとしながら、パネルはここで終了した。

予算の継続的な確保、共同運用の具体的な形、開発成果を共有する際の権利関係、AIに渡すデータのライセンスとアクセス制御、そしてAIレディなデータを作るためにAIが要るという「鶏と卵」の問題は、いずれも今後の議論に委ねられた。