AI時代を見据えた研究データ基盤をどう支えるか:大学・NII・ベンダーが語るストレージ戦略とRDM支援
国立情報学研究所 - National Institute of Informatics学術情報基盤オープンフォーラム2026で、AXIES RDM部会との合同セッション「RDMのためのストレージ基盤の現状と課題」の締めくくりとしてパネル討論が行われた。モデレータは京都大学の渥美紀寿氏が務めた。パネリストは、同セッションで事例を紹介した国立情報学研究所(NII)の下山武司氏、東北大学の中村隆喜氏、大阪大学の甲斐尚人氏の3人に、ストレージベンダーNetAppの脇昌弘氏を加えた4人である。
討論の論点は3つあった。予算や人員に余裕のない大学も含めて研究データの保存環境をどう整えるか。各機関が個別に作っているRDM(研究データ管理)支援サービスを機関の枠を越えて共有できるか。そして「AI for Science」の時代にRDMをどう広げるか。パネリストの意見は、単独の大学で抱え込まず、複数の機関で共同運用することと、メタデータの整備をAIの支援で進めることの2点でおおむね一致した。一方で、予算、権利関係、データ利用の制御については、具体的な解決策はまだ出ていない。
脇氏の問題提起:AIが自ら動き出すとき、今のRDMで足りるのか
討論の前に、脇氏が1枚のスライドで短く問題提起をした。脇氏は2019年にAXIESのRDM部会に加わり、それから8年間在籍している。以前はソニーでストレージ事業に携わり、HPやIBMへのOEM供給や海外での事業開発も経験した。
脇氏によると、この話はもともとストレージソリューションカタログを作る過程で書き始めたものだが、まず議論の場を設けたほうがよいと考えて持ち込んだという。参加者の多くはすでにChatGPT、Claude、Geminiなどを使っているだろうし、最近はClaude CodeやCodexもかなり優秀になっている。脇氏は、AIのない世界にはもう戻らないとの見方を示した。
そのうえで脇氏は、現在のRDMの中心にあるのは、データの保存、保護、所在の管理、再現性など、人が理解するための仕組みだと整理した。AIが自律的に動き出すなら、それだけで十分なのかと脇氏は問う。データの管理から一歩進んで、知識基盤をどう管理するかへ広げる必要がある。AI自身が発見し、理解し、再利用できる「AIレディなデータ」、つまり「AIレディなRDM」が求められるのではないか、というのが脇氏の視点である。
脇氏はさらに、学術に限らず民間でも、AIプロジェクトの6〜7割はうまくいっていないと述べ、最大の原因はデータが「レディ」になっていないことだとした。だからこそ基盤を担う人々にとってRDMは今後いっそう重要になる、というのが脇氏の主張である。
論点1:地方・小規模大学を含めたストレージ整備
渥美氏はまず、ストレージ戦略の論点を整理した。一部の研究機関では、ストレージを使ったサービスが研究活動の中心になりつつある。一方で、地方大学や小規模大学など予算に余裕のないところでは、そもそも基盤が整っていない場合がある。
整備が進んでいる大学にも課題は残っている。渥美氏がとくに強調したのは、継続的な維持・更新のための予算である。現在整備できている機関でも一時的な予算措置で賄っているにすぎず、今後も維持できるかはまだわからない。遠隔バックアップを考えれば必要な容量はさらに増える。データを保護するには、本体と同じものではなく、別の機能を持つストレージ基盤が必要になることもある。多様な研究者を抱える機関では、さまざまな用途に対応できる仕組みが求められる。こうした状況を踏まえて、渥美氏は地方大学も含めた保存・蓄積環境を今後どうしていくべきかを各パネリストに尋ねた。
甲斐氏:保存のコストを経営層に説明することと、近隣大学との共同運用
甲斐氏は、自分はストレージを導入する側ではなく利用する側だと前置きしたうえで、学ぶうちに認識が変わったことを話した。データ量が小さかった頃なら、ハードディスクを組み合わせてRAIDを組めば済むと思っていた。しかし、データが大量になると、1台が故障したあとの復旧に時間がかかり、その間に残りのディスクまで壊れればデータを復元できなくなる。そうした話を聞いて、データを保存するにはそれなりの予算が必要だと改めて認識したという。
そのため甲斐氏は、この事情をかみ砕いて大学の幹部に理解してもらえるように説明することが大きな課題だと考えている。あわせて、近隣の大学とのストレージの相互運用・共有をちょうど始めようとしているところだと明かした。用意できる大学とできない大学は必ず出てくる。中心となる大学が周辺の大学を支援する形もありうる、というのが甲斐氏の見方である。
中村氏:グループ単位の共同運用と、グループ間でのデータの持ち合い
中村氏も甲斐氏とほぼ同じ意見だと断ったうえで、小規模な大学が自前のストレージを整備するのは、予算の面でも、運用する人員の面でも非常に難しいと述べた。中村氏が自身の発表でも触れた「分散化と集中化」の議論に沿って言えば、ある程度のグループで共同運用するのが一つの選択肢になる。どのグループにも加われない大学については、NIIが中心となって受け皿になればよく、現在のGakuNin RDMもそうした形になっているはずだ、と中村氏は個人的な考えとして話した。
データ保護については、共同運用のグループがいくつかできたら、グループ同士でデータを持ち合って保護できるとよいと中村氏は述べた。その中にはNIIも含まれると考えており、そうすることで共通のエコシステムを作れればよいという。
下山氏:GakuNin RDMは220機関超が利用、機関ストレージを独自に設けるのは一桁
全国の大学にサービスを提供する立場から、下山氏はGakuNin RDMの現状を説明した。現在、220を超える機関が利用している。GakuNin RDMでは、機関が用意する「機関ストレージ」、NIIが提供する「標準ストレージ」、プロジェクトや個人ごとに用意する「拡張ストレージ」を使い分けられる。ただし、機関ストレージを独自に設定している機関はまだ一桁程度で、大半はNIIのストレージを使っている。
下山氏は、ある程度の研究活動であればGakuNin RDMで研究データ管理を賄えるとの考えを示した。ただ、大学やプロジェクトの事情によってはそれでは足りないという声も届いている。NIIの財源も無限ではないため、サービスとしては全体に提供できる部分に集中せざるをえない。そこから漏れる需要については、各大学やプロジェクトが拡張ストレージを接続して賄うという方針だという。下山氏は、GakuNin RDMを土台に各機関の研究データ管理が円滑に回る環境を提供していきたいと述べた。
脇氏:SSD値上がり下での階層化と、論理分割されたデータレイク
ベンダーの立場から、脇氏は2点を挙げた。1つ目はデータの階層化である。SSDの値上がりが続いている。そのため、頻繁に使うデータと使わないデータを区別し、使い方に応じて置き場所を変える。高頻度で高速なアクセスが必要なものはSSDに、そうでないものはHDDなど低コストの媒体に置き、場合によってはディープアーカイブも使う。こうした配置を自動化して管理することが一つの手だという。
2つ目は、甲斐氏と中村氏が挙げた共通化に関わる話である。大きなデータレイクを作って論理的に分割し、各利用者がそれぞれの区画を管理しながら使うやり方が、産業界でも広がっていると脇氏は紹介した。日本では人口動態が変わりつつあることもあり、ストレージに限らず、単独では調達が難しいGPUもまとめて共同で持とうという動きがあるという。脇氏は、こうした取り組みには技術面で支援できると述べた。
モデレータの整理
渥美氏は、解決法はいろいろあるものの、共同運用にもさまざまな課題が出てくるので簡単ではないと受けた。そのうえで、全国に地域ごとのコンソーシアムができつつあることを挙げ、その中で議論しながら最適なやり方を探っていくことになるとの見通しを示した。NIIのサービスやストレージの共同調達なども活用し、コストを抑えながら複数の機関で協力する環境を作らなければ、個別の大学だけで維持するのはつらい状況になっている、と渥美氏は第1の論点を締めくくった。
論点2:RDM支援サービスを機関の枠を越えて共有できるか
2つ目の論点について、渥美氏は現状をこう整理した。GakuNin RDMや各機関のRDM関連の管理サービスとストレージとの連携は進んでいる。しかし、サービス同士がシームレスに連携しているとは言いがたい。研究のライフサイクルに沿ったワークフローも一応はできているが、細かいところまで行き届かない。
メタデータの問題も大きいと渥美氏は指摘する。必要なのは、研究報告のためのメタデータやデータ公開時のメタデータだけではない。データがどこから生まれ、どう処理され、どんな結果に至ったかという過程のメタデータも要る。ところが、この部分はほとんど自動化されておらず、研究者が手で記録しなければならない。記録を忘れて問題が起きることもある。研究者が意識しなくてもデータが残っていく仕組みと、研究者にとって使いやすいサービスがなければ、こうした活動は広がらない、というのが渥美氏の問題意識である。
現状では、各機関がNIIのサービスを使いつつ、独自にサービスを構築して学内の研究者に提供している。しかし、開発できる人材も協力できるベンダーも限られており、運用サポートの人員にも費用がかかる。渥美氏が具体例として挙げたのは、今回事例を紹介した京大、阪大、東北大がいずれも同じNextcloudを使っているにもかかわらず、その上に作ったアプリケーションはまったく共有できていないことだった。Nextcloudではプラグインとして機能を開発できるので、連携できる部分は共有するのも一つの手である。オープンソースの活用も含めて、機関をまたいだサービス展開やツールの共有の可能性について、渥美氏は各パネリストに意見を求めた。
甲斐氏:ONIONは閉じたサービスではなく「ゲートウェイ」
甲斐氏は、大阪大学が運用するONIONについて、もともと学内に閉じたストレージとして作ったものではなく、閉じる必要もないと考えていると述べた。ONIONはゲートウェイとしての役割を意識している。データが集まれば、共同利用の基盤であるスーパーコンピュータにつながっているのですぐに解析できる。コアファシリティの測定データを集約して共同研究者と共有することもできる。このように各研究機関とつながることを意識しており、その中核になっているのがS3だという。甲斐氏は、機関をまたいだ展開の可能性は大いにあると考えている。
中村氏:事例共有にはすでに価値があるが、横展開には権利の壁がある
中村氏はまず、各大学がどんな取り組みをしているかという考え方自体は、このような場ですでに共有できており、それだけでも価値があると述べた。東北大学の取り組みはAXIESの論文誌でも発表されており、ONIONについても論文誌で共有されていたはずだとして、各大学の先行事例を参考にしてもらえるとの考えを示した。
一方で、各大学が開発した機能そのものを横展開するには権利関係が絡むと中村氏は指摘した。たとえば保守ベンダーが開発したものは、そのまま他大学に渡すのは難しいだろう。東北大学は内製にこだわっており、自分たちでできることは自分たちで開発している。中村氏が自身の発表で紹介した申請フォームについても、製品に近い部分はベンダーに頼まざるをえないが、境界となるポイントを決めて、大学側でもかなりの部分を開発しているという。ただし、それが共有の機会につながるかどうかはわからないと中村氏は留保した。
個別の例として中村氏が挙げたのは、コアファシリティとの連携である。この分野では阪大と東大が先行していると中村氏は認識しており、東北大学としては課題意識を持っている。このパネルの前にも甲斐氏と少し話をしたといい、少なくとも考え方については議論し、一緒にできることは進めたいと述べた。
下山氏:大多数の大学には「何のためのデータ管理か」から説明が要る
下山氏は、京大、阪大、東北大のように個別の事情に合わせて研究データ管理を進めている事例は先進的でありがたいとしたうえで、NIIとしてはそれ以外の大多数の大学にも目を向けなければならないと述べた。そうした大学では、研究データ管理そのもののモチベーションを高める必要がある。実際、何のためにデータ管理をするのかと説明を求められることがよくあるという。
その説明にあたって、下山氏はオープンサイエンスの原点に立ち返り、研究成果の利活用という観点から考えたいとした。研究データを利活用するには、データを貯めるだけでなく、その先のリポジトリ登録まで視野に入れる必要がある。NIIはいま、ローカルなデータをオープンなデータへつなぐ橋渡しに取り組んでいるという。下山氏は宣伝と断ったうえで、クローズドなデータをオープンにするためのGakuNin RDMとJAIRO Cloudの連携を扱うセッションを翌日に開くと案内した。
脇氏:AXIESで合意を形成し、実装は企業が支える形を
脇氏は、ストレージベンダーとしてではなく、民間企業も参加するAXIESという場の意義に触れて話した。NetAppはアメリカの会社で外資系なので、保守などを直接長く続けることはできない。そこで脇氏が提案したのは、AXIESである程度の合意を形成し、ポリシーや運用はアカデミアが主導し、実装技術を企業が支えるという役割分担である。そこには日本の企業にも加わってほしいという。
例として脇氏は、研究者がDMP(データマネジメントプラン)の作成などに余計な労力を取られているのであれば、大きなデータレイクにデータを置いておくだけで、システム側がフォーマットに沿ってある程度作ってくれる、といった双方にとってメリットのある仕組みを挙げた。こうした要望をAXIESのような場で総意としてまとめ、文部科学省やベンダーに作れないか相談するようにすれば、物事がもっと前に進むのではないか、と脇氏は述べた。
渥美氏は、権利関係の問題も当然出てくるので、機関間での共有は簡単にはいかないと受けた。そのうえで、どう進めるべきかは今後も継続して議論したいとまとめた。
論点3:AI for Science時代のRDM支援
最後の論点は、脇氏の冒頭の問題提起を受けて、AI for Science時代のRDM支援として何ができるかである。
甲斐氏:データの質と、公開後の「制御」の問題
甲斐氏は、何ができるかというより考えなければならないこととして、AIレディなデータには、データを貯めること、貯める際に適切なメタデータが付いているかといった質、そして集めたデータに対する制御の3つが必要だと述べた。
制御の例として甲斐氏が挙げたのは、最近知ったという人文系データの話である。データを公開すると、AIは公開されたデータをどんどん取り込む。公開者が意図してライセンスを付けていても、そのライセンスが外れたまま「AIのご飯」として使われていくことがある。甲斐氏はこれを課題として認識したと話した。AIレディなデータを作る際に考えるべきことは、学ぶたびに新たに出てくるという。甲斐氏自身、答えにはなっていないと断ったうえでの発言だった。
中村氏:AIレディにするにはAIが要るという「鶏と卵」
中村氏は、この問いは個人的には「鶏と卵」だと述べた。データをAIレディにするには、そもそもAIを活用しなければならない。たとえばセッション中に何度か話題に出たメタデータ付与の自動化のように、AIを使ってデータをAIレディにするところから始める必要があるという。
甲斐氏の話に重なる点として、中村氏はアクセス制御の設定にもAIの支援がほしいと述べた。コンテンツの中身に基づいて、このコンテンツならこういうアクセス制御がよい、と提案してくれるようなものである。それが実現した先にデータカタログのようなものができてくるとよいが、やはり鶏と卵の関係になっている、と中村氏は話した。まとまりのない話で申し訳ないとも付け加えた。
下山氏:出自やライセンスが書かれていなければ「使えるものも使えない」
下山氏は、AIにデータをどう渡すかを考えるとき、データについての情報であるメタデータと、それを付与する仕組みの重要性が一層高まっていると述べた。ライセンスはもちろん、元データがどこにあるのか、そもそも誰が作ったのかがきちんと記載されていなければ、使えるものも使えない。研究データ管理をきちんと行わなければ、正確で使えるAIにはならないだろう、というのが下山氏の考えである。
AI時代のRDMとは、具体的にはメタデータをどう付けていくかという問題であり、AIの進化は速いので、人間がいちいち入力するのではなくAIに支援してもらうことを十分に視野に入れて進めたいと下山氏は述べた。例として、フォーラム初日に黒橋所長が紹介したNIIのLLM-jpの話の中に、メタデータの自動付与の事例があったことを挙げ、こうした技術が進めばAI for Scienceに使いやすいデータになっていくとの見方を示した。
脇氏:ガバナンス、分散データの安全な連携、AIによるRDM作業の自動化
最後に、問題提起をした脇氏が議論をまとめた。AIの進展は待ったなしである。人口が変わり人手が足りない中でデータを管理していくには、AIをうまく使っていくしかない。そのためにはまずデータを整える必要があり、何でもAIに食べさせてはいけないという面もあるので、ガバナンスを含めた基盤整備が非常に大事だと脇氏は述べた。
脇氏が挙げたのは3点である。第一に、機械やAIがそのまま理解できるデータであること。第二に、AIがアクセスできる基盤である。データは研究室、HPC、クラウド、外部機関などにまだ分散しているため、それらをAIが横断的に使えるように、データ連携、メタデータ連携、ID/PIDによる紐付けなどを通じて安全につなぐことが本質的に大事だという。第三に、AIで高度化したRDM支援である。DMPやメタデータの品質管理といった負荷の高い作業のうち、人ができないことをAIに担ってもらえば、研究者はもっと研究に没頭でき、支援する側も楽になる。そのための基盤を整えることが重要であり、そのための技術はさまざまな形で出てきている、と脇氏は締めくくった。
結び:AIの進化は読めないが、自動化と科学への貢献に向けて
終了時刻の合図が出たため、渥美氏が議論を閉じた。AIの活用はこれから必要になるが、どう進化するかは読めない。そのうえで、うまく使ってさまざまな自動化を実現し、科学の発展に貢献できるようにしたいと渥美氏は述べた。議論はまだ尽きないとしながら、パネルはここで終了した。
予算の継続的な確保、共同運用の具体的な形、開発成果を共有する際の権利関係、AIに渡すデータのライセンスとアクセス制御、そしてAIレディなデータを作るためにAIが要るという「鶏と卵」の問題は、いずれも今後の議論に委ねられた。
では、パネルの方に移らせていただきますが、このパネルのテーマとしては、今後の研究機関におけるストレージ戦略とRDM支援ということで、モデレーターは司会を兼ねて私が担当させていただきます。
パネリストとしては、事例紹介いただいた国立情報学研究所の下山先生、それから東北大学の中村先生、大阪大学の甲斐先生で、それに加えまして、ストレージベンダーでもある脇さんで、AXIESのRDM部会の一員にもなっておられますので、その中でAI・DX戦略のビジネス開発センター長も進められておりますので、AIに関する話も含めて、このパネルで色々議論できればと思っております。まず最初に、脇さんの方からショートプレゼンをしていただこうと思っております。
はい。1枚だけですけど、あ、すいません。自己紹介もなくですね、私は脇と申します。よろしくお願いします。
2018年からですよね。先生がおっしゃっていて、RDM部会が始まって、2019年に当時NIIの山地先生と名古屋大学の青木先生にお声がけいただきまして、RDM部会に入りまして、そのまま8年間ずっとおりますので、そういう意味では、こいつ見たことあるなという風に思っていただけるんじゃないかなと思います。古くはですね、前はソニーという会社で色々ストレージをやっておりまして、例えばHPとかIBMとかにもOEMで色々とメディアを出していたりとか、世界あちこちで事業開発をやっていたりとか、かなり長く携わってきておりました。
今日なぜこういう形の、これはAI for Science時代のRDMをどう拡張するかみたいな、後でパネルディスカッションの中で加えていただきたいなと思うんですけども、元々そのストレージソリューションカタログを作る時に、ある程度書き始めたりしていたんですが、皆さんとまずその議論の場を設けた上でやった方がいいのかなと思いまして。
皆さん自身もおそらく、ChatGPTだったり、Claudeだったり、Geminiだったり、いろんなAIを使われてると思います。最近ではもちろんClaude Codeにしろ、Codexも5.5が出てから非常に優秀になってきてますので、AIがない世界ってもうこれからありえないのかな、逆行はもうしないなとなってきた時に、RDMという言い方をすると、現在のRDMの中核は、データの保存とか保護とか、書籍管理とか、再現性とか、人が理解するためのものとしてあるんですけども、実際AIが自ら動き出すとなった時に、それだけで本当にいいんですか、と。
そのデータのマネジメントよりも、例えば知識基盤、これはおっしゃってましたけども、そういう知識をどうマネージしていくかというところにどう拡張していくか。その時に、AI自体が発見・理解・再利用できるデータとなってくると、AIレディなデータ、AIレディのRDMというのが必要になるんじゃないかなという視点がありまして、そこで議論を深めていきたいかなと。
今後、世界中で、もちろんこのアカデミアの業界だけでなく民間とかでもいろんなAIのプロジェクトがあるんですけど、6割も7割もそういったプロジェクトが結局うまくいっていないのはなぜかと言うと、データなんですね。データがレディになっていないというのが1番の問題だということで、そういう意味で基盤をやってらっしゃる皆さん、そのデータというのはこれからもっともっと重要になっていくと。RDMというのは、これからどんどんAIを使う中で、最重要な、皆さんが考えなきゃいけない基盤になっていくということがもう分かってますので、そういうことを議論に加えて話していければという風に思っております。すいません、ちょっと長くなりましたけど、よろしくお願いします。
脇さん、ありがとうございました。先ほどのテーマでこのパネルの討論をさせていただくんですが、討論のポイントとして3つ挙げております。特にこの3点について、パネリストの中で色々議論できればと思っております。
まず、今後のストレージ戦略に関してなんですが、先ほど事例報告もありました通り、一部の研究機関では整備が進んでいます。研究活動の中心的なサービスとして、ストレージを使ったサービスがあって、それを使って研究活動が行われる状況になってきておりますが、一方で地方大学だったり、小さい大学、予算的余裕がないところでは、そういった基盤も整備できていなかったりだとか、そういったところがあるかと思います。
それから、事例で報告した大学はストレージ環境を整備できているんですが、私の方からもあったかと思いますし、中村先生の方からもあったかと思いますが、いろんな課題が残っています。特に、継続的に維持更新するための予算確保というのは、今準備できているところでも一時的な予算措置で整備できているだけであって、それを継続的に維持できるのかというのはまだ疑問があって、各研究機関それぞれいろんな努力をしつつ、継続できるように頑張っているところかと思います。
それから遠隔バックアップとか、そういったことも考えると、どんどんストレージの容量が必要になってきますし、その保護するために必要な基盤というのも、同じものではなくて別の機能を持ったストレージ基盤じゃないといけなかったりとか、いろんなことがありますので、そういった点、それから、いろんな用途に対して対応できるようなものを導入していないと、なかなか多様な研究者がいるような研究機関ではそういったものに対応していくということが課題になっているかと思います。
それで、パネリストの皆さんに聞きたいのは、地方大学も含めて研究データの保存とか蓄積環境というのを、今後どういう風にしていくといいのか。左側から、甲斐先生の方から、一言ずつ何かコメントと、お考えがありましたらお願いします。
はい。ありがとうございます。維持するためには予算が必要で、予算を確保するために皆さん苦労されているという状況かと思いますけれども、私はストレージを導入する側というよりも利用する側と先ほど申し上げたんですが、色々勉強するとですね、例えばちょっと昔だったら、データ量が小さいような状況だったら、ハードディスクを組み合わせてRAIDを構築して、というような話があったりすると思うんですけども、それぐらいでいいのかなと思ったりする一方で、色々話を聞くと、データが大量になってくると、1個のハードディスクが例えばクラッシュした時にそれを復元する時に時間がかかって、残りのがクラッシュしたらもうデータが復元できなくなるとか、そういった話をお聞きしていると、やっぱりデータを保存するためにはそれなりの予算が必要なんだなというのは改めて認識したところなので、そういったことをいかに噛み砕いて、大学の幹部の人に理解をしていただけるような説明ができるかとか、そういったところは大きな課題というか、やらなきゃいけないところかなという認識はあります。
あとは、近隣の大学と相互運用的なストレージの共有みたいなところも、ちょうど今始めようとしているところではありますので、用意できるところとやっぱり出てくると思いますので、中心となるところがあって、その周りを支援するみたいな形もあり得るのかなという風に感じているところです。以上です。
はい、ありがとうございます。中村先生、お願いします。
はい。甲斐先生がおっしゃられたことを私も思ったので、だいぶ被ってしまうんですけども、まず地方大学含めというのは、小規模な大学ということを想定すると、小規模な大学で自前のストレージを整備するのは非常に難しいかなと思っています。予算の面もそうですし、それをお守りする人の面でもそうですし。
そういう意味では、先ほど私の中でも少しお話ししたのですが、分散化・集中化みたいな話があるんですけど、甲斐先生が先ほどおっしゃったこととほぼ近いんですけども、ある程度のグループで共同運用みたいな形にするというのが1つあり得るかなと思います。そこにも乗っかれないという場合は、多分NIIさんが中心になって、今もGakuNin RDMはそういう形になっているとは思いますけども、ある程度のグループでやっていくのが良いのかなという風に個人的には思っています。
データの保護についてなんですけども、これも甲斐先生とほぼ同じような意見で、そういったグループが何個かできた時に、そのグループ同士とかでデータを持ち合ったりして、データ保護することをやれるといいのかなと。その中にはNIIも含まれると思っているんですけども、そういう風にすることで、共通のエコシステムを構築できると良いなという風に思っております。
はい、ありがとうございます。下山先生、全国のいろんな大学に対してサービスを提供している立場として何かお考えがありましたらお願いします。
はい。NIIからは、先ほどから話が出ているGakuNin RDMというサービスを、全国の学術機関、大学の方々に向けて提供しております。現時点で220を超える機関の方々に利用していただいているところでございます。
GakuNin RDMというのは、先ほど私の発表の中でも申し上げましたけども、機関ストレージというものと、NIIが提供している標準ストレージ、並びにプロジェクトごとあるいは個人ごとに用意する拡張ストレージというようなもので提供されているわけなんですけども、現時点で機関ストレージを独自に設定しているところはそれほど多くありません。一桁程度でございます。ということで、かなり多くの機関はNIIストレージを利用していただいているところでございます。
ということで、ある程度の研究活動におきましては、GakuNin RDMを使うことで研究データ管理を賄えるんじゃないかなという風に思っておりますが、各大学あるいは各研究プロジェクトの事情によって、どうしてもそれでは賄えないというような声もいくつか聞こえてきております。NIIとしても財源が無尽蔵にあるわけではございませんので、ある程度サービスとしては、絞るじゃないな、全体に提供できるところにフォーカスせざるを得ないところがあります。そういったところから漏れてしまうようなものについては、各大学あるいはプロジェクトごとに、拡張ストレージという形で接続していただいて、その中で賄っていただくというような方針になっているところでございます。
ということで、是非ともGakuNin RDMをベースに、各々の研究データ管理をスムーズに回せるような環境を構築するサービスを提供していければという風に思っております。以上です。
ありがとうございます。脇さん、ストレージベンダー側の立場として何か。
はい。2つほど。1つは、昨今、そういう意味ではSSDがどんどん値上がりしておりますが、そういう中でも、データ自体をよく使うもの、使わないもの、その辺を的確に分けたりして、使われ方に応じてやっぱり配置を変えていく。高頻度で高速なものはもちろんSSDですけど、低頻度なものは低コストのもの、HDDだったり、その他もちろん例えばディープアーカイブみたいなものも言えるかもしれませんけど、その辺りを自動化でうまくマネージしていくというのが1つあると思います。
あと、甲斐先生、中村先生もおっしゃってましたけれども、共通化ということで言いますと、例えば大きなデータレイクみたいなものを作って論理分割して、皆さんが管理しながら、実際そうやって論理分割したものを使っていくというやり方が、実際今、産業界でも広がってきてまして、日本は特に人口動態が変わってきてますので、いろんなところでそうやってやっていきましょうと。ストレージだけじゃなくて、例えばGPUもまとめて1つで買うのは大変なので、それも全部同じようなデータレイクを作ってやろうというような動きもあったりしますので、その辺りは技術的なところではサポートはできると思いますので、いろんな形でお声がけいただければと思います。はい。
はい。皆さんありがとうございました。この問題、いろんな解決法があるとは思うんですが、そのための共同運用にしても、いろんな課題が出てきます。なので、そんな簡単ではないことなんですが、今全国で各地域ごとにコンソーシアムもできておりますので、その中でそれぞれ議論しながら、最適なやり方というのをこれから色々、みんなで考えながら進めていくことになるんじゃないかなと思っております。
NIIさんに関しても、いろんなサービスを提供しておりますし、ストレージの共同調達みたいな話もありますので、そういったところも活用しながら、できるだけコストを抑えながら、複数の機関にまたがって協力し合いながらやっていく環境を作っていかないと、なかなか個別の大学だけで維持していくというのがしんどい状況にはなってきてるのかなという風に思っております。では1点目、ストレージの戦略についてはここまでとさせていただきます。
次ですが、今後のRDM支援についてということで、まず現状では、GakuNinだとか各機関で整備しているRDM関連の管理サービスと、ストレージの連携といったところが進んでいる状況です。ただ、課題としてはいっぱいあって、RDM関連のサービスとシームレスな連携ができているかというと、なかなかそうではなかったりとか、それから研究のライフサイクルに合わせて、一応のワークフローはできていたとしても、なかなか痒いところに手が届かないみたいな形になっていったりだとか、そういったこともあるので、どんどんそういったものを高度化していかないといけないでしょうと。
それから、いろんなメタデータ、単純に研究の報告として出すためのメタデータだけじゃなくて、データを公開する時のメタデータ、それだけでもなくて、そのデータがどこから生まれて、どういう処理をして、どういう結果が出てきたのか、そこに至るいろんなメタデータというのが必要になってくるんですが、その辺りに関してはほとんど自動化できていなくて、研究者の皆さんがそれぞれ手で書いていかないといけない、いろんなものに記録を残していかないといけないという状況になっていて、その記録忘れによっていろんな問題が起こったりというのがあります。なので、そういったところも研究者が意識せずとも色々データが残っていくような形にしないといけないだろうなという風に思っております。
それから、研究者にとってやっぱり使いやすいものじゃないと、どうしてもこういった活動というのは広がっていかないので、そういったサービスをどう作っていくか、どう構築していくかというのが重要かと思っております。
まず聞きたいのはですね、これを今は研究機関ごとでやっているというのが現状です。NIIさんは全国に対して色々サービスを提供している立場になるんですが、各研究機関は、NIIのサービスも使いながら、それぞれ独自で色々サービスを構築して、それぞれの機関内での研究者に対してサービスを展開しているという段階です。ですが、これも開発できる人、開発に協力できるベンダ、それぞれ限られていて、かつ、そのサービスを運用していくためには運用のサポートの人というのも必要になってくるので、そこにもお金がかかってくるということになります。
なので、そういったサービスもできるだけ共用できるんであれば共用したりだとか、例えば、今回事例紹介した京大、阪大、東北大はそれぞれNextcloudという同じものを使ってますが、それを使った何かアプリケーションというのは全然共有できていません。独自開発しているところもきっとあると思います。プラグインとして開発できるので、その部分というのは、もし何か連携できる部分があれば共有するというのも1つの手かと思います。そういった形でオープンソースを活用していくというのは、こういった活動を進めていく中で必要なことかと思っているんですが、まずこの点に関して、機関をまたいだサービスの展開だとか、ツール・サービスの共有みたいな、そういったところの可能性に関して、それぞれまた一言ずつコメントをいただければと思います。甲斐先生からお願いします。
ありがとうございます。大阪大学が運用しているONIONにつきましては、元々大阪大学の中に閉じたストレージというものでもなくて、そういった閉じたサービスにする必要もないと思っています。というのが、ゲートウェイとしての役割というのを意識してまして、ONIONにデータが集まってきた後は、例えば共同利用の基盤となっているスパコンにデータが繋がってますから、すぐ解析ができたりとか、あるいはコアファシリティのような、測定データを集約して、それが共同研究者と共有できたりとか、いろんな各研究機関と繋がるようなことを意識しておりますので、その核となっているのがS3だったりするんですけれども、そこを目指しているというところで言うと、今後の可能性というのは大いにあるかなという風に考えております。はい。
ありがとうございます。中村先生お願いします。
はい。まず、渥美先生、非常に良い課題提起ありがとうございます。私が今議論を聞いていて思ったのが、少なくとも、各大学がどういう取り組みがあって、どういう先行事例があるみたいな、その考え方自体は、こういう場で共有できているので、それがまず価値があるんじゃないかという風に思っています。ちょっと手前味噌ではあるんですけど、本学のこういった取り組みについては、AXIESの論文誌の方とかでも、確かONIONも先生が何か出されてたと思いますけども、論文誌で共有されていたりもするので、そういった意味で各大学の先行事例を参考にしていただけるかなという風には思っています。
さらに踏み込んで、各大学で開発した機能をどうやって横展開するかというところなんですけども、これはちょっと権利関係が絡むと思ってまして、例えば保守ベンダーが開発したものをそのまま多分なかなか渡すわけにはいかないとか、いろんな事情があるとは思います。そういう意味で、実は本学は結構内製にはこだわっていて、自分たちでできることは自分たちで開発しています。例えば、先ほど紹介した申請フォームですね。そこの部分はかなりの部分、もちろん製品にかなり近いところはやっぱりベンダーにお願いせざるを得ないんですけども、境界ポイントを決めて本学側でも開発してやっていたりします。それが解になるかどうか分からないんですけど。
あと、ちょっと細かい個別の事例なんですけども、コアファシリティとの連携というところですと、阪大と東大が先行されているかなという風に私は認識しておりまして、先ほど甲斐先生とも、この場の前に少しお話ししたんですけども、我々ちょっとそこについては課題意識があるので、少なくとも考え方とかについては議論して、一緒にできることはやっていけるといいかなという風に思っております。以上です。
ありがとうございます。下山先生いかがでしょう?
はい。NIIとしては、GakuNin RDMをベースとした共通の基盤、各大学が共通で使える基盤というのを提供しているというのは先ほど申し上げた通りなんですけれども、個々の事情に応じて、京都大学様、大阪大学様、東北大学様の方で事例を紹介していただきましたけれども、こういった個々の事例をベースに研究データ管理をしていただいているというのは非常に先進的でありがたいところなんですけども、それ以外の大多数の大学というところにもやっぱりフォーカスしていかないといけないという風に考えております。
そういったところでは、研究データ管理というところそのもののモチベーションを上げていかないといけないというところがあって、何のためにデータ管理をしているかというところの説明を求められることがよくあります。そういったところを説明する時に、やっぱりオープンサイエンスというところに立ち戻って、研究成果の利活用というところを元に戻って考えたいという風に考えておりまして、そういったものを考えた時に、研究データを利活用する時にはデータを貯めるだけではなくて、その次に行く、利活用をするためのリポジトリ登録というところにまで視点をフォーカスしていきたいという風に思っておりまして、そのためには、ローカルなデータからオープンなデータに対する橋渡しというところをNIIとしては今取り組んでいるところでございまして。
ちょっと宣伝にはなるんですけれども、明日はですね、そのクローズドなデータからオープンのデータにする、GakuNin RDMとJAIRO Cloudの連携というところのセッションを明日行いたいと思ってますので、是非楽しみにしていただければと思います。ちょっと宣伝で、以上でございます。
はい。ありがとうございます。脇さん、いかがでしょう。
はい。ストレージベンダーとかいうそういう枠組みではなくて、せっかくこういうAXIESという場で、民間企業の方もいらっしゃると思いますので、そういう中で我々はどちらかというと、アメリカの会社ですので、外資の会社ですので、直接例えば保守とかそういったものをずっと続けることはできませんので、例えばAXIESである程度合意形成がなされて、ポリシーとか運用はアカデミアの方が主導して、実装を技術で支えるというところで、日本の企業の方にも来ていただいて。
例えばですけど、研究者の方が例えばDMPとか、そういったところをやるのに余計な工数がかかるんでしたら、そういうところこそ例えばAIにある程度やってもらいながら、フォーマットも作って出してもらうというのを、ある程度大きなデータレイクのところに入れておけば、コピーして置いておけば、その辺をある程度作ってやってくれるとか、両方にとってウィンウィンになるような感じのこういうものが欲しいというのを、例えばこういうところでも総意で吸い上げて、それを出して、文科省なり、もちろん例えばベンダーなり、それでも作れないかとか、そういう相談をするような場にしていくと、もしかしたら何かもっと前に進んでいくんじゃないのかなという気がしております。はい。
はい。ありがとうございました。これに関しても、継続的にいろんな議論が必要かなと思っております。先ほどあったように、権利関連の問題とかも当然出てきますし、そんな簡単にいろんな機関で共有できるみたいなことはいかないと思いますので、そこら辺も含めてどうやっていくといいかというのは、今後も含めて色々議論できればと思っております。
それでですね、時間もどんどんなくなってきているので、最後の話に行きたいと思いますが、AI for Science時代のRDM支援ということで、先ほど脇さんの方から最初にちょっとプレゼンがありましたけれども、この話に関して、またそれぞれ、甲斐先生の方からお願いします。何ができるか。
ありがとうございます。何ができるかというよりも、我々がちょっと考えなきゃいけないかなと思っているところは、やっぱりAIレディなデータということは、貯めることも重要ですし、貯める際にそのデータの質、例えばちゃんとしたメタデータがついているかとか、そういう状況も必要だと思いますし、一方で、その集められたデータに対する制御も必要だと思っています。
制御というのは、例えば最近私が知った話だと、人文系のデータを公開すると、AIは公開されたデータをどんどん食べるわけですけれども、そこに例えば公開者の意図として何かしらのライセンスがついていた時に、そのライセンスもないままに、AIのご飯として食べられて活用されていくというところは少し課題としてあるかなという風に私も認識したところで、そういったAIレディのデータを作る時の考えなきゃいけないことというのは、勉強するたびに色々出てくるなという、すいません、ちょっと答えになってないですけども、そういった印象です。
はい。ありがとうございます。中村先生いかがでしょうか?
はい。このお題は個人的には鶏と卵かなと思ってまして、AIレディにするためにはAIを活用しないといけないのかなと思っています。例えばメタデータの付与の自動化みたいな話が何回か出てたと思いますけども、そういった面でAIを活用してAIレディにするというところから多分始めないといけないのかなという風に思っています。
あと、先ほど甲斐先生がおっしゃったことに少し被るんですけど、アクセス制御設定ですね。これもAIが支援してくれるといいなと。コンテンツに基づいて、このコンテンツだったらこういうアクセス制御設定がいいよ、とやってくれるといいなと。あと、そういうのができた暁に、データカタログみたいなものができてくるといいんだと思うんですけど、やっぱり鶏と卵なのかなという風には思っています。ちょっとまとまりないですけど、以上です。
ありがとうございます。下山先生いかがでしょう?
はい。AI for Science時代のRDM支援についてですけども、まさに皆さんおっしゃる通り、AIにデータをどう渡せるのか、渡すのかというところを考える時に、データに対する情報であるところのメタデータ、あるいはそのメタデータを付与する仕組みというのが、まさにより重要になってきているかなという風に感じているところでございます。
データのライセンスもそうですし、元データがどこにあるのかというところ、そもそもそのデータを誰が作ったのかというところ、そういったところがきちんと記載されていないと、使えるものも使えないというところがあるので、ちゃんと研究データ管理というのをきちんとやっていかないと、正しいAI、正確なAIというべきかな、使えるAIになっていかないだろうなという風に思っております。
ということで、このAI時代のRDMというのは、具体的にはメタデータというのをどうつけていくのかというところですけども、ここは昨今AIもかなり進化が早いので、人間がいちいち入れるのではなく、AIに支援してもらうというところは十分視野に入れた上で進めていければと思います。
ちなみに、初日に黒橋所長の方から、NIIが提供しているLLM-jpの話もありましたけども、そのうちの1つに、メタデータの自動付与みたいなところの事例もあったと思います。そういったことが進化することで、より使いやすいデータ、AI for Scienceに使えるデータになっていくのかなと思う次第でございます。以上です。
はい。最初に問題提起いただいた脇さんの方から、今までの話を含めてまとめていただけると。
ありがとうございます。AIもこれも待ったなしで、どんどん進んでいきますので、先ほどもありましたけども、やっぱりAI自体がもう理解できるデータ、今人間がやっている中で、人口が変わりながら人もいない中でどうやってマネージしていくのという時に、やっぱり使わざるを得ない、逆にうまく使っていかなきゃいけないんですよね。その時に、まずそのデータをうまく整えないと、先ほどありましたけども、何でもかんでも食べさせちゃいけないということもありますので、その辺のガバナンスも含めて、ちゃんとした基盤を整備していくというのが非常に大事ですと。
あと、機械がそのまま理解していく、AI自体が食べていくので、それの前提になるということと、あとAIがアクセスできる基盤、データ自体はやっぱりまだ分散してますので、例えば研究室とかHPCとかクラウドとか外部機関とか、そういうものを横断的にAIが使う、そういうところのデータ連携、メタデータ連携とか、ID・PIDによる紐付けとか、そういう単に繋げるよりも安全に繋げるような本質的なところ、そういったところもすごい大事ですし。
あと、AIで高度化するRDM支援というところ、先ほど言っていたようなDMPやメタデータの品質管理とか、そういった負荷も高いので、そういったものでAIがどんどん代わる領域、人ができないことをどんどんやってもらいながら、研究者の方はもっと研究に没頭できる、皆さんももっと楽になっていく、全体がうまく前向きになるような形でAIをうまく取り込みながら使っていくという、そのための基盤をうまく整えるのが非常に重要なのかなと思っています。そのための技術というのは色々な形で出てきてますので、またいろんな形でお役に立てればと思っています。
はい、すいません。終了と目の前に出されておりますので、それを終わりにさせていただきたいと思いますが、AIの活用に関しては、これから必要になってくることですし、どう進化していくかというのも読めないところがありますが、うまく使っていろんな自動化ができ、かつ科学の発展に色々寄与できるようにしていければと思っております。
ではですね、これでパネルは終わりにしたいと思います。まだまだ色々議論が尽きないところではあるんですが、これで終わりにしたいと思います。
最後に事務連絡です。ご参加いただいた皆様に後日アンケートのURLをメールでご案内いたしますので、是非ご協力をお願いします。以上で、AXIES RDM部会との合同セッション「RDMのためのストレージ基盤の現状と課題」を終了いたします。本日はありがとうございました。今後ともAXIES RDM部会とNIIオープンフォーラムをよろしくお願いいたします。
記事公開
