RDMのストレージ基盤をめぐる質疑:DOI付与の自動化と「機関ストレージ」の考え方

YouTubeで開く ↗
概要

学術情報基盤オープンフォーラム2026のセッション「RDMのためのストレージ基盤の現状と課題」では、各大学の事例紹介の後に短い質疑応答が行われた。時間が押していたため質問は2件にとどまった。1件目は研究データの公開とDOI付与、2件目はGakuNin RDMで使うストレージの区分と運用だった。どちらの回答にも、大学ごとの事情に応じた選択や、まだ構想段階の取り組みが含まれていた。

4分で読めます

研究データへのDOI付与はどこまで進んでいるか

最初の質問者は金子氏である。東北大学の中村氏は発表の中で、「泉」(字幕上の表記)と図書館によるDOI発行との連携をこれから検討すると述べていた。金子氏はこれを踏まえ、京都大学が予定しているRDMドライブ(字幕では「RTMドライブ」)とKURENAIの連携にDOI付与が含まれるのか、あるいはすでに何か試みているのかを京都大学の登壇者に尋ねた。

京都大学の登壇者は、今のところきちんとした連携はできていないと答えた。KURENAIでデータを公開するには、研究者がWebインターフェースからさまざまなメタデータを登録し、公開申請をする必要がある。登壇者はこの手順では研究者の負担が大きいとみている。

そこで検討しているのが、データセットからAIなどを使って必要なメタデータをある程度自動的に取り出し、そのまま登録できる仕組みである。ただし登壇者は、これは考えている段階で、まだまったく実現していないと明言した。そのうえで、こうした仕組みがなければ研究者にWebインターフェースで入力させるのは厳しい、という認識を示した。金子氏は、よい解決策が見つかればまた紹介してほしいと応じた。

「標準ストレージ」「拡張ストレージ」「データレイク」の関係

2つ目の質問は、藤田医科大学(字幕では「藤田一下大学」)の島田氏からだった。島田氏はこの仕事を始めて間もないと前置きし、基本的な点を確認したいと述べた。

島田氏の疑問は次のようなものだった。最初の講演のスライドでは、GakuNin RDMのストレージがデフォルトの標準ストレージと拡張ストレージの2つに分けられていた。また島田氏が読んだドキュメントには、大学がNIIのデフォルトを採用せず、標準ストレージ自体を独自に用意する選択肢もあると書かれていた。一方で、事例発表では「ストレージ」という言葉が複数の意味で使われ、東北大学の中村氏は「データレイク」という表現を使っていた。島田氏には、データレイクは1か所にデータをまとめるものという印象がある。そこで、標準ストレージと拡張ストレージという2段階の運用ルールや構想が、データレイクという考え方とどう関係するのかを尋ねた。あわせて、実際にどう設計・提供しているのか、NIIと大学の間でどのようなやり取りがあるのかも聞いた。

NIIの説明:機関が基盤、ただし独自ストレージは必須ではない

NIIの柴氏は、まず「機関ストレージ」という概念を説明した。研究データ管理は機関をベースに行うことが大前提であり、機関が管理するストレージ領域という意味でこの名称を使っているという。ただしNIIは、すべての機関が独自の機関ストレージを用意することを想定しているわけではまったくない。誰でも使えるNII標準ストレージを用意している、と柴氏は述べた。

次に柴氏は拡張ストレージの位置付けを説明した。機関とは別に、研究プロジェクトや研究者個人にはそれぞれ事情があり、データに関する制約を抱えていることが多い。こうしたケースは、機関やNIIが用意するストレージだけではどうしても対応しきれない。その場合は、研究者自身やプロジェクトが独自に調達したストレージを利用してよい、というのが基本的な考え方だという。

京都大学の選択:機関ストレージを設定しない理由

柴氏の回答に続いて、京都大学の登壇者が自学の運用を補足した。京都大学はGakuNin RDMに機関としてのストレージを設定していない。代わりに、研究者のプロジェクトなどの単位で、京大のオンプレミスストレージ(字幕では「兄大のオンレストレージ」)のリソースを拡張ストレージとして割り当てている。

この方式を選んだ理由について、登壇者は、ストレージ基盤をリプレースする際にかなり大変なことになりそうだと考えたためだと説明した。そのうえで、大学ごとにさまざまな考え方があり、機関ストレージを設定する大学もあれば、標準ストレージを使いながら拡張ストレージを併用する大学もあるだろうと述べた。

質疑はここで打ち切られた。パネルの時間を確保するためである。島田氏が挙げた「データレイク」という用語と、2段階のストレージ区分との関係については、この場で直接の回答はなかった。