バイオリソースは研究データの起点になる:NBRPの現状とデータ駆動基盤への期待

YouTubeで開く ↗
概要

国立遺伝学研究所の川本祥子氏は、自身が担当する「ナショナルバイオリソースプロジェクト(NBRP)」を紹介した。そのうえで、リソースを使った研究から何が生まれているのか、リソース基盤にどのような課題があるのかを説明した。最後に、国立情報学研究所が進めるデータ駆動基盤とリソース基盤をつなぐと何が期待できるかを論じた。川本氏の立場ははっきりしている。生命科学のデータは必ず生物そのものから生まれる。そのため、実物のリソースとその情報の両方が重要であり、データ駆動基盤との接続によってリソースの利活用を広げられるのではないか、というものである。

8分で読めます

遺伝学研究所とNBRPの位置づけ

国立遺伝学研究所は国立情報学研究所と同じ情報・システム研究機構に属するが、川本氏によれば「完全に生物学のウェットの研究所」であり、静岡県三島市にある。名前のとおり、メンデルの遺伝や交配の実験を土台として、さまざまな生命科学の研究を展開している。

NBRPは、生命科学研究に必要な生物遺伝資源を整備し提供する国の事業である。文部科学省の事業として2002年に始まり、かなり長く続いているプロジェクトだと川本氏は説明する。全国の大学や研究機関が連携して研究用の生物を維持管理し、国内外の研究者に提供して、多様な研究成果を支えている。川本氏自身は、リソースの情報や成果論文の情報をデータベース化して提供する役割を担っている。

扱うリソースの幅と維持体制

扱う生物はマウスやラットといった有名なモデル生物から、カイコ、日本固有のアサガオ、イネ、メダカまで幅広い。リソースの種類(カテゴリー)は非常に多く、それぞれに研究用として提供している多数のリソースがある。その多くは生きた個体ではなく、DNAなどチューブに入った形のものも含まれる。国がこれだけ多くの種類のリソースの維持管理と提供を支援している状況は、他国にはないものだと川本氏は述べた。

維持は、理化学研究所などを含む全国43機関の約100拠点が担っている。各拠点は、自分たちが得意とするリソースを日々維持管理している。

データベースと提供の流れ

利用者はウェブサイト(nbrp.jp)からリソース情報にアクセスする。川本氏によれば、現在約600万件のリソース情報がある。各リソースには遺伝型や表現型の情報が付いている。例として示されたイネの野生系統では、草丈や米粒の形などがデータベース化され、写真も添えられている。これらのデータは実際にイネを育てている研究者が作り、情報担当がデータベースにまとめている。

利用者はサイトで検索し、オーダーカートの仕組みで注文する。研究目的の提供なので、MTA(試料提供契約)を取り交わしてから実際に利用してもらう流れになっている。

年間の利用件数は平均で6000〜7000件ほどである。そのうち6〜7割が国内で、国外からも使われている。利用者の多くはアカデミアだが、企業も契約書の種類は異なるものの利用できる。

成果論文の収集と分析

川本氏は、リソースを実験に使っても成果が出ないことも多いと前置きした。そのうえで、成果が得られた場合に研究者が書く論文を広く収集し、データベース化していると説明した。20年間で6万件を超える論文を集めており、年間ではおよそ3000本が発表されている。論文の中身を見れば、リソースがどのような研究や知識につながっているかを把握できる。

この6万件の論文には、米国国立医学図書館がMeSHという統制語彙を付与している。川本氏はこれを使って分析した結果を示した。研究分野では、生物における分子の分解など代謝に関わる幅広いタグが最も多く付いていた。それ以外にも、遺伝学や生理学などさまざまな研究に使われている。実験手法の面でも、生命科学には非常に多くの実験・解析手法があり、手法ごとに得られる結果やデータが異なることが表れていた。リソースごとの違いも見えてきているが、講演ではこの部分は割愛された。

7割が複数機関の共同研究

同じ論文群を、クラリベートのデータベースを使って共同研究の観点から調べた結果も紹介された。国内外を合わせた約6万件のうち、1つの機関だけで行われた研究は約30%だった。最も多いのは同一国内の複数機関によるもので45%、国際共同研究が約20%である。つまり約70%が複数機関または国際共同の研究となる。

川本氏はこの数字を、データ共有と解析の悩みにつなげた。どうデータを共有し、どう解析するかについて、研究者は日々悩まされているのではないかという。特に塩基配列データは非常に大きい。そのため、ハードディスクを持っていくのか、Dropboxにするのか、最近ならMicrosoftのサービスがセキュアなのか、といったレベルから検討しているのが実情だと述べた。

リソースの評価と継続の難しさ

文部科学省から予算を得る事業として、どのようなリソースが評価されてきたかも説明された。高品質であること、担当機関が高い技術を持つことは不可欠の前提である。そのうえで最も重視されているのは、研究コミュニティから「国として維持管理してほしい」という支持があることだという。

ただし、実際の評価で注目されるのは、利用数や成果論文の数、NatureやScienceに載ったかどうかといった指標だと川本氏は指摘する。一方で、利用数や論文数だけでは価値を示しにくいリソースもある。研究トレンドに合わせたリソースを整備することも必要だが、それも簡単ではないという。

課題として挙げられたのは次の点である。希少なリソースでも、利用者数や論文数が少なければ継続が難しくなる。また、こうした基盤を支える人材は研究の世界では不足しがちである。そのうえ、発送や料金の徴収などさまざまな業務の負担が増えている。

提供後の支援が足りていないという気づき

利用促進のため、NBRPはこれまで主に二つの取り組みを続けてきた。一つは使ってもらえる有用なリソースを開発すること、もう一つは事業の存在や使えるリソースを知らせる周知啓発である。実験手法についての講習会も定期的に開いてきた。

しかし川本氏は、今回の講演のためにスライドを作る中で、リソースを提供した後の支援が十分にできていないと感じたと語った。研究者が実際にそれを使って実験や解析をする段階のサポートである。コミュニティの中で相談に乗り合うことはあるが、具体的な支援は少ない。自分の研究室でリソースを使うときに使いやすいデータ共有・解析基盤を、リソース提供と一体でシームレスに案内できれば、利活用をもっと広げられるのではないかという。

成功例:遺伝研スパコンによるゲノム解析

こうした形が実際に機能している例として、川本氏は塩基配列データの解析を挙げた。提供したリソースが研究者の手に渡ると、まずシーケンサーでゲノムを解読することが多い。解読したデータは各種データベースと照合し、遺伝子予測プログラムなど多様なバイオインフォマティクスツールにかける必要がある。国立遺伝学研究所のスーパーコンピューターは、計算資源と解析ツールを合わせた計算環境として提供されている。

川本氏によれば、これが使われる大きな理由はゲノムサイズにある。小さなゲノムの生物ならPCでも解析できるが、ヒトなどの大きな高等生物になるとPCでは難しい。大量のメモリーを使い、クラスターで並列処理する必要がある。そのため研究者はどうしてもこの環境を使うことになる。現在は利用申し込みを待ってもらうほど混雑しているという。今後はAIの活用に向けて、遺伝研ではGPUの増強も進めている。

データ駆動基盤との接続に向けた課題

ただし、この成功例にNBRPのバイオリソース自体は含まれていない。研究リソースからデータ駆動基盤へ接続するには課題が多いと川本氏は整理した。扱う生物の種類が多いため、データはそもそも多様で不均一である。標準化やメタデータの統一も不足している。解析手法も多岐にわたり、どのプログラムをデータ基盤に置けばよいかも、まだ整理が全くできていない状態だという。さらに、表現型のデータは画像や動画が多いため、データサイズも大きくなっていくと見込む。共同研究の場合は、秘匿性や利用条件も問題になると考えている。

それでも、こうした課題をクリアし、強力なデータ解析基盤が使えるようになれば状況は変わるというのが川本氏の見方である。特にそこでAIが提供されるなら、生物の研究者もそれを使わざるを得なくなり、使うメリットもはっきりするのではないかと述べた。

描かれた将来像と結論

川本氏は、プロンプトを書いてAIに作らせたという図を示しながら将来像を説明した。バイオリソースプロジェクトがリソースを提供し、研究者がそれを利用する。その解析の途中にデータ駆動基盤を組み込めば、研究プロセスが高度化し、スピードアップも期待できるのではないかという。さらに、研究リソースから生まれる多様なデータをつなぎ、再利用可能な知識として共有すれば、新しい発見が生まれる未来があるのではないかと考えた。

まとめとして川本氏は、NBRPが生命科学研究を支える国のリソース基盤として続いてきたことを改めて述べた。研究リソースは多様な研究データを生み出す起点であり、データ駆動基盤と接続すればリソースの利活用と研究の活性化が進むと強く期待している、と講演を締めくくった。