バイオリソースは研究データの起点になる:NBRPの現状とデータ駆動基盤への期待
国立情報学研究所 - National Institute of Informatics国立遺伝学研究所の川本祥子氏は、自身が担当する「ナショナルバイオリソースプロジェクト(NBRP)」を紹介した。そのうえで、リソースを使った研究から何が生まれているのか、リソース基盤にどのような課題があるのかを説明した。最後に、国立情報学研究所が進めるデータ駆動基盤とリソース基盤をつなぐと何が期待できるかを論じた。川本氏の立場ははっきりしている。生命科学のデータは必ず生物そのものから生まれる。そのため、実物のリソースとその情報の両方が重要であり、データ駆動基盤との接続によってリソースの利活用を広げられるのではないか、というものである。
遺伝学研究所とNBRPの位置づけ
国立遺伝学研究所は国立情報学研究所と同じ情報・システム研究機構に属するが、川本氏によれば「完全に生物学のウェットの研究所」であり、静岡県三島市にある。名前のとおり、メンデルの遺伝や交配の実験を土台として、さまざまな生命科学の研究を展開している。
NBRPは、生命科学研究に必要な生物遺伝資源を整備し提供する国の事業である。文部科学省の事業として2002年に始まり、かなり長く続いているプロジェクトだと川本氏は説明する。全国の大学や研究機関が連携して研究用の生物を維持管理し、国内外の研究者に提供して、多様な研究成果を支えている。川本氏自身は、リソースの情報や成果論文の情報をデータベース化して提供する役割を担っている。
扱うリソースの幅と維持体制
扱う生物はマウスやラットといった有名なモデル生物から、カイコ、日本固有のアサガオ、イネ、メダカまで幅広い。リソースの種類(カテゴリー)は非常に多く、それぞれに研究用として提供している多数のリソースがある。その多くは生きた個体ではなく、DNAなどチューブに入った形のものも含まれる。国がこれだけ多くの種類のリソースの維持管理と提供を支援している状況は、他国にはないものだと川本氏は述べた。
維持は、理化学研究所などを含む全国43機関の約100拠点が担っている。各拠点は、自分たちが得意とするリソースを日々維持管理している。
データベースと提供の流れ
利用者はウェブサイト(nbrp.jp)からリソース情報にアクセスする。川本氏によれば、現在約600万件のリソース情報がある。各リソースには遺伝型や表現型の情報が付いている。例として示されたイネの野生系統では、草丈や米粒の形などがデータベース化され、写真も添えられている。これらのデータは実際にイネを育てている研究者が作り、情報担当がデータベースにまとめている。
利用者はサイトで検索し、オーダーカートの仕組みで注文する。研究目的の提供なので、MTA(試料提供契約)を取り交わしてから実際に利用してもらう流れになっている。
年間の利用件数は平均で6000〜7000件ほどである。そのうち6〜7割が国内で、国外からも使われている。利用者の多くはアカデミアだが、企業も契約書の種類は異なるものの利用できる。
成果論文の収集と分析
川本氏は、リソースを実験に使っても成果が出ないことも多いと前置きした。そのうえで、成果が得られた場合に研究者が書く論文を広く収集し、データベース化していると説明した。20年間で6万件を超える論文を集めており、年間ではおよそ3000本が発表されている。論文の中身を見れば、リソースがどのような研究や知識につながっているかを把握できる。
この6万件の論文には、米国国立医学図書館がMeSHという統制語彙を付与している。川本氏はこれを使って分析した結果を示した。研究分野では、生物における分子の分解など代謝に関わる幅広いタグが最も多く付いていた。それ以外にも、遺伝学や生理学などさまざまな研究に使われている。実験手法の面でも、生命科学には非常に多くの実験・解析手法があり、手法ごとに得られる結果やデータが異なることが表れていた。リソースごとの違いも見えてきているが、講演ではこの部分は割愛された。
7割が複数機関の共同研究
同じ論文群を、クラリベートのデータベースを使って共同研究の観点から調べた結果も紹介された。国内外を合わせた約6万件のうち、1つの機関だけで行われた研究は約30%だった。最も多いのは同一国内の複数機関によるもので45%、国際共同研究が約20%である。つまり約70%が複数機関または国際共同の研究となる。
川本氏はこの数字を、データ共有と解析の悩みにつなげた。どうデータを共有し、どう解析するかについて、研究者は日々悩まされているのではないかという。特に塩基配列データは非常に大きい。そのため、ハードディスクを持っていくのか、Dropboxにするのか、最近ならMicrosoftのサービスがセキュアなのか、といったレベルから検討しているのが実情だと述べた。
リソースの評価と継続の難しさ
文部科学省から予算を得る事業として、どのようなリソースが評価されてきたかも説明された。高品質であること、担当機関が高い技術を持つことは不可欠の前提である。そのうえで最も重視されているのは、研究コミュニティから「国として維持管理してほしい」という支持があることだという。
ただし、実際の評価で注目されるのは、利用数や成果論文の数、NatureやScienceに載ったかどうかといった指標だと川本氏は指摘する。一方で、利用数や論文数だけでは価値を示しにくいリソースもある。研究トレンドに合わせたリソースを整備することも必要だが、それも簡単ではないという。
課題として挙げられたのは次の点である。希少なリソースでも、利用者数や論文数が少なければ継続が難しくなる。また、こうした基盤を支える人材は研究の世界では不足しがちである。そのうえ、発送や料金の徴収などさまざまな業務の負担が増えている。
提供後の支援が足りていないという気づき
利用促進のため、NBRPはこれまで主に二つの取り組みを続けてきた。一つは使ってもらえる有用なリソースを開発すること、もう一つは事業の存在や使えるリソースを知らせる周知啓発である。実験手法についての講習会も定期的に開いてきた。
しかし川本氏は、今回の講演のためにスライドを作る中で、リソースを提供した後の支援が十分にできていないと感じたと語った。研究者が実際にそれを使って実験や解析をする段階のサポートである。コミュニティの中で相談に乗り合うことはあるが、具体的な支援は少ない。自分の研究室でリソースを使うときに使いやすいデータ共有・解析基盤を、リソース提供と一体でシームレスに案内できれば、利活用をもっと広げられるのではないかという。
成功例:遺伝研スパコンによるゲノム解析
こうした形が実際に機能している例として、川本氏は塩基配列データの解析を挙げた。提供したリソースが研究者の手に渡ると、まずシーケンサーでゲノムを解読することが多い。解読したデータは各種データベースと照合し、遺伝子予測プログラムなど多様なバイオインフォマティクスツールにかける必要がある。国立遺伝学研究所のスーパーコンピューターは、計算資源と解析ツールを合わせた計算環境として提供されている。
川本氏によれば、これが使われる大きな理由はゲノムサイズにある。小さなゲノムの生物ならPCでも解析できるが、ヒトなどの大きな高等生物になるとPCでは難しい。大量のメモリーを使い、クラスターで並列処理する必要がある。そのため研究者はどうしてもこの環境を使うことになる。現在は利用申し込みを待ってもらうほど混雑しているという。今後はAIの活用に向けて、遺伝研ではGPUの増強も進めている。
データ駆動基盤との接続に向けた課題
ただし、この成功例にNBRPのバイオリソース自体は含まれていない。研究リソースからデータ駆動基盤へ接続するには課題が多いと川本氏は整理した。扱う生物の種類が多いため、データはそもそも多様で不均一である。標準化やメタデータの統一も不足している。解析手法も多岐にわたり、どのプログラムをデータ基盤に置けばよいかも、まだ整理が全くできていない状態だという。さらに、表現型のデータは画像や動画が多いため、データサイズも大きくなっていくと見込む。共同研究の場合は、秘匿性や利用条件も問題になると考えている。
それでも、こうした課題をクリアし、強力なデータ解析基盤が使えるようになれば状況は変わるというのが川本氏の見方である。特にそこでAIが提供されるなら、生物の研究者もそれを使わざるを得なくなり、使うメリットもはっきりするのではないかと述べた。
描かれた将来像と結論
川本氏は、プロンプトを書いてAIに作らせたという図を示しながら将来像を説明した。バイオリソースプロジェクトがリソースを提供し、研究者がそれを利用する。その解析の途中にデータ駆動基盤を組み込めば、研究プロセスが高度化し、スピードアップも期待できるのではないかという。さらに、研究リソースから生まれる多様なデータをつなぎ、再利用可能な知識として共有すれば、新しい発見が生まれる未来があるのではないかと考えた。
まとめとして川本氏は、NBRPが生命科学研究を支える国のリソース基盤として続いてきたことを改めて述べた。研究リソースは多様な研究データを生み出す起点であり、データ駆動基盤と接続すればリソースの利活用と研究の活性化が進むと強く期待している、と講演を締めくくった。
国立遺伝学研究所の川本と申します。NIIとは同じ法人の情報・システム研究機構に所属しているんですけれども、完全に生物学のウェットの研究の研究所で、静岡県の三島市にございます。遺伝学という風に名前がついておりますので、いわゆるメンデルの遺伝ですね、交配の実験、ああいうことが本当にベースに、色々な生命科学を展開している研究所になります。
本日なんですけれども、その中でも私が担当しております、バイオリソースのプロジェクトについてご紹介をして、そのリソースを使った研究からどういうことが生まれているのか、そのリソースの基盤っていうのにどういう課題があるのか、最後にそのリソース基盤と本日のそのデータ駆動基盤の接続っていうのが、どういう効果をもたらすのだろうかということをお話ししたいと思っております。
私が担当しておりますNBRP、これナショナルバイオリソースプロジェクトと申しまして、生命科学研究、ちょっと待ってくださいね。ポインター、そっか。生命科学研究に必要な生物遺伝資源を整備提供する国の事業でございます。
文部科学省の事業で2002年にスタートしたかなり長寿のプロジェクトになってるんですけれども、全国の大学研究機関が連携をして、その生命科学研究に使ういわゆる本当に生物ですね、この後お見せするんですけれども維持管理して、それを国内外の研究者に提供して多様な研究成果を支えるということをやっております。
私の担当としましては、その中からリソースの情報や成果論文の情報をデータベース化をして提供する。本日のそのデータ駆動基盤ということで言いますと、データは生命科学においては必ずこういう生物から生まれておりますし、リソースなくして情報も得られないということで、リソースと実体とその情報の両方が重要であるということを認識して進めております。
これ、ちょっとさらっと、いろんな生き物使ってますよということで、すごくマウスとかラットとか、有名なモデル生物から、日本固有のカイコだったり、日本固有のアサガオ、イネ、メダカといったような、様々なリソースを扱っております。
全体のリソースの種類というのが非常に大きくなっておりまして、678、今334ぐらいのリソースのカテゴリーというか種類がありまして、それぞれがこの中の数字がですね、そこが研究用に提供しているリソースの数になります。この数の多くのところは、生きたものじゃなくて、DNAだったり、チューブに入ったものも含まれてるんですけれども、こういった形で国がこれだけの種類のリソースの維持管理提供を支援してるっていうのは、他国にはないような状況になっています。
どういった風に維持してるかって言うと、こういう形で、全国の大学また研究機関、理研等も含めまして43機関に100拠点リソースの拠点がありまして、これがその日々自分たちの得意とするリソースの維持管理を行っております。
利用者は、このウェブサイトを通じて、リソース情報にアクセスいたします。これnbrp.jpっていうところで見れますので、もしご興味あったら見ていただければと思うんですけれども、今600万件のリソース情報あるって言ったんですけども、ここのリソースの遺伝型とか表現型っていうのを、この右側にあります。これあるイネの野生系統の情報が書いてあるんですけれども、例えば遺伝型であるとか、表現型としましては、イネですから、どれぐらい長さがあるのか、その稲のお米がどんな形なのかというようなことをデータベース化して、写真なんかも添えてデータベースが作られています。
ですので、これは実験をしてる、実際圃場でイネを育ててる人がこのデータを作って、情報の担当がデータベース化をしています。このデータをさっきのウェブサイトに行っていただくと検索ができますので、利用者は検索して、本当にオーダーカートシステムを作っておりまして、オーダーをしたら、これ研究ですので、MTAという契約書を取り交わしまして、実際に利用をしていただくというような流れになっています。
どれぐらい利用者がいるのかっていうことなんですけれども、年間の利用者数が平均しますと、6000から7000の利用件数があります。分布は6割、7割が日本なんですけども、国際的にも使われておりますし、また、多くはアカデミアなんですけれども、産業界、企業の方にでも、取り交わす契約書がちょっと異なるんですけども、利用をしていただけるというようになっています。
これから少しその成果というところをお話しするんですけれども、リソースを用いてどういう成果が出たかっていうのが、なかなかその実験なんで、使ったはいいけども何も成果得られなかったっていうことも多くあるんですけれども、成果が得られた場合は、研究者が論文を書いています。その研究者が書いた論文を広く収集しまして、今データベース化をしています。20年間で大体6万を超える論文を収集していて、年間で言うと大体3000ぐらいの論文が発表されています。この論文の中身を見ればリソースがどのような研究、どのような知識につながっているのかを把握できるようになっています。
これは年間の推移なんですけれども、ちょっとこれ小さくて恐縮なんですけれども、その6万ある論文に、アメリカの国立医学図書館がMeSHというシソーラス、統制用語をつけているので、それで分析をしたこの表を出しています。すいません。これちょっとまた今度、資料を公開した時にじっくり見ていただければいいんですけれども、左側の図がですね、これが研究分野を表してるんですけれども、1番上が、これ成学かこ代謝って、これちょっとそのシソーラスの書き方でこうなってるんですけども、これは生物における分子の分解とか、そういったことに関わる研究、かなり幅広のことでのタグが1番ついてるんですけども、それ以外にも遺伝学、生理学だとか様々な研究に使われていることがここで示されています。
また右がですね、これはどういう実験手法を使ったかっていうことも調べられるんですけども、実に生命科学ですね、ものすごいたくさんの実験手法、解析手法がありまして、それぞれに得られる結果が違う、得られるデータが違うという風になってございます。これはちょっと飛ばしますけど、個々のリソースごとの違いなんかも出てきています。
先ほどの論文をまた違う視点から見ますとですね、どれぐらい共同研究が行われているかっていうの、これはクラリベイトのデータベースにあたって調べたんですけれども、日本、海外ミックスして調べてますけれども、同一の国内で1つの機関だけで行われた論文っていうのがその6万件ぐらいのうちの約30%でした。それ以外で言いますと、同一国内の複数機関で行われたっていうのが最も多くて45%。それ以外に元々その国際共同でやられた共同研究というのも20%ぐらいがあって、これを見ますと70%が複数機関、国際共同研究でして、これは、データ共有とかその解析する中でも、じゃあこのデータどうやって共有しましょうかと、どうやって解析しましょうかっていうようなことが実は多分日々悩まされてて、本当に塩基配列なんてすごく多くて、もうハードディスクを持っていくとか、そういうレベルからや、Dropboxにしようか、最近だとMicrosoftのボックスがセキュアなのかとか、色々悩んでいるっていうような状況がございます。
私たちのそのプロジェクトも文部科学省から予算をいただくということで、どのようなリソースが評価されてきたかっていうことで、1番大事なのは高品質なリソースであるっていうこと。またそのリソースを担当しているところが高い技術を持っているっていうことは、もう必要不可欠のことなんですけれども、1番大事にされているのが研究コミュニティから、そのリソースを国として維持管理してくれることが大事なんだっていう支持があるっていうことが言われています。
でもただ実際本当に評価される時って利用の数とか、あと成果論文の数が多いねとか、ネイチャー、サイエンスに載ってるねとか、やっぱそういうのが注目されてるんですけども、一方でやっぱり分譲数とか論文数だけでは価値を示しにくいリソースもあって、例えば研究トレンドに乗せたリソースを整備していこうということも必要なんですけれども、なかなかそれも難しいところがございます。
このリソース、私たちがその利活用を広げるために常に色々取り組んでるんですけれども、課題としてはその希少なリソースであってもやっぱり利用者数や分譲数が少ない場合に、もうそもそも継続が難しくなるっていうことがあったりですね、こういう基盤を支える人材がやっぱりどうしても研究では不足しがちで、さっき見ていただいた通り、発送するとか、あと色々、お金を徴収するとかいろんな業務あるんですけども、そういうの負担が増えてきています。
私たちも利用促進のために色々取り組んでいるんですけれども、1番大事にはやっぱり使ってもらえる有用なリソースを開発するっていうことと、あと、もう1つできるっていうのは、こういうプロジェクトやっていますよ、皆さんが使えるリソースがありますよっていうことを周知啓発活動する。たまにはじゃないな、定期的に実験についても、こういう実験ができますよっていうような講習会をするというようなことかをやってきたんですけれども、今回このお話をいただいてスライドを作る中で、リソースを提供した後ですね、その研究者が実際にそれを使って実験や解析をするサポートってなかなかやっぱりできてないなと。
コミュニティベースでは色々こう相談に乗り合ったりはするんですけども、やっぱ具体的なサポートっていうことになると少なくて、やっぱりリソースを自分の研究室で研究した時に使いやすいデータ共有や解析基盤とかが、リソース提供と合わせてシームレスに、じゃあここ使ってくださいねというようなことが提供できたら、このリソースの利活用をもっと広げられるんじゃないかなという風に今回感じました。
そういったことが実は成功している例が1つございまして、これは塩基配列データ解析ですね。ゲノムという言葉皆さんお聞きになったと思うんですけれども、私たちが提供しているリソースが研究者の手元に行った場合に、じゃあまず、ゲノムを調べてみましょうということで、シーケンサーでゲノムを解読するんですね。解読したデータは、いろんなデータベースにあたったり、またそのどこが遺伝子であるかというようなプログラム、遺伝子予測プログラムにかけたり、様々なそのバイオインフォマティクスの解析ツールを使わなきゃいけないんですけれども、これを実は私の所属してる国立遺伝学研究所のスーパーコンピューターでは、その解析の計算機資源と一緒に解析ツール合わせて計算環境として提供しています。
これが使われる1つの大きな原因は、そのゲノムのサイズが大きくて、このMacで解析できる生物のゲノムサイズもあるんです。生物とかだとこれでいけるんですけれども、人とかもっと大きな高等生物の解析になると、とてもそのPCでできなくて、スーパーコンピューターを使って、メモリーもいっぱい使ってクラスターでやる、並列でやるっていうようなことがあって、もうどうしてもっていうことでこれを使われていて、現在このスーパーコンピューターの申し込み、利用混みって、もうちょっと待っていただいてるぐらい混んでて大変な状況になってます。今後はですね、ここにAIの活用をするべく、今遺伝学研究所ではGPUなんかも増強をしていっています。
ここに、私がやってるバイオリソースは載ってないんですけども、じゃあ研究リソースからデータ駆動基盤への接続に向けた課題ということで、色々あります。あれだけたくさんの種類の生物があるので、そもそもデータの多様性あります。不均一もあります。当然標準化やメタデータの統一の不足もありますし、いろんな解析手法があるんで、じゃあどういうプログラムをデータ基盤に置けばいいのかっていうのもまだ全然整理をしなきゃいけない状態です。
さっき見ていただいたように、生物の表現型のデータって画像だったり動画だったりそういうものが多いので、データサイズも多分大きくなってくるでしょう。共同研究っていうことになると秘匿性とか、あと利用条件なんかも問題になってくるとは思います。でも、こういうことをクリアしたうちに、やっぱりそういう強力なデータ解析基盤を使えることによって、特に今後はそこでAIが提供されるっていうことになりましたら、やっぱり生物の研究者もそこを使わなきゃならない、使ってメリットがあるっていうことになるんじゃないかなと思いました。
すいません。これちょっとプロンプト書いてAIで書かしちゃったんですけれども、研究リソースから、リソースの提供をバイオリソースプロジェクトが行う、リソースの利用を研究者が行って、その解析途中にデータ駆動基盤を入れることによって、よりこの研究プロセスが高度化されて、なおかつスピードアップもされるんじゃないかと。つまり、研究リソースから生まれる多様なデータを繋ぐことで、裁も可能な知識へ、もっとなんて言うんですかね、シェアをしつつ、いろんな事件が生まれるといった未来があるんじゃないかという風に考えました。
はい、最後、まとめです。NBRPは生命科学研究を支える国のリソース基盤としてやってきました。研究リソースは多様な研究データを生み出す起点でもありますが、データ駆動基盤との接続によるよりリソースの利活用と研究の活性化が期待されると、強く思っている次第でございます。ありがとうございました。
記事公開
