精度70%の壁をグラフとオントロジーで越えようとするインフォシズ
EO Korea翻訳元 한국어
生成AIを導入した企業が、いまだに基本的な検索すらまともにできないのはなぜなのか。このドキュメンタリーは、グラフ技術とオントロジーでこの問題を解決しようとする企業インフォシズ(INFOCZ)の代表とメンバーへのインタビューで構成されている。彼らは、企業データが散在し断片化していることが根本的な原因であり、データを集めてつなぐグラフ技術こそが解決策だと主張する。セキュリティ、図面認識、保険約款、半導体の生産計画といった実際のプロジェクト事例とともに、この主張を説明していく。
ベクトルRAGの後にも残った問題
代表は、多くの企業が生成AIを導入したものの、最も基本的な検索機能すらうまく機能していないのが現実だと診断する。その理由として、企業内部のデータが散在していたり断片化していたりして活用しにくい点を挙げる。生成AI導入の初期には、ベクトルという技術的手法でこの問題を解決しようとした。代表によれば、この方式は2024〜2025年にかけて大きく流行し、企業に適用された。それでもハルシネーションの問題は解決されず、精度は約70%の水準にとどまっているという。
代表は、根本的な解決のためにはハルシネーションをなくし、散在するデータを集めてつなぎ、分析しなければならないと考えている。その技術がグラフだというのだ。代表は映画『アバター』で、ナヴィ族が互いに、そして周囲のあらゆるものとつながって力を引き出す場面を例に挙げる。AI時代には周囲のあらゆるものがネットワークの形でつながったときに大きな力を発揮するようになり、あの場面はそれを示す典型的な例だという説明だ。インフォシズはかなり以前からグラフ技術を準備してきた。現在はプラント、半導体、金融、公共など多くの産業でプロジェクトを進めている。代表が紹介した最近の事例は次のとおりだ。
- 半導体分野のセキュリティ脅威をグラフで精密に検知するプロジェクト
- 半導体の生産計画の最適化
- 国家最高機関の情報を構造化する作業
- 石油化学・エネルギー分野の図面認識
セキュリティ企業からグラフ企業へ
インフォシズはセキュリティ専門企業として出発した。代表は、セキュリティはITの中でも難易度の高い分野であると同時に、巨大なビッグデータの分野でもあると説明する。セキュリティの仕事をしながら、自分でも認識していない周囲のさまざまな情報がつながれば、知らなかったインサイトが得られるのではないかと日頃からよく考えていたという。その考えにぴったり当てはまったのがグラフ理論とグラフ技術であり、だからこの仕事を始めたのだと語る。
代表によれば、2025年を過ぎたあたりから、グラフ技術がベクトルRAGの次の選択肢として世界的に注目されるようになった。これをきっかけに、多くの企業がインフォシズに連絡してくるようになった。また今年は、国内最大規模の投資会社から投資を受けたと明かす。
契約を断念した決断
代表は最もつらかった時期として、ある大企業との大規模プロジェクトを挙げる。インフォシズは受注までに多大な労力と投資を注いだ。ところが受注が確定し契約する段階になって、その企業がソリューションのすべての所有権を自社に渡すよう要求してきた。代表は10日以上悩んだ末に、契約しないことを決めた。プロジェクト費用を一度受け取るのはよいが、そうすれば技術そのものに対する主権を取り戻すのが非常に難しくなると判断したためだ。
それまでに注いだ投資と努力が大きかったため、財務的な打撃も非常に大きかったと代表は言う。しかし結果として自社の技術力を守ることができ、これを機にさらに成長することができた。そのため代表は、この決断が今のインフォシズをつくった基本的な母体になったと評価している。
ビジョン技術なしで飛び込んだ図面認識
図面認識事業の始まりについても、代表自らが語る。字幕で「S4」と表記された顧客企業とミーティングをした際、顧客企業は毎回3,000枚ほどの図面を受け取っており、それを素早く認識する方法を6か月以上探していると話した。代表はグラフデータベースで読み取ってみてはどうかと提案した。顧客企業が可能なのかと尋ねると、可能だと確信を持って答えた。
会社に戻って社内の人員に話すと、「そうやって何でもできると言われても困りますよ」という反応が返ってきた。あるメンバーの回想によれば、当時の会社にはビジョン技術がまったくなかった。そこでまずはやってみようと始め、ドメイン関連の論文やビジョン認識分野の既存の試みを手当たり次第に探して読みながら、皆で成果物をつくり上げた。うまくいかないかもしれないと思っていたが、やってみたらできたという。代表は、顧客企業がとても驚いたと伝える。顧客企業は世界最大規模の企業と仕事をしてきたにもかかわらず、グラフ技術を活用するやり方を非常に新しい方法だと受け止め、それが大企業がインフォシズを選ぶきっかけになったという。
プラットフォームリード:経験を資産にする仕事
プラットフォームリードであり、FDE(Forward Deployed Engineer)も兼任するユン・ウン氏は、自身の役割を次のように説明する。複数のオントロジープロジェクトで繰り返し出てくる共通のニーズを一般化し、どの現場に行ってもその地点から出発できるようにすることだ。具体的には、字幕上「AId」と呼ばれる機能をつくっている。FDEたちがどんなことに悩み、なぜそのような選択をしたのかを全社的に集める機能だ。今後、企業のより深い課題に入り込んでいく際に、出発点が十分に先のほうにあるよう、経験を資産化することがその目的である。
ユン氏が入社して最初に担当したのは、保険約款のチャットボットだった。保険では、約款の中の段落を一つ見つけることが重要なのではないと説明する。人が判断する際に必ず一緒に参照しなければならない段落が、あちこちに散らばっていることが核心だった。これをグラフでモデリングし、必要な情報をすべて集めて回答するチャットボットをつくり、グラフを使うとベクトルRAGよりも答えられることが確実に増えるという効果を実感したという。
次に担当した公共機関のプロジェクトは、今考えてもかなり難しかったとユン氏は言う。どの文書を使うのか、どんな質問をするのかも決まっていない状態で、すべての非構造化文書をグラフにし、それに対応するチャットボットをつくってほしいという要求だった。当時は非構造化データにグラフを使い始めた頃で、オントロジーに至ってはどこにも正解がなかった時期だったため、さまざまな試みをするしかなかった。この経験以降、「必ず先に問題を定義し、その問題を解く方法を探す」がユン氏のルールになった。
現在、ユン氏が最も難しいと考えている課題は設計エージェントだ。インフォシズが得意とする図面と非構造化文書をつなぎ、さらにはシミュレーションまで可能にするエージェントをつくっている。顧客企業が先行して推進するプロジェクトであり、物理的な世界に近づいたプロジェクトでもあるという点で、これを重要な分岐点だと捉えているという。
ユン氏は同僚のキム・チャンハ氏についての印象も語る。自分は試行錯誤の末に、問題を明確に定義しなければならないという教訓を得たが、チャンハ氏は最初から「こうするとこういう問題がありませんか?」とすぐに指摘してくれる人だったとして、「天才」と表現する。チャンハ氏本人は、問題を解くことに少し執着するタイプだと言う。一つの問題だけを見るのではなく、上下左右を見渡しながら本当の問題が何かを探して移動していくように考えるのだと説明する。
技術リード:オントロジーレイヤーと自由度の削減
技術リードのキム・チャンハ氏は、企業の課題を理解し、AIを導入する仕事をしている。インフォシズに持ち込まれる課題はおおむね2種類だとキム氏は言う。社内で自力では解決しにくい、あるいは単にSaaSを適用するだけでは解けない課題、そして「パランティア」というキーワードを思い浮かべたときに連想される課題だ。そのため、顧客企業ごとに課題は非常に多様である。
キム氏は企業データを構造化データと非構造化データに分ける。構造化データは形式が決まっているため、機械が扱いやすい。一方、メールのようなメッセージや契約書など、それ以外のすべては非構造化データであり、扱うのが非常に難しい。そのため通常は、関連する内容を探してモデルに入力するベクトルRAG方式で開発する。インフォシズはここからさらに一歩進む。文書が扱う概念や対象をすべて抽出し、同じ概念を扱う複数の文書が一か所に集まるようにする。この中間段階を、インフォシズは「オントロジーレイヤー」と呼んでいる。
キム氏はこれをカーナビにたとえる。カーナビをつくるときに、建物があって道路がこうつながっている、というように道案内に不可欠な要素だけを抽出するのと同じく、複雑な概念を単純化・抽象化するのだ。この上でまず道を見つけ、その結果をもとに回答が出てくるため、はるかに正確になるとキム氏は説明する。また、回答がどのような経路をたどって出てきたのかが見えるため、運用もしやすくなるという。キム氏はこれをインフォシズの方法論の長所として挙げる。
キム氏は、短期間に没頭した重要な顧客企業のプロジェクトも紹介する。絶対に間違えてはならず、精度が100%でなければならないプロジェクトだった。キム氏は、AIに与える自由度を減らすほど精度が高まるだろうと考えた。自由度が大きいということは、それだけミスをする余地が大きいという意味だからだ。自由度を減らす手段として、ドメインに特化した言語、つまりDSLを思いついた。素早く実験してみたところ性能がよかったため、プラットフォームに反映し、新たな方法論として適用して成果を上げたという。
キム氏は、結局のところエージェントの性能に最も大きな影響を与えるのはデータ品質だと強調する。データをうまく整えるには、業務への理解度が高くなければならない。したがって、現場の担当者とエンジニアがほとんど一体となって働いてこそ、AIにうまく伝わる形に整えることができる。チームにはそうした人が多く、FDE一人ひとりが幅広く多くの仕事をこなせると信じているとキム氏は言う。
FDEの現場:シミュレーションエージェントと中間言語
FDEのシン・ジオン氏は、FDEを「前方配置エンジニア」、つまり顧客の課題を現場に直接入り込んで解決するエンジニアだと紹介する。課題の発掘から最後まで自分で手がけなければならない。プロジェクト開始前に現場とワークショップを行うこともあり、課題を解くにはそのドメインのある程度の専門家にならなければならないと語る。
シン氏が興味深い事例として挙げるのは、「S4」の顧客企業とつくった製品シミュレーションエージェントだ。どの製品を多くつくり、どの製品を少なくつくるかをシミュレーションし、原価もシミュレーションするエージェントである。このエージェントが営業利益に貢献し、それが株価にも好影響を与えているようで面白かったとシン氏は言う。
シン氏は、LLMでエージェントをつくる際、正しい答えだけを生成させるのは非常に難しいと語る。LLMにSQLを直接生成させると、現場のSQLはあまりに複雑で、人間にも理解しにくい。そこでインフォシズは、字幕上「オQL」と聞こえる中間言語をつくった。人間にもLLMにも理解しやすい形にすることで、ハルシネーション率をほぼゼロに近いところまで下げることができたとシン氏は伝える。また、自社ソリューションをベースに作業すると非常にスピードが速く、数時間でセットアップを終えてすぐに顧客企業にデモを行ったこともあるという。それが信頼を築くうえでも役立つとシン氏は言う。
シン氏は、市場でFDEの需要がさらに増えると見ている。大企業には、データを社内だけで整えなければならず、外部に流出させることはできないという制約がある。しかし社内の人員だけではすべての課題を解決することはできない。そのためFDEという職種を求めるようになり、こうした企業を引き続き好むようになるだろうという見通しだ。インフォシズが扱うデータには産業的・国家的に重要なものが多く、セキュリティが非常に重要だという点も付け加える。
MLリード:ルールのないセキュリティ検知
MLリードのピョン・ミョンジャン氏は大学院時代からAIを研究し、大企業のAI研究員や大手コマースプラットフォームのレコメンドシステムの機械学習エンジニアとして働いてきた。大学院に進学したときに抱いた「AIで世界を変えたい」という志に照らすと、これまでのキャリアには物足りなさがあったとピョン氏は語る。誰も解けていない問題に挑むというインフォシズの目標が、研究者として胸を躍らせたと、参加した理由を明かす。
ピョン氏は、インフォシズのセキュリティ製品は既存の製品とはパラダイムが異なると説明する。既存の方式では、ハッカーの過去の攻撃パターンがインターネット上に登録されていたり、自社で保有していたりして、それをもとに「こういう行動をしてはならない」というルールをつくる。ルールに反する行動が見つかれば、遮断したりアラートを送ったりする。一方、インフォシズの製品は最初からそうしたルールを想定しない。ある人が普段の業務から大きく外れた場合に、自動でアラートを出す。それをさらに推論モデルに渡して脅威かどうかをふるい分けたうえで、セキュリティアナリストに伝える仕組みだ。
ピョン氏によれば、この製品で、時価総額上位のある半導体企業において、これまでまったく捉えられなかった種類の脅威を検知したこともあった。一瞬で大量のデータを持ち出す攻撃は捉えやすい。しかし、30日間潜伏しながらデータを少しずつ外部に流出させる攻撃もある。こうした攻撃は1時間分のログではわからず、長期間のログをグラフの形で把握して初めて捉えられるとピョン氏は説明する。グラフベースの異常検知を大規模エンタープライズに適用して実証した事例は、自分の知る限り国内にはなく、インフォシズが初めて試みて有数の企業で良い成果を上げたと理解しているとピョン氏は言う。
同じ流れで、グラフデータを活用した図面認識プロジェクトも進めている。ピョン氏によれば、この作業はほとんど人が手作業で行っており、手作業では最低でも8時間以上かかっていた。インフォシズの製品で自動認識すれば5分以内に短縮され、実際の作業効率を大きく高めるという。複雑な図面の接続関係を復元することは学術界でも解決されていない難題であり、インフォシズがほぼ初めてそれを商用化可能な水準まで引き上げたとピョン氏は主張する。現在はソウル大学との共同研究も行っている。
台湾から来た研究者の図面エージェント
図面認識チームには、台湾出身のオリバー氏がいる。ピョン・ミョンジャン氏によれば、オリバー氏はここで取り組む問題が本当に難しく、そのぶんインパクトも大きそうだと感じてインフォシズに関心を持ったという。オリバー氏は中国語でインタビューに応じた。台湾でしばらく天文学の研究員として働き、いくつかの重要な成果を国際学術誌に発表した後、ソウル大学のデータサイエンス修士課程に進学したと自己紹介する。
オリバー氏がインフォシズで担当しているのは、工学図面の構造を精密に把握するAIエージェントの開発だ。オリバー氏はこの問題が難しい理由を次のように説明する。図面のスクリーンショットをChatGPTに入力しても、GPTは図面上の各部品間の接続や配管の流れの方向を正しく理解できない。そのためオリバー氏は、ハーネスエンジニアリング(harness engineering)の手法で、AIに低レベルながら精密な幾何認識ツールを提供する作業を行っている。
現在最も重要な成果は、「dataflow」と呼ぶプロジェクトだ。図面上の部品の接続関係と流れの方向を、信頼性の高いデータの基準点に変換する。これによって、AIが推論する際に大まかな推測をしたりハルシネーションを起こしたりせず、図面を精密に理解できるようにするというものだ。オリバー氏はこの成果を大規模エネルギープラントの顧客企業の責任者に見せ、責任者は現在の成果物がここまで精密であることに大いに驚いたと伝える。
オリバー氏は、外国人の視点からは韓国を非常に上下関係の強い社会だと捉えがちだったが、インフォシズがその印象を完全に覆したと語る。会社がメンバー間の対等な協業関係を非常に重視していると感じたという。別のメンバーも、さまざまな年代の人が混ざって一つのチームとして働くのは簡単ではないこともあるが、代表が柔軟なので、そうした構成でもうまく働くことができると付け加える。
メンバーから見た代表、代表が語る信頼
メンバーたちは代表についてさまざまな印象を語る。安心感を与えるタイプだという評価がある。「僕たちが解いているこの問題、すごく面白いと思わない?」という話を無邪気に繰り返し、問題解決に真剣な人だと感じたという声も出る。会社がどんなに苦しくても社員のことをまず考え、給料が遅れることは絶対にないようにしたという証言もある。また、知らない分野に飛び込んだりピボットしたりすることを恐れず、社員を信頼してくれるという評価もある。
代表は会社の核となる価値として、信頼、創意、没入(すなわち情熱)の三つを挙げる。会社にも財務的に非常に苦しい時期があったと認める。それでも自分が感じる責任感は信頼から来ていると語る。顧客にはより良い製品を納品するという信頼を、社内のメンバーには会社のビジネスが続いていくという信頼を、自分がまず与えなければならないという思いが骨の髄まで染み込んでいると説明する。
リファレンスのない問題の難しさ
ピョン・ミョンジャン氏は、国内のB2C企業で機械学習エンジニアが行う仕事は、ほとんどが検索、広告、レコメンドのいずれかに決まっていると語る。こうした仕事はパターンが規格化されており、米国シリコンバレーのベストプラクティスが存在する。一方、インフォシズが扱う問題は世界のどこにもリファレンスがなく、研究面でも難易度が非常に高い点が魅力だとピョン氏は言う。
B2B企業といえば、ソリューションを導入して運用上の問題に対応する程度だと考えがちだが、そうではないとピョン氏は強調する。むしろB2Cよりもはるかに整理されていない生データを、意味論的に整合した形へと引き上げなければならない。これはB2Cで経験した大規模な問題よりも難しく、技術的にもむしろ先を行っているとピョン氏は評価する。
メンバーたちは会社の強みについても語る。図面認識は現在どこにもない領域であるため最前線で取り組んでおり、それゆえビジョン分野に確かな強みがあると見ている。非構造化データからオントロジーをつくる部分では、最も多くの経験を積んできたという評価も出る。兆単位の売上を上げる企業の最も重要なプロジェクトを手がけながら積み上げてきた経験と共有資産が差別化要因になるだろうという声もある。
物理設備のデジタル化とAI主権
代表は、産業現場の物理的な設備をデジタル化する作業が必要であり、それがインフォシズの図面認識技術だと語る。設備から流れてくるセンサーデータや工程データがオントロジー化されて意味論的につながれば、一つの巨大なシミュレーションが可能になるというのが代表の構想だ。代表は、インフォシズには決して譲れない固有の技術があると強調する。
代表は、パランティアをはじめエヌビディアのような企業が韓国に進出してくる状況の中で、先進技術を活用しつつも、韓国独自の主権にあたるAIインフラをつくる必要があると主張する。この技術はデータを流出させるのではなく、方法論そのものを輸出できる重要な技術だと代表は語る。
エージェント数千個の時代とロボット
代表は、企業がいま最も力を入れているのはエージェントの構築だと語る。代表によれば、これまで企業が導入したエージェントは多くても10〜20個程度だった。今後はエージェントが数百、数千個に増える時代が、今年の下半期から来年初めにかけて本格的に訪れると代表は予想する。そうなればエージェントが企業のほぼすべての業務を担う時代になり、エージェントの管理と情報の伝達が非常に重要な課題になるという見通しだ。あるメンバーは、資金力のある大企業だけがエージェントを使えるようであってはならないため、オントロジー構築のプロセスそのものがかなりの部分まで自動化されなければならないと付け加える。
代表は、ロボットも同じだと語る。ロボットは展示会などで華々しく紹介されるが、実際の生産現場に投入されるケースは非常に少ないと代表は指摘する。現場で何をすべきかについてのガイドや情報が、きちんと伝わっていないからだという。エージェントとロボットが適切に機能するためには、企業の情報と構造がきちんと伝達され、活用され、管理されなければならず、その役割を担う最も重要な技術の一つがグラフとオントロジーだと、代表は繰り返し強調する。
人への信頼と残された道のり
あるメンバーは、AIは人の仕事を代替できず、とりわけ考える人を代替することはできないと語る。人がより深く考えられるよう、不要な仕事を減らしてくれる製品を人間中心につくっているのだと説明する。その目標に照らせば、今は30%ほどまで来ていると自己評価する。別のメンバーは、AI開発者は一歩間違えれば、目先では自分の利益になっても長期的には社会に害を及ぼしやすい職種だと警戒する。だからこそ、それぞれがどんな選択をし、どれだけ誠実であるかが非常に重要だと考えている。本当の問題を解決するには「あそこまで行かなければならない」と言える仲間たちだから、信頼できるのだという。
難しい問題に取り組んでいるだけに、つらい時期も多かったとメンバーたちは認める。そんなときでも皆「とりあえずやってみよう」という姿勢で、南極に行くために装備を整えて出発する冒険のような感覚で働いていると、あるメンバーは表現する。問題から逃げずに解決する力は結局のところ人から生まれるものであり、インフォシズの最大の強みは人だという声も出る。別のメンバーは、難しいということは誰も解けていないということであり、解けたときに産業に与えるインパクトが非常に大きいことの裏返しだと語る。だから難しい問題に出会うとむしろ興味が湧き、生み出せるインパクトを想像しながら、より楽しく没頭するのだという。最も難しい問題を解くために集めた「宝石」のような人たちが、それぞれ異なる個性と問題解決の方法を持っているのがよいという話も続く。
代表は、インフォシズが最も重視する人材像を「限りなく挑戦し続ける人材」とまとめる。世界で最も難しく、解けそうにないが解く価値のある問題に共に取り組もうとする人たちが集まったと代表は語る。彼らが同じ哲学と信念のもとで互いを信頼しながら企業のAI導入を支援し、企業が効率化されるほど世界により大きく貢献できるというのが、代表の結論である。
該当する記事はありません。
記事公開
