韓国で見向きもされなかった「映像理解AI」が、シリコンバレーで1億ドルを調達するまで:Twelve Labs イ・ジェソン代表とNAVER Ventures パク・ヨンジョン パートナーの対談

翻訳元 한국어

YouTubeで開く ↗
概要

Twelve Labsは、映像を人間のように理解するAIをつくる会社だ。最近、約1,500億ウォン(1億ドル)規模のシリーズBを完了した。このラウンドは米国のNEAとNAVER Venturesが共同でリードした。NVIDIA、Amazon、Snowflake、Databricksといった戦略的投資家が参加し、Index Ventures、World Labsを立ち上げているフェイフェイ・リー、Metaに会社を売却したアレクサンダー・ワンらも株主に名を連ねた。

19分で読めます

この動画は、Twelve Labsの梨泰院オフィスを見て回ってメンバーに会ったあと、イ・ジェソン代表とNAVER Venturesのパク・ヨンジョン ジェネラルパートナー(YJ)と対談する構成になっている。中心となる問いは二つだ。誰もが言語モデルに殺到していた時期に、20代の韓国人創業チームはなぜ最も難しい映像を選んだのか。そして、韓国で投資家を見つけられなかったチームが、どのようにしてシリコンバレーでビッグテックと競うまでになったのか。

映像を理解するAIとは何か

イ・ジェソン代表はTwelve Labsを「映像を人間のように理解するAIをつくる会社」と紹介した。顧客はTwelve Labsのモデルを使って膨大な映像データを素早く検索し、新しいコンテンツを制作する。また映像を素早く分析し、スポーツ分析やハイライト生成といった作業に活用している。

ソウルとサンフランシスコの2カ所に拠点を置くが、役割は異なる。イ代表によれば、顧客がいま使っているモデルとエージェントの開発はすべてソウルで行われている。サンフランシスコではそのモデルの上に自社のラッパー製品をつくり、市場進出(GTM)も主にそこが担う。最近は韓国のGTMチームも立ち上げているという。コア開発を韓国に置く理由として、彼は韓国人創業者であることに加え、「韓国で行われている研究は引けを取らないという思い」、つまり「ここでもつくれる」というプライドを挙げた。

なぜテヘラン路ではなく梨泰院なのか

韓国のスタートアップは通常、テヘラン路や駅三駅周辺に拠点を構える。Twelve Labsもそうした勧めを多く受けたという。それでも梨泰院を選んだのには理由がある。創業者たちは龍山で一緒に兵役に就いており、休暇や外出の際にこの近くのカフェで一緒に仕事をすることが多かった。そのためイ代表にとって梨泰院は初心を象徴する場所なのだ。米国と韓国のメンバーが混ざって働くことになるので、インターナショナルな雰囲気が合うという判断もあった。

彼は、世の中にないものをつくるには、雑音から離れた「自分たちだけのアジト」が必要だと考えた。うまくやれば投資家は自然と訪ねてくるだろうと思っていたという。今のオフィスは、もともとインテリアデザイン会社が使っていた空間だ。天井の高いアトリウム構造で窮屈さがなく、互いの顔が見えるよう開けている点が気に入ったと語った。

メンバーが語るTwelve Labs:視覚知能とエージェント「Jockey」

機械学習リサーチサイエンティストのチェ・セヒョン氏は、ソウル大学で博士号を取得し、サムスン電子で約2年間働いた。彼は大学院時代から、視覚知能を「真の知能へ至る道の一つ」と考えていたという。人間の脳が処理する情報の70%以上が視覚情報であることを根拠に挙げた。サムスン電子では大きな仕事ができたが、やりたかった視覚知能の研究とは距離があった。そこでコンピュータビジョンと映像分野の機会を探すなかで、Twelve Labsを知った。

彼のチームは「Jockey」という新製品を研究開発している。JockeyはTwelve Labsの二つのモデル、PegasusとMarengoを組み合わせて使う。大量の映像データから、ユーザーが求める情報を迅速に提供することが目標だ。そのために映像、画像、さらに他のモダリティまで構造化して保存・消化する「エージェンティック・プラットフォーム」だと彼は説明した。質問すると答える対話型エージェントとは異なり、エージェントがデータを自在に扱い拡張することに重点を置いている点が差別化ポイントだという。機械学習リサーチエンジニアのソン・サンヒョン氏も併せて紹介された。

イ代表が「精神的支柱」として挙げたのは、社長兼最高戦略責任者のキム・ユン博士だ。イ代表によれば、キム博士は創業者出身だ。AppleでSiriをつくったチームの主要メンバーであり、SKTでCTOを務め、ベンチャー投資も手がけた。イ代表は2年かけて口説き落として迎え入れたと言い、「ぜひ見習いたい先輩」だと語った。

入社20カ月目だというキム博士と思われる発言者は、最初はTwelve Labsに投資家の立場で接したと振り返った。約4年前、ChatGPTが登場する前のことだ。当時はGPT-3.5でさえコストが高すぎて潰れるだろうという話がニュースに出ていた頃だった。そのため映像理解という課題を初めて聞いたとき、「とても良い、重要で難しい問題だが、うまくいかないだろう」と思ったという。それでも可能性の幅があまりにも大きく、「一度やってみよう」という気持ちになったと語った。進行役は、映像モデルは言語モデルよりはるかに多くのGPUを必要とするのではないかという通説にも触れた。

NAVER Venturesの第1号投資の論理:テキストは圧縮された記録だ

パク・ヨンジョン パートナーによれば、NAVER Venturesは設立から1年ほどで、Twelve Labsはその最初の投資先だった。彼は投資の論理はシンプルだったと語った。

彼の説明はこうだ。世界のデータの80%以上は映像の形をとっている。ところがここ数年、AIモデルの大半はテキストの上に築かれてきた。テキストは人間が現実世界を事後的に圧縮した記録であり、その過程で多くのものが失われる。彼はワイングラスの例を挙げた。字幕には「ワイングラスが割れた」と1行書かれて終わりだが、実際の映像はその前後の一瞬一瞬をそのまま収めている。だからAIが物理世界を理解するには、結局こうした生の信号を扱わなければならないというわけだ。

パク・パートナーは、この一つの課題に5年以上集中してきたチームは世界でTwelve Labsだけだと判断した。狭い分野を深く掘り下げながら、ビッグテックやフロンティアラボが追いつきにくい実行スピードで事業を伸ばしているとも見た。その根拠として、世界的なハリウッドのスタジオが映像技術を導入する際、ビッグテックの類似モデルではなくTwelve Labsを選んだ事例が何度も繰り返されたことを挙げた。

そのため彼は、「最終的にはビッグテックがすべてを持っていく」という前提は必ずしも正しくないと語った。歴史的な事例も示した。ハイパースケーラーがクラウド市場を掌握したにもかかわらず、データストレージとアナリティクスではSnowflakeとDatabricksが意味のある成長を遂げた。決済ではStripeが、コーディングではCursorが新しいカテゴリーをつくった。パク・パートナーは、映像理解はいままさにそうした空白地帯であり、Twelve Labsがその場所に最も近いと評価した。

二人が出会った経緯も紹介された。パク・パートナーがシリコンバレーに移ったのは約2年前だ。シリコンバレーのあるVCを離れて自分のファンドを立ち上げていたインド系の投資家が、彼を韓国から来た投資家と知って、イ代表を紹介してくれた。進行役は、韓国人の二人がインド系の投資家を介してシリコンバレーで出会ったことについて、「巡り巡って出会ったわけだ」と表現した。

パク・ヨンジョン パートナーとNAVER Ventures:関係で築いたネットワーク

パク・パートナーはNAVERで投資業務に携わって8年あまりになる。事業部が検討する戦略的投資案件のデューデリジェンスと実行を担当した。あまり知られていないNAVERのグローバル投資業務も一部担当しており、そこにはスタートアップへの直接投資から、複数のティア1 VCへのLP出資までが含まれる。その過程でシリコンバレーの主要VCとの関係を築いた。それを土台に、AI時代の創業者に直接投資し、投資後にNAVERとの協業を図るためにシリコンバレーに出てきたと説明した。

進行役は、a16zやLightspeedのようなところは、お金があるからといって誰でも受け入れてくれるわけではないのに、どうやってそうしたネットワークをつくったのかと尋ねた。パク・パートナーはまずその難しさを認めた。ファンド規模が大きくなり、メガファンドの運用会社が登場したことで、小さな金額で戦略的な関係をつくることはほぼ不可能になったという。それでも、ベンチャー産業はガレージから始まった非常にパーソナルなビジネスだという点を強調した。出資者と運用会社という関係ではなく、人と人として互いに何を助け、何を助けてもらえるかを長く積み重ねてきた関係が力になったというのだ。

その結果、出資額にかかわらず、韓国の技術や企業について知りたいときに真っ先に連絡を受ける人物になったという。韓国のスタートアップが北米に進出して現地のVCと接触する機会が増え、そうしたVCがリファレンスを得るためにまずNAVER Venturesに連絡してくる。NAVER出身の創業者も多く、個人的な質問をしてきたり、デューデリジェンスの過程で彼の意見を参考にしたりするという。

シリーズBの意味:テキストだけの「意味レイヤー」に映像を加える

イ代表は今回のシリーズBを一つのシグナルとして受け止めた。大規模な映像処理技術、その上の自社映像基盤モデル、さらにその上に積み上げるエージェントスタックまで、きちんとスタートが切れたのだから、もっと速く、もっと大きく前進せよという意味だと語った。

彼はこれをよりマクロな視点で説明した。テキストが圧縮データだとすれば、映像は人間が世界を学ぶときに使う源泉データに近い。いま業界はどこも「トークン」の話ばかりだ。表形式のデータやPDFの原本のようなデータも、言語モデルを経て意味レイヤー、つまりセマンティックデータに変換されるが、その大半はテキスト由来のトークンだ。映像を理解して入ってきたトークンはこのレイヤーにほとんどない、というのが彼の診断だ。視覚的に正確な情報がこのレイヤーに入れば、はるかに複雑な問題を解けると彼は見ている。Twelve Labsは、このセマンティックデータレイヤーをより堅牢で活用可能なものにする役割を担っていると説明した。

進行役は、AIが人間のように理解し行動するには結局「目」が必要であり、その大きな柱がビデオだと応じた。イ代表もロボティクスを例に挙げて同意した。Vision-Language-Actionモデルのようなものも、映像理解が本当にうまくできてこそ、ロボットに必要な性能が出るというのだ。

軍隊の先輩後輩から創業チームへ:「めちゃくちゃ難しい」問題を選んだ理由

進行役は、この事業は若い人よりも経験豊富な天才たちが集まってやるものに聞こえるとして、創業の経緯を尋ねた。イ代表によれば、創業者たちは軍隊の先輩後輩として出会った。2018年から2020年ごろ、特殊な環境で一緒にAIの研究開発を行い、大規模な映像理解の問題に取り組んでいた。その中で、自分たちの間で映像は「本当にめちゃくちゃ難しいな」と感じたという。

もともとの計画は、除隊後にみんなで大学院に進むことだった。ところがTransformerの論文が出て、意味のあるAI研究をするにはスケーリングが必要に見えた。優れたプレイヤーはテキスト側に集まっていて、映像から出発して知能システムをつくるグループは不在に見えた。イ代表は「賢くはあるが、これがどれほど難しいかを知らない状態でぶつかったから」できたのだと思う、と振り返った。

進行役は、GPT以前の2018年にTransformerに触れた賢い人たちはほとんどがテキストに飛び込んだのに、なぜわざわざ難しいほうを選んだのかと改めて尋ねた。イ代表は会社の哲学と結びつけて答えた。世界をよく理解するAIこそ有用なはずで、そのためには人間が世界を学ぶ信号に最も近いデータから学習を始めるべきではないか、という疑問を強く抱いたという。誰もやっておらず、難しく、言語モデルより馴染みのない分野だからこそ、かえって独自のポジションを取れると考えた。彼は「難しいからこそ、より執着するようになったのだと思う」と語った。

生成によって理解するより、人が映像を見るやり方から学ぶ

進行役は、拡散モデルの登場以降、映像生成がうまくいくようになったが、そうした流れが検索や理解にもヒントになったのかと尋ねた。イ代表は、拡散モデルとTwelve Labsのモデルは異なると一線を引いた。拡散モデルは生成モデルであり、生成を通じて世界を理解しようとするワールドモデルの方向性でもある。しかし彼は、生成を通じた理解が先にうまくいくかどうかには疑問があったという。

言語モデルは、次の単語をうまく予測できれば優れたシステムになるという仮説の上に成り立っている。これをそのまま映像に移すと、次のフレームを予測してみようという発想になる。しかしイ代表は「それはうまくいかない」と語った。そのため、拡散モデルや言語モデルからヒントを得るよりも、人が映像を見るときにどう処理しているかをよく考えているという。

例に挙げたのはキム・ヨナ選手のスケーティングだ。長く滑走する場面はゆったりと見ていて、トリプルアクセルを跳ぶ直前にはぐっと集中して見る。こうした注意の配分をデータ処理システムでどう実装するかから、多くのインスピレーションを得ていると彼は説明した。

VCが創業者を見る基準、そして韓国での拒絶

進行役は、3年前にシリコンバレーで初めてイ代表に会ったとき、「韓国にはいないタイプの創業者」だと感じたと語った。パク・パートナーも同じ印象を受けたと言い、VCが創業者を見る基準を説明した。第一に創業者と市場のフィット、つまりなぜほかでもないこの人がこの問題を解くことができ、解くべきなのか。第二に、トレンドを追う人なのか、この問題そのものに打ち込んでいる人なのか。第三に、リソースが足りなくても最後までやり遂げようとする執念と、それに耐えるスタミナがあるか。彼は、イ代表はこの三つがすべて重なる稀なケースだと判断したと語った。

進行役は2023年のシリコンバレーの雰囲気も振り返った。AIでPPTをつくってくれる会社が数百億、数千億ウォン単位の投資を受けていた頃で、映像を理解する基盤モデルをつくるという話は初めて聞いたという。ところが話してみると、韓国で創業して投資先を回ったものの、このビジョンを信じてくれる初期投資家が韓国にはいなかった。そのため海外に出るしかなかったという事情を知ったと語った。

イ代表は、自分たちが先を行き過ぎているかもしれないことは分かっていたと答えた。シリコンバレーには、こうした技術をもっと寛容に評価してくれる観客がいそうだと思ったという。うまくいくかは分からなくても「すごく難しくて面白いことをやってるね」と応援してくれる雰囲気が、向こうのほうが多かったというのだ。韓国にも好意的に言ってくれる投資家はいたが、当時は市場への理解が形成されておらず、市場そのものがなかったという。結局、「韓国でつくって、シリコンバレーに行ってなんとか戦って勝とう」という結論に至った。彼はこれを「無謀に、勇敢に」出ていって戦ったのだと表現した。

ローンと家庭教師代でつくった最初のモデル、そしてIndex Venturesのシード

モデルをつくる会社には多額の資金がかかる。イ代表は除隊後の初期の過程をこう語った。コロナ禍の時期にリモートでアクセラレーターのTechstarsに参加したが、本当に大変だったという。CTOは、米国の大学入試共通テストにあたるSATの家庭教師で生活費を稼いだ。イ代表は以前働いて貯めたお金で持ちこたえた。仲間があまりにも苦しんでいたので、ローンを組んで共同創業者たちの機材を買い、給料も払った。彼はこれを「後がない行動」「なんとかなるだろう」だったと表現した。

決定的な助けとなったのは、Techstarsを通じてアマゾン ウェブ サービス(AWS)から受けた相当額のクレジットだった。イ代表は当時と今の規模の差にも触れた。今はモデル一つの訓練に1,000億ウォンかかるが、当時はモデル訓練に3億ウォンを費やしたというだけで驚かれる時代だったという。持っているものをすべてかき集めてつくったのが、検索モデルMarengoのプロトタイプだ。このモデルがICCVという国際大会の映像理解部門で1位を獲得した。

この成果がIndex Venturesの目に留まった。イ代表はIndex Venturesを、Anthropic、Figma、Notion、Cohereなどに投資したシリコンバレーのティア1 VCとして紹介した。すでに言語モデルに賭けていたIndexが「LLMとテキストの次は何か」を考え、2022年にビデオという答えを出したのだろうと語った。シードラウンドの規模は500万ドルだった。

パク・パートナーはここでNAVERの「悲しい記憶」を持ち出した。そのシードラウンドに、NAVERでシード投資を専門とするD2SFが投資の意向を伝えたが、断られたというのだ。イ代表は、Indexがラウンドをすべて取りたがっていたうえ、エンジェル投資家も大きな金額を出したためだと説明した。

Indexがどれほどすごいベンチャーキャピタルなのかも、イ代表は後になって実感したという。契約書に署名した後、Techstarsのマネージングディレクターに電話して、サインしたと伝えた。相手はひどく驚いたが、「すごいじゃないか」という反応というよりは、そういう決定は相談してからするものだ、こういう戦略もあるのだ、という調子だったという。イ代表はその出来事から多くの教訓を得たと語った。署名して2〜3カ月後には、違うやり方をすべきだったかと思う気持ちもあったが、今はありがたく思っていると述べた。

メディア経験のないチームの営業:バースツール3脚と「切実さ」

進行役は、20代の韓国人で、ソフトウェアを売った経験もメディア業界の経験もないチームが、どうやって顧客を獲得したのかと尋ねた。イ代表はメディアをまったく知らなかった頃の話を持ち出した。メディア・エンターテインメントの顧客がアムステルダムの国際放送機器展(IBC)に多く来ると聞き、とにかく行ってみることにした。ブースは高くて出せなかった。代わりにバースツールを3脚なんとか確保して真ん中に座り、Netflixの人が通りかかると「Netflix!」と呼び止めたという。

秘訣を尋ねられると、彼は「本当に秘訣はないと思う」と繰り返した。ただ「誰よりも切実ではあったと思う」と言い、そういう姿を嫌がる人もいただろうと付け加えた。

モデルはすぐに置き換えられる:「映像認知システム」というフルスタック

話題は集中の問題へと移った。進行役と思われる発言者は、OpenAIとAnthropicを例に挙げた。OpenAIが戦線を広げている間に、Anthropicは文章作成とコーディングの二つだけを推して良い数字をつくった。ところがAnthropicがデプロイ側に戦線を広げると、OpenAIは逆に絞り込んでCodexに集中し、正面からぶつかっているという説明だ。彼は、モデルはすぐに置き換えられると評した。

イ代表は、だからこそモデルだけでは不十分だと語った。モデルの上にインテリジェンスレイヤーを置き、その上にシステムを置き、そのシステムで価値を生み出すところまでフルスタックで届けてこそ、置き換えが難しくなるというのだ。Twelve Labsがつくっているのは、イ代表が「映像認知システム」と呼ぶものであり、先に触れたエージェント製品Jockeyがその実装だ。彼はこのシステムを三つのレイヤーで説明した。映像を認識するレイヤー、認識された事実をもとに映像についての記憶をつくるレイヤー、そしてその記憶をいつでも見返しながら推論するレイヤーだ。

ソブリンAIを再定義する

進行役は、韓国と米国のAI言説の違いに物足りなさを示した。米国はAIを覇権争いとして捉えて攻撃的にアプローチしているのに対し、韓国は防御的な観点からのソブリンAIの議論が中心だというのだ。彼は、自分たちだけのAIも重要だが、この機会に世界標準になり得るものをつくって供給する優れた会社が出てくるべきだと語った。Twelve Labsはその代表格だとも述べた。

イ代表は、ソブリンAIの定義はいまだに明確ではないと答えた。進行役が、ある時点から国境の意味が消えたように思うと言うと、彼も同意した。彼が考えるソブリンAIとは、他国の企業がサービスをつくる際に使うインテリジェンスレイヤーに組み込まれるモデルだ。世界中の企業が価値を生み出すたびに、わずかな取り分でも継続的に得られるもの、それがソブリンAIになり得るのではないかと語った。

今後の計画:すべてのカメラ映像を処理する日まで

イ代表は、計画はシンプルだと語った。誰よりも映像をよく理解し、顧客の役に立つ製品をもっと懸命につくることだ。ただし「今やっていることよりはるかにうまくやること」が、実行するのが最も難しいと付け加えた。目標としては、カメラで撮影された映像がすべてTwelve Labsを通じて処理される日を掲げた。

パク・パートナーは、Twelve Labsのような創業者を発掘し続けることを最大のミッションに挙げた。NAVER Ventures自体も、まだ1年しか経っていない「投資するスタートアップ」のようなものだという。彼が語った方向性は二つだ。一つは、韓国の創業者がシリコンバレーや北米市場に進出する際に支援すること。もう一つはその逆方向で、投資した米国企業がアジアに進出する際に、誰と会い、誰を採用し、技術をどう検証するかを共に考えるパートナーになることだ。彼は、Twelve Labsはこの二つの方向が一つの会社の中で同時に起きている事例だと捉え、新しいカテゴリーをつくる取り組みをそばで応援し続けたいと語った。

イ代表は最後に、韓国のAIと米国のAIを分ける区別は、もはやある程度無意味だと語った。今はモデルであれエージェントであれ、リリースされた瞬間に世界中の人が試し、すぐに市場の評価にさらされ、国境がそれを防いでくれることはないというのだ。だからこそ、韓国でつくったモデルも自信を持ってシリコンバレーで戦い、勝つ姿をたくさん見たいと語った。Twelve Labsはそうした信念を持って、新技術が次々と生まれるシリコンバレーで戦っていると明かした。三人は、AI時代に3年は長すぎるとして、1年半後にさらに成長した姿で再会しようと約束し、対談を終えた。