MotuBrainのワールドモデルが2つのグローバルベンチマークで首位を獲得 — ロボット知能における画期的な進展

motubrainの世界モデルが2つのグローバルベンチマークで首位を獲得――ロボット知能における画期的な進展

社名を明かさないにもかかわらず、2つの世界的なベンチマークで首位を獲得

ここ数日、ワールドモデル空間は例年になく活気にあふれています。.

李飛飛氏が率いる空間知能分野のユニコーン企業「World Labs」が「Spark 2.0」を大々的に発表すると、アリババもすぐに世界モデル「Happy Oyster」を発表した。“

ほぼ同時期に、Physical Intelligence社も新モデル「π 0.7」をリリースし、未見のタスクに対する初期の構成的汎化能力と、ロボットプラットフォーム間の転移特性を強調した。.

こうした一連の動きそのものが、あるメッセージを発信している。すなわち、この業界における競争の焦点は、個別のアクションを実行できるかどうかにあるのではなく、「世界の予測」と「アクションの推進」を単一のモデル内で統合することに、より近づいているかどうかに移りつつあるのだ。.

この時点で、いわゆる MotuBrain 社名を一切明かさずに、ひっそりと2つの国際的なベンチマークのトップに躍り出た。.

もし、あるランキングで1位になっただけなら、それほど珍しいことではないかもしれない。.

しかし、重要なのは、同時に廃止されたのが、この業界の「両極端」をほぼ象徴する2つのリーダーボードであるという点だ。1つは、ワールドモデルが現実世界を真に理解し、予測できているかを測定する「WorldArena」、もう1つは、ロボットのタスク実行能力と汎化能力を評価する「RoboTwin2.0」である。 一方は世界の予測に、もう一方はタスクの実行に重点を置いており、これら二つを合わせると、まさに業界が現在解決しようとしている統一された課題にぴったりと合致するのです。.

MotuBrainが「WorldArena」と「RoboTwin2.0」の両方で首位に立つ

motubrainは、worldarenaとrobotwin2.0の両方で首位を走っている

WorldArenaにおいて、MotuBrainは総合EWMスコア63.77を記録し、1位を獲得しました。この結果から、その性能はGaodeのABotやJijiaのGigaWorld-1といったモデルを上回っており、モーション品質、フロースコア、モーションの滑らかさといった主要なモーション指標のすべてでトップの成績を収めています。.

RoboTwin2.0において、MotuBrainは「Clean」設定で95.8、「Randomized」設定で96.1を記録し、いずれも1位となりました。 ランダム化された環境において平均スコアが95を超えるリーダーボード上の唯一のモデルであり、ほとんどの特定タスクでは100、あるいは100に近いスコアを達成しました。Gaode ABotなどのモデルと比較すると、, Ant Lingbo LingBot, 、JEPA-VLA、およびpi0.5において、MotuBrainはRoboTwinベンチマークで圧倒的な性能を発揮しています。.

RoboTwin2.0において、MotuBrainは「Clean」設定で95.8、「Randomized」設定で96.1を記録し、,

まさにこの「ダブル1位」こそが、この無名のモデルに注目が集まり始めた理由なのです。.

ざっと検索してみると、MotuBrainに関する情報はネット上には依然としてほとんど見当たらないが、今月登録されたばかりのXアカウントが1つある。.

これを見ると、以前の「Huanle Ma」を思い出します。このアカウントは後にアリババが権利を主張しました(アリババもその後、Xアカウントを開設しました)。.

この謎めいた世界モデル――もしかすると、国内の大手IT企業によるものなのかもしれない?

MotuBrainの成果が重要な理由

WorldArenaとRoboTwinは同じ種類のテストではなく、それぞれ異なる能力を測定するものです。.

WorldArenaは、世界モデルの次元を評価します。具体的には、そのモデルが運動法則を理解できるか、時系列における物理的な変化を正確に推論・予測できるか、そして環境状態の変化を認識できるかといった点です。これが「世界を予測する能力」です。.

一方、RoboTwinは、アクションモデルやポリシーモデルの側面を重視しています。例えば、モデルが複数のタスクや環境にわたって安定してアクションを実行できるか、未見のシナリオに一般化できるか、そして複雑な操作を継続的に完了できるかといった点です。これは、現実世界で行動する能力に他なりません。.

こう考えてみてください。人間のドライバーが複雑な交通状況の中で安全に運転できる理由は、単なる筋肉の記憶だけでなく、次の1秒に何が起こるかを絶えず予測しているからです――前の車が急にブレーキを踏むだろうか? 歩行者が予期せず横断してくるだろうか? こうした予測と行動の連動こそが、人間の知性の根底にある論理なのです。.

既存のロボットシステムの多くは、まさにこの層を欠いている。外界を理解するのは得意だが、どう行動すべきか分からないものもあれば、あらかじめ決められた行動は実行できるものの、環境の変化を予測できないものもある。この二分化により、ロボットは訓練シナリオから外れると、容易に機能不全に陥ってしまう。.

ここ数年、これら両方面の研究が進められてきたが、その多くは互いに独立して行われてきた。 映像生成やワールドモデルに取り組むチームは、モデルが物理世界を現実的にシミュレートできるかどうかに焦点を当てており、ロボットのポリシーやVLAに取り組むチームは、特定のタスクにおいてモデルを確実に実行させる方法に焦点を当てている。この2つを真に統合しようとする試みはほとんどなく、安定した成果はさらに少ない。.

MotuBrainが両方のベンチマークで1位を獲得できたことは、少なくともベンチマークのレベルにおいて、世界予測と行動制御を単一のモデル内に統合することが実現可能な道筋であることを裏付けている。.

ダブル1位:どちらが優勝するのか?

WorldArenaのランキングにおいて、MotuBrainが際立っている点は、いくつかの指標でトップを走っていることです。.

「モーションの品質」が1位となっており、これはモデルによって生成される動作が、単なる視覚的な動きの効果にとどまらず、より現実的であることを意味します。.

Flow Scoreが1位を獲得しており、これは連続的な動きや軌跡に対する深い理解と、大規模な動きの変化を安定して予測する能力を示しています。つまり、フレームごとに繋ぎ合わせるのではなく、ある瞬間から次の瞬間へと滑らかに繋げているのです。.

「動作の滑らかさ」が1位となっており、これは生成された動作が実際の物理法則により忠実に従っており、不自然な急加速や揺れ、方向の急変がないことを意味します。.

これら3つの次元はすべて、動きと直接的に関連しています。ロボットに活用されることを目的とした将来の世界モデルにとって、これこそがまさに最も重要な機能なのです。.

タスクの実行に重点を置いたRoboTwinでは、この優位性がさらに際立っています。50のタスクと2種類の環境設定において、MotuBrainの平均スコアは96.0に達し、2位の92.3を大幅に上回りました。この差は、2位と5位の間の差とほぼ同等です。.

さらに重要なのは、その安定性です。タスクの半数で100%の成功率を達成しており、90%のタスクでは90%を上回っています。これは単に正しい結果を出せるというだけでなく、複数のタスクにわたり、またランダムな外乱下でも一貫して結果を再現できることを意味しています。.

これらの結果を総合すると、それは「汎用的なロボットの脳」に近いもの、すなわち、行動レベルでの連続性と一貫性を維持しつつ、タスクを横断した汎化能力も備えていることを示唆している。.

その背後には誰がいて、どのような道を進んでいるのか?

現時点では、MotuBrainに関する公開情報はほとんどありません。しかし、2つのリーダーボードにおけるその結果の傾向から判断すると、これは従来の動画モデルでも、純粋なVLAモデルやポリシーモデルでもないと思われます。これは、従来のモデルとは一線を画す、異なる種類の推論を表しているのです。 適応的思考 最先端の言語モデルに見られるもので、純粋な物理的知能に重点を置いている。.

この1年間、ワールドモデルやアクションモデルをめぐる探求を通じて、業界内ではいくつかの代表的な道筋が形成されてきた。.

統一された世界モデルを重視するアプローチもあり、動画モデル、VLA、世界モデルなどを統合した共同モデリングを通じて、視覚、言語、動画、動作を結びつけ、実環境における知覚、計画、予測、実行、およびタスク横断的な汎化を実現しようとしています。その代表的な例が、昨年12月に公開された「Motus」です。.

中には、「まず想像し、それから行動する」というアプローチを好む人もいます。例えば、, Lingbot-VAは、今年1月末に公開されたもので、まず動画モデルを用いて将来の動画を予測し、次にその予測に基づいてロボットの動作決定を逆方向に導き、これらを1つのモデルに統合している。.

また、2月初旬にNVIDIAがリリースした「DreamZero」のように、予測と行動が同時に行われる「将来の状態の推論と行動の生成を同時に行う」アプローチ、いわゆる「ワールド・アクション・モデル」を採用しているものもある。.

今回のMotuBrainのパフォーマンスを見る限り、環境や将来の状態を推論するワールドモデルの能力と、実際のタスクにおけるアクションモデルの実行能力を組み合わせ、ワールド・アクション・モデルに近い道を歩んでいる可能性がある。.

これなら、なぜ「ワールドモデリング」と「アクション実行」の両方のベンチマークでトップの成績を収められるのかも説明がつく。.

結論

ロボットを分解すると、その「手や足」はハードウェア、「脳」はソフトウェアと捉えることができます。.

ここ数年、ロボットハードウェアの進化のスピードは著しい。モーションコントロールの精度は向上し、センサーはより豊富になり、コストも低下している。しかし、ロボットの大規模な導入を真に阻んでいるのは、タスクを指揮する「脳」である。.

今日のロボットは、本質的には依然として「特定のタスクのために訓練された専用システム」に過ぎません。シナリオが変わったり、対象物が変わったり、指示が変わったりすると、完全に機能しなくなる可能性があります。これは、大部分が知能の問題に帰着します。.

「体現された知能」の目標は、物理的な世界を理解し、状態の変化を予測し、それに基づいて信頼性の高い行動を生成し、あらゆるタスクやシナリオに適応できる統一モデルを構築することです。この飛躍は、ロボット工学にとって、まるで……のような変革をもたらすものです。 バイブ・コーディングからウィッシュ・コーディングへ AIプログラミング分野において、これまで……であった。.

資本はすでに、実際の資金をもってその判断を下している。.

最近のいくつかの大規模な資金調達ラウンドを見ると、ロボットの「脳」を開発する企業に資金が集中的に流入していることは明らかだ。表面的にはロボットへの投資に見えるが、実際には、次世代の「ロボットOS」や「汎用物理脳」の参入ポイントをめぐる競争が繰り広げられているのかもしれない。“

このように考えると、MotuBrainが代表する「世界+行動」の統合アーキテクチャは、まさにこの戦略的競争の核心に位置していることになる。.

MotuBrainの背後にいるチームがどこなのか、そして今後どのような展開が待っているのか――その疑問は、おそらくそう長くは未解決のままにはならないだろう。.

上部へスクロール