LDA-1Bの説明:ゴミデータ」が次のロボットAIのブレークスルーをもたらす

LDA 1Bは、“ガベージデータ ”が次のロボットAIのブレークスルーをもたらすと説明した。

ロボットの基盤モデルをめぐる競争に、新たなプレイヤーが加わった。北京大学、清華大学、Galaxy General、および智源研究院からなる共同チームが、 LDA-1B, 、これによりパラメータの規模は直接10億単位にまで拡大した。.

この数字の背後には、より大胆な発想が潜んでいます。それは、専門家のデモンストレーションデータだけに注目するのをやめる、というものです。かつてはゴミ箱に捨てられていたような「ゴミデータ」こそが、実はロボットにとって本当に必要な栄養分なのかもしれません。.

ロボットの従来の学習プロセスは単純明快です。熟練したオペレーターを見つけ、その動作を記録し、ロボットに模倣によって学習させるというものです。この「行動クローン」アプローチは、OpenAIやGoogle DeepMindによって広く採用されてきました。しかし、問題点は明らかです。データの活用率が痛々しいほど低いのです。.

ロボットの試作に失敗したのか? 廃棄された。.
何気なく撮影された人間の作業動画?画質が良くないから、削除した。.
別のロボットプラットフォームからのデータですか? 形式が互換性がないため、やはり破棄されました。.

その LDA-1B チームは、ある単純な疑問を投げかけました。「もし、その無駄になっているデータをすべて実際に活用したら、どうなるだろうか?」


LDA-1Bが利用可能なすべてのデータをどのように活用するか

彼らは「EI-30k」と呼ばれるデータセットを構築した。これは、人間の操作とロボットの軌跡の両方を網羅した、3万時間分の体現的相互作用データである。.

ロボット工学の分野において、この規模はすでに極めて巨大なものとなっています。比較のために言えば、これまで最大だったデータセット「Open X-Embodiment」の規模は、1,000時間強に過ぎませんでした。.

しかし、規模こそが鍵なのではない。鍵となるのは多様性だ。.

このデータセットには以下のものが含まれています:

  • 成功した実証と失敗した試み
  • 高精度なロボットデータと、気軽に撮影された人間の動画
  • 両腕を用いた操作と、器用な手の動作

従来の基準からすれば、このデータの多くは一貫性に欠けており、決して学習データセットには採用されないだろう。.

LDA-1B ここでは別のアプローチをとっています。つまり、品質の異なるデータにそれぞれ異なる役割を割り当てるのです。.

ポリシーを学習する際には、質の高い専門家によるデモンストレーションが活用されています。.
質の低い、あるいは「不適切な」データを用いて、物理世界のダイナミクスを解明する。.

把持に失敗した動画は、そのまま模倣することはできませんが、モデルに対して「この把持方法では失敗する」と伝えます。これこそが動的知識です。.

このアイデアは単純そうに聞こえますが、技術的な課題が生じます:
どうすれば LDA-1B 「次のフレームがどのようなものか」と「次にどのような行動をとるべきか」を同時に学ぶことはできるのでしょうか?


LDA-1B と DINO 潜在空間における予測

このチームが提案する解決策は、予測タスクをDINOの潜在空間に移すことである。.

Metaが開発した視覚的自己教師付きモデル「DINO」は、画像を高度に抽象化された特徴表現に圧縮します。この空間では、, LDA-1B 「テーブルは木製か、それとも白いのか」といった表面的な詳細を気にする必要はなく、その代わりに「物体がどこにあるか」や「どのように動くか」といった核心的な物理的情報に焦点を当てています。“

この設計には、2つの利点があります:

  • ピクセル単位の冗長性を回避することで、計算効率が大幅に向上する
  • 環境をまたいだ汎化能力が向上するのは、以下の理由による。 LDA-1B シーン固有の視覚的特徴ではなく、抽象的な物理法則を学習する

統一されたマルチモーダル拡散トランスフォーマーフレームワークにおいて、本モデルはアクションチャンクと将来のDINOシーケンスのノイズ除去を同時に行う。.

異種データは、以下の各分野において、それぞれ独自かつ相互に補完的な役割を果たしています:

  • 視覚的予測
  • ダイナミクス学習
  • 政策学習

研究チームは、さまざまなイベントの所要時間や操作タスクを網羅した、30,000時間以上にわたる多様な人間とロボットの相互作用データを収録した「EI-30k」を収集した。.

建築的な観点から言えば、, LDA-1B マルチモーダル・ディフュージョン・トランスフォーマーを採用しています。これにより、視覚ストリームと動作ストリームの非同期処理が可能になります。現実の世界では、カメラのフレームレートとロボットの制御周波数がずれていることが多く、従来のモデルではその処理に苦労していました。.

拡散モデリングの導入により、以下のことも可能になります。 LDA-1B 10億パラメータ規模で安定して学習を行うこと――これは、これまでロボットモデルにとっては困難だったことである。.


3つのタスクカテゴリにおけるLDA-1Bの性能

評価のために、チームは3つの代表的なシナリオを選定した:

LDA-1Bにおけるコンタクトを多用するタスク

これらは、ロボットの知覚能力や力の制御能力を検証するもので、USBケーブルの差し込みやネジの締め付けなど、正確な力覚フィードバックが不可欠な作業を対象としています。.

LDA-1B 従来のπ0.5モデルを21%上回っている。.

LDA-1Bによる巧みな操作

さらに難しいことに、これらの課題では、ルービックキューブを回したり、道具を使ったりするなど、複数の指を協調させて動かす操作が求められます。.

ここで、, LDA-1B さらに大きな優位性を示しており、パフォーマンスが48%向上しています。.

LDA-1Bにおける長期計画

これらは計画能力を評価するものです。ロボットは、最終目標を達成するために、一連のサブタスクを完了しなければなりません。.

LDA-1B このカテゴリーにおいて、23%の改善を達成した。.

さらに興味深いのは、微調整の実験だ。.

研究チームは、通常なら破棄されるような「質の低い」データ――失敗例や不完全な軌跡――を意図的に用いた。.

その結果、このデータのうちわずか30%を使用するだけで、パフォーマンスが10%向上した。.

この発見は、業界で広く信じられていた通説を覆すものである:
いわゆる「ゴミデータ」は負担ではなく、むしろ LDA-1B.


LDA-1Bと世界モデルへの新たな道

その背後にある技術的アプローチ LDA-1B これは、より大きな問い――ロボット向け基盤モデルはどのように学習すべきか――に対する答えとなる。

現在、2つの主流のパラダイムが存在します:

行動のクローン化
その代表例が、OpenAIのロボット工学分野の取り組みや、Physical Intelligence社の「π0」シリーズです。その考え方は単純で、専門家の動きを観察し、それを模倣するというものです。.

ワールド・モデルズ
『Genie』や『DIAMOND』といった作品に代表される。その考え方は、まず物理的な世界がどのように機能しているかを理解し、その上でどう行動すべきかを決定するというものである。.

行動クローニングにはデータ効率が低いという課題がある。つまり、成功事例からのみ学習を行うからだ。.
これまでのモデルは、粗雑な実装に悩まされてきました。具体的には、アクションを伴わない動画予測のみに焦点を当てているか、あるいは大規模な学習には不十分なほどデータセットが小さすぎるという問題がありました。.

LDA-1B 第3の道を選ぶ。.

これは、ダイナミクス学習、ポリシー学習、および視覚的予測を単一のフレームワークに統合し、質が異なるデータがそれぞれ異なる役割を果たせるようにする。.

この「統一世界モデル」という考え方は、以前から理論上は提唱されてきた。しかし、 LDA-1B 10億パラメータ規模で、安定した学習を実現した最初の手法である。.

工学的な観点から見ると、の最大の貢献は LDA-1B これは単なる一つの画期的な発見というわけではありません。それは、ある一つのことを証明しているのです:

ロボットの基盤モデルは、言語モデルと同様に、膨大な量の多様なデータを「取り込む」ことで、スケーリングが可能である。.

以前は無駄になっていたデータも、内部で知識へと変えることができます LDA-1B.


LDA-1Bは「データ飢餓」の解決策となるのか?

ロボット工学はかねてより、ある厄介な現実に直面してきた。それは、データにはコストがかかるということだ。.

1時間分の高品質なロボット実演データを記録するには、熟練したオペレーター、標準化された環境、そして高精度なセンサーが必要となります。その費用は数千ドルに達することもあります。.

資金が潤沢な研究室でさえ、言語モデル規模のデータを用いてモデルを学習させることに苦労している。.

LDA-1B 新たな方向性を提示しています。.

完璧なデータを収集するために多額の費用をかけるのではなく、不完全なデータを活用しましょう。.

YouTubeに投稿された人間の操作動画、デバッグ中のロボットの失敗映像、さまざまな研究室やプラットフォームで収集されたデータセット――これまでは見過ごされていたこうしたリソースが、今や以下のための学習素材となり得る LDA-1B.

とはいえ、依然として不確実な点が残っている。.

本論文では、EI-30kデータセットの構成やデータソースについて十分に開示されていないため、再現を試みる他のチームにとって障壁となっている。 LDA-1B この規模で。.

また、展開に関する問題もあります。10億パラメータのモデルには、多大な計算コストが伴います。ロボットはサーバーとは異なり、単に計算能力を増強することはできません。.

とはいえ、現時点では、, LDA-1B ロボット向け基盤モデルの新たな基準を打ち立てた:

  • より大規模な
  • より多様なデータ
  • より統一された手法

さて、問題は、他の出場者たちがこれにどう対応するかということだ。 LDA-1B.

上部へスクロール