「HappyOyster」が登場:アリババのインタラクティブな世界モデルがAI動画の未来を一変させる

happyoyster

最近、謎の「ハッピーホース」が突如として人工分析ランキングのトップに躍り出た。.

AI界隈ではたちまち憶測が飛び交ったが、アリババが名乗り出て、その事実を認めるまで続いた。.

ところが、そのわずか数日後、アリババの「Happy」ファミリーに、新たなメンバー「HappyOyster」が加わることになった。.

「ハッピー・オイスター」は、自由度の高いワールドモデル製品です。

どちらも、今年3月に設立された「アリババ・トークン・ハブ(ATH)」というイノベーショングループに由来しています。.

しかし、「ハッピーホース」のような「プロンプトを入力し、レンダリングを待ち、完成したクリップを受け取る」というワンショット方式とは異なり、HappyOysterは オープンワールド型モデル製品 リアルタイムで構築・操作できるものです。.

これはネイティブなマルチモーダルアーキテクチャに基づいており、その基盤には、マルチモーダル入力をサポートし、音声と映像の同時生成を可能にするストリーミング型の生成世界モデルが採用されています。生成プロセス中は、ユーザーからの指示を継続的に受け付け、ビジュアルがリアルタイムで反応し、絶えず変化し続けます。.

HappyOysterは、「Wander」と「Direct」という2つの主要機能に重点を置いています。.

「Wander」機能は、あらゆるスタイルと無制限のインタラクションに対応した、初の汎用ワールドモデルです。テキストや画像を入力するだけで、無限に探索可能なワールドシーンを生成でき、1分以上のリアルタイムな移動やカメラ操作に対応しています。.

一方、「Direct」機能は、ワールドモデルに基づいたリアルタイムAI映像演出エンジンです。最大3分間の720pリアルタイム動画を継続的に生成することができます。テキストによる指示を通じて、カメラの操作、キャラクターの行動のスケジュール設定、ストーリーラインの変更などをリアルタイムで行うことができます。.

この名前には、ある意図が込められています。シェイクスピアの有名な台詞「世界はあなたのもの」に由来しています。“

現在、「HappyOyster」はすでにサービスを開始しており、私たちはすぐに招待コードを受け取りました。それでは、実際に試してみましょう。.

ハッピーオイスターの招待コード

体験リンク: https://www.happyoyster.cn/

アクセスするには、招待コードが必要になりました。.

HappyOysterの実機テスト:このアリババ・ワールドのモデルはなかなか興味深い

まずは、Wanderの主力機能を試してみましょう。.

この機能は、テキストや画像からワールドを生成することをサポートしています。.

プロンプトを直接入力することも、よりきめ細かく制御するために「キャラクター」と「シーン」を個別に定義することも可能です。また、一人称視点と三人称視点を切り替えることもできます。.

たとえば、「カスタムモード」を使用して、次のように個別に指定します:
キャラクター:「スタイリッシュな金髪の女性モデル」“
場面:「1980年代のパリの街角」。“

イメージ

HappyOysterは、固定された動画を直接出力するわけではありません。その代わりに、10秒強の間に、雨上がりの夜のパリの通りの全体像を構築します。地面に溜まった水には薄黄色の街灯の光が映り込み、道路を車が駆け抜け、両側には店が立ち並び、その細部はすべて物理法則に従っています。.

次に、WASDキーを使ってキャラクターの移動を操作したり、矢印キーを使ってカメラを動かしたりすることができます。キャラクターはこの空間内を自由に動き回り、やがて動画が完成します。.

シーン全体がリアルタイムで反応し、ラグもなく、終始滑らかに動作します。.

また、このシステムはシーンの雰囲気に合ったBGMを自動的に追加し、音声と映像を自然に同期させます。.

また、アニメ風の「一人称視点」のサイクリング画像もアップロードしました。この静止画をもとに、HappyOysterは完全なシーンを生成し、 空間構造 および動作ロジック。.

視点が前方へ移動しても、道路の延長線、花畑の広がり、そして遠くの風景の重なりは、目立った継ぎ目や不自然さを感じさせることなく、一貫性を保っている。.

ジブリ風の映像表現や、桜の花びらが舞い散る雰囲気も、作品全体を通して一貫して表現されています。.

「Wander」機能は、さまざまなスタイルに対応しています。なんと、私たちはゴッホの絵画の中にそのまま入り込んでしまったことさえありました。.

それでは、「Direct」機能を試してみましょう。この機能の最大の特徴は、動画のどの部分でもリアルタイムでコンテンツを変更できることです。.

私たちはそれをジブリ風のイメージに仕上げると、HappyOysterはすぐに宮崎駿風のアニメーションの世界を作り出しました。それは、赤い傘を差した小さな女の子が、雨上がりのでこぼこした田舎道を歩いているという光景でした。.

ここで、「ジブリ風のかわいい子猫が、突然女の子のところへ駆け寄ってくる」というプロンプトを入力します。モデルは再レンダリングを行わず、現在のシーンの中で、女の子の横を並んで走る子猫を直接生成します。.

次に、「少女は子猫を撫でるためにしゃがむ」という指示を追加します。すると、シーンは再び即座に反応し、少女が身をかがめて手を伸ばします。その動きは自然で滑らかです。.

要するに、このモデルは、私たちが入力したプロンプトに応じて、シーンやキャラクターの行動を正確に調整することができます。映像は滑らかで自然であり、あらゆる変化がストーリー展開とシームレスに結びついています。.

HappyOysterの技術的解説:ワールドモデル対テキストから動画生成

テストを見てみると、直感的にこう感じます。「これはSoraやKlingといったモデルとは何かが違うようだ」。確かに違いがあり、その違いは根底にあるロジックから始まっています。.

SoraであれKlingであれ、テキストから動画を生成するモデルは本質的にワンショット型システムです。テキストや画像の条件が与えられると、モデルはあらかじめ定義された時間枠内でコンテンツ、動き、リズムを構成し、その結果を出力します。 ユーザーは1つの入力を与え、1つの出力を得て、プロセスはそこで終了します。これは閉じた単発のプロセスであり、その間に介入の余地はありません。.

このモードであれば、完成度の高い短い動画を作成するには十分ですが、途中で介入して、すでに起こった出来事を変更したい場合、それはどうしても不可能です。.

世界モデルという概念は、これとは全く異なります。世界モデルは、世界が次にどのように変化していくか、現在の状態はどのようなものか、あるアクションを実行した後に何が起こるか、そしてその後に何が起こるかを学習します。あらかじめ設定された終点はありません。 新しい入力がない場合でも、モデルは現在の状態に基づいて世界を変化させ続けます。途中で新しい指示を与えれば、現在の状態に基づいて未来を再計算します。このモデルはいつでも中断され、干渉を受け、書き換えられる可能性があり、その動的な相互作用のあり方は、まさに進化そのものに似ています。 バイブ・コーディングからウィッシュ・コーディングへ.

このため、ワールドモデルの学習は、テキストから動画への生成よりもはるかに困難です。.

最も直接的な課題は速度です。ワールドモデルは、ユーザーから指示があった際に即座に応答する必要があります。目立つ遅延があれば、没入感が損なわれてしまいます。HappyOysterはストリーミング生成フレームワークを採用しており、高次元の動画やマルチモーダル情報をコンパクトな動的潜在状態に圧縮することで、ステップごとの計算コストを大幅に削減し、低遅延で生成を継続的に進めることを可能にしています。 テキスト、画像、およびナビゲーションなどの制御信号は、オンラインで注入可能な条件変数として設計されているため、モデルは生成プロセスをリセットすることなく、どの時点でも即座に応答することができます。.

より厄介な問題は、長期にわたる進化の過程で世界の整合性をいかに維持するかという点です。生成時間が長くなればなるほど、シーンがずれたり構造が劣化したりする可能性が高まります。 物理法則や空間構造に対する制約が徐々に失われ、世界は徐々に本来の様相を失っていきます。この「記憶喪失」に対抗するため、HappyOysterは永続的な状態再利用メカニズムを導入しています。過去のアテンション状態を継続的に引き継ぐことで、モデルは生成された情報を効率的に継承し、段階的に更新することで、より長い時間スケールにわたって安定したシーン構造と動的な一貫性を維持します。.

オーディオビジュアルの連携という点では、HappyOysterはオーディオを後処理として追加するのではなく、統一されたオーディオ・ビデオ生成フレームワークを採用しています。視覚信号と聴覚信号は、同じワールド状態の下で同時に生成されます。オーディオはワールドのダイナミクスの一部として機能し、クロスモダルな時間的整合性を自然に確立します。.

現在、ワールドモデル分野にはいくつかの代表的な研究方向が存在する。Googleの「Genie」はリアルタイムのインタラクティブなワールドモデリングに焦点を当てているが、統一的なマルチモーダル表現や音声・映像の同時生成という点では依然として限界がある。 Fei-Fei Li氏のWorld Labsは、3D空間再構築の道を歩んでおり、ピクセル空間における長シーケンスの動的生成よりも、幾何学的な一貫性を重視している。.

HappyOysterは、ピクセル空間において、長尺のリアルタイムでインタラクティブな動的世界をシミュレートすることを選択し、さらにその上に音声と映像を連動して生成する機能を追加しています。これは、これまでほとんど誰も踏み込んだことのない道であり、参考となる既存の事例もほとんど存在しません。.

HappyOysterのまとめ:コンテンツ制作から世界観の構築まで

AIGCは今日に至るまで進化を遂げ、コンテンツ生成ツールはすでにかなり成熟しています。記事の執筆、画像の生成、動画の作成――こうしたニーズにはすべて優れた解決策が存在します。しかし、この分野は「コンテンツの生成」から「世界の構築」へと、静かに新たな転換点を迎えようとしています。“

「HappyOyster」の登場により、この方向性の輪郭が見えてきました。このサービスは、誰もがいつでも入り込み、いつでも変更でき、リアルタイムで反応する「自分だけのデジタル世界」を提供してくれます。私たちはその中を自由に歩き回り、中での行動を指示し、他の人と共有することで、自分たちが作り上げた世界の中で、他の人たちに物語を紡ぎ続けてもらうことができるのです。.

活用シーンという点では、その範囲は画面内のエンターテインメントにとどまらず、はるかに広いものです。文化観光展、インタラクティブな短編ドラマ、映画のコンセプト検証、ブランドマーケティング、ライブでの共同創作……リアルタイムでの知覚、生成、フィードバックループを必要とするあらゆるシーンに、この技術は自然に適しています。.

さらに先を見据えると、カメラやセンサー、空間認識デバイス、その他のハードウェアと組み合わせることで、HappyOysterが実現するのは、現実世界の信号によって継続的に駆動される生成型環境システムとなります。.

しかし率直に言えば、ワールドモデルは全体としてまだ初期段階にあります。長期的な物理的一貫性、複雑なシーンにおける因果推論、そして現実世界のルールに対する深い理解は、いずれも未解決の難題です。HappyOysterは、この分野において「実用的な製品」の形に最も近い試みの一つですが、あくまで「試み」である以上、その境界はまだ明確には定まっていません。.

これは制限であると同時に、想像力が今もなお存在している理由でもある。.

上部へスクロール