論文の概要: HelloWorld: Enabling Socially Interactive Characters in Video World Models
- arxiv url: http://arxiv.org/abs/2608.05070v1
- Date: Wed, 05 Aug 2026 17:14:19 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:44.041205
- Title: HelloWorld: Enabling Socially Interactive Characters in Video World Models
- Title(参考訳): HelloWorld:ビデオワールドモデルでソーシャルにインタラクティブなキャラクタを実現する
- Authors: Liangyang Ouyang, Ruicong Liu, Xuangeng Chu, Kaipeng Zhang, Yoichi Sato,
- Abstract要約: HelloWorldは、現実世界のキャラクターとのソーシャルインタラクションを可能にするビデオワールドモデルである。
ワンボタンを押すと、ユーザーは画面上のキャラクターにカメラに反応するよう促すことができる。
本稿では, 自己合成データに基づいて, ビデオ生成モデルを微調整する自己蒸留パイプラインを提案する。
- 参考スコア(独自算出の注目度): 45.03339689137851
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Despite the remarkable recent progress of video world models, social interaction between users and the characters within these worlds remains unsupported. To fill this gap, we present HelloWorld, a video world model that enables social interaction with in-world characters. With a single button press, users can prompt the on-screen character to respond toward the camera, e.g., turning to the viewer, waving, nodding, or speaking a short greeting. To make these interactions natural, we propose a self-distillation pipeline that finetunes the video generation model on data synthesized by itself. Each synthesized clip contains both social interactions and camera motion, allowing the model to learn camera-pose conditioning without degrading interaction quality. At inference, we further introduce a training-free module that determines when the interaction occurs. Upon a button press, it modulates the cross-attention masks of the DiT so that the interaction-related text prompt attends only to the frames within the press window, temporally localizing the character's response. We further build HelloWorldBench, a 400-sample benchmark with three social interaction metrics alongside three conventional metrics, for evaluation. Experiments demonstrate that HelloWorld surpasses a variety of baselines in interaction quality, while maintaining state-of-the-art picture aesthetics and camera-pose following. Project page: https://github.com/AlayaLab/HelloWorld
- Abstract(参考訳): 最近のビデオワールドモデルの顕著な進歩にもかかわらず、ユーザーとこれらの世界のキャラクターとの社会的相互作用は未だにサポートされていない。
このギャップを埋めるために、私たちはHelloWorldという、現実世界のキャラクターとのソーシャルインタラクションを可能にするビデオワールドモデルを紹介します。
ワンボタンを押すと、ユーザーは画面上のキャラクターにカメラに向かって反応するよう促すことができる。
これらの相互作用を自然にするために,ビデオ生成モデルを自ら合成したデータに基づいて微調整する自己蒸留パイプラインを提案する。
合成されたクリップには、ソーシャルインタラクションとカメラモーションの両方が含まれており、インタラクションの品質を劣化させることなく、カメラのコンディショニングを学習することができる。
推論では,インタラクションの発生時期を決定するトレーニングフリーなモジュールも導入する。
ボタンを押すと、DiTのクロスアテンションマスクを変調して、インタラクション関連のテキストプロンプトがプレスウィンドウ内のフレームにのみ対応し、文字の応答を時間的にローカライズする。
HelloWorldBenchは3つのソーシャルインタラクションメトリクスと3つの従来のメトリクスを併用した400サンプルのベンチマークです。
HelloWorldは、最先端の画像美学とカメラ目的のフォローを維持しながら、インタラクション品質のさまざまなベースラインを超えていることを示す実験である。
プロジェクトページ:https://github.com/AlayaLab/HelloWorld
関連論文リスト
- JoyAI-VL-Interaction: Real-Time Vision-Language Interaction Intelligence [53.427969116091184]
8Bスケールの視覚優先型VL-インタラクションモデルであるJoyAI-VL-Interactionをリリースする。
応答を内部で決定し、各秒を選択して、沈黙を維持したり、応答したり、バックグラウンドモデルに委譲したりする。
これは、トレーニングレシピ、データ、完全なデプロイ可能なシステムとともにリリースされた最初のオープンなビジョン駆動インタラクションモデルである。
論文 参考訳(メタデータ) (2026-06-10T03:43:50Z) - SocialDirector: Training-Free Social Interaction Control for Multi-Person Video Generation [25.88676013839077]
ビデオ生成は急速に進歩し、テキストや画像のプロンプトからビデオを生成する。
映画制作とソーシャルロボティクスは、リッチなソーシャルインタラクションを備えた多人数ビデオの要求をますます高めている。
既存のモデルでは、誰がどのアクションを実行し、いつ発生し、誰が指示されたかなど、インタラクションを明示的に制御することができない。
クロスアテンションマップによる生成モデルを強化する,トレーニング不要なインタラクションコントローラであるSocialDirectorを提案する。
論文 参考訳(メタデータ) (2026-05-11T07:01:38Z) - Talking Together: Synthesizing Co-Located 3D Conversations from Audio [21.481529577056904]
混合オーディオストリームから2人の対話的かつ協調的な参加者を対象に,完全な3D顔アニメーションを作成するという課題に対処する。
我々の研究は、現実的な対人対話に欠かせない3次元空間関係をモデル化する最初のものである。
本手法は,VRおよびテレプレゼンスにおける没入型アプリケーションに適した流動的,制御可能,空間的に認識されたダイアディックアニメーションを生成する。
論文 参考訳(メタデータ) (2026-03-09T17:46:52Z) - Hunyuan-GameCraft-2: Instruction-following Interactive Game World Model [19.937724706042804]
Hunyuan-GameCraft-2は生成ゲームワールドモデリングのための命令駆動インタラクションの新しいパラダイムである。
我々のモデルでは,自然言語のプロンプトやキーボード,マウスの信号を通じてゲーム映像のコンテンツを制御することができる。
本モデルでは,時間的コヒーレントかつ因果的な対話型ゲームビデオを生成する。
論文 参考訳(メタデータ) (2025-11-28T18:26:39Z) - HERO: Human Reaction Generation from Videos [54.602947113980655]
HEROは、videOsからのHuman rEaction geneRationのフレームワークである。
HEROはビデオのグローバルレベルとフレームレベルの局所表現の両方を考慮し、インタラクションの意図を抽出する。
局所的な視覚表現は、ビデオに固有の動的特性を最大限に活用するために、モデルに連続的に注入される。
論文 参考訳(メタデータ) (2025-03-11T10:39:32Z) - SOLAMI: Social Vision-Language-Action Modeling for Immersive Interaction with 3D Autonomous Characters [38.90959051732146]
SOLAMIは,3次元自律型キャラクタとの没入型インタラクションのための,初のエンドツーエンドのソーシャルビジョン・ランゲージ・アクション(VLA)モデリングフレームワークである。
本稿では,ユーザのマルチモーダル入力をベースとしたマルチモーダル応答(音声と動き)を生成するソーシャルVLAフレームワークを提案する。
既存の動作データセットのみを用いて自動パイプラインによって生成された合成マルチモーダルなソーシャルインタラクションデータセットであるSynMSIを提案する。
論文 参考訳(メタデータ) (2024-11-29T18:53:40Z) - Interaction Replica: Tracking Human-Object Interaction and Scene Changes From Human Motion [48.982957332374866]
人間による変化をモデル化することは、デジタル双生児を作るのに不可欠である。
本手法は,シーン中の人間の視覚的位置決めとIMUデータからの人間とシーンの相互作用に関する接触に基づく推論を組み合わせたものである。
私たちのコード、データ、モデルは、プロジェクトのページ http://virtual humans.mpi-inf.mpg.de/ireplica/.comで公開されています。
論文 参考訳(メタデータ) (2022-05-05T17:58:06Z) - DialogueNeRF: Towards Realistic Avatar Face-to-Face Conversation Video
Generation [54.84137342837465]
対面会話は毎日の会話の大部分を占める。
既存の手法のほとんどは、一人称音声音声生成に重点を置いている。
ニューラルレイディアンスフィールド(NeRF)に基づく新しい統合フレームワークを提案する。
論文 参考訳(メタデータ) (2022-03-15T14:16:49Z) - Triangular Character Animation Sampling with Motion, Emotion, and
Relation [78.80083186208712]
本稿では,キャラクターの身体の動き,表情,社会的関係を関連づけることで,アニメーションのサンプリングと合成を行う新しい枠組みを提案する。
本手法は,3次元キャラクタアニメーションの自動生成,非プレーヤキャラクタ(NPC)間のインタラクションの合成,バーチャルリアリティ(VR)におけるマシン感情インテリジェンスの向上を支援するアニメーターを提供する。
論文 参考訳(メタデータ) (2022-03-09T18:19:03Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。