論文の概要: Video = World + Event Stream
- arxiv url: http://arxiv.org/abs/2607.15038v2
- Date: Fri, 17 Jul 2026 01:17:33 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-20 13:50:44.535632
- Title: Video = World + Event Stream
- Title(参考訳): Video = World + Event Stream
- Abstract要約: Wan-Streamer v0.3は、ひとつの組織でネイティブインタラクションモデルを再構築します。
これにより、大量の実ビデオに対して、汎用的な事前学習タスクが得られる。
機能的には、モデルのマルチモーダル理解プロセスは視覚-アクション-様である。
- 参考スコア(独自算出の注目度): 70.56197496608006
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We present Wan-Streamer v0.3, which reframes our native-streaming interaction model under a single organizing view: a video is a world plus an event stream. The world is the persistent context in which a video unfolds, including the environment, scene, subjects, ambient acoustic conditions, voice characteristics, and other relatively stable conditions. The event stream is everything that changes over time within that world, including scene or environmental changes, subject behavior, speech, and other sounds. This yields a general-purpose pretraining task over large amounts of real video: given a world and incoming input, predict how the world moves, changes, and responds in real time. The resulting competence can be specialized to a broad family of real-time downstream tasks. We instantiate it on real-time full-duplex audio-visual interaction, where the event stream is the agent's speech together with free-form behavior. Functionally, the model's multimodal understanding process is vision-language-action-like: it maps multimodal user input to language-form speech and behavior actions. Wan-Streamer v0.3 preserves the v0.2 operating point: 640x368 video at 25 FPS, a 160 ms streaming unit, approximately 200 ms model-side response latency, and approximately 550 ms total interaction latency under a 350 ms bidirectional network budget.
- Abstract(参考訳): 私たちはWan-Streamer v0.3を紹介します。これは、ネイティブストリーミングのインタラクションモデルを単一の組織ビューで再構成します。
世界は、環境、シーン、主題、周囲の音響条件、声の特徴、その他の比較的安定した条件を含む、ビデオが広がる永続的な文脈である。
イベントストリームは、シーンや環境の変化、主題の振る舞い、スピーチ、その他の音など、世界の時間とともに変化するもの全てです。
与えられた世界と入力を入力し、世界がどのように動き、変化し、リアルタイムで反応するかを予測する。
結果として得られる能力は、リアルタイム下流タスクの幅広いファミリーに特化することができる。
イベントストリームは、エージェントのスピーチと自由形式の振る舞いを合わせて、リアルタイムのフルデュープレックスな音声-視覚インタラクションでインスタンス化する。
機能的には、マルチモーダルなユーザ入力を言語形式の音声や行動行動にマッピングする。
Wan-Streamer v0.3は、25 FPSで640x368のビデオ、160ミリ秒のストリーミングユニット、約200ミリ秒のモデルサイドレスポンスレイテンシ、350ミリ秒の双方向ネットワーク予算で約550ミリ秒のインタラクションレイテンシといった、v0.2の動作点を保存する。
関連論文リスト
- Wan-Streamer v0.2: Higher Resolution, Same Latency [68.78755383327113]
Wan-Streamer v0.2は、ネイティブストリーミング、エンドツーエンドのオーディオ-視覚インタラクションモデルの遅延保存アップグレードである。
リアルタイム会話中に、姿勢、視線、手、近くの物体、およびローカルなシーンレイアウトが正当であるシーングラウンドのミッドショットエージェントをサポートする。
論文 参考訳(メタデータ) (2026-07-05T18:05:20Z) - Wan-Streamer v0.1: End-to-end Real-time Interactive Foundation Models [68.51256516936338]
Wan-Streamerは、ローストリーミングインタラクションのためのエンドツーエンドのインタラクティブ基盤モデルである。
音声とビデオは、入力と出力の両方を単一のTransformerシーケンスでシームレスにモデル化する。
およそ200msのモデル側レスポンスレイテンシと、合計550msのインタラクションレイテンシを実現している。
論文 参考訳(メタデータ) (2026-06-23T18:01:03Z) - EgoCS-400K: An Egocentric Gameplay Dataset for World Models [53.9389499966106]
EgoCS-400Kは,世界モデルのための大規模リプレイ・グラウンド型Egocentric Counter-Strikeデータセットである。
パブリックプロのCSとCS2のマッチデモから作られ、人間のゲームプレイの軌跡を保存している。
EgoCS-400Kには、1000以上の試合と4万回以上のラウンドから40万人以上の個人ビデオと1万時間のゲームプレイが含まれている。
論文 参考訳(メタデータ) (2026-06-16T17:13:58Z) - Harnessing Streaming Video in the Wild [53.23721420272668]
VLM(Vision-Language Models)は、ビデオコールアシスタント、ライブコメンタリー、エンボディロボットなどのアプリケーションでビデオストリームを処理するためにますます必要とされる。
理想的なストリーミングシステムは、アクティブなインタラクション、長期メモリ、リアルタイム処理をサポートする必要がある。
既存のVLMはオフラインのビデオ理解に優れていますが、ストリーミング機能に欠け、ストリーミングデプロイメント専用のインフラストラクチャが欠如しています。
論文 参考訳(メタデータ) (2026-06-07T13:00:19Z) - Don't Pause: Streaming Video-Language Synchrony for Online Video Understanding [69.296913137409]
オンラインビデオ理解のための新しいパラダイム: SVLS(Streaming Video-Language Synchrony)を紹介する。
LyraVは、2つのコアイノベーションを備えた階層的なコントロールフレームワーク上に構築されたライブストリーミングアシスタントである。
まず、フレーム駆動トランジションコントローラ(FDTC)は、いつ話を続けるか、新しいレスポンスを開始するか、沈黙を保つか、といった、高レベルのセマンティックな決定を行います。
第二に、プラグアンドプレイの軽量予測モジュールであるStreaming Token Pacer (SToP)は、動的に言語生成率に適応し、視覚的コンテンツのペースにマッチする。
論文 参考訳(メタデータ) (2026-06-05T07:29:20Z) - OmniInteract: Benchmarking Real-World Streaming Interaction for Real-Time Omnimodal Assistants [43.2907783462394]
音声-視覚的ストリームに対するネイティブ推論によって評価されたリアルタイム全言語モデルのストリーミングベンチマーク。
本研究では,対話型品質タイムラインF1,割り込み診断スイート,368の1QnAスロットを用いて,応答の正しさ,タイミング,不正出力の割り込み,コンテキスト継続性を評価した。
論文 参考訳(メタデータ) (2026-05-26T02:49:47Z) - VideoLLM-online: Online Video Large Language Model for Streaming Video [27.073238234038826]
本稿では,ビデオストリーム内での時間的整合性,長コンテキスト性,リアルタイムな会話を可能にする,新しいLearning-In-Video-Streamフレームワークを提案する。
当社のフレームワークは,A100 GPU上で10FPS以上の5分間のビデオクリップでストリーミング対話をサポートする。
また、認識、キャプション、予測など、パブリックなオフラインビデオベンチマークで最先端のパフォーマンスを示す。
論文 参考訳(メタデータ) (2024-06-17T17:55:32Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。