論文の概要: Wan-Streamer v0.2: Higher Resolution, Same Latency
- arxiv url: http://arxiv.org/abs/2607.04443v2
- Date: Tue, 07 Jul 2026 02:21:23 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-08 14:37:43.258932
- Title: Wan-Streamer v0.2: Higher Resolution, Same Latency
- Title(参考訳): Wan-Streamer v0.2: より高解像度で、同じレイテンシ
- Abstract要約: Wan-Streamer v0.2は、ネイティブストリーミング、エンドツーエンドのオーディオ-視覚インタラクションモデルの遅延保存アップグレードである。
リアルタイム会話中に、姿勢、視線、手、近くの物体、およびローカルなシーンレイアウトが正当であるシーングラウンドのミッドショットエージェントをサポートする。
- 参考スコア(独自算出の注目度): 68.78755383327113
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We present Wan-Streamer v0.2, a latency-preserving upgrade of the native-streaming, end-to-end audio-visual interaction model. v0.2 keeps the v0.1 modeling formulation, but raises the interactive output stream from 192x336 to 640x368 while preserving approximately 200 ms model-side signal-to-signal latency at 25 FPS. The higher-resolution stream supports scene-grounded mid-shot agents whose posture, gaze, hands, nearby objects, and local scene layout remain legible during real-time conversation. To support the larger visual stream without adding user-visible delay, v0.2 keeps the thinker as a single-GPU low-latency path for streaming perception, the short language/state Transformer pass that builds the generation cache, and final decoding. The performer becomes a multi-GPU Ulysses-style context-parallel group for the expensive next-unit latent generation. Each performer rank writes incoming K/V into a pre-sharded local cache. The long high-resolution latent video sequence is split across ranks for denoising and gathered through Ulysses communication, while the much shorter audio latent sequence is generated without sequence sharding. In this split, the thinker's language/state computation reaches the performer only as K/V conditioning, so no separate language sequence has to be communicated inside the performer group. This concentrates additional hardware on visual generation while preserving the compact thinker-performer boundary, keeping total remote interaction latency at approximately 550 ms when a 350 ms bidirectional network budget is included.
- Abstract(参考訳): We present Wan-Streamer v0.2, a latency-serving upgrade of the native-streaming, end-to-end audio-visual interaction model。
v0.2はv0.1モデリングの定式化を保ちながら、対話的な出力ストリームを192x336から640x368に引き上げ、約200msのモデル側信号-信号-信号レイテンシを25 FPSで保存する。
高解像度のストリームは、姿勢、視線、手、近くの物体、およびローカルなシーンレイアウトがリアルタイムの会話中に正当であるシーングラウンドのミッドショットエージェントをサポートする。
ユーザ可視の遅延を追加することなく、より大きなビジュアルストリームをサポートするため、v0.2は、ストリーミング知覚のためのシングルGPUの低レイテンシパス、生成キャッシュを構築するショート言語/ステートトランスフォーマーパス、最終的なデコードとして、思考者を維持できる。
パフォーマーは、高価な次世代潜伏世代のためのマルチGPUユリシーズスタイルのコンテキスト並列グループになる。
各パフォーマーランクは、プリシャードされたローカルキャッシュに入力K/Vを書き込む。
長い高分解能潜時ビデオシーケンスは、ユリシーズ通信を介して復調・収集するためのランクに分割され、より短いオーディオ潜時シーケンスはシーケンシャルシャーディングなしで生成される。
この分割では、思考者の言語/状態計算はK/V条件としてのみパフォーマーに到達するため、パフォーマーグループ内で個別の言語シーケンスを通信する必要がなくなる。
これは、350msの双方向ネットワーク予算が組み込まれている場合に、リモートインタラクション全体のレイテンシを約550msに保ちながら、視覚生成にさらなるハードウェアを集中させる。
関連論文リスト
- Aero Realtime: Fully Aligned Input-Output Streams for Low-Latency Streaming Multimodal Generation [33.4073718746898]
本稿では,映像,音声,テキストを共有時間グリッド上でリアルタイムに出力するAero Realtimeを紹介した。
4つのNVIDIA A6000ワークステーションでは、Aero Realtimeは84msの中央値と173msのP95処理ラグを継続的にストリーミングされたビデオの20分以上保持している。
その結果,デュアルプレックス・プロアクティブ・ハードウェア・アライン・マルチモーダルインタラクションのための完全インプット・アウトプット・モデリングの実現可能性を示した。
論文 参考訳(メタデータ) (2026-08-09T04:22:57Z) - StreamArena: Toward Continuous, Interactive, and Long-Horizon Agentic Streaming Video Understanding [42.88155526332792]
時間スケールでインタラクティブなストリーミングビデオ理解のためのベンチマークであるStreamArenaを紹介する。
多様なシステムに対する評価は、連続的な相互作用と長距離多モード理解の間の緊張を露呈する。
レイテンシクリティカルなインタラクションとアクティブな監視を,独立したスケジュール作業者に割り当てる2層アーキテクチャであるStreamMindとの緊張に対処する。
論文 参考訳(メタデータ) (2026-08-06T07:46:37Z) - Video = World + Event Stream [70.56197496608006]
Wan-Streamer v0.3は、ひとつの組織でネイティブインタラクションモデルを再構築します。
これにより、大量の実ビデオに対して、汎用的な事前学習タスクが得られる。
機能的には、モデルのマルチモーダル理解プロセスは視覚-アクション-様である。
論文 参考訳(メタデータ) (2026-07-16T14:19:42Z) - Wan-Streamer v0.1: End-to-end Real-time Interactive Foundation Models [68.51256516936338]
Wan-Streamerは、ローストリーミングインタラクションのためのエンドツーエンドのインタラクティブ基盤モデルである。
音声とビデオは、入力と出力の両方を単一のTransformerシーケンスでシームレスにモデル化する。
およそ200msのモデル側レスポンスレイテンシと、合計550msのインタラクションレイテンシを実現している。
論文 参考訳(メタデータ) (2026-06-23T18:01:03Z) - ViCoStream: Streaming VideoLLMs Can Run Beyond 100 FPS with Stage-Wise Coordinated Inference [28.470202983949886]
ViCoStreamは、チャンクワイズ実行、ビジュアルトークン制御、バウンドビジュアルアテンション、クエリサイド検索、メモリコストを組み合わせた、ステージワイドなストリーミングフレームワークである。
ViCoStreamは、1つのA100 GPU上で134FPSビデオスループットと50ms TTFT未満のTTFTを実現し、全方位ベースラインに近い精度を維持していることを示す。
論文 参考訳(メタデータ) (2026-06-18T06:57:31Z) - Low-Latency Real-Time Audio Game Commentary System via LLM-Based Parallel Text Generation [59.178597408747095]
本稿では,ライブゲームプレイビデオから直接音声コメントを生成する低遅延リアルタイム音声ゲーム解説システムを提案する。
従来のパイプラインはフレームをキャプチャし、テキストを生成し、発話毎に順次音声を合成し、音声再生が完了するまで次世代を要求しない。
本システムでは、音声再生と並行してテキスト生成を行い、複数の候補発話を事前にバッファリングすることで、再生境界での即時合成を可能にする。
論文 参考訳(メタデータ) (2026-06-11T13:15:13Z) - Don't Pause: Streaming Video-Language Synchrony for Online Video Understanding [69.296913137409]
オンラインビデオ理解のための新しいパラダイム: SVLS(Streaming Video-Language Synchrony)を紹介する。
LyraVは、2つのコアイノベーションを備えた階層的なコントロールフレームワーク上に構築されたライブストリーミングアシスタントである。
まず、フレーム駆動トランジションコントローラ(FDTC)は、いつ話を続けるか、新しいレスポンスを開始するか、沈黙を保つか、といった、高レベルのセマンティックな決定を行います。
第二に、プラグアンドプレイの軽量予測モジュールであるStreaming Token Pacer (SToP)は、動的に言語生成率に適応し、視覚的コンテンツのペースにマッチする。
論文 参考訳(メタデータ) (2026-06-05T07:29:20Z) - Small Vision-Language Models are Smart Compressors for Long Video Understanding [73.65465038390771]
長時間のビデオ理解は、欲求に満ちたコンテキストではなく、意図駆動の効率に頼っている。
本稿では,下流の理解のために長い動画を圧縮する効率的なクエリ認識フレームワークであるTempoを提案する。
テストでは、Tempoが1時間のビデオを理論的限界以下に圧縮し、真のロングフォームビデオ理解が意図駆動の効率に依存することを示した。
論文 参考訳(メタデータ) (2026-04-09T11:40:25Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。