論文の概要: Wan-Streamer v0.2: Higher Resolution, Same Latency
- arxiv url: http://arxiv.org/abs/2607.04443v2
- Date: Tue, 07 Jul 2026 02:21:23 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-08 14:37:43.258932
- Title: Wan-Streamer v0.2: Higher Resolution, Same Latency
- Title(参考訳): Wan-Streamer v0.2: より高解像度で、同じレイテンシ
- Authors: Lianghua Huang, Zhi-Fan Wu, Yupeng Shi, Wei Wang, Mengyang Feng, Junjie He, Chen-Wei Xie, Yu Liu, Jingren Zhou, Ang Wang, Bang Zhang, Baole Ai, Chen Liang, Cheng Yu, Chongyang Zhong, Jinwei Qi, Kai Zhu, Pandeng Li, Peng Zhang, Wenyuan Zhang, Xinhua Cheng, Yitong Huang, Yun Zheng, Yuxiang Bao, Yuzheng Wang, Zoubin Bi,
- Abstract要約: Wan-Streamer v0.2は、ネイティブストリーミング、エンドツーエンドのオーディオ-視覚インタラクションモデルの遅延保存アップグレードである。
リアルタイム会話中に、姿勢、視線、手、近くの物体、およびローカルなシーンレイアウトが正当であるシーングラウンドのミッドショットエージェントをサポートする。
- 参考スコア(独自算出の注目度): 68.78755383327113
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We present Wan-Streamer v0.2, a latency-preserving upgrade of the native-streaming, end-to-end audio-visual interaction model. v0.2 keeps the v0.1 modeling formulation, but raises the interactive output stream from 192x336 to 640x368 while preserving approximately 200 ms model-side signal-to-signal latency at 25 FPS. The higher-resolution stream supports scene-grounded mid-shot agents whose posture, gaze, hands, nearby objects, and local scene layout remain legible during real-time conversation. To support the larger visual stream without adding user-visible delay, v0.2 keeps the thinker as a single-GPU low-latency path for streaming perception, the short language/state Transformer pass that builds the generation cache, and final decoding. The performer becomes a multi-GPU Ulysses-style context-parallel group for the expensive next-unit latent generation. Each performer rank writes incoming K/V into a pre-sharded local cache. The long high-resolution latent video sequence is split across ranks for denoising and gathered through Ulysses communication, while the much shorter audio latent sequence is generated without sequence sharding. In this split, the thinker's language/state computation reaches the performer only as K/V conditioning, so no separate language sequence has to be communicated inside the performer group. This concentrates additional hardware on visual generation while preserving the compact thinker-performer boundary, keeping total remote interaction latency at approximately 550 ms when a 350 ms bidirectional network budget is included.
- Abstract(参考訳): We present Wan-Streamer v0.2, a latency-serving upgrade of the native-streaming, end-to-end audio-visual interaction model。
v0.2はv0.1モデリングの定式化を保ちながら、対話的な出力ストリームを192x336から640x368に引き上げ、約200msのモデル側信号-信号-信号レイテンシを25 FPSで保存する。
高解像度のストリームは、姿勢、視線、手、近くの物体、およびローカルなシーンレイアウトがリアルタイムの会話中に正当であるシーングラウンドのミッドショットエージェントをサポートする。
ユーザ可視の遅延を追加することなく、より大きなビジュアルストリームをサポートするため、v0.2は、ストリーミング知覚のためのシングルGPUの低レイテンシパス、生成キャッシュを構築するショート言語/ステートトランスフォーマーパス、最終的なデコードとして、思考者を維持できる。
パフォーマーは、高価な次世代潜伏世代のためのマルチGPUユリシーズスタイルのコンテキスト並列グループになる。
各パフォーマーランクは、プリシャードされたローカルキャッシュに入力K/Vを書き込む。
長い高分解能潜時ビデオシーケンスは、ユリシーズ通信を介して復調・収集するためのランクに分割され、より短いオーディオ潜時シーケンスはシーケンシャルシャーディングなしで生成される。
この分割では、思考者の言語/状態計算はK/V条件としてのみパフォーマーに到達するため、パフォーマーグループ内で個別の言語シーケンスを通信する必要がなくなる。
これは、350msの双方向ネットワーク予算が組み込まれている場合に、リモートインタラクション全体のレイテンシを約550msに保ちながら、視覚生成にさらなるハードウェアを集中させる。
関連論文リスト
- Wan-Streamer v0.1: End-to-end Real-time Interactive Foundation Models [68.51256516936338]
Wan-Streamerは、ローストリーミングインタラクションのためのエンドツーエンドのインタラクティブ基盤モデルである。
音声とビデオは、入力と出力の両方を単一のTransformerシーケンスでシームレスにモデル化する。
およそ200msのモデル側レスポンスレイテンシと、合計550msのインタラクションレイテンシを実現している。
論文 参考訳(メタデータ) (2026-06-23T18:01:03Z) - ViCoStream: Streaming VideoLLMs Can Run Beyond 100 FPS with Stage-Wise Coordinated Inference [28.470202983949886]
ViCoStreamは、チャンクワイズ実行、ビジュアルトークン制御、バウンドビジュアルアテンション、クエリサイド検索、メモリコストを組み合わせた、ステージワイドなストリーミングフレームワークである。
ViCoStreamは、1つのA100 GPU上で134FPSビデオスループットと50ms TTFT未満のTTFTを実現し、全方位ベースラインに近い精度を維持していることを示す。
論文 参考訳(メタデータ) (2026-06-18T06:57:31Z) - Don't Pause: Streaming Video-Language Synchrony for Online Video Understanding [69.296913137409]
オンラインビデオ理解のための新しいパラダイム: SVLS(Streaming Video-Language Synchrony)を紹介する。
LyraVは、2つのコアイノベーションを備えた階層的なコントロールフレームワーク上に構築されたライブストリーミングアシスタントである。
まず、フレーム駆動トランジションコントローラ(FDTC)は、いつ話を続けるか、新しいレスポンスを開始するか、沈黙を保つか、といった、高レベルのセマンティックな決定を行います。
第二に、プラグアンドプレイの軽量予測モジュールであるStreaming Token Pacer (SToP)は、動的に言語生成率に適応し、視覚的コンテンツのペースにマッチする。
論文 参考訳(メタデータ) (2026-06-05T07:29:20Z) - Small Vision-Language Models are Smart Compressors for Long Video Understanding [73.65465038390771]
長時間のビデオ理解は、欲求に満ちたコンテキストではなく、意図駆動の効率に頼っている。
本稿では,下流の理解のために長い動画を圧縮する効率的なクエリ認識フレームワークであるTempoを提案する。
テストでは、Tempoが1時間のビデオを理論的限界以下に圧縮し、真のロングフォームビデオ理解が意図駆動の効率に依存することを示した。
論文 参考訳(メタデータ) (2026-04-09T11:40:25Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。