論文の概要: MOSS-Video-Preview: Toward Real-Time Video Understanding via Cross-Attention
- arxiv url: http://arxiv.org/abs/2606.07639v1
- Date: Mon, 01 Jun 2026 09:07:15 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-09 14:42:05.17239
- Title: MOSS-Video-Preview: Toward Real-Time Video Understanding via Cross-Attention
- Title(参考訳): MOSS-Video-Preview: クロスアテンションによるリアルタイムビデオ理解に向けて
- Authors: Pengyu Wang, Chenkun Tan, Shaojun Zhou, Wei Huang, Qirui Zhou, Zhan Huang, Zhen Ye, Jijun Cheng, Xiaomeng Qian, Yanxin Chen, Xingyang He, Huazheng Zeng, Chenghao Wang, Pengfei Wang, Hongkai Wang, Shanqing Gao, Yixian Tian, Chenghao Liu, Xinghao Wang, Botian Jiang, Xipeng Qiu,
- Abstract要約: クロスアテンションバックボーンは、一般的なデコーダのみの設計よりもリアルタイムの視覚言語融合に適していることを示す。
我々のモデルはQwen2.5-VL-7Bベースライン全体に続く。
256フレームの1つのH200では、最初のトークンの5倍のスピードアップを実現している。
- 参考スコア(独自算出の注目度): 53.80990122465395
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Video understanding is shifting from the offline paradigm -- taking a fully recorded video as input and producing a single answer after it ends -- toward real-time interaction, in which the model perceives new frames while still replying, revises its answer as new evidence appears, and remains silent when there is nothing to say. We present MOSS-Video-Preview to validate this paradigm. Our central claim is that perception must not be blocked by generation; its natural realization is a two-channel architecture. We argue that a cross-attention backbone is better suited to real-time vision-language fusion than the prevailing decoder-only design: visual features enter through a side channel rather than joining the autoregressive sequence, so perception and generation run on separate, non-blocking pathways -- reducing the frequency of visual processing and exposing a clean channel-wise interface for independent compression. We complement this with a data synthesis pipeline that converts dense captions into real-time understanding QA whose answers are revised to match what the model has perceived so far, and we specialize an offline model on these data to elicit real-time behavior. Our model trails the strong Qwen2.5-VL-7B baseline overall -- a gap we attribute primarily to data and scale rather than the architecture -- yet attains competitive offline video and multimodal understanding, remains robust on the spatial and fine-grained temporal reasoning central to real-time use, and acquires behaviors that offline models lack: continuous perception, answer revision, and timely silence. On a single H200 with 256 frames per video, it achieves about a 5x speedup in time to first token and 2.7x higher decoding throughput, with negligible degradation in offline ability. Our study of paradigm, architecture, and data outlines a viable path toward real-time video understanding.
- Abstract(参考訳): ビデオの理解は、オフラインのパラダイムからシフトしている -- 完全に記録された動画を入力として取り、完了後に単一の回答を生成する — から、リアルタイムなインタラクションへと移行している。
本稿では,このパラダイムを検証するため,MOSS-Video-Previewを提案する。
我々の中心的な主張は、知覚は世代によってブロックされてはならない、ということであり、その自然な実現は2チャンネルアーキテクチャである。
視覚的特徴は自己回帰的なシーケンスに結合するのではなく、サイドチャネルを介し、知覚と生成は独立したノンブロッキング経路で実行されるので、視覚処理の頻度を減らし、独立した圧縮のためのクリーンなチャネルワイズインターフェースを公開する。
我々はこれを,高密度キャプションをリアルタイム理解QAに変換するデータ合成パイプラインで補完し,その回答をモデルがこれまでに認識したものに合わせるように修正し,これらのデータに対するオフラインモデルを専門化し,リアルタイムな振る舞いを導き出す。
当社のモデルは、Qwen2.5-VL-7Bベースライン全体 – アーキテクチャよりもデータとスケールに起因するギャップ – を基本として、しかしながら、競争力のあるオフラインビデオとマルチモーダル理解を達成し、空間的かつきめ細かな時間的推論をリアルタイム使用の中心とし、オフラインモデルに欠けている行動、すなわち継続的知覚、回答リビジョン、タイムリーな沈黙を実現しています。
ビデオあたり256フレームの単一のH200では、ファーストトークンの5倍のスピードアップと2.7倍のデコードスループットを実現し、オフライン能力の低下を無視できる。
パラダイム,アーキテクチャ,データに関する本研究は,リアルタイムビデオ理解に向けた有効な道筋を概説する。
関連論文リスト
- Don't Pause: Streaming Video-Language Synchrony for Online Video Understanding [69.296913137409]
オンラインビデオ理解のための新しいパラダイム: SVLS(Streaming Video-Language Synchrony)を紹介する。
LyraVは、2つのコアイノベーションを備えた階層的なコントロールフレームワーク上に構築されたライブストリーミングアシスタントである。
まず、フレーム駆動トランジションコントローラ(FDTC)は、いつ話を続けるか、新しいレスポンスを開始するか、沈黙を保つか、といった、高レベルのセマンティックな決定を行います。
第二に、プラグアンドプレイの軽量予測モジュールであるStreaming Token Pacer (SToP)は、動的に言語生成率に適応し、視覚的コンテンツのペースにマッチする。
論文 参考訳(メタデータ) (2026-06-05T07:29:20Z) - DiffVC-RT: Towards Practical Real-Time Diffusion-based Perceptual Neural Video Compression [38.495966630021556]
我々は、リアルタイム拡散に基づくニューラルビデオ圧縮(NVC)を実現するための最初のフレームワークであるDiffVC-RTを提案する。
DiffVC-RTは、NVIDIA H800 GPU上の720pビデオに対して、リアルタイムエンコーディングとデコード速度206/30 fpsのHEVCデータセット上で、LPIPSよりもVTM-17.0よりも80.1%のパーセプティカルセーブを実現していることを示す。
論文 参考訳(メタデータ) (2026-01-28T12:59:25Z) - TV-RAG: A Temporal-aware and Semantic Entropy-Weighted Framework for Long Video Retrieval and Understanding [14.570869250170139]
TV-RAGは、時間的アライメントとエントロピー誘導のセマンティクスを結合して、長時間ビデオの推論を改善する、トレーニング不要のアーキテクチャである。
これらの時間的および意味的な信号を織り合わせることで、TV-RAGは、再トレーニングや微調整なしに任意のLVLMに移植できる二重レベルの推論ルーチンを実現する。
論文 参考訳(メタデータ) (2025-12-29T14:10:22Z) - VideoScan: Enabling Efficient Streaming Video Understanding via Frame-level Semantic Carriers [23.541896057977745]
VideoScanは、リアルタイムビデオインタラクションのための効率的な視覚言語モデル(VLM)推論フレームワークである。
VideoScanでは、各フレームを表すために単一のセマンティックキャリアトークンを使用している。
論文 参考訳(メタデータ) (2025-03-12T13:30:40Z) - STORM: Token-Efficient Long Video Understanding for Multimodal LLMs [116.4479155699528]
STORMは、イメージエンコーダとビデオLLMの間に専用のテンポラリエンコーダを組み込んだ、新しいアーキテクチャである。
我々は,STORMが様々な長いビデオ理解ベンチマークにおいて最先端の結果を達成することを示す。
論文 参考訳(メタデータ) (2025-03-06T06:17:38Z) - A Coding Framework and Benchmark towards Low-Bitrate Video Understanding [63.05385140193666]
我々は,従来のコーデックとニューラルネットワーク(NN)の両方を活用する,従来型ニューラル混合符号化フレームワークを提案する。
このフレームワークは、動画の移動効率の良いセマンティック表現を確実に保持することで最適化される。
8つのデータセットに3つのダウンストリームタスクを備えた低ビットレートビデオ理解ベンチマークを構築し、このアプローチの顕著な優位性を実証した。
論文 参考訳(メタデータ) (2022-02-06T16:29:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。