論文の概要: MOSS-VL Technical Report
- arxiv url: http://arxiv.org/abs/2608.15045v1
- Date: Sat, 15 Aug 2026 05:12:53 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-18 19:59:03.171387
- Title: MOSS-VL Technical Report
- Title(参考訳): MOSS-VL技術報告
- Abstract要約: リアルタイムインタラクションを第一級機能として扱うオープンビジョン言語モデルファミリーであるMOSS-VLを提案する。
言語デコーダは、ゲートされたクロスアテンションを通してのみビジョンに出席する。
オフラインでは、MOSS-VL-Instructは、競合するスケールで競合し、時間的推論ビデオセットをリードする。
- 参考スコア(独自算出の注目度): 66.58420246189313
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: We present MOSS-VL, an open vision-language model family that treats real-time interaction -- perceiving while it speaks -- as a first-class capability. It is co-designed across the stack: the language decoder attends to vision only through gated cross-attention, so the model can naturally see incoming frames while generating; a synthesized interaction corpus supervises when to speak, when to stay silent, and when to revise; and a staged curriculum concentrates all real-time-specific training in one light final stage over a strong offline foundation. Offline, MOSS-VL-Instruct is competitive at comparable scale and leads temporal-reasoning video sets. Across four streaming benchmarks, MOSS-VL-Realtime posts the best average on three (second on the fourth) among open-source streaming models, sweeping the three subsets that squarely test proactive behavior -- 66.0 vs. 37.5 for the best baseline on OmniMMI Proactive Alerting. With 11.3B parameters but visual tokens outside the decoded sequence, MOSS-VL widens its time-to-first-token advantage over same-backbone Qwen3-VL-8B from 2.8x to 5.1x as visual context grows. We release all five checkpoints, the training curriculum, and the real-time inference code at https://github.com/OpenMOSS/MOSS-VL.
- Abstract(参考訳): MOSS-VLはオープンなビジョン言語モデルファミリで、リアルタイムインタラクション(会話中に知覚する)をファーストクラスの機能として扱う。
言語デコーダは、ゲートクロスアテンションを通してのみ視覚に出席するので、生成中のフレームを自然に見ることができ、合成された相互作用コーパスは、いつ話すか、いつ沈黙し続けるか、いつ修正するかを監督し、ステージドカリキュラムは、強力なオフライン基盤の1つの軽い最終段階において、すべてのリアルタイム特化トレーニングを集中させる。
オフラインでは、MOSS-VL-Instructは、競合するスケールで競合し、時間的推論ビデオセットをリードする。
4つのストリーミングベンチマークで、MOSS-VL-Realtimeは、オープンソースのストリーミングモデルの中で3つ(第4位)で最高の平均を投稿し、OmniMMI Proactive Alertingの最高のベースラインに対して66.0対37.5の正方形テストを行う3つのサブセットを網羅した。
11.3Bパラメータを持つが、デコードされたシーケンスの外側の視覚トークンにより、MOSS-VLは、同じバックボーンのQwen3-VL-8Bよりも2.8倍から5.1倍に、タイム・ツー・ファーストの優位性を広げる。
5つのチェックポイント、トレーニングカリキュラム、およびリアルタイム推論コードをhttps://github.com/OpenMOSS/MOSS-VLでリリースします。
関連論文リスト
- Mage-VL: An Efficient Codec-Native Streaming Multimodal Foundation Model [60.85752511708308]
本稿では,リアルタイムマルチモーダル理解とインタラクションのための効率的なストリーミング基盤モデルであるMage-VLを提案する。
その中核として、我々のカスタムトークンであるMage-ViTは、動的エントロピーリッチな領域を選択的に符号化することで、一様フレームサンプリングを置き換える。
我々は、キャプションとAI駆動のパフォーマンス診断のためのプロンプトコード共同最適化を含むAI4AIデータパイプラインを確立する。
論文 参考訳(メタデータ) (2026-07-27T17:59:53Z) - Kwai Keye-VL-2.0 Technical Report [53.82434681649277]
Keye-VL-2.0は、長期ビデオ理解とエージェントインテリジェンスを促進するために設計されたマルチモーダル基盤モデルである。
DeepSeek Sparse Attention (DSA)をGQAベースのマルチモーダルアーキテクチャに適応したのは,これが初めてである。
コンテクスト-RLとビデオ-RLを併用したMOPD(Cross-Modal Multi-Teacher On-Policy Distillation)は破滅的忘れのアルゴリズム的ジレンマを克服する。
論文 参考訳(メタデータ) (2026-06-09T09:58:08Z) - OmniVTG: A Large-Scale Dataset and Training Paradigm for Open-World Video Temporal Grounding [55.29748680163419]
Video Temporal Grounding (VTG)は、データセットの規模やセマンティックな多様性が制限されているため、オープンワールド設定で苦労している。
オープンワールドVTGのための新しい大規模データセットであるOmniVTGを紹介する。
MLLMをトレーニングして、まず予測を行い、その理解能力を使用して、独自の予測を反映し、洗練します。
論文 参考訳(メタデータ) (2026-04-28T06:34:19Z) - Kwai Keye-VL Technical Report [80.53170317017147]
ショートビデオ理解のためのマルチモーダル基盤モデルである textbfKwai Keye-VL を紹介する。
Keye-VLの開発は,ビデオに重点を置いた大規模で高品質なデータセットと,革新的なトレーニングレシピという,2つのコア柱に留まっている。
提案手法の有効性を検証するため,我々は,Kee-VLが公開ビデオベンチマークにおける最先端の成果を達成し,一般的な画像ベースタスクにおいて高い競争力を保っていることを示す,広範囲な評価を行う。
論文 参考訳(メタデータ) (2025-07-02T17:57:28Z) - Visatronic: A Multimodal Decoder-Only Model for Speech Synthesis [13.702423348269155]
Video-Text to Speech (VTTS) は、会話者のテキストとビデオの両方に条件付けされた音声生成タスクである。
視覚,テキスト,音声の入力を共有部分空間に埋め込む,マルチモーダルデコーダのみの統合トランスフォーマモデルであるVisatronicを導入する。
LRS3でのみ訓練されたSOTA法よりも優れた4.5%のWERが得られることを示す。
論文 参考訳(メタデータ) (2024-11-26T18:57:29Z) - Unveiling Encoder-Free Vision-Language Models [62.52803514667452]
既存の視覚言語モデル (VLM) は主に視覚的特徴を抽出するために視覚エンコーダに依存しており、視覚言語タスクには大きな言語モデル (LLM) が続く。
エンコーダベースモデルとエンコーダフリーモデルとのギャップを橋渡しし、純粋なVLMに対するシンプルで効果的なトレーニングレシピを示す。
EVEはエンコーダなしの視覚言語モデルで、効率的にトレーニングと転送ができる。
論文 参考訳(メタデータ) (2024-06-17T17:59:44Z) - ViLA: Efficient Video-Language Alignment for Video Question Answering [22.972518862771697]
我々のViLAネットワークは、効率的なフレームサンプリングと効果的なクロスモーダルアライメントの両方に対処する。
我々のViLAネットワークは、ビデオ質問応答ベンチマークにおいて最先端の手法よりも優れています。
論文 参考訳(メタデータ) (2023-12-13T18:58:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。