論文の概要: Efficient Unified Multimodal Understanding (EUMU): Winning Solution for the MUMU Track at the 8th LSVOS Challenge
- arxiv url: http://arxiv.org/abs/2609.19451v1
- Date: Wed, 16 Sep 2026 21:37:05 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-20 08:55:54.020808
- Title: Efficient Unified Multimodal Understanding (EUMU): Winning Solution for the MUMU Track at the 8th LSVOS Challenge
- Title(参考訳): ユニファイドマルチモーダル理解(EUMU):第8回LSVOSチャレンジにおけるMUMUトラックの勝利解
- Abstract要約: 有効統一マルチモーダル理解(EUMU)は、第8回LSVOSチャレンジのMUMUトラックの勝利のソリューションである。
EUMUは、検出とキャプションのプロンプトベースの機能を使用して、共有事前トレーニングされたマルチモーダルモデルを構築している。
EUMUには239.169Mパラメータが含まれ、23.947 GFLOPsが必要であり、4.5GBのピーク推論メモリを使用し、最終挑戦スコアは17.3409である。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: The Mobile Unified Multimodal Understanding (MUMU) Challenge requires a single efficient model to jointly perform multi-concept image tagging, open-vocabulary object detection, and image captioning. We present Efficient Unified Multimodal Understanding (EUMU), the winning solution for the MUMU Track of the 8th LSVOS Challenge. EUMU builds on a shared pretrained multimodal model, using its prompt-based capabilities for detection and captioning and training lightweight heads on shared visual features to predict quality, scene, and event tags. Rather than treating the three tasks independently, EUMU applies task-aware inference refinement by reusing task outputs as cross-task cues. For detection, caption cues help recover objects missed by the initial detection. For captioning, detection cues help refine the caption to better reflect the detected objects. For tagging, image statistics refine quality predictions, while caption and detection cues refine scene and event predictions. This design unifies all three tasks within a single model while satisfying the challenge's resource constraints. EUMU contains 239.169M parameters, requires 23.947 GFLOPs, uses 4.5 GB of peak inference memory, and achieves a final challenge score of 17.3409. Code and models are available at https://github.com/Dayoung-Kil/EUMU.
- Abstract(参考訳): Mobile Unified Multimodal Understanding (MUMU) Challengeは、複数概念の画像タグ付け、オープン語彙オブジェクト検出、画像キャプションを共同で行うための単一の効率的なモデルを必要とする。
第8回LSVOSチャレンジMUMUトラックの勝利解であるEUMU(Efficient Unified Multimodal Understanding)を提案する。
EUMUは、クオリティ、シーン、イベントタグを予測するために、共有された視覚的特徴に基づいて軽量ヘッドを検出し、キャプションし、訓練するためのプロンプトベースの機能を使用して、共有事前トレーニングされたマルチモーダルモデルを構築している。
EUMUは3つのタスクを独立して扱うのではなく、タスク出力をタスク間のキューとして再利用することでタスク認識推論の洗練を適用している。
検出のために、キャプションキューは、初期検出によって見逃されたオブジェクトを復元するのに役立つ。
キャプションでは、検出キューがキャプションを洗練して、検出されたオブジェクトをよりよく反映するのに役立つ。
タグ付けでは、画像統計は品質予測を洗練させ、キャプションと検出はシーンとイベント予測を洗練させる。
この設計は、課題のリソース制約を満たしながら、1つのモデル内の3つのタスクをすべて統一する。
EUMUには239.169Mパラメータが含まれ、23.947 GFLOPsが必要であり、4.5GBのピーク推論メモリを使用し、最終挑戦スコアは17.3409である。
コードとモデルはhttps://github.com/Dayoung-Kil/EUMUで公開されている。
関連論文リスト
- QG-CoC: Question-Guided Chain-of-Captions for Large Multimodal Models [50.51641024244313]
本稿では,複数の画像を扱う場合の視覚的情報処理について検討する。
そこで本研究では,新たなゼロショットプロンプト手法であるQG-CoC(QG-CoC)を提案する。
マルチイメージおよびシングルイメージベンチマークのための各種オープンソースおよびクローズドソースMLLMについて評価を行った。
論文 参考訳(メタデータ) (2025-11-05T05:49:48Z) - MMSearch-Plus: Benchmarking Provenance-Aware Search for Multimodal Browsing Agents [44.63565009665076]
マルチモーダル理解を強制する311タスクのベンチマークであるMMSearch-Plusを紹介する。
標準ブラウジングツールとset-of-mark(SoM)モジュールを備えたモデルに依存しないエージェントフレームワークを提供する。
SoMは、プロファイナンス対応のズーム・アンド・リトリーブを可能にし、マルチステップ推論におけるロバスト性を改善する。
論文 参考訳(メタデータ) (2025-08-29T09:58:27Z) - Analyze-Prompt-Reason: A Collaborative Agent-Based Framework for Multi-Image Vision-Language Reasoning [3.588567067449924]
マルチイメージ推論のための協調エージェントベースフレームワークを提案する。
提案手法は,多様なデータセットやタスク形式にまたがるマルチモーダル推論のインターリーブ化という課題に対処する。
我々は2025年のMIRAGE Challengeから18種類の多様なデータセットについて評価を行った。
論文 参考訳(メタデータ) (2025-08-01T06:39:15Z) - Towards Text-Image Interleaved Retrieval [49.96332254241075]
テキスト画像検索(TIIR)タスクを導入し、クエリと文書をインターリーブしたテキスト画像シーケンスとする。
我々は、自然にインターリーブされたwikiHowチュートリアルに基づいてTIIRベンチマークを構築し、インターリーブされたクエリを生成するために特定のパイプラインを設計する。
異なる粒度で視覚トークンの数を圧縮する新しいMMEを提案する。
論文 参考訳(メタデータ) (2025-02-18T12:00:47Z) - Grounding Partially-Defined Events in Multimodal Data [61.0063273919745]
部分定義イベントに対するマルチモーダル定式化を導入し、これらのイベントの抽出を3段階スパン検索タスクとしてキャストする。
このタスクのベンチマークであるMultiVENT-Gを提案し,22.8Kのラベル付きイベント中心エンティティを含む,14.5時間の高密度アノテーション付き現在のイベントビデオと1,168のテキストドキュメントからなる。
結果は、イベント理解の抽象的な課題を示し、イベント中心のビデオ言語システムにおける約束を実証する。
論文 参考訳(メタデータ) (2024-10-07T17:59:48Z) - A Vanilla Multi-Task Framework for Dense Visual Prediction Solution to
1st VCL Challenge -- Multi-Task Robustness Track [31.754017006309564]
様々な視覚認識アルゴリズムをマルチタスクモデルにシームレスに結合するUniNetというフレームワークを提案する。
具体的には,DreTR3D,Mask2Former,BinsFormerを3次元オブジェクト検出,インスタンスセグメンテーション,深さ推定タスクとして選択する。
最後のエントリーは、InternImage-Lバックボーンを備えた単一のモデルで、総合スコアは49.6である。
論文 参考訳(メタデータ) (2024-02-27T08:51:20Z) - Unified Demonstration Retriever for In-Context Learning [56.06473069923567]
Unified Demonstration Retriever (textbfUDR)は、幅広いタスクのデモを検索する単一のモデルである。
我々は,高品質な候補を見つけるための反復的なマイニング戦略を備えたマルチタスクリストワイド・トレーニング・フレームワークを提案する。
13のタスクファミリーと複数のデータドメインにわたる30以上のタスクの実験は、UDRがベースラインを大幅に上回っていることを示している。
論文 参考訳(メタデータ) (2023-05-07T16:07:11Z) - Unifying Architectures, Tasks, and Modalities Through a Simple
Sequence-to-Sequence Learning Framework [83.82026345508334]
モーダル性(クロスモダリティ、ビジョン、言語など)とタスク(画像生成、視覚接地、画像キャプション、画像分類、テキスト生成など)を統一する統合マルチモーダル事前訓練モデルOFAを提案する。
OFAは、イメージキャプション(COCO test CIDEr: 149.6)、テキスト・ツー・イメージ生成(COCO test FID: 10.5)、VQA(test-std encoder acc.: 80.02)、SNLI-VE(test acc.: 90)など、一連のマルチモーダルタスクにおける新しい最先端処理を実現している。
論文 参考訳(メタデータ) (2022-02-07T10:38:21Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。