論文の概要: Beyond Scene Priors: Fine-Grained Traffic Scene Reasoning with Benchmarking and Query-Guided Small-Object Focus
- arxiv url: http://arxiv.org/abs/2607.04149v1
- Date: Sun, 05 Jul 2026 07:27:02 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.840968
- Title: Beyond Scene Priors: Fine-Grained Traffic Scene Reasoning with Benchmarking and Query-Guided Small-Object Focus
- Title(参考訳): 優先事項を超えて - ベンチマークとクエリガイドによる小さなオブジェクト重視による微粒なトラフィックシーン推論
- Authors: Waikit Xiu, Qiang Lu, Zian Wang, Xinjie Yang, Zhiwei Chen, Chen Sun, Xiying Li,
- Abstract要約: 我々は、FGTR-BenchとTSR-MLLM(Text-Guided Small-Object Reasoning MLLM)を提案する。
FGTR-Benchは、マルチエージェント生成、一貫性チェック、専門家監査を通じて作成される40,236のシングルイメージのMultiple-Choice Questions (MCQ)で構成されている。
Qwen3-VL-4B上に構築されたTSR-MLLMは、クエリ条件付きテキストガイド型小型オブジェクトフォーカス(TG-SOF)マップを使用して証拠の希釈を解決する。
- 参考スコア(独自算出の注目度): 21.376452292092836
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: In safety-critical traffic scenarios, answering complex questions relies on minute, localized visual cues. However, standard Multimodal Large Language Models (MLLMs) tend to over-attend to backgrounds, overwhelming crucial small objects during visual-language alignment, a failure mode we term 'critical evidence dilution.' Furthermore, existing visual question answering (VQA) datasets rarely expose this flaw, as they lack large-scale, distractor-heavy evaluations that require pinpointing local evidence. To bridge this evaluation and architecture gap, we introduce the Fine-Grained Traffic Reasoning Benchmark (FGTR-Bench) and the Text-Guided Small-Object Reasoning MLLM (TSR-MLLM). FGTR-Bench comprises 40,236 single-image Multiple-Choice Questions (MCQs) created via multi-agent generation, consistency checks, and expert audits, alongside a disjoint 4,947-sample blind test split. To resolve evidence dilution, TSR-MLLM, built on Qwen3-VL-4B, uses a query-conditioned Text-Guided Small-Object Focus (TG-SOF) map. Applied once at the decoder boundary, the map adds sparse Top-K gated residuals to the most question-relevant vision slots while leaving text tokens unchanged. Together with lightweight decoder adaptation, TSR-MLLM preserves single-pass inference without external detectors or image re-encoding. Under matched settings, TSR-MLLM outperforms the strongest 4B baseline by 2.1 points on FGTR-Bench (74.1% overall), with larger gains on evidence-local tracks. Furthermore, it remains competitive on DriveQA-V (CARLA Signs) under greedy decoding without task-specific fine-tuning.
- Abstract(参考訳): 安全クリティカルな交通シナリオでは、複雑な質問に答えるには、局所的な視覚的手がかりに依存する。
しかし、標準的なマルチモーダル大言語モデル(MLLM)は、視覚言語アライメントにおいて圧倒的に重要な小さなオブジェクトである背景に過度に依存する傾向にある。
さらに、既存の視覚的質問応答(VQA)データセットは、局所的な証拠の特定を必要とする大規模で注意深い評価を欠いているため、この欠陥をほとんど公開しない。
この評価とアーキテクチャのギャップを埋めるため,FGTR-Bench と Text-Guided Small-Object Reasoning MLLM (TSR-MLLM) を導入する。
FGTR-Benchは、マルチエージェント生成、一貫性チェック、専門家監査を通じて作成される40,236のシングルイメージのMultiple-Choice Questions (MCQ)と、分離された4,947サンプルのブラインドテストスプリットで構成される。
証拠の希釈を解決するため、Qwen3-VL-4B上に構築されたTSR-MLLMは、クエリ条件付きテキストガイド型小型オブジェクトフォーカス(TG-SOF)マップを使用する。
デコーダ境界で一度適用すると、地図はテキストトークンをそのまま残しながら、最も疑問に満ちた視覚スロットにTop-Kゲートの残基を狭く追加する。
軽量デコーダの適応とともに、TSR-MLLMは外部検出器や画像再符号化なしでシングルパス推論を保っている。
マッチした設定で、TSR-MLLMはFGTR-Bench(全体の74.1%)で最強の4Bベースラインを2.1ポイント上回った。
さらに、DriveQA-V (CARLA Signs) では、タスク固有の微調整なしで、グレディデコードで競合する。
関連論文リスト
- Latent Noise Mask for Reducing Visual Redundancy in Multimodal Large Language Models [56.11961584000622]
MLLM(Multimodal large language model)は、しばしば細粒度の視覚的推論において失敗する。
質問条件付き視覚的エビデンス浄化フレームワークであるLatEnt Noise maSk (Lens)を提案する。
視覚トークンが現在の質問をサポートし、復号時にそれらを保存するレンズスコア。
論文 参考訳(メタデータ) (2026-06-29T11:44:09Z) - COHERENCE: Benchmarking Fine-Grained Image-Text Alignment in Interleaved Multimodal Contexts [34.97838652946461]
COHERENCEは、MLLMがインターリーブされたコンテキストにおける微細な画像テキスト対応を回復する能力を評価するために設計されたベンチマークである。
我々は、6種類の誤り解析を行い、インターリーブ画像テキスト理解における失敗の微粒化を可能とした。
論文 参考訳(メタデータ) (2026-04-30T03:59:22Z) - PinpointQA: A Dataset and Benchmark for Small Object-Centric Spatial Understanding in Indoor Videos [23.951493516327016]
PinpointQAは、屋内ビデオにおける小さなオブジェクト中心空間理解のための最初のデータセットとベンチマークである。
1024のシーンと10,094のQAペアからなる。
実験では、プログレッシブチェーンに沿って一貫した能力ギャップが示され、SSPは特に困難である。
論文 参考訳(メタデータ) (2026-04-10T05:53:47Z) - MultiHaystack: Benchmarking Multimodal Retrieval and Reasoning over 40K Images, Videos, and Documents [57.32877731797049]
MultiHaystackは、大規模なクロスモーダル条件下での検索と推論の両方を評価するために設計された最初のベンチマークである。
モデルが対応するエビデンスを付与した場合,その性能は,全コーパスからそのエビデンスを取得するために必要な場合,急激に低下することがわかった。
論文 参考訳(メタデータ) (2026-03-05T21:43:02Z) - MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks [67.31276358668424]
AV-HaystacksQAという新しいタスクを導入し、クエリに応答して、異なるビデオにまたがる有能なセグメントを識別し、それらをリンクして最も有意義な回答を生成する。
AVHaystacksは、マルチビデオ検索および時間的グラウンドタスクにおけるLMMの能力を評価するために設計された3100の注釈付きQAペアからなるオーディオビジュアルベンチマークである。
提案するAVHaystackのQAタスクにおけるBLEU@4およびGPT評価スコアの基準値よりも89%と65%の相対的な改善を実現し、モデルに依存しないマルチエージェントフレームワークを提案する。
論文 参考訳(メタデータ) (2025-06-08T06:34:29Z) - Benchmarking Retrieval-Augmented Multimodal Generation for Document Question Answering [60.062194349648195]
Document Visual Question Answering (DocVQA)は、長いマルチモーダル文書の処理において2つの課題に直面している。
現在の文書検索拡張生成法(DocRAG)はテキスト中心のアプローチによって制限されている。
MMDocRAGは,多ページのクロスモーダルエビデンスチェーンを持つ4,055のエキスパートアノテーション付きQAペアを特徴とする総合ベンチマークである。
論文 参考訳(メタデータ) (2025-05-22T09:52:57Z) - Grounded Chain-of-Thought for Multimodal Large Language Models [66.04061083611863]
我々は,GCoT(Gunded Chain-of-Thought)と呼ばれるマルチモーダル大規模言語モデル(MLLM)の新しい学習タスクを提案する。
GCoTは、MLLMが関連する視覚的手がかりを段階的に認識し、グラウンド化するのを支援し、グラウンド化座標による正しい解を直感的に予測する。
この作業を容易にするために,5,033画像に対して24,022 GCoT例からなるマルチモーダルグラウンドド・チェーン・オブ・ソート(MM-GCoT)と呼ばれるデータセットを慎重に設計し,構築する。
論文 参考訳(メタデータ) (2025-03-17T04:07:47Z) - Visual CoT: Advancing Multi-Modal Language Models with a Comprehensive Dataset and Benchmark for Chain-of-Thought Reasoning [40.972648044298374]
MLLM(Multi-Modal Large Language Models)は様々なVQAタスクにおいて顕著な性能を示す。
解釈可能性に欠け、複雑な視覚的な入力に苦しむことが多い。
438k問合せ対からなる大規模Visual CoTデータセットを提案する。
視覚的な入力を動的に重視し,解釈可能な思考を提供するマルチターン処理パイプラインを提案する。
論文 参考訳(メタデータ) (2024-03-25T17:59:23Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。