論文の概要: Propose and Attend: Training-free MLLM Grounding Confidence via Multi-Token Localized Attention
- arxiv url: http://arxiv.org/abs/2607.05978v1
- Date: Tue, 07 Jul 2026 08:10:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-08 21:24:51.451798
- Title: Propose and Attend: Training-free MLLM Grounding Confidence via Multi-Token Localized Attention
- Title(参考訳): 目的と態度:多段階局所的注意による無訓練MLLM接地信頼度
- Abstract要約: MTLA(Multi-Token Localized Attention)は、トレーニングなしのポストホックスコアで、予測トークンが主張する領域にどの程度強く関与しているかを測定する。
複数のMLLMファミリーと3つのモダリティにまたがって、MTLAは最高のトレーニングのないベースラインに対して、AUROCを+7から+38に改善する。
- 参考スコア(独自算出の注目度): 9.899649326522761
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Multimodal large language models can emit localized predictions, bounding boxes for objects and temporal windows for video and audio events, but they hallucinate these regions prolifically. The model's own token log-probabilities are nearly uninformative: they conflate grounding quality with input ambiguity, and coordinate tokens become near-deterministic once the model commits. We propose Multi-Token Localized Attention (MTLA): a training-free, post-hoc score that measures how strongly a prediction's tokens attend to the region they claim. Prior attention-based detectors, which sum attention over the entire input modality and read a single response token, are weaker special cases; we show that summing only within the claimed region and aggregating across all prediction tokens recovers a stronger grounding signal. The same recipe applies almost trivially to other modalities and tasks: object detection in images and temporal localization in video and audio. Across multiple MLLM families and three modalities, MTLA improves hallucination AUROC by +7 to +38 over the best prior training-free baseline. Used as a confidence score for re-ranking, it nearly doubles the zero-shot COCO detection AP of an open-source 8B generalist (from 20.4 to 37.0), narrowing the gap to supervised detectors without any task-specific training.
- Abstract(参考訳): マルチモーダルな大規模言語モデルは、オブジェクトのボックスやビデオやオーディオイベントの時間的ウィンドウなど、局所的な予測を出力することができるが、これらの領域は確率的に幻覚する。
モデル自身のトークンログ確率は、入力のあいまいさで基底品質を記述し、モデルがコミットすると、座標トークンはほぼ決定論的になる。
MTLA(Multi-Token Localized Attention: Multi-Token Localized Attention: MTLA)を提案する。
従来のアテンションベース検出器は,入力モード全体に対する注意を和らげ,単一の応答トークンを読み取ることで,要求領域内でのみ集計し,全ての予測トークンを集約することにより,より強いグラウンド信号が回復することを示す。
同じレシピは、画像中の物体の検出や、ビデオやオーディオにおける時間的局所化といった、他のモダリティやタスクに対して、ほぼ自明に適用される。
複数のMLLMファミリーと3つのモダリティにまたがって、MTLAは最高のトレーニングのないベースラインに対して、AUROCを+7から+38に改善する。
信頼性スコアとして使用され、オープンソースの8Bジェネラリスト(20.4から37.0まで)のゼロショットCOCO検出APをほぼ2倍にし、タスク固有のトレーニングを行わずに検出器のギャップを狭める。
関連論文リスト
- ActMap: Single-Pass Uncertainty Quantification from Generation-Time Activation Maps [1.7403133838762448]
ActMapは、生成時の隠れ状態軌跡を固定された12時間s32times128$の時間統計チャネルに圧縮する表現である。
小型ビジョン変換器としてインスタンス化された軽量分類器は、各マップから推定された正当性確率をミリ秒単位で読み取る。
論文 参考訳(メタデータ) (2026-09-10T13:04:24Z) - Language Models Can Control Their Own Attention [42.07765767561011]
宣言的意図(DA:Declarative Attention)は、モデルにそのチェーン内のどこに出席すべきかを宣言するプロトコルである。
DAはデコード中の総出席トークン(52.0%、31.1%)を大幅に削減し、モデルスケールで縮小する程度の精度低下(1.27pp、2.75pp)を行う。
論文 参考訳(メタデータ) (2026-09-02T15:43:38Z) - Beyond the Current Observation: Evaluating Multimodal Large Language Models in Controllable Non-Markov Games [69.57330692969543]
RNG-Benchは、過去の観測を再構築するベースモデルの能力を分離するために設計されたベンチマークスイートである。
RNG-Benchには2つの補完ゲームがある: マッチングペア(英語版) - 特定の場所でカードのIDを短期間明らかにする) と、エゴセントリックなビューを空間地図に統合する3D Maze である。
最も難しい構成では、約128Kのトークンと350のイメージ入力のコンテキストが必要であり、フロンティアMLLMによる飽和には程遠いままである。
論文 参考訳(メタデータ) (2026-06-17T17:59:34Z) - Unmute the Patch Tokens: Rethinking Probing in Multi-Label Audio Classification [8.07177858013243]
オーディオにおける自己教師型学習は、微調整をデフォルトとする。
本稿では,二項化プローブについて紹介する。二項化プローブは,プロトタイプを学習し,クラスワイズ情報アグリゲーションを行う軽量でシンプルなプーリング手法である。
我々の研究は、オーディオSSLモデルを評価するための競争的かつ効率的なパラダイムとして探索を確立し、コストのかかる微調整への依存に挑戦する。
論文 参考訳(メタデータ) (2025-09-29T15:11:18Z) - Attention Reallocation: Towards Zero-cost and Controllable Hallucination Mitigation of MLLMs [62.9348974370985]
約ゼロの余剰コストで幻覚を緩和するための注意再配置(AttnReal)を提案する。
我々のアプローチは,MLLMの注意分布が,歴史的出力トークンによって特徴が支配されるという重要な観測によって動機付けられている。
この観測に基づいて、AttnRealは出力トークンからの過剰な注意をリサイクルし、それを視覚トークンに再配置することで、MLLMの言語優先への依存を軽減します。
論文 参考訳(メタデータ) (2025-03-11T11:52:37Z) - Not all tokens are created equal: Perplexity Attention Weighted Networks for AI generated text detection [49.15148871877941]
大規模言語モデル(LLM)の検出に理論的に魅力的なアプローチを提供する次点分布出力
本稿では,LLMの最後の隠蔽状態を用いて,列長の次トーケン分布のメトリクスに基づく一連の特徴量の重み付けを行うパープレキシティ注意重み付けネットワーク(PAWN)を提案する。
PAWNは、トレーニング可能なパラメータのごく一部を持つ最強のベースラインよりも、競争力があり、より優れた分散性能を示している。
論文 参考訳(メタデータ) (2025-01-07T17:00:49Z) - FIRP: Faster LLM inference via future intermediate representation prediction [54.897493351694195]
FIRPはデコードステップ毎に1つではなく複数のトークンを生成する。
いくつかのモデルとデータセットで1.9x-3xのスピードアップ比を示す広範な実験を行った。
論文 参考訳(メタデータ) (2024-10-27T15:53:49Z) - ControlMLLM: Training-Free Visual Prompt Learning for Multimodal Large Language Models [73.34709921061928]
マルチモーダル大言語モデル(MLLM)に視覚的プロンプトを注入する学習自由手法を提案する。
我々は,エネルギー関数に基づいて学習可能な潜伏変数を最適化し,注目マップにおける参照領域の強度を高める。
提案手法は,参照能力のMLLMへの統合に有望な方向を与え,ボックス,マスク,スクリブル,ポイントによる参照を支援する。
論文 参考訳(メタデータ) (2024-07-31T11:40:29Z) - OPERA: Alleviating Hallucination in Multi-Modal Large Language Models
via Over-Trust Penalty and Retrospection-Allocation [124.9008419182485]
OPERA(Over-trust PenaltyとRetrospection-Allocation戦略に基づく新しいMLLM復号法)を提案する。
私たちのアプローチは、ほとんどの幻覚は自己注意行列の知識集約パターンと密接に結びついているという興味深い観察から始まります。
この観察に基づいて、OPERAは、ビーム探索復号時にモデルロジットにペナルティ項を導入し、オーバートラスト問題を緩和する。
論文 参考訳(メタデータ) (2023-11-29T18:57:07Z) - Semi-Supervised Speech Recognition via Local Prior Matching [42.311823406287864]
局所的な事前マッチングは、強い事前から知識を蒸留する半教師付き目的である。
我々は,LPMが理論的に良好であり,実装が容易であり,既存の知識蒸留技術よりも優れていることを実証した。
論文 参考訳(メタデータ) (2020-02-24T16:07:11Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。