論文の概要: ClueTracer: Question-to-Vision Clue Tracing for Training-Free Hallucination Suppression in Multimodal Reasoning
- arxiv url: http://arxiv.org/abs/2602.02004v1
- Date: Mon, 02 Feb 2026 12:03:56 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-02-03 19:28:34.126819
- Title: ClueTracer: Question-to-Vision Clue Tracing for Training-Free Hallucination Suppression in Multimodal Reasoning
- Title(参考訳): ClueTracer:マルチモーダル推論における学習自由幻覚抑制のための質問対視覚的クローズトレーシング
- Abstract要約: 本稿では,視覚的手がかり検索の指標であるClueRecallを紹介する。
本稿では,幻覚抑制のためのトレーニングフリー,パラメータフリー,アーキテクチャ非依存のプラグインであるClueTracerを紹介する。
- 参考スコア(独自算出の注目度): 11.30122927323085
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large multimodal reasoning models solve challenging visual problems via explicit long-chain inference: they gather visual clues from images and decode clues into textual tokens. Yet this capability also increases hallucinations, where the model generates content that is not supported by the input image or the question. To understand this failure mode, we identify \emph{reasoning drift}: during clue gathering, the model over-focuses on question-irrelevant entities, diluting focus on task-relevant cues and gradually decoupling the reasoning trace from visual grounding. As a consequence, many inference-time localization or intervention methods developed for non-reasoning models fail to pinpoint the true clues in reasoning settings. Motivated by these insights, we introduce ClueRecall, a metric for assessing visual clue retrieval, and present ClueTracer, a training-free, parameter-free, and architecture-agnostic plugin for hallucination suppression. ClueTracer starts from the question and traces how key clues propagate along the model's reasoning pathway (question $\rightarrow$ outputs $\rightarrow$ visual tokens), thereby localizing task-relevant patches while suppressing spurious attention to irrelevant regions. Remarkably, \textbf{without any additional training}, ClueTracer improves all \textbf{reasoning} architectures (including \texttt{R1-OneVision}, \texttt{Ocean-R1}, \texttt{MM-Eureka}, \emph{etc}.) by $\mathbf{1.21\times}$ on reasoning benchmarks. When transferred to \textbf{non-reasoning} settings, it yields a $\mathbf{1.14\times}$ gain.
- Abstract(参考訳): 大規模なマルチモーダル推論モデルは、画像から視覚的な手がかりを収集し、手掛かりをテキストトークンにデコードすることで、明示的な長鎖推論を通じて、難しい視覚的問題を解決する。
しかし、この能力はまた幻覚を増大させ、モデルが入力画像や質問でサポートされていないコンテンツを生成する。
この失敗モードを理解するために, 手がかり収集において, モデルが質問非関連エンティティに過度に焦点を合わせ, タスク関連キューに焦点を絞り, 視覚的グラウンドから推論トレースを徐々に分離する。
その結果、非推論モデルのために開発された多くの推論時ローカライズまたは介入手法は、推論設定における真の手がかりを特定できない。
これらの知見に触発され,視覚的手がかり検索の指標であるClueRecallと,幻覚抑制のためのトレーニングフリー,パラメータフリー,アーキテクチャ非依存のプラグインであるClueTracerを紹介した。
ClueTracerはこの質問から始まり、キーのヒントがモデルの推論経路に沿ってどのように伝播するか(クエション$\rightarrow$ outputs $\rightarrow$ visual tokens)を辿り、従ってタスク関連パッチをローカライズし、無関係な領域への急激な注意を抑える。
注目すべきなのは、 ClueTracer は、すべての \textbf{reasoning} アーキテクチャ( \texttt{R1-OneVision}, \texttt{Ocean-R1}, \texttt{MM-Eureka}, \emph{etc} を含む)を改善していることだ。
) by $\mathbf{1.21\times}$ on reasoning benchmarks。
textbf{non-reasoning}設定に転送されると、$\mathbf{1.14\times}$ gainとなる。
関連論文リスト
- TRACE: Trajectory-robust Admission with Evidence Ordering for Efficient GUI Agents [54.88208747581851]
トレーニング不要のビジュアルトークンプルーニングは、このコストを削減することができるが、キャッシュ再利用には基本的な制約が伴う。
我々は,emphtextbfTrajectory-textbfrobust textbfAdmission と textbfCoverage-aware textbfEvidence ordering のためのトレーニング不要フレームワーク textbfmethod を提案する。
論文 参考訳(メタデータ) (2026-09-09T15:12:48Z) - RoboPIN: Grounded Embodied Reasoning via Pinned Chain-of-Thought [50.36951914894845]
身体的推論は、物理的環境におけるタスク関連オブジェクトや空間を知覚するモデルを必要とする。
現在の視覚言語モデルは、テキストのみまたはコーディネートで拡張されたチェーン・オブ・思想に依存している。
我々は、あらゆる推論ステップを視覚的証拠にピン留めする構造化推論パラダイムであるPinned Chain-of-Thoughtを提案する。
論文 参考訳(メタデータ) (2026-06-14T11:30:42Z) - LongTraceRL: Learning Long-Context Reasoning from Search Agent Trajectories with Rubric Rewards [53.339700196282905]
検証可能な報酬(RLVR)による強化学習は,この課題を約束している。
既存の方法は、信頼性の低いインタプリタと、スパースで結果のみの報酬信号によって制限される。
textscLongTraceRLは、ランダムサンプリングやワンショット検索によって作られたものよりもはるかに難しいトレーニングコンテキストを生成する。
論文 参考訳(メタデータ) (2026-05-29T17:51:40Z) - Shorthand for Thought: Compressing LLM Reasoning via Entropy-Guided Supertokens [4.0704009036918025]
大規模言語モデルにおける推論は、重要な推論時間計算を引き起こす。
推論トークンは、低エントロピーのテクスト構造トークン(推論過程を足場とするフレーズの再帰)と高エントロピーのテクスト有機トークン(解に向かって進むプロブレム固有のコンテンツ)の2つの機能タイプに分かれていることを示す。
頻繁な構造パターンをキャプチャするテクスチャツペルトケンを導出し、教師付き微調整によりモデルに導入するように教える。
論文 参考訳(メタデータ) (2026-04-29T07:06:43Z) - Clue Matters: Leveraging Latent Visual Clues to Empower Video Reasoning [14.945921705882725]
この研究はMLLMビデオ理解における知覚と世代間のギャップを埋め、ビデオQAアプリケーションのための解釈可能で忠実な推論パラダイムを提供する。
階層的人間の視覚認知に着想を得たClueNetを提案する。
論文 参考訳(メタデータ) (2026-03-16T09:15:12Z) - Seeing Through the Chain: Mitigate Hallucination in Multimodal Reasoning Models via CoT Compression and Contrastive Preference Optimization [78.94590726578014]
マルチモーダル推論モデル (Multimodal reasoning model, MLRM) は幻覚の傾向が強く, 効果的な解はいまだ未発見のままである。
textbfCompression と textbfPreference textbfOptimization を組み合わせたトレーニングベースの緩和フレームワーク C3PO を提案する。
論文 参考訳(メタデータ) (2026-02-03T11:00:55Z) - MentisOculi: Revealing the Limits of Reasoning with Mental Imagery [63.285794947638614]
視覚的解決が可能な多段階推論問題の組である MentisOculi を開発した。
遅延トークンから明示的な生成画像まで,視覚的戦略を評価すると,一般的にはパフォーマンス向上に失敗する。
以上の結果から,視覚的思考がモデル推論の恩恵を受けていないことが示唆された。
論文 参考訳(メタデータ) (2026-02-02T18:49:06Z) - Thinking with Deltas: Incentivizing Reinforcement Learning via Differential Visual Reasoning Policy [75.66913260900726]
検証可能なリワードによる強化学習は、大規模言語モデルにおいてかなり高度な推論能力を持っている。
既存のパラダイムは、テキスト中心の成果報酬によって推進され、モデルが視覚的知覚をバイパスすることを奨励します。
我々はtextbfDifferential Visual Reasoning Policy によって駆動されるフレームワーク Deltas を用いた textbfThinking を提案する。
論文 参考訳(メタデータ) (2026-01-11T08:25:34Z) - CogFlow: Bridging Perception and Reasoning through Knowledge Internalization for Visual Mathematical Problem Solving [28.57547723919984]
本稿では,認知に触発された新しい3段階のフレームワークであるCogFlowについて紹介する。
抽出された視覚的手がかりをその後の推論に忠実に統合することを保証するために,知識内部化リワードモデルを導入する。
また、120K以上の高品質な知覚関連アノテーションを持つサンプルを含むモデルトレーニングのための新しいデータセットMathCogも提供します。
論文 参考訳(メタデータ) (2026-01-05T08:02:18Z) - Deep But Reliable: Advancing Multi-turn Reasoning for Thinking with Images [53.373427633330515]
DRIMは,マルチモーダルCoTの画像について考える際に,深層かつ信頼性の高いマルチターン推論を可能にするモデルである。
高精細画像データセットに基づいて,高精細かつ検証可能な視覚的問合せ対を構築する。
SFTの段階では,ツールトラジェクトリをコールドスタートデータとして収集し,マルチターン推論パターンを導出する。
RLの段階では、冗長性を考慮したポリシー最適化を導入し、自己反射的推論パターンを開発するためのモデルにインセンティブを与える。
論文 参考訳(メタデータ) (2025-12-19T07:44:43Z) - Thinking Before You Speak: A Proactive Test-time Scaling Approach [54.8205006555199]
emphThinking Before You Speak (TBYS)という名前の推論フレームワークとして、私たちのアイデアを実装しています。
インテリジェンス生成のためのコンテキスト内サンプルを自動的に収集・フィルタリングするパイプラインを設計する。
挑戦的な数学的データセットの実験は、TBYSの有効性を検証する。
論文 参考訳(メタデータ) (2025-08-26T03:43:32Z) - VLM-R$^3$: Region Recognition, Reasoning, and Refinement for Enhanced Multimodal Chain-of-Thought [51.43082554363725]
textbfVLM-R$3$ (textbfVisual textbfLanguage textbfModel with textbfRegion textbfRecognition and textbfReasoning) はMLLMに付加的な視覚的証拠が必要な場合にエフェクトを決定する機能を提供するフレームワークである。
MathVista、ScienceQA、その他のベンチマークの実験は、VLM-R$3$が新しいものを設定することを示している
論文 参考訳(メタデータ) (2025-05-22T03:50:13Z) - Mitigating Visual Forgetting via Take-along Visual Conditioning for Multi-modal Long CoT Reasoning [53.790502697674754]
本稿では、画像入力を重要な推論段階に移行する戦略であるTake-Allong Visual Conditioning (TVC)を提案する。
TVCは、推論を通して視覚的なコンポーネントへの注意を維持するのに役立つ。
提案手法は,5つの数学的推論ベンチマークにおいて,最先端の性能を平均で達成する。
論文 参考訳(メタデータ) (2025-03-17T16:45:12Z) - PAINT: Paying Attention to INformed Tokens to Mitigate Hallucination in Large Vision-Language Model [0.0]
幻覚は、しばしば注意重みの進歩的な弱体化から視覚的トークンへと生じる。
textbfPAINT (textbfPaying textbfAttention to textbfINformed textbfTokens) は、大規模視覚言語モデルの自己保持機構を介するプラグイン・アンド・プレイフレームワークである。
論文 参考訳(メタデータ) (2025-01-21T15:22:31Z) - Socratic Questioning: Learn to Self-guide Multimodal Reasoning in the Wild [35.91285472401222]
軽量マルチモーダル大言語モデル(MLLM)に適した革新的学習・推論フレームワークを考案する。
我々の自己組織化アプローチはMLLMを組織的にガイドし、ターゲット問題に関連する視覚的手がかりに集中させ、幻覚を減らし、きめ細かい画像の詳細を記述できるモデルの能力を高める。
各種ベンチマーク実験により,SQの自己探索,ゼロショット視覚推論,幻覚緩和における顕著な能力を示す。
論文 参考訳(メタデータ) (2025-01-06T12:16:56Z) - Interpretable Visual Question Answering via Reasoning Supervision [4.76359068115052]
トランスフォーマーベースのアーキテクチャは、最近Visual Question Answering (VQA)タスクで顕著なパフォーマンスを示している。
本稿では,視覚的質問応答のための新しいアーキテクチャを提案する。
提案手法がモデルの視覚知覚能力を向上し,性能向上につながることを定量的かつ定性的に示す。
論文 参考訳(メタデータ) (2023-09-07T14:12:31Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。