論文の概要: ROT: Rotating Hidden States towards Contextual Vectors for Hallucination Mitigation in LVLMs
- arxiv url: http://arxiv.org/abs/2610.06056v1
- Date: Mon, 05 Oct 2026 09:49:09 GMT
- ステータス: 情報取得中
- システム内更新日: 2026-10-06 20:29:07.698181
- Title: ROT: Rotating Hidden States towards Contextual Vectors for Hallucination Mitigation in LVLMs
- Title(参考訳): ROT:LVLMにおける幻覚緩和のためのコンテキストベクトルへの隠れ状態の回転
- Abstract要約: LVLM(Large Vision-Language Models)はしばしば物体幻覚に悩まされる。
既存のトレーニングなしの介入は、主に注意重みを操り、最終予測層に到達する深い意味論に間接的に影響を及ぼす。
本研究では,自己注意および残留付加後に抽出した隠れ状態ベクトルに焦点を移す。
経験的分析により、幻覚されたトークンは単に言語的先入観に過剰に依存するのではなく、異常な文脈偏差を示すことが明らかになった。
そこで我々は,レイヤ固有の,トレーニング不要なフレームワークであるROTを提案する。
- 参考スコア(独自算出の注目度): 5.443812686257769
- License:
- Abstract: Large Vision-Language Models (LVLMs) frequently suffer from object hallucination. Existing training-free interventions primarily manipulate attention weights, which indirectly affect the deep semantics reaching the final predictive layers. In this work, we shift our focus to the hidden state vectors extracted after self-attention and residual addition. Empirical analysis reveals that hallucinated tokens do not simply over-rely on linguistic priors; instead, they exhibit an anomalous contextual deviation, showing significantly lower similarities to both textual and visual contexts in intermediate layers. Motivated by this, we propose ROT, a layer-specific, training-free framework. ROT dynamically detects semantic deviation in the middle layers and applies a norm-preserving rotation to steer the hidden states back toward the local multimodal context plane spanned by the contexts. For subsequent layers, a representational smoothing mechanism is introduced to stabilize the calibrated trajectory. Extensive experiments on multiple benchmarks demonstrate that ROT consistently reduces hallucinations across various model architectures and scales, offering an efficient, geometry-driven solution for grounded generation.
- Abstract(参考訳): LVLM(Large Vision-Language Models)はしばしば物体幻覚に悩まされる。
既存のトレーニングなしの介入は、主に注意重みを操り、最終予測層に到達する深い意味論に間接的に影響を及ぼす。
本研究では,自己注意および残留付加後に抽出した隠れ状態ベクトルに焦点を移す。
経験的分析により、幻覚化したトークンは単に言語的先行性に過剰に依存するのではなく、異常な文脈偏差を示し、中間層におけるテキストと視覚の両方のコンテキストとの類似性が著しく低いことが示された。
そこで我々は,レイヤ固有の,トレーニング不要なフレームワークであるROTを提案する。
ROTは、中間層における意味的偏差を動的に検出し、正規保存ローテーションを適用して、コンテキストに分散したローカルなマルチモーダルコンテキストプレーンに対して隠れた状態を操る。
その後の層では、キャリブレーションされた軌道を安定化させるために、表現的平滑化機構が導入された。
複数のベンチマークに関する大規模な実験により、ROTは様々なモデルアーキテクチャとスケールにわたる幻覚を一貫して低減し、基底生成のための効率的で幾何学駆動のソリューションを提供することが示された。
関連論文リスト
- CofactVLA: Deconfounding Vision-Language-Action Models via Counterfactual Intervention [48.20065816234311]
VLA(Vision-Language-Action)モデルはロボット操作に大きな進歩をもたらしたが、ビジョンオーバーライド現象に苦戦している。
本稿では,新たな因果介入フレームワークCofactVLAを提案する。
我々は、CofactVLAが様々なシミュレーションベンチマークにまたがって新しい最先端のベンチマークを確立していることを示す。
論文 参考訳(メタデータ) (2026-08-05T02:58:41Z) - See Only When Needed: Context-Aware Attention Intervention for Mitigating Hallucinations in LVLMs [81.71384150441163]
大規模視覚言語モデル(LVLM)のためのコンテキスト認識注意介入(CAI)を提案する。
CAIは必要なときのみ2軸選択によってシーズを強制する。
複数のLVLMバックボーンとベンチマークの実験は、CAIが最先端の幻覚緩和を達成することを示している。
論文 参考訳(メタデータ) (2026-06-29T06:35:47Z) - ExACT: Exemplar-Driven Calibrated Refinement for Training-Free Visual Grounding in Remote Sensing Images [51.53960096934913]
リモートセンシングビジュアルグラウンドティング(RSVG)は、自由形式の自然言語記述を用いて、高解像度のRS画像中の特定の物体を特定することを目的としている。
マルチモーダル大言語モデル(MLLM)の最近の進歩は、そのようなオープン語彙RSVGに大きな可能性を示している。
Inemplar-driven Calibrated Refinement (ExACT)を提案する。
論文 参考訳(メタデータ) (2026-06-27T13:50:39Z) - Diagnosing Visual Ignorance in Vision-Language Models [29.2851901986069]
VLM(Vision-Language Models)は、しばしば言語先行に頼り、視覚的証拠に弱く根ざした自信ある答えを生み出す。
本研究では,機械的視点と行動的視点の両方から言語優先性について検討する。
言語優先の信頼性は、モデル内部とベンチマークの妥当性の両方に影響を及ぼす体系的なルーティング障害であることがわかった。
論文 参考訳(メタデータ) (2026-06-05T04:16:01Z) - Rethinking Visual Neglect: Steering via Context-Preference for MLLM Hallucination Mitigation [5.041079621345155]
画像は文脈として、モデルのパラメトリック知識とテキストコンテキストと同時に競合する、と我々は主張する。
本研究では,2つの意味論的に異なるコンテキスト参照ベクトルを抽出する,学習不要なフレームワークであるコンテキスト参照ステアリング(CAS)を提案する。
実験により、CASは遅延遅延を増大させることなくオブジェクト幻覚を実質的に緩和し、ネイティブテキスト生成の品質を保っていることが示された。
論文 参考訳(メタデータ) (2026-05-27T05:33:06Z) - IVR-R1: Refining Trajectories through Iterative Visual-Grounded Reasoning in Reinforcement Learning [15.580070614790776]
強化学習による多モーダルな大言語モデルは、複雑な視覚的推論タスクにおいて顕著な能力を示した。
現在の方法では、下流の推論を容易にするために、高次元の視覚シーンを個別のテキストプロキシにプリエンコードする。
推論軌道を補正して最適化する動的視覚再構成を導入する。
論文 参考訳(メタデータ) (2026-05-18T09:53:08Z) - VCE: A zero-cost hallucination mitigation method of LVLMs via visual contrastive editing [70.82867621856968]
大きな視覚言語モデル(LVLM)は、しばしば物体幻覚(OH)に悩まされる
近年の研究では、幻覚の問題は言語の先行に起因している可能性が示唆されている。
本稿では視覚コントラスト編集(VCE)を提案する。
論文 参考訳(メタデータ) (2026-04-21T12:40:07Z) - Decoding by Perturbation: Mitigating MLLM Hallucinations via Dynamic Textual Perturbation [36.57014987764294]
Decode by Perturbation (DeP)は、事前誘発幻覚を緩和するトレーニング不要のフレームワークである。
動的プローブを用いて、多レベルテキストの摂動を潜在言語に応用する。
大規模な実験により、DePは幻覚を効果的に減らし、複数のベンチマークで優れたパフォーマンスを達成することが確認された。
論文 参考訳(メタデータ) (2026-04-14T08:15:44Z) - Locate-then-Sparsify: Attribution Guided Sparse Strategy for Visual Hallucination Mitigation [68.41785694664011]
機能ステアリングのためのLate-Then-Sparsify(LTS-FS)と呼ばれるプラグアンドプレイフレームワークを提案する。
各層の幻覚関係に応じて操舵強度を制御する。
我々の枠組みは、強い性能を維持しながら幻覚を効果的に緩和する。
論文 参考訳(メタデータ) (2026-03-17T09:16:50Z) - Multimodal LLM-Guided Semantic Correction in Text-to-Image Diffusion [52.315729095824906]
MLLM Semantic-Corrected Ping-Pong-Ahead Diffusion (PPAD) は,マルチモーダル大言語モデル(MLLM)を推論中の意味的オブザーバとして導入する新しいフレームワークである。
中間世代をリアルタイムに分析し、潜在意味的不整合を識別し、フィードバックを制御可能な信号に変換し、残りの認知ステップを積極的に導く。
大規模な実験ではPPADの大幅な改善が示されている。
論文 参考訳(メタデータ) (2025-05-26T14:42:35Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。