論文の概要: Where Hallucinations Live: A Cross-Architecture Circuit in VQ-Tokenized Vision-Language Models
- arxiv url: http://arxiv.org/abs/2609.29048v1
- Date: Thu, 24 Sep 2026 05:28:12 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-25 21:10:09.736571
- Title: Where Hallucinations Live: A Cross-Architecture Circuit in VQ-Tokenized Vision-Language Models
- Title(参考訳): 幻覚の生き方:VQ-Tokenized Vision-Language Modelにおけるクロスアーキテクチャ回路
- Abstract要約: 統一視覚言語モデル(VLM)はベクトル量子化(VQ)コードブックを通じて画像をトークン化する。
本稿では,それを持たないモデルと区別する3ゲート診断法を提案する。
- 参考スコア(独自算出の注目度): 36.36933261903688
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Unified vision-language models (VLMs) that tokenize images through a vector-quantized (VQ) codebook routinely hallucinate objects on grounded yes/no benchmarks, yet existing decoding-time fixes treat this as generic miscalibration without an architectural account. Using activation patching across twenty-five models spanning eight LLM families, we identify an early-layer ($L_0$) attention routing circuit shared across VQ-tokenized VLMs and propose a three-gate diagnostic that distinguishes the models carrying it from those that do not. The diagnostic isolates ten positive models (five natural unified-VQ VLMs across three LLM families and five induced variants) and rejects the remaining fifteen. A single-variable architectural swap (LLaVA-1.6 CLIP+MLP $\rightarrow$ VQ+Linear) installs the circuit, while a matched-compute MLP control on identical data does not, isolating vector quantization as the source of the pathological signal; the routing pathway that carries it is one that the backbone already provides. Against tuned VCD and DoLA baselines, tuned DoLA wins on binary calibration, but \textbf{only $L_0$ ablation reduces object hallucination in open-ended generation} (CHAIR$_i$ reduces by $31\,\%$ relatively, whereas tuned DoLA and VCD leave it unchanged or worsen it). These results recast object hallucination in unified VQ VLMs as a property of architecture and pretraining, and yield a targeted intervention that mechanism-agnostic decoding cannot replicate.
- Abstract(参考訳): ベクトル量子化(VQ)コードブックを通じて画像をトークン化する統一視覚言語モデル(VLM)は、接地されたye/noベンチマークでオブジェクトを幻覚させるが、既存の復号時間修正は、アーキテクチャ上の説明なしにこれを一般的な誤判定として扱う。
8つのLLMファミリーにまたがる205モデルのアクティベーションパッチを用いて、VQトークン化されたVLM間で共有される初期層(L_0$)のアテンションルーティング回路を特定し、それを持たないモデルと区別する3ゲート診断を提案する。
この診断は10の陽性モデル(5つのLLMファミリーと5つの誘導された変異体からなる5つの自然統合VQ VLM)を単離し、残りの15を拒絶する。
単一変数のアーキテクチャスワップ (LLaVA-1.6 CLIP+MLP $\rightarrow$ VQ+Linear) が回路をインストールする一方、同一データに対するマッチング計算型MLP制御は、病的信号のソースとしてベクトル量子化を分離する。
調整された VCD と DoLA のベースラインに対して、調整された DoLA はバイナリキャリブレーションで勝利するが、 \textbf{only $L_0$ ablation はオープンエンドジェネレーションにおけるオブジェクト幻覚を減少させる(CHAIR$_i$ は311\,\%$ と相対的に減少するが、調整された DoLA と VCD はそれを変更せず、あるいは悪化させる)。
これらの結果は、統一VQ VLMにおけるオブジェクト幻覚をアーキテクチャと事前学習の特性として再放送し、機構に依存しない復号化が複製できないという目標の介入をもたらす。
関連論文リスト
- UniProbe: A Learnable Token-Level Hallucination Detector for Large VLMs using Multi-Structural Internal Representations [61.85916280854257]
LVLM(Large Vision-Language Models)は印象的な視覚的推論と対話機能を実現するが、視覚入力によるコンテンツサポートを幻覚させることが多い。
textbfUniProbeは軽量で統一された学習可能な検出器で、凍ったLVLMの不均一な計算トレースを1つの前方パスからモデル化する。
論文 参考訳(メタデータ) (2026-08-11T12:01:59Z) - UniGen-AR: Unifying Visual Generation with Auto-Regressive Modeling [57.126059929740926]
統一視覚生成 (Unified Visual Generation, UVG) について検討した。
汎用多目的言語モデル(MLLM)と効率的な視覚自動回帰デコーダを組み合わせたフレームワークUniGen-ARを提案する。
MLLMは、自由形式の命令と制御信号を統一シーケンスに符号化し、VARデコーダを誘導して、4つのファミリーにまたがる15以上のタスクに対して画像評価出力を生成する。
論文 参考訳(メタデータ) (2026-07-27T08:35:09Z) - Steering Vision-Language Models with Joint Sparse Autoencoders [2.367986397868328]
連成スパースオートエンコーダ(JSAE)を導入し、シーケンスプールされた視覚と言語アクティベーションを、共用、解釈可能な画像/カプセルレベルの特徴に分解する。
JSAEを視覚言語モデル(VLM)に適用すると、制御可能なクロスモーダルステアリングの方向として使うのが難しい表現が得られる。
論文 参考訳(メタデータ) (2026-06-24T10:11:04Z) - Hydra: Unifying Document Retrieval and Generation in a Single Vision-Language Model [0.0]
Hydraは、シングルビジョン言語モデル(VLM)からColBERTスタイルの遅延相互作用検索と自己回帰生成の両方を提供するデュアルヘッドアプローチである。
単一のLoRAアダプタは、検索用にのみ訓練され、推論時にトグルされる。
ViDoRe V1では、Hydra (4B) は単一のトレーニングランで制御された単一ヘッドベースラインの1パーセント以内である。
論文 参考訳(メタデータ) (2026-03-30T15:17:41Z) - Cost-Efficient Multimodal LLM Inference via Cross-Tier GPU Heterogeneity [0.0]
MLLM(Multimodal large language model)推論は、ハードウェア要求に反する2つのフェーズに分けられる。
標準変圧器KVキャッシングの下では、モダリティ境界はデバイス間転送を最小化する。
We build HeteroServe, a phase-aware runtime with modality-level partitioning and cross-tier scheduling。
論文 参考訳(メタデータ) (2026-03-13T06:42:35Z) - QLIP: A Dynamic Quadtree Vision Prior Enhances MLLM Performance Without Retraining [28.2730962800806]
既存のMLLMとシームレスに統合可能なCLIPビジョンエンコーダのドロップイン置換を提案する。
QLIPは、様々なモデルサイズにわたるLLaVA v1.5モデルの一般的な視覚的質問応答精度を改善する。
特にQLIPは、挑戦的な$Vast$ベンチマークの詳細な理解パフォーマンスを最大13.6%向上させる。
論文 参考訳(メタデータ) (2025-05-29T02:26:34Z) - Fast-dLLM: Training-free Acceleration of Diffusion LLM by Enabling KV Cache and Parallel Decoding [51.711605076319216]
拡散に基づく大規模言語モデル (Diffusion LLM) は、並列復号機能を持つ非自己回帰テキスト生成を約束している。
本稿では,双方向拡散モデルに適したブロック単位で近似したKVキャッシュ機構を提案する。
本稿では,信頼しきい値を超えるトークンを選択的に復号し,依存関係違反を軽減し,生成品質を維持できる信頼度対応並列復号方式を提案する。
論文 参考訳(メタデータ) (2025-05-28T17:39:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。