論文の概要: HKVLM: Faithful Reasoning Grounding by Binding Language Queries to a Frozen Detector
- arxiv url: http://arxiv.org/abs/2606.28862v1
- Date: Sat, 27 Jun 2026 11:10:33 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-30 18:07:15.71909
- Title: HKVLM: Faithful Reasoning Grounding by Binding Language Queries to a Frozen Detector
- Title(参考訳): HKVLM:凍結検知器への言語クエリの結合による忠実な推論グラウンド
- Abstract要約: 言語パスからローカライゼーションを取り除くHKVLMを提案する。
我々は、結合誤差(SayErr)から局所化誤差(SeeErr)を分離するEmphsay-vs-see分解を定式化する。
凍結したグラウンドDINOとQwen2.5-VLでは、トレーニングはトレーニングされていないクロススペースマッチングに対して50ドル~90ドルという精度でグラウンドリフトされる。
- 参考スコア(独自算出の注目度): 1.4061915592167218
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Many visual requests -- ``the object to open this bottle'', ``the person not wearing a helmet'' -- require reasoning, not just category matching. Pure open-vocabulary detectors need an explicit phrase; vision-language models (VLMs) can reason yet ``see but mis-speak'', attending to the right region but returning the wrong box or label. We argue this is a \emph{binding} failure: in coordinate-as-text VLMs localization passes through the autoregressive head, coupling it to language generation; in two-stage pipelines the model's intent is squeezed through a single class string. We present HKVLM, which removes localization from the language path. A frozen, language-aligned detector emits class-agnostic region proposals; a frozen language model encodes reasoning instructions as referential query embeddings; a lightweight \emph{alignment hook} binds queries to regions by contrastive retrieval and bipartite assignment in a shared embedding space. A perception-grounded faithfulness veto forbids naming an object that no region supports. Only the hook is trained, targeting small-data cold-start settings where monolithic VLM tuning struggles. We formalize a \emph{say-vs-see} decomposition separating localization error (SeeErr) from binding error (SayErr), and evaluate on RefCOCO/RefCOCO+/RefCOCOg and POPE. With frozen Grounding DINO and Qwen2.5-VL, training only the hook lifts grounding accuracy by $50$--$90\times$ over untrained cross-space matching; the faithfulness veto raises POPE accuracy from near-chance ($0.50$) to $0.66$--$0.76$ and reduces hallucination from ${\sim}0.99$ to $0.23$--$0.43$, with gains from $200$ expressions. Increasing proposals from $M{=}50$ to $M{=}300$ improves grounding by $19$--$24\%$ without retraining, confirming that residual error is perceptual (SeeErr) rather than binding (SayErr).
- Abstract(参考訳): 多くの視覚的リクエスト -- `` このボトルを開くオブジェクト', ` ``ヘルメットを着用していない人' -- は、単なるカテゴリマッチングではなく、推論を必要とする。
視覚言語モデル (VLM) は 'see but mis-speak'' を推論し、適切な領域に出席するが、間違ったボックスやラベルを返す。
コーディネート・アズ・テキストのVLMでは、ローカライゼーションが自動回帰ヘッドを通過し、それを言語生成に結合します。
言語パスからローカライゼーションを取り除くHKVLMを提案する。
フリーズされた言語対応検出器は、クラスに依存しない領域の提案を出力し、フリーズされた言語モデルは、推論命令を参照クエリの埋め込みとしてエンコードし、ライトウェイトな \emph{alignment hook} は、共有埋め込み空間におけるコントラスト検索と二部配置によってクエリを領域にバインドする。
認識に基づく忠実な拒否は、リージョンがサポートしていないオブジェクトを命名することを禁ずる。
フックのみをトレーニングし、モノリシックなVLMチューニングが苦労する小さなデータコールドスタート設定をターゲットとする。
本研究では,局所化誤差(SeeErr)と結合誤差(SayErr)を分離した<emph{say-vs-see}分解を定式化し,RefCOCO/RefCOCO+/RefCOCOgおよびPOPEで評価する。
凍結したDINOとQwen2.5-VLでは、トレーニングはトレーニングされていないクロススペースマッチングよりも50$--90\times$で、忠実度はPOPEの精度を0.50$から0.66$--0.76$に上げ、幻覚を${\sim}0.99$から$0.23$--0.43$に下げる。
M{=}50$から$M{=}300$へのプロポーザルの増加は、再トレーニングなしで19$--$24\%$のグラウンディングを改善し、残りのエラーがバインディング(SayErr)ではなく知覚的(SeeErr)であることを確認する。
関連論文リスト
- Teaching MLLMs to Say No: Generalized Referring Expression Comprehension via Refusal Calibrated GRPO [8.477600107706547]
Generalized Referring Expression (GREC) は、テキスト式(正のサンプル)が存在するときに記述されたオブジェクトをローカライズし、(負のサンプル)存在しないときに出力を拒否するモデルを必要とする。
教師付き微調整(SFT)や強化学習(RL)のような既存の訓練後のアプローチは、拒絶行動を高めるが、通常正のサンプル上での局所化精度を低下させ、モデルのコアコンピテンスを損なう。
本稿では,ローカライゼーション性能を維持しながらMLLMのリファリング能力を向上するRL戦略であるRefusal-Calibrated Group Relative Policy Optimization (RC-GRPO)を提案する。
論文 参考訳(メタデータ) (2026-08-05T11:07:22Z) - TrustVLA: Mechanism-Guided Inference-Time Defense Against Vision-Language-Action Backdoors [54.12833308568015]
VLA(Vision-Language-Action)モデルは、エンドユーザが監査できないパイプラインを通じてデプロイされる。
小さな視覚トリガーは、障害が観測可能である前に、長い水平ロボットポリシーをリダイレクトする。
個別に提案した2つのVLA攻撃を通してこのギャップについて検討した。
論文 参考訳(メタデータ) (2026-07-14T09:43:52Z) - See Only When Needed: Context-Aware Attention Intervention for Mitigating Hallucinations in LVLMs [81.71384150441163]
大規模視覚言語モデル(LVLM)のためのコンテキスト認識注意介入(CAI)を提案する。
CAIは必要なときのみ2軸選択によってシーズを強制する。
複数のLVLMバックボーンとベンチマークの実験は、CAIが最先端の幻覚緩和を達成することを示している。
論文 参考訳(メタデータ) (2026-06-29T06:35:47Z) - Space-Efficient Language Generation in the Limit [34.38365460078856]
本稿では,空間効率の最小限の制約の下で,テキスト生成の資源認識理論を提案する。
私たちは$mathcalC_s,k$という,DFAが認識する言語のコレクションに注目しています。
より厳格なメモリ予算の下では、最強の世代保証を特徴付ける。
論文 参考訳(メタデータ) (2026-06-24T12:55:34Z) - Rethinking Embodied Navigation via Relational Inductive Bias [53.72276435022479]
本稿では,DB-Navを提案する。
標的中心の関係を活性化バイアスと抑制バイアスに分類する。
成功率(SR)と成功率(SPL)はパス長さ(SPL)が重み付けされているため、既存の方法よりも著しく優れています。
論文 参考訳(メタデータ) (2026-06-09T02:57:34Z) - Benchmarking Speech-to-Speech Translation Models [55.00303727199927]
音声音声翻訳(S2ST)は急速に進歩しているが、オフライン評価には統一されたプロトコルが欠けている。
8次元にわたる46のメトリクスを統合するベンチマークフレームワークを導入する。
FLEURSとCVSSから1,248のモデル言語構成でデプロイする。
論文 参考訳(メタデータ) (2026-06-02T07:01:33Z) - Trust but Verify: Prover-Verifier Deliberation for Selective LLM Prediction [4.273094752480624]
本稿では,対話的証明理論に基づく推論時間プロトコルであるPVDを導入する。
PVDは回答と構造化された信頼判定の両方を生成し、システムは不確実なケースを棄却しながら高信頼の回答を報告できる。
論文 参考訳(メタデータ) (2026-05-24T15:23:27Z) - Subtle Injection for Ground-truth Inference of LLM Training Data [0.2538209532048867]
SIGILは、認識不能なEmphcanary Sequenceを保護されたテキストとコードに埋め込むフレームワークである。
SIGILは、語彙規則、語彙句、構文、意味、コードパターンの5つのカナリア戦略を定義している。
論文 参考訳(メタデータ) (2026-05-18T14:48:44Z) - Exemplar Partitioning for Mechanistic Interpretability [0.02986128861233961]
大規模言語モデルのアクティベーションから解釈可能な特徴辞書を構築するための教師なし手法を提案する。
EP辞書(EP dictionary)は、リーダークラスタリングされたストリームアクティベーションを距離閾値内で生成した、活性化空間のボロノイ分割である。
例題は学習ではなく観察されるため、同じデータストリームから構築された辞書は、レイヤ、モデル、トレーニングチェックポイント間で直接比較される。
論文 参考訳(メタデータ) (2026-05-14T04:15:30Z) - Future Validity is the Missing Statistic: From Impossibility to $Φ$-Estimation for Grammar-Faithful Speculative Decoding [21.074583041375888]
文法制約付き生成は、しばしば局所的な語彙マスキングと投機的復号化と組み合わせられる。
局所マスクアクセスを持つ投機的デコーダ,レバイアサン拒絶,および局所予測分布$mathrmproj$からのロールバック音質サンプルは,文法条件分布$star$ではなく,いずれかを示す。
論文 参考訳(メタデータ) (2026-05-08T13:08:18Z) - Skill-RAG: Failure-State-Aware Retrieval Augmentation via Hidden-State Probing and Skill Routing [12.09179106162719]
本稿では,隠れ状態のプローバとプロンプトベースのスキルルータを結合した障害対応RAGフレームワークであるSkill-RAGを提案する。
実験により,Skill-RAGは多ターン検索後に持続するハードケースの精度を大幅に向上することが示された。
論文 参考訳(メタデータ) (2026-04-17T07:25:43Z) - RACER: Retrieval-Augmented Contextual Rapid Speculative Decoding [80.12789199134511]
大規模言語モデル(LLM)における自己回帰デコーディングは、ステップ毎に1つのトークンを生成し、高い推論遅延を引き起こす。
我々は,検索した正確なパターンとロジット駆動の将来の手がかりを統合する軽量でトレーニング不要な $textbfRACER を提案する。
Spec-Bench、HumanEval、MGSM-ZHの実験では、RACERは推論を継続的に加速し、自動回帰デコーディングよりも2倍以上のスピードアップを達成した。
論文 参考訳(メタデータ) (2026-04-16T11:23:55Z) - Seeing to Ground: Visual Attention for Hallucination-Resilient MDLLMs [47.94507630961399]
トレーニング不要なデコードフレームワークであるVISAGEを導入し、推論時に目的を校正する。
我々は、VISAGEが推定誤差の下で有界目的損失を維持することを保証する解析的安定性を保証する。
幻覚感受性および汎用ベンチマークによる評価は、フレームワークの堅牢性を示している。
論文 参考訳(メタデータ) (2026-03-26T17:53:49Z) - Neural Uncertainty Principle: A Unified View of Adversarial Fragility and LLM Hallucination [60.197429875410286]
大規模言語モデルにおける視覚と幻覚の対立的脆弱性は、伝統的に別の問題と見なされている。
損失誘起状態下でのニューラル不確実性原理(NUP)の定式化により, ほぼバウンド状態においては, さらなる圧縮は感度分散の増大を伴うことが判明した。
視覚では、高度に結合したコンポーネントをマスキングすることで、コストのかかる敵の訓練なしに堅牢性を向上させる。
言語では、任意の応答トークンを生成する前に、同じプレフィルステージプローブが幻覚リスクを検出する。
論文 参考訳(メタデータ) (2026-03-20T02:07:10Z) - Trust but Verify: Adaptive Conditioning for Reference-Based Diffusion Super-Resolution via Implicit Reference Correlation Modeling [42.10910149675583]
実世界の劣化は、低品質(LQ)入力と参照(Ref)イメージの対応を信頼できないものにする。
本稿では,一段階拡散フレームワークであるAda-RefSRを提案する。
複数のデータセットの実験では、Ada-RefSRは忠実さ、自然性、効率性の強いバランスを達成している。
論文 参考訳(メタデータ) (2026-02-02T09:34:57Z) - Reinforcement Learning with Verifiable yet Noisy Rewards under Imperfect Verifiers [90.50039419576807]
RLVR(Reinforcement Learning with Verifiable Rewards)は、人為的なラベル付けを避けるために、自動検証に対するポリシーを訓練する。
認証ハッキングの脆弱性を軽減するため、多くのRLVRシステムはトレーニング中にバイナリ$0,1$の報酬を破棄する。
この選択にはコストがかかる:textitfalse negatives(正しい回答、FNを拒絶)とtextitfalse positives(間違った回答、FPを受け入れる)を導入する。
論文 参考訳(メタデータ) (2025-10-01T13:56:44Z) - Don't Get Lost in the Trees: Streamlining LLM Reasoning by Overcoming Tree Search Exploration Pitfalls [83.89771461061903]
検証者による木探索アルゴリズムの最近の進歩は、大規模言語モデル(LLM)の推論能力を大幅に向上させた。
検証者による木探索アルゴリズムの最近の進歩は、大規模言語モデル(LLM)の推論能力を大幅に向上させた。
意味論的に等価なコンテンツを持つ冗長な状態による$textitover-Exploration$と、検証器のスコアリングにおける高いばらつきに起因する$textitunder-Exploration$である。
各種木探索アルゴリズムに適合するフレキシブルなプラグアンドプレイシステムであるFETCHを提案する。
論文 参考訳(メタデータ) (2025-02-16T16:12:01Z) - Coarse-to-Fine Proposal Refinement Framework for Audio Temporal Forgery Detection and Localization [60.899082019130766]
本稿では、フレームレベル検出ネットワーク(FDN)と、音声の時間的偽造検出とローカライゼーションのための改良ネットワーク(PRN)を提案する。
FDNは、偽のフレーム間で情報的不整合の手がかりを抽出し、偽の領域を大まかに示すのに有用な識別的特徴を得る。
PRNは、FDNから派生した粗粒度の提案を洗練するために、信頼スコアと回帰オフセットを予測する責任がある。
論文 参考訳(メタデータ) (2024-07-23T15:07:52Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。