論文の概要: Token Preference Optimization with Self-Calibrated Visual-Anchored Rewards for Hallucination Mitigation
- arxiv url: http://arxiv.org/abs/2412.14487v2
- Date: Thu, 02 Jan 2025 07:39:20 GMT
- ステータス: 翻訳完了
- システム内更新日: 2025-01-03 16:56:19.427538
- Title: Token Preference Optimization with Self-Calibrated Visual-Anchored Rewards for Hallucination Mitigation
- Title(参考訳): 幻覚軽減のための自己校正型ビジュアルアンカレッドリワードを用いたトークン選好最適化
- Abstract要約: 自己校正型報酬(TPO)を用いた新しいToken Preference Optimizationモデルを提案する。
具体的には,生画像に条件付された生成トークンのロジスティック分布と劣化したトークンの対数分布の差として,トークンレベルのアンカレート・アンカレート・アンフレワードを導入する。
より正確なトークンレベルの最適化を実現するために,視覚認識型学習目標を提案する。
- 参考スコア(独自算出の注目度): 29.667702981248205
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Direct Preference Optimization (DPO) has been demonstrated to be highly effective in mitigating hallucinations in Large Vision Language Models (LVLMs) by aligning their outputs more closely with human preferences. Despite the recent progress, existing methods suffer from two drawbacks: 1) Lack of scalable token-level rewards; and 2) Neglect of visual-anchored tokens. To this end, we propose a novel Token Preference Optimization model with self-calibrated rewards (dubbed as TPO), which adaptively attends to visual-correlated tokens without fine-grained annotations. Specifically, we introduce a token-level \emph{visual-anchored} \emph{reward} as the difference of the logistic distributions of generated tokens conditioned on the raw image and the corrupted one. In addition, to highlight the informative visual-anchored tokens, a visual-aware training objective is proposed to enhance more accurate token-level optimization. Extensive experimental results have manifested the state-of-the-art performance of the proposed TPO. For example, by building on top of LLAVA-1.5-7B, our TPO boosts the performance absolute improvement for hallucination benchmarks.
- Abstract(参考訳): 直接選好最適化(DPO)は、人間の嗜好とより密接に一致させることにより、LVLM(Large Vision Language Models)における幻覚の緩和に非常に効果的であることが示されている。
最近の進歩にもかかわらず、既存の手法には2つの欠点がある。
1)スケーラブルなトークンレベルの報酬の欠如,及び
2)ビジュアルアンコールトークンの無視
そこで本稿では,自己校正型報酬(TPO)を付加した新しいトークン選好最適化モデルを提案する。
具体的には, 生画像上で条件付けられた生成トークンのロジスティック分布と劣化トークンとの差として, トークンレベル \emph{visual-anchored} \emph{reward} を導入する。
さらに,より正確なトークンレベルの最適化を実現するために,視覚認識型学習目標を提案する。
実験結果から,提案したTPOの最先端性能が明らかとなった。
例えば、LLAVA-1.5-7Bの上に構築することで、私たちのTPOは幻覚ベンチマークのパフォーマンス絶対改善を促進します。
関連論文リスト
- Not All Attention Heads Contribute to Critical Visual Token Selection: Head-Aware Pruning Matters More [10.64705408079015]
VLM(Vision-Language Models)は、さまざまな視覚シナリオにまたがって素晴らしいパフォーマンスを示している。
VLM推論効率を改善するために、典型的な視覚トークンプルーニング手法はトークンの重要性を推定する。
トレーニング不要なプログレッシブ・プログレッシブ・トークン・プルーニング・フレームワークであるProViPを提案する。
論文 参考訳(メタデータ) (2026-08-26T03:27:14Z) - Calibrate Before Reason: Robust Visual Token Reduction against Semantic Drift in VLMs [26.936352183867854]
CaReは,1)多方向摂動下で安定なモデル側の影響を持つアンカーを識別する摂動ロバストアンカリング,2)未選択トークンから信頼性の高い校正信号を抽出しアンカーに注入する信頼性ゲートトケンの2つの相互補完モジュールから構成される。
視覚トークンの94.4%をプルーニングする一方で、本手法は元のフルトーケン性能の96.4%を保持し、未使用バニラモデルと比較して最大2.30倍高速なエンドツーエンド推論速度を実現する。
論文 参考訳(メタデータ) (2026-07-30T05:36:29Z) - Visual Token Compression Enhances Robustness of MLLMs [54.28558472087342]
視覚的トークンプルーニングがマルチモーダル大言語モデル(MLLM)のロバスト性を高めることを初めて示す。
我々は,ロバスト・プルーニング層におけるOOD視覚トークンを削減し,ジェイルブレイクや幻覚に対するモデルロバスト性を高めることを目指している。
本手法は,ジェイルブレイク攻撃の防御において平均13.29%の改善を達成し,幻覚の緩和において一貫して競争力を発揮し,MMEなどの一般データセット上での強い結果を維持する。
論文 参考訳(メタデータ) (2026-07-21T15:52:30Z) - P$^2$-DPO: Grounding Hallucination in Perceptual Processing via Calibration Direct Preference Optimization [55.74731799669337]
幻覚は近年、LVLM(Large Vision-Language Models)において大きな研究の注目を集めている。
直接選好最適化(DPO)は、人間が提供した修正選好から直接学習することを目的としている。
既存の選好ペアは視覚に依存しないことが多く、その本質的に非政治的な性質は、モデル学習を導く上での有効性を制限している。
本稿では、モデルが独自の選好ペアから生成し学習する新しい訓練パラダイムである知覚処理直接選好最適化(P$2$-DPO)を提案する。
論文 参考訳(メタデータ) (2026-06-02T09:22:53Z) - Seeing Through the Chain: Mitigate Hallucination in Multimodal Reasoning Models via CoT Compression and Contrastive Preference Optimization [78.94590726578014]
マルチモーダル推論モデル (Multimodal reasoning model, MLRM) は幻覚の傾向が強く, 効果的な解はいまだ未発見のままである。
textbfCompression と textbfPreference textbfOptimization を組み合わせたトレーニングベースの緩和フレームワーク C3PO を提案する。
論文 参考訳(メタデータ) (2026-02-03T11:00:55Z) - CAPA: Contribution-Aware Pruning and FFN Approximation for Efficient Large Vision-Language Models [14.30682201364961]
本研究では,注目度をベクトルサイズで重み付けした注意貢献が,視覚的トークン選択のためのより正確な基準を提供することを示す。
本稿では、重要な機能遷移における注意貢献を用いて視覚トークンを創出する二重戦略フレームワークであるCAPA(Contribution-Aware Pruning and FFN Approximation)を紹介する。
論文 参考訳(メタデータ) (2026-01-30T19:09:03Z) - ZSPAPrune: Zero-Shot Prompt-Aware Token Pruning for Vision-Language Models [7.7352936204066]
本稿では,タスク関連性と情報多様性のバランスとして,視覚トークンプルーニングをモデル化する新しいゼロショット手法を提案する。
本手法は,精度の低下を最小限に抑えて,最先端技術に適合または超越した性能を実現する。
これらのゲインには、GPUメモリフットプリントの大幅な削減と推論レイテンシが伴っている。
論文 参考訳(メタデータ) (2025-10-20T06:18:47Z) - Don't Just Chase "Highlighted Tokens" in MLLMs: Revisiting Visual Holistic Context Retention [50.97683288777336]
MLLM(Multimodal Large Language Models)は、巨大な視覚トークンに依存するため、計算オーバーヘッドがかなり大きい。
近年の研究では、この問題を緩和するためにトークンプルーニングが検討されている。
本稿では,効率的な推論のためのビジュアルトークン・プルーニング・フレームワークであるHoloVを提案する。
論文 参考訳(メタデータ) (2025-10-03T11:33:40Z) - PoRe: Position-Reweighted Visual Token Pruning for Vision Language Models [12.189644988996022]
本稿では,視覚的トークンプルーニングにおける遅延バイアスを軽減するための,極めて単純かつ効果的なアプローチを提案する。
画像内の空間的位置に応じて視覚的トークンの注意点を調節する簡単なリウェイト機構を提案する。
提案手法は,既存のビジュアルトークンプルーニングフレームワークにシームレスに組み込むことができるプラグイン・アンド・プレイソリューションである。
論文 参考訳(メタデータ) (2025-08-25T08:56:32Z) - A Glimpse to Compress: Dynamic Visual Token Pruning for Large Vision-Language Models [94.49953824684853]
人間の認知に触発された動的刈り取りフレームワークGlimpsePruneを導入する。
データ駆動の 'glimpse' を受け取り、応答生成の前に単一のフォワードパスで無関係な視覚トークンをプルーンする。
強化されたGlimpsePrune+は、同様に高いプルーニング率を維持しながら、ベースライン性能の110%を達成する。
論文 参考訳(メタデータ) (2025-08-03T02:15:43Z) - Rethinking Visual Token Reduction in LVLMs under Cross-modal Misalignment [38.04426918886084]
視覚言語モデル(LVLM)は、視覚入力をパッチレベルのトークンの密度の高いシーケンスとしてエンコードし、微細なセマンティクスをキャプチャする。
これまでは、大型言語モデル(LLM)の前か中のいずれかで、視覚トークンの削減を検討してきた。
トレーニングフリーで視覚のみのプルーニングフレームワークであるVisionDropを導入し、モーダル内(視覚から視覚への)注目に基づいて情報的視覚トークンを選択する。
論文 参考訳(メタデータ) (2025-06-27T14:55:40Z) - IGD: Token Decisiveness Modeling via Information Gain in LLMs for Personalized Recommendation [70.2753541780788]
我々は,トークン決定性をチューニングと復号の両方に統合する情報ゲインに基づく決定性対応トークンハンドリング(IGD)戦略を導入する。
IGDはリコメンデーションの精度を一貫して改善し、強力なベースラインに比べて広く使われているランキングの指標で顕著に向上した。
論文 参考訳(メタデータ) (2025-06-16T08:28:19Z) - End-to-End Vision Tokenizer Tuning [73.3065542220568]
低レベルの再構築のために最適化された視覚トークンーは、様々な表現と意味論を必要とする下流タスクである。
視覚トークン化の損失は、ターゲットタスクの表現ボトルネックになる可能性がある。
本研究では,視覚トークン化と目標自己回帰タスクを協調的に最適化するエンド・ツー・エンドの視覚トークン化チューニング手法であるETTを提案する。
論文 参考訳(メタデータ) (2025-05-15T17:59:39Z) - TopV: Compatible Token Pruning with Inference Time Optimization for Fast and Low-Memory Multimodal Vision Language Model [56.43860351559185]
高速かつ低メモリの textbfVLM に対する推論時間最適化を備えた textbfToken textbfPruning の互換性である textbfTopV を導入する。
我々のフレームワークは、各ソースの視覚的トークンの重要性を測定するために、視覚的なコスト関数を組み込んでおり、低重要トークンの効果的なプルーニングを可能にしている。
論文 参考訳(メタデータ) (2025-03-24T01:47:26Z) - "Principal Components" Enable A New Language of Images [79.45806370905775]
証明可能なPCAのような構造を潜在トークン空間に組み込む新しい視覚トークン化フレームワークを導入する。
提案手法は、最先端の再構築性能を実現し、人間の視覚システムとの整合性を向上する。
論文 参考訳(メタデータ) (2025-03-11T17:59:41Z) - AlignDistil: Token-Level Language Model Alignment as Adaptive Policy Distillation [46.72611855060883]
トークンレベルの報酬最適化のためのRLHF等価蒸留法を提案する。
実験の結果、既存の方法よりもAlignDistilの方が優れていることが示された。
論文 参考訳(メタデータ) (2025-03-04T17:57:09Z) - Critical Tokens Matter: Token-Level Contrastive Estimation Enhances LLM's Reasoning Capability [55.29624228206882]
大規模言語モデル(LLM)は推論タスクにおいて顕著なパフォーマンスを示した。
LLMは、クリティカルトークンの代わりに他のトークンをデコードせざるを得ない場合、肯定的な結果をもたらす傾向がある。
クリティカルトークンに対するトークンレベルの報酬を自動的に認識し,実行するための,新しいアプローチであるcDPOを提案する。
論文 参考訳(メタデータ) (2024-11-29T18:58:22Z) - Systematic Reward Gap Optimization for Mitigating VLM Hallucinations [34.71750379630014]
本稿では,報酬ギャップ構成の体系的最適化を目的とした新しいフレームワークであるトピックレベルの参照書き換え(TPR)を紹介する。
TPRは、詳細なセマンティック詳細をトピックレベルに制御し、高度なデータキュレーション戦略を可能にする。
ObjectHal-Benchでは幻覚を最大93%減少させ、堅牢で費用対効果の高いVLMアライメントに対して優れたデータ効率を示す。
論文 参考訳(メタデータ) (2024-11-26T09:42:07Z) - Inference Optimal VLMs Need Fewer Visual Tokens and More Parameters [54.01228554126122]
視覚言語モデル(VLM)は、様々な視覚的理解と推論タスクにまたがる強力な能力を示している。
推論コストを削減するために、LLM(Large Language Models)を縮小するか、イメージを表すのに必要な入力トークンの数を削減できる。
高速圧縮に適したトークン圧縮アルゴリズムを設計する第一歩を踏み出す。
論文 参考訳(メタデータ) (2024-11-05T18:54:21Z) - Fine-Grained Verifiers: Preference Modeling as Next-token Prediction in Vision-Language Alignment [57.0121616203175]
本研究では,視覚言語アライメントを改善するための細粒度検証器として,モデル自身のビジュアルエンコーダを利用する新たな自己アライメント手法であるFiSAOを提案する。
ビジョンエンコーダからのトークンレベルのフィードバックを活用することで、FiSAOは視覚言語アライメントを大幅に改善する。
論文 参考訳(メタデータ) (2024-10-18T03:34:32Z) - Calibrated Self-Rewarding Vision Language Models [27.686545023186852]
LVLM(Large Vision-Language Models)は、訓練済みの大規模言語モデル(LLM)と視覚モデルを統合することで、指導チューニングを通じて大幅に進歩した。
LVLMは、しばしば幻覚現象を示し、生成されたテキスト応答は言語的に妥当に見えるが、入力画像に矛盾する。
本稿では,候補応答を反復的に生成し,各応答に対する報酬を評価し,微調整のための選好データをキュレートすることで,モデルの自己改善を可能にするCalibrated Self-Rewarding(CSR)アプローチを提案する。
論文 参考訳(メタデータ) (2024-05-23T14:30:33Z) - Aligning Modalities in Vision Large Language Models via Preference
Fine-tuning [67.62925151837675]
本研究では,幻覚の問題をアライメント問題とみなし,好みのチューニングで対処する。
具体的には,AIモデルを用いたフィードバックデータを生成するPOVIDを提案する。
提案手法は,好ましくないデータを生成するための2段階のアプローチである。
広範ベンチマークを用いた実験では、幻覚を減らすだけでなく、標準ベンチマークでのモデル性能を向上させることができ、従来の手法よりも優れていた。
論文 参考訳(メタデータ) (2024-02-18T00:56:16Z) - Adaptive Sparse ViT: Towards Learnable Adaptive Token Pruning by Fully
Exploiting Self-Attention [36.90363317158731]
最小限のコストで適応的なスパーストークンプルーニングフレームワークを提案する。
提案手法では,DeiT-Sのスループットを50%向上し,トップ1の精度は0.2%低下した。
論文 参考訳(メタデータ) (2022-09-28T03:07:32Z) - Prompt-based Learning for Unpaired Image Captioning [86.44188293709307]
Unpaired Image Captioning (UIC) は、非整合視覚言語サンプルペアから画像記述を学習するために開発された。
近年のVision-Language Pre-Trained Models (VL-PTMs) の成功は、プロンプトベース学習の発展を引き起こしている。
本稿では,UICモデルをトレーニングするためのプロンプトに基づく新しいスキームを提案し,その強力な一般化能力を最大限に活用する。
論文 参考訳(メタデータ) (2022-05-26T03:13:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。