論文の概要: Beyond Saying Less: Fine-Grained Alignment for Informative and Faithful Vision-Language Models
- arxiv url: http://arxiv.org/abs/2609.35294v1
- Date: Mon, 28 Sep 2026 14:37:33 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-02 06:45:16.817438
- Title: Beyond Saying Less: Fine-Grained Alignment for Informative and Faithful Vision-Language Models
- Title(参考訳): 少ない言い方を超えて:インフォーマティブで忠実なビジョンランゲージモデルのためのファイングラインドアライメント
- Abstract要約: 物体幻覚は、大きな視覚言語モデルにとって依然として大きな課題である。
本稿では,データレベルでの高密度報酬信号と,アルゴリズムレベルでの正確な信用割当を結合する微粒化アライメントフレームワークを提案する。
本手法は, 識別評価において, 顕著な性能向上を図りながら, 生成タスクにおける高情報かつ忠実な記述を生成する。
- 参考スコア(独自算出の注目度): 71.46915245859357
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Object hallucination remains a major challenge for large vision-language models. While off-policy preference optimization proves to be an effective solution, on-policy reinforcement learning provides a more promising direction as it directly targets a model's current failure modes. However, we find that without fine-grained reward formulation and allocation, on-policy optimization often falls into an easy shortcut: reducing hallucinations merely by saying less---making fewer valid claims. To comprehensively resolve this, we propose a fine-grained alignment framework that couples dense reward signals at the data level with precise credit assignment at the algorithmic level. Specifically, we first construct the Dense Object Presence and Absence (DOPA) dataset to address sparse annotations that prevent valid object claims from being verified and rewarded. DOPA exhaustively annotates the deterministic presence and absence of every concept across an expanded vocabulary, significantly increasing the density of reliable reward signals during on-policy rollouts. Second, we propose Subsentence-level Credit Assignment for on-Policy Optimization (SCAPO) to prevent response-level shared advantages from allowing local hallucinations to compromise all other valid outputs within the same response. By assigning credit to each subsentence independently based on its object claims, SCAPO can precisely reinforce faithful generations and penalize hallucinations. Furthermore, we leverage the resulting faithful image descriptions as auxiliary context to transfer generative gains to discriminative tasks. Experiments demonstrate that our method produces highly informative, faithful descriptions in generative tasks while yielding clear performance gains on discriminative evaluation.
- Abstract(参考訳): 物体幻覚は、大きな視覚言語モデルにとって依然として大きな課題である。
オフ・ポリティクスの選好最適化は効果的な解決法であることが証明されているが、オン・ポリティクスの強化学習は、モデルの現在の障害モードを直接ターゲットとして、より有望な方向を提供する。
しかし、細かな報酬の定式化や割り当てがなければ、オン・ポリティクスの最適化は簡単なショートカットに陥りがちである。
これを包括的に解決するために,データレベルでの高密度報酬信号と,アルゴリズムレベルでの正確なクレジット割り当てを結合する微粒化アライメントフレームワークを提案する。
具体的には、まずDense Object Presence and Absence(DOPA)データセットを構築し、有効なオブジェクトクレームの検証と報奨を防止するスパースアノテーションに対処する。
DOPAは、拡張された語彙にまたがるすべての概念の決定論的存在と欠如を徹底的に注釈し、オン・ポリケーション・ロールアウト中の信頼性の高い報酬信号の密度を著しく高めている。
第2に、応答レベル共有の利点を生かし、局所幻覚が全ての有効な出力を同じ応答内で損なうことを防止するために、SCAPO(Subsentence-level Credit Assignment for On-Policy Optimization)を提案する。
オブジェクトのクレームに基づいて各サブセントにクレジットを割り当てることによって、SCAPOは忠実な世代を正確に強化し、幻覚を罰することができる。
さらに、得られた忠実な画像記述を補助的文脈として利用して、生成ゲインを識別タスクに転送する。
提案手法は, 識別評価において, 顕著な性能向上を図りながら, 生成タスクにおいて, 高い情報的かつ忠実な記述を生成できることを実証した。
関連論文リスト
- BALTO: Balanced Token-Level Policy Optimization for Hallucination Mitigation [51.22170603236523]
幻覚緩和のためのバランスドトークンレベルの政策最適化フレームワークを提案する。
BalTOはチェック可能な事実クレームを抽出し、参照コンテキストに対して検証し、トークンレベルのラベルに対するクレームレベルの判断をプロジェクトする。
ConFiQA、RAGTruth、FinLLM-Evalの実験では、BALTOは6つのモデルで最高の忠実さを達成している。
論文 参考訳(メタデータ) (2026-06-14T16:25:59Z) - TRACE: A Unified Rollout Budget Allocation Framework for Efficient Agentic Reinforcement Learning [52.67756371231985]
検証可能な報酬を伴う強化学習(RLVR)は、大規模言語モデルにおける推論とエージェント的行動を強化するための有望なアプローチである。
本稿では,Tree Rollout Allocation for Contrastive Exploration (TRACE)について紹介する。
技術的には、TRACEはロールアウト予算をルートと中間プレフィックスの両方に割り当てている。
論文 参考訳(メタデータ) (2026-06-09T17:16:03Z) - SAEExplainer: Interpreting SAE Features with Activation-Guided Preference Optimization [27.75787562103551]
SAEExplainerは,活性化スコアを客観的報酬信号として活用し,自己補正と反復ブートストラップのためのモデルトレーニングを行うためのトレーニングフレームワークである。
2ラウンドの最適化プロセスを通じて基礎的な説明を反復的に検証し、修正することにより、SAEExplainerはその説明能力を継続的に改善する。
論文 参考訳(メタデータ) (2026-06-07T07:54:25Z) - REINFORCE Adversarial Attacks on Large Language Models: An Adaptive, Distributional, and Semantic Objective [57.57786477441956]
応答の個体群に対する適応的・意味的最適化問題を提案する。
我々の目標は、Llama3の攻撃成功率(ASR)を2倍にし、サーキットブレーカー防御でASRを2%から50%に向上させることである。
論文 参考訳(メタデータ) (2025-02-24T15:34:48Z) - Systematic Reward Gap Optimization for Mitigating VLM Hallucinations [34.71750379630014]
本稿では,報酬ギャップ構成の体系的最適化を目的とした新しいフレームワークであるトピックレベルの参照書き換え(TPR)を紹介する。
TPRは、詳細なセマンティック詳細をトピックレベルに制御し、高度なデータキュレーション戦略を可能にする。
ObjectHal-Benchでは幻覚を最大93%減少させ、堅牢で費用対効果の高いVLMアライメントに対して優れたデータ効率を示す。
論文 参考訳(メタデータ) (2024-11-26T09:42:07Z) - In-context Demonstration Matters: On Prompt Optimization for Pseudo-Supervision Refinement [71.60563181678323]
大規模言語モデル(LLM)は様々なタスクで大きな成功を収めており、生成品質をさらに向上させるためには微調整が必要である場合もある。
これらの課題に対処する直接的な解決策は、教師なしの下流タスクから高信頼のデータを生成することである。
本稿では,プロンプトと全体的な擬似スーパービジョンを両立させる新しい手法,擬似教師付きデモアライメント・アライメント・アライメント・プロンプト・最適化(PAPO)アルゴリズムを提案する。
論文 参考訳(メタデータ) (2024-10-04T03:39:28Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。