論文の概要: Enhancing VLM Reward Models Through Structure-Aware Fine-Tuning
- arxiv url: http://arxiv.org/abs/2608.03875v1
- Date: Tue, 04 Aug 2026 16:15:12 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-05 15:30:23.278895
- Title: Enhancing VLM Reward Models Through Structure-Aware Fine-Tuning
- Title(参考訳): 構造認識ファインチューニングによるVLMリワードモデルの強化
- Authors: Pyrros Koussios, Chenhao Li, Xin Chen, Andreas Krause,
- Abstract要約: 本研究では,不完全な報奨信号をオンラインで改良する簡易な自己監督手法であるStructure-Aware Fine-Tuning(SAFT)を提案する。
以上の結果から,SAFTは報酬環境を常に軽視し,より高速な政策収束とアライメントの大幅な改善を図っている。
- 参考スコア(独自算出の注目度): 40.883363154420614
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Designing effective reward functions remains a major bottleneck in Reinforcement Learning (RL). Recent work uses large foundation Vision-Language Models (VLMs) as reward models, computing text-observation similarity to bypass manual reward engineering. Although promising, these rewards are often noisy and unreliable, limiting their direct utility during deployment. We present Structure-Aware Fine-Tuning (SAFT), a simple, self-supervised method that refines these imperfect reward signals online without access to ground-truth supervision. SAFT leverages intrinsic structural priors to regularize the VLM's latent space via LoRA adapters. We rigorously evaluate SAFT across a spectrum of base model capabilities to demonstrate its versatility. Our results show that SAFT consistently denoises the reward landscape, yielding faster policy convergence and substantially improved alignment (EPIC distance) relative to the underlying base model, suggesting that failures can often be attributed to structural brittleness rather than semantic misunderstanding. By replacing extensive human preference annotation with structural inductive biases inherent to the task, SAFT offers a scalable path for stabilizing text-conditioned RL and underscores the broader value of incorporating task structure as a general inductive bias.
- Abstract(参考訳): 効果的な報酬関数の設計は、強化学習(RL)において依然として大きなボトルネックとなっている。
最近の研究は、報酬モデルとして大きな基盤であるビジョン・ランゲージ・モデル(VLM)を使用し、手動報酬工学をバイパスするテキスト・オブザーブレーションの類似性を計算している。
有望ではあるが、これらの報酬は、しばしば騒々しく、信頼できないもので、デプロイ中に直接の効用を制限する。
本研究では,これらの不完全な報奨信号をオンラインで改良する簡易な自己監督手法であるStructure-Aware Fine-Tuning(SAFT)を提案する。
SAFTは、VLMの潜伏空間をLoRAアダプタを介して規則化するために、固有の構造的前提を利用する。
我々はSAFTを、その汎用性を示すために、ベースモデル機能の範囲で厳格に評価する。
以上の結果から,SAFTは報酬景観を常に軽視し,より高速なポリシー収束と,基礎となるベースモデルに対するアライメント(EPIC距離)を大幅に改善し,失敗は意味的誤解よりも構造的脆さに起因することが示唆された。
タスク固有の構造的帰納バイアスに人為的嗜好アノテーションを置き換えることで、SAFTはテキスト条件付きRLを安定化するためのスケーラブルなパスを提供し、タスク構造を一般的な帰納バイアスとして組み込むことのより広い価値を浮き彫りにする。
関連論文リスト
- Power Reinforcement Post-Training of Text-to-Image Models with Super-Linear Advantage Shaping [66.25536973294726]
テキスト・トゥ・イメージ(T2I)モデルのポストトレーニング手法はハッキングに報いる傾向がある。
SLAS(Super-Linear Advantage Shaping)は、地方政策の分野を再考する。
SLASは、DanceGRPOベースラインを複数のバックボーンとベンチマークで一貫して上回っている。
論文 参考訳(メタデータ) (2026-05-11T17:59:25Z) - Large Vision-Language Models Get Lost in Attention [51.851592109135716]
本稿では,情報理論と幾何に基づく統合フレームワークを提案し,残差更新の幾何的およびエントロピー的性質を定量化する。
注意は再設定に焦点を当てたサブスペース言語演算子として機能し、FFNはセマンティックイノベーションを駆動するサブスペース言語演算子として機能します。
論文 参考訳(メタデータ) (2026-05-07T04:45:52Z) - Mitigating Reward Hacking in RLHF via Bayesian Non-negative Reward Modeling [49.41422138354821]
非負の因子分析をBradley-Terry選好モデルに統合する原理的報酬モデリングフレームワークを提案する。
BNRMは、スパースで非負の潜在因子生成過程を通じて報酬を表す。
BNRMは報酬の過度な最適化を著しく軽減し、分布シフトによるロバスト性を改善し、強いベースラインよりも解釈可能な報酬分解をもたらすことを示す。
論文 参考訳(メタデータ) (2026-02-11T08:14:11Z) - Shaping Explanations: Semantic Reward Modeling with Encoder-Only Transformers for GRPO [0.0]
グループ相対政策最適化フレームワークにおいて,報酬形成のための新たなアプローチを導入する。
私たちの中心的な貢献は、セマンティック報酬モデルとして、小型で効率的なエンコーダのみのトランスフォーマーを使用することです。
本手法は,イタリア医学部入学試験のモデルを訓練する作業に適用する。
論文 参考訳(メタデータ) (2025-09-16T13:39:29Z) - Interpretable Reward Model via Sparse Autoencoder [16.903840987027912]
本稿では,Sparse Autoencoder-enhanced Reward Model(SARM)を紹介する。
SARMはLLMベースのRMの隠れた活性化を解釈可能でスパースで単意味的な特徴空間にマッピングする。
実験的な評価では、SARMは報酬割り当ての直接的特徴レベルの帰属を促進し、好みのシフトを動的に調整し、従来の報酬モデルよりも優れたアライメント性能を実現する。
論文 参考訳(メタデータ) (2025-08-12T08:41:00Z) - On the Generalization of SFT: A Reinforcement Learning Perspective with Reward Rectification [61.607788999847564]
LLM(Large Language Model)のためのSFT(Supervised Fine-Tuning)の改良法を提案する。
標準SFT勾配は、モデルの一般化能力を著しく制限する問題のある報酬構造を暗黙的に符号化する。
本稿では,このトークンの確率で目的関数を動的に再スケーリングすることにより,各トークンの勾配を安定化する動的微調整(DFT)を提案する。
論文 参考訳(メタデータ) (2025-08-07T17:59:04Z) - Rubrics as Rewards: Reinforcement Learning Beyond Verifiable Domains [9.917318870162365]
Reinforcement Learning with Verifiable Rewards (RLVR) は、数学やコーディングのような明確な正当性信号を持つ複雑な推論タスクに有効であることが証明されている。
ラグビーは近年、そのような判断を捉えるために評価ベンチマークで使用されているが、オンラインのポストトレーニングの報奨信号としての可能性はまだ未定である。
本稿では,RLVRを検証可能な領域を超えて,ルーブリックフィードバックを用いて拡張するオンライン強化学習手法であるRaRを紹介する。
論文 参考訳(メタデータ) (2025-07-23T17:57:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。