論文の概要: Beyond Binary Preferences: Graded Preference Optimization for Limb-Motion Captioning
- arxiv url: http://arxiv.org/abs/2609.36628v1
- Date: Tue, 29 Sep 2026 03:37:06 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-30 21:28:47.158296
- Title: Beyond Binary Preferences: Graded Preference Optimization for Limb-Motion Captioning
- Title(参考訳): バイナリの選好を超えて: Limb-Motion Captioningのグレードされた選好最適化
- Abstract要約: 3,105のショットと18,161のアセスメントクエリにまたがるベンチマークであるFlexBenchを紹介します。
我々のグレード物理アライメントスコア(GPA)は、正しいコンテンツに対するクレジットを授与し、不正または製造されたアクションに対するポイントを減じます。
そこで我々は,より厳密な行動エラーに対して,より強い選好率とトレーニング重量を割り当てるグレードマージン直接選好最適化(GM-DPO)を提案する。
- 参考スコア(独自算出の注目度): 8.271597512446315
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Vision-Language Models (VLMs) can generate rich video captions, yet often misidentify which person performs an action or which limb is involved, particularly across camera cuts. Improving these details requires evaluation and training that distinguish missing information from incorrect assertions. We introduce FlexBench, a benchmark spanning 3,105 shots and 18,161 evaluation queries, with human-verified identities and systematic per-person coverage of fine-grained limb actions and states. Its reference-derived checklists support automated assessment of complete captions in their person and shot contexts. Our Graded Physical Alignment score (GPA) awards credit for correct content and deducts points for incorrect or fabricated actions, making these errors explicit in the aggregate score. Building on this rubric, we propose Graded Margin Direct Preference Optimization (GM-DPO), which assigns stronger preference margins and greater training weight to more severe action errors. Across three VLM backbones, GM-DPO achieves the highest substantive-action and GPA scores among the evaluated preference objectives, improving GPA over DPO by 2.02-3.40 points. On Qwen3-8B, it reduces the weighted hallucination rate by 21.3% relative to DPO. These gains accompany sustained long-form output, improved shot structure, and competitive performance on three additional multimodal benchmarks.
- Abstract(参考訳): VLM(Vision-Language Models)は、リッチなビデオキャプションを生成することができるが、多くの場合、アクションを行う人や、特にカメラカットを通して、どの手足が関与しているかを誤識別する。
これらの詳細を改善するには、欠落した情報を誤ったアサーションと区別する評価とトレーニングが必要である。
3,105枚のショットと18,161個の評価クエリにまたがるベンチマークであるFlexBenchを紹介した。
参照由来のチェックリストは、人やショットコンテキストの完全なキャプションの自動評価をサポートする。
我々の段階的身体適応スコア(GPA)は、正しい内容のクレジットを付与し、誤りまたは偽造行為のポイントを減算し、これらの誤りを集計スコアで明示する。
このルーリックに基づいて、より強い選好マージンとより高いトレーニング重量をより厳密なアクションエラーに割り当てるグレード・マージン直接選好最適化(GM-DPO)を提案する。
3つのVLMバックボーン全体で、GM-DPOは、評価された選好目標のうち、最高の実体作用とGPAスコアを達成し、DPOよりも2.02-3.40ポイント改善する。
Qwen3-8Bでは、重み付けされた幻覚率をDPOと比較して21.3%減少させる。
これらのゲインには、持続的な長期出力、ショット構造の改善、さらに3つのマルチモーダルベンチマークでの競合性能が伴った。
関連論文リスト
- From Reward Signal to Visual Utility: A Controlled Audit of Medical VLM Post-Training [0.0]
教師付き微調整(SFT)と低ランク適応(LoRA)を比較した。
2,000のクリーンテスト質問に対して、言語モデルLoRA SFTは正像精度を+1.10ポイント変更した。
広範適応は言語モデルLoRA SFTよりも低い正像精度が得られる。
論文 参考訳(メタデータ) (2026-09-25T16:06:54Z) - Learn What's Left, Not What's Mastered: Saturation Aware Advantage Reweighting for Multi-Reward Policy Optimization [60.89431018071735]
グループ相対的な優位性を持つ強化学習は、訓練後の言語モデル推論のデファクトスタンダードとなっている。
異なる報酬プロファイルを持つロールアウトは、同じ利点を享受でき、現在の飽和度に関わらず、全ての目的が固定相対重みで最適化されることを示す。
本研究では,各報酬目標を独立に標準化し,目標飽和度をバッチレベルで推定した値に従って貢献を適応的に割引する飽和度認識再重み付けを導入する。
論文 参考訳(メタデータ) (2026-08-17T04:07:50Z) - Select Smarter, Not More: Prompt-Aware Evaluation Scheduling with Submodular Guarantees [28.54776477263591]
本稿では, Prompt-Aware Online Evaluation Scheduling (POES)を提案する。
POESはIRTベースの識別ユーティリティ、施設位置のカバレッジ用語、スイッチングコストを意識したウォームスタートスワップを統一された目的に統合する。
POESは、無視できるトークンオーバーヘッドで、全体的な平均精度(最高のベースラインよりも6.2%改善)が最も高い。
論文 参考訳(メタデータ) (2026-04-13T11:31:04Z) - VerIPO: Cultivating Long Reasoning in Video-LLMs via Verifier-Gudied Iterative Policy Optimization [59.39976343879587]
VerIPOは、深く長期的な推論チェーンを生成するためのビデオLLMの能力を徐々に改善することを目指している。
トレーニングループはGRPOの拡張検索とDPOのターゲット最適化の恩恵を受けている。
我々の訓練されたモデルは、大規模命令調整ビデオ-LLMの直接推定を超えている。
論文 参考訳(メタデータ) (2025-05-25T06:41:28Z) - Uncertainty-Penalized Direct Preference Optimization [52.387088396044206]
我々は、優先不確実性ペナル化スキームを導入し、DPOの悲観的な枠組みを開発する。
ペナル化は、不確実なサンプルの損失勾配を減衰させる損失の補正として機能する。
我々は,バニラDPOと比較して全体的な性能が向上し,高い不確実性選択/拒絶反応によるプロンプトの完成度も向上した。
論文 参考訳(メタデータ) (2024-10-26T14:24:37Z) - TIS-DPO: Token-level Importance Sampling for Direct Preference Optimization With Estimated Weights [73.9088920210495]
本稿では,TIS-DPO と呼ばれるトークン単位の重要度サンプリング DPO の目的について,その報酬に基づいて各トークンに重要度を割り当てる手法を提案する。
TIS-DPOは、無害性、有用性アライメントおよび要約タスクにおいて、様々なベースライン手法を著しく上回っている。
論文 参考訳(メタデータ) (2024-10-06T04:03:00Z) - Triple Preference Optimization: Achieving Better Alignment using a Single Step Optimization [34.29965046863887]
Triple Preference Optimization (TPO) は、推論能力と命令追従能力の両方を強化するために設計された新しい選好学習手法である。
TPOは、異なるデータセットサイズで応答長を大幅に増加させることなく、既存のメソッドよりも大幅に改善されている。
論文 参考訳(メタデータ) (2024-05-26T20:18:11Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。