論文の概要: Claim-Level Rubric Rewards for Video Caption Reinforcement Learning
- arxiv url: http://arxiv.org/abs/2607.05150v1
- Date: Mon, 06 Jul 2026 14:33:41 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:30.193094
- Title: Claim-Level Rubric Rewards for Video Caption Reinforcement Learning
- Title(参考訳): ビデオ字幕強化学習のためのクレームレベルルーブリックリワード
- Abstract要約: Claim-Level Rewards Rewards (CuRe)は、高密度ビデオキャプションのための強化学習における報酬-設計のボトルネックに対処するために設計された構造化された報酬フレームワークである。
CuReは、報酬モデリングをきめ細かいクレームレベルの検証として再構成する。
- 参考スコア(独自算出の注目度): 44.96572145476932
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: In this paper, we introduce Claim-Level Rubric Rewards (CuRe), a structured reward framework designed to address the reward-design bottleneck in reinforcement learning for dense video captioning. Existing reward designs generally fall into two categories: holistic response-level judgment across heterogeneous criteria, or alignment-based evaluation against reference captions. However, both paradigms suffer from fundamental limitations. Holistic rewards struggle to ensure factual accuracy and are prone to stylistic reward hacking, while reference-based rewards overly rely on rigid textual alignment, failing to preserve the completeness and diversity inherent to open-ended generation tasks. To address these challenges, CuRe reformulates reward modeling as fine-grained claim-level verification. Specifically, CuRe decomposes captions into category-aware atomic claims through a structured rubric, converting holistic evaluation into simpler and more reliable claim-level verification.
- Abstract(参考訳): 本稿では,高密度ビデオキャプションのための強化学習における報酬-設計ボトルネックに対処する構造的報酬フレームワークであるClim-Level Rubric Rewards(CuRe)を紹介する。
既存の報酬デザインは一般に、不均一な基準にまたがる全体的応答レベル判定と、参照キャプションに対するアライメントに基づく評価の2つのカテゴリに分類される。
しかし、どちらのパラダイムも基本的な制限に悩まされている。
ホロスティック報酬は事実の正確性を保証するのに苦労し、スタイリスティック報酬のハッキングに苦慮する一方で、参照ベースの報酬は厳密なテキストアライメントに過度に依存し、オープンな生成タスクに固有の完全性と多様性を維持できない。
これらの課題に対処するため、CuReは報酬モデリングをきめ細かいクレームレベルの検証として再定義する。
具体的には、CuReはキャプションを構造化ルーリックを通してカテゴリ対応原子クレームに分解し、全体的な評価をよりシンプルで信頼性の高いクレームレベルの検証に変換する。
関連論文リスト
- CoRT: Counterfactual Replay for Token-Level Rubric-Guided Policy Optimization [21.755134237801443]
CoRTは、ルーリック条件のGRPOのトークンレベルクレジット重み付け手法である。
比較の結果,CoRTは一致した応答レベルGRPOよりも改善していることがわかった。
論文 参考訳(メタデータ) (2026-07-28T12:45:19Z) - Designing Reward Signals for Portable Query Generation: A Case Study in Industrial Semantic Job Search [8.82040111147814]
本稿では,Emphportable Search クエリを生成するために,エンドツーエンドの RLAIF フレームワークを提案する。
このタスクは、ポリシー最適化がルーリックの欠陥を活用し、冗長なコピー動作をもたらす、非常に敵対的な報酬曲面を導入する。
提案手法では,提案手法の誤りを再現する報酬を補正するルールベースの報酬フロアを導入することで,家族間評価審査員に+0.147ドルの品質改善をもたらすことを示す。
論文 参考訳(メタデータ) (2026-06-25T17:09:12Z) - Rethinking Reward Supervision: Rubric-Conditioned Self-Distillation [60.55792673956761]
我々は, ルブリックを構造化, きめ細かいフィードバックとして組み込んだフレームワークであるtextbfRubric-Conditioned Self-Distillationを提案する。
その結果, ルーリック条件の自己蒸留は, ルーリックレベルの基準をトークンレベルのガイダンスに効果的に変換することを示した。
論文 参考訳(メタデータ) (2026-06-17T17:54:04Z) - BALTO: Balanced Token-Level Policy Optimization for Hallucination Mitigation [51.22170603236523]
幻覚緩和のためのバランスドトークンレベルの政策最適化フレームワークを提案する。
BalTOはチェック可能な事実クレームを抽出し、参照コンテキストに対して検証し、トークンレベルのラベルに対するクレームレベルの判断をプロジェクトする。
ConFiQA、RAGTruth、FinLLM-Evalの実験では、BALTOは6つのモデルで最高の忠実さを達成している。
論文 参考訳(メタデータ) (2026-06-14T16:25:59Z) - Prompt-Level Reward Specifications for Open-Ended Post-Training [43.215398565987265]
訓練後のオープンエンドのメリットは、迅速な成功条件を明確にする報酬である。
本稿では、報酬仕様と報酬仕様を分離するプロンプトレベル報酬仕様フレームワークを提案する。
論文 参考訳(メタデータ) (2026-05-28T02:52:06Z) - Chain of Uncertain Rewards with Large Language Models for Reinforcement Learning [52.48243762705385]
Chain of Uncertain Rewards (CoUR)は、大きな言語モデル(LLM)を統合して報酬関数の設計と評価を効率化する新しいフレームワークである。
我々は、CoURがより良い性能を実現し、報酬評価のコストを大幅に削減できることを示します。
論文 参考訳(メタデータ) (2026-04-15T05:44:14Z) - Rubrics to Tokens: Bridging Response-level Rubrics and Token-level Rewards in Instruction Following Tasks [30.108876878365496]
強化学習(Reinforcement Learning, RL)は,大規模言語モデルと複雑なオープンドメイン命令を連携させる,有望なアプローチとして登場した。
既存の手法は主に応答レベルの報酬に依存しており、厳格な報酬の分散と報酬のあいまいさの問題を導入している。
粗い応答レベルスコアときめ細かいトークンレベルクレジット割り当てを橋渡しするルーブリックベースの新しいRLフレームワークを提案する。
論文 参考訳(メタデータ) (2026-04-03T07:02:57Z) - Reinforcing Consistency in Video MLLMs with Structured Rewards [14.560061824569333]
マルチモーダル大言語モデル (MLLM) はビデオ理解において顕著な進歩を遂げている。
本研究では,この障害モードを,キャプションを事実的・時間的クレームに分解する構成整合監査を通じて検討する。
本研究の目的は,(1)実物,属性,関係性に対する実例対応のシーングラフ報酬,(2)イベントの順序と繰り返しに対する時間報酬,(3)階層的自己検証のためのビデオグラウンド付VQA報酬の3つの相補的な構成要素を統合することである。
論文 参考訳(メタデータ) (2026-04-01T23:15:34Z) - Intra-Trajectory Consistency for Reward Modeling [67.84522106537274]
軌道内整合性正則化を開発し、より高い次トーケン生成確率を持つプロセスがより一貫した報酬を維持することを強制する。
提案した正規化でトレーニングした報酬モデルにより、より優れたDPO整合ポリシーが導出され、より優れたベスト・オブ・N(BON)検証結果が得られることを示す。
論文 参考訳(メタデータ) (2025-06-10T12:59:14Z) - QA-LIGN: Aligning LLMs through Constitutionally Decomposed QA [46.65999744568314]
本稿では,モノリシック報酬を解釈可能な原理固有評価に分解するQA-LIGNを紹介する。
ランマ-3.1-8B-インストラクションの適用により、QA-LIGNは攻撃成功率を最大68.7%まで下げる一方で、偽拒絶率0.67%を維持している。
論文 参考訳(メタデータ) (2025-06-09T18:24:57Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。