論文の概要: DocPO: Advancing Document Policy Optimization via Tailored Step-Aware Rewards
- arxiv url: http://arxiv.org/abs/2608.00536v2
- Date: Thu, 06 Aug 2026 05:51:08 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-07 15:25:20.714709
- Title: DocPO: Advancing Document Policy Optimization via Tailored Step-Aware Rewards
- Title(参考訳): DocPO: 階層化されたステップアウェアリワードによるドキュメントポリシ最適化の強化
- Authors: Yunhao Wang, Binghong Wu, Zhenyu Huang, Jiacheng Shi, Shuo Huang, Tinghao Yu, Feng Zhang,
- Abstract要約: 文書解析のための強化学習(RL)は、しばしば編集距離(木編集距離など)に根ざした参照ベースの報酬に依存する。
本稿では,段階的アウェア・アナリング(SAA)を提案する。
SAAに基づいて構築されたDocPOは、編集距離信号に固定された要素固有の参照ベースの報酬を持つ文書ポリシーフレームワークである。
- 参考スコア(独自算出の注目度): 12.045942626285155
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Reinforcement learning (RL) for document parsing often relies on reference-based rewards rooted in edit distance (e.g., tree edit distance), yet it remains hard to optimize in the high-accuracy regime because such rewards become weakly discriminative: near-correct outputs receive very similar scores, providing limited learning signal for hard cases. We propose Step-Aware Annealing (SAA), a plug-and-play reward sharpening mechanism that progressively increases reward curvature during training, amplifying subtle quality differences among high-scoring samples while preserving stability in early learning. Built on SAA, we introduce DocPO, a document policy optimization framework with element-specific, reference-based rewards anchored by edit-distance signals: normalized string edit distance (NED) for text, tree edit distance similarity (TEDS) for tables, and a hybrid Rubric+edit reward for formulas. Experiments on OmniDocBench and DocElemHard show that SAA consistently improves GRPO-style RL across document elements over non-annealed rewards, without requiring additional human supervision for reward construction.
- Abstract(参考訳): 文書解析のための強化学習(RL)は、しばしば、編集距離(木編集距離など)に根ざした参照ベースの報酬に依存するが、そのような報酬が弱いため、高い精度で最適化することは依然として困難である。
本研究では, 早期学習の安定性を維持しつつ, 学習中の報酬曲率を徐々に向上させ, 高品位標本間の微妙な品質差を増幅する, プラグアンドプレイ報酬のシャープ化機構であるステップ・アウェア・アニーリング(SAA)を提案する。
SAA上に構築されたDocPOは、テキストの正規化文字列編集距離(NED)、テーブルのツリー編集距離類似度(TEDS)、公式のハイブリッドRubric+edit報酬といった、要素固有の参照ベースの報酬をアンロックした文書ポリシー最適化フレームワークである。
OmniDocBench と DocElemHard の実験では、SAA は報酬構築のために人手による監督を必要とせず、文書要素間のGRPO スタイル RL を一貫して改善している。
関連論文リスト
- STAMP: Provenance-Guided Credit Assignment for Deep Search Agents [16.1299556246389]
ディープリサーチエージェントの強化学習は、主に軌道レベルのスコアリングに焦点を当てている。
本稿では、参照ベースの検証器が各引用文書がエンティティや関係をサポートするかどうかを判断するSTAMPを提案する。
BrowseComp、BrowseComp-ZH、xbench-DSでは、STAMPはGRPOのベースラインを+2.0/+5.5/+3.0ポイント改善している。
論文 参考訳(メタデータ) (2026-07-13T07:12:55Z) - TRACE: A Unified Rollout Budget Allocation Framework for Efficient Agentic Reinforcement Learning [52.67756371231985]
検証可能な報酬を伴う強化学習(RLVR)は、大規模言語モデルにおける推論とエージェント的行動を強化するための有望なアプローチである。
本稿では,Tree Rollout Allocation for Contrastive Exploration (TRACE)について紹介する。
技術的には、TRACEはロールアウト予算をルートと中間プレフィックスの両方に割り当てている。
論文 参考訳(メタデータ) (2026-06-09T17:16:03Z) - RHyVE: Competence-Aware Verification and Phase-Aware Deployment for LLM-Generated Reward Hypotheses [7.123785374544969]
大規模言語モデル(LLM)は、強化学習における報酬設計をかなりスケーラブルにするが、生成された報酬は自動的に信頼性のある訓練目標ではない。
本稿では,現在の政策の能力に依拠する報酬仮説として,生成した報酬を扱い,この展開時問題を考察する。
我々は,有能な検証とフェーズアウェアなデプロイメントプロトコルであるtextscRHyVEを提案する。
論文 参考訳(メタデータ) (2026-04-30T16:01:51Z) - Improving Search Agent with One Line of Code [68.58667107354253]
ツールベースのエージェント強化学習(TARL)は,検索エージェントが外部ツールと対話できるようにトレーニングするための,有望なパラダイムとして登場した。
textbfSearch textbfAgent textbfPolicy textbfOptimization (textbfSAPO)を提案する。
論文 参考訳(メタデータ) (2026-03-10T04:07:39Z) - CVeDRL: An Efficient Code Verifier via Difficulty-aware Reinforcement Learning [57.24524263804788]
コード検証は、LLMベースのコード生成の検証後において重要な役割を果たす。
既存の教師付き微調整手法は、データの不足、高い失敗率、推論効率の低下に悩まされている。
機能的な報酬しか持たない単純RLは、難しいブランチやサンプルに対して効果的な単体テストを生成することができないことを示す。
論文 参考訳(メタデータ) (2026-01-30T10:33:29Z) - Evidence-Augmented Policy Optimization with Reward Co-Evolution for Long-Context Reasoning [52.144281362465996]
本稿では,強化学習を長期シナリオに適用するためのEAPO(Evidence-Augmented Policy Optimization)を提案する。
最初にEvidence-Augmented Reasoningパラダイムを確立し、Tree-Structued Evidence Smplingを介して検証する。
次に、報酬モデルがグループ相対エビデンス・リワードを計算する特殊なRLアルゴリズムを導入する。
トレーニングを通して正確な監視を維持するため、適応的リワード・ポリティ共進化機構をさらに取り入れる。
論文 参考訳(メタデータ) (2026-01-15T11:40:57Z) - Optimizing Long-Form Clinical Text Generation with Claim-Based Rewards [9.525090594500577]
長期臨床テキスト生成のための評価統合強化学習フレームワークを提案する。
提案手法は,個別の報酬モデルを訓練したり,人手による参照に頼ることなく,現実的な接地と完全性を直接的に最適化する。
このフレームワークは現実世界の設定にスケーラブルで、ガイドラインの遵守や請求の好みといったカスタムの目的を組み込むことができる。
論文 参考訳(メタデータ) (2025-09-26T17:53:08Z) - Agentic Reinforcement Learning with Implicit Step Rewards [92.26560379363492]
大規模言語モデル (LLMs) は強化学習 (agentic RL) を用いた自律的エージェントとして発展している。
我々は,標準RLアルゴリズムとシームレスに統合された一般的なクレジット割り当て戦略であるエージェントRL(iStar)について,暗黙的なステップ報酬を導入する。
我々は,WebShopとVisualSokobanを含む3つのエージェントベンチマークと,SOTOPIAにおける検証不可能な報酬とのオープンなソーシャルインタラクションについて評価した。
論文 参考訳(メタデータ) (2025-09-23T16:15:42Z) - Rubrics as Rewards: Reinforcement Learning Beyond Verifiable Domains [9.917318870162365]
Reinforcement Learning with Verifiable Rewards (RLVR) は、数学やコーディングのような明確な正当性信号を持つ複雑な推論タスクに有効であることが証明されている。
ラグビーは近年、そのような判断を捉えるために評価ベンチマークで使用されているが、オンラインのポストトレーニングの報奨信号としての可能性はまだ未定である。
本稿では,RLVRを検証可能な領域を超えて,ルーブリックフィードバックを用いて拡張するオンライン強化学習手法であるRaRを紹介する。
論文 参考訳(メタデータ) (2025-07-23T17:57:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。