論文の概要: TCPO: Turn-Level Credit Policy Optimization
- arxiv url: http://arxiv.org/abs/2608.01667v1
- Date: Mon, 03 Aug 2026 04:01:36 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:25.324271
- Title: TCPO: Turn-Level Credit Policy Optimization
- Title(参考訳): TCPO:ターンレベル信用政策最適化
- Abstract要約: 検証器誘導型マルチターンRLのターンレベルクレジット代入法であるTCPOを提案する。
TCPOは、クレジット割り当てをスコア・ツー・クレディット変換とし、基準ベースの比較を通じてターンレベルの利点を構築する。
数学推論、コード生成、AppWorldエージェントタスクの実験は、TCPOがモデルスケール、タスクドメイン、検証対象タイプで最強のベースラインを改善したり、適合させたりしていることを示している。
- 参考スコア(独自算出の注目度): 3.5758528239482477
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Verifier-guided reinforcement learning has become a powerful paradigm for improving LLM reasoning. In multi-turn settings, models receive a verifier score after each turn and iteratively refine their outputs. Although such scores provide dense feedback, they do not directly provide dense credit: a score measures the quality of the current output, while credit should measure how the current turn changes the refinement trajectory. We propose TCPO, a turn-level credit assignment method for verifier-guided multi-turn RL. TCPO casts credit assignment as score-to-credit conversion and constructs turn-level advantages through reference-based comparisons: retrospective credit captures immediate progress and regression relative to the best prior state; hindsight delayed credit identifies non-improving turns with later payoff; and selective fixed-history counterfactual estimation refines high-surprisal turns under the same history. Experiments on math reasoning, code generation, and AppWorld agent tasks show that TCPO improves or matches the strongest baselines across model scales, task domains, and verifier types. TCPO achieves the best or tied-best best-turn Pass@8 on Qwen3-4B and DeepSeek-R1-Distill-Llama-8B, reduces turns to success, and improves multi-turn agent performance. These results highlight score-to-credit conversion as a central ingredient for verifier-guided multi-turn policy optimization.
- Abstract(参考訳): 検証誘導強化学習はLLM推論を改善するための強力なパラダイムとなっている。
マルチターン設定では、モデルは各ターン後に検証者スコアを受け取り、出力を反復的に洗練する。
スコアは現在の出力の質を計測するが、クレジットは現在のターンがリファインメントの軌道をどのように変えるかを測定する必要がある。
検証器誘導型マルチターンRLのターンレベルクレジット代入法であるTCPOを提案する。
TCPOは、クレジット割り当てをスコア・ツー・クレディットの変換として、基準ベースの比較を通じてターンレベルの優位性を構築する: 振り返りクレジットは、最高の事前状態に対して即時進行と回帰をキャプチャし、後続の遅延クレジットは、後続の支払いで非改善のターンを特定する。
数学推論、コード生成、AppWorldエージェントタスクの実験は、TCPOがモデルスケール、タスクドメイン、検証対象タイプで最強のベースラインを改善したり、適合させたりしていることを示している。
TCPOはQwen3-4BとDeepSeek-R1-Distill-Llama-8BでベストあるいはベストターンのPass@8を達成する。
これらの結果から, スコア・ツー・クレディット変換が, 検証者誘導型マルチターンポリシー最適化の鍵となる要素であることが示唆された。
関連論文リスト
- TRCA: Transition-wise Rubric Credit Assignment for Long-horizon LLM Agents [22.01777615106231]
Long-Horizon Large Language Model (LLM) エージェントは通常、スパース終端結果に最適化される。
本稿では、ステップレベルの監督を行動誘発遷移から直接引き出すトランジッションワイド・クレジット・アサインメントを提案する。
ALFWorld、WebShop、および7つの検索拡張された質問回答ベンチマークの実験は、評価されたベースラインよりも一貫した改善を示している。
論文 参考訳(メタデータ) (2026-08-17T06:19:12Z) - AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning [58.76655851910778]
AgentOPSDは、エージェント強化学習におけるターンレベルのクレジット割り当てのための、批判のない再帰的手法である。
ALFWorld, WebShop, Search-QA上のAgentOPSDを2つのスケールでQwen2.5モデルを用いて評価する(3B, 7B)。
論文 参考訳(メタデータ) (2026-08-06T13:00:59Z) - APPO: Agentic Procedural Policy Optimization [28.730334202611257]
エージェントRLを2つの視点から研究する:textitwhere to branchと、ブランチ後のクレジットの割り当て方法
本稿では、分岐とクレジットの割り当てを粗い相互作用単位から細かな決定点にシフトするAPPOを提案する。
APPOは、強力なエージェントRLベースラインを4ポイント近く改善し、効率的なツールコールを維持し、振る舞いの解釈可能性を維持する。
論文 参考訳(メタデータ) (2026-06-10T17:47:07Z) - TAPO: Tool-Aware Policy Optimization via Credit Transfer for Multimodal Search Agents [54.08846865906602]
ツール強化マルチモーダルサーチエージェントにおいて,クレジットミス割り当てをGRPOの系統的障害モードとして特徴付ける。
本稿では,情報取得ツールのパラメータ決定性を利用したツール・アウェア・ポリシー・オプティマイズ(TAPO)を提案する。
論文 参考訳(メタデータ) (2026-06-04T07:15:43Z) - VeriGate: Verifier-Gated Step-Level Supervision for GRPO [51.26100506256885]
グループ相対政策最適化は、検証者に基づく結果報酬を伴う推論モデルをトレーニングするための効果的なレシピである。
GRPO の検証子付き拡張である VeriGate を提案し,これらの制限を3つの設計選択で解決する。
We show that VeriGate improves average accuracy around 20% and 12% for 1.5B and 7B models respectively。
論文 参考訳(メタデータ) (2026-05-28T18:20:32Z) - Save the Good Prefix: Precise Error Penalization via Process-Supervised RL to Enhance LLM Reasoning [59.76691952347156]
強化学習(RL)は,大規模言語モデル(LLM)の推論能力向上のための強力なフレームワークとして登場した。
既存のRLアプローチの多くは疎結果報酬に依存しており、部分的に成功した解では正しい中間段階を信用できない。
本稿では、PRMを用いてRL中の最初のエラーをローカライズする検証済み事前修正ポリシー最適化(VPPO)を提案する。
論文 参考訳(メタデータ) (2026-01-26T21:38:20Z) - CAPO: Towards Enhancing LLM Reasoning through Generative Credit Assignment [44.33395106709674]
RLVR(Reinforcement Learning with Verifiable Rewards)は、ルールベースのバイナリフィードバックを使用することで、LLM(Large Language Models)の推論能力を改善した。
現在のRLVRメソッドは、通常、すべてのトークンに同じ報酬を割り当てる。
この粗い粒度のフィードバックは、正確なクレジット割り当てを妨げ、モデルがどの推論ステップが成功または失敗につながるかを特定するのが難しくなる。
論文 参考訳(メタデータ) (2025-08-04T11:06:08Z) - Rewarding Progress: Scaling Automated Process Verifiers for LLM Reasoning [90.23629291067763]
大規模言語モデルにおける推論を改善するための有望なアプローチは、プロセス報酬モデル(PRM)を使用することである。
PRMは多段階の推論トレースの各ステップでフィードバックを提供し、結果報酬モデル(ORM)よりも信用割当を改善する可能性がある。
PRMに対して探索を行ったり、強化学習(RL)の報酬として使ったりすることで、基本方針を改善するために、「プロセス報酬をどう設計すべきか?」と質問する。
理論的には,良質なプロデューサの集合を特徴付けるとともに,このようなプロデューサからのプロセス報酬の最適化が,テスト時間探索やオンラインRLの探索を改善することを示す。
論文 参考訳(メタデータ) (2024-10-10T17:31:23Z) - VinePPO: Refining Credit Assignment in RL Training of LLMs [66.80143024475635]
我々は,言語環境の柔軟性を利用してモンテカルロをベースとした推定値を計算する,簡単なアプローチであるVinePPOを提案する。
本手法は,MATHおよびGSM8Kデータセット間のPPOおよび他のベースラインをウォールクロック時間以下で連続的に上回る。
論文 参考訳(メタデータ) (2024-10-02T15:49:30Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。