論文の概要: A Bird's-Eye View of Iterative Reward Design
- arxiv url: http://arxiv.org/abs/2610.04364v1
- Date: Sat, 03 Oct 2026 08:02:22 GMT
- ステータス: 情報取得中
- システム内更新日: 2026-10-06 20:25:54.036585
- Title: A Bird's-Eye View of Iterative Reward Design
- Title(参考訳): 反復型リワードデザインの鳥の視点
- Abstract要約: 本稿では,既存の手法を統一的な構成と評価空間で表現するBIRD(Benchmark for Iterative Reward Design)を提案する。
MuJoCo、Meta-World、Assistax、HumanoidBench全体で、パフォーマンスを継続的に改善する単純な設計選択の小さなセットを特定します。
本結果は,単純なベースラインの強みを強調し,アルゴリズムの複雑さが反復的な報酬設計を改善するときのさらなる研究を動機づけるものである。
- 参考スコア(独自算出の注目度): 1.6770237546339255
- License:
- Abstract: Designing effective reward functions in RL typically requires substantial expertise and trial and error. Recent work automates this process with LLM-based systems that generate and iteratively improve reward code using policy feedback. However, these methods are often hard to compare because they differ in implementation details, feedback assumptions, and evaluation environments. To address this, we introduce a Benchmark for Iterative Reward Design (BIRD) that expresses existing methods in a unified configuration and evaluation space. This lets us compare algorithms directly, ablate individual design choices, and prototype new components under matched feedback conditions and policy-training budgets. Across MuJoCo, Meta-World, Assistax, and HumanoidBench, we identify a small set of simple design choices that consistently improve performance. Combining these choices yields significantly better performance than the evaluated methods from prior work. Our results highlight the strength of simple baselines and motivate further study of when additional algorithmic complexity improves iterative reward design. Code is available at https://github.com/safety-research/bird.
- Abstract(参考訳): RLで効果的な報酬関数を設計するには、かなりの専門知識と試行錯誤が必要となる。
最近の研究は、ポリシーフィードバックを用いて報酬コードを生成し、反復的に改善するLLMベースのシステムで、このプロセスを自動化する。
しかし、これらの手法は実装の詳細、フィードバックの前提、評価環境が異なるため、比較が難しいことが多い。
これを解決するために,既存のメソッドを統一的な構成と評価空間で表現するBIRD(Benchmark for Iterative Reward Design)を導入する。
これにより、アルゴリズムを直接比較し、個々の設計選択を短縮し、マッチしたフィードバック条件とポリシトレーニング予算の下で新しいコンポーネントのプロトタイプを作成します。
MuJoCo、Meta-World、Assistax、HumanoidBench全体で、パフォーマンスを継続的に改善する単純な設計選択の小さなセットを特定します。
これらの選択を組み合わせることで、以前の作業で評価された方法よりも大幅にパフォーマンスが向上する。
本結果は,単純なベースラインの強みを強調し,アルゴリズムの複雑さが反復的な報酬設計を改善するときのさらなる研究を動機づけるものである。
コードはhttps://github.com/safety-research/bird.comから入手できる。
関連論文リスト
- Reward Score Matching: Unifying Reward-based Fine-tuning for Flow and Diffusion Models [54.597200388738656]
Reward-based fine-tuningは、事前訓練された拡散またはフローベース生成モデルを、より高い逆サンプルに向けて操ることを目的としている。
報酬スコアマッチング (RSM) と呼ばれる共通フレームワークで記述できることが示される。
論文 参考訳(メタデータ) (2026-04-19T12:47:52Z) - Chain of Uncertain Rewards with Large Language Models for Reinforcement Learning [52.48243762705385]
Chain of Uncertain Rewards (CoUR)は、大きな言語モデル(LLM)を統合して報酬関数の設計と評価を効率化する新しいフレームワークである。
我々は、CoURがより良い性能を実現し、報酬評価のコストを大幅に削減できることを示します。
論文 参考訳(メタデータ) (2026-04-15T05:44:14Z) - A Minimal Agent for Automated Theorem Proving [0.3262230127283452]
この設計は、反復的証明改善、ライブラリ検索、コンテキスト管理といった最先端システム間で共有されるコア機能を実装している。
定性的に異なるベンチマークを用いてベースラインを評価し、様々な人気モデルと設計選択を比較した。
論文 参考訳(メタデータ) (2026-02-27T18:43:47Z) - Reward-Agnostic Prompt Optimization for Text-to-Image Diffusion Models [20.292872255460534]
RATTPOは,様々な報酬シナリオに適用可能なフレキシブルなテスト時間最適化手法である。
RATTPOは、報酬固有のタスク記述を必要とせずに、大きな言語モデル(LLM)のテキストをクエリすることで、最適化されたプロンプトを検索する。
経験的結果はRATTPOの汎用性を示し、多様な報酬設定のユーザプロンプトを効果的に強化する。
論文 参考訳(メタデータ) (2025-06-20T09:02:05Z) - DOCE: Finding the Sweet Spot for Execution-Based Code Generation [69.5305729627198]
本稿では,候補生成,$n$-best再ランク,最小ベイズリスク(MBR)復号化,自己老化などを含む包括的フレームワークを提案する。
本研究は,実行ベースメソッドの重要性と,実行ベースメソッドと実行フリーメソッドとの差を明らかにする。
論文 参考訳(メタデータ) (2024-08-25T07:10:36Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。