論文の概要: Learning Generalizable Behaviors for Terminal Agents
- arxiv url: http://arxiv.org/abs/2608.22631v2
- Date: Wed, 26 Aug 2026 21:18:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-28 14:16:51.659356
- Title: Learning Generalizable Behaviors for Terminal Agents
- Title(参考訳): 端末エージェントの汎用行動学習
- Abstract要約: 低品質環境をフィルタし、プロセスレベルの行動規則化による結果報酬を増大させることにより、報酬品質を向上させるための簡単なトレーニングレシピを提案する。
このレシピを用いて、4つの端末エージェントベンチマークで評価されたオープンソースのRL学習8Bモデルのうち、RL学習エージェントは最高の性能を考慮に入れた。
- 参考スコア(独自算出の注目度): 72.62493560701414
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Terminal agents are a compelling application of large language models (LLMs), with the potential to integrate deeply into users' daily workflows. Reinforcement learning (RL) is a key technique for improving their capabilities, making scalable training environments a central challenge. Since public real-user interaction data are scarce, synthetic environments provide a practical alternative, but often suffer from domain gaps and limited fidelity, leading to poor generalization. Existing work mainly scales the quantity and diversity of synthetic environments, while reward-signal quality and the mechanisms governing generalization remain under-explored. We study how RL improves terminal agents and propose the Agentic Compositional Generalization hypothesis: rather than teaching new domain-specific skills from scratch, RL primarily shapes high-level decision-making behaviors that compose and route low-level skills acquired during pre-training and supervised fine-tuning (SFT). This account is consistent with our empirical results and suggests that verifier quality, which determines which behaviors are reinforced, is more important than simply increasing environment quantity or diversity. Motivated by this insight, we propose River, a simple training recipe that improves reward quality by filtering low-quality environments and augmenting outcome rewards with process-level behavior regularization. Using this recipe, our RL-trained agent achieves the best performance among evaluated open-source RL-trained 8B models across four terminal-agent benchmarks. River also generalizes across model families, scales, agent harnesses, and RL objectives. Using fewer than 30% of the TMax training environments, River improves RL gains by 106% and 30% on average for models ranging from 2B to 27B on Terminal-Bench-Lite and Terminal-Bench-v2.1, respectively.
- Abstract(参考訳): ターミナルエージェントは、大きな言語モデル(LLM)の魅力的なアプリケーションであり、ユーザの日々のワークフローに深く統合される可能性がある。
強化学習(RL)は、その能力を改善するための重要なテクニックであり、スケーラブルなトレーニング環境を中心的な課題にしている。
公共のリアルタイムインタラクションデータは少ないため、合成環境は実用的な代替手段を提供するが、しばしばドメインギャップと有限性に悩まされ、一般化が不十分になる。
既存の研究は主に合成環境の量と多様性をスケールし、報酬信号の品質と一般化のメカニズムは未調査のままである。
我々は、RLが端末エージェントをどのように改善し、エージェント構成一般化仮説を提案する:新しいドメイン固有のスキルをスクラッチから教える代わりに、RLは主に、事前学習と教師付き微調整(SFT)の間に獲得した低レベルのスキルを構成し、ルートする高レベルの意思決定行動を形成する。
この説明は、我々の経験的結果と一致しており、どの行動が強化されているかを決定する検証品質は、単に環境量や多様性を増やすことよりも重要であることを示唆している。
この知見により,低品質環境をフィルタリングし,プロセスレベルの行動規則化による成果報酬を増大させることにより,報酬品質を向上させるための簡単なトレーニングレシピであるRiverを提案する。
このレシピを用いて、4つの端末エージェントベンチマークで評価されたオープンソースのRL学習8Bモデルの中で、RL学習エージェントが最高の性能を達成する。
Riverはまた、モデルファミリー、スケール、エージェントハーネス、RLの目的を一般化する。
TMaxトレーニング環境の30%未満を使用して、リバーはターミナル・ベンチ・ライトの2Bから27Bまでのモデルとターミナル・ベンチ・v2.1のモデルで、平均してRLが106%向上し、30%向上した。
関連論文リスト
- EnvRL: Learn from Environment Dynamics in Agentic Reinforcement Learning [78.62829041672663]
強化学習(RL)は大規模言語モデル(LLM)をエージェントとして訓練するための強力なパラダイムとして登場した。
本稿では,環境動態学習をエージェントRLに組み込むフレームワークであるEnvRLを提案する。
論文 参考訳(メタデータ) (2026-06-16T08:48:09Z) - RLAnything: Forge Environment, Policy, and Reward Model in Completely Dynamic RL System [52.3348044324205]
クローズドループ最適化により環境・ポリシー・報酬モデルを構築する強化学習フレームワークであるRLAnythingを提案する。
具体的には、ポリシーはステップワイドおよび結果信号からの総合的なフィードバックで訓練される。
理論を動機とした自動環境適応は、報酬モデルと政策モデルの両方のトレーニングを改善する。
論文 参考訳(メタデータ) (2026-02-02T18:59:04Z) - Sample-Efficient Neurosymbolic Deep Reinforcement Learning [49.60927398960061]
本稿では,背景記号知識を統合し,サンプル効率を向上させるニューロシンボリックディープRL手法を提案する。
オンライン推論は2つのメカニズムを通じてトレーニングプロセスのガイドを行う。
我々は、最先端の報奨機ベースラインよりも優れた性能を示す。
論文 参考訳(メタデータ) (2026-01-06T09:28:53Z) - Information Gain-based Policy Optimization: A Simple and Effective Approach for Multi-Turn LLM Agents [28.145430029174577]
大規模言語モデル(LLM)ベースのエージェントは、外部環境と対話する能力を高めるために強化学習(RL)でますます訓練されている。
既存のアプローチは通常、最終回答でのみ提供される結果に基づく報酬に依存します。
本稿では,情報ゲインに基づくポリシー最適化(IGPO)を提案する。
論文 参考訳(メタデータ) (2025-10-16T17:59:32Z) - Demystifying Reinforcement Learning in Agentic Reasoning [90.3737088727791]
エージェント推論における強化学習のデミスティフィケーションのための包括的かつ体系的な調査を行う。
i) 縫合された合成軌道を、実際のエンドツーエンドのツール・ツー・ユース・トラジェクトリに置き換えることで、より強力なSFTが得られる。
探索フレンドリーな技術は、高いクリップ、過剰な報酬形成、適切なポリシーエントロピーの維持といったエージェントRLにとって不可欠であり、訓練効率を向上させることができる。
論文 参考訳(メタデータ) (2025-10-13T17:57:15Z) - Dynamics Generalization via Information Bottleneck in Deep Reinforcement
Learning [90.93035276307239]
本稿では,RLエージェントのより優れた一般化を実現するために,情報理論正則化目標とアニーリングに基づく最適化手法を提案する。
迷路ナビゲーションからロボットタスクまで、さまざまな領域において、我々のアプローチの極端な一般化の利点を実証する。
この研究は、タスク解決のために冗長な情報を徐々に取り除き、RLの一般化を改善するための原則化された方法を提供する。
論文 参考訳(メタデータ) (2020-08-03T02:24:20Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。