論文の概要: Learning to Control LLM Agent Harnesses with Offline Reinforcement Learning
- arxiv url: http://arxiv.org/abs/2607.05458v1
- Date: Sun, 05 Jul 2026 22:11:18 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-08 21:24:51.268047
- Title: Learning to Control LLM Agent Harnesses with Offline Reinforcement Learning
- Title(参考訳): オフライン強化学習によるLDMエージェントのハーネス制御の学習
- Abstract要約: 大規模言語モデル(LLM)エージェントは通常、プロンプト、キャリブレーションされたモデル、手書きで改善される。
LLMエグゼキュータが凍結状態にある間、軽量コントローラが構造実行動作を選択する有限水平ハーネスMDPとしてハーネス演算を形式化する。
- 参考スコア(独自算出の注目度): 0.05371337604556311
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large language model (LLM) agents are usually improved by changing prompts, models, or hand-written workflows, while the execution harness around the model is treated as fixed infrastructure. We argue that this harness is itself a learnable control layer. We formalize harness operation as a finite-horizon Harness MDP, where a lightweight controller selects structural execution actions while the LLM executor remains frozen. The controller is trained from offline rollouts using advantage-weighted regression with only terminal task-rubric rewards. We also separate final task quality from a post-hoc Harness Maturity Score, which measures whether the harness follows reliable execution patterns rather than only whether the final answer is correct. This separation gives a finite-buffer view of harness learning: final-quality gains require high-return support in the offline buffer, while process behavior can shift whenever it aligns with advantage-weighted actions. Across six controlled domains and two public-benchmark adapters, the learned controller consistently improves verification behavior and selectively improves final task quality, with the largest gains on adapted tau-bench retail, adapted AgentBench DB-Bench, and coding with a calibrated structural verifier. Ablations against behavior cloning and Forced CHECK show that the gains are not explained by imitation or by simply adding checks. These results identify harness control as a learnable layer for frozen LLM agents, while showing that offline support limits when better process control becomes better final answers.
- Abstract(参考訳): 大規模言語モデル(LLM)エージェントは通常、プロンプトやモデル、手書きのワークフローを変更することで改善される。
このハーネスはそれ自体が学習可能なコントロール層である、と私たちは主張する。
LLMエグゼキュータが凍結状態にある間、軽量コントローラが構造実行動作を選択する有限水平ハーネスMDPとしてハーネス演算を形式化する。
コントローラは、オフラインのロールアウトから、ターミナルタスク・ルーブリックの報酬のみを持つアドバンテージ重み付けレグレッションを使用してトレーニングされる。
また、最終回答が正しいかどうかだけでなく、ハーネスが信頼できる実行パターンに従うかどうかを測定する、ポストホックなハーネス成熟スコアから最終タスク品質を分離する。
最終品質のゲインはオフラインバッファで高いリターンサポートを必要とし、一方プロセスの振る舞いは、有利な重み付けされたアクションと整合するたびにシフトする。
6つの制御ドメインと2つの公開ベンチマークアダプタで、学習したコントローラは、検証動作を一貫して改善し、最終タスク品質を選択的に改善する。
行動クローニングと強制CHECKに対するアブレーションは、利得が模倣や単に小切手を追加することによって説明されないことを示している。
これらの結果から, 凍結LDMエージェントの学習可能な層としてハーネス制御を同定し, より優れたプロセス制御が最終回答となると, オフラインサポートが制限されることを示した。
関連論文リスト
- TROVE: Adaptive Agent Skill Orchestration via Trace-Grounded Route Validation and Editing [14.424308190797683]
検証・編集(TROVE)によるトレーサグラウンドルートオーケストレーションを提案する。
オフライン, TROVE蒸留は, ワークフローのトレースから原子・複合技術, 結果条件遷移グラフまでの評価を行った。
オンラインでは、計画されたルートを暫定的に扱い、1つのトップレベルスキルをコミットした後、コントローラは有効な継続を保持し、トレースサポートされたローカルレスポンスを挿入し、無効な接尾辞のみを置き換える。
論文 参考訳(メタデータ) (2026-09-04T11:38:13Z) - Control-Diverse Reinforcement Fine-Tuning: Decoupling the Shared Control Bottleneck of RL Post-Training [5.633817116718103]
強化学習はLLMの複雑な推論を解き放つ。
ベンチマークスコアは、モデルが改善されたか、内部が変更されたか、タスク間で有限の能力をどのように分割したかのみを示す。
我々は、アクティベーションを制御から分離することで、このアクティベーション中心のアカウントに挑戦する。
論文 参考訳(メタデータ) (2026-08-08T16:44:47Z) - TTHE: Test-Time Harness Evolution [50.26245555541721]
既存のアプローチでは、デプロイ前、トレーニング前、あるいはテスト時に凍結される固定されたエージェントワークフローの開発データを最適化する。
我々は、エージェントがテスト入力で生成するラベルのない実行トレースのみを使用して、評価自体にハーネスを最適化できるかどうかを問う。
評価中、TTHEは候補ハーネスの人口を維持し、それらの実行トレースの理由をエージェントプロジェクタを通じてそれらを洗練する。
その後、審査員は実行元プロキシ信号から改善されたハーネスをコミットし、選択したプログラムは継続してその後の入力を統治する。
論文 参考訳(メタデータ) (2026-07-09T05:53:39Z) - LLM-as-a-Verifier: A General-Purpose Verification Framework [74.40111651545979]
本稿では,汎用検証フレームワーク LLM-as-a-Verifier を紹介する。
追加のトレーニングを必要とせずに、エージェントタスクに対してきめ細かいフィードバックを提供する。
いくつかのベンチマークで最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2026-07-06T17:59:35Z) - Benchmarking Code Improvement with Progressive, Adaptive, and Interactive Feedback [13.976149104483449]
PAIR-Benchは、大規模言語モデル(LLM)を評価するためのプログレッシブベンチマークである。
不正確なプログラムや不完全なプログラムを、フィードバック誘導による改善によって、より正しいプログラムに変換する。
モデルがターゲットの障害を修復するかどうかを計測し、ヒントを超えて一般化し、すでに正しい振る舞いを保持し、どのくらいの助けが必要なのかを測定します。
論文 参考訳(メタデータ) (2026-07-01T18:20:27Z) - AI Training Manager: Bounded Closed-Loop Control of Adaptive Training Recipes [0.0]
Managerはアクティブな実行から構造化されたテレメトリスナップショットを読み、制約されたアクション空間を監査し、トレーニングパラメータに検証された更新を返す。
TinyStoriesでは、マネージャがオーバーフィッティングを検出し修正し、ベースラインよりも60%低い検証損失を達成する。
ロボット操作強化学習タスクでは,評価やチェックポイント境界においてマネージャの更新を適用したエピソード閉ループ設定において,同じ境界決定インタフェースを使用する。
論文 参考訳(メタデータ) (2026-06-29T07:07:33Z) - From Failed Trajectories to Reliable LLM Agents: Diagnosing and Repairing Harness Flaws [12.757205456771295]
本稿では,エージェント故障の診断と修復を行うためのトレースガイドフレームワークであるHarnessFixを提案する。
HarnessFixは生の実行トレースをコンパイルし、コードをHarness対応のトレース中間表現に変換する。
障害の原因は、責任ある軌道ステップとレイヤの活用、繰り返し診断を実行可能な欠陥レコードに集約し、スコープ化された修復オペレータにマップすることにある。
論文 参考訳(メタデータ) (2026-06-04T15:58:30Z) - PYTHALAB-MERA: Validation-Grounded Memory, Retrieval, and Acceptance Control for Frozen-LLM Coding Agents [0.0]
本稿では,ローカル検証条件付きコード生成のための軽量外部コントローラであるPYTHALAB-MERAを紹介する。
厳密な検証ゲートを持つ強化学習コーディングタスクにおけるローカルCLIアーティファクトとしての実装を評価する。
論文 参考訳(メタデータ) (2026-05-08T20:39:32Z) - Training LLMs for Multi-Step Tool Orchestration with Constrained Data Synthesis and Graduated Rewards [76.49428173793386]
LLMは、中間出力を伝搬しながら、正しい順序で複数の依存APIを呼び出す必要がある。
既存の環境は、シミュレーションデータを使った単純なターン毎の関数呼び出しとバイナリ報酬に重点を置いている。
まず、実APIレスポンスの大規模キャッシュを背景とした強化学習環境を構築し、有効なマルチステップオーケストレーショントレースをサンプリングするデータ合成パイプラインを実現する。
第二に、正当性を原子の妥当性とオーケストレーションに分解する、段階的な報酬設計を提案する。
論文 参考訳(メタデータ) (2026-03-25T18:31:39Z) - GUI-Libra: Training Native GUI Agents to Reason and Act with Action-aware Supervision and Partially Verifiable RL [64.8155693023222]
オープンソースのネイティブGUIエージェントは、長い水平ナビゲーションタスクのクローズドソースシステムに遅れを取っている。
このギャップは、高品質でアクション整合性のある推論データが不足していることに起因している。
GUI-Libraは、これらの課題に対処する調整されたトレーニングレシピです。
論文 参考訳(メタデータ) (2026-02-25T18:34:57Z) - Confounding Robust Continuous Control via Automatic Reward Shaping [48.93769483870838]
オフラインデータセットから連続制御問題に対する報酬形成機能を自動的に学習することを提案する。
提案手法は,最近提案された因果ベルマン方程式に基づいて,最適状態値の厳密な上界を学習する。
私たちの研究は、因果的観点から堅牢な継続的制御を分離する第一歩です。
論文 参考訳(メタデータ) (2026-02-10T21:23:12Z) - Attribute Controlled Fine-tuning for Large Language Models: A Case Study on Detoxification [76.14641982122696]
本稿では,属性制御付き大規模言語モデル(LLM)の制約学習スキーマを提案する。
提案手法は, ベンチマーク上での競合性能と毒性検出タスクを達成しながら, 不適切な応答を少ないLCMに導出することを示す。
論文 参考訳(メタデータ) (2024-10-07T23:38:58Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。