論文の概要: Harness Annealing: Learning to Act with Less External Control
- arxiv url: http://arxiv.org/abs/2610.01235v1
- Date: Thu, 01 Oct 2026 07:35:39 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 01:19:23.969964
- Title: Harness Annealing: Learning to Act with Less External Control
- Title(参考訳): Harness Annealing: 外部制御の少ない行動を学ぶ
- Abstract要約: ハーネスをサポートする軌道のトレーニングは、実行時の介入に依存したままタスクパフォーマンスを向上させることができる。
我々は、ハーネスに支えられた経験が、これらの決定をモデルに教えることができ、モデルが学習するにつれて制御の分割が変更できるかどうか尋ねる。
- 参考スコア(独自算出の注目度): 9.808032179894935
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Language agents rely on external harnesses to track state, organize workflows, and verify answers. Beyond providing tools and information, these harnesses supply control decisions about what to investigate, whether to revise, and when to stop. Training on successful harness-supported trajectories can improve task performance while leaving these decisions dependent on runtime intervention. We ask whether harness-supported experience can also teach the model to make these decisions, allowing the division of control to change as the model learns. We call this objective harness internalization: learning to assume specified control responsibilities while retaining task performance after the corresponding support is withdrawn. We introduce HARNESS ANNEALING TRAINING (HAT), which combines explicit control supervision with a curriculum over teacher trajectories collected under progressively weaker harnesses. Experiments with 9B and 35B models on SWE-QA and SWE-QA-Pro evaluate every checkpoint under four deployment harnesses. Selected annealed checkpoints operating with tools alone achieve scores close to those of their respective starting checkpoints deployed with the full harness. The benefits vary with model scale and deployment configuration, and further annealing does not uniformly improve performance. These findings suggest that harness-supported experience can help reduce the runtime control required by a trained agent.
- Abstract(参考訳): 言語エージェントは、状態を追跡し、ワークフローを編成し、回答を検証するために外部ハーネスに依存している。
ツールや情報の提供以外にも、調査するべきこと、修正するべきこと、停止するべき時間に関する制御上の決定を活用できる。
ハーネスをサポートする軌道のトレーニングは、実行時の介入に依存したままタスクパフォーマンスを向上させることができる。
我々は、ハーネスに支えられた経験が、これらの決定をモデルに教えることができ、モデルが学習するにつれて制御の分割が変更できるかどうか尋ねる。
我々は、この目標ハーネス内部化を、対応するサポートが取り下げられた後、タスクパフォーマンスを維持しながら、特定の制御責任を負うことを学ぶことと呼ぶ。
本稿では,より弱いハーネスの下で収集された教師軌道に関するカリキュラムと,明示的な制御指導を併用したHARNESS ANNEAING(HarnESS ANNEAING TRAINING)を紹介する。
SWE-QAとSWE-QA-Proの9Bモデルと35Bモデルを用いた実験は、4つの配置ハーネスで全てのチェックポイントを評価した。
ツールだけで動作する選択されたアニールチェックポイントは、フルハーネスでデプロイされた各開始チェックポイントのスコアに近いスコアを得る。
メリットは、モデルスケールとデプロイメントの設定によって異なり、さらにアニールすることでパフォーマンスが一様に向上しない。
これらの結果は、ハーネスサポートされた経験は、訓練されたエージェントが必要とするランタイム制御を減らすのに役立つことを示唆している。
関連論文リスト
- Harness Learning Enables Generalizable Test-Time Adaptation [75.12882372844764]
本稿では,提案手法を学習し,提案手法を学習し,提案手法を改良するハーネス学習を提案する。
我々は、改良されたハーネスのタスクパフォーマンスを報奨として、強化学習で提案者を訓練する。
推論とマルチホップ質問応答の実験は、学習の活用によってリビジョン品質が向上し、テストタイムで適応する能力が見当たらないタスクに適応することを示した。
論文 参考訳(メタデータ) (2026-09-28T17:52:54Z) - Self-Confirming Superposition Traps in Reinforcement Learning [62.71685993550818]
強化学習はエージェントのポリシーによって選択されたデータに基づいて表現し、その結果のリターンを使って次の選択を導く。
これらのデータに対して表現フィッティングがグローバルに最適である場合でも,このループは低リターンポリシーを維持可能であることを示す。
論文 参考訳(メタデータ) (2026-09-26T21:56:26Z) - Learning to Control LLM Agent Harnesses with Offline Reinforcement Learning [0.05371337604556311]
大規模言語モデル(LLM)エージェントは通常、プロンプト、キャリブレーションされたモデル、手書きで改善される。
LLMエグゼキュータが凍結状態にある間、軽量コントローラが構造実行動作を選択する有限水平ハーネスMDPとしてハーネス演算を形式化する。
論文 参考訳(メタデータ) (2026-07-05T22:11:18Z) - AI Training Manager: Bounded Closed-Loop Control of Adaptive Training Recipes [0.0]
Managerはアクティブな実行から構造化されたテレメトリスナップショットを読み、制約されたアクション空間を監査し、トレーニングパラメータに検証された更新を返す。
TinyStoriesでは、マネージャがオーバーフィッティングを検出し修正し、ベースラインよりも60%低い検証損失を達成する。
ロボット操作強化学習タスクでは,評価やチェックポイント境界においてマネージャの更新を適用したエピソード閉ループ設定において,同じ境界決定インタフェースを使用する。
論文 参考訳(メタデータ) (2026-06-29T07:07:33Z) - SENTINEL: Failure-Driven Reinforcement Learning for Training Tool-Using Language Model Agents [52.758563996979596]
言語モデルエージェントは、マルチターンツールの使用によって現実的なタスクを解決するのにますます効果的である。
SENTINELは障害駆動型強化学習フレームワークで,障害のロールアウトを目標とするトレーニングタスクに変換する。
Tau2-Bench Retail with Qwen3-4B-Thinking-2507では、SENTINELはPass1を66.4から74.9に改善し、Passkメトリクス全体にわたる一般的な合成タスクにおいてRLを上回っている。
論文 参考訳(メタデータ) (2026-06-11T05:06:50Z) - Training with Harnesses: On-Policy Harness Self-Distillation for Complex Reasoning [8.33682726719781]
インタイムハーネスは複雑な推論タスクにおいて大きな言語モデルを大幅に改善する。
emphOn-Policy Harness Self-Distillation (OPHSD)を紹介する。
OPHSDは、タスク固有のハーネス機能を学生モデルに内包する。
論文 参考訳(メタデータ) (2026-05-09T07:06:37Z) - HINT: Helping Ineffective Rollouts Navigate Towards Effectiveness [49.72591739116668]
強化学習(RL)は、大規模言語モデル(LLM)の長いチェーン・オブ・シント(CoT)推論能力を高めるための重要な要因となっている。
しかし、GRPOのような一般的な手法は、タスクの難しさがモデルの能力を超えると失敗し、スパーシリティと非効率なトレーニングに報いる。
我々は、適応的なヒントフレームワークであるHINT: Helping In Effective Rollouts Navigate Towards Effectiveを提案する。
論文 参考訳(メタデータ) (2025-10-10T13:42:03Z) - Guiding Through Complexity: What Makes Good Supervision for Hard Math Reasoning Tasks? [74.88417042125985]
複雑さの異なるタスクにおいて、様々な品質レベルで監視データを提供する様々なデータ駆動戦略について検討する。
ハードタスクの監視における結果エラー率が高い場合でも、そのようなデータによるトレーニングは、より簡単なサブタスクの監督を完璧に上回ります。
また,本研究の結果から,タスク・インスペクションとサブタスク・インスペクションを補完することで,顕著なパフォーマンス向上が期待できることがわかった。
論文 参考訳(メタデータ) (2024-10-27T17:55:27Z) - URLB: Unsupervised Reinforcement Learning Benchmark [82.36060735454647]
教師なし強化学習ベンチマーク(URLB)を紹介する。
URLBは2つのフェーズで構成されている。
評価のために3つのドメインから12の連続制御タスクを提供し、8つの主要な教師なしRLメソッドに対してオープンソースコードを提供する。
論文 参考訳(メタデータ) (2021-10-28T15:07:01Z) - Reinforcement Learning for Robust Missile Autopilot Design [0.0]
この研究は、飛行制御のフレームワークとして強化学習を提案する先駆者である。
TRPOの手法では、収集されたエクスペリエンスはHERに従って拡張され、リプレイバッファに格納され、その重要性に応じてサンプリングされる。
その結果、最適な性能を達成し、不確実性に対するエージェントの堅牢性を改善することが可能であることがわかった。
論文 参考訳(メタデータ) (2020-11-26T09:30:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。