論文の概要: Recursive Harness Self-Improvement
- arxiv url: http://arxiv.org/abs/2607.15524v1
- Date: Fri, 17 Jul 2026 00:21:19 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-20 17:56:52.720566
- Title: Recursive Harness Self-Improvement
- Title(参考訳): Recursive Harness Self-Improvement
- Authors: Hyunin Lee, Jinglue Xu, Jeffrey Seely, Donghyun Lee, Matei Zaharia, Yujin Tang,
- Abstract要約: モデル-ハーネス共進化の下では、ハーネスはデータ生成コンポーネントであり、実行トレースは将来の基礎モデルを形成することができる。
本稿では,エージェントループのプロンプトレベル仕様としてハーネスを表現したRecursive Harness Self-Improvement (RHI)を紹介する。
RHIは、自身のリビジョン履歴に対してペアのフィードバックを使って、反復的にそれを洗練します。
- 参考スコア(独自算出の注目度): 28.432258880153125
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Under model--harness co-evolution, harnesses are not merely inference-time scaffolds but data-generating components whose execution traces can shape future foundation models. This motivates harness-in-the-loop learning: optimizing harnesses for both immediate agent performance and the quality of traces used for future model training. However, continually updating provider-built scaffolds is costly and labor-intensive. We therefore investigate whether optimizing user-constructed harnesses in a task-specific manner can improve execution-trace quality while remaining computationally lightweight and requiring only a few update iterations. To this end, we introduce Recursive Harness Self-Improvement (RHI), which represents the harness as a prompt-level specification of the agent loop and iteratively refines it using pairwise feedback over its own revision history. Across 30 synthetic machine-learning research tasks spanning quantitative finance, robotics, and pharmacy, a few RHI iterations suffice to substantially raise the performance ceiling of low-reasoning-effort agents, exceeding the corresponding maximum-reasoning-effort setting while reducing inference cost by up to 60%. We show that these gains arise primarily from improved task-specific context management through more effective inter-agent information flow rather than longer reasoning traces. Finally, we formalize this behavior as an information-theoretic hypothesis for RHI's implicit optimization objective, suggesting RHI as a practical algorithm for continual learning within the paradigm of model--harness co-evolution.
- Abstract(参考訳): モデル-ハーネス共進化の下では、ハーネスは単なる推論時の足場ではなく、実行トレースが将来の基礎モデルを形成することができるデータ生成コンポーネントである。
これはハーネス・イン・ザ・ループ学習を動機付け、即時エージェントのパフォーマンスと将来のモデルトレーニングに使用されるトレースの品質の両方にハーネスを最適化する。
しかし、プロバイダが構築した足場を継続的に更新することはコストが高く、労働集約的である。
そこで本研究では,タスク固有の方法でユーザ構築型ハーネスを最適化することで,計算処理の軽量さを維持しつつ,数回の更新イテレーションしか必要とせず,実行トレース品質を向上できるかどうかを考察する。
この目的のために、エージェントループのプロンプトレベル仕様としてハーネスを表現したRecursive Harness Self-Improvement (RHI)を導入し、それぞれのリビジョン履歴に対してペアフィードバックを用いて反復的に改善する。
定量的ファイナンス、ロボティクス、薬局にまたがる30の総合的な機械学習研究課題のうち、いくつかのRHIイテレーションは、推論コストを最大60%削減しつつ、対応する最大空洞効果設定を超える、低空洞効果剤のパフォーマンス天井を大幅に上げるのに十分である。
これらの利点は主に、長い推論トレースではなく、より効果的なエージェント間情報フローによるタスク固有のコンテキスト管理の改善によるものであることを示す。
最後に、この振る舞いをRHIの暗黙の最適化目標に対する情報理論仮説として定式化し、モデル-ハーネス共進化のパラダイムにおける継続学習の実践的アルゴリズムとして提案する。
関連論文リスト
- Adaptive Recurrent Message Passing for Test Time Computing on Graphs [80.56829418752513]
繰り返しグラフモデルでは,グラフデータとアーキテクチャ設計の固有のミスマッチを克服できることを示す。
本稿では,アダプティブ・リカレントグラフモデルであるAdaRを提案する。
論文 参考訳(メタデータ) (2026-06-21T12:14:11Z) - Evolving Agents in the Dark: Retrospective Harness Optimization via Self-Preference [51.55077364626896]
本稿では,過去の軌道のみを用いたエージェント・ハーネスを最適化する自己教師型手法であるRetrospective Harness Optimization (RHO)を紹介する。
RHOは、過去の軌跡から様々な課題のコアセットを選択し、それらを並列に解決する。
1回の最適化ラウンドでは、SWE-Bench Proのパスレートが59%から78%に向上する。
論文 参考訳(メタデータ) (2026-06-04T09:26:00Z) - Efficient Reinforcement Learning for Large Language Models with Intrinsic Exploration [33.02780998281276]
検証可能な報酬付き強化学習(RLVR)は、大規模言語モデルの推論能力を改善した。
本研究は,RLVRにおけるデータ効率の向上に本質的なデータ特性の活用,すなわちトレーニング中のほぼ自由な利益をいかに生かすかを検討する。
論文 参考訳(メタデータ) (2025-11-02T04:16:47Z) - Deep Generative Continual Learning using Functional LoRA: FunLoRA [12.547444644243543]
共通の戦略は、忘れを和らげるために、生成モデルを自身の合成データで再訓練することである。
低階適応(LoRA)に基づく生成モデルのための新しい、より表現力のある条件付け機構を提案する。
提案手法は,拡散モデルに基づく先行技術結果を上回るパラメータ効率細調整(PEFT)手法である。
論文 参考訳(メタデータ) (2025-10-03T00:18:05Z) - Exploring Training and Inference Scaling Laws in Generative Retrieval [50.82554729023865]
生成検索は、検索を自己回帰生成タスクとして再構成し、大きな言語モデルがクエリから直接ターゲット文書を生成する。
生成的検索におけるトレーニングと推論のスケーリング法則を体系的に検討し,モデルのサイズ,トレーニングデータスケール,推論時間計算が協調的に性能に与える影響について検討した。
論文 参考訳(メタデータ) (2025-03-24T17:59:03Z) - Chain-of-Retrieval Augmented Generation [91.02950964802454]
本稿では,o1-like RAGモデルを学習し,最終回答を生成する前に段階的に関連情報を抽出・推論する手法を提案する。
提案手法であるCoRAGは,進化状態に基づいて動的にクエリを再構成する。
論文 参考訳(メタデータ) (2025-01-24T09:12:52Z) - Agent-R: Training Language Model Agents to Reflect via Iterative Self-Training [18.896813839389893]
本稿では,言語エージェントをオンザフライでリフレクション可能な反復型自己学習フレームワーク,Agent-Rを提案する。
Agent-Rは、正しさに基づいてアクションを報酬または罰揚する従来の方法とは異なり、MCTSを活用して、誤ったトラジェクトリから正しいトラジェクトリを復元するトレーニングデータを構築する。
以上の結果から,Agent-Rは連続的にエラーから回復し,タイムリーなエラー訂正を可能にすることが示唆された。
論文 参考訳(メタデータ) (2025-01-20T11:46:04Z) - Enhancing Robustness of Vision-Language Models through Orthogonality Learning and Self-Regularization [77.62516752323207]
そこで本研究では,事前訓練した重みを効率よく微調整する直交微調整法を導入し,頑健さと一般化の強化を実現した。
自己正規化戦略は、OrthSRと呼ばれるVLMのゼロショット一般化の観点から安定性を維持するためにさらに活用される。
筆者らはCLIPとCoOpを再検討し,少数の画像のクラスフィシエーションシナリオにおけるモデルの改善を効果的に行う。
論文 参考訳(メタデータ) (2024-07-11T10:35:53Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。