論文の概要: Causal Improvement Graph for Agentic Harness Optimization
- arxiv url: http://arxiv.org/abs/2610.05039v1
- Date: Sun, 04 Oct 2026 08:15:37 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-11 06:50:14.377025
- Title: Causal Improvement Graph for Agentic Harness Optimization
- Title(参考訳): エージェントハーネス最適化のための因果改善グラフ
- Abstract要約: 因果改善グラフ(Causal Improvement Graph, CIG)は、永続グラフにおける改善状態の進化を外部化する、グラフが支配するメタハーネスフレームワークである。
CIGはノードをリンクして、観察されたこと、どのように説明されるか、その説明をテストする方法、そして評価が示すものを表す。
- 参考スコア(独自算出の注目度): 85.77143316265415
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Agentic Harness is the runtime that constructs task context and controls execution flow, thereby shaping overall agent performance. Given a fixed model and external evaluation, automated Harness optimization seeks to improve this runtime through an iterative proposal--evaluation loop to better solve target tasks. Existing meta-harness methods mainly adopt proposer-centric discovery, in which an LLM-based proposer integrates accumulated experimental findings to determine subsequent Harness revisions. This places the burden of maintaining the evolving improvement state on the proposer as history expands and its underlying experimental logic becomes harder to discern. In this paper, we introduce the Causal Improvement Graph (CIG), a graph-governed meta-harness framework that externalizes the evolving improvement state in a persistent graph, allowing prior findings to directly govern subsequent Harness optimization through local proposer operations. CIG grows and links Evidence, Hypothesis, Intervention, and Outcome nodes to represent what was observed, how it may be explained, how to test that explanation, and what the evaluation reveals. Their structural relations preserve how the improvement state changes across iterations, allowing local proposers to build directly on relations among prior findings rather than recover them from raw history. Across various agent tasks, CIG discovers stronger Harnesses than previous meta-harness baselines and remains robust to the choice of task solver and proposer. Structural ablations further support the design of an explicit improvement state with graph-governed evolution.
- Abstract(参考訳): Agentic Harnessは、タスクコンテキストを構築し、実行フローを制御するランタイムである。
固定モデルと外部評価によって、自動化されたHarness最適化は、目標タスクをよりよく解決するために、反復的な提案-評価ループを通じて、このランタイムを改善しようとしている。
既存のメタハーネス法は, LLMに基づく提案者が蓄積した実験結果を統合し, その後のハーネス修正を決定する, プロジェクタ中心の発見を主に採用している。
これにより、歴史が拡大し、基礎となる実験論理が識別しにくくなるにつれて、提案者の進歩する改善状態を維持するという負担が生じる。
本稿では,グラフが支配するメタハーネスフレームワークであるCausal Improvement Graph(CIG)を紹介する。
CIGはEvidence, hypothesis, Intervention, Outcomeの各ノードをリンクして、観察されたこと、どのように説明されるか、その説明をテストする方法、そして評価が示すものを表現する。
それらの構造的関係は、改善状態がイテレーション間でどのように変化するかを保ち、ローカルな提案者は、生の履歴から回復するのではなく、事前の発見間の関係を直接構築できる。
様々なエージェントタスクにおいて、CIGは以前のメタハーネスベースラインよりも強いハーネスを発見し、タスクソルバとプロジェクタの選択に頑健である。
構造的アブレーションは、グラフが支配する進化を伴う明示的な改善状態の設計をさらに支援します。
関連論文リスト
- TROVE: Adaptive Agent Skill Orchestration via Trace-Grounded Route Validation and Editing [14.424308190797683]
検証・編集(TROVE)によるトレーサグラウンドルートオーケストレーションを提案する。
オフライン, TROVE蒸留は, ワークフローのトレースから原子・複合技術, 結果条件遷移グラフまでの評価を行った。
オンラインでは、計画されたルートを暫定的に扱い、1つのトップレベルスキルをコミットした後、コントローラは有効な継続を保持し、トレースサポートされたローカルレスポンスを挿入し、無効な接尾辞のみを置き換える。
論文 参考訳(メタデータ) (2026-09-04T11:38:13Z) - HarnessEvolve: Learning from Reference Trajectories for Reliable Agent Self-Evolution [11.431479238875712]
我々は、信頼できるエージェントの自己進化を実現するために、参照軌道から学習する自己進化フレームワークであるHarnessEvolveを紹介する。
私たちは、さまざまなモデルとエージェントフレームワークを使用して、オープンドメインとエンタープライズシナリオにまたがるいくつかのベンチマークで広範な実験を行います。
結果は、HarnessEvolveがすべてのベンチマークと設定で、最先端のベースラインを一貫して上回っていることを示している。
論文 参考訳(メタデータ) (2026-09-01T07:31:18Z) - Recursive Harness Self-Improvement [28.432258880153125]
モデル-ハーネス共進化の下では、ハーネスはデータ生成コンポーネントであり、実行トレースは将来の基礎モデルを形成することができる。
本稿では,エージェントループのプロンプトレベル仕様としてハーネスを表現したRecursive Harness Self-Improvement (RHI)を紹介する。
RHIは、自身のリビジョン履歴に対してペアのフィードバックを使って、反復的にそれを洗練します。
論文 参考訳(メタデータ) (2026-07-17T00:21:19Z) - Back to the Beginning of Heuristic Design: Bridging Code and Knowledge with LLMs [8.10827298136302]
大規模言語モデル (LLM) は、最近最適化のための高度自動設計 (AHD) を発表した。
既存のほとんどのアプローチは実行可能プログラムを探索し、実行フィードバックから洞察を抽出し、後続のイテレーションをガイドする。
我々は知識が主検索対象となり、コードは単にそれをインスタンス化し、テストするだけであると主張している。
論文 参考訳(メタデータ) (2026-05-07T12:30:58Z) - Co-evolving Agent Architectures and Interpretable Reasoning for Automated Optimization [6.428928591765431]
大規模言語モデル(LLM)を用いた操作研究は、手作業による推論によって制限されている。
自動最適化のための共進化的フレームワークであるEvoOR-Agentを提案する。
ケーススタディとアブレーション分析は、明示的なアーキテクチャ進化とグラフによる推論-軌道探索が、性能改善と構造的解釈可能性の両方に寄与していることを示している。
論文 参考訳(メタデータ) (2026-04-20T01:44:18Z) - Beyond Progress Measures: Theoretical Insights into the Mechanism of Grokking [50.465604300990904]
グロキング(Grokking)とは、オーバーフィッティングの拡張後のテスト精度の急激な改善を指す。
本研究では、素数演算のタスクにおいて、Transformerの基盤となるグルーキング機構について検討する。
論文 参考訳(メタデータ) (2025-04-04T04:42:38Z) - Chain-of-Retrieval Augmented Generation [91.02950964802454]
本稿では,o1-like RAGモデルを学習し,最終回答を生成する前に段階的に関連情報を抽出・推論する手法を提案する。
提案手法であるCoRAGは,進化状態に基づいて動的にクエリを再構成する。
論文 参考訳(メタデータ) (2025-01-24T09:12:52Z) - Understanding, Predicting and Better Resolving Q-Value Divergence in
Offline-RL [86.0987896274354]
まず、オフラインRLにおけるQ値推定のばらつきの主な原因として、基本パターン、自己励起を同定する。
そこで本研究では,Q-network の学習における進化特性を測定するために,SEEM(Self-Excite Eigen Value Measure)尺度を提案する。
われわれの理論では、訓練が早期に発散するかどうかを確実に決定できる。
論文 参考訳(メタデータ) (2023-10-06T17:57:44Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。