論文の概要: Self-Evolving Agents with Anytime-Valid Certificates
- arxiv url: http://arxiv.org/abs/2607.00871v1
- Date: Wed, 01 Jul 2026 12:34:52 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-02 19:56:07.891484
- Title: Self-Evolving Agents with Anytime-Valid Certificates
- Title(参考訳): 任意のValid証明書を用いた自己進化剤
- Abstract要約: 我々は,小型のステアリングアダプタとEmphfrozenベースモデルを中心としたバージョン付きハーネスに自己修正を限定するアーキテクチャである textbfSEA を提案する。
5つのループコントローラが発行された保証を構成しており、そのようなゲートは凍結されたベースが既に生成している動作の中でのみ選択できるため、5つの検証器・イン・ザ・ループ機構はゲートが必要とする高密度でグレーダフリーな信号を供給する。
結果は高価な評価で単回実行され、実行時から実行時までの分散を確認し、タスク毎のアルゴリズムの混合を適用することが今後の作業である。
- 参考スコア(独自算出の注目度): 1.2691047660244335
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: Self-evolving agents violate the assumption behind most learning-theoretic guarantees: the data, evaluator, components, and hypothesis space are produced by the policy being updated. We present \textbf{SEA}, an architecture that confines self-modification to a small steering adapter and a versioned harness around a \emph{frozen} base model and admits each modification only through an anytime-valid gate that emits an auditable certificate against a fixed error budget. Five loop controllers compose published guarantees; because such gates can only \emph{select} among behaviors the frozen base already produces, five verifier-in-the-loop mechanisms -- best-of-$N$, micro-step search, self-authored reproduction oracles, search-layer control, and self-repair -- supply the dense, grader-free signal the gates require, computed from the issue text alone. On a $52$-instance SWE-bench Verified subset across four base models, base capability is the dominant, confound-free effect, and on two strong base models a deliberate no-op-composite control isolates the suite's contribution at $+4$ and $+5$ (\textsc{Glm}~5.2 $24\to28$; \textsc{Gpt} $29\to34$, the $65\%$ best), with event logs confirming that its mechanisms fire and prevent regressions. Results are single-run on expensive evaluations; confirming run-to-run variance and adapting the per-task algorithm mix are future work.
- Abstract(参考訳): 自己進化エージェントは、データ、評価器、コンポーネント、仮説空間が更新されるポリシーによって生成される、ほとんどの学習理論的な保証の裏にある仮定に反する。
本稿では,小型のステアリングアダプタと,emph{frozen}ベースモデルを中心としたバージョン付きハーネスに自己修正を限定するアーキテクチャである‘textbf{SEA} について述べる。
5つのループコントローラは、凍結されたベースが既に生成している動作の中でのみ \emph{select} を指定できるため、5つの検証器・イン・ザ・ループ機構 -- best-of-N$, micro-step search, self-authored production oracles, search-layer control, self-repair -- ゲートが要求する高密度でグレーダーフリーなシグナルを発行する。
4つのベースモデルにまたがる52ドルのSWE-bench検証サブセットでは、ベース能力が支配的かつ無防備な効果であり、2つの強力なベースモデルでは、意図的なno-op-compositeコントロールがスイートのコントリビューションを$+4$と$+5$で分離する(\textsc{Glm}~5.2$4\to28$; \textsc{Gpt} $29\to34$, the best)。
結果は高価な評価で単回実行され、実行時から実行時までの分散を確認し、タスク毎のアルゴリズムの混合を適用することが今後の作業である。
関連論文リスト
- SVR: Self-Verifying Refinement via Joint Verdict-Confidence Reinforcement Learning for Adaptive Test-Time Compute [62.3458279176813]
自己検証リファインメント(Self-Verifying Refinement)は、オラクルフリーのマルチターン強化学習フレームワークである。
自己検証を計算制御ポリシとして使用することを学ぶ。
マクロ平均精度は0.563で、平均で2.99回しか推測できない。
論文 参考訳(メタデータ) (2026-07-30T16:20:58Z) - Maestro Order: A Model-Agnostic Orchestration Harness [0.5414847001704247]
本稿では、信頼できない解法を信頼性の高い問題解決システムに変換するモデルに依存しないオーケストレーションハーネスを提案する。
アーキテクチャ、メッセージおよび状態スキーマ、コントローラアルゴリズム、そして決定論的で観測可能でフォールトトレラントなエンジニアリングを提供します。
パラメータ化ソルバ/検証器モデル上でのハーネスの忠実なモンテカルロシミュレーションの結果を報告する。
論文 参考訳(メタデータ) (2026-06-22T22:21:59Z) - A Mathematical Theory of Value: a synthesis on goal-directed agency under resource constraints [6.057587531186626]
目的指向エージェントが生成し、破壊し、交換する価値は、情報と同じカテゴリの法的構造量であることを示す。
価格がフレームに依存していない間、価値はフレーム相対的であり、そのリソースをプールし、その知覚を融合する艦隊が天井を継承する。
論文 参考訳(メタデータ) (2026-06-10T16:11:04Z) - CIAware-Bench: Benchmarking Control Intervention Awareness Across Frontier LLMs [100.38986535324284]
我々は、フロンティアモデル全体でのtextbfcontrol textbfintervention (CI) の認識を測定するベンチマークである textbfCIAware-Bench を紹介する。
CIAware-Benchは、モデルが自身の軌跡を制御介入によって修正されたものと区別できるかどうかをテストする。
論文 参考訳(メタデータ) (2026-06-09T16:24:16Z) - Regimes: An Auditable, Held-Out-Gated Improvement Loop Demonstrated on LongMemEval with ActiveGraph [0.0]
イベントソースのエージェントランタイムは、制御された改善をファーストクラスのワークフローに変換する。
エージェントの状態が追加のみのイベントログの決定論的プロジェクションである場合、障害が記録され、実行がログから正確にリプレイされ、候補パッチスコープがタイプされたパイプラインシームに反映され、ゲートが監査可能である。
我々は、ActiveGraphランタイムのループであるRegimesでこれを実証し、失敗した評価を診断し、パイプラインポイントで修復を提案し、静的チェック、サンドボックスの実行、インサンプル評価、ホールドアウトバリデーションの後にのみそれを促進します。
論文 参考訳(メタデータ) (2026-06-08T23:04:35Z) - Survive or Collapse: The Asymmetric Roles of Data Gating and Reward Grounding in Self-Play RL [76.45061154544568]
セルフプレイ強化学習は、言語モデルを独自の生成タスクで訓練し、人間ラベルなしでプロジェクタとソルバを共進化させる。
最近のシステムでは強い推理効果が報告されているが、崩壊と不安定性は広く観察され、理解されていない。
代わりに、自己プレイの安定性は、提案者生成タスクがトレーニングプールに入るかを判断するデータレベルゲートと、すでに認められたタスクに関するポリシーを更新する報酬信号の2つの異なるレバーによって管理されていると論じる。
論文 参考訳(メタデータ) (2026-05-21T09:19:23Z) - Persona-Model Collapse in Emergent Misalignment [0.0]
有害な内容を持つ狭いデータに対する微調整された大きな言語モデルは、無関係なプロンプトに対して広範囲に不整合な振る舞いをもたらす。
モラル・サセプティビリティ(S)とモラル・ロバストネス(R)の2つの指標を用いてこの仮説を検証する。
これらのメトリクスは、与えられた文字(S)と、与えられた文字(R)をシミュレートするときにその一貫性を識別するモデルの能力を形式化する。
論文 参考訳(メタデータ) (2026-05-13T00:48:57Z) - The Surprising Universality of LLM Outputs: A Real-Time Verification Primitive [0.0]
CPUのみのスコアリングプリミティブはトークン当たり2.6マイクロ秒で動作する。
トークンのランク周波数分布は同じ2パラメータのMandelbrotランキング分布に収束する。
利用可能な場合にモデルログの確率で構成し、クローズドAPIで使用可能なランクオンリーモードに分解するシングルパススコアリングプリミティブを導出する。
論文 参考訳(メタデータ) (2026-04-28T13:35:31Z) - Correction and Corruption: A Two-Rate View of Error Flow in LLM Protocols [51.56484100374058]
そこで本研究では,単一プロトコルステップを正確なマッチングタスクで監査するためのペアアウトカム計測インタフェースを提案する。
各インスタンスについて、インターフェースはベースラインの正当性ビットと後ステップの正当性ビットを記録する。
これらのレートは精度の変化を予測し、種、混合物、パイプライン間でテスト可能な再利用可能な経験的インターフェースを定義する。
論文 参考訳(メタデータ) (2026-04-20T13:25:40Z) - Self-Calibrating Language Models via Test-Time Discriminative Distillation [18.46710400838861]
大規模言語モデル(LLM)は、しばしば間違って答える質問に対して体系的に過度に信頼されている。
我々は、テスト時間トレーニング(TTT)パイプラインである$textbfSECL$ ($textbfSE$lf-$textbfC$alibrating $textbfL$anguage Modelsを紹介します。
論文 参考訳(メタデータ) (2026-03-18T13:28:50Z) - Automated Self-Testing as a Quality Gate: Evidence-Driven Release Management for LLM Applications [51.56484100374058]
我々は,エビデンスに基づくリリース決定を伴う品質ゲートを導入する自動自己テストフレームワークを提案する。
内部展開型多エージェント対話型AIシステムの縦型ケーススタディにより,本フレームワークの評価を行った。
論文 参考訳(メタデータ) (2026-03-13T20:44:15Z) - $V_1$: Unifying Generation and Self-Verification for Parallel Reasoners [69.66089681814013]
$V_$は、効率的なペアワイドランキングを通じて生成と検証を統合するフレームワークである。
V_$-Inferはポイントワイド検証でPass@1を最大10%改善する。
V_$-PairRLは、標準のRLとポイントワイドのジョイントトレーニングよりも、テストタイムのスケーリングが7ドル--9%で向上する。
論文 参考訳(メタデータ) (2026-03-04T17:22:16Z) - Reinforcement Learning with Verifiable yet Noisy Rewards under Imperfect Verifiers [90.50039419576807]
RLVR(Reinforcement Learning with Verifiable Rewards)は、人為的なラベル付けを避けるために、自動検証に対するポリシーを訓練する。
認証ハッキングの脆弱性を軽減するため、多くのRLVRシステムはトレーニング中にバイナリ$0,1$の報酬を破棄する。
この選択にはコストがかかる:textitfalse negatives(正しい回答、FNを拒絶)とtextitfalse positives(間違った回答、FPを受け入れる)を導入する。
論文 参考訳(メタデータ) (2025-10-01T13:56:44Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。