論文の概要: The Red Queen Gödel Machine: Co-Evolving Agents and Their Evaluators
- arxiv url: http://arxiv.org/abs/2606.26294v2
- Date: Mon, 29 Jun 2026 17:13:25 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-30 15:56:39.052368
- Title: The Red Queen Gödel Machine: Co-Evolving Agents and Their Evaluators
- Title(参考訳): Red Queen Gödel Machine:共進化型エージェントとその評価装置
- Authors: Alex Iacob, Andrej Jovanović, William F. Shen, Daniel Burkhardt, Meghdad Kurmanji, Nurbek Tastan, Lorenzo Sani, Niccolò Alberto Elia Venanzi, Ambroise Odonnat, Zeyu Cao, Bill Marino, Xinchi Qiu, Nicholas D. Lane,
- Abstract要約: 自己改善エージェントはエージェントコーディングベンチマークの最先端(SOTA)であり、最近一般的なドメインに拡張されている。
非定常ユーティリティ下での自己改善のための進化的フレームワークであるRed Queen Godel Machine(RQGM)を紹介する。
RQGMは、補完的なエージェント・アズ・ア・ジャッジ・コード・レビュー信号を追加することにより、以前のSOTAよりもテストパス率を向上させることを示す。
次に、科学論文の執筆とレビュー、オリンピアードレベルの証明の執筆と評価に目を向け、RQGMは以前の自己改善エージェントよりもパフォーマンスを向上させる。
- 参考スコア(独自算出の注目度): 17.44053709945519
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Self-improving agents are state-of-the-art (SOTA) on agentic coding benchmarks and have recently been extended to general domains. However, their search methods generally assume a stationary evaluation criterion: a fixed verifier, benchmark, or labeled dataset that remains valid as the agent improves. This ignores a central feature of evolution: species adapt as their environments change with them. We aim to bring the same principle to recursive self-improvement, making evaluation part of the improvement loop and opening search to evolving evaluators, adversarial objectives, and dynamic utilities that may surpass static benchmarks. We introduce the Red Queen Godel Machine (RQGM), an evolutionary framework for recursive self-improvement under non-stationary utilities. The RQGM makes this possible through controlled utility evolution: search is organized into epochs with a fixed within-epoch evaluation criterion, while the utility can be updated at epoch boundaries, so self-improvement guarantees hold per epoch as the objective evolves across them. We begin by showing that even on verifiable coding tasks, the RQGM improves test pass rate over the prior SOTA by adding a complementary agent-as-a-judge code-review signal. This signal is cheaper and the RQGM uses 1.35x-1.72x fewer tokens. We then turn to scientific paper writing and reviewing, and Olympiad-level proof writing and grading, where the RQGM improves performance over prior self-improving agents: co-evolved writers reach 1.78x-1.86x higher acceptance rates under a diverse agent-as-a-judge panel, while co-evolved graders reach 9% higher ground-truth accuracy. In paper reviewing, the strongest baseline reviewer over-accepts AI-generated papers at up to 1.91x the human rate. The RQGM corrects this by introducing an adversarial objective that discovers reviewers equally stringent on AI and human work.
- Abstract(参考訳): 自己改善エージェントはエージェントコーディングベンチマークの最先端(SOTA)であり、最近一般的なドメインに拡張されている。
しかし、それらの検索手法は一般に固定評価基準(固定検証器、ベンチマーク、またはエージェントの改善とともに有効であるラベル付きデータセット)を仮定する。
これは進化の中心的な特徴を無視している: 種は環境が変化するにつれて適応する。
我々は、再帰的自己改善に同じ原則を導入し、改善ループの評価部分を作成し、静的ベンチマークを超える可能性のある進化的評価者、敵対的目標、動的ユーティリティーに探索を開放することを目指している。
非定常ユーティリティの下で再帰的自己改善のための進化的フレームワークであるRed Queen Godel Machine(RQGM)を紹介する。
検索はエポック内評価基準が固定されたエポックに編成され、ユーティリティはエポック境界で更新できるため、目的が進化するにつれて自己改善保証はエポック毎に保持される。
まず、検証可能な符号化タスクにおいても、RQGMは相補的なエージェント・アズ・ア・ジャッジ・コード・レビュー信号を追加することにより、以前のSOTAよりもテストパス率を向上することを示す。
この信号は安価で、RQGMは1.35x-1.72倍少ないトークンを使用する。
RQGMは従来の自己改善エージェントよりもパフォーマンスを向上し、共進化ライターは多様なエージェント・アズ・ア・ジャッジパネルの下で1.78x-1.86倍、共進化グレーダーは9%高いグランド・トゥルース精度に達する。
論文レビューにおいて、最強のベースラインレビュアーは、AI生成論文を最大1.91倍の人間率で過剰に受け入れている。
RQGMは、AIと人間の作業に等しく厳格なレビュアーを発見する敵の目標を導入することで、これを修正している。
関連論文リスト
- The Meta-Agent Challenge: Are Current Agents Capable of Autonomous Agent Development? [80.24951682268332]
本稿では,自律エージェント開発のためのフロンティアモデルのキャパシティをテストするための評価フレームワークであるMeta-Agent Challenge(MAC)を紹介する。
評価の整合性を確保するため、このフレームワークは報奨ハッキングに対する多層防御によって確保される。
メタエージェントは人間工学的な基本方針とほとんど一致せず、その一部はプロプライエタリなフロンティアモデルに支配されている。
論文 参考訳(メタデータ) (2026-06-03T04:58:17Z) - FRESCO: Benchmarking and Optimizing Re-rankers for Evolving Semantic Conflict in Retrieval-Augmented Generation [73.22935457705057]
時間的動的文脈における再ランカ評価のためのベンチマークであるFRESCOを紹介する。
レクエンシ検索クエリと過去のウィキペディアのリビジョンを組み合わせることで、FRESCOは、セマンティックな関連性を維持しながら、リランカが事実として最新の証拠を優先順位付けできるかどうかをテストする。
我々の評価では、既存の再ランカ間で一貫した障害モードが明らかになっている。
論文 参考訳(メタデータ) (2026-04-14T17:04:25Z) - Are we still able to recognize pearls? Machine-driven peer review and the risk to creativity: An explainable RAG-XAI detection framework with markers extraction [7.723181091241251]
本稿では、レビュー品質を評価し、自動パターンを検出するための説明可能なフレームワーク(RAG-XAI)を提案する。
XGBoost、Random Forest、LightGBMは99.61%、AUC-ROCは0.999以上、F1スコアは0.9925である。
論文 参考訳(メタデータ) (2026-04-09T08:25:49Z) - PaperRepro: Automated Computational Reproducibility Assessment for Social Science Papers [33.12402746591649]
PaperReproは、自動評価のための新しい2段階のマルチエージェントアプローチである。
実行段階では、エージェントが複製パッケージを実行し、コードを編集して再生結果を明示的な成果物としてキャプチャする。
評価段階では、エージェントは明確な証拠を用いてエージェントを評価する。
論文 参考訳(メタデータ) (2026-02-10T09:04:59Z) - R-Align: Enhancing Generative Reward Models through Rationale-Centric Meta-Judging [69.96389360650072]
解析精度は, 標準ラベルの精度を超えて, 下流RLHFの結果を高い精度で予測できることが示される。
我々は,金の判断でトレーニングを増強し,合理的アライメントを明示的に監督するR-Alignを提案する。
論文 参考訳(メタデータ) (2026-02-06T15:17:11Z) - A2Eval: Agentic and Automated Evaluation for Embodied Brain [26.357063836707223]
現在のVLMの評価は静的で専門家が定義し、手動で注釈付けされたベンチマークに依存している。
Agentic Automatic Evaluation (A2Eval)は、ベンチマークのキュレーションと2つの協調エージェントによる評価を自動化する最初のエージェントフレームワークである。
10のベンチマークと13のモデルで評価され、A2Evalは評価スイートを85%圧縮し、全体的な計算コストを77%削減し、4.6倍のスピードアップを提供する。
論文 参考訳(メタデータ) (2026-02-02T04:55:27Z) - RATE: Reviewer Profiling and Annotation-free Training for Expertise Ranking in Peer Review Systems [6.083097040417168]
LRベンチ(LR-bench)は,2024-2025のAI/NLP原稿を5段階の自己評価親和性評価で評価したベンチマークである。
また、レビュアーの最近の出版物をコンパクトなキーワードベースのプロファイルに抽出するレビュアー中心のランキングフレームワークであるRATEを提案する。
我々の手法は、常に最先端のパフォーマンスを達成し、明確なマージンで強力な埋め込みベースラインを上回ります。
論文 参考訳(メタデータ) (2026-01-27T14:13:46Z) - Alita-G: Self-Evolving Generative Agent for Agent Generation [54.49365835457433]
汎用エージェントをドメインエキスパートに変換するフレームワークであるALITA-Gを提案する。
このフレームワークでは、ジェネラリストエージェントが対象ドメインタスクのキュレートされたスイートを実行する。
計算コストを削減しながら、大きな利益を得ることができます。
論文 参考訳(メタデータ) (2025-10-27T17:59:14Z) - Holistic Agent Leaderboard: The Missing Infrastructure for AI Agent Evaluation [87.47155146067962]
数百のタスクで並列評価をオーケストレーションする,標準化された評価ハーネスを提供する。
モデル、足場、ベンチマークにまたがる3次元解析を行う。
私たちの分析では、ほとんどのランで精度を低下させる高い推論努力など、驚くべき洞察が示されています。
論文 参考訳(メタデータ) (2025-10-13T22:22:28Z) - RAG-Zeval: Towards Robust and Interpretable Evaluation on RAG Responses through End-to-End Rule-Guided Reasoning [64.46921169261852]
RAG-Zevalは、ルール誘導推論タスクとして忠実さと正しさの評価を定式化する、新しいエンドツーエンドフレームワークである。
提案手法は、強化学習による評価者を訓練し、コンパクトなモデルにより包括的および音質評価を生成する。
実験では、RAG-Zevalの優れた性能を示し、人間の判断と最も強い相関性を達成した。
論文 参考訳(メタデータ) (2025-05-28T14:55:33Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。