論文の概要: Bad Genius: Counterfactual-Guided Harness Evolution Beyond Task-Specific Shortcuts
- arxiv url: http://arxiv.org/abs/2609.18366v3
- Date: Thu, 24 Sep 2026 07:59:20 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-25 21:10:09.253124
- Title: Bad Genius: Counterfactual-Guided Harness Evolution Beyond Task-Specific Shortcuts
- Title(参考訳): Bad Genius:タスクに特有なショートカットを超越した非現実的ハーネス進化
- Abstract要約: 本稿では,有効な反現実的ベンチマークに対する制約生成として,Hergent Evolutionを活用可能なCASE(Courerfactual Harness Search and Evolution)を提案する。
我々はCHASEをSyn-LedgerおよびOfficeQA上で評価し、CHASEは強力なリリースベンチマークゲインを維持しつつ、有効なプロトコル変換の下でのゲイン破壊を大幅に低減する。
- 参考スコア(独自算出の注目度): 4.3073010448091695
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Reliable agent evaluation is complicated by automatic harness optimization, which repeatedly uses a released benchmark $B_{\mathrm{rel}}$ to guide a Proposer that edits prompts, memory, retrieval, tools, and control code around a fixed foundation model. Task holdout is commonly used to guard against harness overfitting. It varies semantic tasks but leaves the benchmark protocol fixed, so a bad genius Proposer can produce a cheating harness whose improvement over the initial harness on $B_{\mathrm{rel}}$ depends on a benchmark-wide shortcut. We introduce Counterfactual Harness Search and Evolution (CHASE), which casts harness evolution as constraint generation over valid counterfactual benchmarks. After each Proposer update, a Challenger searches for an executable protocol transformation with large gain destruction. A validity firewall checks that task semantics are preserved, while a held-out confirmation set determines whether the counterfactual enters a finite archive. We formalize an ideal shortcut-neutralized benchmark $B_0$ and establish theoretical guarantees linking finite counterfactual archives to $B_0$ and characterizing sequential Challenger search. We evaluate CHASE on Syn-Ledger and OfficeQA, where CHASE retains strong released-benchmark gains while substantially reducing gain destruction under valid protocol transformations.
- Abstract(参考訳): 信頼性のあるエージェント評価は、自動ハーネス最適化によって複雑になる。これはリリース済みのベンチマークである$B_{\mathrm{rel}}$を使って、固定基盤モデルの周りのプロンプト、メモリ、検索、ツール、制御コードを編集するProposerをガイドする。
タスクホールドアウトは、ハーネスオーバーフィッティングを防ぐために一般的に使用される。
セマンティックなタスクは異なるが、ベンチマークプロトコルは固定されているため、悪い天才Proposerは、ベンチマーク全体のショートカットに依存する$B_{\mathrm{rel}}$の最初のハーネスよりも改善された不正なハーネスを生成することができる。
本稿では,有効な反現実的ベンチマークに対する制約生成として,Hergent Evolutionを活用可能なCASE(Courerfactual Harness Search and Evolution)を提案する。
Proposerのアップデート毎に、Challengerは大きなゲイン破壊を伴う実行可能なプロトコル変換を検索する。
有効ファイアウォールはタスクのセマンティクスが保存されていることをチェックし、ホールドアウト確認セットは、カウンターファクトアルが有限アーカイブに入るかどうかを判定する。
理想的なショートカットニュートラル化ベンチマークである$B_0$を定式化し、有限反事実アーカイブを$B_0$にリンクし、シーケンシャルなチャレンジャー検索を特徴付ける理論的保証を確立する。
我々はCHASEをSyn-LedgerおよびOfficeQA上で評価し、CHASEは強力なリリースベンチマークゲインを維持しつつ、有効なプロトコル変換の下でのゲイン破壊を大幅に低減する。
関連論文リスト
- Adaptive Critical Token-Aware Retrieval for Repository-Level Code Generation [53.85136813868056]
ACToRは、リポジトリレベルのコード生成のための適応型クリティカルトークン対応検索フレームワークである。
我々は、ACToRが、リポジトリレベルのベンチマークにおいて、最先端のメソッドを一貫して上回っていることを示す。
論文 参考訳(メタデータ) (2026-09-01T17:59:39Z) - HarnessEvolve: Learning from Reference Trajectories for Reliable Agent Self-Evolution [11.431479238875712]
我々は、信頼できるエージェントの自己進化を実現するために、参照軌道から学習する自己進化フレームワークであるHarnessEvolveを紹介する。
私たちは、さまざまなモデルとエージェントフレームワークを使用して、オープンドメインとエンタープライズシナリオにまたがるいくつかのベンチマークで広範な実験を行います。
結果は、HarnessEvolveがすべてのベンチマークと設定で、最先端のベースラインを一貫して上回っていることを示している。
論文 参考訳(メタデータ) (2026-09-01T07:31:18Z) - The Order Is the Guarantee: Verifier-Budgeted Code Deletion with Static-First Learned Proposals [12.095189927690988]
本稿では,Al系が実行検証能力が有限である場合,コードを削除する方法の逆問題について検討する。
提案スケジューリングとして冗長コード削減を定式化する。
スケジューリングが検索を司る一方で、テストスイートのみが"保存行動"の意味を司ることを示す。
論文 参考訳(メタデータ) (2026-08-05T09:16:29Z) - Partial Contracts Suffice: Sound, LLM-Inferred Regression Verification [7.004725450780227]
本稿では,契約に基づく回帰検証ツールについて紹介する。
契約の健全性は、すべての関数バージョンが振舞いと一致することを証明することによって保証される。
完全な振る舞い仕様ではなく、部分的かつ呼び出し側対応の契約で十分かどうかを問う。
論文 参考訳(メタデータ) (2026-07-11T12:40:22Z) - TTHE: Test-Time Harness Evolution [50.26245555541721]
既存のアプローチでは、デプロイ前、トレーニング前、あるいはテスト時に凍結される固定されたエージェントワークフローの開発データを最適化する。
我々は、エージェントがテスト入力で生成するラベルのない実行トレースのみを使用して、評価自体にハーネスを最適化できるかどうかを問う。
評価中、TTHEは候補ハーネスの人口を維持し、それらの実行トレースの理由をエージェントプロジェクタを通じてそれらを洗練する。
その後、審査員は実行元プロキシ信号から改善されたハーネスをコミットし、選択したプログラムは継続してその後の入力を統治する。
論文 参考訳(メタデータ) (2026-07-09T05:53:39Z) - FRESCO: Benchmarking and Optimizing Re-rankers for Evolving Semantic Conflict in Retrieval-Augmented Generation [73.22935457705057]
時間的動的文脈における再ランカ評価のためのベンチマークであるFRESCOを紹介する。
レクエンシ検索クエリと過去のウィキペディアのリビジョンを組み合わせることで、FRESCOは、セマンティックな関連性を維持しながら、リランカが事実として最新の証拠を優先順位付けできるかどうかをテストする。
我々の評価では、既存の再ランカ間で一貫した障害モードが明らかになっている。
論文 参考訳(メタデータ) (2026-04-14T17:04:25Z) - Runtime Execution Traces Guided Automated Program Repair with Multi-Agent Debate [8.424102114588559]
自動プログラム修復(APR)は複雑なロジックエラーとサイレント障害に悩まされる。
現在のLLMベースのAPRメソッドは主に静的であり、ソースコードと基本的なテスト出力に依存している。
我々は、パッチ検証のための共有制約としてランタイム事実を活用するマルチエージェントフレームワークであるTraceRepairを提案する。
論文 参考訳(メタデータ) (2026-04-03T02:23:25Z) - RealSec-bench: A Benchmark for Evaluating Secure Code Generation in Real-World Repositories [58.32028251925354]
LLM(Large Language Models)は、コード生成において顕著な能力を示しているが、セキュアなコードを生成する能力は依然として重要で、未調査の領域である。
我々はRealSec-benchを紹介します。RealSec-benchは、現実世界の高リスクなJavaリポジトリから慎重に構築されたセキュアなコード生成のための新しいベンチマークです。
論文 参考訳(メタデータ) (2026-01-30T08:29:01Z) - DeRAG: Black-box Adversarial Attacks on Multiple Retrieval-Augmented Generation Applications via Prompt Injection [0.9499594220629591]
アドリシャル・プロンプト・アタックは、レトリーバル・アフュージョンド・ジェネレーション(RAG)システムの信頼性を大きく変える可能性がある。
本稿では, RAGに基づく質問応答に対して, 対角的プロンプト接尾辞を最適化するために, 微分進化(DE)を適用した新しい手法を提案する。
論文 参考訳(メタデータ) (2025-07-20T16:48:20Z) - COIN: Uncertainty-Guarding Selective Question Answering for Foundation Models with Provable Risk Guarantees [51.5976496056012]
COINは、統計的に有効な閾値を校正し、質問毎に1つの生成された回答をフィルタリングする不確実性保護選択フレームワークである。
COINはキャリブレーションセット上で経験的誤差率を推定し、信頼区間法を適用して真誤差率に高い確率上界を確立する。
リスク管理におけるCOINの堅牢性,許容回答を維持するための強いテストタイムパワー,キャリブレーションデータによる予測効率を実証する。
論文 参考訳(メタデータ) (2025-06-25T07:04:49Z) - SolBench: A Dataset and Benchmark for Evaluating Functional Correctness in Solidity Code Completion and Repair [51.0686873716938]
コード補完モデルによって生成されたSolidityスマートコントラクトの機能的正しさを評価するベンチマークであるSolBenchを紹介する。
本稿では,スマートコントラクトの機能的正当性を検証するための検索拡張コード修復フレームワークを提案する。
その結果、コード修復と検索技術は、計算コストを削減しつつ、スマートコントラクト完了の正しさを効果的に向上することを示した。
論文 参考訳(メタデータ) (2025-03-03T01:55:20Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。