論文の概要: WhatWorkedBench: Benchmarking Experimental Understanding in AI Agents
- arxiv url: http://arxiv.org/abs/2609.27490v2
- Date: Mon, 28 Sep 2026 04:23:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-29 21:31:51.717867
- Title: WhatWorkedBench: Benchmarking Experimental Understanding in AI Agents
- Title(参考訳): WhatWorkedBench: AIエージェントの実験的理解のベンチマーク
- Abstract要約: WhatWorkedBenchは、取得、推論、プログラム構造、配信をリンクする。
カタログは、36のタスク条件、30のソース、8のワークフローファミリ、1248のインデックス付き構成レコードで構成されている。
- 参考スコア(独自算出の注目度): 0.7460935829208671
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: AI research agents must predict the effects of computational changes after budgeted experiments. WhatWorkedBench evaluates this experimental understanding through a delivered response surface of configuration scores. Agents inspect workflow code and buy measurements; exhaustive CPU references score conditional component effects, mean pair interactions, configuration choice, and delivery. The catalog spans 36 task conditions, 30 sources, 8 workflow families, and 1248 indexed configuration records, with 4,206 numerical controls. At eight purchased measurements plus two free anchors, pair-effect ridge selects an exact optimum on 15 of 22 sources; 13 of these cases have at least one conditional-effect error exceeding 10% of the task utility range. Shared-estimator comparisons measure acquisition and reconstruction on common observations. In a prospective typed study on 12 four-factor sources, DeepSeek Flash submits 12/12 direct tables and gains 0.147 recovery over a Gaussian process (GP) fitted to the same observations. Pro delivers 11/12 artifacts, with an all-attempt GP difference of -0.001 and a delivered-only difference of +0.063. On six prespecified new agent-evaluation sources, Flash and Pro gains are 0.149 and 0.074. In eight typed six-factor episodes, seven final tables satisfy verified code equivalences. Four fresh agents pass all six registered rules through named estimators and deliver consistent tables at 0.682 recovery versus 0.710 for separate direct-table runs. WhatWorkedBench links acquisition, inference, program structure, and delivery.
- Abstract(参考訳): AI研究エージェントは、予算実験後の計算変化の影響を予測しなければならない。
WhatWorkedBenchは、この実験的な理解を、構成スコアの応答面を通じて評価する。
エージェントはワークフローコードを検査し、測定値を購入する。徹底的なCPU参照は条件付きコンポーネント効果、平均ペアインタラクション、設定の選択、デリバリをスコアする。
このカタログは、36のタスク条件、30のソース、8のワークフローファミリ、1248のインデックス付き構成記録、および4,206の数値制御で構成されている。
8つの購入された測定値と2つのフリーアンカーで、ペアエフェクトリッジは22のソースのうち15の正確な最適値を選択する。
共有推定器の比較は、共通の観測に基づいて取得と再構成を測定する。
12の4要素ソースに関する先進的な型付け調査で、DeepSeek Flashは12/12の直接テーブルを提出し、同じ観測に適合したガウス過程(GP)上で0.147のリカバリを得た。
Proは11/12のアーティファクトを提供し、全方位GP差は-0.001、配信のみの差は+0.063である。
事前に特定された6つのエージェント評価ソースでは、FlashとProのゲインは0.149と0.074である。
8つの型付き6要素エピソードにおいて、7つの最終表が検証されたコード等価性を満たす。
4人の新入生エージェントが6つの登録済みのルールすべてに名前付き推定器を通し、0.682リカバリで一貫したテーブルを提供する。
WhatWorkedBenchは、取得、推論、プログラム構造、配信をリンクする。
関連論文リスト
- Greedy Decoding Is Not Precision-Invariant: Cross-Precision Output Divergence in LLM Inference [13.137699166830322]
大規模言語モデルからのグレディ復号は、一般に決定論的として扱われる。
同一のモデル,プロンプト,デコードアルゴリズムは同一のハードウェア上で,BF16とFP16の異なる出力を生成する。
実験により,22層に蓄積したボディーエラーは,浮動小数点数と浮動小数点数とを区別しないことがわかった。
論文 参考訳(メタデータ) (2026-09-22T15:54:16Z) - PersonaForge: Realistic Multi-Turn User Simulation for Agentic Systems [53.65117408512214]
我々は,現実的なマルチターンユーザ-エージェントインタラクションを合成するユーザシミュレーションフレームワークであるtextbfPersonaForgeを紹介した。
PersonaForgeを使って、6.3Kレコードのトレーニングデータセットと、手動で注釈付き138タスクベンチマークである textbfPersonaForge-Benchを構築します。
実験の結果、PersonaForgeのトレーニングでは、合成スコアが+4.1%向上し、4次元すべてで利得が得られた。
論文 参考訳(メタデータ) (2026-08-28T14:33:19Z) - AgentFAIR: A Multi-Agent Collaborative Framework for FAIRness Evaluation of Geospatial Datasets [4.193537335690018]
本稿では,構造抽出とサブプリンシプル固有評価器を組み合わせたマルチエージェントフレームワークであるAgentFAIRを提案する。
それぞれが0-3の成熟度スコア、エビデンス、レコメンデーションを生成します。
15データセットの専門家による予備的な研究では、フライスのカッパは0.71で、82%が専門家のコンセンサスと一致している。
論文 参考訳(メタデータ) (2026-07-17T09:32:54Z) - FDM: A Framework for Decision-making to build ML-based Malware detection systems [3.552368449344917]
本稿では,MLベースのマルウェア検出システムを構築するためのFDMフレームワークを提案する。
FDMは、9つの設定範囲にまたがる推奨事項に5つの運用パラメータをランク付けしている。
フレームワークを検証するために、3つのデータセットで4つの実験を行った。
論文 参考訳(メタデータ) (2026-06-05T04:21:22Z) - Amplifying, Not Learning: Fine-Tuned AI Text Detectors Amplify a Pretrained Direction [51.56484100374058]
テキスト検出器は、事前訓練された典型軸を増幅する。
タスク監督前の生エンコーダでは、3つのアーキテクチャでNYT-vs-HC3 AUROC 0.806/0.944/0.834を達成する。
RoBERTaベースでは、生のプロジェクションは微調整を超えるが、RoBERTaベースでは、フル微調整は、試験された流線型人口の双方で生よりも識別を小さくする。
論文 参考訳(メタデータ) (2026-05-20T19:08:38Z) - Multi-Dimensional Behavioral Evaluation of Agentic Stock Prediction Systems Using Large Language Model Judges with Closed-Loop Reinforcement Learning Feedback [1.2362187555287152]
ファイナンスにおける予測評価は、ポイント予測エラーに基づく集計精度測定と予測精度テストに依存している。
本稿では,中間決定プロセス自体を評価することによって,精度試験を補完する行動予測評価手法を提案する。
論文 参考訳(メタデータ) (2026-05-07T06:31:34Z) - Towards a Science of Scaling Agent Systems [79.64446272302287]
エージェント評価の定義を定式化し,エージェント量,コーディネーション構造,モデル,タスク特性の相互作用として,スケーリング法則を特徴付ける。
協調指標を用いて予測モデルを導出し,R2=0をクロスバリデーションし,未知のタスク領域の予測を可能にする。
ツールコーディネーショントレードオフ: 固定的な計算予算の下では, ツールヘビータスクはマルチエージェントのオーバーヘッドから不均衡に悩まされ, 2) 能力飽和: 調整が減少または負のリターンを, 単一エージェントのベースラインが45%を超えると達成できる。
論文 参考訳(メタデータ) (2025-12-09T06:52:21Z) - Chest x-ray automated triage: a semiologic approach designed for
clinical implementation, exploiting different types of labels through a
combination of four Deep Learning architectures [83.48996461770017]
本研究では,異なる畳み込みアーキテクチャの後期融合に基づく深層学習手法を提案する。
公開胸部x線画像と機関アーカイブを組み合わせたトレーニングデータセットを4つ構築した。
4つの異なるディープラーニングアーキテクチャをトレーニングし、それらのアウトプットとレイトフュージョン戦略を組み合わせることで、統一されたツールを得ました。
論文 参考訳(メタデータ) (2020-12-23T14:38:35Z) - Automatic sleep stage classification with deep residual networks in a
mixed-cohort setting [63.52264764099532]
我々は,大規模コホートの一般化性を評価するために,新しいディープニューラルネットワークモデルを開発した。
総合的な分類精度はトレーニングデータの分数を増やして向上した。
論文 参考訳(メタデータ) (2020-08-21T10:48:35Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。