論文の概要: WhatWorkedBench: Benchmarking Experimental Understanding in AI Agents
- arxiv url: http://arxiv.org/abs/2609.27490v1
- Date: Wed, 23 Sep 2026 07:49:24 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-25 00:05:17.936994
- Title: WhatWorkedBench: Benchmarking Experimental Understanding in AI Agents
- Title(参考訳): WhatWorkedBench: AIエージェントの実験的理解のベンチマーク
- Abstract要約: 我々は、AI研究エージェントの実験的理解を測定するためにWhatWorkedBenchを紹介した。
WhatWorkedBenchは、実験エージェントの研究、適応的な実験設計、数値推論、プログラム構造の利用をサポートする。
- 参考スコア(独自算出の注目度): 0.7460935829208671
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: AI research agents need reliable knowledge of how their experiments change outcomes. We introduce WhatWorkedBench to measure experimental understanding, the accuracy of predictions about component changes after budgeted experimentation. Agents inspect code, select measurements, and submit a response surface, a table predicting scores for every configuration of component settings. Exhaustive CPU execution supplies reference effects for changing each component while holding the others fixed. These effects capture combinations of changes across 36 tasks from 30 data sources and 8 workflow types, with 1248 configuration records. Core evaluation combines 4,206 numerical-control records across all eight families and 108 agent episodes across the original six. At eight new measurements, pair-effect ridge selects an optimum on 15 of 22 sources and limits every effect error to 10% of score range on three. Fitting a Gaussian process (GP) to the same agent observations raises effect recovery, accuracy relative to true effect magnitude, from 0.632 to 0.698 in the original Flash cohort and from 0.621 to 0.720 in an additional cohort. On six completed beat-detection and graph submissions, the same-observation GP raises family-macro recovery from 0.303 to 0.455. On six workflows with six binary options at 20 new measurements, encoding code equivalences, configurations with identical behavior, raises GP recovery from 0.248 to 0.462. WhatWorkedBench supports research on experimental agents, adaptive experimental design, numerical inference, and use of program structure.
- Abstract(参考訳): AI研究エージェントは、実験が結果をどのように変えるかについて、信頼できる知識を必要とする。
我々は,WhatWorkedBenchを導入して,実験の理解度,予算化実験後の成分変化の予測精度を計測する。
エージェントはコードを検査し、測定を選択し、レスポンスサーフェスを送信し、コンポーネントの設定ごとにスコアを予測する。
排他的CPU実行は、他のコンポーネントを固定しながら各コンポーネントを変更するための参照エフェクトを提供する。
これらのエフェクトは、30のデータソースと8つのワークフロータイプから、36タスク間の変更の組み合わせをキャプチャする。
コア評価は、8つのファミリーすべてに4,206の数値制御記録と、元の6つのエピソードに108のエージェントエピソードが組み合わされている。
8つの新しい測定で、ペアエフェクトリッジは22のソースのうち15の最適値を選択し、すべての効果誤差を3つのスコア範囲の10%に制限する。
ガウス過程(GP)を同じエージェントの観察に合わせると、効果回復、真の効果の大きさに対する精度、元のフラッシュコホートでは0.632から0.698、追加コホートでは0.621から0.720に上昇する。
6つの完了したビート検出とグラフの提出により、同観測のGPは0.303から0.455に回復する。
20の新しい測定値で6つのバイナリオプションを持つ6つのワークフローでは、コード等価性、同一の振る舞いを持つ構成がGPリカバリを0.248から0.462に引き上げている。
WhatWorkedBenchは、実験エージェントの研究、適応的な実験設計、数値推論、プログラム構造の利用をサポートする。
関連論文リスト
- Greedy Decoding Is Not Precision-Invariant: Cross-Precision Output Divergence in LLM Inference [13.137699166830322]
大規模言語モデルからのグレディ復号は、一般に決定論的として扱われる。
同一のモデル,プロンプト,デコードアルゴリズムは同一のハードウェア上で,BF16とFP16の異なる出力を生成する。
実験により,22層に蓄積したボディーエラーは,浮動小数点数と浮動小数点数とを区別しないことがわかった。
論文 参考訳(メタデータ) (2026-09-22T15:54:16Z) - PersonaForge: Realistic Multi-Turn User Simulation for Agentic Systems [53.65117408512214]
我々は,現実的なマルチターンユーザ-エージェントインタラクションを合成するユーザシミュレーションフレームワークであるtextbfPersonaForgeを紹介した。
PersonaForgeを使って、6.3Kレコードのトレーニングデータセットと、手動で注釈付き138タスクベンチマークである textbfPersonaForge-Benchを構築します。
実験の結果、PersonaForgeのトレーニングでは、合成スコアが+4.1%向上し、4次元すべてで利得が得られた。
論文 参考訳(メタデータ) (2026-08-28T14:33:19Z) - AgentFAIR: A Multi-Agent Collaborative Framework for FAIRness Evaluation of Geospatial Datasets [4.193537335690018]
本稿では,構造抽出とサブプリンシプル固有評価器を組み合わせたマルチエージェントフレームワークであるAgentFAIRを提案する。
それぞれが0-3の成熟度スコア、エビデンス、レコメンデーションを生成します。
15データセットの専門家による予備的な研究では、フライスのカッパは0.71で、82%が専門家のコンセンサスと一致している。
論文 参考訳(メタデータ) (2026-07-17T09:32:54Z) - FDM: A Framework for Decision-making to build ML-based Malware detection systems [3.552368449344917]
本稿では,MLベースのマルウェア検出システムを構築するためのFDMフレームワークを提案する。
FDMは、9つの設定範囲にまたがる推奨事項に5つの運用パラメータをランク付けしている。
フレームワークを検証するために、3つのデータセットで4つの実験を行った。
論文 参考訳(メタデータ) (2026-06-05T04:21:22Z) - Amplifying, Not Learning: Fine-Tuned AI Text Detectors Amplify a Pretrained Direction [51.56484100374058]
テキスト検出器は、事前訓練された典型軸を増幅する。
タスク監督前の生エンコーダでは、3つのアーキテクチャでNYT-vs-HC3 AUROC 0.806/0.944/0.834を達成する。
RoBERTaベースでは、生のプロジェクションは微調整を超えるが、RoBERTaベースでは、フル微調整は、試験された流線型人口の双方で生よりも識別を小さくする。
論文 参考訳(メタデータ) (2026-05-20T19:08:38Z) - Multi-Dimensional Behavioral Evaluation of Agentic Stock Prediction Systems Using Large Language Model Judges with Closed-Loop Reinforcement Learning Feedback [1.2362187555287152]
ファイナンスにおける予測評価は、ポイント予測エラーに基づく集計精度測定と予測精度テストに依存している。
本稿では,中間決定プロセス自体を評価することによって,精度試験を補完する行動予測評価手法を提案する。
論文 参考訳(メタデータ) (2026-05-07T06:31:34Z) - Towards a Science of Scaling Agent Systems [79.64446272302287]
エージェント評価の定義を定式化し,エージェント量,コーディネーション構造,モデル,タスク特性の相互作用として,スケーリング法則を特徴付ける。
協調指標を用いて予測モデルを導出し,R2=0をクロスバリデーションし,未知のタスク領域の予測を可能にする。
ツールコーディネーショントレードオフ: 固定的な計算予算の下では, ツールヘビータスクはマルチエージェントのオーバーヘッドから不均衡に悩まされ, 2) 能力飽和: 調整が減少または負のリターンを, 単一エージェントのベースラインが45%を超えると達成できる。
論文 参考訳(メタデータ) (2025-12-09T06:52:21Z) - Chest x-ray automated triage: a semiologic approach designed for
clinical implementation, exploiting different types of labels through a
combination of four Deep Learning architectures [83.48996461770017]
本研究では,異なる畳み込みアーキテクチャの後期融合に基づく深層学習手法を提案する。
公開胸部x線画像と機関アーカイブを組み合わせたトレーニングデータセットを4つ構築した。
4つの異なるディープラーニングアーキテクチャをトレーニングし、それらのアウトプットとレイトフュージョン戦略を組み合わせることで、統一されたツールを得ました。
論文 参考訳(メタデータ) (2020-12-23T14:38:35Z) - Automatic sleep stage classification with deep residual networks in a
mixed-cohort setting [63.52264764099532]
我々は,大規模コホートの一般化性を評価するために,新しいディープニューラルネットワークモデルを開発した。
総合的な分類精度はトレーニングデータの分数を増やして向上した。
論文 参考訳(メタデータ) (2020-08-21T10:48:35Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。