論文の概要: Automating and Scaling Behavioral Scientific Research on AI Agents
- arxiv url: http://arxiv.org/abs/2608.10030v2
- Date: Sat, 15 Aug 2026 23:17:28 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-18 19:59:03.024299
- Title: Automating and Scaling Behavioral Scientific Research on AI Agents
- Title(参考訳): AIエージェントにおける行動科学的研究の自動化とスケーリング
- Abstract要約: AEROBATはAIエージェントの行動科学的研究を自動化する最初のマルチエージェントシステムである。
AEROBATは、ユーザーによって任意の標的行動が与えられると、行動科学的研究の完全なパイプラインを自動的に実行します。
- 参考スコア(独自算出の注目度): 36.703207109917074
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: As AI agents are increasingly deployed in complex environments, understanding their behaviors becomes critical. Yet behavioral scientific research on AI agents remains manual and labor-intensive. We introduce AEROBAT, the first multi-agent system to automate behavioral scientific research on AI agents. Given an arbitrary target behavior by its user, AEROBAT automatically executes a full pipeline of behavioral scientific research---generating hypotheses about the behavior, designing and executing controlled experiments, making behavioral assessments, analyzing the results, and writing reports. For 12 target behaviors, we used AEROBAT to generate and test 73 hypotheses: designing 1,160 controlled experiments and executing 22,954 simulation rounds in total. Moderate-to-strong statistical evidence was found for 30 hypotheses, including some novel ones. In sum, our results demonstrate that automated behavioral scientific research on AI agents can complement and extend the reach of manual research.
- Abstract(参考訳): AIエージェントが複雑な環境にますますデプロイされるにつれて、その振る舞いを理解することが重要になる。
しかし、AIエージェントに関する行動科学的研究は手作業と労働集約的なままである。
AEROBATはAIエージェントの行動科学的研究を自動化する最初のマルチエージェントシステムである。
AEROBATはユーザーによって任意の行動が与えられた場合、行動科学的研究の完全なパイプラインを自動的に実行し、行動に関する仮説を生成、制御された実験を設計、実行し、行動評価を行い、結果を分析し、レポートを書く。
AEROBATを用いて73の仮説を生成・検証した: 1,160の制御された実験を設計し、合計22,954回のシミュレーションラウンドを実行した。
厳密な統計的証拠は、新しいものを含む30の仮説で発見された。
まとめると、AIエージェントに関する行動科学的自動研究は、手作業による研究の範囲を補完し、拡張することができることを示す。
関連論文リスト
- Benchmarking AI Agents for Addressing Scientific Challenges Across Scales [118.2204632627895]
SciAgentArenaは、現実世界の科学研究シナリオでAIエージェントを評価するための体系的なベンチマークである。
ステップワイズ検証を備えた約200のタスクと、多様なAIエージェントを評価するためのインタラクティブでエージェントに依存しない環境で構成される。
タスク構造や評価基準が明確である場合, 現状のエージェントはデータ分析に効果的に貢献できることがわかった。
論文 参考訳(メタデータ) (2026-06-10T22:55:30Z) - Beyond One-shot: AI Agents for Learning in Field Experiments [1.8135456588838779]
ツール強化エージェントAIが実験データから自動的に学習し、新たな介入を生成できるかどうかを検討する。
我々の研究は、ツール強化AIが実験データから学習し、改善されたドメイン関連介入を生成することを示している。
論文 参考訳(メタデータ) (2026-06-01T16:30:42Z) - AutoScientists: Self-Organizing Agent Teams for Long-Running Scientific Experimentation [28.790523063833376]
AutoScientistsは、長期的な計算科学実験のためのAIエージェントの分散チームである。
エージェントは共有された実験状態を解釈し、実験計算を使用する前に、有望な仮説、批判的な提案に関するチームに自己組織化する。
一致した実験予算の下で、AutoScientistsは、バイオメディカル機械学習、言語モデルトレーニング最適化、タンパク質の適合性予測など、AIエージェントを改良する。
論文 参考訳(メタデータ) (2026-05-27T15:56:12Z) - The Story is Not the Science: Execution-Grounded Evaluation of Mechanistic Interpretability Research [56.80927148740585]
我々は、動的に進化し、研究評価者としてAIエージェントを開発することで、スケーラビリティと厳密さの課題に対処する。
我々は,機械的解釈可能性の研究をテストベッドとして使用し,標準化された研究成果を構築し,MechEvalAgentを開発した。
我々の研究は、AIエージェントが研究評価を変革し、厳格な科学的実践の道を開く可能性を実証している。
論文 参考訳(メタデータ) (2026-02-05T19:00:02Z) - AstaBench: Rigorous Benchmarking of AI Agents with a Scientific Research Suite [75.58737079136942]
本稿では,AstaBenchについて紹介する。AstaBenchは,科学的研究を行うためのエージェント能力の総合的な測定を行うスイートである。
私たちのスイートには、プロダクショングレードの検索ツールを備えた、最初の科学研究環境が付属しています。
22のエージェントクラスで57のエージェントを評価したところ,いくつかの興味深い結果が得られた。
論文 参考訳(メタデータ) (2025-10-24T17:10:26Z) - LIMI: Less is More for Agency [49.63355240818081]
LIMI(Less Is More for Intelligent Agency)は、機関が根本的に異なる開発原則に従うことを示す。
高度なエージェント・インテリジェンスは、最小でも戦略的にキュレートされた自律行動のデモンストレーションから生まれる可能性がある。
マシンの自律性はデータの豊富さではなく、高品質なエージェント実証の戦略的キュレーションから生まれる。
論文 参考訳(メタデータ) (2025-09-22T10:59:32Z) - Autonomous Microscopy Experiments through Large Language Model Agents [4.241267255764773]
大規模言語モデル(LLM)は、材料研究のための自己運転実験室(SDL)に革命をもたらしている。
LLM駆動エージェントによる原子間力顕微鏡の自動化フレームワークであるArtificially Intelligent Lab Assistant (AILA)を紹介する。
アートモデルの現状が,基本的なタスクや調整シナリオに苦労していることに気付きました。
論文 参考訳(メタデータ) (2024-12-18T09:35:28Z) - AIGS: Generating Science from AI-Powered Automated Falsification [17.50867181053229]
本稿では,重要な研究プロセスを代表する役割を担ったマルチエージェントシステムである,フルプロセスAIGSシステムのベビーステップとして,Baby-AIGSを提案する。
3つのタスクの実験では、Baby-AIGSは経験豊富な人間の研究者と同等ではないが、有意義な科学的発見を産み出すことができた。
論文 参考訳(メタデータ) (2024-11-17T13:40:35Z) - Generative Agent Simulations of 1,000 People [56.82159813294894]
本稿では,1,052人の実人の態度と行動をシミュレートする新しいエージェントアーキテクチャを提案する。
生成エージェントは一般社会調査の参加者の回答を85%の精度で再現する。
我々のアーキテクチャは、人種的およびイデオロギー的グループにおける正確さのバイアスを、人口統計学的記述のエージェントと比較して低減する。
論文 参考訳(メタデータ) (2024-11-15T11:14:34Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。