論文の概要: Can AI Scientists Coordinate at Runtime?
- arxiv url: http://arxiv.org/abs/2610.00980v1
- Date: Thu, 01 Oct 2026 03:18:07 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 01:19:23.875407
- Title: Can AI Scientists Coordinate at Runtime?
- Title(参考訳): AIサイエンティストは実行時に調整できるか?
- Abstract要約: 我々はエージェントコーディネーション(RAC)を導入し、実行中に既存のAI科学者ホストからエージェントを選択する。
RACはスコープ化された作業契約を割り当て、アーティファクト的な検証を提供する。
我々は,ResearchClawBenchのエージェントラボ,エボサイディスト,ARKを対象に,単一種探索実験を行った。
- 参考スコア(独自算出の注目度): 16.07223486176944
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Multi-agent AI scientists have shown improving performance across a diverse range of tasks. Yet a common approach is design-time agentic orchestration, which typically relies on fixed workflows. In contrast, human scientists coordinate and adjust their division of labor at runtime. We therefore ask: can AI scientists also coordinate at runtime? To this end, we introduce Runtime Agent Coordination (RAC), which selects agents from existing AI-scientist hosts during execution, assigns scoped work contracts, and provides artifact-grounded verification. Verification informs subsequent agents without blocking transitions or discarding artifacts. We conduct a single-seed exploratory evaluation across Agent Laboratory, EvoScientist, and ARK on ResearchClawBench, preserving host models, tools, and permissions under host-calibrated budgets. Four cumulative conditions separate native execution, runtime communication, runtime selection, and the combined addition of contracts and verification. Runtime selection yields the highest observed mean score for each host; adding contracts and verification reduces these means, with host-dependent outcomes relative to native execution. These results motivate runtime coordination while exposing the limits of additional coordination mechanisms under constrained budgets. Code is available at https://github.com/systemind-team/Runtime-AI-Scientist.
- Abstract(参考訳): マルチエージェントAI科学者は、さまざまなタスクでパフォーマンスを改善することを示した。
しかし、一般的なアプローチは設計時のエージェントオーケストレーションであり、通常は固定ワークフローに依存します。
対照的に、人間の科学者は実行時に労働の分業を調整・調整します。
AI科学者も実行時に調整できますか?
この目的のために、実行中に既存のAI科学者ホストからエージェントを選択し、スコープ化された作業契約を割り当て、アーティファクトグラウンドの検証を提供する実行時エージェントコーディネーション(RAC)を導入する。
検証は、遷移をブロックしたり、アーティファクトを破棄することなく、後続のエージェントに通知する。
我々は、ホストモデル、ツール、パーミッションをホスト校正予算下で保存し、エージェントラボ、エボサイシスト、ARKに対して単一種探索評価を行い、ResearchClawBench上で実施する。
4つの累積条件は、ネイティブ実行、ランタイム通信、ランタイム選択、およびコントラクトと検証の組み合わせを分離する。
実行時選択は各ホストで観測される平均スコアが最も高く、コントラクトの追加と検証により、ネイティブ実行と比較してホスト依存の結果が減少する。
これらの結果は、制約された予算の下で追加の調整機構の限界を明らかにしながら、実行時の調整を動機付けます。
コードはhttps://github.com/systemind-team/Runtime-AI-Scientistで入手できる。
関連論文リスト
- Agensh: Scaling Organizational Intelligence to 1,024 Agents [85.08934183130329]
Agenshは、中央のオーケストレータを持たないスケーラブルな自己組織化マルチエージェントハーネスである。
GPT-5.6-sol を用いて,最も難しい ProgramBench タスクを5つ評価した。
1から128エージェントへのスケーリングでは、最終テストパス率は19.31%から28.78%に上昇する。
パンドックでは、1から1,024のエージェントが最終テストパスレートを33.89%から55.06%に引き上げる。
論文 参考訳(メタデータ) (2026-09-22T17:56:25Z) - Benchmarking Open-Ended Multi-Agent Coordination in Language Agents [48.1363632826625]
Alemは、手続き的に生成されたコーディネーションタスク、ソフトな特殊化、コミュニケーション、制御可能なコーディネーションの難しさを、長い水平サバイバルの世界に埋め込む。
Craftaxライクなダイナミックス上に構築されたオープンなマルチエージェント協調のためのJAXベースのベンチマークである$alem$を紹介します。
論文 参考訳(メタデータ) (2026-06-06T21:13:43Z) - Code as Agent Harness [107.31925305395957]
新興のエージェントシステムでは、コードはもはや単なる目標出力ではない。
コードはエージェントの推論、行動、環境モデリング、実行ベースの検証のための運用上の基盤としてますます役立っている。
この調査は、実行可能、検証可能、ステートフルなAIエージェントシステムに向けた統一されたロードマップを提供する。
論文 参考訳(メタデータ) (2026-05-18T17:59:03Z) - From Prompts to Protocols: An AI Agent for Laboratory Automation [1.9609766210591626]
大規模な言語モデルと実験室オーケストレーションを統合したAIエージェントアーキテクチャを提案する。
AIエージェントは、自動検証とエラー訂正を備えたエージェントループの下で動作する。
プロトコルの作成、両方のプロトコルの実行と監視、クローズドループ最適化キャンペーンなど、完全な実験ライフサイクルをサポートする。
論文 参考訳(メタデータ) (2026-05-15T18:52:41Z) - If You Want Coherence, Orchestrate a Team of Rivals: Multi-Agent Models of Organizational Intelligence [1.1637186977447433]
完全コンポーネントを得ることなく、不完全なコンポーネントを慎重にオーケストレーションすることで信頼性を実現することができることを示す。
本稿では,このようなシステムのアーキテクチャについて述べる。特殊エージェントチーム(プランナ,実行者,評論家,専門家)。
提案手法は,ユーザの露出前に90%以上の内部エラーインターセプションを達成し,許容可能なレイテンシトレードオフを維持していることを示す。
論文 参考訳(メタデータ) (2026-01-20T17:19:09Z) - Code with Me or for Me? How Increasing AI Automation Transforms Developer Workflows [60.04362496037186]
本研究は,コーディングエージェントと開発者インタラクションを制御した最初の研究である。
我々は,2つの主要な協調型およびエージェント型符号化アシスタントの評価を行った。
結果から,エージェントはコピロトを超える方法で開発者を支援することができることがわかった。
論文 参考訳(メタデータ) (2025-07-10T20:12:54Z) - When Disagreements Elicit Robustness: Investigating Self-Repair Capabilities under LLM Multi-Agent Disagreements [56.29265568399648]
我々は、不一致が早期のコンセンサスを防ぎ、探索されたソリューション空間を拡張することを主張する。
タスククリティカルなステップの相違は、ソリューションパスのトポロジによってコラボレーションを損なう可能性がある。
論文 参考訳(メタデータ) (2025-02-21T02:24:43Z) - Cocoa: Co-Planning and Co-Execution with AI Agents [31.695129948650287]
我々は、AIエージェントとのコラボレーションのための新しいデザインパターン(インタラクティブプラン)を導入するシステムであるCocoaを紹介する。
Cocoaは、計算ノートやドキュメントエディタからのインタラクション設計に基づいて、フレキシブルなエージェンシーデリゲートをサポートする。
サンプルドメインとして科学的研究を用いて、我々の研究室と現場での展開調査により、Cocoaは使いやすさを犠牲にすることなく、エージェントのステアビリティを改善した。
論文 参考訳(メタデータ) (2024-12-14T23:59:42Z) - ChatCollab: Exploring Collaboration Between Humans and AI Agents in Software Teams [1.3967206132709542]
ChatCollabの斬新なアーキテクチャは、エージェント(人間またはAI)が任意の役割でコラボレーションに参加することを可能にする。
ソフトウェアエンジニアリングをケーススタディとして使用することで、私たちのAIエージェントが彼らの役割と責任をうまく特定できることが分かりました。
ソフトウェア開発のための従来の3つのマルチエージェントAIシステムに関連して、ChatCollab AIエージェントはインタラクティブなゲーム開発タスクにおいて、同等またはより良いソフトウェアを生成する。
論文 参考訳(メタデータ) (2024-12-02T21:56:46Z) - ProAgent: Building Proactive Cooperative Agents with Large Language
Models [89.53040828210945]
ProAgentは、大規模な言語モデルを利用してプロアクティブエージェントを生成する新しいフレームワークである。
ProAgentは現状を分析し、チームメイトの意図を観察から推測することができる。
ProAgentは高度なモジュール化と解釈可能性を示し、様々な調整シナリオに容易に統合できる。
論文 参考訳(メタデータ) (2023-08-22T10:36:56Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。