論文の概要: MADE: Belief-Driven Dual-Agent Coordination for Autonomous Model Deployment
- arxiv url: http://arxiv.org/abs/2608.01189v1
- Date: Sun, 02 Aug 2026 12:14:43 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:25.114998
- Title: MADE: Belief-Driven Dual-Agent Coordination for Autonomous Model Deployment
- Title(参考訳): MADE: 自律的なモデル展開のための信念駆動のデュアルエージェントコーディネーション
- Abstract要約: LLMベースのエージェントはドメイン固有のタスクに苦労し、外部ツールの統合を動機付けている。
オープンソースコミュニティは、典型的に異質な研究成果物としてリリースされる多数のAIモデルを提供している。
これらをプリ・ツー・コールのAPIに変換するのは費用がかかり、労力がかかる。
本稿では,デュアルエージェント協調システムであるModel Automated Deployment Engine (MADE)を紹介する。
- 参考スコア(独自算出の注目度): 19.126846876843356
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: LLM-based agents now have strong general capabilities. However, they still struggle with domain-specific tasks, motivating the integration of external tools to broaden their capabilities. The open-source community offers a vast array of AI models typically released as heterogeneous research artifacts, whereas transforming them into ready-to-call APIs is costly and labor-intensive. Automated model deployment is therefore essential for bridging the gap between model resources and tool usability, yet it remains a long-horizon, multi-stage task that has not been sufficiently explored. To tackle this challenge, we introduce Model Automated Deployment Engine (MADE), a dual-agent coordination system. Specifically, given a model resource, MADE iteratively constructs and validates the deployment artifacts, updates its deployment belief based on execution feedback, and revisits invalid upstream artifacts until the model is successfully served as a ready-to-call API that can then be used by other agents. We further introduce M2ABench, a benchmark for the task of transforming Models to ready-to-call APIs. M2ABench comprises 122 real-world models with standardized test cases for evaluation. Experimental results demonstrate that MADE achieves a deployment success rate of 68.85%, outperforming SWE-agent and OpenHands by 13.93 and 44.26 percentage points, respectively. Our code and dataset are publicly available at https://github.com/HITDiSC/MADE.
- Abstract(参考訳): LLMベースのエージェントは現在、強力な汎用機能を備えている。
しかし、彼らはまだドメイン固有のタスクに取り組んでおり、その機能を拡張するために外部ツールの統合を動機付けています。
オープンソースコミュニティは、異質な研究成果物として一般的にリリースされる多数のAIモデルを提供している。
したがって、モデルリソースとツールのユーザビリティのギャップを埋めるためには、自動モデルデプロイメントが不可欠である。
この課題に対処するために、デュアルエージェント協調システムであるModel Automated Deployment Engine (MADE)を紹介する。
具体的には、モデルリソースが与えられた場合、MADEは、デプロイアーティファクトを反復的に構築し、検証し、実行フィードバックに基づいてデプロイメントの信条を更新し、モデルが他のエージェントによって使用される準備ができているAPIとして機能するまで、無効なアップストリームアーティファクトを再考する。
さらに、M2ABenchを紹介します。M2ABenchは、Modelsをプリ・トゥ・コールAPIに変換するタスクのためのベンチマークです。
M2ABenchは122の現実世界モデルで構成され、テストケースを標準化して評価する。
実験の結果、MADEのデプロイメント成功率は68.85%で、SWEエージェントとOpenHandsをそれぞれ13.93ポイント、44.26ポイント上回った。
私たちのコードとデータセットはhttps://github.com/HITDiSC/MADE.comで公開されています。
関連論文リスト
- Model-Driven Discipline for Multi-Agent LLMs: Requirement-to-Verification Generation of Traceable System Models [62.62160094849002]
RADIANTは、MDEとMulti-Agent Large Language Modelを組み合わせたエンジニアリング方法論である。
工学的なフェーズにまたがる異種モデルを自動的に生成する。
正確かつ自動的な変更インパクト分析を提供する。
論文 参考訳(メタデータ) (2026-07-18T08:50:55Z) - Agent2World: Learning to Generate Symbolic World Models via Adaptive Multi-Agent Feedback [51.22403664895878]
Agent2Worldは、強力な推論時ワールドモデル生成を実現するツール拡張マルチエージェントフレームワークである。
また、マルチエージェントフィードバックの生成を基盤にすることで、教師付き微調整のためのデータエンジンとしても機能する。
論文 参考訳(メタデータ) (2025-12-26T18:54:14Z) - OWMM-Agent: Open World Mobile Manipulation With Multi-modal Agentic Data Synthesis [70.39500621448383]
オープンワールドのモバイル操作タスクは、オープンエンドの命令や環境への一般化が必要なため、依然として課題である。
本稿では,多視点のシーンフレームとエージェント状態を維持した新しいマルチモーダルエージェントアーキテクチャを提案する。
我々は,グローバルなシーン理解,ロボットの状態追跡,マルチモーダルアクション生成を統一モデルで実現した,モバイルマニピュレータのための基礎モデルであるOWMM-VLMについて紹介する。
論文 参考訳(メタデータ) (2025-06-04T17:57:44Z) - OptMerge: Unifying Multimodal LLM Capabilities and Modalities via Model Merging [124.91183814854126]
モデルマージは、複数のエキスパートモデルをひとつのモデルに組み合わせようとしている。
本稿ではMLLMのトレーニングと評価のタスクを明確に分割したモデルマージ研究のベンチマークを紹介する。
モデルマージは、トレーニングデータを必要とせずに改善されたMLLMを構築するための有望な方法であることがわかった。
論文 参考訳(メタデータ) (2025-05-26T12:23:14Z) - Activation-Guided Consensus Merging for Large Language Models [25.68958388022476]
textbfActivation-Guided textbfConsensus textbfMerging(textbfACM)は,層固有のマージ係数を決定するプラグインとプレイのマージフレームワークである。
L2S(Long-to-Short)と一般的なマージタスクの実験は、ACMが全てのベースラインメソッドを一貫して上回ることを示した。
論文 参考訳(メタデータ) (2025-05-20T07:04:01Z) - MergeBench: A Benchmark for Merging Domain-Specialized LLMs [25.333088749417414]
MergeBenchは、スケールでのモデルマージを評価するために設計された評価スイートである。
2Bから9BスケールのLlamaやGemmaファミリなど、最先端のオープンソース言語モデルの上に構築されている。
マルチタスク性能, 忘れられたこと, 実行効率にまたがる8つの代表的なマージ手法を評価した。
論文 参考訳(メタデータ) (2025-05-16T04:02:55Z) - APIGen-MT: Agentic Pipeline for Multi-Turn Data Generation via Simulated Agent-Human Interplay [86.01901238059261]
APIGen-MTは検証可能で多様なマルチターンエージェントデータを生成するフレームワークである。
xLAM-2-fc-r 級数で 1B から 70B のパラメータを持つモデル群を訓練する。
我々のモデルは、$tau$-benchとBFCLベンチマークでGPT-4oやClaude 3.5のようなフロンティアモデルより優れている。
論文 参考訳(メタデータ) (2025-04-04T17:13:57Z) - Thinking Longer, Not Larger: Enhancing Software Engineering Agents via Scaling Test-Time Compute [61.00662702026523]
より大規模なモデルではなく、推論時間の増加を活用する統合されたテスト時間計算スケーリングフレームワークを提案する。
当社のフレームワークには,内部TTCと外部TTCの2つの補完戦略が組み込まれている。
当社の textbf32B モデルは,DeepSeek R1 671B や OpenAI o1 など,はるかに大きなモデルを上回る 46% の課題解決率を実現している。
論文 参考訳(メタデータ) (2025-03-31T07:31:32Z) - xLAM: A Family of Large Action Models to Empower AI Agent Systems [111.5719694445345]
AIエージェントタスク用に設計された大規模なアクションモデルであるxLAMをリリースする。
xLAMは、複数のエージェント能力ベンチマークで例外的なパフォーマンスを提供する。
論文 参考訳(メタデータ) (2024-09-05T03:22:22Z) - Model Share AI: An Integrated Toolkit for Collaborative Machine Learning
Model Development, Provenance Tracking, and Deployment in Python [0.0]
モデル共有AI(AIMS)は、コラボレーティブモデル開発、モデル前駆者追跡、モデルデプロイメントを合理化するように設計された、使いやすいMLOpsプラットフォームである。
AIMSは、協調的なプロジェクト空間と、見当たらない評価データに基づいてモデル提出をランク付けする標準化されたモデル評価プロセスを備えている。
AIMSでは、Scikit-Learn、Keras、PyTorch、ONNXで構築されたMLモデルを、ライブREST APIや自動生成されたWebアプリにデプロイすることができる。
論文 参考訳(メタデータ) (2023-09-27T15:24:39Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。