論文の概要: DAIN: Dynamic Agent-Based Interaction Network for Efficient and Collaborative Multimodal Reasoning
- arxiv url: http://arxiv.org/abs/2606.30189v1
- Date: Mon, 29 Jun 2026 12:04:01 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-30 18:07:16.212057
- Title: DAIN: Dynamic Agent-Based Interaction Network for Efficient and Collaborative Multimodal Reasoning
- Title(参考訳): DAIN:効率的な協調型マルチモーダル推論のための動的エージェントベースインタラクションネットワーク
- Authors: Xinxin Chen, Yuchen Li, Zihan Wang, Haoyu Zhang, Ruixin Liu, Mingyuan Zhao,
- Abstract要約: 動的エージェントベースインタラクションネットワーク(DAIN)を導入し,マルチモーダル融合を動的・マルチエージェント協調プロセスとして再認識する。
DAINはコンテキスト対応のメタコントローラを使用し、特別なインタラクションエージェントのスパースアクティベーションをスケジュールし、コンセンサス構築のために圧縮されたエージェント間通信をオーケストレーションする。
- 参考スコア(独自算出の注目度): 21.622690972238615
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Current multimodal fusion approaches, particularly those based on static Mixture-of-Experts (MoE) architectures, often struggle to provide the adaptive and efficient collaborative reasoning required by complex real-world applications. We introduce the Dynamic Agent-based Interaction Network (DAIN), which reconceptualizes multimodal fusion as a dynamic, multi-agent collaborative process. DAIN employs a context-aware Meta-Controller that dynamically schedules sparse activation of specialized interaction agents and orchestrates compressed inter-agent communication for consensus-building. The framework is guided by a multi-objective loss function that jointly optimizes task accuracy, agent specialization, and operational efficiency through sparse activation and communication regularization. Comprehensive evaluations across five diverse benchmarks -- ADNI, MIMIC-IV, MM-IMDB, CMU-MOSI, and ENRICO -- establish DAIN as a new state-of-the-art, delivering significant performance improvements including a 2.6\% accuracy gain on ADNI. Ablation studies verify the critical roles of both dynamic scheduling and agent communication. Furthermore, DAIN offers enhanced interpretability by exposing context-dependent agent roles and collaboration patterns while maintaining computational efficiency through sample-wise sparse agent activation. Our work demonstrates the promise of dynamic, agent-based paradigms for multimodal reasoning.
- Abstract(参考訳): 現在のマルチモーダル融合アプローチ、特に静的なMixture-of-Experts (MoE)アーキテクチャに基づくものは、複雑な現実世界のアプリケーションに必要な適応的で効率的な協調的推論を提供するのにしばしば苦労する。
動的エージェントベースインタラクションネットワーク(DAIN)を導入し,マルチモーダル融合を動的・マルチエージェント協調プロセスとして再認識する。
DAINはコンテキスト対応のMeta-Controllerを使用し、特別なインタラクションエージェントのスパースアクティベーションを動的にスケジュールし、コンセンサス構築のために圧縮されたエージェント間通信をオーケストレーションする。
このフレームワークは,タスクの正確性,エージェントの専門化,操作効率を疎活性化と通信規則化を通じて共同で最適化する多目的損失関数によって導かれる。
ADNI、MIMIC-IV、MM-IMDB、CMU-MOSI、ENRICOの5つのベンチマークの総合的な評価は、DAINを新しい最先端として確立し、ADNIの2.6倍の精度向上を含む大幅なパフォーマンス改善を提供する。
アブレーション研究は、動的スケジューリングとエージェント通信の両方の重要な役割を検証している。
さらに、DAINは、サンプルワイドスパースエージェントアクティベーションによる計算効率を維持しつつ、コンテキスト依存のエージェントロールと協調パターンを公開することで、解釈可能性の向上を提供する。
我々の研究は、マルチモーダル推論のための動的エージェントベースのパラダイムの可能性を実証している。
関連論文リスト
- Scaling Behavior of Single LLM-Driven Multi-Agent Systems [5.2324118961669575]
マルチエージェントシステム(MAS)は、協調的な知性によって複雑なタスクに取り組むことを約束する。
本稿では, エージェント数の増加に伴い, 均質MASの性能がどう進化するかを系統的に検討する。
論文 参考訳(メタデータ) (2026-05-30T09:57:49Z) - Differentiable Mixture-of-Agents Incentivizes Swarm Intelligence of Large Language Models [17.7409616106227]
Differentiable Mixture-of-Agents (DMoA) は、推論中に弾性および適応的なエージェントの協調を可能にする自己進化型マルチエージェントフレームワークである。
DMoAは, 高い効率, 堅牢性, アンサンブル性を示しながら, 最先端性能を実現していることを示す。
論文 参考訳(メタデータ) (2026-05-15T07:54:46Z) - AffectAgent: Collaborative Multi-Agent Reasoning for Retrieval-Augmented Multimodal Emotion Recognition [62.16431420189863]
LLMに基づくマルチモーダル感情認識は静的なパラメトリックメモリに依存しており、ニュアンス化された感情状態の解釈時にしばしば幻覚を与える。
本稿では,感情指向型マルチエージェント検索拡張生成フレームワークであるAffectAgentを紹介する。
AffectAgentは3つの共同最適化されたエージェント、すなわちクエリプランナー、エビデンスフィルタ、感情生成器から構成される。
論文 参考訳(メタデータ) (2026-04-14T13:49:19Z) - Multi-Agent Model-Based Reinforcement Learning with Joint State-Action Learned Embeddings [10.36125908359289]
モデルに基づくマルチエージェント強化学習フレームワークを提案する。
我々は変分自動エンコーダで訓練された世界モデルを設計し、状態-作用学習埋め込みを用いてモデルを増強する。
想像された軌道とSALEに基づく行動値とを結合することにより、エージェントは彼らの選択が集団的な結果にどのように影響するかをより深く理解する。
論文 参考訳(メタデータ) (2026-02-13T01:57:21Z) - MedSAM-Agent: Empowering Interactive Medical Image Segmentation with Multi-turn Agentic Reinforcement Learning [53.37068897861388]
MedSAM-Agentは、対話的なセグメンテーションを多段階の自律的な意思決定プロセスとして再構築するフレームワークである。
マルチターン・エンド・ツー・エンドの成果検証を統合した2段階のトレーニングパイプラインを開発した。
6つの医療モダリティと21のデータセットにわたる実験は、MedSAM-Agentが最先端のパフォーマンスを達成することを示す。
論文 参考訳(メタデータ) (2026-02-03T09:47:49Z) - InterAgent: Physics-based Multi-agent Command Execution via Diffusion on Interaction Graphs [72.5651722107621]
InterAgentはテキスト駆動型物理ベースのマルチエージェントヒューマノイド制御のためのエンドツーエンドフレームワークである。
本稿では,マルチストリームブロックを備えた自己回帰拡散トランスフォーマーを提案する。
また,空間依存性の微粒化を明示的に捉えた対話グラフのエクスセプション表現を提案する。
論文 参考訳(メタデータ) (2025-12-08T10:46:01Z) - Parallelism Meets Adaptiveness: Scalable Documents Understanding in Multi-Agent LLM Systems [0.8437187555622164]
大規模言語モデル(LLM)エージェントは、協調的なタスク補完の約束が増していることを示している。
既存のマルチエージェントフレームワークは、静的で固定されたロールと限定的なエージェント間通信に依存していることが多い。
本稿では,3つのコア機構による適応性を実現するための協調フレームワークを提案する。
論文 参考訳(メタデータ) (2025-07-22T22:42:51Z) - Cross-Task Experiential Learning on LLM-based Multi-Agent Collaboration [63.90193684394165]
マルチエージェント・クロスタスク体験学習(MAEL)は,LSM駆動型エージェントに明示的なクロスタスク学習と経験蓄積を付与する新しいフレームワークである。
経験的学習フェーズでは、タスク解決ワークフローの各ステップの品質を定量化し、その結果の報酬を記憶する。
推論中、エージェントは、各推論ステップの有効性を高めるために、いくつかの例として、高頻度のタスク関連体験を検索する。
論文 参考訳(メタデータ) (2025-05-29T07:24:37Z) - Multi-Agent Collaboration via Evolving Orchestration [55.574417128944226]
大規模言語モデル(LLM)は、様々な下流タスクで顕著な成果を上げているが、そのモノリシックな性質は複雑な問題解決におけるスケーラビリティと効率を制限している。
LLMに基づくマルチエージェントコラボレーションのためのパウチスタイルのパラダイムを提案し,タスク状態の進化に応じて,中央集権的なオーケストレータ("puppeteer")がエージェント("puppets")を動的に指示する。
クローズドドメインおよびオープンドメインシナリオの実験により,この手法は計算コストを低減し,優れた性能が得られることが示された。
論文 参考訳(メタデータ) (2025-05-26T07:02:17Z) - Modeling the Interaction between Agents in Cooperative Multi-Agent
Reinforcement Learning [2.9360071145551068]
対話型アクター・クリティック(IAC)と呼ばれる新しい協調型MARLアルゴリズムを提案する。
IACは政策と価値関数の観点からエージェントの相互作用をモデル化する。
連続制御タスクに値分解手法を拡張し、古典的な制御やマルチエージェント粒子環境を含むベンチマークタスク上でIACを評価する。
論文 参考訳(メタデータ) (2021-02-10T01:58:28Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。