論文の概要: ReM-MoA: Reasoning Memory Sustains Mixture-of-Agents Scaling
- arxiv url: http://arxiv.org/abs/2606.24437v1
- Date: Tue, 23 Jun 2026 11:14:37 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-24 22:16:48.914522
- Title: ReM-MoA: Reasoning Memory Sustains Mixture-of-Agents Scaling
- Title(参考訳): ReM-MoA: Reasoning Memory Sustains Mixture-of-Agents Scaling
- Authors: Heng Ping, Arijit Bhattacharjee, Peiyu Zhang, Shixuan Li, Wei Yang, Ali Jannesari, Nesreen Ahmed, Paul Bogdan,
- Abstract要約: メモリ拡張型MoAフレームワークであるReM-MoAを提案する。
ランク付き推論メモリは、比較レビュアエージェントを使用して、すべてのレイヤからの推論トレースを永続的に保存し、ランク付けする。
Curated Diversified Memory スキームは、異なるエージェントを、成功したトレースと失敗したトレースの明確な組み合わせに公開し、探索の多様性を保ちながら、高品質な推論を伝播する。
- 参考スコア(独自算出の注目度): 17.627802155311535
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Mixture-of-Agents (MoA) architectures improve inference-time scaling by organizing multiple LLM agents into layered reasoning pipelines. However, existing MoA variants fail to sustain gains as depth increases, exhibiting degradation, early plateauing, or saturation. We propose ReM-MoA, a memory-augmented MoA framework that sustains scaling through two mechanisms: (1) a Ranked Reasoning Memory that persistently stores and ranks reasoning traces from all layers using a comparative Reviewer Agent, and (2) a Curated Diversified Memory Routing scheme that exposes different agents to distinct combinations of successful and failed traces, preserving exploration diversity while propagating high-quality reasoning. We further introduce an optional multi-domain Reviewer distillation pipeline that improves ranking quality through frontier-model supervision. Across five reasoning benchmarks spanning math, formal logic, code, knowledge, and commonsense, ReM-MoA consistently outperforms prior MoA variants across both depth and width scaling, and its advantage widens with depth, establishing structured cross-layer reasoning memory as a key missing mechanism for scalable multi-agent inference.
- Abstract(参考訳): Mixture-of-Agents (MoA)アーキテクチャは、複数のLDMエージェントを階層化された推論パイプラインにまとめることで、推論時間のスケーリングを改善する。
しかし、既存のMoA変種は、深さが増加し、劣化、早期沈降または飽和を示すため、上昇を維持できない。
メモリ拡張型MoAフレームワークであるReM-MoAを提案する。(1) 比較レビュアーエージェントを用いて全ての層からの推論トレースを永続的に保存・ランク付けするランク付き推論メモリ,(2) 異なるエージェントに異なるトレースと失敗したトレースの異なる組み合わせを公開し、高品質な推論を伝播させながら探索多様性を保ちながら、異なるエージェントを公開するキュレートされた分散メモリルーティングスキームである。
さらに,フロンティアモデル監視によるランク付け品質の向上を目的とした,オプションのマルチドメインレビュア蒸留パイプラインを導入する。
数学、形式論理、コード、知識、コモンセンスにまたがる5つの推論ベンチマークの中で、ReM-MoAは、深さと幅のスケーリングの両方で、MoAの以前のバリエーションよりも一貫して優れており、その利点は深みに広がっており、スケーラブルなマルチエージェント推論の鍵を欠くメカニズムとして構造化されたクロスレイヤー推論メモリが確立されている。
関連論文リスト
- Dense2MoE: Pushing the Pareto Frontier of On-Device LLMs via Unified Pruning and Upcycling [10.009897539610646]
Mixture of Experts MoEアーキテクチャは、デバイスデプロイメントに制約のあるリソースに対して非常に有望だが、これらのモデルをスクラッチからトレーニングすることは禁忌なコストである。
現在の手法では、密度の高いモデルをMoEにアップサイクルすることでこれを緩和しようとするが、しばしばパラメータの冗長性を導入し、推論効率を低下させる。
論文 参考訳(メタデータ) (2026-05-26T03:19:04Z) - Think When Needed: Adaptive Reasoning-Driven Multimodal Embeddings with a Dual-LoRA Architecture [5.59567612070537]
Think When Needed (TWN) は適応的推論を備えた統合マルチモーダル埋め込みフレームワークである。
これに基づいてアダプティブシンク機構は、自己教師付きルーティングゲートを使用して、入力毎にチェーン・オブ・シークレット(CoT)を生成するかどうかを決定する。
MMEB-V2の78タスクでは、TWNは最先端の埋め込み品質を達成し、既存の生成方法よりもはるかに効率的である。
論文 参考訳(メタデータ) (2026-05-14T06:41:53Z) - Beyond Chain-of-Thought: Rewrite as a Universal Interface for Generative Multimodal Embeddings [32.702215732070826]
MLLM(Multimodal Large Language Models)は、ユニバーサルなマルチモーダル埋め込みのための有望な基盤として登場した。
近年の研究では、推論駆動型生成多モード埋め込みは、複数の埋め込みタスクにおける識別的埋め込みよりも優れていることが示されている。
Rewrite-driven Multimodal Embedding (RIME)を提案する。
論文 参考訳(メタデータ) (2026-04-24T06:50:11Z) - Refer-Agent: A Collaborative Multi-Agent System with Reasoning and Reflection for Referring Video Object Segmentation [50.22481337087162]
Referring Video Object (RVOS) は、テキストクエリに基づくビデオ内のオブジェクトのセグメンテーションを目的としている。
Refer-Agent (Refer-Agent) は、共用多エージェントシステムである。
論文 参考訳(メタデータ) (2026-02-03T14:48:12Z) - Representation Space Constrained Learning with Modality Decoupling for Multimodal Object Detection [3.556651853847748]
本稿では,マルチモーダル検出における核融合劣化の理論的検討を行う。
2つのモジュールからなるRepresentation Space Constrained Learning with Modality Decoupling (RSC-MD)法を提案する。
提案手法は, 核融合劣化を効果的に軽減し, 複数のベンチマークで最先端性能を実現する。
論文 参考訳(メタデータ) (2025-11-19T13:41:27Z) - Apriel-H1: Towards Efficient Enterprise Reasoning Models [6.630534140883356]
ハイブリッドLLMのApriel-H1ファミリーは、15Bモデルサイズでの効率的な推論のためにトランスフォーマーアテンションとSSMシークエンスミキサーを組み合わせた。
SSM-to-MHA比の異なるApriel-H1-15B-Thinkerの蒸留後変種を複数リリースし、より多くのマンバ層がMHAに置き換わるにつれて、推論性能が劣化するかを分析した。
論文 参考訳(メタデータ) (2025-11-04T15:17:43Z) - MoCa: Modality-aware Continual Pre-training Makes Better Bidirectional Multimodal Embeddings [75.0617088717528]
MoCaは、トレーニング済みのVLMバックボーンを効果的な双方向埋め込みモデルに変換するためのフレームワークである。
MoCaは、MMEBとViDoRe-v2ベンチマークのパフォーマンスを継続的に改善し、新しい最先端の結果を達成する。
論文 参考訳(メタデータ) (2025-06-29T06:41:00Z) - Reinforcing Video Reasoning with Focused Thinking [65.85683941058916]
本稿では,集中的思考と深い報酬の粒度で視覚的推論を強化する新しいフレームワークであるTW-GRPOを提案する。
具体的には,高情報密度のトークンを優先するトークン重み付け機構を用いる。
また,シングルチョイスからマルチチョイスQAタスクにシフトすることで,RLトレーニングを再構築する。
論文 参考訳(メタデータ) (2025-05-30T15:42:19Z) - ReMA: Learning to Meta-think for LLMs with Multi-Agent Reinforcement Learning [53.817538122688944]
Reinforced Meta-thinking Agents (ReMA) を導入し,Large Language Models (LLMs) の推論からメタ思考行動を求める。
ReMAは、推論プロセスを2つの階層的なエージェントに分解する。戦略上の監視と計画を生成するハイレベルなメタ思考エージェントと、詳細な実行のための低レベルな推論エージェントである。
単ターン実験による実験結果から、ReMAは複雑な推論タスクにおいて単エージェントRLベースラインよりも優れることが示された。
論文 参考訳(メタデータ) (2025-03-12T16:05:31Z) - Progressive Multimodal Reasoning via Active Retrieval [64.74746997923967]
多段階多モーダル推論タスクは、大規模言語モデル(MLLM)に重大な課題をもたらす
本稿では,MLLMの推論能力の向上を目的とした汎用フレームワークAR-MCTSを提案する。
我々は,AR-MCTSがサンプリングの多様性と精度を最適化し,信頼性の高いマルチモーダル推論を実現することを示す。
論文 参考訳(メタデータ) (2024-12-19T13:25:39Z) - SHERL: Synthesizing High Accuracy and Efficient Memory for Resource-Limited Transfer Learning [63.93193829913252]
本稿では,リソース制限シナリオに対するSHERLと呼ばれる革新的なMETL戦略を提案する。
初期経路では、中間出力は反冗長動作によって統合される。
遅延ルートでは、最小限の遅延事前トレーニングされたレイヤを利用することで、メモリオーバーヘッドのピーク需要を軽減できる。
論文 参考訳(メタデータ) (2024-07-10T10:22:35Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。