論文の概要: A Large-Scale Empirical Evaluation of MMAO Under Fair-Budget Continuous and Discrete Benchmarks
- arxiv url: http://arxiv.org/abs/2606.31584v2
- Date: Sat, 04 Jul 2026 15:34:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 17:33:48.694777
- Title: A Large-Scale Empirical Evaluation of MMAO Under Fair-Budget Continuous and Discrete Benchmarks
- Title(参考訳): 公平かつ離散的なベンチマークによるMMAOの大規模評価
- Abstract要約: この研究は、MMAOのクローズドループリソース割り当ての原則が、より広く、より標準的で、より明確な予算管理のベンチマークの下で、信頼性が保たれているかどうかを問うものである。
我々は、MMAOを、エビデンス・プレッシャーの下で内因性資源の再分配を最も明確に検証した、ベンチマークベースのクロスドメイン適応フレームワークとして位置づける。
- 参考スコア(独自算出の注目度): 0.5156484100374058
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: This paper evaluates the Metabolic Multi-Agent Optimizer (MMAO) under a stricter empirical protocol rather than reintroducing the framework itself. The study asks whether MMAO's closed-loop resource-allocation principle remains credible under broader, more standard, and more explicitly budget-controlled continuous and discrete benchmarks. The main completed matrix covers eight CEC2017 functions at 10D and 30D with 20 seeds each, and five TSPLIB instances with 20 seeds each, together with stronger reproducible baselines including PSO-lite, ES-lite, and an iterated-greedy 2-opt route baseline. We further add trajectory-level diagnostics for communal budget, success rate, role evolution, and population turnover, plus an auxiliary OR-Library multiple-knapsack slice to extend the discrete evidence beyond routing. Under this protocol, MMAO clearly outperforms the external baseline set on the continuous side and on the TSPLIB side, while the ablation variants remain much closer to the full method than the external baselines are. We therefore position MMAO as a benchmark-backed cross-domain adaptive framework whose most clearly validated value is endogenous resource redistribution under evidence pressure, while also noting that the strongest remaining gap is not basic workability but sharper mechanism isolation and broader competition-grade comparison.
- Abstract(参考訳): 本稿では,メタボリック・マルチエージェント・オプティマイザ(MMAO)をフレームワーク自体の再導入よりも厳密な経験的プロトコルで評価する。
この研究は、MMAOのクローズドループリソース割り当ての原則が、より広く、より標準的で、より明確に予算管理された連続的および離散的なベンチマークの下で、信頼性が保たれているかどうかを問うものである。
メインコンプリートマトリックスは、20種の種子を持つ10Dおよび30DのCEC2017機能8と、20種の種子を持つ5つのTSPLIBインスタンスと、PSO-lite、ES-lite、反復グレード2-optルートベースラインを含むより強い再現可能なベースラインを含む。
さらに, 共同予算, 成功率, 役割進化, 人口移動の軌跡レベル診断, 補助的な OR-Library multiple-knapsack スライスにより, ルーティング以外の決定的な証拠を拡大する。
このプロトコルの下では、MMAOは連続した側とTSPLIB側の外部ベースラインよりも明らかに優れているが、アブレーションの変種は外部ベースラインよりも完全なメソッドにかなり近いままである。
そこで我々は,MMAOを,エビデンス・プレッシャー下での内在的資源再分配を最も明確に検証したベンチマーク支援型クロスドメイン適応フレームワークとして位置づけるとともに,最強の残差は基本的な作業性ではなく,よりシャープな機構分離とより広範なコンペティション・グレード・コンペティション・コンペティション・コンペティション・コンペティション(コンペティション・コンペティション・コンペティション・コンペティション・コンペティション・コンペティション・コンペティション・コンペティション)の比較を行った。
関連論文リスト
- Minimal MMAO: A Resource-Closed-Loop Framework for Adaptive Metaheuristic Search [0.5156484100374058]
本稿では,内因性資源循環を中心に構築された適応型メタヒューリスティックとしてメタボリック・マルチエージェント(MMAO)を提案する。
我々は、有界私的エネルギー、共同予算、正規化された報酬、継続的な役割適応、資源の確保された分枝と刈り取りを通じて、MMAOを定式化する。
結果は一貫したパターンを示しており、同じ代謝ループはドメイン間で動作可能であり、離散的な実現はコンパクトな設計の下で比較的安定であり、連続的な改善品質はメソッドをリーンに保つための主なコストである。
論文 参考訳(メタデータ) (2026-06-29T15:20:36Z) - MMAO: A Metabolic Multi-Agent Optimizer with Endogenous Resource Allocation for Continuous and Discrete Optimization [0.5156484100374058]
本稿では,プライベート・パブリックなメタボリック・リソース・ループから順応的に適応を導出するクロスドメイン最適化フレームワークを提案する。
連続的な設定では、MMAOはエネルギー制御されたゼロオーダープローブとロール補間運動を使用する。
離散的な設定では、同じ制御則が構造的センシング、局所摂動、誘導、エネルギー重み付きエッジ再利用によってインスタンス化される。
論文 参考訳(メタデータ) (2026-06-26T14:10:34Z) - Too Correct to Learn: Reinforcement Learning on Saturated Reasoning Data [55.84428098924793]
構造保存探索を行うためのパラメータ自由復号法である Constrained Uniform Top-K Smpling (CUTS) を提案する。
グループ内の利点分散を増幅するために、エクスプロイトと探索的なロールアウトを相乗化するためのトレーニングフレームワークであるMixed-CUTSに統合する。
特にMixed-CUTSは、AIME25ベンチマークのPass@1の精度を標準のGRPOよりも15.1%向上している。
論文 参考訳(メタデータ) (2026-04-20T16:43:28Z) - MM-Doc-R1: Training Agents for Long Document Visual Question Answering through Multi-turn Reinforcement Learning [74.07254720088926]
長文の視覚的質問応答に対処するために,エージェント型視覚認識ワークフローを利用する新しいフレームワークMM-Doc-R1を紹介する。
GRPOのような既存のマルチターン強化学習(RL)アルゴリズムにおけるベースライン推定バイアスに対処する、類似性に基づくポリシー最適化(SPO)を提案する。
MMLongbench-Docベンチマークの実験では、MM-Doc-R1が以前のベースラインを10.4%上回る結果となった。
論文 参考訳(メタデータ) (2026-04-15T07:39:08Z) - EvoNash-MARL: A Closed-Loop Multi-Agent Reinforcement Learning Framework for Medium-Horizon Equity Allocation [13.877325729509058]
EvoNash-MARLは、強化学習と人口ベースのポリシー最適化と実行対応の選択を統合するクローズドループフレームワークである。
2014年から2024年までのサンプル外データでは、SPYの11.7%に比べて19.6%のリターンが得られ、2026年までの長期評価では安定している。
論文 参考訳(メタデータ) (2026-04-13T02:24:32Z) - Improving Search Agent with One Line of Code [68.58667107354253]
ツールベースのエージェント強化学習(TARL)は,検索エージェントが外部ツールと対話できるようにトレーニングするための,有望なパラダイムとして登場した。
textbfSearch textbfAgent textbfPolicy textbfOptimization (textbfSAPO)を提案する。
論文 参考訳(メタデータ) (2026-03-10T04:07:39Z) - ArenaRL: Scaling RL for Open-Ended Agents via Tournament-based Relative Ranking [84.07076200941474]
ArenaRLは、ポイントワイドスカラースコアからグループ内相対ランクにシフトする強化学習パラダイムである。
我々は,グループ内対角アリーナを構築し,安定した有利な信号を得るためのトーナメントベースのランキングスキームを考案する。
実験により、ArenaRLは標準のRLベースラインを大幅に上回っていることが示された。
論文 参考訳(メタデータ) (2026-01-10T08:43:07Z) - Self-Rewarded Multimodal Coherent Reasoning Across Diverse Visual Domains [16.357026482329232]
マルチモーダルLSMは、流動的で信頼性の低い推論を生成する。
SR-MCRは軽量でラベルのないフレームワークであり、推論を整合させる。
SR-MCRは、幅広いビジュアルベンチマークで解答精度と推論コヒーレンスを改善する。
論文 参考訳(メタデータ) (2025-12-27T10:14:14Z) - Stable and Efficient Single-Rollout RL for Multimodal Reasoning [66.53652874617217]
$textbfMSSR$ (Multimodal Stabilized Single-Rollout)はグループフリーのRLVRフレームワークで、安定した最適化と効果的なマルチモーダル推論性能を実現する。
分散評価では、MSSRはトレーニングの効率が良く、トレーニングの歩数の半分でグループベースベースラインに類似した検証精度を達成できる。
論文 参考訳(メタデータ) (2025-12-20T05:07:53Z) - MMR1: Enhancing Multimodal Reasoning with Variance-Aware Sampling and Open Resources [113.33902847941941]
VAS (Variance-Aware Sampling) は、Variance Promotion Score (VPS) によって導かれるデータ選択戦略である。
我々は、1.6MのCoT冷間開始データと15kのRLQAペアを含む大規模かつ慎重にキュレートされたリソースをリリースする。
数学的推論ベンチマークによる実験では、キュレートされたデータと提案されたVASの有効性が示されている。
論文 参考訳(メタデータ) (2025-09-25T14:58:29Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。