論文の概要: MMAO-Dyn: A Metabolic Multi-Agent Optimizer for Dynamic Optimization
- arxiv url: http://arxiv.org/abs/2607.00846v2
- Date: Sat, 04 Jul 2026 15:43:49 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 17:33:48.81968
- Title: MMAO-Dyn: A Metabolic Multi-Agent Optimizer for Dynamic Optimization
- Title(参考訳): MMAO-Dyn:動的最適化のためのメタボリックマルチエージェント最適化
- Authors: Jinliang Xu, Liping Ma,
- Abstract要約: MMAO-Dynは、プライベートエネルギー、共同予算、ロールドリフト、成功フィードバック、ライフサイクル・ターンオーバーを非定常環境にマッピングする。
MMAO-Dyn を 18-scenario 合成連続ベンチマーク行列上で評価した。
- 参考スコア(独自算出の注目度): 0.5156484100374058
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: This paper studies whether the Metabolic Multi-Agent Optimizer (MMAO) can be credibly derived into a dynamic-optimization method without replacing its core metabolic control loop by external adaptation modules. The proposed MMAO-Dyn maps private energy, communal budget, role drift, success feedback, and lifecycle turnover to a nonstationary setting in which environmental changes repeatedly invalidate previously useful local structure. We evaluate MMAO-Dyn on an 18-scenario synthetic dynamic continuous benchmark matrix covering shifted sphere, shifted Ackley, and shifted Rastrigin landscapes at $10D$, $20D$, and $30D$, with two change severities and 12 seeds per scenario. The comparison layer includes a generic MMAO variant without dynamic derivation, dynamic random search, dynamic PSO-lite, dynamic DE-lite, and three endogenous ablations. Across the full 216-run matrix, MMAO-Dyn attains mean offline error $28.07$, improving over Generic-MMAO ($29.36$), Dynamic-PSO-lite ($34.65$), Dynamic-DE-lite ($67.09$), and Dynamic-RandomSearch ($111.37$). The gains are clearest in aggregate robustness on sphere and Rastrigin families and in 10-step post-change recovery relative to the generic backbone, whereas the seed-aligned comparison with Dynamic-PSO-lite remains unfavorable in win-loss count and the \texttt{NoMemoryRefresh} ablation stays very close to the full method. We therefore position MMAO-Dyn as a credible family-expansion result for MMAO: the metabolic loop can generate meaningful dynamic behavior, but the strongest current value lies in recovery-oriented resource redistribution rather than in universal dominance or in a fully optimized submechanism design.
- Abstract(参考訳): 本稿では, メタボリック・マルチエージェント・オプティマイザ (MMAO) が, コアメタボリック制御ループを外部適応モジュールに置き換えることなく, 動的最適化法に確実に導出できるかどうかを考察する。
提案したMMAO-Dynは、プライベートエネルギー、共同予算、ロールドリフト、成功フィードバック、ライフサイクル・ターンオーバーを、環境変化が繰り返し発生する非定常的な環境にマッピングする。
我々はMMAO-Dynを、シフトスフィアをカバーし、Ackleyをシフトし、Rastriginのランドスケープを10D$、20D$、30D$にシフトした18-scenarioの合成動的ベンチマークマトリックス上で評価した。
比較層は、動的導出、動的ランダム探索、動的PSO-lite、動的D-lite、および3つの内因性アブレーションのない汎用的なMMAO変異を含む。
MMAO-Dynは216行の行列全体にわたって、平均的なオフラインエラー28.07$に達し、Generic-MMAO(29.36$)、Dynamic-PSO-lite(34.65$)、Dynamic-DE-lite(67.09$)、Dynamic-RandomSearch(111.37$)よりも改善されている。
球状およびラストリギン族における集合的強靭性や、一般的なバックボーンに対する10段階のポスト・チェンジ回復では最も顕著であり、一方、動的PSO-ライトとのシード・アライメント比較は、ウィンロス数では好ましくないままであり、 \texttt{NoMemoryRefresh} アブレーションはフルメソッドに非常に近いままである。
したがって、MMAO-Dynは、メタボリックループが意味のある動的挙動を生み出すことができるが、最も強い電流値は、普遍的な支配や完全に最適化されたサブメカニズム設計よりも、回復指向のリソース再分配にある。
関連論文リスト
- MMAO: A Metabolic Multi-Agent Optimizer with Endogenous Resource Allocation for Continuous and Discrete Optimization [0.5156484100374058]
本稿では,プライベート・パブリックなメタボリック・リソース・ループから順応的に適応を導出するクロスドメイン最適化フレームワークを提案する。
連続的な設定では、MMAOはエネルギー制御されたゼロオーダープローブとロール補間運動を使用する。
離散的な設定では、同じ制御則が構造的センシング、局所摂動、誘導、エネルギー重み付きエッジ再利用によってインスタンス化される。
論文 参考訳(メタデータ) (2026-06-26T14:10:34Z) - GD$^2$PO: Mitigating Multi-Reward Conflicts via Group-Dynamic reward-Decoupled Policy Optimization [54.596224644751565]
訓練後強化学習(RL)は多次元報酬に頼り、包括的能力を育成する。
これを解決するために、グループ報酬分離政策最適化(GDPO)のような既存の手法は、総合的なスコアを独立した報酬グループに分解し、各グループ内でRL損失を個別に計算する。
本稿では,GD$2$PO(Group-Dynamic reward-Decoupled Policy Optimization)を提案する。
論文 参考訳(メタデータ) (2026-06-15T14:19:28Z) - Momentum Stability and Adaptive Control in Stochastic Reconfiguration [6.526210062544706]
変動型モンテカルロ(VMC)と表現型ニューラルネットワークの波動関数の組み合わせは、基底状態計算の強力な経路となっている。
適応再構成(SR)による高精度分散による効率よく安定した波動関数最適化について検討する。
本研究では,実効的なスペクトル次元と部分空間重なりに基づく,チューニング不要な運動量適応型SR法PRIME-SRを提案する。
論文 参考訳(メタデータ) (2026-04-20T14:49:30Z) - A Dynamic Retrieval-Augmented Generation System with Selective Memory and Remembrance [0.0]
Emph Adaptive RAG Memory (ARM) は,静的ベクトルインデックスをEmphdynamicメモリ基板に置き換える検索拡張生成(RAG)フレームワークである。
ARMは、軽量な検索ベンチマークで最先端のパフォーマンスに近づいた。
ARMは、ジェネレータカラーブラックを再トレーニングすることなく、競合精度、自己正規化メモリ成長、解釈可能な保持ダイナミクスを出力し、生産・研究RAGシステムの品質、レイテンシ、メモリ効率のトレードオフを実践する。
論文 参考訳(メタデータ) (2026-01-04T21:51:41Z) - Evolution Strategies at the Hyperscale [57.75314521465674]
本稿では,大集団にバックプロップフリーな最適化を拡大するための進化戦略(ES)アルゴリズムEGGROLLを紹介する。
ESは、微分不可能またはノイズの多い目的を処理できる強力なブラックボックス最適化手法のセットである。
EGGROLLはランダム行列を$Ain mathbbRmtimes r, Bin mathbbRntimes r$ with $rll min(m,n)$ とすることでこれらのボトルネックを克服し、低ランク行列摂動を$A Btop$とする。
論文 参考訳(メタデータ) (2025-11-20T18:56:05Z) - Near-Optimal Dynamic Regret for Adversarial Linear Mixture MDPs [63.47351876442425]
本研究は,完全情報フィードバックの下で,相変わらずの相変わらずの線形混合MDPについて検討した。
本稿では,占領率に基づく手法と政策に基づく手法の利点を組み合わせた新しいアルゴリズムを提案する。
我々のアルゴリズムは$widetildemathcalO(d sqrtH3 K + sqrtHK(H + barP_K$)$ dynamic regret, ここで$d$は特徴次元である。
論文 参考訳(メタデータ) (2024-11-05T13:55:52Z) - Narrowing the Gap between Adversarial and Stochastic MDPs via Policy Optimization [11.11876897168701]
対人的マルコフ決定過程における学習の問題を考える。
本稿では,APO-MVPと呼ばれるアルゴリズムを提案する。
論文 参考訳(メタデータ) (2024-07-08T08:06:45Z) - A Relational Intervention Approach for Unsupervised Dynamics
Generalization in Model-Based Reinforcement Learning [113.75991721607174]
同じ環境に属する2つの推定$hatz_i, hatz_j$の確率を推定するための介入予測モジュールを導入する。
提案手法により推定される$hatZ$は,従来の方法よりも冗長な情報が少ないことを実証的に示す。
論文 参考訳(メタデータ) (2022-06-09T15:01:36Z) - Efficient Policy Iteration for Robust Markov Decision Processes via
Regularization [49.05403412954533]
ロバストな意思決定プロセス(MDP)は、システムのダイナミクスが変化している、あるいは部分的にしか知られていない決定問題をモデル化するためのフレームワークを提供する。
最近の研究は、長方形長方形の$L_p$頑健なMDPと正規化されたMDPの等価性を確立し、標準MDPと同じレベルの効率を享受する規則化されたポリシー反復スキームを導出した。
本研究では、政策改善のステップに焦点をあて、欲求政策と最適なロバストなベルマン作用素のための具体的な形式を導出する。
論文 参考訳(メタデータ) (2022-05-28T04:05:20Z) - Near-Optimal No-Regret Learning for Correlated Equilibria in
Multi-Player General-Sum Games [104.74734408204749]
マルチプレイヤーの汎用正規形式ゲームにおいて,OMWU(Optimistic Multiplicative Weights Update)を用いているエージェントが全員,O(textrmpolylog(T))$(T$)$(T$)$(OMWU)$(OMWU)$(OMWU)$(OMWU)$(OMWU)$)であることを示す。
外部の後悔から内部の後悔へと結果を拡張し、後悔を交換することで、近似した平衡に収束する非結合学習ダイナミクスを確立する。
論文 参考訳(メタデータ) (2021-11-11T01:19:53Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。