論文の概要: Multi-scale Mixture of World Models for Embodied Agents in Evolving Environments
- arxiv url: http://arxiv.org/abs/2607.00457v1
- Date: Wed, 01 Jul 2026 05:23:56 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-02 19:56:07.726524
- Title: Multi-scale Mixture of World Models for Embodied Agents in Evolving Environments
- Title(参考訳): 進化型環境における人工呼吸器の世界モデルのマルチスケール混合
- Abstract要約: 実世界で活動する身体エージェントは、条件が変わるにつれて多スケールの推論と知識適応を必要とする。
MuSixは、スケールアウェアな世界モデルと進化の混合を通じて、両方の課題に対処するフレームワークです。
EmbodiedBenchとHAZARDの実験では、MuSixはマルチスケール推論と動的適応に基づく最先端のベースラインよりも改善されている。
- 参考スコア(独自算出の注目度): 17.72952875357674
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Embodied agents operating in the real world require multi-scale reasoning and knowledge adaptation as conditions change. We identify two challenges in applying Mixture of Experts (MoE) to this setting: routing lacks an explicit notion of scale, preventing targeted updates at specific scales, and a uniform update policy cannot accommodate the different rates at which knowledge at each scale becomes outdated. We present MuSix, a framework that addresses both challenges through scale-aware world model mixture and evolution. A two-stage routing mechanism grounds scale selection in experiential distance, a measure of situational novelty inspired by Construal Level Theory: a meta-router first maps this quantity to a weight over continuous scale space, then per-scale base routers select world models within the identified scale. For adaptation, scale-dependent forgetting rates allow low-scale knowledge to refresh rapidly while high-scale abstractions persist, and gated inter-scale transfer maintains coherence across the hierarchy. Experiments on EmbodiedBench and HAZARD show that MuSix improves over state-of-the-art baselines on multi-scale reasoning and dynamic adaptation.
- Abstract(参考訳): 実世界で活動する身体エージェントは、条件が変わるにつれて多スケールの推論と知識適応を必要とする。
この設定にMixture of Experts(MoE)を適用する際の2つの課題は、ルーティングにはスケールという明確な概念が欠けていること、特定のスケールでのターゲット更新を防ぐこと、各スケールでの知識が時代遅れになった場合の異なるレートに統一的な更新ポリシが対応できないこと、である。
MuSixは、スケールアウェアな世界モデルと進化の混合を通じて、両方の課題に対処するフレームワークです。
メタルータはまず、この量を連続的なスケール空間上の重みにマッピングし、次に、スケールごとのベースルータが特定スケール内の世界モデルを選択する。
適応のために、スケール依存の忘れる速度は、低スケールの知識を迅速にリフレッシュし、高スケールの抽象化は継続し、ゲート間転送は階層間のコヒーレンスを維持する。
EmbodiedBenchとHAZARDの実験では、MuSixはマルチスケール推論と動的適応の最先端ベースラインよりも改善されている。
関連論文リスト
- Unlocking Feature Learning in Gated Delta Networks at Scale [52.705562336559446]
大規模言語モデルの訓練とスケーリングは膨大な計算資源を必要とする。
我々はGated Delta Networkのスケーリングルールを導出する。
言語モデル事前学習の実験により、我々の構成が安定した学習速度転送を可能にすることが確認された。
論文 参考訳(メタデータ) (2026-06-02T08:45:24Z) - Agentic World Modeling: Foundations, Capabilities, Laws, and Beyond [209.35045331678043]
2つの軸に沿って組織された「レベルx法」の分類を導入します。
第一に、3つの能力レベルを定義している: 1段階の局所遷移演算子を学ぶL1 Predictor、それらをドメインの法則を尊重する多段階のアクション条件付きロールアウトに構成するL2 Simulator、新しいエビデンスに対して予測が失敗すると自己のモデルを自動で修正するL3 Evolver。
我々は400以上の作品を合成し、モデルに基づく強化学習、ビデオ生成、WebおよびGUIエージェント、マルチエージェント社会シミュレーション、AIによる科学的発見にまたがる100以上の代表システムを要約する。
論文 参考訳(メタデータ) (2026-04-24T17:48:47Z) - DynaMoE: Dynamic Token-Level Expert Activation with Layer-Wise Adaptive Capacity for Mixture-of-Experts Neural Networks [0.0]
Mixture-of-Experts (MoE)アーキテクチャは、計算効率を維持しながらニューラルネットワークをスケールするための強力なパラダイムとして登場した。
本稿では,動的トークンレベルのエキスパートアクティベーションと層幅適応キャパシティアロケーションによって制約を緩和する新しいMoEフレームワークであるDynaMoEを紹介する。
論文 参考訳(メタデータ) (2026-03-02T10:25:56Z) - Rethinking Efficient Mixture-of-Experts for Remote Sensing Modality-Missing Classification [33.302856478333524]
リモートセンシングにおけるマルチモーダル分類は、環境干渉、センサーの故障、大気の影響によって生じるモダリティの欠如に悩まされることが多い。
既存の2段階適応法は計算コストが高く、訓練中に完全なマルチモーダルデータを仮定し、その一般化を実世界の不完全性に制限する。
マルチタスク学習問題として欠落したモダリティを再構成するMissing-Aware Mixture-of-Lorasフレームワークを提案する。
論文 参考訳(メタデータ) (2025-11-14T16:31:37Z) - Mixture-of-Experts for Personalized and Semantic-Aware Next Location Prediction [20.726107072683575]
NextLocMoEは、大きな言語モデル(LLM)上に構築され、デュアルレベルのMixture-of-Experts(MoE)設計を中心に構築された、新しいフレームワークである。
我々のアーキテクチャは2つの特別なモジュールで構成されている: ロケーションセマンティックス MoE は、位置の豊富な機能的意味をエンコードする埋め込みレベルで動作し、パーソナライズされた MoE は、トランスフォーマーのバックボーンに埋め込まれ、個々のユーザーモビリティパターンに動的に適応する。
論文 参考訳(メタデータ) (2025-05-30T13:45:19Z) - Dita: Scaling Diffusion Transformer for Generalist Vision-Language-Action Policy [73.75271615101754]
本稿では,Transformerアーキテクチャを活用した拡張性のあるフレームワークであるDitaについて紹介する。
Ditaはコンテキスト内コンディショニング(context conditioning)を採用しており、歴史的観察から生の視覚トークンと識別されたアクションをきめ細やかなアライメントを可能にする。
Ditaは、さまざまなカメラパースペクティブ、観察シーン、タスク、アクションスペースの横断的なデータセットを効果的に統合する。
論文 参考訳(メタデータ) (2025-03-25T15:19:56Z) - Diffusion Transformer Policy [48.50988753948537]
本稿では,拡散変圧器ポリシー(Diffusion Transformer Policy)と呼ばれる多モード拡散変圧器を提案し,連続的なエンドエフェクタ動作をモデル化する。
トランスのスケーリング機能を活用することで、提案手法は、多種多様なロボットデータセットにわたる継続的エンドエフェクタアクションを効果的にモデル化することができる。
論文 参考訳(メタデータ) (2024-10-21T12:43:54Z) - A Practitioner's Guide to Continual Multimodal Pretraining [83.63894495064855]
マルチモーダル・ファンデーション・モデルは視覚と言語を交わす多くのアプリケーションに役立っている。
モデルを更新し続けるために、継続事前トレーニングの研究は主に、大規模な新しいデータに対する頻度の低い、差別的な更新、あるいは頻繁に行われるサンプルレベルの更新のシナリオを探求する。
本稿では,FoMo-in-Flux(FoMo-in-Flux)について紹介する。
論文 参考訳(メタデータ) (2024-08-26T17:59:01Z) - Global-to-Local Modeling for Video-based 3D Human Pose and Shape
Estimation [53.04781510348416]
フレーム内精度とフレーム間スムーズさにより,映像に基づく3次元人間のポーズと形状推定を評価する。
エンドツーエンドフレームワークGLoT(Global-to-Local Transformer)における長期的・短期的相関のモデル化を構造的に分離することを提案する。
我々のGLoTは、一般的なベンチマーク(3DPW、MPI-INF-3DHP、Human3.6M)において、最も低いモデルパラメータを持つ従来の最先端の手法を上回る。
論文 参考訳(メタデータ) (2023-03-26T14:57:49Z) - ScaleFormer: Revisiting the Transformer-based Backbones from a
Scale-wise Perspective for Medical Image Segmentation [16.995195979992015]
医用画像セグメンテーションのための新しいビジョントランスフォーマーベースのバックボーンであるScaleFormerを提案する。
スケールワイド・スケール・イン・スケール・トランスフォーマーは,CNNをベースとした局所的特徴と,トランスフォーマーをベースとしたグローバルなキューをそれぞれのスケールで組み合わせるように設計されている。
簡易かつ効果的な空間認識型大規模変圧器は,複数のスケールで接続領域間で相互作用するように設計されている。
論文 参考訳(メタデータ) (2022-07-29T08:55:00Z) - Crowd Counting via Hierarchical Scale Recalibration Network [61.09833400167511]
本稿では,群集カウントの課題に取り組むために,階層型大規模校正ネットワーク(HSRNet)を提案する。
HSRNetは、リッチなコンテキスト依存をモデル化し、複数のスケール関連情報を再検討する。
提案手法は,様々なノイズを選択的に無視し,適切な群集スケールに自動的に焦点を合わせることができる。
論文 参考訳(メタデータ) (2020-03-07T10:06:47Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。