論文の概要: Hi-FLoop: Hierarchical State-Feedback Loops for Multi-Timescale World Modeling
- arxiv url: http://arxiv.org/abs/2609.08796v2
- Date: Wed, 09 Sep 2026 12:40:17 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-10 19:44:08.677654
- Title: Hi-FLoop: Hierarchical State-Feedback Loops for Multi-Timescale World Modeling
- Title(参考訳): Hi-FLoop:マルチ時間世界モデリングのための階層的状態フィードバックループ
- Authors: Rx Fan, Z Han,
- Abstract要約: Hi-FLoopはブランチ一貫性のあるマルチスケールステートフィードバックフレームワークである。
各コミットは、実行されるプレフィックスのみを新しい事実としてフィードバックする。
共同プレビューインタラクションはスパース指向の将来のグラフを誘導する。
- 参考スコア(独自算出の注目度): 0.09821874476902968
- License: http://creativecommons.org/publicdomain/zero/1.0/
- Abstract: Multi-agent traffic simulation seeks diverse, coordinated, and physically realistic futures from maps and observed history. Long-horizon closed-loop generation must reconcile multiple decision time scales while its context evolves with generated states. Existing methods often unfold long futures from an initial scene and resolve intent, interaction, and motion monolithically, weakening cross-scale consistency and adaptation. Multimodal rollout poses a further consistency problem: independently reselecting modes across agents or commits can stitch together incompatible futures instead of preserving a coherent joint branch. We present Hi-FLoop, a branch-consistent multi-timescale state-feedback framework. Eight scene-level Worlds represent joint hypotheses; all agents share one selected World identity throughout all 16 commits of an 8-second rollout, while Goal, Preview, and Control states adapt within that branch. An 8-second Goal anchors intent, a 2-second Preview coordinates interactions, and 1-second Control produces physical motion. Every 0.5-second commit feeds back only its executed prefix as new facts, while unexecuted hypotheses never enter factual memory. Joint Preview Interaction induces a sparse directed future graph and uses conflict probabilities and signed arrival-time differences to refine interaction-aware motion. For generated-state recovery, a prefix-frozen A-to-B cascade transfers typed physical state and the branch index--but no latent state--from a frozen prefix model to an independently parameterized recovery model. On the full H-D public-validation split of 955 scenarios, the S2.1 cascade obtains an 8-second scene-joint ADE-at-joint-minFDE@8/joint-minFDE@8 of 2.048/6.384 m when one World must explain all evaluated agents. Agent-centric oracle-minADE@8 is 0.526 m at 6 seconds and 0.875 m at 8 seconds.
- Abstract(参考訳): マルチエージェント交通シミュレーションは、地図や観測された歴史から多様な、協調的で、物理的に現実的な未来を求める。
ロングホライゾン閉ループ生成は、複数の決定時間スケールを調整しなければならないが、そのコンテキストは生成された状態とともに進化する。
既存の方法は、しばしば初期のシーンから長い未来を広げ、意図、相互作用、動きをモノリシックに解決し、大規模な一貫性と適応を弱める。
エージェントやコミット間でモードを独立に再選択することは、一貫性のないジョイントブランチを保存するのではなく、互換性のない未来を縫い合わせることができる。
分岐一貫性を持つマルチタイム状態フィードバックフレームワークであるHi-FLoopを提案する。
8つのシーンレベルワールドは共同仮説を表しており、すべてのエージェントは8秒のロールアウトで16のコミットすべてで1つの選択されたワールドアイデンティティを共有し、ゴール、プレビュー、コントロールのステートはそのブランチ内で適応する。
8秒のゴールアンカーと2秒のプレビューが相互作用をコーディネートし、1秒のコントロールが物理運動を生成する。
0.5秒毎のコミットは実行されるプレフィックスのみを新しい事実として返送するが、実行されていない仮説が事実記憶に入ることはない。
共同プレビューインタラクションは、スパース指向の将来のグラフを誘導し、競合確率と署名された到着時間差を使用して、インタラクション対応の動作を洗練する。
生成状態回復のために、プレフィックスフリーズA-to-Bカスケードは、タイプされた物理状態と分岐インデックス---------------凍結プレフィックスモデルから独立にパラメータ化された回復モデルへ転送する。
955のシナリオの完全なH-D公開バリデーション分割で、S2.1カスケードは、8秒のシーンジョイント ADE-at-joint-minFDE@8/joint-minFDE@8 of 2.048/6.384 m を得る。
エージェント中心のOlacle-minADE@8は6秒で0.526m、8秒で0.875mである。
関連論文リスト
- TRACT: Temporally Routed Action Chunks with Chronological Phase Authority for Contact-Rich Manipulation [33.980402689056895]
アクションチャンキングは、ロボット模倣学習の効果的な意思決定の地平を短くする。
本稿では, 位相構造を有する動作チャンキングを, 将来の地平線内での1つのCURRENT変種境界に分解するTRACTを提案する。
論文 参考訳(メタデータ) (2026-07-31T10:59:14Z) - FBFM: A Training-Free Asynchronous Feedback Mechanism for Flow-Matching in World-Action Models Execution [50.18922379062543]
フィードバックフローマッチング(Feedback Flow Matching, FBFM)は、アクティブに生成されたチャンク内で再接地を行うトレーニング不要な推論機構である。
トレーニング不要であるため、このメカニズムは予期せぬ事象に対する応答性を改善し、長時間の作業におけるドリフトを抑制する。
我々は,FBFMを第2世代WAMと第2世代WAMの両方で評価した。
論文 参考訳(メタデータ) (2026-07-31T10:11:09Z) - Rethinking Event-Based Object Dtection through Representation-Level Temporal Aggregation and Model-Level Hypergraph Reasoning [65.08890312027314]
イベントカメラはマイクロ秒レベルの時間分解能、低レイテンシ、高ダイナミックレンジを提供する。
Event Dual Temporal-Relational Aggregation Detector (Ev-DTAD)は、表現レベルの時間エンコーディングとモデルレベルの時間-ハイパーグラフ推論を統合する。
Ev-DTADは、コンパクトな時間的表現と時間的ハイパーグラフの特徴的推論の相補性を検証し、競争精度と効率のトレードオフを実現する。
論文 参考訳(メタデータ) (2026-05-09T09:20:34Z) - Symbolic-Vector Attention Fusion for Collective Intelligence [0.9494375075678443]
本稿では,集団知能のための結合エンジンであるSybolic-pass Attention Fusion (SVAF)を紹介する。
SVAFは、各エージェント間の信号を7つの型付きセマンティックフィールドに分解し、学習された融合ゲートを通じてそれぞれを評価し、リミックスを生成する。
273のシナリオから237Kサンプルをトレーニングし、SVAFは78.7%の3クラス精度を達成した。
論文 参考訳(メタデータ) (2026-04-05T04:10:15Z) - Agentic World Modeling for 6G: Near-Real-Time Generative State-Space Reasoning [70.56067503630486]
第6世代(6G)インテリジェンスは、流動的なトークン予測ではなく、想像と選択の能力を校正している、と我々は主張する。
We showed that WM-MS3M cuts mean absolute error (MAE) by 1.69% vs MS3M with 32% less parameters and similar latency, and achieve a 35-80% lower root mean squared error (RMSE) than attention/hybrid baselines with 2.3-4.1x faster inference。
論文 参考訳(メタデータ) (2025-11-04T17:22:22Z) - Multi-scale Temporal Prediction via Incremental Generation and Multi-agent Collaboration [16.581438325440285]
手術シーンにおけるMSTP(Multi-Scale Temporal Prediction)タスクの形式化について検討した。
我々は、複数の状態スケールと時間スケールにまたがる同期アノテーションを特徴とする最初のMSTPベンチマークを紹介する。
まず,時間スケール拡大時に最新のビジュアルプレビューを連続的に合成するプラグイン・アンド・プレイインクリメンタル・ジェネレーション・モジュールを提案する。
次に,多状態予測のための意思決定型マルチエージェント協調フレームワークを提案する。
論文 参考訳(メタデータ) (2025-09-22T07:22:27Z) - DIR-AS: Decoupling Individual Identification and Temporal Reasoning for
Action Segmentation [84.78383981697377]
完全な教師付きアクションセグメンテーションは、高密度アノテーションによるフレームワイドアクション認識に作用し、しばしば過剰なセグメンテーションの問題に悩まされる。
本研究では, 時間的ピラミッド拡張と時間的ピラミッドプールを併用して, 効率的なマルチスケールアテンションを実現するため, 新たなローカル・グローバルアテンション機構を開発した。
GTEAでは82.8%(+2.6%)、Breakfastでは74.7%(+1.2%)の精度を実現し,本手法の有効性を示した。
論文 参考訳(メタデータ) (2023-04-04T20:27:18Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。