論文の概要: IMPACT: Attention Is the Interaction Map for Scalable Interaction-Aware World Model Training
- arxiv url: http://arxiv.org/abs/2609.00161v1
- Date: Mon, 31 Aug 2026 18:00:36 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:35.89931
- Title: IMPACT: Attention Is the Interaction Map for Scalable Interaction-Aware World Model Training
- Title(参考訳): IMPACT: スケーラブルなインタラクションを意識した世界モデルトレーニングのためのインタラクションマップ
- Authors: Rongze Tang, Jianjie Fang, Zhaolu Wang, Ziyou Wang, Xvyuan Liu, Haisheng Su, Xin Zhang, Wei Wu, Chen Gao, Yong Li, Zhibo Chen,
- Abstract要約: IMPACTは,事前誘導と目標設定を併用したスケーラブルなインタラクション対応フレームワークである。
IMPACTは、対応するMSE訓練ベースラインを一貫して上回り、相互作用の忠実度、物理的妥当性、視覚的品質を改善している。
- 参考スコア(独自算出の注目度): 18.292611164084537
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: World models have made remarkable progress in action-conditioned future prediction for embodied agents, yet still struggle to model physically plausible interactions. Existing approaches address this limitation by constraining the generation process with external representations encoding motion, geometry, or semantics. Obtaining these spatiotemporally dense representations typically requires auxiliary estimators or manual annotations, limiting training scalability. We instead revisit the training objective and identify a supervision-allocation mismatch under the globally averaged mean squared error (MSE) denoising objective: prevalent static content dominates the optimization signal, leaving sparse dynamic-object regions critical to interaction generation disproportionately under-supervised. Motivated by this observation, we introduce IMPACT, a scalable Interaction-aware Model training framework with Prior-guided Attention Calibration and Targeting. IMPACT uses cross-attention associated with manipulated-object tokens as an internal spatiotemporal prior for action-conditioned changes. It samples candidate regions from this prior, calibrates them with detached local prediction errors to construct an interaction map, and uses the map to reweight denoising supervision, requiring neither external representations nor inference-time modifications. Extensive experiments on robot-arm and human-hand manipulation, spanning diverse control modalities and DiT backbones, show that IMPACT consistently outperforms the corresponding MSE-trained baselines, improving interaction fidelity, physical plausibility, and visual quality.
- Abstract(参考訳): 世界モデルは、体現剤の行動条件による将来の予測において顕著な進歩を遂げてきたが、物理的に妥当な相互作用のモデル化には依然として苦戦している。
既存のアプローチでは、生成プロセスを運動、幾何学、意味論をコードする外部表現で制限することで、この制限に対処している。
これらの時空間的に密度の高い表現を取得するには、トレーニングのスケーラビリティを制限する補助的な推定器や手動のアノテーションが必要になる。
その代わりに、トレーニング対象を再検討し、世界平均平均二乗誤差(MSE)に基づく監督-配置ミスマッチを特定する。
この観察に動機づけられたIMPACTは,事前注意校正と目標設定を併用した,スケーラブルな対話型モデルトレーニングフレームワークである。
IMPACTは、操作対象トークンに関連付けられたクロスアテンションを、アクション条件付き変更の時空間前処理として使用する。
以前の候補領域を抽出し、分離した局所予測誤差を校正して相互作用マップを構築し、このマップを使用して、外部表現も推論時間の変更も必要とせず、監督の重み付けを行う。
多様な制御モードとDiTバックボーンにまたがるロボットアームと人手操作に関する広範囲な実験は、IMPACTが対応するMSEトレーニングベースラインを一貫して上回り、相互作用の忠実さ、物理的妥当性、視覚的品質を改善していることを示している。
関連論文リスト
- CAER: Causal Action Effect Reweighting for World Model Training [31.737118584204342]
本稿では,その行動に因果的に影響される可能性のあるトークンに対する監督を再分配する訓練パラダイムであるCausal Action Effect Reweighting(CAER)を紹介する。
CAERは、モデル自身の予測とアクション条件なしでこれらのトークンをオンラインにローカライズし、結果のエフェクトマップを、合計係数の質量を保存する重みに正規化し、使用される場所だけを変える。
不均一なアクション条件付きワールドモデルタスクによる実験により、CAERは一様MSEトレーニングよりも優れたソリューションに収束し、生成したビデオの物理的一貫性、制御性、視覚的品質が一貫した改善が得られた。
論文 参考訳(メタデータ) (2026-08-31T14:49:56Z) - DyG$^2$T: Modeling Object Dynamics with 3D Gaussian Temporal-Spatial Particle Graph Transformer [86.4618122245946]
DyG$2$Tは動的モデリングフレームワークで、キーポイント表現を空間的に完了し、時間的に識別することでオブジェクトの運動軌跡を推定する。
合成データセットと実世界のデータセットの両方の実験は、DyG$2$Tが正確な動的モデリングと推論を実現することを示した。
論文 参考訳(メタデータ) (2026-08-19T03:44:28Z) - Making Foresight Actionable: Repurposing Representation Alignment in World Action Models [57.23863557252883]
World Action Models (WAMs)は、ビデオ生成モデルを使用して将来のシーンの進化をモデル化することで、ロボット操作のための有望なルートを提供する。
目に見える未来を生み出すことは 必ずしも正確な行動の抽出を 保証するとは限らない
本稿では,Action-Grounded Representation Alignmentの目的であるAGRAを提案する。
論文 参考訳(メタデータ) (2026-06-10T15:31:25Z) - HarmoWAM: Harmonizing Generalizable and Precise Manipulation via Adaptive World Action Models [58.191567345416836]
世界行動モデル(WAM)は、物理力学のモデリングによるロボット制御のための有望なパラダイムとして登場した。
HarmoWAMは、予測と反応の制御を統一するために世界モデルを完全に活用し、一般的なトランジットと正確な操作を可能にする。
実世界の6つのロボットタスクにまたがる3つのトレーニング未確認テスト環境を構築し、背景、位置、オブジェクトの意味のバリエーションをカバーした。
論文 参考訳(メタデータ) (2026-05-11T17:59:56Z) - IMPACT-Scribe: Interactive Temporal Action Segmentation with Boundary Scribbles and Query Planning [75.72434806468884]
IMPACT-Scribeは高密度ラベリングのための修正駆動のフレームワークである。
不確実性を認識した境界管理、局所的な提案モデリング、コストを意識したクエリ計画、構造化された伝搬、修正駆動適応を組み合わせる。
実験と人間の研究により、このクローズドループの設計は、努力ごとのラベル付け品質を改善し、境界精度を高め、時間とともにより良い人間機械の相互作用を促進することが示されている。
論文 参考訳(メタデータ) (2026-05-03T01:45:58Z) - Mitigating Attention Hacking in Preference-Based Reward Modeling via Interaction Distillation [62.14692332209628]
インタラクション蒸留(Interaction Distillation)は、注意レベル最適化によるより適切な嗜好モデリングのための新しいトレーニングフレームワークである。
最先端のRM最適化法と比較して、より安定で一般化可能な報酬信号を提供する。
論文 参考訳(メタデータ) (2025-08-04T17:06:23Z) - Zero-Shot EEG-to-Gait Decoding via Phase-Aware Representation Learning [9.49131859415923]
ドメイン一般化型脳波-モーションデコーディングフレームワークであるNeuroDyGaitを提案する。
構造化されたコントラスト表現学習とリレーショナルドメインモデリングを使用して、脳波とモーション埋め込みのセマンティックアライメントを実現する。
ベンチマークデータセットのクロスオブジェクト歩行復号における適応や優れた性能を必要とせずに、見えない個人に対するゼロショットモーション予測を実現する。
論文 参考訳(メタデータ) (2025-06-24T06:03:49Z) - Understanding GUI Agent Localization Biases through Logit Sharpness [15.986679553468989]
MLLM(Multimodal large language model)は、GUIエージェントが言語を空間的アクションにグラウンドすることでオペレーティングシステムと対話することを可能にする。
有望な性能にもかかわらず、これらのモデルはしばしば、信頼性を損なう幻覚的局所化誤差を示す。
モデル予測を4つの異なるタイプに分類し,従来の精度測定値を超える不確実な障害モードを明らかにするための,きめ細かい評価フレームワークを提案する。
論文 参考訳(メタデータ) (2025-06-18T12:55:35Z) - Cost-effective Interactive Attention Learning with Neural Attention
Processes [79.8115563067513]
対話型注意学習(Interactive Attention Learning, IAL)と呼ばれる対話型学習フレームワークを提案する。
IALは、人間のアノテーションが不足しているため、過度に適合する傾向がある。
我々は,サンプル効率のよい注意機構と,コスト効率のよいインスタンスと機能の再ランクアルゴリズムを提案することで,これらの課題に対処する。
論文 参考訳(メタデータ) (2020-06-09T17:36:41Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。