論文の概要: Diffusion ReRoll: Revisable Denoising for Robotic Sequential Prediction
- arxiv url: http://arxiv.org/abs/2607.19919v1
- Date: Wed, 22 Jul 2026 08:50:40 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-23 18:51:38.033995
- Title: Diffusion ReRoll: Revisable Denoising for Robotic Sequential Prediction
- Title(参考訳): 拡散リロール:ロボットシークエンシャル予測のための修正可能なデノジング
- Authors: Seonsoo Kim, Seongil Hong, Jun-Gill Kang,
- Abstract要約: Diffusion ReRollは、ロボットシーケンシャル予測のための拡散ベースのフレームワークで、水平線上での修正可能な復調を可能にする。
我々は、長期計画、政策学習、統合ビデオアクションモデリングにおける拡散強制に基づくフルシーケンス拡散と因果分解に対して評価を行った。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We propose Diffusion ReRoll, a diffusion-based framework for robotic sequential prediction that enables revisable denoising over horizons. Existing diffusion-based sequence predictors typically perform a single monotonic denoising process. In contrast, Diffusion ReRoll selectively re-noises regions that have become locally stable while the remaining regions continue denoising, so the re-noised regions can be refined again using context from the rest of the horizon. This structured re-noising enables iterative cross-horizon revision, allowing earlier and later segments to revise one another, while maintaining local consistency. We evaluate Diffusion ReRoll against full-sequence diffusion and causal denoising based on Diffusion Forcing across long-horizon planning, policy learning, and unified video-action modeling. On OGBench PointMaze and AntMaze, Diffusion ReRoll achieves relative gains in average success rate of 21% over Diffusion Forcing in matched guidance-based planning and 23% over Diffuser in matched goal-inpainting. In diffusion-policy-style action prediction, Diffusion ReRoll improves average success by 56.5% relative to Diffusion Policy across different prediction horizons and history lengths on the LIBERO-10 multi-task benchmark. In unified video-action prediction, Diffusion ReRoll improves policy and inverse dynamics performance, especially under out-of-distribution evaluation, and achieves the best action-video consistency. These results support structured re-noising as an effective mechanism for revisable robotic sequence generation.
- Abstract(参考訳): Diffusion ReRollはロボットシーケンシャル予測のための拡散に基づくフレームワークで、水平線上での修正可能な復調を可能にする。
既存の拡散に基づくシーケンス予測器は、通常単一の単調な復調処理を行う。
対照的に、Diffusion ReRollは、残りの領域が分解を続ける間、局所的に安定になった領域を選択的に再ノイズ化するので、残りの領域からのコンテキストを用いて再ノイズ化領域を再び洗練することができる。
この構造化された再ノイズにより、反復的なクロス水平修正が可能となり、早期と後期のセグメントは、局所的な一貫性を維持しながら、相互に修正できる。
本研究では、長期計画、ポリシー学習、統合ビデオアクションモデリングにおける拡散強制に基づく全系列拡散と因果分解に対する拡散遅延を評価する。
OGBench PointMazeとAntMazeでは、Diffusion ReRollは、マッチしたガイダンスベースの計画におけるDiffusion Forcingの平均成功率を21%、マッチしたゴールペンディングにおけるDiffuserよりも23%で達成している。
Diffusion ReRollは、拡散政治的な行動予測において、LIBERO-10マルチタスクベンチマークの様々な予測水平線と履歴の長さにわたる拡散政策と比較して平均成功率を56.5%向上させる。
統合されたビデオアクション予測において、Diffusion ReRollは、特にアウト・オブ・ディストリビューション評価の下で、ポリシーと逆ダイナミクスのパフォーマンスを改善し、最高のアクション・ビデオ整合性を達成する。
これらの結果は、リビジョン可能なロボットシークエンス生成の有効なメカニズムとして、構造化された再ノイズ化を支援する。
関連論文リスト
- SATB-VR: Training Few-Step Video Restoration Diffusion Model using SNR-Aware Trajectory Blending [55.764018145256216]
本稿では,補助予測器を介してデノナイジングプロセスを開始する数ステップのパラダイムであるSATB-VRを提案する。
我々は,SATB-VRが,合成,実世界,AIGCベンチマークにおける既存のアプローチに対して良好に動作することを示す。
論文 参考訳(メタデータ) (2026-06-27T01:32:16Z) - ForeDiffusion: Foresight-Conditioned Diffusion Policy via Future View Construction for Robot Manipulation [37.67451041903772]
拡散戦略は、高次元の動作シーケンスを段階的に denoising することによって、高度な視覚運動制御を行う。
本稿では,予測される将来のビュー表現を拡散過程に注入することにより,フォレスト・コンディションド・ディフュージョン(フォレスト・ディフュージョン)を提案する。
ForeDiffusionは、タスク全体の平均成功率80%を達成し、既存のメインストリーム拡散法を23%上回った。
論文 参考訳(メタデータ) (2026-01-19T10:28:42Z) - Sequence-Adaptive Video Prediction in Continuous Streams using Diffusion Noise Optimization [63.37868191173104]
本稿では,事前学習した拡散モデルをビデオストリームに継続的に適応させる手法を提案する。
拡散雑音最適化(SAVi-DNO)を用いた逐次適応映像予測手法について
実験により,Ego4DとOpenDV-YouTubeの長いビデオ上でのFVD,SSIM,PSNR測定値に基づく性能向上が実証された。
論文 参考訳(メタデータ) (2025-11-23T02:58:10Z) - Exploring Iterative Refinement with Diffusion Models for Video Grounding [17.435735275438923]
ビデオグラウンドイングは、所定の文クエリに対応する未編集ビデオにおいて、ターゲットモーメントをローカライズすることを目的としている。
条件生成タスクとしてビデオグラウンドを定式化する拡散モデルを用いた新しいフレームワークであるDiffusionVGを提案する。
論文 参考訳(メタデータ) (2023-10-26T07:04:44Z) - Single and Few-step Diffusion for Generative Speech Enhancement [18.487296462927034]
拡散モデルは音声強調において有望な結果を示した。
本稿では,2段階の学習手法を用いて,これらの制約に対処する。
提案手法は定常的な性能を保ち,従って拡散ベースラインよりも大きく向上することを示す。
論文 参考訳(メタデータ) (2023-09-18T11:30:58Z) - DiffusionVMR: Diffusion Model for Joint Video Moment Retrieval and
Highlight Detection [38.12212015133935]
DiffusionVMRという新しいフレームワークは、2つのタスクを統一された条件記述生成プロセスとして再定義するために提案されている。
5つの広く利用されているベンチマークで実施された実験は、提案されたDiffusionVMRの有効性と柔軟性を示している。
論文 参考訳(メタデータ) (2023-08-29T08:20:23Z) - DiffTAD: Temporal Action Detection with Proposal Denoising Diffusion [137.8749239614528]
そこで我々は,時間的行動検出(TAD)の新しい定式化を提案し,拡散を抑えるDiffTADを提案する。
入力されたランダムな時間的提案を考慮すれば、トリミングされていない長いビデオが与えられたアクションの提案を正確に得ることができる。
論文 参考訳(メタデータ) (2023-03-27T00:40:52Z) - DiffusionAD: Norm-guided One-step Denoising Diffusion for Anomaly Detection [80.20339155618612]
DiffusionADは、再構成サブネットワークとセグメンテーションサブネットワークからなる、新しい異常検出パイプラインである。
高速なワンステップデノゲーションパラダイムは、同等の再現品質を維持しながら、数百倍の加速を達成する。
異常の出現の多様性を考慮し、複数のノイズスケールの利点を統合するためのノルム誘導パラダイムを提案する。
論文 参考訳(メタデータ) (2023-03-15T16:14:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。