論文の概要: SUNTA: Hierarchical Video Prediction with Surprise-based Chunking
- arxiv url: http://arxiv.org/abs/2607.02087v1
- Date: Thu, 02 Jul 2026 12:27:54 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 19:45:08.824294
- Title: SUNTA: Hierarchical Video Prediction with Surprise-based Chunking
- Title(参考訳): SUNTA:サプライズベースのチャンキングによる階層的ビデオ予測
- Authors: Tomoshi Iiyama, Masahiro Suzuki, Yutaka Matsuo,
- Abstract要約: チャンキングは予測エラーによって駆動されるべきであり、より直接的に、より長い範囲のコンテキストが必要な場合を示す。
本研究では,サプライズをベースとしたNested Temporal Abstraction (SUNTA) を提案する。
2次元および3次元環境における映像予測タスクの実験は、SUNTAがベースラインを上回っていることを示す。
- 参考スコア(独自算出の注目度): 26.31264097587371
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Hierarchical state-space models (HSSMs) offer a promising approach to long-horizon prediction by segmenting sequences into temporal chunks. However, their performance hinges on how chunk boundaries are determined. While prior HSSMs typically rely on fixed-length chunking or similarity-based boundary detection, these methods often misalign with the intrinsic temporal structure of the data. We argue that chunking should instead be driven by prediction errors, which more directly indicate when longer-range context becomes necessary. Nevertheless, integrating surprise-based chunking into HSSMs introduces critical challenges, including hierarchical collapse during end-to-end training and the absence of surprise signals during open-loop prediction. To address these issues, we propose Surprise-based Nested Temporal Abstraction (SUNTA), a method that employs a decoupled training strategy to preserve surprise signals and uses internal inconsistency as a top-down surprise metric to determine chunk boundaries within imagined rollouts. Experiments on video prediction tasks in 2D and 3D environments demonstrate that SUNTA outperforms baselines, uniquely maintaining accurate predictions over 250 timesteps, whereas all baselines degrade within the first 10 timesteps.
- Abstract(参考訳): 階層的状態空間モデル(HSSM)は、シーケンスを時間チャンクに分割することで、長期水平予測に有望なアプローチを提供する。
しかし、その性能はチャンク境界を決定する方法に左右される。
以前のHSSMは通常、固定長のチャンキングや類似性に基づく境界検出に頼っているが、これらの手法はデータ固有の時間構造と誤解することが多い。
チャンキングは予測エラーによって駆動されるべきであり、より直接的に、より長い範囲のコンテキストが必要な場合を示す。
それでも、サプライズベースのチャンキングをHSSMに統合することは、エンドツーエンドトレーニング時の階層的崩壊や、オープンループ予測時のサプライズ信号の欠如など、重要な課題をもたらす。
これらの問題に対処するため,サプライズをベースとしたNested Temporal Abstraction (SUNTA) を提案する。
2Dおよび3D環境におけるビデオ予測タスクの実験では、SUNTAはベースラインよりも優れており、250以上のタイムステップで正確な予測を維持している。
関連論文リスト
- Surprised by Attention: Predictable Query Dynamics for Time Series Anomaly Detection [1.7751300245073598]
AxonADは、マルチヘッドアテンションクエリの進化を短い水平方向予測可能なプロセスとして扱う教師なし検出器である。
テール集約型クエリミスマッチスコアは、最近のタイムステップで予測されたクエリとターゲットクエリの相違を測定する。
インターバルアノテーションを用いた車内テレメトリでは、AxonADは強力なベースライン上でのランキング品質と時間的ローカライゼーションを改善している。
論文 参考訳(メタデータ) (2026-03-13T11:40:51Z) - Generative Regression Based Watch Time Prediction for Short-Video Recommendation [36.95095097454143]
短いビデオレコメンデーションシステムでは、時計の時間予測が重要なタスクとして現れている。
最近の研究は、連続時計時間推定を正規回帰タスクに変換することによって、これらの問題に対処しようとしている。
本稿では,WTPをシーケンス生成タスクとして再構成する新しい生成回帰(GR)フレームワークを提案する。
論文 参考訳(メタデータ) (2024-12-28T16:48:55Z) - Spatial Decomposition and Temporal Fusion based Inter Prediction for
Learned Video Compression [59.632286735304156]
学習ビデオ圧縮のための空間分解と時間融合に基づく相互予測を提案する。
SDDに基づく動きモデルと長時間の時間的融合により,提案した学習ビデオはより正確な相互予測コンテキストを得ることができる。
論文 参考訳(メタデータ) (2024-01-29T03:30:21Z) - Streaming Motion Forecasting for Autonomous Driving [71.7468645504988]
ストリーミングデータにおける将来の軌跡を問うベンチマークを導入し,これを「ストリーミング予測」と呼ぶ。
我々のベンチマークは本質的に、スナップショットベースのベンチマークでは見過ごされていない安全上の問題であるエージェントの消失と再出現を捉えている。
我々は,任意のスナップショットベースの予測器をストリーミング予測器に適応させることのできる,"Predictive Streamer"と呼ばれるプラグアンドプレイメタアルゴリズムを提案する。
論文 参考訳(メタデータ) (2023-10-02T17:13:16Z) - Temporal Action Localization with Enhanced Instant Discriminability [66.76095239972094]
時間的行動検出(TAD)は、すべての行動境界とその対応するカテゴリを、トリミングされていないビデオで検出することを目的としている。
本稿では,既存の手法による動作境界の不正確な予測を解決するために,TriDetという一段階のフレームワークを提案する。
実験結果から,複数のTADデータセット上でのTriDetの堅牢性と最先端性能が示された。
論文 参考訳(メタデータ) (2023-09-11T16:17:50Z) - Uncovering the Missing Pattern: Unified Framework Towards Trajectory
Imputation and Prediction [60.60223171143206]
軌道予測は、観測されたシーケンスから実体運動や人間の行動を理解する上で重要な作業である。
現在の方法では、観測されたシーケンスが完了したと仮定し、欠落した値の可能性を無視する。
本稿では,グラフに基づく条件変動リカレントニューラルネットワーク (GC-VRNN) の統一フレームワークを提案する。
論文 参考訳(メタデータ) (2023-03-28T14:27:27Z) - Semi-Supervised Temporal Action Detection with Proposal-Free Masking [134.26292288193298]
PropOsal-free Temporal mask (SPOT) に基づく新しい半教師付き時間行動検出モデルを提案する。
SPOTは最先端の代替品よりも優れている。
論文 参考訳(メタデータ) (2022-07-14T16:58:47Z) - Interpretable Deep Feature Propagation for Early Action Recognition [39.966828592322315]
本研究では,空間的特徴空間における行動パターンの時間的変化を解明し,行動予測に対処する。
我々は、空間的レイアウトを維持しながら、生データからの抽象化を可能にする中間層ConvNet機能で作業する。
我々はKalmanフィルタを用いてエラーのビルドと予測開始時刻の統一に対処する。
論文 参考訳(メタデータ) (2021-07-11T19:40:19Z) - Revisiting Hierarchical Approach for Persistent Long-Term Video
Prediction [55.4498466252522]
従来の手法よりも桁違いに長い予測時間を持つビデオ予測の新しい標準を設定しました。
本手法は,まず意味構造列を推定し,その後,映像から映像への変換により,画素に翻訳することにより,将来的なフレームを予測する。
本手法は,自動車運転と人間のダンスに関する3つの課題データに基づいて評価し,非常に長い時間にわたって複雑なシーン構造と動きを生成できることを実証した。
論文 参考訳(メタデータ) (2021-04-14T08:39:38Z) - A PAC-Bayesian Perspective on Structured Prediction with Implicit Loss
Embeddings [11.711761707845865]
PAC-Bayesは最近、予測分布の厳密なリスクバウンドを生成する能力に関心を寄せている。
我々は,リスクと過剰リスクの2つの一般化境界を示し,ile予測者の行動に対する洞察を与える。
2つの学習アルゴリズムはこれらの境界から導かれる。
論文 参考訳(メタデータ) (2020-12-07T15:19:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。