論文の概要: StreamHOI: Interaction-aware Temporal Memory Adaptation for Streaming HOI Video Generation
- arxiv url: http://arxiv.org/abs/2607.20174v1
- Date: Wed, 22 Jul 2026 14:06:39 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-23 18:51:38.106762
- Title: StreamHOI: Interaction-aware Temporal Memory Adaptation for Streaming HOI Video Generation
- Title(参考訳): StreamHOI: ストリーミングHOIビデオ生成のためのインタラクション対応時間メモリ適応
- Authors: Zejing Rao, Haoxian Zhang, Xiaoqiang Liu, Yiping Meng, Guoxin Zhang, Pengfei Wan, Fan Tang, Tong-Yee Lee,
- Abstract要約: 長周期HOIビデオ生成のための低遅延ストリーミングフレームワークであるemphStreamHOIを提案する。
StreamHOIは、強い相互作用の妥当性、オブジェクトの忠実さ、人間の品質と効率を達成し、0.75秒のレイテンシで17.6 FPSに達する。
- 参考スコア(独自算出の注目度): 31.081864027419016
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Existing human--object interaction (HOI) video generation methods are largely limited to offline short-video generation with complex driving conditions, making them unsuitable for real-time interactive applications. We present \emph{StreamHOI}, a low-latency streaming framework for long-duration HOI video generation. Instead of converting heavily conditioned HOI pipelines into streaming systems, we study how an image-to-video streaming generator should organize historical memory to preserve interactions under bounded latency. We find that the standard sink-local memory design faces a trade-off in streaming HOI generation, and different transformer blocks show different historical-memory preferences for HOI regions and surrounding regions. To match memory composition with block behavior, StreamHOI performs offline HOI-aware block profiling and applies bias-guided memory-specialized training to adapt the generator to block-specific memory layouts. We further introduce a memory distance scaling module to strengthen long-range access to early interaction states. Extensive comparisons with both long-video baselines and recent HOI generation methods demonstrate that StreamHOI achieves strong interaction plausibility, object fidelity, human quality and efficiency, reaching 17.6 FPS with 0.75s first-chunk latency.
- Abstract(参考訳): 既存のヒューマンオブジェクトインタラクション(HOI)ビデオ生成方法は、複雑な駆動条件を持つオフラインのショートビデオ生成に限られており、リアルタイムのインタラクティブアプリケーションには適さない。
本稿では,長期HOIビデオ生成のための低遅延ストリーミングフレームワークである \emph{StreamHOI} を提案する。
本研究では、高条件のHOIパイプラインをストリーミングシステムに変換する代わりに、画像間ストリーミングジェネレータが履歴メモリを編成して、バウンドレイテンシ下でのインタラクションを保存する方法を検討する。
標準シンクローカルメモリ設計はストリーミングHOI生成のトレードオフに直面しており、異なるトランスフォーマーブロックはHOI領域と周辺領域の異なる履歴メモリ嗜好を示す。
メモリ構成とブロック動作を一致させるために、StreamHOIはオフラインのHOI対応ブロックプロファイリングを実行し、バイアス誘導型メモリ特殊化トレーニングを適用して、ジェネレータをブロック固有のメモリレイアウトに適応させる。
さらに、初期相互作用状態への長距離アクセスを強化するために、メモリ距離スケーリングモジュールを導入する。
長ビデオベースラインと最近のHOI生成手法の双方と比較して、StreamHOIは強い相互作用の可視性、オブジェクトの忠実性、人間の品質と効率性を達成し、0.75秒のレイテンシで17.6 FPSに達する。
関連論文リスト
- LiveStarPro: Proactive Streaming Video Understanding with Hierarchical Memory for Long-Horizon Streams [59.485485426790966]
このLiveStarProは、長時間のストリーミング上でのプロアクティブなビデオ理解のために設計されたライブストリーミングアシスタントである。
LiveStarProは既存のメソッドを一貫して上回り、セマンティックな正確性は28.9%向上した。
そのストリーミングキーバリューキャッシュは、キャッシュなしで同じモデル上で1.58倍の推論速度を得る。
論文 参考訳(メタデータ) (2026-06-16T11:18:05Z) - SlotMemory: Object-Centric KV Memory for Streaming Long-Video Generation [30.157534925157844]
SlotMemoryは、ビデオ拡散をストリーミングするためのオブジェクト中心のKey-Valueメモリメカニズムである。
我々のアプローチでは、イベントが発生したときのメモリ抽象化を、トランスフォーマーのキー-値多様体を分解することで、"何"が表現されているかに変換する。
論文 参考訳(メタデータ) (2026-05-29T09:04:26Z) - Attend Locally, Remember Linearly: Linear Attention as Cross-Frame Memory for Autoregressive Video Diffusion [61.57938553036056]
ARL2は、二次的なクロスフレームアテンションを固定サイズのリカレント状態に置き換えるハイブリッドアテンションモジュールである。
本研究では,フレーム内ソフトマックスブランチとフレーム間リカレント線形ブランチの2つに分割し,ストリームコンテキストの固定サイズ状態を維持する。
75%の層がハイブリッドリニアアテンションに置き換えられ、最大2.26ウォールクロックのスピードアップと54%のメモリ削減を実現した。
論文 参考訳(メタデータ) (2026-05-15T19:33:45Z) - SWIFT: Prompt-Adaptive Memory for Efficient Interactive Long Video Generation [31.105007908298003]
ストリーミング長ビデオ生成は、連続的なセマンティックスイッチングにおいて中心的な課題に直面している。
現在のアプローチは、プロンプトバウンダリや固定メモリ予算でのキャッシュ再構築に依存している。
マルチプロンプト長ビデオ生成のためのトレーニングフリーフレームワークであるSWIFTを提案する。
論文 参考訳(メタデータ) (2026-05-10T09:37:56Z) - Long-Horizon Streaming Video Generation via Hybrid Attention with Decoupled Distillation [16.611062315689306]
本稿では,時間的情報保持と計算効率を協調的に最適化するハイブリッド・フォースを提案する。
我々のモデルは、量子化やモデル圧縮なしで、単一のNVIDIA H100 GPU上で29.5 FPSでリアルタイムな832x480ビデオ生成を実現する。
論文 参考訳(メタデータ) (2026-04-11T08:54:07Z) - MemFlow: Flowing Adaptive Memory for Consistent and Efficient Long Video Narratives [54.07515675393396]
既存のソリューションは、事前に定義された戦略で過去のフレームを圧縮することでメモリを維持する。
我々はこの問題に対処するためにMemFlowを提案する。
MemFlowは、無視可能な負担を伴う、卓越した長いコンテキスト整合性を実現する。
論文 参考訳(メタデータ) (2025-12-16T18:59:59Z) - VideoSSM: Autoregressive Long Video Generation with Hybrid State-Space Memory [42.2374676860638]
自己回帰(AR)拡散は、フレームを因果的に生成することで、ストリーミングでインタラクティブな長ビデオ生成を可能にする。
微小スケールの地平線上でのコヒーレンスを維持することは、蓄積したエラー、動きのドリフト、およびコンテンツ反復のために依然として困難である。
我々は、AR拡散をハイブリッドな状態空間メモリと統合する長ビデオモデルVideoSSMを提案する。
論文 参考訳(メタデータ) (2025-12-04T07:06:02Z) - RELIC: Interactive Video World Model with Long-Horizon Memory [74.81433479334821]
真のインタラクティブな世界モデルは、リアルタイムの長距離ストリーミング、一貫した空間記憶、正確なユーザ制御を必要とする。
この3つの課題を完全に解決する統合フレームワークであるRELICを紹介します。
単一の画像とテキスト記述が与えられた後、RELICは任意のシーンをリアルタイムにメモリを意識した長期探索を可能にする。
論文 参考訳(メタデータ) (2025-12-03T18:29:20Z) - Mixture of Contexts for Long Video Generation [72.96361488755986]
我々は長文ビデオ生成を内部情報検索タスクとして再放送する。
本稿では,学習可能なスパークアテンション・ルーティング・モジュールであるMixture of Contexts (MoC) を提案する。
データをスケールしてルーティングを徐々に分散させていくと、そのモデルは計算を適切な履歴に割り当て、アイデンティティ、アクション、シーンを数分のコンテンツで保存する。
論文 参考訳(メタデータ) (2025-08-28T17:57:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。