論文の概要: Persistent Object Narratives for Token-Efficient Video Language Models
- arxiv url: http://arxiv.org/abs/2608.04866v1
- Date: Wed, 05 Aug 2026 13:59:04 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.948549
- Title: Persistent Object Narratives for Token-Efficient Video Language Models
- Title(参考訳): トークン効率の良いビデオ言語モデルのための永続的オブジェクトナラティブ
- Authors: Junzhe Chen, Siyuan Meng, Xiaojie Guo,
- Abstract要約: ビデオ大言語モデル(ビデオ-LLM)は、オープンなビデオ理解において大きく進歩している。
SlotNarrativeは、ビデオがコンパクトなオブジェクト状態トークンで表現される永続的なオブジェクトの物語に整理されるスロットベースのインタフェースである。
- 参考スコア(独自算出の注目度): 10.96152392810444
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Video large language models (Video-LLMs) have made strong progress in open-ended video understanding. However, their visual interfaces remain token-intensive and provide limited explicit structure for linking recurring object evidence across time. We introduce SlotNarrative, a slot-based interface that organizes a video into persistent object narratives represented by compact object-state tokens. Rather than compressing frame-wise features before establishing temporal correspondence, SlotNarrative first groups visual features into object-like slots and then associates recurring observations with clip-level object entries through a lightweight, parameter-free memory that integrates multiple complementary matching cues. Each retained entry is serialized into two token types: an identity token that summarizes persistent object appearance and a set of state tokens that encode segment-level appearance, geometry, visibility, and trajectory information. This design yields an interface of only 144 allocated visual-token positions for a frozen Video-LLM, independent of the number of sampled frames. Across multiple datasets, SlotNarrative achieves a favorable trade-off between accuracy and visual-token count compared with prior compact Video-LLM interfaces. Experimental results establish persistent object narratives as a compact, structured, and temporally organized visual interface for Video-LLMs. Our code will be made publicly available.
- Abstract(参考訳): ビデオ大言語モデル(ビデオ-LLM)は、オープンなビデオ理解において大きく進歩している。
しかし、それらの視覚インターフェイスはトークン集約であり、時間をかけて繰り返される物体の証拠をリンクするための限定的な明示的な構造を提供する。
SlotNarrativeは、ビデオがコンパクトなオブジェクト状態トークンで表現される永続的なオブジェクトの物語に整理されるスロットベースのインタフェースである。
時間的対応を確立する前にフレームワイドな特徴を圧縮するのではなく、SlotNarrativeは視覚的特徴をオブジェクトのようなスロットにグループ化し、複数の補完的なマッチングキューを統合する軽量なパラメータフリーメモリを通じて、繰り返し観察とクリップレベルのオブジェクトエントリを関連付ける。
保持された各エントリは、2つのトークンタイプにシリアライズされる。永続的なオブジェクトの外観を要約するIDトークンと、セグメントレベルの外観、幾何学、可視性、軌跡情報をエンコードするステートトークンのセットである。
この設計では、サンプルフレームの数によらず、凍結したビデオLLMに対して、144個の視覚的トーケン位置のインターフェースが与えられる。
複数のデータセットにわたって、SlotNarrativeは、以前のコンパクトなVideo-LLMインターフェースと比較して、精度と視覚的トーケン数の間の良好なトレードオフを実現している。
実験結果は、ビデオLLMのためのコンパクトで構造化され、時間的に整理されたビジュアルインターフェースとして、永続的なオブジェクトの物語を確立する。
私たちのコードは公開されます。
関連論文リスト
- Advancing Narrative Long Video Generation via Training-Free Identity-Aware Memory [79.01059178883817]
IAMFlowはトレーニング不要のID対応メモリフレームワークで、永続的なエンティティのIDを明示的にモデル化し追跡する。
VLMは、レンダリングフレームから属性を非同期に検証し、洗練し、暗黙の類似性ベースのマッチングの代わりに明示的なエンティティ追跡を可能にする。
NarraStream-Benchは,6次元にまたがる324のマルチプロンプトスクリプトを備えた,ナラストリームビデオ生成のためのベンチマークである。
論文 参考訳(メタデータ) (2026-05-18T17:54:34Z) - BoxTuning: Directly Injecting the Object Box for Multimodal Model Fine-Tuning [18.859227273698615]
BoxTuningは、オブジェクトの時空間情報を視覚的モダリティに直接注入する。
トークンコストを大幅に削減し、実際に87-93%のテキストトークン削減を実現している。
また、完全な時間分解能を保ち、軌道はフレーム間の運動方向と速度をさらに符号化する。
論文 参考訳(メタデータ) (2026-04-13T07:49:31Z) - AlcheMinT: Fine-grained Temporal Control for Multi-Reference Consistent Video Generation [58.844504598618094]
本稿では、被験者駆動ビデオ生成のための明示的なタイムスタンプ条件付きフレームワークAlcheMinTを提案する。
提案手法では,時間間隔の符号化を解き放つ新しい位置符号化機構を導入する。
我々は、視覚的アイデンティティとビデオキャプションの結合を強化するために、主観記述型テキストトークンを導入し、世代間あいまいさを緩和する。
論文 参考訳(メタデータ) (2025-12-11T18:59:34Z) - MomentSeg: Moment-Centric Sampling for Enhanced Video Pixel Understanding [40.37010049965347]
Referring Video Object (RefVOS)は、自然言語記述でガイドされたビデオにターゲットオブジェクトをセグメント化しようとする。
本稿では,時空間接地(TSG)とRefVOSを協調的に最適化し,キーモーメント接地機能を自然に組み込んだ統合フレームワークを提案する。
論文 参考訳(メタデータ) (2025-10-10T11:18:21Z) - VideoAnchor: Reinforcing Subspace-Structured Visual Cues for Coherent Visual-Spatial Reasoning [69.64660280965971]
VideoAnchorは、サブスペース親和性を活用してフレーム間の視覚的手がかりを強化するプラグイン・アンド・プレイモジュールである。
InternVL2-8BとQ2.5VL-72Bのベンチマークで一貫した性能向上を示した。
私たちのコードはhttps://github.com/feufhd/VideoAnchor.comで公開されます。
論文 参考訳(メタデータ) (2025-09-29T17:54:04Z) - Memory-efficient Streaming VideoLLMs for Real-time Procedural Video Understanding [51.91097761028129]
本稿では,リアルタイム・プロシージャ・ビデオ理解のためのエンドツーエンドフレームワークであるProVideLLMを紹介する。
ProVideLLMは、2種類のトークンを格納するように構成されたマルチモーダルキャッシュを統合する。
ProVideLLMは、これらのトークンをマルチモーダルキャッシュにインターリーブすることで、メモリと計算のサブ線形スケーリングをビデオ長で保証します。
論文 参考訳(メタデータ) (2025-04-10T17:13:08Z) - VrdONE: One-stage Video Visual Relation Detection [30.983521962897477]
Video Visual Relation Detection (VidVRD)は、ビデオの時間と空間におけるエンティティの理解に焦点を当てている。
VidVRDの従来の手法は、その複雑さに悩まされ、通常、タスクを2つの部分に分割する。
VidVRDのワンステージモデルであるVrdONEを提案する。
論文 参考訳(メタデータ) (2024-08-18T08:38:20Z) - Training-Free Robust Interactive Video Object Segmentation [82.05906654403684]
対話型ビデオオブジェクトセグメンテーション(I-PT)のためのトレーニングフリープロンプトトラッキングフレームワークを提案する。
スパースポイントとボックストラッキングを共同で採用し、不安定なポイントをフィルタリングし、オブジェクトワイズ情報をキャプチャします。
我々のフレームワークは、人気のあるVOSデータセット上で、ゼロショットビデオセグメンテーションの堅牢な結果を示してきた。
論文 参考訳(メタデータ) (2024-06-08T14:25:57Z) - Exploring Motion and Appearance Information for Temporal Sentence
Grounding [52.01687915910648]
本研究では、時間的文のグラウンド化を解決するために、MARN(Motion-Appearance Reasoning Network)を提案する。
動作誘導と外見誘導のオブジェクト関係を学習するために,動作分岐と外見分岐を別々に開発する。
提案するMARNは,従来の最先端手法よりも大きなマージンで優れていた。
論文 参考訳(メタデータ) (2022-01-03T02:44:18Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。