論文の概要: APM-Bench: Benchmarking Cross-session Persistent Memory for Egocentric Streaming Video Assistants
- arxiv url: http://arxiv.org/abs/2609.37559v1
- Date: Tue, 29 Sep 2026 13:32:06 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-30 21:28:47.561742
- Title: APM-Bench: Benchmarking Cross-session Persistent Memory for Egocentric Streaming Video Assistants
- Title(参考訳): APM-Bench:エゴセントリックなストリーミングビデオアシスタントのためのクロスセッション永続メモリのベンチマーク
- Abstract要約: 現実のパーソナルアシスタントとして機能するためには、ストリーミングビデオモデルは、後から使うために過去の体験を保持する永続的なメモリを必要とする。
実世界のストリーミングインタラクションをマルチセッションライフトラジェクトリとして再構成するAPM-Benchを紹介する。
549のセッション、104のトラジェクトリー、2,719の候補者が参加し、客観的な質問とオープンな質問の両方をカバーしている。
- 参考スコア(独自算出の注目度): 23.48188444793718
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: To serve as real-world personal assistants, streaming video models need persistent memory that retains past experiences for later use. Yet existing streaming benchmarks and methods often focus on individual continuous videos or short clips, overlooking that real-world interactions are often intermittent and require memory to persist across interruptions. To fill this gap, we introduce APM-Bench, which reformulates real-world streaming interaction as multi-session life trajectories. It contains 549 sessions, 104 trajectories, and 2,719 candidates, spanning both objective and open-ended questions. Each session is a video with fine-grained annotations, and sessions within a trajectory revolve around related activities. Models then use persistent memory to answer questions about past sessions and provide proactive responses while maintaining real-time interaction. This raises challenges: persistent memory must be storable, selectively retain information, be injected at the right time, and remain efficient. Moreover, finite storage may leave required evidence unavailable, so assistants should recognize missing evidence. Therefore, we systematically evaluate general video models under different memory protocols and diverse specialized streaming memory systems, and test whether models acknowledge insufficient evidence. Our evaluation reveals a clear utility--latency--storage trade-off: existing methods still struggle to simultaneously achieve reliable long-term recall, low overhead, and effective proactive assistance across sessions. APM-Bench provides a comprehensive testbed for developing and comparing persistent memory systems under realistic streaming conditions. We hope it encourages future work that jointly considers utility, latency, and storage toward more practical persistent memory for real-world streaming assistants.
- Abstract(参考訳): 現実のパーソナルアシスタントとして機能するためには、ストリーミングビデオモデルは、後から使うために過去の体験を保持する永続的なメモリを必要とする。
しかし、既存のストリーミングベンチマークとメソッドは、個々の連続ビデオやショートクリップにフォーカスすることが多い。
このギャップを埋めるために,マルチセッションライフトラジェクトリとして実世界のストリーミングインタラクションを再構築するAPM-Benchを導入する。
549のセッション、104のトラジェクトリー、2,719の候補者が参加し、客観的な質問とオープンな質問の両方をカバーしている。
各セッションは、きめ細かいアノテーションを備えたビデオであり、関連するアクティビティを取り巻く軌道内のセッションである。
モデルでは、永続メモリを使用して過去のセッションに関する質問に答え、リアルタイムのインタラクションを維持しながら積極的な応答を提供する。
永続メモリは保存可能で、情報を選択的に保持し、適切なタイミングで注入し、効率を保たなければならない。
さらに、有限記憶装置は必要な証拠を入手できなくなる可能性があるため、助手は行方不明の証拠を認識すべきである。
そこで我々は,異なるメモリプロトコルと多様な特殊なストリーミングメモリシステムの下で,一般的な映像モデルを体系的に評価し,モデルが不十分な証拠を認めているかどうかを検証した。
既存の手法は, 信頼性の高い長期リコール, オーバーヘッドの低減, セッション間の効果的な積極的支援の両立に苦慮している。
APM-Benchは、現実的なストリーミング条件下での永続メモリシステムの開発と比較のための包括的なテストベッドを提供する。
現実のストリーミングアシスタントにとって、より実用的な永続メモリに向けて、ユーティリティ、レイテンシ、ストレージを共同で検討する将来の作業を促進することを願っています。
関連論文リスト
- Beyond Retrieval: Progressive Latent Memory Evolution for Streaming Video Understanding [64.34948094316685]
latentStreamは、ストリーミングメモリをストア・アンド・レトリーブから検索・インターナライズへシフトする、プログレッシブな潜伏型ワーキングメモリフレームワークです。
LatentStreamは、既存のオンラインおよびオフラインビデオベンチマークで、最先端の新たな結果を達成する。
論文 参考訳(メタデータ) (2026-09-03T17:28:14Z) - StreamArena: Toward Continuous, Interactive, and Long-Horizon Agentic Streaming Video Understanding [42.88155526332792]
時間スケールでインタラクティブなストリーミングビデオ理解のためのベンチマークであるStreamArenaを紹介する。
多様なシステムに対する評価は、連続的な相互作用と長距離多モード理解の間の緊張を露呈する。
レイテンシクリティカルなインタラクションとアクティブな監視を,独立したスケジュール作業者に割り当てる2層アーキテクチャであるStreamMindとの緊張に対処する。
論文 参考訳(メタデータ) (2026-08-06T07:46:37Z) - GROVE: Growing and Reasoning over Temporally Stratified Memory from Streaming Video Experience [67.55136435794206]
ウェアラブルアシスタントは、その視覚的履歴に関する質問に答え、その歴史が現在の状況に有効であるかどうかを認識する。
GROVEは、連続的なビデオストリームから慎重に成長した1つのメモリで両方の動作をサポートする、トレーニング不要のフレームワークである。
GROVEは、きめ細かい知覚的証拠を保持し、それをタイムスタンプ化された瞬間、一貫性のあるエピソード、そして日々のパターンに漸進的に統合する。
論文 参考訳(メタデータ) (2026-08-03T15:35:28Z) - WorldMemArena: Evaluating Multimodal Agent Memory Through Action-World Interaction [72.1620416874118]
マルチモーダルな言語モデルは、長距離エージェントとしてますます多くデプロイされている。
既存のベンチマークは、静的対話上のリコールを測定し、メモリを1つのタスクの精度に分解し、キャプションに対する視覚的な観察を減らす。
マルチモーダルエージェントメモリを,観測可能な4段階ライフサイクルを持つアクションワールドインタラクションループとして定式化する。
論文 参考訳(メタデータ) (2026-05-28T04:27:20Z) - InternLM-XComposer2.5-OmniLive: A Comprehensive Multimodal System for Long-term Streaming Video and Audio Interactions [104.90258030688256]
本研究は,ストリーミング映像とオーディオ入力とのリアルタイムインタラクションを実現するために,非絡み合いのストリーミング知覚,推論,メモリ機構を導入している。
このプロジェクトは人間のような認知をシミュレートし、多モーダルな大規模言語モデルが時間とともに継続的かつ適応的なサービスを提供できるようにする。
論文 参考訳(メタデータ) (2024-12-12T18:58:30Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。