論文の概要: GROVE: Growing and Reasoning over Temporally Stratified Memory from Streaming Video Experience
- arxiv url: http://arxiv.org/abs/2608.02392v2
- Date: Wed, 05 Aug 2026 05:29:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.200199
- Title: GROVE: Growing and Reasoning over Temporally Stratified Memory from Streaming Video Experience
- Title(参考訳): GROVE: ストリーミングビデオ体験から一時的に階層化されたメモリ上での成長と推論
- Authors: Sitong Gong, Caixin Kang, Tianyu Yan, Guo Chen, Bo Zheng, Kaipeng Zhang, Yunzhi Zhuge, Xiang Ruan, Huchuan Lu, Yifei Huang,
- Abstract要約: ウェアラブルアシスタントは、その視覚的履歴に関する質問に答え、その歴史が現在の状況に有効であるかどうかを認識する。
GROVEは、連続的なビデオストリームから慎重に成長した1つのメモリで両方の動作をサポートする、トレーニング不要のフレームワークである。
GROVEは、きめ細かい知覚的証拠を保持し、それをタイムスタンプ化された瞬間、一貫性のあるエピソード、そして日々のパターンに漸進的に統合する。
- 参考スコア(独自算出の注目度): 67.55136435794206
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: A wearable assistant should both answer questions about its visual history and recognize when that history is useful to the present situation. Existing video-memory systems primarily support question-conditioned recall, whereas proactive assistants typically use separate memory and control mechanisms. We introduce GROVE, a training-free framework that supports both behaviors with one memory grown causally from a continuous video stream. GROVE retains fine-grained perceptual evidence and incrementally consolidates it into time-stamped moments, coherent episodes, and recurring cross-day patterns. Each stratum is paired with a scale-native retrieval skill for locating an observation, replaying an activity, or traversing long-range regularities. Reactive QA and proactive assistance share this memory and access interface, differing in whether retrieval is initiated by a user query or the current situation. Across multiple benchmarks including the challenging MM-lifelong and EgoServe, GROVE achieves the best results among the compared methods. Controlled ablations show that the temporal strata and their access skills are complementary, with patterns providing the largest benefit when evidence spans multiple days. Code will be available at https://github.com/SitongGong/GROVE.
- Abstract(参考訳): ウェアラブルアシスタントは、その視覚的履歴に関する質問に答え、その歴史が現在の状況に有効であるかどうかを認識する。
既存のビデオメモリシステムは、主に質問条件のリコールをサポートするが、プロアクティブアシスタントは通常、別々のメモリと制御機構を使用する。
GROVEは、連続的なビデオストリームから慎重に成長した1つのメモリで両方の動作をサポートする、トレーニング不要のフレームワークである。
GROVEは、きめ細かい知覚的証拠を保持し、それをタイムスタンプ化された瞬間、一貫性のあるエピソード、そして日々のパターンに漸進的に統合する。
各層は、観測、アクティビティの再生、長距離の規則性の追跡のためのスケールネイティブ検索スキルとペアリングされる。
リアクティブQAとプロアクティブアシストは、ユーザクエリによって検索が開始されたか、現在の状況で異なる、このメモリとアクセスインターフェースを共有します。
挑戦的なMM-lifelongとEgoServeを含む複数のベンチマークで、GROVEは比較したメソッドの中で最高の結果を得る。
制御されたアブレーションは、時間的階層とそのアクセススキルが相補的であり、証拠が複数日に及ぶ場合に最大の利益をもたらすパターンであることを示している。
コードはhttps://github.com/SitongGong/GROVE.comで入手できる。
関連論文リスト
- CMT-RAG: Complementary Memory Traces for Multi-turn Multi-hop RAG [17.889279174355227]
本稿では,マルチターンマルチホップRAGのベンチマークである MuMu-QA と,この設定を補完するメモリフレームワークである CMT-RAG を紹介する。
MuMu-QAとコーパスレベルのRAGベンチマークは、CMT-RAGが回答精度においてRAGの5つのカテゴリを一貫して上回っていることを示している。
論文 参考訳(メタデータ) (2026-07-29T04:50:41Z) - VL-MemKnG: Hybrid Memory with a Spatio-Temporal Knowledge Graph for Question Answering over Long Egocentric Navigation Trajectories [6.008251172997241]
本稿では,VL-MemKnGを拡張するハイブリッドメモリフレームワークを提案する。
また、長距離ナビゲーション指向のビデオ質問応答のためのWalkyKnowledgeの拡張であるWalkyKnowledgeT+についても紹介する。
論文 参考訳(メタデータ) (2026-06-15T18:21:14Z) - Semantic-Aware Adaptive Visual Memory for Streaming Video Understanding [55.7992006853979]
SAVEMemは、セマンティックな認識をメモリ生成にもたらすフレームワークで、クエリ毎に検索スコープを適応させる。
SAVEMemは、メモリ生成にセマンティックな認識をもたらし、クエリ毎に検索範囲を適応させる、トレーニングフリーのデュアルステージフレームワークである。
論文 参考訳(メタデータ) (2026-05-08T15:40:40Z) - AdaMem: Adaptive User-Centric Memory for Long-Horizon Dialogue Agents [49.63422082885992]
長軸対話エージェントのための適応型ユーザ中心メモリフレームワークであるAdaMemを提案する。
AdaMemは対話履歴をワーキング、エピソディック、ペルソナ、グラフメモリに整理する。
LoCoMo と PERSONAMEM ベンチマーク上での AdaMem の評価を行った。
論文 参考訳(メタデータ) (2026-03-17T13:22:54Z) - AMA: Adaptive Memory via Multi-Agent Collaboration [54.490349689939166]
複数の粒度にまたがるメモリ管理に協調エージェントを活用する新しいフレームワークであるAMA(Adaptive Memory via Multi-Agent Collaboration)を提案する。
AMAは、ステート・オブ・ザ・アートのベースラインを著しく上回り、トークンの消費をフルコンテキストの手法と比べて約80%削減する。
論文 参考訳(メタデータ) (2026-01-28T08:09:49Z) - Temporal Memory Relation Network for Workflow Recognition from Surgical
Video [53.20825496640025]
本研究では, 長期および多スケールの時間パターンを関連づける, エンドツーエンドの時間メモリ関係ネットワーク (TMNet) を提案する。
我々はこのアプローチを2つのベンチマーク手術ビデオデータセットで広範囲に検証した。
論文 参考訳(メタデータ) (2021-03-30T13:20:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。