論文の概要: EgoCITE: Context-Augmented Indexing and Time-Aware Retrieval for Long-Horizon Egocentric Memory
- arxiv url: http://arxiv.org/abs/2608.12627v2
- Date: Sat, 15 Aug 2026 00:24:00 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-18 13:30:43.586447
- Title: EgoCITE: Context-Augmented Indexing and Time-Aware Retrieval for Long-Horizon Egocentric Memory
- Title(参考訳): EgoCITE: 長期集中型メモリのためのコンテキスト拡張インデックスと時間認識検索
- Authors: Le Zhang, Ke Sun,
- Abstract要約: EgoCITEは、Egocentric QAのための長距離エージェントメモリフレームワークである。
EgoIndexは、補完的なアクション、アクティビティ、発話、会話表現を検索可能なメモリインデックスに整理する。
EgoRetrvは、意味探索と質問条件付き時間関連スコアと、検索された証拠のキュレーションを組み合わせる。
- 参考スコア(独自算出の注目度): 7.41246708183326
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Long-horizon egocentric memory transforms continuous first-person video and audio into a searchable record of past experiences. We demonstrate two bottlenecks in existing systems: indices built from context-poor captions are unreliable for agentic search, while retrieval ignores a question's temporal intent. To address both bottlenecks, we introduce EgoCITE (Egocentric Context-augmented Indexing and Time-aware Evidence retrieval), a long-horizon agentic memory framework for egocentric QA. EgoCITE comprises three components. EgoScheme uses local multimodal context to turn fragmentary video captions and speech transcripts into self-contained atomic memory indices. EgoIndex organizes complementary action, activity, utterance, and conversation representations into searchable multi-view memory indices at multiple granularities. EgoRetrv combines semantic search with question-conditioned temporal relevance scoring and curation of retrieved evidence. We evaluate EgoCITE on EgoLifeQA, EgoMem, and EgoR1-Bench in terms of answer accuracy and target-event retrieval alignment. EgoCITE improves accuracy over agentic memory baselines by at least 4.4--14.2% while achieving 36$\times$ lower cost than long-context LLM agents.
- Abstract(参考訳): ロングホライゾンのエゴセントリックメモリは、連続したファーストパーソンのビデオとオーディオを過去の経験を検索可能な記録に変換する。
既存のシステムでは2つのボトルネックが示される: 文脈不足キャプションから構築されたインデックスはエージェント検索では信頼できないが、検索は質問の時間的意図を無視している。
両ボトルネックに対処するため,EgoCITE (Egocentric Context-augmented Indexing and Time-aware Evidence retrieve)を導入した。
EgoCITEは3つのコンポーネントから構成される。
EgoSchemeはローカルなマルチモーダルコンテキストを使用して、断片的なビデオキャプションと音声の書き起こしを自己完結した原子メモリインデックスに変換する。
EgoIndexは、補完的なアクション、アクティビティ、発話、会話表現を複数の粒度で検索可能なマルチビューメモリインデックスに整理する。
EgoRetrvは、意味探索と質問条件付き時間関連スコアと、検索された証拠のキュレーションを組み合わせる。
EgoLifeQA, EgoMem, EgoR1-Bench における EgoCITE の解答精度と目標値の検索アライメントについて検討した。
EgoCITEは、エージェントメモリベースラインの精度を少なくとも4.4-14.2%向上し、長文のLLMエージェントよりも36$\times$安くする。
関連論文リスト
- Vinci2: Providing Proactive Assistance in Continuous Egocentric Videos [74.71281081304846]
継続的エゴセントリックなビデオは、リッチで進化したコンテキストを提供し、新しい形式の支援を可能にします。
Vinci2は、デバイス上のアシスタントであるVinciを、反応反応から活性へ前進させる、活性中心型補助システムである。
EgoMemoはトレーニング不要で、メモリ拡張されたエージェントで、3つの補完的なメモリ表現を保持する。
論文 参考訳(メタデータ) (2026-07-13T13:09:45Z) - Imprint: Online Memory Compression for Long-Horizon Egocentric QA [3.944710336786154]
ロングホライゾンのエゴセントリックな質問の答えは、過去に何時間、何日も発生した出来事について答えることである。
既存のロングホライゾン・エゴセントリックQA法は、観測の階層的なテキスト要約としてメモリを構成する。
我々は,オンラインメモリ圧縮問題として,長軸エゴ中心メモリを定式化するインタラクション中心メモリフレームワークImprintを提案する。
論文 参考訳(メタデータ) (2026-07-01T09:45:30Z) - VL-MemKnG: Hybrid Memory with a Spatio-Temporal Knowledge Graph for Question Answering over Long Egocentric Navigation Trajectories [6.008251172997241]
本稿では,VL-MemKnGを拡張するハイブリッドメモリフレームワークを提案する。
また、長距離ナビゲーション指向のビデオ質問応答のためのWalkyKnowledgeの拡張であるWalkyKnowledgeT+についても紹介する。
論文 参考訳(メタデータ) (2026-06-15T18:21:14Z) - Keep It in Mind: User Centric Continual Spatial Intelligence Reasoning in Egocentric Video Streams [58.77207336324662]
UCS-ベンチ (UCS-Bench) は、170時間以上のエゴセントリックな視覚観察と8.1K以上のタイムスタンプの質問のデータセットである。
我々は、ストリーミングエゴセントリックな観測から構造化空間記憶をインクリメンタルに構築し、維持するフレームワークであるDirectMeを提案する。
論文 参考訳(メタデータ) (2026-06-13T08:50:49Z) - SuperMemory-VQA: An Egocentric Visual Question-Answering Benchmark for Long-Horizon Memory [14.96864764261795]
SuperMemory-VQAは、実用的な長期記憶タスクでAIアシスタントを評価するデータセットである。
これには、同期RGBビデオ、音声の書き起こし、視線、IMU、SLAMトラジェクトリなど、AIメガネで記録された日常的な活動の52.9時間が含まれている。
対象と位置記憶,意図的リコール,視覚的シーンリコール,タイムライン再構築,会話記憶,コンテキスト内検索にまたがる4,853の質問応答対を構築した。
論文 参考訳(メタデータ) (2026-05-30T17:53:10Z) - EgoIntrospect: An Egocentric Dataset and Benchmark for User-Centric Internal State Reasoning [47.853306116245484]
EgoIntrospectは、セルフアノテーションを備えたユーザ駆動のシナリオでキャプチャされた最初のエゴセントリックなデータセットである。
収録時間は60人から180時間、平均録音時間は1人あたり3時間である。
我々は、感情経験、インタラクティブな意図、認知記憶など、ユーザ内部状態を中心とした一連のタスクを形式化する。
論文 参考訳(メタデータ) (2026-05-17T05:05:29Z) - EgoMemReason: A Memory-Driven Reasoning Benchmark for Long-Horizon Egocentric Video Understanding [89.26501160264199]
EgoMemReasonは、メモリ駆動推論を通じて、1週間のエゴセントリックなビデオ理解を体系的に評価する。
EgoMemReasonには3つのメモリタイプと6つのコア課題に関する500の質問が含まれている。
EgoMemReasonをMLLMとエージェントフレームワークにまたがる17の手法で評価する。
論文 参考訳(メタデータ) (2026-05-11T01:59:59Z) - TeleEgo: Benchmarking Egocentric AI Assistants in the Wild [55.53194302888826]
実世界のエゴセントリックなAIアシスタントは、マルチモーダル入力(ビデオ、オーディオ、テキスト)を処理しなければならない
我々は、エゴセントリックなAIアシスタントを評価するために、長いデュレーション、ストリーミング、オムニモーダルのベンチマークであるtextbfTeleEgoを紹介した。
このデータセットは、4つのドメインにわたる同期されたエゴセントリックなビデオ、オーディオ、テキストの参加者あたり14時間以上を特徴としている。
論文 参考訳(メタデータ) (2025-10-28T01:24:24Z) - Omnia de EgoTempo: Benchmarking Temporal Understanding of Multi-Modal LLMs in Egocentric Videos [51.8995932557911]
EgoTempoは、エゴセントリックドメインにおける時間的理解を評価するために設計されたデータセットである。
本稿では,ベンチマークにおける最先端のマルチモーダル言語モデル (MLLM) が,テキストやフレームのみを入力として,驚くほど高い性能を実現していることを示す。
EgoTempoがこの分野の新たな研究を触媒し、時間的ダイナミクスの複雑さをよりよく捉えたモデルに刺激を与えることを期待している。
論文 参考訳(メタデータ) (2025-03-17T18:50:36Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。