論文の概要: ViSAGE: Constructing Self-Correcting Memories for Long-Form Video Understanding
- arxiv url: http://arxiv.org/abs/2607.28678v1
- Date: Wed, 29 Jul 2026 10:25:23 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-03 14:29:40.366119
- Title: ViSAGE: Constructing Self-Correcting Memories for Long-Form Video Understanding
- Title(参考訳): ViSAGE: 長時間のビデオ理解のための自己修正記憶の構築
- Abstract要約: ViSAGEは、自己修正、エンティティ中心のメモリを構築するマルチモーダルなエージェントメモリフレームワークである。
これは、遅延したアイデンティティの証拠を伝播させ、過去の記録を遡って統一し、将来の推論を改善するために、双方向のメモリリファインメントを適用している。
その結果、ViSAGEは最強のベースラインを一貫して上回り、精度は5.9%向上した。
- 参考スコア(独自算出の注目度): 11.461394531496397
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Multimodal agents operating in long-horizon environments must build and continually update multimedia memories to support entity-consistent, temporally grounded reasoning. However, existing agentic memory approaches often discard fine-grained dentity cues under aggressive compression and segment-wise processing. They also rely heavily on vector similarity retrieval, which can surface semantically related yet identity-mismatched evidence, leading to entity confusion, error propagation, and hallucinated answers. We propose ViSAGE, a multimodal agentic memory framework that constructs self-correcting, entity-centric memories. Specifically, ViSAGE anchors entity identity via cross-modal binding over long temporal ranges. It then applies bidirectional memory refinement to propagate delayed identity evidence, retroactively unifying historical records and improving future reasoning. We also introduce multi-agent cross-verification to assess retrieved evidence under an identity-evidence alignment onstraint, enabling abstention instead of unsupported answers when evidence is missing. Extensive results demonstrate that ViSAGE consistently outperforms the strongest baseline, achieving 5.9% higher accuracy.
- Abstract(参考訳): 長距離環境で動作するマルチモーダルエージェントは、エンティティ一貫性のある時間的根拠を持つ推論をサポートするために、マルチメディアメモリを構築し、継続的に更新する必要がある。
しかし、既存のエージェントメモリアプローチは、攻撃的な圧縮とセグメントワイド処理の下で、きめ細かい密度のキューを破棄することが多い。
それらはベクトル類似性検索にも大きく依存しており、意味論的に関連があるが、アイデンティティにミスマッチした証拠を表面化し、実体の混乱、エラーの伝播、幻覚的な答えをもたらす。
自己修正型エンティティ中心メモリを構築するマルチモーダルエージェントメモリフレームワークであるViSAGEを提案する。
具体的には、ViSAGEは長い時間範囲にわたるクロスモーダルバインディングを通じてエンティティアイデンティティをアンロックする。
次に、遅延したアイデンティティの証拠を伝播させ、過去の記録を遡って統一し、将来の推論を改善するために、双方向のメモリリファインメントを適用します。
また,複数エージェントの相互検証を導入し,証拠が欠落した場合の無関係な回答に代えて,本人確認アライメントの制約下での証拠の検索を可能とした。
その結果、ViSAGEは最強のベースラインを一貫して上回り、精度は5.9%向上した。
関連論文リスト
- REVEAL: A Rubric-Guided Agent for Explicit Evidence Sufficiency Verificationin Long-Video Question Answering [25.519927761448603]
REVEALは、長いビデオ質問応答のためのルーリック誘導エージェントフレームワークである。
本稿では,視覚的コヒーレントな隣接フレームを自然なイベント単位にグループ化する適応型視覚類似性に基づく前処理パイプラインを提案する。
この構造化メモリ上に構築されたREVEALは、自動的に構築されたルーリックライブラリを使用して、検索された証拠が満足度基準を満たすかどうかを明示的に検証する。
論文 参考訳(メタデータ) (2026-08-09T09:55:42Z) - Beyond Episodic Evaluation: Memory Architectural Bottlenecks in Sequential Embodied Question Answering [93.80043825360514]
EQA(Embodied Question answering)は、伝統的にエピソードの定式化の下で評価され、エージェントは各タスクを独立して解決し、エピソード間の内部状態をリセットする。
EQAエージェントを逐次評価する際に異なるメモリアーキテクチャがどのように振る舞うかを検討する。
既存のメモリを単純に保存することは、しばしば不十分である。
連続したシーン表現の視覚的意味的証拠を3次元幾何学にマッピングするアーキテクチャについて, 構造的, 空間的基盤的記憶の必要性を強調した。
論文 参考訳(メタデータ) (2026-07-23T17:50:45Z) - MRMS: A Multi-Resolution Memory Substrate for Long-Lived AI Agents [2.808851478009314]
長期的なAIエージェントは、相互作用の連続性を必要とする。
プロンプトウィンドウを拡張するだけで連続性を得ることはできない。
2つの軸に沿って構成されたアーキテクチャ記憶基板を提案する。
論文 参考訳(メタデータ) (2026-07-06T02:54:37Z) - SAM: State-Adaptive Memory for Long-Horizon Reasoning Agent [51.274445160155864]
ロングホライゾンのエージェント推論は、思考、ツールコール、観察、部分的な結論を含む長い相互作用履歴を通して行動するために大きな言語モデルを必要とする。
既存のアプローチでは、インタラクション履歴の切り抜き、短いサロゲートに圧縮、あるいは再利用のために選択した部分を取得することで、この問題に対処している。
我々は、インテント駆動リコールのための生のトラジェクトリページを保持しながら、継続的なインタラクションをコンパクトなメモリキューに統合するスタンドアロンフレームワークであるState-Adaptive Memoryを提案する。
論文 参考訳(メタデータ) (2026-05-23T08:37:16Z) - MemEye: A Visual-Centric Evaluation Framework for Multimodal Agent Memory [80.97855900579512]
既存の評価では、エージェントが後続の推論に必要な視覚的証拠を保存するかどうかを検査することはめったにない。
メモリ性能を2次元から評価するフレームワークであるMemEyeを紹介する。
本フレームワークでは,8つのライフシナリオタスクにまたがる新しいベンチマークを構築した。
論文 参考訳(メタデータ) (2026-05-14T17:37:52Z) - AdaMem: Adaptive User-Centric Memory for Long-Horizon Dialogue Agents [49.63422082885992]
長軸対話エージェントのための適応型ユーザ中心メモリフレームワークであるAdaMemを提案する。
AdaMemは対話履歴をワーキング、エピソディック、ペルソナ、グラフメモリに整理する。
LoCoMo と PERSONAMEM ベンチマーク上での AdaMem の評価を行った。
論文 参考訳(メタデータ) (2026-03-17T13:22:54Z) - Persistent Identity in AI Agents: A Multi-Anchor Architecture for Resilient Memory and Continuity [0.0]
soul.pyは、分離可能なコンポーネントを通して永続的なアイデンティティを実装するオープンソースのアーキテクチャです。
我々は、AIシステムにおけるアイデンティティアンカーの概念を定式化し、部分記憶障害に耐えられるエージェントを構築するためのロードマップを示す。
論文 参考訳(メタデータ) (2026-03-02T02:34:50Z) - AMA: Adaptive Memory via Multi-Agent Collaboration [54.490349689939166]
複数の粒度にまたがるメモリ管理に協調エージェントを活用する新しいフレームワークであるAMA(Adaptive Memory via Multi-Agent Collaboration)を提案する。
AMAは、ステート・オブ・ザ・アートのベースラインを著しく上回り、トークンの消費をフルコンテキストの手法と比べて約80%削減する。
論文 参考訳(メタデータ) (2026-01-28T08:09:49Z) - MemWeaver: Weaving Hybrid Memories for Traceable Long-Horizon Agentic Reasoning [26.119505362626338]
本稿では,長期エージェント体験を3つの相互接続コンポーネントに集約する統合メモリフレームワークを提案する。
MemWeaverは、構造化された知識を共同で検索し、エビデンスをサポートし、コンパクトで情報密度の高いコンテキストを構築するデュアルチャネル検索戦略を採用している。
論文 参考訳(メタデータ) (2026-01-26T06:39:27Z) - Agentic Learner with Grow-and-Refine Multimodal Semantic Memory [50.81667005063605]
ViLoMemは、コンパクトなスキーマベースのメモリを構築するデュアルストリームメモリフレームワークである。
視覚的障害パターンと論理的推論エラーを符号化し、MLLMが成功し失敗した経験から学ぶことを可能にする。
論文 参考訳(メタデータ) (2025-11-26T18:55:08Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。