論文の概要: A Framework for Egocentric and Exocentric Procedural Understanding via Temporal Segmentation and Semantic Abstraction
- arxiv url: http://arxiv.org/abs/2610.00069v1
- Date: Fri, 04 Sep 2026 17:34:52 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-05 14:48:16.34495
- Title: A Framework for Egocentric and Exocentric Procedural Understanding via Temporal Segmentation and Semantic Abstraction
- Title(参考訳): Egocentric and Exocentric Procedural Understanding by Temporal Segmentation and SemanticAbstraction
- Abstract要約: ロングホライゾン・エゴ/エクソデータは、手続き的証拠が豊富にあるが、冗長でノイズがあり、処理や保持に費用がかかる。
本稿では,連続マルチモーダルな職場映像を構造化された手続き状態記憶に変換するためのコンパクトなフレームワークを提案する。
- 参考スコア(独自算出の注目度): 9.167082845109439
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Long-horizon ego/exo data contains rich procedural evidence, but are redundant, noisy, and costly to process or retain. We propose a compact framework that converts continuous multimodal workplace video into a structured Procedural State Memory, implemented as a Work Environment Model (WEM). Inspired by event segmentation theory, we detect boundaries using changes in visual context, location, motion, narration, gaze/object interaction, and optional exocentric workspace evidence, rather than fixed windows or visual novelty alone. Each segment is abstracted into an evidence-linked event card containing actor, interval, location, action, objects/tools, pre/post state, confidence, and provenance. These event cards incrementally update the WEM, enabling compact, auditable documentation and retrieval under on-premise privacy constraints. We instantiate the design with frozen DINOv2 and VJEPA-2 encoders and a local language model, and outline evaluation criteria for segmentation quality, memory compression, retrieval fidelity, and long-horizon QA.
- Abstract(参考訳): ロングホライゾン・エゴ/エクソデータは、手続き的証拠が豊富にあるが、冗長でノイズがあり、処理や保持に費用がかかる。
作業環境モデル(WEM)として実装された,連続マルチモーダルな職場映像を構造化された手続き状態記憶に変換する,コンパクトなフレームワークを提案する。
イベントセグメンテーション理論に触発されて,視覚的コンテキスト,場所,動き,ナレーション,視線と物体の相互作用,および任意の外心的ワークスペースエビデンスを用いて境界を検出する。
各セグメントは、アクター、インターバル、ロケーション、アクション、オブジェクト/ツール、プレ/ポスト状態、信頼、証明を含むエビデンスリンクされたイベントカードに抽象化される。
これらのイベントカードはWEMを段階的に更新し、オンプレミスのプライバシー制約の下でコンパクトで監査可能なドキュメントと検索を可能にする。
凍結したDINOv2とVJEPA-2エンコーダとローカル言語モデルを用いて設計をインスタンス化し、セグメンテーション品質、メモリ圧縮、検索精度、長期QAの評価基準を概説する。
関連論文リスト
- The Evolution of Attention in Large Language Models: Mechanisms, Trade-offs, and Emerging Trends [51.17628561637134]
自己アテンションは、LLMにコンテキストへの細粒度でクエリ依存のアクセスを与える。
本調査は, モデル内コンテクストメモリとしての開発状況を解析する。
論文 参考訳(メタデータ) (2026-09-30T13:03:01Z) - The Model Is Not the Product: A Dual-Pillar Architecture for Local-First Psychological Coaching [51.56484100374058]
本報告では,iOS アプリケーションである Psych LM について紹介する。
Psych LMは、動作およびライフコーチングアプリケーション用に設計された、目的に構築された、ローカルファーストのランタイム内で、ローカル、オンデバイス言語モデルを実行する。
論文 参考訳(メタデータ) (2026-05-23T05:49:11Z) - Referring Video Object Segmentation with Cross-Modality Proxy Queries [23.504655272754587]
Referring Video Object segmentation (RVOS)は、与えられたテキスト表現によって参照される対象オブジェクトのピクセルレベルマップを生成することを目的とした、新たなクロスモーダルタスクである。
近年のアプローチでは、条件付きクエリによるモダリティアライメントに対処し、クエリ応答に基づくメカニズムを用いて対象オブジェクトを追跡する。
本稿では,視覚とテキストのセマンティクスを統合するためのプロキシクエリセットを導入するProxyFormerという新しいRVOSアーキテクチャを提案する。
論文 参考訳(メタデータ) (2025-11-26T07:45:41Z) - FOCUS: Unified Vision-Language Modeling for Interactive Editing Driven by Referential Segmentation [55.01077993490845]
最近のLVLM(Large Vision Language Models)は、視覚的理解と生成的モデリングを統一する有望な能力を示している。
本稿では,分割認識と制御可能なオブジェクト中心生成をエンドツーエンドフレームワークに統合した統合LVLMであるFOCUSを紹介する。
論文 参考訳(メタデータ) (2025-06-20T07:46:40Z) - Caption Anything in Video: Fine-grained Object-centric Captioning via Spatiotemporal Multimodal Prompting [60.58915701973593]
CAT-V(Caption AnyThing in Video)は、オブジェクト中心のビデオキャプションを微粒化するためのトレーニング不要のフレームワークである。
Cat-Vは3つの重要なコンポーネントを統合している: SAMIに基づくフレーム間の正確なオブジェクトセグメンテーションのためのセグメンタ、TRACE-UniVLを動力とするテンポラルアナライザ、Intern-2.5を使用するキャピタ。
我々のフレームワークは、追加のトレーニングデータを必要とすることなく、オブジェクトの属性、アクション、ステータス、インタラクション、環境コンテキストの詳細な時間的記述を生成します。
論文 参考訳(メタデータ) (2025-04-07T22:35:36Z) - Test-Time Optimization for Domain Adaptive Open Vocabulary Segmentation [15.941958367737408]
Seg-TTOはゼロショットでオープンなセマンティックセグメンテーションのためのフレームワークである。
このギャップに対処するために、セグメンテーション固有のテスト時間最適化にフォーカスします。
Seg-TTOは明確なパフォーマンス向上(いくつかのデータセットで最大27%のmIoU増加)を示し、新たな最先端の確立を実現している。
論文 参考訳(メタデータ) (2025-01-08T18:58:24Z) - VrdONE: One-stage Video Visual Relation Detection [30.983521962897477]
Video Visual Relation Detection (VidVRD)は、ビデオの時間と空間におけるエンティティの理解に焦点を当てている。
VidVRDの従来の手法は、その複雑さに悩まされ、通常、タスクを2つの部分に分割する。
VidVRDのワンステージモデルであるVrdONEを提案する。
論文 参考訳(メタデータ) (2024-08-18T08:38:20Z) - Visual In-Context Prompting [100.93587329049848]
本稿では,オープンセットのセグメンテーションや検出といった視覚的タスクのためのユニバーサルな視覚的インコンテキストプロンプトフレームワークを提案する。
エンコーダ-デコーダアーキテクチャ上に構築し,ストロークやボックス,ポイントなど,さまざまなプロンプトをサポートする汎用的なプロンプトエンコーダを開発する。
広範にわたる調査の結果,提案した視覚的インコンテクストは,異常参照と汎用セグメンテーション機能を引き起こすことが示された。
論文 参考訳(メタデータ) (2023-11-22T18:59:48Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。