論文の概要: Memory Tree Guided Key Frame Querying for Efficient 3D Question Answering
- arxiv url: http://arxiv.org/abs/2608.18009v1
- Date: Tue, 18 Aug 2026 16:56:35 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-19 21:40:53.410372
- Title: Memory Tree Guided Key Frame Querying for Efficient 3D Question Answering
- Title(参考訳): 効率的な3次元質問応答のためのメモリツリーガイドキーフレームクエリ
- Authors: Hsiang-Wei Huang, Fu-Chen Chen, Li-Wu Tsao, Cheng-Han Lee, Che-Chun Su, Lu Xia, Ronghui Peng, Jenq-Neng Hwang, Min Sun, Cheng-Hao Kuo,
- Abstract要約: 具体的シナリオにおける効率的な3次元質問応答のためのメモリツリーガイドキーフレーム選択パラダイムを提案する。
MemTree3Dは、マルチレベルな3Dシーン情報をキャプチャし、Large Language Modelが質問関連キーフレームを効率的にクエリし、取得することを可能にする。
- 参考スコア(独自算出の注目度): 33.69615919013964
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Answering questions accurately and efficiently in embodied scenarios presents significant challenges due to limited computational and memory resources for Vision Language Model (VLM) inference. Existing methods adopt visual search key frame retrieval method to select critical question-related key frames for VLM input. However, visual search methods are inefficient because they require visual search among thousands of video frames for each individual user query. In this work, we propose a memory tree guided key frame selection paradigm for efficient 3D question answering in embodied scenarios. Our method leverages a compact and reusable 3D scene representation, termed MemTree3D, which supports real-time online construction leveraging camera 6-DoF poses. MemTree3D captures multi-level 3D scene information, enabling a Large Language Model to efficiently query and retrieve question-relevant key frames through our scoring-based frame selection without reprocessing the entire video stream. On OpenEQA, our method improves the LLM-Match of GPT-4o by 17.4%, LLaVA-OneVision-7B by 5.8%, outperforms existing visual search methods. Our code is available at https://github.com/hsiangwei0903/MemTree3D
- Abstract(参考訳): 具体的シナリオでは,視覚言語モデル(VLM)推論のための限られた計算資源とメモリ資源が問題となる。
既存の手法では、VLM入力に重要な質問関連キーフレームを選択するために、ビジュアル検索キーフレーム検索方式を採用している。
しかし、個々のユーザクエリごとに数千のビデオフレーム間で視覚的な検索を必要とするため、視覚的な検索手法は非効率である。
本研究では,組込みシナリオにおける効率的な3次元質問応答のためのメモリツリーガイドキーフレーム選択パラダイムを提案する。
提案手法は,カメラ6-DoFのポーズを利用したリアルタイムオンライン構築を支援する,MemTree3Dと呼ばれるコンパクトで再利用可能な3Dシーン表現を利用する。
MemTree3Dは、マルチレベルな3Dシーン情報をキャプチャし、ビデオストリーム全体を再処理することなく、スコアリングベースのフレーム選択を通じて、質問関連キーフレームを効率的にクエリし、検索することができる。
OpenEQAでは、GPT-4oのLLMマッチングを17.4%改善し、LLaVA-OneVision-7Bを5.8%改善し、既存のビジュアルサーチ法より優れている。
私たちのコードはhttps://github.com/hsiangwei0903/MemTree3Dで利用可能です。
関連論文リスト
- Seeing Once is Enough? Online Geometry-Aware Token Pruning for 3D Question Answering [26.954138767457277]
本稿では,従来のMLLMモデルとシームレスに統合可能な3次元質問応答タスクのオンライントークン処理手法を提案する。
本手法は,トークン使用量の最大50%を削減しつつ,効率的なオンライン処理を実現する。
本手法をQwen2.5-VL-7BとQwen3-VL-8Bに適用し,ScanQA,SQA3D,OpenEQA-HM3Dベンチマークの性能向上を示す。
論文 参考訳(メタデータ) (2026-07-05T02:00:54Z) - VideoBrain: Learning Adaptive Frame Sampling for Long Video Understanding [9.415923244280542]
VideoBrainは、Vision-Language Modelsが学習したサンプリングポリシーを通じて視覚情報を適応的に取得することを可能にするエンドツーエンドフレームワークである。
提案手法は,ビデオ間の意味検索を行うCLIPエージェントと,時間間隔内での高密度サンプリングを行うUniformエージェントの2つの補完エージェントを特徴とする。
論文 参考訳(メタデータ) (2026-02-04T00:08:35Z) - FOCUS: Internal MLLM Representations for Efficient Fine-Grained Visual Question Answering [8.826505135681705]
我々は、最も関連性の高い画像領域の探索をガイドする、FOCUSと呼ばれる訓練不要な視覚的収穫法を提案する。
FOCUSは4つの細粒度VQAデータセットと3種類のMLLMに対して高いパフォーマンスを実現している。
精度と効率の両面で人気の高い3つのビジュアルトリミング法を上回り、最高のパフォーマンスのベースラインであるZoomEyeに匹敵する。
論文 参考訳(メタデータ) (2025-06-26T18:51:04Z) - T*: Re-thinking Temporal Search for Long-Form Video Understanding [66.72243342954823]
現在の時間探索法は、Longvideobenchサブセットで2.1%の時間F1スコアしか達成していない。
画像中の視覚探索に触発されて,空間探索として高価な時間探索を再構成する軽量な時間探索フレームワークT*を提案する。
大規模な実験により、T*と既存の方法を統合することにより、SOTAの長めのビデオ理解が大幅に向上することが示された。
論文 参考訳(メタデータ) (2025-04-03T04:03:10Z) - EmbodiedSAM: Online Segment Any 3D Thing in Real Time [61.2321497708998]
身体的なタスクは、エージェントが探索と同時に3Dシーンを完全に理解する必要がある。
オンライン、リアルタイム、微粒化、高度に一般化された3D知覚モデルは、必死に必要である。
論文 参考訳(メタデータ) (2024-08-21T17:57:06Z) - BundleSDF: Neural 6-DoF Tracking and 3D Reconstruction of Unknown
Objects [89.2314092102403]
モノクロRGBDビデオシーケンスから未知物体の6-DoF追跡をリアルタイムに行う手法を提案する。
視覚的テクスチャがほとんど欠如している場合でも,任意の剛体オブジェクトに対して有効である。
論文 参考訳(メタデータ) (2023-03-24T17:13:49Z) - EgoLoc: Revisiting 3D Object Localization from Egocentric Videos with
Visual Queries [68.75400888770793]
我々は、エゴセントリックなビデオから2次元オブジェクトを検索することで、3次元のマルチビュー幾何をよりうまく絡み合わせるパイプラインを定式化する。
具体的には、VQ3Dタスクにおける新しい最先端の成果を設定できる87.12%の総合的な成功率を達成する。
論文 参考訳(メタデータ) (2022-12-14T01:28:12Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。