論文の概要: Seeing Once is Enough? Online Geometry-Aware Token Pruning for 3D Question Answering
- arxiv url: http://arxiv.org/abs/2607.04079v1
- Date: Sun, 05 Jul 2026 02:00:54 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.813225
- Title: Seeing Once is Enough? Online Geometry-Aware Token Pruning for 3D Question Answering
- Title(参考訳): 一度見れば十分か?3D質問応答のためのオンラインジオメトリ対応トケンプルーニング
- Authors: Ruei-Chi Lai, Bolivar Solarte, Chin-Hsuan Wu, Yi-Hsuan Tsai, Min Sun,
- Abstract要約: 本稿では,従来のMLLMモデルとシームレスに統合可能な3次元質問応答タスクのオンライントークン処理手法を提案する。
本手法は,トークン使用量の最大50%を削減しつつ,効率的なオンライン処理を実現する。
本手法をQwen2.5-VL-7BとQwen3-VL-8Bに適用し,ScanQA,SQA3D,OpenEQA-HM3Dベンチマークの性能向上を示す。
- 参考スコア(独自算出の注目度): 26.954138767457277
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Recent Multi-modal Large Language Models (MLLMs) have demonstrated remarkable performance on 2D question answering tasks. However, extending these models to the 3D question answering remains challenging, as they typically require multiple views of the scene, which incurs substantial computational cost at inference. To mitigate this issue, existing solutions rely on strategic frame selection or token-merging algorithms that require preprocessing in advance all frames of the scene, i.e., an offline fashion. In contrast, we propose the first online token-pruning method that can be integrated seamlessly with current MLLM models for 3D question answering tasks, without additional training and with lower memory usage.Our key insight is to project each input frame into a shared voxel space using depth information and camera pose, identifying spatially-overlapped regions across frames and selectively pruning redundant image tokens before they enter the language model. Our method enables efficient online processing while reducing up to 50% of token usage. We apply this approach to Qwen2.5-VL-7B and Qwen3-VL-8B, demonstrating improved performance on the ScanQA, SQA3D, and OpenEQA-HM3D benchmarks.
- Abstract(参考訳): 最近のMLLM(Multi-modal Large Language Models)は,2次元質問応答タスクにおいて顕著な性能を示した。
しかしながら、これらのモデルを3次元質問応答に拡張することは、典型的にはシーンの複数のビューを必要とするため、推論においてかなりの計算コストが発生するため、依然として困難である。
この問題を緩和するため、既存のソリューションは、前もってシーンのすべてのフレーム、すなわちオフラインのスタイルを前もって前処理する必要がある、戦略的フレーム選択やトークンマージアルゴリズムに依存している。
一方,本研究では,従来のMLLMモデルとシームレスに統合可能なオンライントークン抽出手法を提案する。この手法は,入力フレームを奥行き情報とカメラポーズを用いて共有ボクセル空間に投影し,フレーム間の空間的に重なり合った領域を特定し,冗長な画像トークンを言語モデルに入力する前に選択的にプルーニングすることを目的としている。
本手法は,トークン使用量の最大50%を削減しつつ,効率的なオンライン処理を実現する。
本手法をQwen2.5-VL-7BとQwen3-VL-8Bに適用し,ScanQA,SQA3D,OpenEQA-HM3Dベンチマークの性能向上を示す。
関連論文リスト
- Zero-Shot 3D Question Answering via Hierarchical View-to-Token Transportation [9.296275675671636]
本稿では,ビューレベルとトークンレベルの両方において,入力コンテキスト収集のための階層的アプローチを提案する。
具体的には、画素特徴とカメラパラメータを組み合わせることで、意味的内容と幾何学的位置の両方に基づいて、ビューの重要性を評価する。
フレームワークを3つの広く使用されているベンチマークで評価し、既存のチューニング不要の手法とトレーニングベースのアプローチに匹敵するパフォーマンスを大幅に改善したことを示す。
論文 参考訳(メタデータ) (2026-06-02T03:38:51Z) - Advancing 3D Scene Understanding with MV-ScanQA Multi-View Reasoning Evaluation and TripAlign Pre-training Dataset [56.533371387182065]
MV-ScanQAは、新しい3D質問応答データセットである。
本稿では,大規模かつ低コストな2D-3D言語事前学習コーパスTripAlignについて紹介する。
さらに,MV-ScanQAにおける多視点推論のためのベースライン手法であるLEGOを開発し,事前学習した2次元LVLMの知識をTripAlignで3Dドメインに転送する。
論文 参考訳(メタデータ) (2025-08-14T20:35:59Z) - 3D Question Answering via only 2D Vision-Language Models [87.41421075243103]
大規模視覚言語モデル(LVLM)は、多くの分野を進歩させた。
代表的な例として,3次元質問応答(3D-QA)を用いた3次元シーン理解タスクの活用について検討する。
具体的には、3Dポイントクラウドから2Dビューをサンプリングし、2Dモデルにフィードして、与えられた質問に答える。
我々は3D-QAのための重要かつ多様なビューを自動的に選択する新しいアプローチであるcdViewsを提案する。
論文 参考訳(メタデータ) (2025-05-28T09:04:39Z) - EmbodiedSAM: Online Segment Any 3D Thing in Real Time [61.2321497708998]
身体的なタスクは、エージェントが探索と同時に3Dシーンを完全に理解する必要がある。
オンライン、リアルタイム、微粒化、高度に一般化された3D知覚モデルは、必死に必要である。
論文 参考訳(メタデータ) (2024-08-21T17:57:06Z) - Coarse Correspondences Boost Spatial-Temporal Reasoning in Multimodal Language Model [51.83436609094658]
本稿では,2次元画像を入力として,MLLMの時空間推論を強化する軽量な手法である粗対応を導入する。
本手法は,映像のフレーム間や異なる視点における主物体の対応性を特定するために,軽量な追跡モデルを用いている。
この単純なトレーニングフリーアプローチは、4つのベンチマークでGPT4-V/Oに一定の利得をもたらすことを実証する。
論文 参考訳(メタデータ) (2024-08-01T17:57:12Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。