論文の概要: PointVG-R: Internalizing Geometric Reasoning in MLLMs for Precise Pointing Localization via Visual Chain of Thought
- arxiv url: http://arxiv.org/abs/2606.24539v1
- Date: Tue, 23 Jun 2026 13:06:51 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-24 22:16:48.96263
- Title: PointVG-R: Internalizing Geometric Reasoning in MLLMs for Precise Pointing Localization via Visual Chain of Thought
- Title(参考訳): PointVG-R:思考の視覚的連鎖による精密点定位のためのMLLMの内部化幾何学的推論
- Authors: Ling Li, Bowen Liu, Zinuo Zhan, Jianhui Zhong, Ziyu Zhu, Bingcai Wei, Kenglun Chang, Zhidong Deng,
- Abstract要約: ポインティングに基づく視覚的グラウンドリングでは、視覚シーンとポインティングジェスチャの間の複雑な空間的関係を解読することで、ターゲットオブジェクトを正確に特定する必要がある。
推論誘導型マルチモーダル言語モデル(MLLM)であるPointVG-Rを提案する。
我々は,人間の指し示すジェスチャーを解釈する際に使用する反復的認知過程をシミュレートする,新しい幾何学的推論パイプラインを設計する。
- 参考スコア(独自算出の注目度): 19.680475189691965
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Pointing-based visual grounding requires models to precisely locate target objects by deciphering complex spatial relationships between the visual scene and pointing gestures. Traditional methods typically encode input images into static feature representations and perform reasoning primarily within the linguistic domain, often overlooking the rich perceptual cues and explicit spatial geometry inherent in images. In this study, we aim to mitigate the cognitive vulnerability of models in interpreting gestural spatial relations by proposing PointVG-R, a reasoning-guided Multi-modal Large Language Model (MLLM). PointVG-R introduces geometric-aware reasoning for pointing-based grounding, enabling the model to think with images through the strategic integration of Reinforcement Learning (RL) and cold-start data. Specifically, we design a novel geometric reasoning pipeline that simulates the iterative cognitive process humans employ when interpreting pointing gestures. Furthermore, we construct EgoPoint-CoT, a high-quality visual Chain-of-Thought (CoT) dataset featuring detailed reasoning trajectories to guide the model via Supervised Fine-Tuning (SFT) and RL. To address the varying quality of learning signals encountered during training, we further propose an Adaptive Importance Weighting strategy based on Group Variance, which dynamically adjusts reward signals to optimize the learning process. Experimental results demonstrate that PointVG-R achieves SOTA performance, outperforming the baseline by $\textbf{15.86}$ points in mIoU. Extensive ablation studies further validate the efficacy of our proposed modules. Code: https://github.com/lingli1724/PointVG-R.
- Abstract(参考訳): ポインティングに基づく視覚的グラウンドリングでは、視覚シーンとポインティングジェスチャの間の複雑な空間的関係を解読することで、ターゲットオブジェクトを正確に特定する必要がある。
伝統的な方法では、入力画像を静的な特徴表現にエンコードし、主に言語領域内で推論を行う。
本研究では,マルチモーダル大規模言語モデル(MLLM)であるPointVG-Rを提案することにより,空間的空間関係の解釈におけるモデルの認知的脆弱性を軽減することを目的とする。
PointVG-Rは、ポインティングに基づくグラウンドディングのための幾何学的推論を導入し、Reinforcement Learning (RL)とコールドスタートデータの戦略的統合を通じて、モデルがイメージで考えることを可能にする。
具体的には,人間が指さすジェスチャーを解釈する際に使用する反復的認知過程をシミュレートする,新しい幾何学的推論パイプラインを設計する。
さらに,高精細な推論トラジェクトリを特徴とする高品質なビジュアル・チェーン・オブ・ソート(CoT)データセットであるEgoPoint-CoTを構築し,スーパーバイザード・ファイン・チューニング(SFT)とRLを用いてモデルを導出する。
さらに,学習過程を最適化するために報酬信号の動的調整を行うグループ変数に基づく適応的重要度重み付け手法を提案する。
実験の結果,pointVG-R は SOTA のパフォーマンスを達成し,mIoU の $\textbf{15.86}$ よりも高い性能を示した。
広範囲にわたるアブレーション研究により,提案モジュールの有効性がさらに検証された。
コード:https://github.com/lingli1724/PointVG-R。
関連論文リスト
- VistaRef: Boosting Visual Spatial Orientation Awareness for Pointing-to-Object Detection [19.163908796279802]
自然画像における難解なジェスチャーの接地は、ARと人間とロボットのコラボレーションに不可欠である。
VistaRefは空間的指向の意識を高めるために設計されたフレームワークである。
論文 参考訳(メタデータ) (2026-06-23T12:30:04Z) - Learning Entropy and Spatial Adaptation Dynamics of Multilayer Perceptrons for Structural Point Extraction [1.4681690787310104]
本稿では,学習エントロピー(LE)の概念を時間適応システムから多層空間ネットワーク(MLP)における空間学習へ拡張する。
中心画素の強度を周囲の空間的文脈から予測するために訓練され、LEは画像由来のサンプルの学習中に神経重みの漸進的適応から評価される。
空間学習エントロピーマップ(SLEM)は、ニューラルネットワークの強い適応を誘発する異常なイメージポイントや領域を特定し、学習プロセスにおいて重要な役割を果たす。
論文 参考訳(メタデータ) (2026-06-08T21:05:03Z) - Implicit Neural Representations: A Signal Processing Perspective [54.57279006229212]
入射神経表現(INR)は、離散的なサンプルデータから連続的な機能的表現へと、信号モデリングの根本的な変化を示す。
本稿では、信号処理の観点からのINRの進化を考察し、スペクトル挙動、サンプリング理論、マルチスケール表現を強調する。
医療・レーダ画像の逆問題,圧縮,3次元シーン表現など,幅広い応用分野におけるINRの有用性を強調した。
論文 参考訳(メタデータ) (2026-04-16T14:12:06Z) - Bridging Visual Representation and Reinforcement Learning from Verifiable Rewards in Large Vision-Language Models [35.97638821723309]
KAWHIは、構造化された視覚情報を均一な報酬ポリシー最適化手法に明示的に組み込む、プラグアンドプレイ報酬再重み付け機構である。
階層的幾何的アグリゲーションにより意味的に有意な領域を適応的に局在させ、構造化属性を介して視覚クリティカルなアテンションヘッドを識別し、段落レベルの信用再配置を行い、空間的な視覚的証拠を意味的に決定的な推論ステップと整合させる。
論文 参考訳(メタデータ) (2026-03-28T18:40:14Z) - Towards Foundation Models for 3D Scene Understanding: Instance-Aware Self-Supervised Learning for Point Clouds [53.82500407523346]
PointINSは、幾何学的学習を通じてポイントクラウド表現を豊かにする、インスタンス指向の自己組織化フレームワークである。
PointINSは、屋内のインスタンスセグメンテーションで平均+3.5%のmAP改善、屋外のパン光学セグメンテーションで+4.1%のPQゲインを達成している。
論文 参考訳(メタデータ) (2026-03-26T08:31:06Z) - RSGround-R1: Rethinking Remote Sensing Visual Grounding through Spatial Reasoning [61.84363374647606]
リモートセンシングビジュアルグラウンドディング(RSVG)は、自然言語記述に基づく大規模空中画像における対象物体のローカライズを目的としている。
これらの記述はしばしば位置的手がかりに大きく依存しており、空間的推論においてMLLM(Multimodal Large Language Models)に固有の課題を提起している。
空間理解の高度化を図るために,textbfRSGround-R1 と呼ばれる推論誘導型位置認識後学習フレームワークを提案する。
論文 参考訳(メタデータ) (2026-01-29T12:35:57Z) - Improving Vision-and-Language Reasoning via Spatial Relations Modeling [30.477235227733928]
ビジュアルコモンセンス推論(VCR)は、難しいマルチモーダルタスクである。
提案手法は,より空間的な文脈を維持するために表現を導くことができる。
VCRと他の2つの視覚・言語推論タスクであるVQAとNLVRについて、最先端の結果を得る。
論文 参考訳(メタデータ) (2023-11-09T11:54:55Z) - INFOrmation Prioritization through EmPOWERment in Visual Model-Based RL [90.06845886194235]
モデルベース強化学習(RL)のための修正目的を提案する。
相互情報に基づく状態空間モデルに,変分エンパワーメントにインスパイアされた用語を統合する。
本研究は,視覚に基づくロボット制御作業における自然な映像背景を用いたアプローチの評価である。
論文 参考訳(メタデータ) (2022-04-18T23:09:23Z) - Self-supervised Geometric Perception [96.89966337518854]
自己教師付き幾何知覚(self-supervised geometric perception)は、基底幾何モデルラベルなしで対応マッチングのための特徴記述子を学ぶためのフレームワークである。
また,SGPは,地上トラスラベルを用いて訓練した教師付きオークルよりも同等か優れる最先端性能を達成できることを示す。
論文 参考訳(メタデータ) (2021-03-04T15:34:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。