論文の概要: ObjChangeVR: Object State Change Reasoning from Continuous Egocentric Views in VR Environments
- arxiv url: http://arxiv.org/abs/2603.06648v1
- Date: Fri, 27 Feb 2026 19:29:02 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-15 16:38:22.478273
- Title: ObjChangeVR: Object State Change Reasoning from Continuous Egocentric Views in VR Environments
- Title(参考訳): ObjChangeVR:VR環境における連続的エゴシックな視点からのオブジェクト状態変化の推論
- Abstract要約: 仮想現実(VR)におけるオブジェクト状態変化に対する質問応答タスクのベンチマークについて紹介する。
また、視点認識と時間ベース検索を組み合わせたフレームワークであるChangeVRと、クロスビュー推論を提案する。
- 参考スコア(独自算出の注目度): 4.46498673219845
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Recent advances in multimodal large language models (MLLMs) offer a promising approach for natural language-based scene change queries in virtual reality (VR). Prior work on applying MLLMs for object state understanding has focused on egocentric videos that capture the camera wearer's interactions with objects. However, object state changes may occur in the background without direct user interaction, lacking explicit motion cues and making them difficult to detect. Moreover, no benchmark exists for evaluating this challenging scenario. To address these challenges, we introduce ObjChangeVR-Dataset, specifically for benchmarking the question-answering task of object state change. We also propose ObjChangeVR, a framework that combines viewpoint-aware and temporal-based retrieval to identify relevant frames, along with cross-view reasoning that reconciles inconsistent evidence from multiple viewpoints. Extensive experiments demonstrate that ObjChangeVR significantly outperforms baseline approaches across multiple MLLMs.
- Abstract(参考訳): マルチモーダル大規模言語モデル(MLLM)の最近の進歩は、仮想現実(VR)における自然言語ベースのシーン変化クエリーに有望なアプローチを提供する。
MLLMをオブジェクト状態理解に適用する以前の研究は、カメラ装着者のオブジェクトとのインタラクションをキャプチャするエゴセントリックなビデオに焦点を当てていた。
しかし、オブジェクトの状態変化は、直接のユーザインタラクションなしにバックグラウンドで発生し、明示的なモーションキューが欠如し、検出が困難になる可能性がある。
さらに、この挑戦的なシナリオを評価するためのベンチマークは存在しない。
これらの課題に対処するために、ObjChangeVR-Datasetを紹介します。
また、視点認識と時間に基づく検索を組み合わせて関連するフレームを識別するフレームワークであるObjChangeVRと、複数の視点から矛盾する証拠を照合するクロスビュー推論を提案する。
大規模な実験により、ObjChangeVRは複数のMLLMのベースラインアプローチよりも大幅に優れていた。
関連論文リスト
- Show Me When and Where: Towards Referring Video Object Segmentation in the Wild [98.87931411432106]
そこで本研究では,次世代RVOSに向けた新たな設定について紹介する。
我々の新しいベンチマークでは、RVOSメソッドに挑戦して、ビデオにオブジェクトが現れる場所だけでなく、いつ現れるかを示す。
われわれのYoURVOSデータセットは命令型ベンチマークを提供しており、実用化のためのRVOSメソッドの進歩を推し進める。
論文 参考訳(メタデータ) (2026-03-15T09:30:33Z) - Vision-Motion-Reference Alignment for Referring Multi-Object Tracking via Multi-Modal Large Language Models [29.330083952817997]
我々はVMRMOTという新しいビジョン・モーション・リファレンス・アライメントのRMOTフレームワークを提案する。
物体力学から抽出された運動モーダリティを統合し、視覚モーダリティと言語参照のアライメントを強化する。
我々の知る限りでは、VMRMOT は RMOT タスクに MLLM を採用する最初のアプローチである。
論文 参考訳(メタデータ) (2025-11-21T08:53:31Z) - PhysVLM-AVR: Active Visual Reasoning for Multimodal Large Language Models in Physical Environments [36.84821207878773]
マルチモーダル大言語モデル(MLLM)における視覚的推論は、主に静的で完全に観測可能な設定で研究されている。
AVR(Active Visual Reasoning)タスクを導入し、視覚的推論を部分的に観察可能で対話的な環境に拡張する。
推論と情報収集の効率性の両方を評価するために,複数ラウンドの対話型環境を特徴とするベンチマークを提案する。
論文 参考訳(メタデータ) (2025-10-24T02:59:00Z) - InterRVOS: Interaction-aware Referring Video Object Segmentation [44.55538737075162]
インタラクションのモデリングに焦点をあてた新しいタスクであるInterRVOS(Interaction-Aware Referring Video Object)を紹介する。
モデルはアクターとターゲットオブジェクトを別々に分割し、相互作用におけるそれらの非対称的な役割を反映する必要がある。
本稿では,127K以上のアノテート表現を持つ大規模データセットであるInterRVOS-127Kについて述べる。
論文 参考訳(メタデータ) (2025-06-03T01:16:13Z) - Teaching VLMs to Localize Specific Objects from In-context Examples [56.797110842152]
現在、視覚言語モデル(VLM)には、状況を考慮した特定の物体をシーン内でローカライズする学習という、基本的な認知能力がないことが分かっています。
この研究は、VLMのパーソナライズされた数ショットのローカライゼーションを探索し、ベンチマークした初めてのものである。
論文 参考訳(メタデータ) (2024-11-20T13:34:22Z) - VOVTrack: Exploring the Potentiality in Videos for Open-Vocabulary Object Tracking [61.56592503861093]
オープンボキャブラリオブジェクト検出(OVD)とマルチオブジェクトトラッキング(MOT)の複雑さを両立させる。
OVMOT の既存のアプローチは、OVD と MOT の方法論を別個のモジュールとして統合することが多く、主に画像中心のレンズによる問題に焦点を当てている。
VOVTrackは、MOTとビデオ中心トレーニングに関連するオブジェクト状態を統合する新しい手法であり、ビデオオブジェクト追跡の観点からこの問題に対処する。
論文 参考訳(メタデータ) (2024-10-11T05:01:49Z) - OSCaR: Object State Captioning and State Change Representation [52.13461424520107]
本稿では,OSCaR(Object State Captioning and State Change Representation)データセットとベンチマークを紹介する。
OSCaRは14,084の注釈付きビデオセグメントで構成され、様々なエゴセントリックなビデオコレクションから1,000近いユニークなオブジェクトが集められている。
マルチモーダル大言語モデル(MLLM)を評価するための新しいテストベッドを設定する。
論文 参考訳(メタデータ) (2024-02-27T01:48:19Z) - OLViT: Multi-Modal State Tracking via Attention-Based Embeddings for
Video-Grounded Dialog [10.290057801577662]
OLViTは、マルチモーダルアテンションベースのダイアログ状態トラッカー上で動作するビデオダイアログの新しいモデルである。
オブジェクト状態追跡器(OST)と言語状態追跡器(LST)の出力に基づいてグローバルなダイアログ状態を保持する。
論文 参考訳(メタデータ) (2024-02-20T17:00:59Z) - Scalable Video Object Segmentation with Identification Mechanism [125.4229430216776]
本稿では,半教師付きビデオオブジェクト(VOS)のスケーラブルで効果的なマルチオブジェクトモデリングを実現する上での課題について検討する。
AOT(Associating Objects with Transformers)とAOST(Associating Objects with Scalable Transformers)の2つの革新的なアプローチを提案する。
当社のアプローチは最先端の競合に勝って,6つのベンチマークすべてにおいて,例外的な効率性とスケーラビリティを一貫して示しています。
論文 参考訳(メタデータ) (2022-03-22T03:33:27Z) - Multi-modal Transformers Excel at Class-agnostic Object Detection [105.10403103027306]
既存の手法では、人間の理解可能な意味論によって支配されるトップダウンの監視信号が欠落していると論じる。
マルチスケール特徴処理と変形可能な自己アテンションを用いた効率よく柔軟なMViTアーキテクチャを開発した。
多様なアプリケーションにおけるMViT提案の重要性を示す。
論文 参考訳(メタデータ) (2021-11-22T18:59:29Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。