論文の概要: DialogueVPR: Towards Conversational Visual Place Recognition
- arxiv url: http://arxiv.org/abs/2607.14115v1
- Date: Fri, 08 May 2026 12:04:43 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-27 00:46:13.013147
- Title: DialogueVPR: Towards Conversational Visual Place Recognition
- Title(参考訳): 対話型視覚的位置認識に向けた対話型VPR
- Abstract要約: 推論検索へのパラダイムシフトを提案し,対話位置認識(DlgPR)を導入する。
DlgPRは、対話型対話駆動推論プロセスとしてローカライゼーションを論じている。
DlgQuest-Citiesは、位置認識のための最初の大規模対話ベースのベンチマークである。
- 参考スコア(独自算出の注目度): 47.182753191840185
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Inspired by how humans communicate spatial information, language-guided geo-localization has gained significant traction for its intuitive and practical value. Despite this progress, most methods still rely on a static, one-shot retrieval paradigm, which fails to handle the ambiguity and incompleteness inherent in real-world natural language descriptions. We propose a paradigm shift to reasoning retrieval and introduce Dialogue Place Recognition (DlgPR), which casts localization as an interactive, dialogue-driven reasoning process. To support this new task, we present DlgQuest-Cities, the first large-scale dialogue-based benchmark for place recognition, and a unified reasoning framework that couples a cross-modal multi-level retriever with an intelligent questioner, DQ-pilot. DQ-pilot is trained in a curriculum: supervised fine-tuning on a curated DQ-cities-20k subset followed by reinforcement refinement on a harder DQ-cities-10k split via GRPO. Two task-aligned metrics guide learning: a Discriminative Difficulty Index (DDI) for curriculum sampling and a Positional Retrieval Gain (PRG) reward that directly measures retrieval improvement induced by a question. Experiments show this reasoning-based approach significantly outperforms baselines. The code and model are available at https://github.com/Graysonggg/DlgPR.
- Abstract(参考訳): 人間が空間情報を伝達する方法にインスパイアされた言語誘導のジオローカライゼーションは、その直感的で実践的な価値によって大きな牽引力を得ている。
この進歩にもかかわらず、ほとんどのメソッドは静的なワンショット検索パラダイムに依存しており、これは現実世界の自然言語記述に固有の曖昧さと不完全性を扱うのに失敗する。
本稿では,対話型対話型推論プロセスとしてローカライゼーションを取り入れた,推論検索へのパラダイムシフトと対話場所認識(DlgPR)を提案する。
このタスクをサポートするために、我々は、位置認識のための最初の大規模対話ベースのベンチマークであるDlgQuest-Citiesと、知的質問者DQ-pilotとクロスモーダルなマルチレベルレトリバーを結合した統合推論フレームワークを提示する。
DQ-pilotはカリキュラムで訓練されており、キュレートされたDQ-cities-20kサブセットの微調整を監督し、GRPOを介してより硬いDQ-cities-10kの分割を強化する。
カリキュラムサンプリングのための識別困難指数(DDI)と、質問によって引き起こされる検索改善を直接測定する位置検索ゲイン(PRG)の2つのタスク整合メトリクスガイド学習。
実験では、この推論に基づくアプローチがベースラインを大幅に上回っている。
コードとモデルはhttps://github.com/Graysonggg/DlgPRで公開されている。
関連論文リスト
- Interactive ASR: Towards Human-Like Interaction and Semantic Coherence Evaluation for Agentic Speech Recognition [52.63676763985825]
トークンレベルの精度を超えた認識品質を評価するための意味認識評価指標を提案する。
我々は,人間のようなマルチターンインタラクションをシミュレートするエージェント・フレームワークを設計し,認識出力の反復的改善を可能にする。
対話型およびエージェント型ASRにおける今後の研究を促進するためのコードをリリースする。
論文 参考訳(メタデータ) (2026-04-10T09:02:42Z) - Human-Guided Reasoning with Large Language Models for Vietnamese Speech Emotion Recognition [1.744935381873858]
本稿では,人間の知識を学習プロセスに統合する人間と機械の協調的な枠組みを提案する。
簡単なサンプルとあいまいなサンプルを区別するために、信頼に基づくルーティング機構が導入された。
ベトナム語の音声データセットを用いて、3つの感情クラスにわたる2,764のサンプルを実験した。
論文 参考訳(メタデータ) (2026-04-02T07:24:14Z) - Modeling and Benchmarking Spoken Dialogue Rewards with Modality and Colloquialness [45.06366615980232]
SDiaReward-Datasetでトレーニングしたエンドツーエンドのマルチターン報酬モデルであるSDiaRewardを紹介する。
完全なマルチターン音声エピソードで直接動作し、ペアワイズ・プライオリティ・インスペクションに最適化されている。
実験により、SDiaRewardは最先端のペアの選好精度を達成することが示された。
論文 参考訳(メタデータ) (2026-03-16T06:39:30Z) - Thinking Forward and Backward: Multi-Objective Reinforcement Learning for Retrieval-Augmented Reasoning [137.33138614095435]
Retrieval-augmented Generation (RAG) は、大規模言語モデルにおける幻覚の緩和に有効であることが証明されている。
近年、検索に基づく対話をRAGに組み込んで、リアルタイム検索による反復推論を可能にしている。
提案するBi-RARは,各中間ステップを前方方向と後方方向の両方で共同で評価する,新たな検索拡張推論フレームワークである。
論文 参考訳(メタデータ) (2025-11-12T08:29:39Z) - A Multimodal Depth-Aware Method For Embodied Reference Understanding [56.30142869506262]
Embodied Reference Understandingでは、言語命令とポインティングキューの両方に基づいて、視覚的なシーンで対象のオブジェクトを識別する必要がある。
本稿では,データ拡張,深度マップのモダリティ,深度認識決定モジュールを共同で活用する新しいERUフレームワークを提案する。
論文 参考訳(メタデータ) (2025-10-09T14:32:21Z) - Towards Unsupervised Speech Recognition at the Syllable-Level [95.54031547995874]
マスク付き言語モデリングに基づく音節レベルのUASRフレームワークを提案する。
我々は,従来の手法では特に難しい言語であるマンダリンを効果的に一般化する。
論文 参考訳(メタデータ) (2025-10-04T02:56:33Z) - CORAL: Benchmarking Multi-turn Conversational Retrieval-Augmentation Generation [68.81271028921647]
我々は,現実的なマルチターン対話環境におけるRAGシステム評価のためのベンチマークであるCORALを紹介する。
コラルにはウィキペディアから自動的に派生した多様な情報検索会話が含まれている。
対話型RAGの3つの中核的なタスク、すなわち、通過検索、応答生成、および引用ラベリングをサポートする。
論文 参考訳(メタデータ) (2024-10-30T15:06:32Z) - ReAct: Synergizing Reasoning and Acting in Language Models [44.746116256516046]
大規模言語モデル (LLM) は, 推論トレースとタスク固有動作の両方を, インターリーブ方式で生成可能であることを示す。
我々はReActという名前のアプローチを多種多様な言語と意思決定タスクに適用する。
ReActは、単純なウィキペディアAPIと対話することで、チェーン・オブ・ソート推論でよく見られる幻覚やエラーの伝播の問題を克服する。
論文 参考訳(メタデータ) (2022-10-06T01:00:32Z) - GRASP: Guiding model with RelAtional Semantics using Prompt [3.1275060062551208]
本稿では Prompt (GRASP) を用いたRelAtional Semantics を用いた誘導モデルを提案する。
我々は、プロンプトベースの微調整アプローチを採用し、引数を意識したプロンプトマーカー戦略を用いて、ある対話における関係意味的手がかりをキャプチャする。
実験では、DialogREデータセット上でのF1とF1cのスコアの観点から、GRASPの最先端のパフォーマンスが評価された。
論文 参考訳(メタデータ) (2022-08-26T08:19:28Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。