論文の概要: One Channel to Rule Them All: Rethinking Input Representation for Visual Place Recognition
- arxiv url: http://arxiv.org/abs/2606.00936v1
- Date: Sun, 31 May 2026 00:30:05 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-02 21:34:28.988944
- Title: One Channel to Rule Them All: Rethinking Input Representation for Visual Place Recognition
- Title(参考訳): 視覚的位置認識のための入力表現の再考
- Authors: Timur Ismagilov, Shakaiba Majeed, Michael Milford, Tan Viet Tuyen Nguyen, Sarvapali D. Ramchurn, Shoaib Ehsan,
- Abstract要約: 視覚的位置認識は、長期ロボットのローカライゼーションとSLAMの基礎となる。
現在のシステムはRGB入力に大きく依存しており、グローバルな位置認識には暗黙的に色が必要であると仮定している。
グレースケールは一般的にRGBのパフォーマンスと一致し, 外観変化が激しい場合, 性能に優れることがわかった。
- 参考スコア(独自算出の注目度): 14.020214078011515
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Visual Place Recognition (VPR) is fundamental to long-term robot localization and SLAM, yet current systems overwhelmingly rely on RGB input, implicitly assuming color is necessary for global place recognition. We challenge this assumption, investigating the role of chromatic information across training regimes, model architectures and standard benchmarks under real-world appearance variation. We find that grayscale matches RGB performance generally and outperforms it under severe appearance shifts where color invariance is insufficiently learned, while color provides meaningful gains only where persistent and discriminative chromatic cues are present. Across selected benchmarks, a fully gray-trained MixVPR model achieves an average 82.4% Recall@1 compared to 81.2% for its RGB counterpart. In some cases, lightweight grayscale variants with 60% fewer parameters can outperform heavier RGB models. Grayscale further offers practical advantages in storage, bandwidth and alignment with resource-constrained systems. We conclude that for global VPR where scenes vary across illumination, weather, season and setting, color contributes minimally, and grayscale alone is sufficient for reliable place recognition.
- Abstract(参考訳): 視覚的位置認識(VPR)は、長期ロボットのローカライゼーションとSLAMの基礎であるが、現在のシステムはRGB入力に圧倒的に依存しており、グローバルな位置認識には色が必要であると暗黙的に仮定している。
この仮定に挑戦し、実世界の外観変化下でのトレーニング体制、モデルアーキテクチャ、標準ベンチマークにおける色情報の役割について検討する。
グレースケールはRGB性能と概ね一致し,色差が不十分な外観変化の下では優れ,色が持続的かつ差別的な色相が現れる場合にのみ有意義な利得をもたらすことが判明した。
選択されたベンチマークでは、完全にグレーのトレーニングを受けたMixVPRモデルが平均82.4%のRecall@1を達成するのに対し、RGBは81.2%である。
一部のケースでは、パラメータが60%少ない軽量のグレースケールのバリエーションは、より重いRGBモデルより優れている。
Grayscaleはさらに、ストレージ、帯域幅、リソース制限されたシステムとのアライメントにおいて、実用的な利点を提供している。
照明, 天気, 季節, 設定の異なるグローバルなVPRでは, 色は最小限に寄与し, グレースケール単独では信頼性の高い場所認識に十分である。
関連論文リスト
- Color When It Counts: Grayscale-Guided Online Triggering for Always-On Streaming Video Sensing [58.25947399492333]
グレースケール・アレンジ,カラー・オン・デマンドという,効率的なストリーミングビデオ理解のための新しいパラダイムを提案する。
そこで我々は、カラーキャプチャーを窓付きグレースケール親和性分析に基づいて起動するオンライントレーニングフリートリガであるColorTriggerを提案する。
ストリーミングビデオ理解ベンチマークでは、ColorTriggerはフルカラーのベースライン性能の91.6%を達成し、8.1%のRGBフレームしか使用していない。
論文 参考訳(メタデータ) (2026-03-23T18:32:36Z) - PEPR: Privileged Event-based Predictive Regularization for Domain Generalization [19.185122873391517]
本稿では,厳密な単一モダリティRGBモデルをトレーニングするための特権情報(LUPI)パラダイムを用いた学習環境下でのクロスモーダルフレームワークを提案する。
イベントカメラを特権情報のソースとして利用し、トレーニング中にのみ利用可能です。
RGBエンコーダをPEPRでトレーニングし、イベントベースの潜伏特性を予測し、意味豊かさを犠牲にすることなくロバスト性を蒸留する。
論文 参考訳(メタデータ) (2026-02-04T14:10:36Z) - Histogram Assisted Quality Aware Generative Model for Resolution Invariant NIR Image Colorization [0.9064664319018063]
本稿では,分解能不変なNIR-to-RGBカラー化のための統一生成モデルHAQAGenを提案する。
提案モデルでは, (i) 異なるヒストグラムマッチング, 知覚的画像品質測定, テクスチャ情報を保存するための特徴に基づく類似性を通じて, グローバルな色統計を整合させる複合的損失項を導入する。
品質を犠牲にすることなく高分解能翻訳を可能にする適応分解能推論エンジンを導入する。
論文 参考訳(メタデータ) (2026-01-03T07:46:59Z) - VELoRA: A Low-Rank Adaptation Approach for Efficient RGB-Event based Recognition [54.27379947727035]
本稿では,RGBイベントに基づく分類のために,事前学習した基盤視覚モデルに適応するための新しいPEFT戦略を提案する。
また、2重モードのフレーム差は、フレーム差バックボーンネットワークを介してモーションキューをキャプチャすると考えられている。
ソースコードと事前トレーニングされたモデルはurlhttps://github.com/Event-AHU/VELoRAでリリースされる。
論文 参考訳(メタデータ) (2024-12-28T07:38:23Z) - UniRGB-IR: A Unified Framework for Visible-Infrared Semantic Tasks via Adapter Tuning [34.727262809777095]
我々は、RGB-IRセマンティックタスクのためのスケーラブルで効率的なフレームワークUniRGB-IRを提案する。
本フレームワークは,視覚変換器(ViT)基礎モデル,マルチモーダル特徴プール(SFI)モジュール,補助特徴プール(SFI)モジュールの3つの主要コンポーネントから構成される。
各種RGB-IRセマンティックタスクの実験結果から,本手法が最先端の性能を実現することを示す。
論文 参考訳(メタデータ) (2024-04-26T12:21:57Z) - Rethinking RGB Color Representation for Image Restoration Models [55.81013540537963]
各画素に局所的な近傍構造情報を保持するために表現を拡大する。
画素あたりの損失に対する表現空間の置換は、画像復元モデルのトレーニングを容易にする。
私たちの空間は、色と局所構造の両方を再構築することで、全体的なメトリクスを一貫して改善します。
論文 参考訳(メタデータ) (2024-02-05T06:38:39Z) - Self-Supervised Modality-Aware Multiple Granularity Pre-Training for
RGB-Infrared Person Re-Identification [9.624510941236837]
Modality-Aware Multiple Granularity Learning (MMGL)は、ImageNetの事前学習に代わる自己教師付き事前学習である。
MMGLはImageNetの事前トレーニングよりも高速なトレーニング速度(数時間で収束)とデータ効率(5%のデータサイズ)で、より良い表現(+6.47% Rank-1)を学習する。
結果は、既存のさまざまなモデル、損失をうまく一般化し、データセット間で有望な転送可能性を持つことを示唆している。
論文 参考訳(メタデータ) (2021-12-12T04:40:33Z) - CoRe: Color Regression for Multicolor Fashion Garments [80.57724826629176]
本稿では,RGBの正確な値を予測するために,色検出を回帰問題として扱う。
新たに提案したアーキテクチャの洗練のための第2のレグレッションステージも含んでいます。
このアーキテクチャはモジュラーであり、多色衣料のすべての色のRGBを検出するために容易に拡張される。
論文 参考訳(メタデータ) (2020-10-06T16:12:30Z) - Bi-directional Cross-Modality Feature Propagation with
Separation-and-Aggregation Gate for RGB-D Semantic Segmentation [59.94819184452694]
深度情報はRGBD画像のセマンティックセグメンテーションにおいて有用であることが証明されている。
既存のほとんどの研究は、深度測定がRGBピクセルと正確で整合していると仮定し、問題をモーダルな特徴融合としてモデル化している。
本稿では,RGB特徴量応答を効果的に再検討するだけでなく,複数の段階を通して正確な深度情報を抽出し,代わりに2つの補正表現を集約する,統一的で効率的なクロスモダリティガイドを提案する。
論文 参考訳(メタデータ) (2020-07-17T18:35:24Z) - Synergistic saliency and depth prediction for RGB-D saliency detection [76.27406945671379]
既存のRGB-Dサリエンシデータセットは小さく、多様なシナリオに対して過度に適合し、限定的な一般化につながる可能性がある。
そこで本研究では,RGB-Dサリエンシ検出のための半教師付きシステムを提案する。
論文 参考訳(メタデータ) (2020-07-03T14:24:41Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。