論文の概要: 0.5%>100%: Bidirectional Reciprocal Learning for Referring Image Segmentation
- arxiv url: http://arxiv.org/abs/2609.24510v2
- Date: Tue, 22 Sep 2026 02:32:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-23 18:04:03.996745
- Title: 0.5%>100%: Bidirectional Reciprocal Learning for Referring Image Segmentation
- Title(参考訳): 0.5%>100%:画像セグメント参照のための双方向相互学習
- Abstract要約: $textbfB$idirectional $textbfR$eciprocal $textbfL$は、新しいアダプタベースのPEFTフレームワークである。
Reciprocal Attention Adapter (RAA) はトークンレベルでクロスモーダルなクエリキー交換を行う。
Reciprocal Gate Adapter(RGA)は、チャネルレベルにおいて、クロスモーダルゲーティング信号を生成する。
- 参考スコア(独自算出の注目度): 60.19375952029603
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Recent advances in vision foundation models (VFMs) have shown remarkable capabilities across diverse unimodal visual tasks. However, adapting VFMs to referring image segmentation (RIS) typically necessitates precise vision-language alignment via full fine-tuning, incurring substantial computational overhead and risking catastrophic forgetting. While existing parameter-efficient fine-tuning (PEFT) methods enable safe knowledge transfer with minimal training costs, they predominantly operate independently within individual modalities or focus exclusively on unidirectional guidance from language to vision, overlooking progressive cross-modal interaction and visual feedback for textual refinement. To address these limitations, we propose $\textbf{B}$idirectional $\textbf{R}$eciprocal $\textbf{L}$earning ($\textbf{BRL}$), a novel adapter-based PEFT framework that facilitates hierarchical, bidirectional information flow within both token-mixing and channel-mixing layers of frozen foundation models. Specifically, BRL introduces two complementary lightweight modules. The Reciprocal Attention Adapter (RAA) performs cross-modal query-key exchanges at the token level, enabling visual and linguistic tokens to mutually attend to each other for fine-grained spatial grounding. The Reciprocal Gate Adapter (RGA) generates cross-modal gating signals at the channel level, allowing global semantic context from one modality to adaptively recalibrate channel activations of the other. Extensive experiments on RefCOCO, RefCOCO+, and RefCOCOg benchmarks demonstrate the superiority of BRL over prior RIS methods, achieving state-of-the-art performance while requiring less than 0.5% backbone parameter updates. Code and models will be released at https://github.com/xiaoqiang-lu/BRL.
- Abstract(参考訳): 視覚基礎モデル(VFM)の最近の進歩は、多種多様な視覚的タスクにまたがる顕著な能力を示している。
しかしながら、イメージセグメンテーション(RIS)を参照するためにVFMを適用するには、通常、完全な微調整によって正確な視覚言語アライメントを必要とし、かなりの計算オーバーヘッドを発生させ、破滅的な忘れのリスクを負う。
既存のパラメータ効率の微調整(PEFT)手法は、トレーニングコストを最小限に抑えた安全な知識伝達を可能にするが、それらは主に個々のモダリティ内で独立して機能するか、言語から視覚への一方向誘導にのみ焦点を合わせ、進歩的な相互モーダル相互作用やテキスト修正のための視覚的フィードバックを見越す。
これらの制限に対処するために、フリーズ基盤モデルのトークン混合層とチャネル混合層の両方において階層的で双方向な情報の流れを促進する新しいアダプタベースのPEFTフレームワークである$\textbf{B}$idirectional $\textbf{R}$eciprocal $\textbf{L}$earning ($\textbf{BRL}$。
具体的には、BRLは2つの補完的な軽量モジュールを導入している。
Reciprocal Attention Adapter (RAA) はトークンレベルでクロスモーダルなクエリキー交換を行う。
相互ゲートアダプタ(Reciprocal Gate Adapter, RGA)は、チャネルレベルでのクロスモーダルゲーティング信号を生成し、一方のモダリティから他方のチャネルアクティベーションを適応的に再調整するグローバルな意味的コンテキストを可能にする。
RefCOCO、RefCOCO+、RefCOCOgベンチマークに関する大規模な実験は、従来のRISメソッドよりもBRLの方が優れていることを示した。
コードとモデルはhttps://github.com/xiaoqiang-lu/BRL.comでリリースされる。
関連論文リスト
- LiAuto-MindViT: A Hybrid Vision Backbone with Adaptive Bidirectional Mamba [43.47610933419303]
LiAuto-MindViTは、CNN、Mamba、Transformersの強みをシナジするハイブリッドビジョンバックボーンである。
我々の設計の中核は、一方向SSMの方向性バイアスを取り除くアダプティブ双方向マンバ(ABM)である。
論文 参考訳(メタデータ) (2026-09-21T09:35:13Z) - Semantic-Driven Scale and Spatial Selection for Efficient Cross-Modal Alignment in Referring Remote Sensing Image Segmentation [14.492779733437082]
Referring Remote Sensing Imageは、リモートセンシングイメージで自然言語表現によって指定された対象または領域をローカライズし、セグメンテーションする。
既存のRRSISモデルは大規模な基礎モデルの恩恵を受けているが、それらは主に完全な微調整に依存している。
本稿では,効率的なクロスモーダルアライメントのためのセマンティック・スケールと空間選択という新しい枠組みを提案する。
論文 参考訳(メタデータ) (2026-06-29T12:54:10Z) - Ego to World: Collaborative Spatial Reasoning in Embodied Systems via Reinforcement Learning [61.753025885751036]
本稿では,3つのタスクにまたがる異種視点を融合する視覚言語モデルの能力を評価するEgo-to-Worldベンチマークを提案する。
我々は,2段階のフレームワークであるCoRLを提案し,チェイン・オブ・ソート(Chain-of-Thought)を教師付き微調整と強化学習を組み合わせた。
我々は、CoRLが、推論と知覚グラウンドのメトリクスの両方において、強力なプロプライエタリおよびオープンソースベースラインを一貫して超越していることを示します。
論文 参考訳(メタデータ) (2026-03-16T04:27:53Z) - DART: Dual Adaptive Refinement Transfer for Open-Vocabulary Multi-Label Recognition [59.203152078315235]
Open-Vocabulary Multi-Label Recognition (OV-MLR)は、画像内の複数の見えないオブジェクトカテゴリを識別することを目的としている。
ビジョンランゲージ事前学習モデルは強力なオープン語彙基盤を提供するが、弱い監督下では微粒な局所化に苦慮する。
本稿では,これらの制約を克服するためのDART(Dual Adaptive Refinement Transfer)フレームワークを提案する。
論文 参考訳(メタデータ) (2025-08-07T17:22:33Z) - ViaRL: Adaptive Temporal Grounding via Visual Iterated Amplification Reinforcement Learning [68.76048244253582]
ビデオ理解におけるフレーム選択の最適化にルールベース強化学習(RL)を利用する最初のフレームワークであるViaRLを紹介する。
ViaRLは、下流モデルの応答精度を報奨信号として利用し、試行錯誤によってフレームセレクタを訓練する。
ViaRLは、多様なビデオ理解タスクに対して、時間的基盤性能と堅牢な一般化を一貫して提供します。
論文 参考訳(メタデータ) (2025-05-21T12:29:40Z) - Semantic-Aligned Learning with Collaborative Refinement for Unsupervised VI-ReID [82.12123628480371]
教師なしの人物再識別(USL-VI-ReID)は、モデル学習のための人間のアノテーションを使わずに、同じ人物の歩行者像を異なるモードでマッチングすることを目指している。
従来の手法では、ラベルアソシエーションアルゴリズムを用いて異質な画像の擬似ラベルを統一し、グローバルな特徴学習のためのコントラスト学習フレームワークを設計していた。
本稿では,各モダリティによって強調される特定のきめ細かいパターンを対象とするSALCR(Semantic-Aligned Learning with Collaborative Refinement)フレームワークを提案する。
論文 参考訳(メタデータ) (2025-04-27T13:58:12Z) - Diffusion Augmented Retrieval: A Training-Free Approach to Interactive Text-to-Image Retrieval [7.439049772394586]
Diffusion Augmented Retrieval (DAR)は、複数の中間表現を生成するフレームワークである。
DARの結果は微調整されたI-TIRモデルと同等だが、チューニングオーバーヘッドは発生しない。
論文 参考訳(メタデータ) (2025-01-26T03:29:18Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。