論文の概要: WRF4CIR: Weight-Regularized Fine-Tuning Network for Composed Image Retrieval
- arxiv url: http://arxiv.org/abs/2604.05583v1
- Date: Tue, 07 Apr 2026 08:23:39 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-08 17:42:09.715236
- Title: WRF4CIR: Weight-Regularized Fine-Tuning Network for Composed Image Retrieval
- Title(参考訳): WRF4CIR:合成画像検索のための重み調整型ファインチューニングネットワーク
- Authors: Yizhuo Xu, Chaojian Yu, Yuanjie Shao, Tongliang Liu, Qinmu Peng, Xinge You,
- Abstract要約: Composed Image Retrieval (CIR)タスクは、参照画像と修正テキストに基づいてターゲット画像を取得することを目的としている。
現在のCIR法は、微調整された視覚言語による事前訓練モデルに依存している。
我々は、CIRのための軽量正規化ファインチューニングネットワークであるWRF4CIRを紹介する。
- 参考スコア(独自算出の注目度): 58.85945491755373
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Composed Image Retrieval (CIR) task aims to retrieve target images based on reference images and modification texts. Current CIR methods primarily rely on fine-tuning vision-language pre-trained models. However, we find that these approaches commonly suffer from severe overfitting, posing challenges for CIR with limited triplet data. To better understand this issue, we present a systematic study of overfitting in VLP-based CIR, revealing a significant and previously overlooked generalization gap across different models and datasets. Motivated by these findings, we introduce WRF4CIR, a Weight-Regularized Fine-tuning network for CIR. Specifically, during the fine-tuning process, we apply adversarial perturbations to the model weights for regularization, where these perturbations are generated in the opposite direction of gradient descent. Intuitively, WRF4CIR increases the difficulty of fitting the training data, which helps mitigate overfitting in CIR under limited triplet supervision. Extensive experiments on benchmark datasets demonstrate that WRF4CIR significantly narrows the generalization gap and achieves substantial improvements over existing methods.
- Abstract(参考訳): Composed Image Retrieval (CIR)タスクは、参照画像と修正テキストに基づいてターゲット画像を取得することを目的としている。
現在のCIR法は主に微調整の視覚言語事前訓練モデルに依存している。
しかし、これらのアプローチは一般的に重度のオーバーフィッティングに悩まされ、限られた三重項データを持つCIRにとっての課題となっている。
この問題をより深く理解するために、我々はVLPベースのCIRにおける過剰適合に関する体系的研究を行い、異なるモデルやデータセット間で、これまで見過ごされていた、重要な一般化ギャップを明らかにした。
これらの知見に触発されて、我々はCIRのための軽量正規化ファインチューニングネットワークであるWRF4CIRを紹介した。
具体的には、微調整過程において、正則化のためのモデル重みに対する逆摂動を適用し、これらの摂動は勾配降下の反対方向に発生する。
直感的には、WRF4CIRはトレーニングデータの適合の難しさを増大させ、CIRにおける過剰適合を3倍の監督下で緩和するのに役立つ。
ベンチマークデータセットの大規模な実験により、WRF4CIRは一般化のギャップを著しく狭め、既存の手法よりも大幅に改善されていることが示された。
関連論文リスト
- FBCIR: Balancing Cross-Modal Focuses in Composed Image Retrieval [12.652218923459742]
合成画像検索(CIR)は、テキストイメージの入力ペアで提示される視覚的内容と意味的な修正を共同で推論するために、マルチモーダルモデルを必要とする。
FBCIR(FBCIR)は、モデル決定に最も重要な視覚的およびテキスト的入力要素を識別するマルチモーダル焦点解釈法である。
論文 参考訳(メタデータ) (2026-03-12T04:05:27Z) - Implicit Neural Representation-Based Continuous Single Image Super Resolution: An Empirical Study [50.15623093332659]
入射神経表現(INR)は任意のスケール画像超解像(ASSR)の標準的アプローチとなっている
既存の手法を多様な設定で比較し、複数の画像品質指標に対して集計結果を示す。
トレーニング中, エッジ, テクスチャ, 細部を保存しながら, 強度変化をペナライズする新たな損失関数について検討した。
論文 参考訳(メタデータ) (2026-01-25T07:09:20Z) - Rotation Equivariant Arbitrary-scale Image Super-Resolution [62.41329042683779]
任意のスケールの超解像(ASISR)は、低解像度の入力画像から任意のスケールの高分解能回復を実現することを目的としている。
本研究では, 回転同変ASISR法の構築に尽力する。
論文 参考訳(メタデータ) (2025-08-07T08:51:03Z) - CoLLM: A Large Language Model for Composed Image Retrieval [76.29725148964368]
Composed Image Retrieval (CIR)は、マルチモーダルクエリに基づいた画像検索を目的とした複雑なタスクである。
本稿では,イメージキャプションペアからトリプレットをオンザフライで生成するワンストップフレームワークであるCoLLMを提案する。
我々はLarge Language Models (LLMs) を利用して参照画像の埋め込みと修正テキストを生成する。
論文 参考訳(メタデータ) (2025-03-25T17:59:50Z) - Generalizable Non-Line-of-Sight Imaging with Learnable Physical Priors [52.195637608631955]
非視線画像(NLOS)は、その潜在的な応用により注目されている。
既存のNLOS再構成アプローチは、経験的物理的前提に依存して制約される。
本稿では,Learningable Path Compensation(LPC)とAdaptive Phasor Field(APF)の2つの主要な設計を含む,学習に基づく新しいソリューションを提案する。
論文 参考訳(メタデータ) (2024-09-21T04:39:45Z) - Tensor Factorization for Leveraging Cross-Modal Knowledge in
Data-Constrained Infrared Object Detection [22.60228799622782]
赤外線画像における物体検出のボトルネックは、十分なラベル付きトレーニングデータがないことである。
我々は、RGBモードにおけるモデル性能を保ちながら、RGBモードからオブジェクト検出器をIRモードにスケールするために、RGBモードからの手がかりを活用しようとしている。
まず、これらの因子行列をRGBモードで事前トレーニングし、多くのトレーニングデータが存在すると仮定した後、IRモードでトレーニングするためのトレーニング可能なパラメータをわずかに増やして過度な適合を避ける。
論文 参考訳(メタデータ) (2023-09-28T16:55:52Z) - Blind Super-Resolution for Remote Sensing Images via Conditional
Stochastic Normalizing Flows [14.882417028542855]
本稿では、上記の問題に対処するために、正規化フロー(BlindSRSNF)に基づく新しいブラインドSRフレームワークを提案する。
BlindSRSNFは、低解像度(LR)画像が与えられた高解像度画像空間上の条件確率分布を、確率の変動境界を明示的に最適化することによって学習する。
提案アルゴリズムは,シミュレーションLRと実世界RSIの両方において,視覚的品質の優れたSR結果が得られることを示す。
論文 参考訳(メタデータ) (2022-10-14T12:37:32Z) - Universal adversarial perturbation for remote sensing images [41.54094422831997]
本稿では,エンコーダ・デコーダネットワークとアテンション機構を組み合わせた新しい手法を提案する。
実験の結果、UAPはRSIを誤分類し、提案手法の攻撃成功率(ASR)は97.35%であることがわかった。
論文 参考訳(メタデータ) (2022-02-22T06:43:28Z) - When Relation Networks meet GANs: Relation GANs with Triplet Loss [110.7572918636599]
GAN(Generative Adversarial Network)の学習安定性はいまだに悩みの種である
本稿では,判別器のための関係ネットワークアーキテクチャについて検討し,より優れた一般化と安定性を実現する三重項損失を設計する。
ベンチマークデータセットの実験により、提案された関係判別器と新たな損失は、可変視覚タスクに大幅な改善をもたらすことが示された。
論文 参考訳(メタデータ) (2020-02-24T11:35:28Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。