論文の概要: Retrieval Geometry Shapes Cache-Based Clip Adaptation
- arxiv url: http://arxiv.org/abs/2609.23409v2
- Date: Fri, 25 Sep 2026 17:06:50 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-28 18:27:51.024652
- Title: Retrieval Geometry Shapes Cache-Based Clip Adaptation
- Title(参考訳): Retrieval Geometryはキャッシュベースのクリップ適応を形作る
- Abstract要約: キャッシュベースのテスト時間適応は、モデルを凍結したままターゲットストリームからサンプルを保存、検索することで、CLIP予測を改善する。
メモリを固定し、検索エンコーダのみを変更することで、同じメモリが全く異なる利得が得られることを確かめる。
そこで本研究では,凍結したCLIPを予測に使用し,DINOv2-Bを単一の融合重み付き検索に使用するトレーニングフリーシステムであるMARC(Memory Augmented Retrieval for CLIP)を提案する。
- 参考スコア(独自算出の注目度): 9.720641053785256
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Cache-based test-time adaptation improves CLIP predictions by storing and retrieving examples from the target stream while keeping the model frozen. However, existing methods largely treat the feature space used for image-image retrieval as fixed, leaving open how much adaptation depends on the retrieval space itself. We study this question by fixing the memory and changing only the retrieval encoder, finding that the same memory can yield very different gains: across sixteen retrieval spaces, ImageNet-A cache gain ranges from at most +0.44 points for CLIP and MAE to +19.7 +/- 0.4 for DINOv2-L, while label-free retrieval-space selection retains 98% of oracle gain on ImageNet-V2. These results show that memory quality depends not only on which examples are stored, but also on how they are retrieved. Motivated by this finding, we propose MARC (Memory Augmented Retrieval for CLIP), a training-free system that uses frozen CLIP for prediction and DINOv2-B for retrieval with a single fusion weight. A single-view cache repairs 1074 +/- 21 baseline errors, compared with 878 +/- 4 for a 64-view ensemble, at roughly one seventh of the cost. Across four ImageNet distribution shifts, MARC reaches a 67.91% OOD average and, at matched DINOv2-B scale and eight views, achieves 64.17 +/- 0.31% versus 62.75 +/- 0.15% for a graph-based cache system while running 2.6 times faster. Overall, our results establish retrieval space as a first-order design choice for robust cache-based adaptation in remote sensing, scientific imaging, and changing visual environments.
- Abstract(参考訳): キャッシュベースのテスト時間適応は、モデルを凍結したままターゲットストリームからサンプルを保存、検索することで、CLIP予測を改善する。
しかし、既存の手法は画像画像検索に使用される特徴空間を主に固定として扱い、検索空間自体にどの程度の適応が依存するかをオープンにしておく。
我々は、メモリを固定し、検索エンコーダだけを変更して、同じメモリが16個の検索空間、ImageNet-Aのキャッシュゲイン範囲を、CLIPとMAEの最大+0.44ポイントからDINOv2-Lの+19.7+/-0.4まで、非常に異なる利得が得られることを発見した。
これらの結果は、メモリ品質がどのサンプルが格納されているかだけでなく、どのように検索されるかにも依存していることを示している。
そこで本研究では,凍結したCLIPを予測に使用し,DINOv2-Bを単一の融合重み付き検索に使用するトレーニングフリーシステムであるMARC(Memory Augmented Retrieval for CLIP)を提案する。
シングルビューキャッシュは、64ビューアンサンブルの878 +/- 4と比較して1074 +/-21のベースラインエラーを約7分の1のコストで修復する。
ImageNetの4つの分散シフトの中で、MARCは平均67.91%のOODに達し、一致するDINOv2-Bスケールと8ビューで64.17 +/- 0.31%、グラフベースのキャッシュシステムでは62.75 +/- 0.15%を達成した。
その結果, 遠隔センシング, 科学的イメージング, 視覚環境の変化において, 堅牢なキャッシュベースの適応のための一次設計選択として, 検索空間を確立した。
関連論文リスト
- XKV: Personalized KV Cache Memory Reduction for Long-Context LLM Inference [9.65524177141491]
大規模言語モデル(LLM)推論は出力トークンを1つずつ生成し、多くの冗長な計算に繋がる。
KV-Cacheフレームワークは時間と空間の複雑さを妥協する。
既存の研究では、推論精度に重要でないキャッシュデータの一部を削除することで、メモリ消費を減らすことができる。
各レイヤのキャッシュサイズをパーソナライズしてカスタマイズすることで,メモリの大幅な削減が期待できることを示す。
論文 参考訳(メタデータ) (2024-12-08T11:32:08Z) - Optimizing Domain-Specific Image Retrieval: A Benchmark of FAISS and Annoy with Fine-Tuned Features [0.0]
近似Nearest Neighborサーチは、多くのアプリケーションにおいて、高速なデータ検索性能の鍵の1つである。
我々は、カスタム画像データセット上でインデックス時間、メモリ使用量、クエリ時間、精度、リコール、F1スコア、リコール@5に関するシステムを評価する。
論文 参考訳(メタデータ) (2024-12-02T14:43:06Z) - Space-time Reinforcement Network for Video Object Segmentation [16.67780344875854]
ビデオオブジェクトセグメンテーション(VOS)ネットワークは通常、メモリベースの手法を使用する。
これらの手法は,1) 隣接するビデオフレーム間の空間的コヒーレンスをデータの整合によって破壊し,2) 画素レベルのマッチングが望ましくないミスマッチを引き起こすという2つの問題に悩まされる。
本稿では,隣接フレーム間の補助フレームを生成することを提案し,クエリの暗黙的短時間参照として機能する。
論文 参考訳(メタデータ) (2024-05-07T06:26:30Z) - FLIQS: One-Shot Mixed-Precision Floating-Point and Integer Quantization Search [50.07268323597872]
本稿では,整数浮動小数点モデルと低精度浮動小数点モデルの両方において再学習を不要とする,最初のワンショット混合量子化探索を提案する。
整数モデルでは、ImageNet上のResNet-18の精度を1.31%、ResNet-50の精度を0.90%向上させる。
従来のFP8モデルと比較して,新しい混合精度浮動小数点探索を探索し,最大0.98%改善した。
論文 参考訳(メタデータ) (2023-08-07T04:17:19Z) - Class-Incremental Exemplar Compression for Class-Incremental Learning [90.93462714376078]
CIM(class-incremental masking)と呼ばれる適応マスク生成モデルを提案する。
我々は,Food-101, ImageNet-100, ImageNet-1000などの高分解能CILベンチマーク実験を行った。
CIMによる圧縮例を用いることで,10Phase ImageNet-1000のFOSTERよりも4.8ポイント高いCIL精度が得られることを示す。
論文 参考訳(メタデータ) (2023-03-24T14:51:20Z) - Scaling Up Dataset Distillation to ImageNet-1K with Constant Memory [66.035487142452]
MTT(trajectory-matching-based method)は,ImageNet-1Kなどの大規模データセットに拡張可能であることを示す。
メモリフットプリントの6倍の削減を図り,MTTをImageNet-1Kにシームレスにスケールすることができる。
1つのGPU上で、ImageNet-1K上で50 IPC(Image Per Class)までスケールアップできる。
論文 参考訳(メタデータ) (2022-11-19T04:46:03Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。