論文の概要: Which Negatives Matter? Ask Your Text Encoder: Adaptive Similarity Margins for Dense-Caption Retrieval
- arxiv url: http://arxiv.org/abs/2608.18521v1
- Date: Wed, 19 Aug 2026 04:16:46 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-20 20:13:55.275855
- Title: Which Negatives Matter? Ask Your Text Encoder: Adaptive Similarity Margins for Dense-Caption Retrieval
- Title(参考訳): テキストエンコーダに尋ねる:Dense-Caption Retrievalのアダプティブな類似性マージン
- Abstract要約: HN-CLIPはテキストエンコーダ独自のテキストテキスト形状を用いて、負の類似度適応マージンを構成する。
HN-CLIPは、GOALより2.4倍、StructXLIPより5.4倍の速さでトレーニングしながら、最強のライバルよりも2.4--+4.3 R@1で改善している。
- 参考スコア(独自算出の注目度): 20.130842837418726
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Dense-caption retrieval has recently been improved by introducing segmentation, edge maps, LLM-filtered captions, and cross-modal modules into contrastive fine-tuning. However, these methods largely inherit the same InfoNCE objective, whose optimization can prematurely saturate under a strong pre-trained initialization: on dense captions, the loss falls below 10^{-3} on 80% of batches within the first epoch, while its gradient reaches exact zero in fp32 in 47% of measurements. We find that this behavior is closely related to the large number of near-duplicate captions in dense-caption benchmarks, where a few highly similar negatives remain unresolved after the easy majority has already been separated. As a remedy, we introduce HN-CLIP, which uses the text encoder's own text-text geometry to construct per-negative adaptive similarity margins. Specifically, a detached caption-similarity matrix is added to the negative logits, assigning larger margins to more similar captions without mining, synthesizing, or resampling negatives. The resulting objective requires only one caption-similarity matrix and a masked logit addition during training, with no auxiliary data, additional parameters, offline preprocessing, or inference-time overhead. Extensive experiments on four dense-caption retrieval benchmarks show that HN-CLIP improves over the strongest competitors by +2.4--+4.3 R@1 while training 2.4x faster than GOAL and 5.4x faster than StructXLIP. Moreover, the proposed objective improves all six tested fine-tuning frameworks on the in-domain benchmarks and reaches the strongest full-data baseline with only 20% of the training data.
- Abstract(参考訳): 近年, セグメント化, エッジマップ, LLMフィルタキャプション, クロスモーダルモジュールをコントラスト的な微調整に導入することにより, ダンスキャプション検索が改良されている。
しかし、これらの手法はほとんど同じInfoNCEの目的を継承しており、その最適化は、強い事前訓練された初期化の下で早々に飽和しうる: 密集したキャプションでは、その損失は、最初のエポック内のバッチの80%で10^{-3}未満となり、その勾配は47%でfp32で完全にゼロに達する。
この振舞いは密封型ベンチマークにおける多くの近重複キャプションと密接に関連しており、簡単な多数決がすでに分離された後も、非常に類似した負のいくつかは未解決のままである。
HN-CLIPは,テキストエンコーダのテキスト・テキスト・ジオメトリを用いて,非負の適応的類似性マージンを構成する。
具体的には、負のロジットに切り離されたキャプション類似行列を追加し、より大きなマージンを、鉱業、合成、再サンプリングすることなく、より類似したキャプションに割り当てる。
結果として得られた目的は、トレーニング中に1つのキャプション類似性マトリックスとマスク付きロジットの追加だけで、補助データ、追加パラメータ、オフライン前処理、推論時のオーバーヘッドが不要になる。
HN-CLIPは、GOALより2.4倍、StructXLIPより5.4倍の速さでトレーニングする一方、HN-CLIPは2.4-+4.3 R@1で最強のライバルよりも改善している。
さらに、提案した目的は、ドメイン内のベンチマークでテストされた6つの微調整フレームワークをすべて改善し、トレーニングデータのわずか20%で最強のフルデータベースラインに達する。
関連論文リスト
- Hypergraph-Regularized Gramian Volumes for Multimodal Retrieval [5.4018351446007875]
本研究はハイパーグラフ規則化文法ボリューム(HyVol)を紹介する。
HyVolは、オリジナルのボリューム損失を評価する前に意味関係を組み込んだトレーニングタイムモジュールである。
VAST-27Mの150Kクリップサブセットで両方のバックボーンをトレーニングし、6つのベンチマークでゼロショット性能を評価する。
論文 参考訳(メタデータ) (2026-09-14T10:12:07Z) - REER-PT: Reverse-Engineered Reasoning for Perplexity-Guided Pre-training Data Augmentation [64.84437332310516]
我々は,Reverse-Engineered Reasoning (REER) を生の事前学習データに拡張するスケーラブルなフレームワークである textbfREER-PT を紹介する。
REER-PTは予測が難しいが、それ以前のコンテキストから推論できる継続を識別し、コンテキストと継続の間の欠落した接続を再構築する簡潔な推論アノテーションを挿入する。
このスパース変換は、ソーステキストを保存し、トレーニング前のオンライン推論ロールアウトを避けることで、標準的な次世代の予測と互換性を維持します。
論文 参考訳(メタデータ) (2026-08-31T11:34:19Z) - Modalities Should Talk to Each Other: Dual-Stream Multimodal Learning for Long-Horizon Influenza Forecasting [1.2599533416395763]
一般に入手可能な監視データセットは、通常、数値疫学的信号をノイズと組み合わせ、ゆるやかに構造化され、短期的な傾向にのみ間接的に関係しており、しばしば数値的な信号と相対的に関連付けられている。
我々は,36週間のマルチモーダル履歴から12週間のILI活動を予測するマルチモーダルディープラーニングフレームワークであるDual-Stream Attention (DSA)を提案する。
論文 参考訳(メタデータ) (2026-08-24T15:20:01Z) - What CLIP Knows but Cannot Say: Recovering Negation from Frozen Intermediate Features [3.9492850032415876]
CLIPのような対照的な視覚言語モデルは、意味論的に逆のフレーズをほぼ同一の埋め込みにマッピングする。
中層は構成構文を構築するが、最終層は視覚的アライメントが上昇するにつれてこの構造を崩壊させる。
本稿では,ピーク時のエンコーダを傍受する軽量なポストホック補正システムであるPeakPatchを提案する。
論文 参考訳(メタデータ) (2026-07-25T16:15:50Z) - Zero Sum SVD: Balancing Loss Sensitivity for Low Rank LLM Compression [11.908793753919745]
白色座標における特異成分選択を行うポストトレーニング法であるtextbfZero Sum SVD (textbfZS-SVD) を提案する。
textbfZS-SVDは、累積的な損失変化を0付近に保持する textbfzero sum ルールで、モデル全体のコンポーネントをプルーする。
実験では、様々なベンチマークと圧縮比で一貫した利得を示している。
論文 参考訳(メタデータ) (2026-02-02T21:51:01Z) - SimpleMatch: A Simple and Strong Baseline for Semantic Correspondence [1.0039285760896914]
我々は,低解像度でも高い性能を実現する意味対応フレームワークであるSimpleMatchを紹介する。
現在のSOTA法よりも252x252 (3.3倍小さい)の解像度で、SimpleMatchはSPair-71kベンチマークで84.1%のPCK@0.1で優れた性能を達成した。
論文 参考訳(メタデータ) (2026-01-18T11:31:46Z) - AdaGC: Improving Training Stability for Large Language Model Pretraining [18.163318397205533]
大きなLanguageText Models(LLM)は、スケーリング中に損失の急増に直面します。
グローバルなクリッピングがこれを緩和する一方で、従来のアプローチは特定のバリエーションを緩和する。
我々は,AdaGCがグローバルクリッピングよりも25%早く収束していることを示す。
論文 参考訳(メタデータ) (2025-02-16T08:13:23Z) - Training LLMs over Neurally Compressed Text [55.11828645767342]
本稿では,高度に圧縮されたテキスト上での大規模言語モデル(LLM)の訓練について検討する。
テキストをブロックに分割し,それぞれが同じビット長に圧縮する新しい圧縮手法であるEqual-Info Windowsを提案する。
提案手法は, 大規模化により向上し, パープレキシティと推論速度のベンチマークにおいて, バイトレベルのベースラインをはるかに上回る, ニューラルネットワークによる効果的な学習を実演する。
論文 参考訳(メタデータ) (2024-04-04T17:48:28Z) - SelfSeg: A Self-supervised Sub-word Segmentation Method for Neural
Machine Translation [51.881877192924414]
サブワードセグメンテーションはニューラルマシン翻訳(NMT)に不可欠な前処理ステップである
本稿では,自己教師型ニューラルネットワークサブワードセグメンテーション手法であるSelfSegを紹介する。
SelfSegはトレーニング/デコードがはるかに高速で、並列コーパスの代わりに単言語辞書のみを必要とする。
論文 参考訳(メタデータ) (2023-07-31T04:38:47Z) - Getting More Juice Out of Your Data: Hard Pair Refinement Enhances Visual-Language Models Without Extra Data [122.282521548393]
コントラスト言語-画像事前学習 (CLIP) は, クロスモーダルな画像-テキスト表現学習の標準となっている。
HELIPは、CLIPモデルを改善するためのコスト効率のよい戦略であり、継続的なトレーニングにおいて既存のデータセット内の挑戦的なテキストイメージペアを利用することで、CLIPモデルを改善する。
論文 参考訳(メタデータ) (2023-05-09T07:00:17Z) - Improved techniques for deterministic l2 robustness [63.34032156196848]
畳み込みニューラルネットワーク(CNN)を$l_2$ノルムの下で厳密な1-Lipschitz制約で訓練することは、対向的堅牢性、解釈可能な勾配、安定した訓練に有用である。
我々は,最後の線形層を1重層に置き換えることで,1-Lipschitz CNNのロバスト性を証明する手法を提案する。
我々は,CIFAR-10およびCIFAR-100における標準および証明可能な堅牢な精度の最先端化を図る。
論文 参考訳(メタデータ) (2022-11-15T19:10:12Z) - PyramidCLIP: Hierarchical Feature Alignment for Vision-language Model
Pretraining [68.84339672878066]
意味レベルが異なる入力ピラミッドを構築し,視覚的要素と言語的要素を階層構造として整列させる。
ゼロショット画像分類、ゼロショット画像テキスト検索、画像オブジェクト検出を含む3つの下流タスクの実験は、提案したピラミドCLIPの有効性を検証する。
論文 参考訳(メタデータ) (2022-04-29T13:38:42Z) - Provable Stochastic Optimization for Global Contrastive Learning: Small
Batch Does Not Harm Performance [53.49803579981569]
各正の対と全ての負の対をアンカーポイントで対比する、コントラスト学習のグローバルな目的を考える。
SimCLRのような既存のメソッドは、十分な結果を得るために大きなバッチサイズを必要とする。
本稿では,SogCLRという表現のグローバルコントラスト学習を解くためのメモリ効率の最適化アルゴリズムを提案する。
論文 参考訳(メタデータ) (2022-02-24T22:16:53Z) - Boosting Continuous Sign Language Recognition via Cross Modality
Augmentation [135.30357113518127]
連続手話認識は不整合のビデオテキストペアを扱う。
クロスモーダル拡張を用いた新しいアーキテクチャを提案する。
提案するフレームワークは、既存のCTCベースの連続SLRアーキテクチャに容易に拡張できる。
論文 参考訳(メタデータ) (2020-10-11T15:07:50Z) - Adaptive additive classification-based loss for deep metric learning [0.0]
分類に基づくディープメトリック学習において,既存の適応マージンの拡張を提案する。
コンバージェンスを高速化し、コードの複雑さを従来の最先端よりも小さくすることで、私たちの成果が得られました。
論文 参考訳(メタデータ) (2020-06-25T20:45:22Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。