論文の概要: A Glance Is All You Need: Single-Pass Fine-Grained Image Captioning with SimLoss
- arxiv url: http://arxiv.org/abs/2609.00591v1
- Date: Tue, 01 Sep 2026 02:31:34 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.243339
- Title: A Glance Is All You Need: Single-Pass Fine-Grained Image Captioning with SimLoss
- Title(参考訳): SimLossで美しい画像が撮れる「Glance」
- Authors: Suryaansh Jain, Rahasya Barkur, Vishal G, Ryan Rossi, Franck Dernoncourt, Jack Wang, Koustava Goswami, Nedim Lipka, Puneet Mathur, Samyadeep Basu, Seunghyun Yoon,
- Abstract要約: 単一パスの微細な画像キャプションのための参照不要な埋め込み空間であるSimLossを提案する。
SimLossは視覚言語モデルをトレーニングし、プロジェクションされた隠れ状態表現と凍結したイメージ埋め込みを一致させる。
ローカルに利用可能な埋め込みモデルを通じてバックプロパゲートするSimLoss FFTと、そのモデルをブラックボックス報酬として扱うSimLoss GRPOとしてインスタンス化します。
- 参考スコア(独自算出の注目度): 57.649669674850095
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: An image may be worth a thousand words, but most captioning models describe it in only a few. Modern vision-language models produce fluent high-level captions, yet routinely miss the attributes, counts, textures, materials, and spatial relations that make an image visually specific. Recent multi-stage systems recover some of these details through generation, decomposition, verification, and rewriting, but they do so at the expense of substantially higher inference latency. We propose SimLoss, a reference-free embedding-space objective for single-pass fine-grained image captioning. SimLoss trains a vision-language model to align its projected hidden-state representation with a frozen image embedding through an InfoNCE contrastive loss, supplying a dense visual supervision signal before any text is decoded, and requiring neither human-written fine-grained captions nor pseudo-captions from a multi-stage pipeline. We instantiate it as SimLoss FFT, which backpropagates through a locally available embedding model, and SimLoss GRPO, which treats that model as a black-box reward. Compared with single-pass, multi-stage verification, reward-optimized, and perception-aware baselines, the fully differentiable fine-tuning variant, SimLoss FFT, achieves the highest precision while nearly matching the F1 score of the multi-stage method, all while retaining single-pass inference and running roughly 20 times faster than the multi-stage pipeline. The reward-based variant SimLoss GRPO attains the strongest recall. Together, these results show that embedding-space supervision can recover the quality of multi-stage verification at the latency of a single-pass captioner.
- Abstract(参考訳): 画像は1000ワードの価値があるかもしれないが、ほとんどのキャプションモデルではほんの数ワードで表現されている。
現代の視覚言語モデルは、流動的な高水準のキャプションを生成するが、イメージを視覚的に特定する属性、数、テクスチャ、材料、空間関係を常に見逃す。
最近のマルチステージシステムは、生成、分解、検証、書き換えによってこれらの詳細を回復しているが、かなり高い推論遅延を犠牲にしている。
単一パスの微細な画像キャプションのための参照不要な埋め込み空間であるSimLossを提案する。
SimLossは視覚言語モデルを訓練し、投影された隠れ状態表現とInfoNCEのコントラスト損失を埋め込んだ凍結画像とを一致させ、テキストがデコードされる前に密集した視覚的監視信号を供給し、人間の手書きの細かいキャプションもマルチステージパイプラインからの擬似キャプションも必要としない。
ローカルに利用可能な埋め込みモデルを通じてバックプロパゲートするSimLoss FFTと、そのモデルをブラックボックス報酬として扱うSimLoss GRPOとしてインスタンス化します。
シングルパス、マルチステージ検証、報酬最適化、知覚認識ベースラインと比較して、完全に微分可能な微調整型であるSimLoss FFTは、マルチステージ方式のF1スコアとほぼ一致しながら、シングルパスの推論を保持しながら、マルチステージパイプラインの約20倍の速度で実行しながら、最高精度を達成する。
報酬ベースの変種SimLoss GRPOは最強リコールを達成した。
これらの結果から,埋め込み空間の監視は,単一パスキャプタのレイテンシにおいて,多段階検証の品質を回復できることが示された。
関連論文リスト
- Timage: A Generative Text-in-Image Paradigm for Fine-Tuning Vision-Language Models [22.803631190636313]
我々は、マルチモーダル理解を入力で解決したアライメント問題として再キャストするパラダイムであるTimageを紹介する。
この研究は、意図的な入力再構成をマルチモーダル推論を強化するための強力なアーキテクチャニュートラルレバーとして位置づけている。
論文 参考訳(メタデータ) (2026-06-18T08:40:41Z) - CycleCap: Improving VLMs Captioning Performance via Self-Supervised Cycle Consistency Fine-Tuning [65.10059440725041]
視覚言語モデル(VLM)は画像キャプション、視覚的質問応答、視覚的推論において顕著な進歩を遂げている。
ヴィジュアル言語を誤用する傾向があり、しばしば過度に汎用的あるいは幻覚的な記述を生み出している。
既存のアプローチでは、コストがかかる大規模アノテートデータセットのインストラクションチューニングと、キャプションリファインメントのための複雑なテストタイムフレームワークによって、この問題に対処している。
本研究では,サイクル一貫性のレンズを用いて,画像テキストのアライメントを再考する。
論文 参考訳(メタデータ) (2026-03-18T20:57:31Z) - RICO: Improving Accuracy and Completeness in Image Recaptioning via Visual Reconstruction [22.72702783743817]
RICOは視覚的再構成によってキャプションを洗練させる新しいフレームワークである。
DPOを用いてRICOのようなキャプションを生成するRICO-Flashを導入する。
提案手法はキャプション精度と完全性を大幅に向上させ,CapsBenchとCompreCapでは,ほとんどのベースラインを約10%上回った。
論文 参考訳(メタデータ) (2025-05-28T17:29:34Z) - Revisit Large-Scale Image-Caption Data in Pre-training Multimodal Foundation Models [63.01630478059315]
マルチモーダルモデルの最近の進歩は、性能向上のための書き直しキャプションの価値を強調している。
プレトレーニングにおける合成キャプションとオリジナルのWebcrawled AltTextsとの相互作用が、まだよく理解されていないかどうかは不明だ。
様々なマルチモーダルモデルに適した多様なキャプションフォーマットを生成するために,新しい,制御可能な,スケーラブルなキャプションパイプラインを提案する。
論文 参考訳(メタデータ) (2024-10-03T17:54:52Z) - Mitigating Open-Vocabulary Caption Hallucinations [33.960405731583656]
オープン語彙設定における画像キャプションにおける幻覚に対処する枠組みを提案する。
我々のフレームワークには、生成基盤モデルを利用してオープン語彙オブジェクト幻覚を評価する新しいベンチマークであるOpenCHAIRが含まれている。
閉じたオブジェクトリストを使わずにオープン語彙の幻覚を緩和するために,MOCHaを提案する。
論文 参考訳(メタデータ) (2023-12-06T17:28:03Z) - Few-shot Action Recognition with Captioning Foundation Models [61.40271046233581]
CapFSARは、テキストを手動でアノテートすることなく、マルチモーダルモデルの知識を利用するフレームワークである。
Transformerをベースとしたビジュアルテキストアグリゲーションモジュールはさらに、モーダル時間間の補完情報を組み込むように設計されている。
複数の標準的な数ショットベンチマークの実験では、提案したCapFSARが既存の手法に対して好適に動作することを示した。
論文 参考訳(メタデータ) (2023-10-16T07:08:39Z) - Injecting Semantic Concepts into End-to-End Image Captioning [61.41154537334627]
本稿では、地域特徴を抽出することなくグリッド表現を使用する、純粋視覚変換器を用いた画像キャプションモデルViTCAPを提案する。
性能向上のために,意味論的概念を予測し,それをエンドツーエンドのキャプションに組み込む新しいコンセプトトークンネットワーク(CTN)を導入する。
特に、CTNは視覚変換器に基づいて構築され、分類タスクを通じて概念トークンを予測するように設計されている。
論文 参考訳(メタデータ) (2021-12-09T22:05:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。