論文の概要: Adjudicated Captioning: Multi-Agent Alignment Scoring and Consensus-Distilled Beam Arbitration for Strict Zero-Shot Image Captioning
- arxiv url: http://arxiv.org/abs/2607.28986v1
- Date: Fri, 31 Jul 2026 03:27:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-03 14:29:40.580481
- Title: Adjudicated Captioning: Multi-Agent Alignment Scoring and Consensus-Distilled Beam Arbitration for Strict Zero-Shot Image Captioning
- Title(参考訳): 適応キャプション:複雑なゼロショット画像キャプションのためのマルチエージェントアライメントスコーリングとコンセンサスビームアロケーション
- Abstract要約: ゼロショット画像キャプション(ZIC)は、キャプタートレーニング中にペア画像キャプションの監督なしで画像を記述する。
2024年以来の厳格な登録方法の改善はない。
Inference-time multi-agent frameworkであるAdjudicated Captioningを提案する。
- 参考スコア(独自算出の注目度): 2.8448946483845994
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Zero-shot image captioning (ZIC) describes images without paired image-caption supervision during captioner training, relying on text-only corpora and frozen pretrained image-text scorers. Existing retrieval-augmented methods score image-text alignment once, at retrieval, then commit the captioner's autoregressive beam under language-model probability alone, leaving the decoder without further visual grounding feedback. Progress has stalled, with no method improving on the strict-regime best since 2024. We propose Adjudicated Captioning, an inference-time multi-agent framework that restores grounding feedback at multiple checkpoints over an unchanged IFCap captioner. First, we install a stronger frozen Retrieval Encoder at the input. Second, between retrieval and decoding we insert a frozen Cross-Attention Verifier that re-ranks the top-9 retrievals to top-5. Third, at the output beam we attach a learned Reranker pairing TriFuse, a multilayer perceptron, with MemAttend, a memory-attended transformer, the pipeline's only learned components; both are trained self-supervised by Borda-consensus distillation across the three frozen scorers, using no paired image-caption labels and no reference captions. Under the inductive headline protocol, with rerankers fit on the disjoint COCO Karpathy validation beam and applied frozen to test, the framework reaches CIDEr 117.6 and SPICE 21.9 on COCO Karpathy, up from 108.0 and 20.3 for IFCap, a +9.6 CIDEr gain, and +7.7 above NES, the strongest synthetic-image-augmented method at 109.9, without retraining the captioner. A training-free fixed-fusion baseline reaches 115.8 CIDEr, so +7.8 of the +9.6 gain comes from the non-learned architectural intervention and the remaining +1.8 from the learned rerankers. The same recipe transfers off-COCO without captioner retraining: +8.1 CIDEr on Flickr30k Karpathy and +5.7 on NoCaps overall.
- Abstract(参考訳): ゼロショット画像キャプション(ZIC)は、文字のみのコーパスと凍結事前訓練された画像テキストスコアラーに頼って、キャプタトレーニング中にペア画像キャプションを監督しないイメージを記述している。
既存の検索拡張手法は、検索時に一度画像テキストアライメントをスコアし、言語モデルのみの確率でキャプタの自己回帰ビームをコミットし、デコーダを視覚的な接地フィードバックなしで残す。
進歩は停滞しており、2024年以来の厳格な登録法の改善はない。
Inference-time multi-agent framework である Adjudicated Captioning を提案し、IFCapキャプタを変更せずに複数のチェックポイントでグラウンドングフィードバックを復元する。
まず、より強力なフリーズな検索エンコーダを入力にインストールする。
次に、検索と復号の間に凍結したクロスアテンション検証器を挿入し、トップ9の検索をトップ5に再ランクします。
第三に、出力ビームでは、学習されたRerankerペアリングTriFuse、多層パーセプトロン、メモリアタッチメントトランスフォーマーであるMemAttendを、パイプラインの唯一の学習コンポーネントとして取り付けます。
インダクティブ・ヘッドラインプロトコルでは、リランカーが解離したCOCOカルパチーのバリデーションビームに適合し、凍結試験のために適用され、このフレームワークはCOCOカルパチーのCIDEr 117.6とSPICE 21.9に到達し、IFCapの108.0と20.3、IFCapのa +9.6 CIDErゲイン、NESの+7.7から上昇する。
トレーニングなしの固定核融合ベースラインは115.8 CIDErに達するので、+9.6のゲインの7.8は、学習された再ランカからの非学習アーキテクチャの介入と残りの+1.8から来ている。
Flickr30k Karpathyでは+8.1 CIDEr、NoCapsでは+5.7である。
関連論文リスト
- CapRecover: A Cross-Modality Feature Inversion Attack Framework on Vision Language Models [11.201984255831126]
CapRecoverは、ラベルやキャプションなどの高レベルのセマンティックコンテンツを、画像再構成なしで中間機能から直接復元する。
本稿では,各層における中間機能にランダムノイズを付加し,次層におけるノイズを除去する,シンプルで効果的な保護手法を提案する。
論文 参考訳(メタデータ) (2025-07-30T16:42:02Z) - ScaleCap: Inference-Time Scalable Image Captioning via Dual-Modality Debiasing [128.8346376825612]
高品質画像キャプションの主な課題は、LVLMの固有のバイアスにある。
本稿では,キャプションを継続的に強化・校正し,推論予算を増大させる,スケーラブルなデバイアス付きキャプション戦略を提案する。
450KイメージにScaleCapをアノテートし、LVLMプレトレーニングに使用することで、11の広く使用されているベンチマークで一貫したパフォーマンス向上を実現している。
論文 参考訳(メタデータ) (2025-06-24T17:59:55Z) - Unleashing Text-to-Image Diffusion Prior for Zero-Shot Image Captioning [70.98890307376548]
そこで本研究では,学習中に不信なコンテンツを適応的に緩和する,新しいPatch-wise Cross-modal Feature Mix-up(PCM)機構を提案する。
私たちのPCM-Netは、ドメイン内およびクロスドメインのゼロショット画像キャプションの両方で第1位です。
論文 参考訳(メタデータ) (2024-12-31T13:39:08Z) - No Detail Left Behind: Revisiting Self-Retrieval for Fine-Grained Image Captioning [13.311411816150551]
画像キャプションシステムは、ノイズ(alt-text)またはジェネリック(ヒューマンアノテーション)のいずれかのデータに基づいて訓練されるため、きめ細かいキャプションを生成することができない
それまでの研究では、自己検索(SR)報酬で微調整されたキャプタによって、この制限に対処しようと試みてきた。
SRファインチューニングは, キャプションの忠実度を低下させ, 幻覚までも減少させる傾向にある。
本稿では,(1)人間のアノテーションに固定されたままの画像キャプションデータセットに細粒度を注入する新しいフレームワークであるビジュアルキャプションブースティング,(2)より最適に活用する慎重に設計されたトレーニングカリキュラムであるBagCurriについて述べる。
論文 参考訳(メタデータ) (2024-09-04T18:32:39Z) - MeaCap: Memory-Augmented Zero-shot Image Captioning [11.817667500151687]
メモリ拡張ゼロショット画像キャプチャフレームワーク(MeaCap)を提案する。
MeaCapは、幻覚の少ないコンセプト中心のキャプションを生成できる。
論文 参考訳(メタデータ) (2024-03-06T14:00:31Z) - DeCap: Decoding CLIP Latents for Zero-Shot Captioning via Text-Only
Training [73.74291217502928]
ゼロショットキャプションのための単純なフレームワークであるDeCapを提案する。
軽量な視覚認識言語デコーダを提案する。
視覚的な埋め込みはCLIPテキスト埋め込み空間に投影するが、投影された埋め込みは視覚的な入力の情報を保持する。
論文 参考訳(メタデータ) (2023-03-06T11:02:47Z) - Exploring Discrete Diffusion Models for Image Captioning [104.69608826164216]
DDCapと呼ばれる拡散型キャプションモデルを提案する。
本稿では,ベストファースト推論,集中注意マスク,テキスト長予測,画像のないトレーニングなど,いくつかの重要な手法を提案する。
4Mビジョン言語による事前学習画像とベースサイズのモデルを用いて,COCO上のCIDErスコア125.1に達する。
論文 参考訳(メタデータ) (2022-11-21T18:12:53Z) - Fine-grained Image Captioning with CLIP Reward [104.71533106301598]
ウェブから大量の画像テキストペアをトレーニングしたマルチモーダルエンコーダであるCLIPを用いて、マルチモーダル類似性を計算し、報酬関数として利用する。
また、追加のテキストアノテーションを必要としない文法を改善するために、CLIPテキストエンコーダの簡単な微調整戦略を提案する。
テキスト・ツー・イメージ検索とFineCapEvalの実験において、提案したCLIP誘導モデルは、CIDEr最適化モデルよりも顕著なキャプションを生成する。
論文 参考訳(メタデータ) (2022-05-26T02:46:09Z) - Reducing Predictive Feature Suppression in Resource-Constrained
Contrastive Image-Caption Retrieval [65.33981533521207]
我々は、リソース制約のあるICR手法における予測的特徴抑圧を減らすアプローチを提案する:潜在目標デコーディング(LTD)
LTDは、汎用文エンコーダの潜時空間で入力キャプションを再構成し、画像及びキャプションエンコーダが予測的特徴を抑制するのを防止する。
実験の結果,入力空間における入力キャプションの再構成とは異なり,LTDはリコール@k,r精度,nDCGスコアを高くすることで,予測的特徴抑制を低減できることがわかった。
論文 参考訳(メタデータ) (2022-04-28T09:55:28Z) - Injecting Semantic Concepts into End-to-End Image Captioning [61.41154537334627]
本稿では、地域特徴を抽出することなくグリッド表現を使用する、純粋視覚変換器を用いた画像キャプションモデルViTCAPを提案する。
性能向上のために,意味論的概念を予測し,それをエンドツーエンドのキャプションに組み込む新しいコンセプトトークンネットワーク(CTN)を導入する。
特に、CTNは視覚変換器に基づいて構築され、分類タスクを通じて概念トークンを予測するように設計されている。
論文 参考訳(メタデータ) (2021-12-09T22:05:05Z) - Show, Recall, and Tell: Image Captioning with Recall Mechanism [21.928309724963604]
リコール単位、セマンティックガイド(SG)、リコールワードスロット(RWS)の3つの部分がある。
テキスト要約にメカニズムを向けることで着想を得て,SGとRWSの間に生成された単語確率のバランスをとるためにソフトスイッチを採用する。
提案手法は, BLEU-4/CIDEr/SPICEスコア36.6/116.9/21.3, CIDEr最適化38.7/129.1/22.4を実現している。
論文 参考訳(メタデータ) (2020-01-15T16:32:51Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。