論文の概要: Controllable Image Captioning with Prompt-Conditioned Scene Rewards
- arxiv url: http://arxiv.org/abs/2609.00709v1
- Date: Tue, 01 Sep 2026 04:36:23 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.322879
- Title: Controllable Image Captioning with Prompt-Conditioned Scene Rewards
- Title(参考訳): Prompt-Conditioned Scene Rewardsによる制御可能な画像キャプション
- Authors: Jongyeop Hyun, Taeyoung Kim, Hyounghun Kim,
- Abstract要約: FoCUS(FoCUS)は、ユーザーが特定のセマンティック・エムフェイズに向けてキャプションを操作できる制御可能な画像キャプション方式である。
FoCUSは、一般的なキャプション性能を劣化させることなく、制御性ときめ細かいキャプション品質を一貫して改善する。
- 参考スコア(独自算出の注目度): 13.154350707762179
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Large Vision-Language Models produce fluent image descriptions but offer limited semantic control: users cannot reliably specify whether captions should emphasize attributes, relations, or particular image regions. We present Fine-grained Captioning Control Using Scene Rewards (FoCUS), a controllable image captioning method that lets users steer captions toward specific semantic emphases through natural-language control prompts. The core idea is a prompt-conditioned control objective based on scene-graph-aligned component scores. Generated captions are parsed and aligned to scene-graph components such as objects, attributes, and relations. These components are differentially weighted, including negative weights, according to the requested emphasis. We optimize this objective with GRPO and further improve its reliability through a stricter object validity threshold and reasoning-based verification for attribute and relation scoring. To evaluate controllability, we introduce Semantic Control and Precision Evaluation (SCoPE), a benchmark with contrastive Include/Avoid constraints for measuring both target content coverage and out-of-scope suppression. Experiments on two VLM backbones show that FoCUS consistently improves controllability and fine-grained caption quality without degrading general caption performance.
- Abstract(参考訳): 大きなヴィジュアルランゲージモデルは、流動的なイメージ記述を生成するが、限定的なセマンティックコントロールを提供する: ユーザーは、キャプションが属性、関係性、または特定の画像領域を強調するべきかを確実に特定できない。
FoCUS (FoCUS) は, 自然言語制御プロンプトを用いて, ユーザが字幕を特定の意味的態様に向けて操ることのできる, 制御可能な画像キャプション方式である。
中心となるアイデアは、シーングラフに沿ったコンポーネントスコアに基づいた、プロンプト条件の制御目標である。
生成されたキャプションは解析され、オブジェクト、属性、リレーションのようなシーングラフコンポーネントにアライメントされる。
これらの成分は、要求された強調値に従って、負の重みを含む差分重み付けされる。
我々は、この目的をGRPOで最適化し、より厳格なオブジェクト妥当性閾値と属性と関係スコアの推論に基づく検証により、信頼性をさらに向上する。
制御性を評価するために,ScoPE (Semantic Control and Precision Evaluation) を導入する。
2つのVLMバックボーンの実験により、FoCUSは一般的なキャプション性能を劣化させることなく、制御性と微粒なキャプション品質を一貫して改善することが示された。
関連論文リスト
- CAPEval: A Decoupled Caption Evaluation across Understanding and Generation [29.355541032573285]
そこで我々は,人間による接頭辞文と人間による検証済みの原子チェックリスト項目を用いた,分離された字幕評価ベンチマークCAPEvalを設計した。
カバレッジは、パフォーマンスを理解するための強い相関関係として機能し、Precisionは、生成パフォーマンスの主要な予測器として機能します。
論文 参考訳(メタデータ) (2026-08-03T17:57:03Z) - TEVI: Text-Conditioned Editing of Visual Representations via Sparse Autoencoders for Improved Vision-Language Alignment [87.69757277913577]
画像埋め込みから何を保持するかの信号としてキャプションを使用するフレームワークTEVIを提案する。
合成キャプションを用いた制御設定では,TEVIは,他のキャプションを廃棄しながら,キャプション記述属性の保存に有効であることを示す。
論文 参考訳(メタデータ) (2026-06-05T16:54:40Z) - ASemConsist: Adaptive Semantic Feature Control for Training-Free Identity-Consistent Generation [14.341691123354195]
ASemconsistは、プロンプトアライメントを犠牲にすることなく、文字アイデンティティの明示的な意味制御を可能にする。
我々のフレームワークは最先端のパフォーマンスを実現し、実質的に以前のトレードオフを克服します。
論文 参考訳(メタデータ) (2025-12-29T07:06:57Z) - SC-Captioner: Improving Image Captioning with Self-Correction by Reinforcement Learning [21.739084696595427]
SC-Captionerはイメージキャプションモデルの自己修正を可能にする強化学習フレームワークである。
初期字幕と自己修正字幕のセット間の設定差を計算し、追加要素と削除要素を識別する。
大規模な視覚言語モデルにSC-Captionerを適用すると、様々なシナリオでより良い画像キャプションが生成される。
論文 参考訳(メタデータ) (2025-08-08T08:45:52Z) - Group-based Distinctive Image Captioning with Memory Difference Encoding and Attention [62.246950834745796]
グループベース微分差分キャプション法
Group-based Differential Memory Attention (GDMA)モジュール。
新しい評価指標DisWordRate
論文 参考訳(メタデータ) (2025-04-03T11:19:51Z) - Benchmarking Large Vision-Language Models via Directed Scene Graph for Comprehensive Image Captioning [77.2852342808769]
本稿では、シーングラフビューから視覚的コンテキストを評価するために、CompreCapと呼ばれる詳細なキャプションベンチマークを導入する。
画像は、まず、共通オブジェクトの語彙に従って意味的に意味のある領域に手動で分割し、また、これらすべての領域内のオブジェクトの属性を識別する。
そして、これらのオブジェクトの方向関係ラベルに注釈を付け、画像のリッチな構成情報を十分にエンコードできる方向のシーングラフを構成する。
論文 参考訳(メタデータ) (2024-12-11T18:37:42Z) - Intrinsic Image Captioning Evaluation [53.51379676690971]
I2CE(Intrinsic Image Captioning Evaluation)と呼ばれる画像キャプションのための学習ベースメトリクスを提案する。
実験の結果,提案手法は頑健な性能を維持し,意味的類似表現やアライメントの少ない意味論に遭遇した場合,候補キャプションに対してより柔軟なスコアを与えることができた。
論文 参考訳(メタデータ) (2020-12-14T08:36:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。