論文の概要: VIF-Bench: Evaluating Visual Instruction Following in Multi-Reference Image Generation
- arxiv url: http://arxiv.org/abs/2609.37709v1
- Date: Tue, 29 Sep 2026 14:40:56 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-30 21:28:47.641026
- Title: VIF-Bench: Evaluating Visual Instruction Following in Multi-Reference Image Generation
- Title(参考訳): VIF-Bench:マルチ参照画像生成における視覚インストラクションの評価
- Abstract要約: マルチモーダル画像生成モデルは、複数の画像とテキスト命令を入力として取り、参照ベースの生成を可能にする。
このジョイント設定におけるモデル機能のエッジを評価するために設計された1,241のタスクのベンチマークであるVIF-Benchを紹介する。
これらの機能を用いて,(1)モデルが係り受け-アーチファクトのトレードオフに直面していること,(2)参照画像が制御属性の健全な状態を担っているタスクに対して視覚的指示の係り受けが低いこと,(3)視覚的指示を理解できるモデルでは,テキストで記述するよりも視覚的制約を直接提供する方がよいこと,の3つの知見が明らかになった。
- 参考スコア(独自算出の注目度): 31.578246171308873
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Recent multimodal image generation models can take multiple images and textual instructions as input, enabling reference-based generation guided not only by text but also by visual instructions such as layouts, arrows, and pose cues. However, existing benchmarks do not evaluate the joint setting in which multiple references must be composed under multiple and heterogeneous visual-instruction images. To address this gap, we introduce VIF-Bench, a benchmark of 1,241 tasks designed to assess the edge of model capabilities in this joint setting by covering: (i) multi-reference generation (up to 7) under multiple heterogeneous visual instructions (up to 6), (ii) cases where reference images can potentially compete with visual instructions (e.g., a strongly posed subject vs. a target pose), and (iii) controlled comparison of visual instructions with text descriptions at different levels of specificity. Using these capabilities, we uncover three findings: (1) models face an adherence-artifact trade-off: once models reach stronger visual instruction adherence, stronger adherence tends to coincide with more instruction artifacts in generated images, (2) visual instruction adherence tends to be lower on tasks whose reference images carry a salient state of the controlled attribute (e.g., a neon-lit subject under a light-direction instruction), most consistently for light and wind, and (3) for models that can understand visual instructions, it is often better to provide visual constraints directly rather than describe them in text; when using text, a moderate level of detail works better than an exhaustive description. VIF-Bench is released as an open benchmark to establish a basis for fair comparison in controllable multi-reference image generation.
- Abstract(参考訳): 最近のマルチモーダル画像生成モデルは、複数の画像とテキスト命令を入力として取り込むことができ、参照ベースの生成をテキストだけでなく、レイアウト、矢印、ポーズキューといった視覚的命令によってガイドすることができる。
しかし、既存のベンチマークでは、複数の参照を多重かつ異種な視覚的指示画像に基づいて構成しなければならないジョイントセッティングを評価していない。
このギャップに対処するため、我々は、このジョイント設定におけるモデル機能のエッジを評価するために設計された1,241のタスクのベンチマークであるVIF-Benchを紹介した。
(i)複数の異種視覚指示(最大6)による多重参照生成(最大7)
二 参照画像が視覚的指示と競合するおそれのある場合(例えば、被写体とターゲットのポーズとを強硬に表す場合)
(3)視覚的指示とテキスト記述との特異性の違いによる比較を制御した。
1) モデルがより強い視覚的指示の付着に達すると、より強い忠実度は生成画像のより多くの命令アーティファクトと一致する傾向にあり、(2) 参照画像が制御された属性(例えば、光と風の下のネオンライトの被写体)の健全な状態を担っているタスクにおいて、視覚的指示の付着度は低い傾向にあり、(3) 視覚的指示を理解できるモデルについては、テキストで記述するよりも直接視覚的制約を提供する方がよい場合が多い。
VIF-Benchは、制御可能なマルチ参照画像生成における公正比較の基礎を確立するためのオープンベンチマークとしてリリースされた。
関連論文リスト
- StructGen: Disambiguating Multi-Reference Image Generation via Structured Context Modeling [112.49355973930555]
マルチ参照画像生成は、テキスト命令下で複数の参照画像からの属性を統合することで、画像を合成することを目的としている。
既存のアプローチは、自然言語の命令にのみ依存しているが、複雑な意図を正確に捉えることができないことが多い。
複数の参照画像をエンコードするために構造化された辞書のような形式を用いるStructGenを提案する。
論文 参考訳(メタデータ) (2026-07-17T04:35:36Z) - Exploring Multi-Modal Large Language Models and Two-Stage Fine-Tuning for Fashion Image Retrieval [3.1033110046835457]
ファッション領域では、このタスクは色、パターン、テクスチャといった微妙なバリエーションを理解する必要がある。
既存のアプローチは、注釈付きデータが少なく、単純なネガティブサンプリングのために制限に直面している。
本稿では,多粒大言語モデル (LLaVA) を統合し,属性認識三重項を生成する新しいフレームワークを提案する。
論文 参考訳(メタデータ) (2026-06-18T01:19:32Z) - UniCustom: Unified Visual Conditioning for Multi-Reference Image Generation [65.53694602893042]
VLMエンコーディングの前にVTとVAE機能を融合した統合ビジュアルコンディショニングフレームワークを提案する。
2つのマルチ参照生成ベンチマークの実験により、UniCustomは主題の一貫性、命令従順、構成の忠実さを一貫して改善することを示した。
論文 参考訳(メタデータ) (2026-05-12T13:10:05Z) - How Well Do Models Follow Visual Instructions? VIBE: A Systematic Benchmark for Visual Instruction-Driven Image Editing [56.60465182650588]
我々は,3段階の相互作用階層を導入し,決定的接地,形態的操作,因果推論を捉える。
本稿では,スケーラブルできめ細かい評価を実現するために,タスク固有のメトリクスを備えた堅牢なLMM-as-a-judge評価フレームワークを提案する。
プロプライエタリなモデルは早期の視覚指示追従能力を示し、一貫してオープンソースモデルを上回っていることがわかった。
論文 参考訳(メタデータ) (2026-02-02T09:24:45Z) - In-Video Instructions: Visual Signals as Generative Control [79.44662698914401]
フレーム内に埋め込まれた視覚信号を命令として解釈することにより、制御可能な画像・映像生成に機能を利用することができるかを検討する。
In-Video Instructionは、オーバーレイテキスト、矢印、軌跡などの要素を通じて、視覚領域に直接ユーザーガイダンスをエンコードする。
Veo 3.1、Kling 2.5、Wan 2.2を含む最先端の3つのジェネレータの実験では、ビデオモデルがそのような視覚的に埋め込まれた命令を確実に解釈し実行できることが示されている。
論文 参考訳(メタデータ) (2025-11-24T18:38:45Z) - Improving Image Captioning with Better Use of Captions [65.39641077768488]
本稿では,画像表現とキャプション生成の両方を強化するために,キャプションで利用可能なセマンティクスをよりよく探求するための新しい画像キャプションアーキテクチャを提案する。
我々のモデルはまず,弱教師付きマルチインスタンス学習を用いて,有益な帰納バイアスをもたらすキャプション誘導型視覚関係グラフを構築した。
生成期間中、このモデルは、単語とオブジェクト/述語タグのシーケンスを共同で予測するために、マルチタスク学習を用いた視覚関係をさらに取り入れる。
論文 参考訳(メタデータ) (2020-06-21T14:10:47Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。