論文の概要: Can Text-to-Image Models Draw from the Right Frame of Reference?
- arxiv url: http://arxiv.org/abs/2608.03357v1
- Date: Tue, 04 Aug 2026 09:05:35 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-05 15:30:23.107206
- Title: Can Text-to-Image Models Draw from the Right Frame of Reference?
- Title(参考訳): テキスト・トゥ・イメージ・モデルは参照の右枠から引き出すことができるか?
- Abstract要約: FOR-T2Iは、カメラビューと異なる場合に、モデルが特定の参照フレームに従うことができるかどうかを評価するベンチマークである。
22のクローズドソースおよびオープンソースT2Iモデルで、最終的な精度はFoRプロンプトよりも41.8%低い。
本稿では,視覚フィードバックを用いて書き直しプロンプトを選択し,FORの精度を25.0%から29.2%に向上させるVLM-gateリライト手法を提案する。
- 参考スコア(独自算出の注目度): 7.483823435566474
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Spatial instruction following has become a crucial requirement for text-to-image (T2I) generation. A common challenge arises when directional expressions are interpreted under different frames of reference. For example, ``the left of'' may refer to the viewer's image coordinates or to the intrinsic orientation of an object, leading to different expected layouts. Existing T2I benchmarks reveal important layout failures, yet they rarely isolate whether models can follow a specified frame of reference when it differs from camera view. To mitigate this gap, we introduce FoR-T2I, a benchmark for evaluating this distinction with 1,200 prompt pairs built from controlled spatial layouts. In each pair, the camera-view (Cam) prompt states the target relation in camera view, while the frame-of-reference (FoR) prompt describes the same target placement through an oriented anchor object. Across 22 closed-source and open-source T2I models, mean final accuracy is 41.8\% lower on FoR prompts than on matched Cam prompts; even the best-performing model achieves only 44.3\% FoR accuracy. This suggests that current models struggle more when the same layout is described through an object's orientation rather than directly in image coordinates. We further analyze this gap by relation type and camera view, compare several training-free prompting and feedback-based mitigation strategies, and propose a VLM-gated rewriting approach that selects rewritten prompts using visual feedback, improving average FoR accuracy from 25.0\% to 29.2\% under the same generation budget.
- Abstract(参考訳): テキスト・ツー・イメージ(T2I)生成において,空間的命令の従が重要な要件となっている。
共通の課題は、方向表現が異なる参照フレームで解釈されるときに生じる。
例えば ``the left of'' は、ビューアのイメージ座標や、オブジェクトの固有の向きを指して、期待されるレイアウトが異なる。
既存のT2Iベンチマークでは、重要なレイアウト上の障害が明らかになっているが、カメラビューと異なる場合に、モデルが特定の参照フレームに従うことができるかどうかを区別することは滅多にない。
このギャップを軽減するために、制御空間配置から構築された1200個のプロンプトペアを用いて、この区別を評価するベンチマークであるFoR-T2Iを導入する。
各ペアにおいて、カメラビュー(Cam)は、カメラビューにおいてターゲット関係をプロンプトし、フレームオブ参照(FoR)プロンプトは、向き付けられたアンカーオブジェクトを介して同じターゲット配置を記述する。
22のクローズドソースおよびオープンソースT2Iモデルにおいて、最終精度は一致したカムプロンプトよりも41.8\%低い。
これは、画像座標を直接記述するのではなく、オブジェクトの向きによって同じレイアウトを記述する場合、現在のモデルの方が苦戦していることを示唆している。
さらに、このギャップを、関係型とカメラビューで分析し、トレーニング不要なプロンプトとフィードバックに基づく緩和戦略を比較し、視覚フィードバックを用いて書き直しプロンプトを選択し、同じ世代予算下で平均FoR精度を25.0\%から29.2\%に改善するVLM付きリライト手法を提案する。
関連論文リスト
- Imagine Before You Draw: Visual Prompt Engineering for Image Generation [67.81347924426714]
内部フレームワークにシームレスに統合可能なVisual Prompt Engineering (VPE)を提案する。
我々は,クラス条件生成,テキスト・ツー・イメージ生成,画像編集にまたがってVPEを検証する。
その結果, VPEはコンバージェンスを加速し, 天井の質を高め, 内部統合により, 編集保存性を大幅に向上することがわかった。
論文 参考訳(メタデータ) (2026-06-03T05:01:36Z) - T2I-VeRW: Part-level Fine-grained Perception for Text-to-Image Vehicle Retrieval [27.508200973079507]
Vehicle Re-IDは、重複しないカメラによって撮影された画像から、与えられたクエリに最もよく似た画像を取得することを目的としている。
我々はPFCVRを提案する。PFCVRは、テキストから画像への車両再識別のための細粒度クロスモーダル車両検索モデルである。
論文 参考訳(メタデータ) (2026-05-07T11:10:30Z) - FoR-SALE: Frame of Reference-guided Spatial Adjustment in LLM-based Diffusion Editing [30.060342890828043]
テキスト・トゥ・イメージ(T2I)生成では、カメラ以外の視点から空間記述が提供される場合、最先端モデルでさえ大きな性能差を示す。
本フレームワークは,1ラウンドの補正のみを用いて,最先端T2Iモデルの性能を最大5.3%向上させる。
論文 参考訳(メタデータ) (2025-09-27T18:42:04Z) - RFMI: Estimating Mutual Information on Rectified Flow for Text-to-Image Alignment [51.85242063075333]
フローマッチングフレームワークでトレーニングされたRectified Flow (RF)モデルは、Text-to-Image (T2I)条件生成における最先端のパフォーマンスを達成した。
しかし、複数のベンチマークでは、合成画像はプロンプトとの整合性に乏しいことが示されている。
RFMI(Mutual Information (MI) 推定器) を導入し,MI推定に事前学習モデル自体を用いる。
論文 参考訳(メタデータ) (2025-03-18T15:41:45Z) - SRPose: Two-view Relative Pose Estimation with Sparse Keypoints [51.49105161103385]
SRPoseは、カメラ・トゥ・ワールドおよびオブジェクト・トゥ・カメラシナリオにおける2ビュー相対ポーズ推定のためのスパースキーポイントベースのフレームワークである。
精度と速度の点で最先端の手法と比較して、競争力や優れた性能を達成する。
さまざまな画像サイズやカメラ固有の機能に対して堅牢であり、低コンピューティングリソースでデプロイすることができる。
論文 参考訳(メタデータ) (2024-07-11T05:46:35Z) - Who Evaluates the Evaluations? Objectively Scoring Text-to-Image Prompt Coherence Metrics with T2IScoreScore (TS2) [62.44395685571094]
T2IScoreScoreはプロンプトを含むセマンティックエラーグラフのキュレートされたセットであり,誤画像の集合である。
これにより、与えられた迅速な忠実度測定値が、客観的な誤差数に対して正しく画像を順序付けできるかどうかを厳格に判断することができる。
最先端のVLMベースのメトリクスは、CLIPScoreのような単純な(そしておそらく悪い)機能ベースのメトリクスを著しく上回りません。
論文 参考訳(メタデータ) (2024-04-05T17:57:16Z) - DEADiff: An Efficient Stylization Diffusion Model with Disentangled
Representations [64.43387739794531]
現在のエンコーダベースのアプローチは、スタイルの転送中にテキスト・ツー・イメージモデルのテキスト制御性を著しく損なう。
この問題に対処するために、以下の2つの戦略を用いてDEADiffを紹介します。
DeAiffは、テキスト・ツー・イメージモデルに固有のテキスト制御性と、参照画像とスタイルの類似性との間の最適な視覚的スタイリング結果と最適なバランスを得る。
論文 参考訳(メタデータ) (2024-03-11T17:35:23Z) - ObjectMatch: Robust Registration using Canonical Object Correspondences [21.516657643120375]
本稿では,RGB-D SLAMパイプラインのためのセマンティック・オブジェクト中心のカメラポーズ推定器であるObjectMatchを提案する。
RGB-Dシークエンスを登録する場合,本手法は,挑戦的で低フレームレートのシナリオにおいて,最先端のSLAMベースラインよりも優れる。
論文 参考訳(メタデータ) (2022-12-05T02:38:08Z) - DQ-DETR: Dual Query Detection Transformer for Phrase Extraction and
Grounding [34.078590816368056]
句抽出と接地(PEG)の両面を考慮した視覚的接地の問題について検討する。
PEGはテキストからフレーズを抽出し、画像からオブジェクトを同時に見つけるモデルを必要とする。
画像とテキストの異なる特徴を探索する2つのクエリを導入した新しいDQ-DETRモデルを提案する。
論文 参考訳(メタデータ) (2022-11-28T16:30:46Z) - Inter-class Discrepancy Alignment for Face Recognition [55.578063356210144]
IA(Inter-class DiscrepancyAlignment)という統合フレームワークを提案する。
IDA-DAOは、画像と隣人の相違を考慮した類似度スコアの整合に使用される。
IDA-SSEは、GANで生成された仮想候補画像を導入することで、説得力のあるクラス間隣人を提供できます。
論文 参考訳(メタデータ) (2021-03-02T08:20:08Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。