論文の概要: Debiasing Text-to-Image Evaluation via Implicit Cultural Alignment Reward Modeling
- arxiv url: http://arxiv.org/abs/2607.15740v1
- Date: Fri, 17 Jul 2026 08:23:03 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-20 17:56:52.793999
- Title: Debiasing Text-to-Image Evaluation via Implicit Cultural Alignment Reward Modeling
- Title(参考訳): 意図しない文化的アライメント・リワード・モデリングによるテキスト・画像の劣化評価
- Abstract要約: 本稿では,AI生成のためのインシシティカルアライメント・リワードモデルを提案する。
筆者らの枠組みは,インプリシット文化プローブとスキップ接続型クロスアテンション機構を統合している。
我々のモデルでは,各評価を局所的な推論設定で0.21秒で処理し,標準VQAベースの評価器よりも10倍のスピードアップを実現している。
- 参考スコア(独自算出の注目度): 1.1172382217477128
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: As Text-to-Image (T2I) systems rapidly advance, evaluating the cultural authenticity of synthesized content has become increasingly important for fair and trustworthy generative AI. Existing T2I evaluation metrics and multimodal judges often rely on visual-semantic representations that underrepresent implicit cultural norms, leading to biased preference judgments and the omission of fine-grained cultural cues. In addition, visual question answering (VQA)-based evaluators typically depend on autoregressive text generation, which limits their scalability for real-time reward modeling. To address these limitations, we introduce an Implicit Cultural Alignment Reward Model built upon a lightweight 4.2-billion-parameter Multimodal Large Language Model (MLLM). Our framework integrates an Implicit Cultural Probe with a Skip-connection Cross-Attention (SkipCA) mechanism, enabling late-stage semantic features to directly attend to early-stage visual representations and better preserve culturally salient details. Evaluations on 3,323 challenging and carefully curated image pairs from the CulturalFrames benchmark show that our approach achieves 80.54% pairwise accuracy, with Pearson and Kendall correlation coefficients of 0.546 and 0.377, respectively, outperforming representative vision-language metrics and MLLM-based evaluators. Moreover, by bypassing autoregressive text generation, our model processes each evaluation in 0.21 seconds under our local inference setup, achieving a $10\times$ speedup over standard VQA-based evaluators. These results suggest that the proposed reward model can provide an efficient and culturally aware scalar signal for preference optimization pipelines such as Reinforcement Learning from Human Feedback and Direct Preference Optimization.
- Abstract(参考訳): テキスト・ツー・イメージ(T2I)システムが急速に進歩するにつれて、合成コンテンツの文化的信頼性を評価することは、公正で信頼できる生成AIにとってますます重要になっている。
既存のT2I評価指標とマルチモーダル・ジャッジは、しばしば暗黙の文化的規範を下記した視覚的意味論的な表現に依存しており、偏見のある選好判断ときめ細かい文化的手がかりの欠落につながっている。
加えて、視覚的質問応答(VQA)ベースの評価器は、通常、自動回帰テキスト生成に依存し、リアルタイム報酬モデリングのスケーラビリティを制限する。
これらの制約に対処するため,軽量な4.2ビリオンパラメトリック・マルチモーダル大言語モデル (MLLM) 上に構築したインプシットカルアライメント・リワードモデルを導入する。
われわれのフレームワークは,インプリシット文化プローブとスキップ接続型クロスアテンション(SkipCA)機構を統合し,後期のセマンティックな特徴を早期の視覚表現に直接参加させ,文化的に健全な詳細を保存できるようにする。
また,CulturalFramesベンチマークによる3,323枚の画像ペアの評価の結果,Pearson と Kendall の相関係数 0.546 と 0.377 がそれぞれ 80.54% の精度で得られた。
さらに,自動回帰テキスト生成をバイパスすることにより,各評価を局所的な推論設定下で0.21秒で処理し,標準VQAベースの評価器よりも10\times$の高速化を実現した。
これらの結果から,提案した報奨モデルにより,人間のフィードバックからの強化学習や直接選好最適化といった選好最適化パイプラインに対して,効率的かつ文化的に認識されたスカラー信号を提供できることが示唆された。
関連論文リスト
- AlignCultura: Towards Culturally Aligned Large Language Models? [19.134202394422285]
アリン・カルチュラ(Align-Cultura)は、文化的アライメントのための2段階のパイプラインである。
CulTURAXはユネスコの文化分類に基づくHHH- Englishデータセットである。
Stage IIはCULTURAXを、汎用モデル、文化的に微調整されたモデル、オープンウェイトLLMでベンチマークする。
実証的に、文化的に微調整されたモデルは、関節HHHを4%-6%改善し、文化的な失敗を18%削減し、10%-12%の効率向上を実現し、漏れを0.3%に制限した。
論文 参考訳(メタデータ) (2026-04-21T03:06:50Z) - Cross-Cultural Expert-Level Art Critique Evaluation with Vision-Language Models [4.317017868438435]
VLM(Vision-Language Models)は、視覚的知覚に優れるが、芸術における文化的意味を解釈する能力は、未検証のままである。
Tier Iは自動カバレッジとリスク指標をオフラインで計算する。
Tier IIIはTier IIアグリゲーションスコアを等調回帰によって人間の評価に分類し、152サンプルのホールトアウトセットでMAEを5.2%減少させる。
論文 参考訳(メタデータ) (2026-01-12T20:33:35Z) - CAIRe: Cultural Attribution of Images by Retrieval-Augmented Evaluation [61.130639734982395]
本稿では,画像の文化的関連度を評価する新しい評価指標であるCAIReを紹介する。
本フレームワークは,イメージ内の実体と概念を知識ベースに基盤として,実情報を用いて各文化ラベルに対して独立した評価を行う。
論文 参考訳(メタデータ) (2025-06-10T17:16:23Z) - CulturalFrames: Assessing Cultural Expectation Alignment in Text-to-Image Models and Evaluation Metrics [23.567641319277943]
テキスト・ツー・イメージ(T2I)モデルと評価指標のアライメントを定量化する。
文化フレームは、文化的表現の厳格な評価のための新しいベンチマークである。
モデルや国全体では、平均して44%の文化的な期待が失われていることが分かっています。
論文 参考訳(メタデータ) (2025-06-10T14:21:46Z) - T2I-Eval-R1: Reinforcement Learning-Driven Reasoning for Interpretable Text-to-Image Evaluation [60.620408007636016]
T2I-Eval-R1は,大まかな品質スコアのみを用いて,オープンソースのMLLMを訓練する新しい強化学習フレームワークである。
提案手法では,グループ相対政策最適化を命令調整プロセスに統合し,スカラースコアと解釈可能な推論チェーンの両方を生成する。
論文 参考訳(メタデータ) (2025-05-23T13:44:59Z) - Multimodal Cultural Safety: Evaluation Frameworks and Alignment Strategies [58.88053690412802]
大規模視覚言語モデル(LVLM)は、観光アシスタントのようなグローバルに分散したアプリケーションにますます導入されている。
CROSSは、LVLMの文化的安全性推論能力を評価するために設計されたベンチマークである。
実験モデルと推論モデルを含む21種類のLVLMを評価した。
論文 参考訳(メタデータ) (2025-05-20T23:20:38Z) - RAVENEA: A Benchmark for Multimodal Retrieval-Augmented Visual Culture Understanding [79.44246283490665]
本稿では,検索による視覚文化理解の促進を目的とした新しいベンチマークであるRAVENEAを紹介する。
RAVENEAは、文化中心の視覚的質問応答(cVQA)と文化インフォームドイメージキャプション(cIC)の2つのタスクに焦点を当てている。
画像クエリ毎に7つのマルチモーダルレトリバーを訓練・評価し、14の最先端の視覚言語モデルにおける検索強化入力の下流への影響を計測する。
論文 参考訳(メタデータ) (2025-05-20T14:57:16Z) - Deconstructing Bias: A Multifaceted Framework for Diagnosing Cultural and Compositional Inequities in Text-to-Image Generative Models [3.6335172274433414]
本稿では,CIS(Component Inclusion Score)を指標として,文化的文脈における画像生成の忠実度を評価する。
我々は、構成的脆弱性と文脈的不整合の観点からバイアスを定量化し、西洋と非西洋の文化的プロンプトの間に顕著なパフォーマンスのギャップを浮き彫りにする。
論文 参考訳(メタデータ) (2025-04-05T06:17:43Z) - Towards Automatic Evaluation for Image Transcreation [52.71090829502756]
本稿では,機械翻訳(MT)メトリクスにインスパイアされた自動評価指標群を提案する。
画像トランスクリエーションの3つの重要な側面として,文化的関連性,意味的等価性,視覚的類似性を挙げる。
この結果から,視覚エンコーダの表現は視覚的類似度を測定するのに有効であるのに対し,プロプライエタリなVLMは文化的関連性と意味的等価性を最もよく認識していることがわかった。
論文 参考訳(メタデータ) (2024-12-18T10:55:58Z) - On the Cultural Gap in Text-to-Image Generation [75.69755281031951]
テキスト・トゥ・イメージ(T2I)生成における課題のひとつは、トレーニングデータに存在する文化ギャップの意図しない反映である。
クロスカルチャー画像を生成するT2Iモデルの能力を体系的に評価するベンチマークは存在しない。
本稿では,モデルが対象文化にどの程度適しているかを評価するため,包括的評価基準付きChallenging Cross-Cultural (C3)ベンチマークを提案する。
論文 参考訳(メタデータ) (2023-07-06T13:17:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。