論文の概要: DefaultShift: Auditing Semantic Default Shift in Accelerated Text-to-Image Models
- arxiv url: http://arxiv.org/abs/2608.21784v1
- Date: Sat, 22 Aug 2026 05:35:09 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-25 13:29:43.457881
- Title: DefaultShift: Auditing Semantic Default Shift in Accelerated Text-to-Image Models
- Title(参考訳): DefaultShift: アクセラレーションされたテキスト-画像モデルにおけるセマンティックデフォルトシフトの検証
- Abstract要約: より遅いジェネレータを置き換える段階のテキスト・ツー・イメージモデルはほとんどないが、アクセラレーションは不特定属性の分布を静かに変更することができる。
これらのディストリビューションをセマンティックデフォルトと呼び、それらの変更をセマンティックデフォルトシフトに置き換えます。
提案手法は, 繰り返しサンプルを閉意味語彙でラベル付けし, 確率質量移動を計測し, 相互適合仮説から解釈可能なランク付けを分離する, ペアオーディションである。
- 参考スコア(独自算出の注目度): 10.591500152032529
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Few-step text-to-image models increasingly replace slower generators, yet acceleration can silently change distributions over unspecified attributes even when individual outputs remain plausible and aligned. We call these distributions semantic defaults and their change under replacement semantic default shift. Existing quality, preference, and diversity evaluations do not test whether a replacement preserves its reference model's semantic defaults. We introduce DefaultShift, a paired audit that labels repeated samples with closed semantic vocabularies, measures probability-mass movement, and separates interpretable ranking from confirmatory cross-fit inference. Across 14 reference and replacement pairs, adjusted color discrepancies range from 0.054 to 0.303 with recipe-specific directions. A 1,000-image human audit reproduces the ordering. We further introduce DefaultShift-Select, an offline calibration method that reduces human-measured shift by 10.3 percent to 35.1 percent across Turbo, DMD2, and FLUX without material quality loss. Under balanced evaluation, selected data recover 4.3 accuracy points and 7.5 worst-group points over uncalibrated replacement data. DefaultShift makes semantic preservation under acceleration measurable and actionable.
- Abstract(参考訳): 少ないステップのテキスト・ツー・イメージモデルでは、より遅いジェネレータを置き換える傾向にあるが、アクセラレーションは、個々の出力が妥当で整列したままであっても、特定されていない属性の分布を静かに変更することができる。
これらのディストリビューションをセマンティックデフォルトと呼び、それらの変更をセマンティックデフォルトシフトに置き換えます。
既存の品質、嗜好、多様性の評価は、リプレースがその参照モデルのセマンティックデフォルトを保存するかどうかを検査しない。
提案手法は, 繰り返しサンプルを閉意味語彙でラベル付けし, 確率質量移動を計測し, 解釈可能なランク付けを検証的クロスフィット推定から分離する, ペアオーディションである。
14組の参照と置換のペア、調整された色差は、レシピ固有の方向で0.054から0.303の範囲である。
1000イメージの人間の監査が注文を再現します。
さらに、オフラインキャリブレーション方式であるDeefaultShift-Selectを導入し、Turbo, DMD2, FLUX間での人為的なシフトを10.3%から35.1%削減する。
バランスの取れた評価の下で、選択されたデータは、未調整の代替データよりも4.3の精度ポイントと7.5の最悪のグループポイントを回復する。
DefaultShiftは、アクセラレーションによるセマンティックな保存を可能にする。
関連論文リスト
- Predicting Human Disagreement for Calibrated Dynamic Facial Expression Recognition [12.523217686212197]
生のアノテータカウントベクトル上で直接トレーニングを行う不一致対応のDFERフレームワークを提案する。
別個の曖昧性ヘッドは、目に見えないクリップのアノテーションエントロピーを予測し、モノトーンChowスタイルのリジェクションルールは、予測された曖昧性、空洞性、時間的不安定性、入力品質を組み合わせる。
DFEWでは、ECEを30%減らし、AURCを15%減らしながら認識精度を保ち、不明瞭度はテストクリップのアノテーションエントロピーとスピアマン相関0.52に達する。
論文 参考訳(メタデータ) (2026-09-15T12:55:22Z) - SC-Diff: Semantically Calibrated Diffusion for Visible-to-Infrared Image Translation [52.62632888060867]
可視赤外画像変換は、豊富な可視画像を用いて赤外線トレーニングデータを拡張するための実用的な方法を提供する。
既存の拡散に基づくメソッドは、通常、外部条件としてのみセマンティックプリエントを使用する。
SC-Diffは、条件付きガイダンスと内部自己注意校正の両方にセマンティックな事前情報を利用する意味論的潜伏拡散フレームワークである。
論文 参考訳(メタデータ) (2026-08-09T07:57:40Z) - Visual Anchoring in Diffusion: Multimodal Zero-Shot Skeleton Action Recognition [4.970910262474302]
Zero-shot Skeleton Action Recognition (ZSAR) は、見えない動作が類似した骨格関節ダイナミクスを共有するが、オブジェクトやシーンコンテキストが異なる場合、あいまいなままである。
既存のマルチモーダルメソッドは通常、独立したスケルトンとRGBスコアリングブランチを保持し、出力を融合する。
骨格データ再構成時に安定した視覚的アンカーとして機能する非拡散RGB条件トークンを用いたテキスト条件記述型変換器を提案する。
論文 参考訳(メタデータ) (2026-08-05T09:28:00Z) - Beyond Static Anchors: Bounded Prototype Conditioning for Language-Free Medical Anomaly Detection [52.986874008247554]
本稿では,静的アンカーを入力条件付きビジュアルプロトタイプに置き換える言語フリーフレームワークReCAPを提案する。
ReCAPリセンターは、境界ゲート変調により、各画像の正常と異常なプロトタイプを分離した。
3つのセグメンテーションデータセットで最高のゼロショットレベルのAUROCと、24の複数ショット設定のうち23のゼロショットレベルのAUROCを達成する。
論文 参考訳(メタデータ) (2026-08-01T04:46:55Z) - Consistent Evidence, Robust Recognition: Faithful Attribution Regularization under Geometric Transformations [42.90321348046055]
画像領域のサブモジュール探索に基づくアノテーションのない属性正規化フレームワークを提案する。
候補部分集合がモデル出力にどのように影響するかを測定することで、探索は、コンパクトでクラス識別的な証拠を探索由来の監督として抽出する。
ImageNet-100の実験結果から,VT-B/16の属性安定性,挿入性,削除性は0.28ポイントの精度低下で大幅に向上することがわかった。
論文 参考訳(メタデータ) (2026-07-26T20:41:38Z) - Do Image-Text Metrics Respect Semantic Invariances? [32.397351493793416]
3軸の摂動を意味論的に保存する5つの人気評価器に不変なプローブを提案する。
連続した非意味的感性を見いだし, 空間的編集や簡単なフレーズ変化を平均で$approx$6--9%シフトする。
小さな人間の研究もこの発見を支持し、アノテータがペアを概して同じくらい正しいと判断していることを確認し、これらの変化は意味的変化よりもメートル法的な振る舞いを反映している。
論文 参考訳(メタデータ) (2026-05-23T18:53:51Z) - The Silent Vote: Improving Zero-Shot LLM Reliability by Aggregating Semantic Neighborhoods [0.0]
対象ラベルを囲むセマンティック・エリアのスコアを集約することにより,損失情報を復元する推論時間層を提案する。
その結果, 予測誤差 (ECE) とブライアスコア (Brier Score) は, AUROC と Macro-F1 の区別性能を同時に向上した。
論文 参考訳(メタデータ) (2026-05-10T20:22:10Z) - CORE: Context-Robust Remasking for Diffusion Language Models [51.59514489363897]
我々は、推論時リビジョンのためのトレーニング不要フレームワークであるContext-Robust Remasking (CORE)を提案する。
静的トークンの確率を信頼するのではなく、COREは、ターゲットとなるマスク付きコンテキストの摂動に対する感受性を示すことによって、コンテキスト不安定なトークンを識別する。
LLaDA-8B-Baseでは、COREは推論とコードベンチマークの間で一貫した改善を行い、計算に適合したベースラインを上回り、MBPPを最大9.2%改善した。
論文 参考訳(メタデータ) (2026-02-04T00:12:30Z) - Multimodal Consistency-Guided Reference-Free Data Selection for ASR Accent Adaptation [0.05219568203653524]
ASRアクセント適応のためのマルチモーダル整合性誘導型参照フリーデータ選択パイプラインを提案する。
パイプラインは、共有埋め込み空間における音声テキストアライメントと予測された単語エラー率の2つの基準自由信号を用いて、各仮説をスコアする。
単純なパーセンタイルベースの選択規則は、ノイズ発声を排除しながら微調整のための信頼できる擬似ラベルを保持する。
論文 参考訳(メタデータ) (2026-02-03T21:35:58Z) - TripleFDS: Triple Feature Disentanglement and Synthesis for Scene Text Editing [56.73004765030206]
STE(Scene Text Editing)は、視覚的一貫性を維持しながら、画像中のテキストを自然に修正することを目的としている。
本稿では,モジュラー属性をアンタングル化したSTEのための新しいフレームワークであるTripleFDSを提案する。
TripleFDSは、メインストリームのSTEベンチマークで最先端の画像忠実度(SSIM 44.54)とテキスト精度(ACC 93.58%)を達成する。
論文 参考訳(メタデータ) (2025-11-17T14:15:03Z) - Contrastive Model Adaptation for Cross-Condition Robustness in Semantic
Segmentation [58.17907376475596]
意味的セグメンテーションのための正規-逆条件モデル適応について検討する。
提案手法は, コントラスト学習を通じて条件不変の特徴を学習するために, このような画像ペアを利用する。
いくつかの正規-逆適応ベンチマークにおけるモデル適応のための最先端セマンティックセマンティックセマンティクス性能を実現する。
論文 参考訳(メタデータ) (2023-03-09T11:48:29Z) - Evaluating Prediction-Time Batch Normalization for Robustness under
Covariate Shift [81.74795324629712]
我々は予測時間バッチ正規化と呼び、共変量シフト時のモデル精度とキャリブレーションを大幅に改善する。
予測時間バッチ正規化は、既存の最先端アプローチに相補的な利点をもたらし、ロバスト性を向上させることを示します。
この手法は、事前トレーニングと併用して使用すると、さまざまな結果が得られるが、より自然なタイプのデータセットシフトでは、パフォーマンスが良くないようだ。
論文 参考訳(メタデータ) (2020-06-19T05:08:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。