論文の概要: Where to Look Is Not How to Fix: Pre-Denoising Diagnostics and Modality-Dependent Control in Diffusion Composition
- arxiv url: http://arxiv.org/abs/2610.03068v1
- Date: Fri, 02 Oct 2026 09:50:43 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-06 00:14:30.310917
- Title: Where to Look Is Not How to Fix: Pre-Denoising Diagnostics and Modality-Dependent Control in Diffusion Composition
- Title(参考訳): どのようにして解決するか: 拡散組成における事前診断とモダリティ依存制御
- Abstract要約: SD1.5,SDXL,SD3テキストパスにまたがるレアコンポジションから共通するテキストのみのコンポジションストレス指標(CSI)を導入する。
しかし、リスクを明らかにする表現座標は、必ずしも生成を改善する座標やモダリティであるとは限らない。
- 参考スコア(独自算出の注目度): 1.9336815376402718
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Understanding compositional failures in text-to-image diffusion requires identifying both where stress is detectable and how intervention changes the output. We study these questions through a controlled anchor--stress protocol that jointly evaluates text-encoder diagnostics and denoiser interventions. We introduce a text-only Compositional Stress Index (CSI), which separates common from rare compositions across SD1.5, SDXL, and the SD3 text path and provides an upstream diagnostic coordinate. A matched six-prompt localization study links intervention location to distinct outcomes: residual-minimizing embedding adapters improve representation fit, while downstream cross-attention intervention increases color hit rate (CHR) by 0.0272. Across SD1.5 and SDXL denoiser blocks, the largest positive signed diagnostic-accessibility mean occurs at the deep encoder, whereas selective boost has its largest positive mean CHR response at decoder blocks. Selective subtraction and broad ablation reveal further modality- and architecture-dependent responses, including a substantial CHR decrease when SDXL decoder cross-attention is broadly ablated. We find a diagnosis-control dissociation under our controlled attribute-object composition setting: compositional defects are diagnosable before denoising, but the representation coordinate that exposes risk is not necessarily the coordinate or modality that improves generation.
- Abstract(参考訳): テキストと画像の拡散における構成上の失敗を理解するには、ストレスが検出可能な場所と、介入が出力をどのように変化させるかの両方を特定する必要がある。
本稿では,テキストエンコーダの診断とデノイザの介入を共同で評価する制御アンカー・ストレスプロトコルを用いて,これらの質問について検討する。
本稿では,SD1.5,SDXL,SD3テキストパスに共通するレアコンポジションから,テキストのみのコンポジションストレス指標(CSI)を導入し,上流診断座標を提供する。
組込みアダプターの残留最小化は表現適合性を改善する一方、下流のクロスアテンション介入は色ヒット率(CHR)を0.0272に向上させる。
SD1.5 および SDXL デノイザブロック全体では, ディープエンコーダでは最大の陽性診断到達平均が生じるが, 選択的ブースターはデコーダブロックでは最大の陽性平均 CHR 応答を有する。
選択的なサブトラクションと広いアブレーションは、SDXLデコーダのクロスアテンションが広範囲に短縮されたときにCHRが大幅に低下するなど、さらなるモダリティとアーキテクチャに依存した応答を示す。
制御された属性・オブジェクト構成条件の下では, 構成欠陥は診断前に診断可能であるが, リスクを明らかにする表現座標は, 生成を改善するための座標やモダリティであるとは限らない。
関連論文リスト
- Agentic AI-based Framework for Mitigating Premature Diagnostic Handoff and Silent Hallucination in Healthcare Applications [17.69274632062373]
オープンエンドの会話エージェントは、早期診断ハンドオフとサイレントな臨床幻覚という、2つの重要な障害モードを伴いがちである。
LLM-as-a-judge'のルーティングを決定論的オーケストレーション制約に置き換えることで、両方の問題に対処するマルチエージェントフレームワークを提案する。
本稿では,150症例を対象に,ラマ3.1-70b-インストラクトモデルを用いたシミュレートされた患者エージェントを用いたシステムの評価を行った。
論文 参考訳(メタデータ) (2026-06-16T15:39:19Z) - Neural Uncertainty Principle: A Unified View of Adversarial Fragility and LLM Hallucination [60.197429875410286]
大規模言語モデルにおける視覚と幻覚の対立的脆弱性は、伝統的に別の問題と見なされている。
損失誘起状態下でのニューラル不確実性原理(NUP)の定式化により, ほぼバウンド状態においては, さらなる圧縮は感度分散の増大を伴うことが判明した。
視覚では、高度に結合したコンポーネントをマスキングすることで、コストのかかる敵の訓練なしに堅牢性を向上させる。
言語では、任意の応答トークンを生成する前に、同じプレフィルステージプローブが幻覚リスクを検出する。
論文 参考訳(メタデータ) (2026-03-20T02:07:10Z) - A Dual-Mode ViT-Conditioned Diffusion Framework with an Adaptive Conditioning Bridge for Breast Cancer Segmentation [2.8110777003480654]
乳房超音波検査では,早期診断には精査が不可欠である。
標準的な畳み込みアーキテクチャは、十分にグローバルなコンテキストを捉えるのにしばしば不足する。
拡張UNetベースの生成デコーダと視覚変換器(ViT)エンコーダを組み合わせたフレキシブルで条件付きデノイング拡散モデルを提案する。
論文 参考訳(メタデータ) (2025-11-08T12:33:18Z) - RTGMFF: Enhanced fMRI-based Brain Disorder Diagnosis via ROI-driven Text Generation and Multimodal Feature Fusion [13.589735978929085]
RTGMFFは自動ROIレベルのテキスト生成とマルチモーダルな特徴融合を統合化して脳障害診断を行うフレームワークである。
RTGMFFは診断精度において現在の手法を上回り、感度、特異性、およびROC曲線下における領域の顕著な向上を達成している。
論文 参考訳(メタデータ) (2025-09-03T11:05:57Z) - MSA-UNet3+: Multi-Scale Attention UNet3+ with New Supervised Prototypical Contrastive Loss for Coronary DSA Image Segmentation [8.850534640462081]
冠状DSA画像のセグメンテーションを高めるために,教師付きおよび原型的コントラスト学習を融合させるスーパービジョン型コントラスト損失を提案する。
MSA-UNet3+: Multi-Scale Attention-Enhanced UNet3+アーキテクチャで提案したSPCL損失を実装した。
プライベート冠DSAデータセットの実験では、MSA-UNet3+が最先端の手法より優れていることが示されている。
論文 参考訳(メタデータ) (2025-04-07T15:35:30Z) - Unveiling Discrete Clues: Superior Healthcare Predictions for Rare Diseases [15.711501507899072]
UDCは、一貫性のあるテキスト知識とCOシグナルを橋渡しする、離散的な手がかりを明らかにする新しい方法である。
我々は、合成ドメインと混合ドメインのターゲットを利用して、デコード段階で高度なコントラスト的アプローチを開発する。
このアプローチは、テキスト知識とCO信号の間の双方向の監視を促進する。
論文 参考訳(メタデータ) (2025-01-23T03:08:22Z) - Cross-Modal Causal Intervention for Medical Report Generation [107.76649943399168]
放射線医学報告生成(RRG)は, コンピュータ支援診断と薬剤指導に不可欠である。
視覚言語的バイアスによる急激な相関により、正確な病変記述の生成は依然として困難である。
我々はCrossModal Causal Representation Learning (CMCRL)という2段階のフレームワークを提案する。
IU-XrayとMIMIC-CXRの実験により、我々のCMCRLパイプラインは最先端の手法よりも大幅に優れていることが示された。
論文 参考訳(メタデータ) (2023-03-16T07:23:55Z) - Context-Aware Refinement Network Incorporating Structural Connectivity
Prior for Brain Midline Delineation [50.868845400939314]
UNetによって生成された特徴ピラミッド表現を洗練・統合するための文脈対応改良ネットワーク(CAR-Net)を提案する。
正中線における脳の構造的接続性を維持するため、我々は新しい接続性レギュラーロスを導入する。
提案手法は, パラメータを少なくし, 4つの評価指標で3つの最先端手法より優れる。
論文 参考訳(メタデータ) (2020-07-10T14:01:20Z) - Collaborative Boundary-aware Context Encoding Networks for Error Map
Prediction [65.44752447868626]
本稿では,AEP-Net と呼ばれる協調的コンテキスト符号化ネットワークを提案する。
具体的には、画像とマスクのより優れた特徴融合のための協調的な特徴変換分岐と、エラー領域の正確な局所化を提案する。
AEP-Netはエラー予測タスクの平均DSCが0.8358,0.8164であり、ピアソン相関係数が0.9873である。
論文 参考訳(メタデータ) (2020-06-25T12:42:01Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。