論文の概要: DiffImaginE: Imagine to Verify Entity Types with Diffusio
- arxiv url: http://arxiv.org/abs/2608.03025v2
- Date: Tue, 11 Aug 2026 03:48:05 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-12 19:14:45.728523
- Title: DiffImaginE: Imagine to Verify Entity Types with Diffusio
- Title(参考訳): DiffImaginE:Diffusioでエンティティの型を検証する
- Authors: Feng Zhang, Feiyu Han, Rongxin Yang, Yang Liu, Yancheng Chen, Rui Wang, Yingguang Yang, Tian Xueyun, Chongyang Zhang, Hao Zheng, Xu Kefu, Congjing Ran, Fuhai Chen, Bin Chong,
- Abstract要約: 本稿では,MNER型検証を条件付き潜伏拡散推論として定式化するDiffImaginEを紹介する。
局所的な視覚的証拠が与えられた場合、型条件付きデノイザは、標準化された潜水器に注入されたノイズを予測する。
結果として生じるデノナイジングエラーは、型条件の負の対数類似性に対するELBO一貫性のサロゲートを与える。
- 参考スコア(独自算出の注目度): 17.922112345279643
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Multimodal named entity recognition (MNER) determines whether each candidate span and entity-type hypothesis is supported by joint textual and visual evidence. Existing imagine-and-compare verifiers map each (span, type) pair to one predicted visual feature, compressing diverse visual realisations into a single prototype and providing a compatibility score without explicit probabilistic semantics. We introduce DiffImaginE, which formulates MNER type verification as conditional latent diffusion inference. Given span-localised visual evidence, a type-conditioned denoiser predicts noise injected into its standardised latent. The resulting denoising error provides an ELBO-consistent surrogate for type-conditional negative log-likelihood, allowing competing type hypotheses to be ranked by how well they explain the observation. DiffImaginE retains a standard multimodal encoder stack and replaces the deterministic verifier with a classifier-free-guided diffusion scorer trained using Min-SNR weighting. We directly supervise per-type diffusion scores as classification logits, learn aggregation across noise levels, and use antithetic sampling to reduce Monte Carlo comparison variance. Our analysis shows that classifier-free guidance sharpens the induced type posterior and characterises when antithetic pairing reduces variance at equal denoiser cost. Experiments on Twitter-2015 and Twitter-2017 show consistent gains over a matched deterministic ImaginE control under the same encoder, auxiliary objectives, and evaluation protocol, supported by ablations and paired significance tests.
- Abstract(参考訳): MNER (Multimodal named entity recognition) は、各候補がスパンとエンティティタイプの仮説を、共同のテキストおよび視覚的証拠によって支持されているかどうかを決定する。
既存の想像・比較検証器は、それぞれ(スパン、タイプ)を1つの予測された視覚的特徴にマッピングし、多様な視覚的実現を1つのプロトタイプに圧縮し、明示的な確率論的意味論なしで互換性スコアを提供する。
本稿では,MNER型検証を条件付き潜伏拡散推論として定式化するDiffImaginEを紹介する。
局所的な視覚的証拠が与えられた場合、型条件付きデノイザは、標準化された潜水器に注入されたノイズを予測する。
結果として生じるデノナイジングエラーは、タイプ条件の負の対数類似性に対してELBOに一貫性のある代理を与え、競合する型仮説を、観察がいかにうまく説明できるかによってランク付けすることができる。
DiffImaginEは標準のマルチモーダルエンコーダスタックを保持し、決定論的検証器をMin-SNR重み付けを用いて訓練されたクラス化自由誘導拡散スコアラに置き換える。
我々は,各タイプの拡散スコアを分類ロジットとして直接監督し,ノイズレベルの集約を学習し,モンテカルロ比較分散を低減するためにアンチセティックサンプリングを用いる。
分析の結果, 分類器フリーガイダンスは, 誘導型後肢を鋭くし, 抗テーゼペアリングが同等のデノイザーコストで分散を減少させる場合に特徴付けることがわかった。
Twitter-2015とTwitter-2017の実験では、同じエンコーダ、補助目的、評価プロトコルの下で一致した決定論的ImaginEコントロールよりも一貫した利得を示している。
関連論文リスト
- Causal Variational Deep Embedding: A Family of Interventional Generators for Confounded Images [23.146237151956765]
CauVaDEは多様な介入サンプルを生成し、未確立の参照に対してFIDを改善している。
画像データベンチマークの実験では、CauVaDEは様々な介入サンプルを生成し、未確立の参照に対してFIDを改善している。
論文 参考訳(メタデータ) (2026-06-19T23:59:14Z) - A Fiber Criterion for Representation Identifiability in Supervised Learning [0.0]
教師付き学習は、その入出力行動を通じて予測器を評価する。
本稿では,結果の表現レベル識別可能性問題を定式化する。
その結果、表現レベルのクレームは、予測行動だけでなく、仮定、目的、測定、帰納的バイアスを必要とすることが明らかとなった。
論文 参考訳(メタデータ) (2026-05-31T08:25:07Z) - VAE-Inf: A statistically interpretable generative paradigm for imbalanced classification [8.677199689027772]
生成的モデリングと識別的分類のギャップを埋める2段階の枠組みを提案する。
推論のために、自然な仮説テストの解釈を受け入れるプロジェクションベースのスコアを導入する。
様々な実世界のベンチマークの実験は、我々のフレームワークが他のアプローチと競合する性能を達成していることを示している。
論文 参考訳(メタデータ) (2026-04-28T07:50:56Z) - PASA: Attack Agnostic Unsupervised Adversarial Detection using Prediction & Attribution Sensitivity Analysis [2.5347892611213614]
分類のためのディープニューラルネットワークは、サンプル入力に対する小さな摂動が誤った予測につながる敵攻撃に対して脆弱である。
本研究では, モデル予測と特徴属性のこの特性の実用的手法を開発し, 対向サンプルを検出する。
本手法は,敵が防御機構を認識した場合でも,競争性能を示す。
論文 参考訳(メタデータ) (2024-04-12T21:22:21Z) - Prototype-based Aleatoric Uncertainty Quantification for Cross-modal
Retrieval [139.21955930418815]
クロスモーダル検索手法は、共通表現空間を共同学習することにより、視覚と言語モダリティの類似性関係を構築する。
しかし、この予測は、低品質なデータ、例えば、腐敗した画像、速いペースの動画、詳細でないテキストによって引き起こされるアレタリック不確実性のために、しばしば信頼性が低い。
本稿では, 原型に基づくAleatoric Uncertainity Quantification (PAU) フレームワークを提案する。
論文 参考訳(メタデータ) (2023-09-29T09:41:19Z) - Variational Classification [51.2541371924591]
我々は,変分オートエンコーダの訓練に用いるエビデンスローバウンド(ELBO)に類似した,モデルの訓練を目的とした変分目的を導出する。
軟質マックス層への入力を潜伏変数のサンプルとして扱うことで, 抽象化された視点から, 潜在的な矛盾が明らかとなった。
我々は、標準ソフトマックス層に見られる暗黙の仮定の代わりに、選択された潜在分布を誘導する。
論文 参考訳(メタデータ) (2023-05-17T17:47:19Z) - Visualizing Classifier Adjacency Relations: A Case Study in Speaker
Verification and Voice Anti-Spoofing [72.4445825335561]
任意のバイナリ分類器によって生成される検出スコアから2次元表現を導出する簡単な方法を提案する。
ランク相関に基づいて,任意のスコアを用いた分類器の視覚的比較を容易にする。
提案手法は完全に汎用的であり,任意の検出タスクに適用可能だが,自動話者検証と音声アンチスプーフィングシステムによるスコアを用いた手法を実証する。
論文 参考訳(メタデータ) (2021-06-11T13:03:33Z) - Autoencoding Variational Autoencoder [56.05008520271406]
我々は,この行動が学習表現に与える影響と,自己整合性の概念を導入することでそれを修正する結果について検討する。
自己整合性アプローチで訓練されたエンコーダは、敵攻撃による入力の摂動に対して頑健な(無神経な)表現につながることを示す。
論文 参考訳(メタデータ) (2020-12-07T14:16:14Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。