論文の概要: EmCom-Diffusion: Probing Visual Reflection in Emergent Languages via Image Generation
- arxiv url: http://arxiv.org/abs/2607.03752v1
- Date: Sat, 04 Jul 2026 07:54:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.705821
- Title: EmCom-Diffusion: Probing Visual Reflection in Emergent Languages via Image Generation
- Title(参考訳): EmCom-Diffusion:画像生成による創発言語における視覚反射の探索
- Authors: Haruumi Omoto, Tadahiro Taniguchi,
- Abstract要約: EmCom-Diffusionは視覚反射を直接測定する評価フレームワークである。
入力された各画像をその創発メッセージから再構成し、元の画像自体と比較する。
- 参考スコア(独自算出の注目度): 8.60846373423558
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Measuring the extent to which emergent languages encode the visual content of their inputs is an open problem. We refer to this property as visual reflection: the extent to which emergent messages preserve information about their source images that can be recovered without appeal to the speaker-listener pair that produced them. Existing metrics measure it only indirectly, through proxies such as human-defined concept inventories, natural-language captions, structural distance correlations, or Referential Game accuracy, each of which can either miss visual content the message encodes or credit content it does not. We propose EmCom-Diffusion, an evaluation framework that measures visual reflection directly: it reconstructs each input image from its emergent message and compares the reconstruction with the original image itself, rather than with human-defined targets. Concretely, it finetunes a pretrained text-to-image diffusion model on (image, emergent-message) pairs and scores visual reflection as the perceptual similarity between the reconstructed and original images, operating generatively rather than discriminatively. Instantiating it on MS-COCO with a Referential Game, we validate the metric against random and fixed-token baselines under three pretrained visual encoders, and compare it against four existing metrics (CBM, supervised translation, TopSim, and R@1). EmCom-Diffusion captures visual content the other metrics miss.
- Abstract(参考訳): 創発言語が入力の視覚的内容をエンコードする範囲を測定することは、オープンな問題である。
我々は、この特性を視覚的反射(visual reflection)と呼ぶ: 生成した話者-リスナー対に訴えることなく、元の画像に関する情報が保存される範囲。
既存のメトリクスは、人間が定義した概念の在庫、自然言語のキャプション、構造距離の相関、あるいはReferential Gameの精度などのプロキシを通じてのみ間接的に測定する。
本研究では,視覚的反射を直接計測する評価フレームワークであるEmCom-Diffusionを提案する。
具体的には、事前訓練されたテキスト・ツー・イメージ拡散モデルを(画像、緊急メッセージ)対に微調整し、再構成された画像とオリジナル画像との知覚的類似性として視覚反射をスコアし、識別的にではなく、生成的に動作させる。
参照ゲームを用いてMS-COCO上でこれを検証し、3つの事前訓練された視覚エンコーダのランダムおよび固定トークンベースラインに対してメトリックを検証し、既存の4つのメトリクス(CBM、教師付き翻訳、TopSim、R@1)と比較する。
EmCom-Diffusionは、他のメトリクスが見逃すビジュアルコンテンツをキャプチャする。
関連論文リスト
- Emergent Communication between Heterogeneous Visual Agents through Decentralized Learning [7.6594584749768835]
分散学習による異種視覚エージェント間の創発的コミュニケーションについて検討する。
この設定は、創発的コミュニケーションの未発見の側面に焦点を当てている。
MHCG(Metropolis-Hastings Captioning Game)におけるこの設定のインスタンス化
論文 参考訳(メタデータ) (2026-05-12T07:51:56Z) - Mind-the-Glitch: Visual Correspondence for Detecting Inconsistencies in Subject-Driven Generation [120.23172120151821]
本稿では,事前学習した拡散モデルのバックボーンから視覚的特徴と意味的特徴を分離するための新しいアプローチを提案する。
注釈付きセマンティックと視覚対応を備えた画像ペアを構築する自動パイプラインを導入する。
被験者駆動画像生成における視覚的不整合を定量化する新しい指標であるビジュアルセマンティックマッチングを提案する。
論文 参考訳(メタデータ) (2025-09-26T07:11:55Z) - Latent Expression Generation for Referring Image Segmentation and Grounding [13.611995923070426]
既存のほとんどのメソッドは単一のテキスト入力に依存しており、視覚領域で利用可能なリッチな情報のごく一部しか取得できない。
このリッチ・ビジュアル・ディテールと粗雑なテキスト・キューのミスマッチは、類似したオブジェクトの誤識別につながる可能性がある。
単一のテキスト入力から生成された複数の潜在表現を利用する新しい視覚的グラウンドディングフレームワークを提案する。
論文 参考訳(メタデータ) (2025-08-07T07:57:27Z) - TokBench: Evaluating Your Visual Tokenizer before Visual Generation [75.38270351179018]
さまざまな画像トークンやVAEに対して,テキストと顔の復元品質をさまざまな尺度で分析する。
以上の結果から, 現代の視覚トークン化器は, 特に小規模では, 細粒度保存に苦慮していることが明らかとなった。
論文 参考訳(メタデータ) (2025-05-23T17:52:16Z) - Embedding and Enriching Explicit Semantics for Visible-Infrared Person Re-Identification [31.011118085494942]
Visible-infrared person re-identification (VIReID)は、異なるモードで同じ同一の歩行者画像を取得する。
既存の方法は画像のみから視覚的コンテンツを学習するが、高レベルの意味を感知する能力は欠如している。
本稿では,意味的にリッチな横断歩行者表現を学習するための埋め込み・拡張型明示的意味論フレームワークを提案する。
論文 参考訳(メタデータ) (2024-12-11T14:27:30Z) - Knowledge-Enhanced Dual-stream Zero-shot Composed Image Retrieval [53.89454443114146]
本研究では,ゼロショット合成画像検索タスク(ZS-CIR)について検討した。
従来の作品では、参照画像の特徴をテキスト埋め込み空間に投影することで、擬似ワードトークンを生成する。
知識強化型デュアルストリームゼロショット合成画像検索フレームワーク(KEDs)を提案する。
KEDはデータベースを組み込むことで、参照画像の属性を暗黙的にモデル化する。
論文 参考訳(メタデータ) (2024-03-24T04:23:56Z) - Collaborative Group: Composed Image Retrieval via Consensus Learning from Noisy Annotations [67.92679668612858]
我々は,集団が個人より優れているという心理的概念に触発されたコンセンサスネットワーク(Css-Net)を提案する。
Css-Netは,(1)コンセンサスモジュールと4つのコンセンサスモジュール,(2)コンセンサス間の相互作用の学習を促進するKulback-Leibler分散損失の2つのコアコンポーネントから構成される。
ベンチマークデータセット、特にFashionIQでは、Css-Netが大幅に改善されている。特に、R@10が2.77%、R@50が6.67%増加し、リコールが大幅に向上している。
論文 参考訳(メタデータ) (2023-06-03T11:50:44Z) - Enhanced Modality Transition for Image Captioning [51.72997126838352]
MTM(Modality Transition Module)を構築し、言語モデルに転送する前に視覚的機能をセマンティック表現に転送します。
トレーニング段階では、モダリティ遷移ネットワークは提案されたモダリティ損失によって最適化される。
提案手法の有効性を示すMS-COCOデータセットを用いて実験を行った。
論文 参考訳(メタデータ) (2021-02-23T07:20:12Z) - Consensus-Aware Visual-Semantic Embedding for Image-Text Matching [69.34076386926984]
画像テキストマッチングは、視覚と言語をブリッジする上で中心的な役割を果たす。
既存のアプローチのほとんどは、表現を学ぶためにイメージテキストインスタンスペアのみに依存しています。
コンセンサスを意識したビジュアル・セマンティック・エンベディングモデルを提案し,コンセンサス情報を組み込む。
論文 参考訳(メタデータ) (2020-07-17T10:22:57Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。