論文の概要: Lost in Visual Translation: A VLM-Assisted Perceptual-Semantic Coherence Framework for EEG-to-Image Reconstruction
- arxiv url: http://arxiv.org/abs/2607.12364v1
- Date: Tue, 14 Jul 2026 05:40:23 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-15 17:08:30.043434
- Title: Lost in Visual Translation: A VLM-Assisted Perceptual-Semantic Coherence Framework for EEG-to-Image Reconstruction
- Title(参考訳): 視覚翻訳における損失:脳波対画像再構成のためのVLM支援パーセマンティックコヒーレンスフレームワーク
- Authors: Sukriti Tiwari, BHVSP Subrahmanyam, Nidhi Goyal, Sai Amrit Patnaik,
- Abstract要約: EEG-to-image評価は、視覚的忠実度と回復可能な意味を区別すべきである。
SSIM、LPIPS、CLIPは意味的に回復可能な出力や報奨を罰する。
我々はATM、ENIGMA、BrainVis、DreamDiffusionから6,855個の地上構造/再構成ペアを解析した。
- 参考スコア(独自算出の注目度): 0.10499611180329804
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: EEG-to-image evaluation should distinguish visual fidelity from recoverable meaning. Yet EEG-derived reconstructions are blurry, distorted, and low-detail, causing SSIM, LPIPS, and CLIP to penalize semantically recoverable outputs or reward plausible but incorrect ones. We analyze 6,855 ground-truth/reconstruction pairs from ATM, ENIGMA, BrainVis, and DreamDiffusion using semantic probes, caption harshness and blind-spot rates, and controlled degradations. Pixel metrics show near-zero correlation with semantic consistency, while representation metrics conflate perceptual and semantic errors. We therefore introduce a BCI-aware framework in which four VLMs assess image pairs through structured questions, producing Tolerant Perceptual Alignment Scores (T-PAS) and Tolerant Semantic Alignment Scores (T-SAS). Their consensus is distilled into the BCI-Coherence Score (BCS), a compact evaluator achieving a T-PAS MAE of 0.079 (r = 0.700) and a T-SAS MAE of 0.082 (r = 0.850) on our data. Human validation shows highly reliable joint coherence judgments, with Cohen's kappa = 0.882 +/- 0.174 and Krippendorff's alpha = 0.882, supporting perceptual-semantic recoverability over generic visual similarity. Code and resources are available at https://sukt03.github.io/BCS/.
- Abstract(参考訳): EEG-to-image評価は、視覚的忠実度と回復可能な意味を区別すべきである。
しかし、脳波由来の再構成はぼやけたり、歪んだり、細部が低いため、SSIM、LPIPS、CLIPは意味的に回復可能な出力や、妥当だが不正確な出力をペナルティ化する。
ATM,ENIGMA,BrainVis,DreamDiffusionの6,855個の接地/再構築ペアをセマンティックプローブ,キャプションの過酷さと盲点率を用いて解析し,劣化を制御した。
Pixelのメトリクスはセマンティックな一貫性とほぼゼロの相関を示し、表現のメトリクスは知覚的エラーとセマンティックなエラーを詳述する。
そこで我々は、4つのVLMが構造化された質問を通して画像対を評価し、T-PAS(Tolerant Perceptual Alignment Scores)とT-SAS(Tolerant Semantic Alignment Scores)を生成するBCI対応フレームワークを導入する。
彼らのコンセンサスをBCI-Coherence Score (BCS) に蒸留し,T-PAS MAEを0.079 (r = 0.700) 、T-SAS MAEを0.082 (r = 0.850) とした。
人間の検証は、コーエンのkaappa = 0.882 +/- 0.174とクリッペンドルフのα = 0.882と非常に信頼性の高い関節コヒーレンス判定を示し、一般的な視覚的類似性よりも知覚的セマンティックな回復性をサポートしている。
コードとリソースはhttps://sukt03.github.io/BCS/で入手できる。
関連論文リスト
- Template Collapse and Information-Theoretic Limits in Camera rPPG Pulse Morphology Restoration [0.0]
コンシューマー・フェイスカメラ リモート・フォトプレティス幻覚(r)は、受動的心血管モニタリングを可能にする。
しかし、動脈硬化度をコードする単一サイクル波形形態が、この測定から回復可能であるか否かは明らかになっていない。
16のエンコーダアーキテクチャを3つのデータセットで評価した。
論文 参考訳(メタデータ) (2026-06-02T15:50:07Z) - PHANTOM: Polymorphic Honeytoken Adaptation with Narrative-Tailored Organisational Mimicry [0.2538209532048867]
ハネトケンは、不正な属性アクセスを検出するために植えられたデコイデジタル資産である。
PHANTOMは,組織固有の知識を符号化することで,文脈的に説得力のあるハネトケンを生成するフレームワークである。
結果は外部のAPIコールなしで再現されるため、パイプラインは空調された環境で完全にデプロイできる。
論文 参考訳(メタデータ) (2026-05-04T17:14:13Z) - CORE: Context-Robust Remasking for Diffusion Language Models [51.59514489363897]
我々は、推論時リビジョンのためのトレーニング不要フレームワークであるContext-Robust Remasking (CORE)を提案する。
静的トークンの確率を信頼するのではなく、COREは、ターゲットとなるマスク付きコンテキストの摂動に対する感受性を示すことによって、コンテキスト不安定なトークンを識別する。
LLaDA-8B-Baseでは、COREは推論とコードベンチマークの間で一貫した改善を行い、計算に適合したベースラインを上回り、MBPPを最大9.2%改善した。
論文 参考訳(メタデータ) (2026-02-04T00:12:30Z) - KoALA: KL-L0 Adversarial Detector via Label Agreement [9.360893727306324]
KoALAは、ディープニューラルネットワークのためのセマンティックスフリーの敵検出器である。
2つの相補的類似度指標からクラス予測が一致しない場合に、敵対攻撃を検出する。
KoALA は ResNet/CIFAR-10 の精度 0.94 とリコール 0.81 、CLIP/Tiny-ImageNet の精度 0.66 とリコール 0.85 を達成している。
論文 参考訳(メタデータ) (2025-10-14T17:33:00Z) - Group Evidence Matters: Tiling-based Semantic Gating for Dense Object Detection [0.0]
本稿では,重畳誘起冗長性をグループエビデンスに変換する検出器非依存のポストプロセッシングフレームワークを提案する。
このフレームワークは再訓練を必要とせず、現代の検出器と統合する。
論文 参考訳(メタデータ) (2025-09-13T01:55:08Z) - LipSim: A Provably Robust Perceptual Similarity Metric [56.03417732498859]
敵攻撃に対するViTベースの特徴抽出器のアンサンブルに基づく,最先端の知覚的類似度指標の脆弱性を示す。
次に、証明可能な保証とともに、LipSimと呼ばれる堅牢な知覚的類似度メトリックをトレーニングするためのフレームワークを提案する。
LipSimは、各データポイント周辺の保護された領域と、$ell$ ball内のすべての摂動の証明書を提供する。
論文 参考訳(メタデータ) (2023-10-27T16:59:51Z) - Multi-View Correlation Consistency for Semi-Supervised Semantic
Segmentation [59.34619548026885]
半教師付きセマンティックセグメンテーションは、ラベルなしデータのリッチで堅牢な監視を必要とする。
本稿では,異なるビュー間の画素・画素対応を保証するビューコヒーレントなデータ拡張戦略を提案する。
2つのデータセットの半教師付き設定では、最先端の手法と比較して、競争の正確さが報告される。
論文 参考訳(メタデータ) (2022-08-17T17:59:11Z) - Introspective Deep Metric Learning for Image Retrieval [80.29866561553483]
良好な類似性モデルは、より堅牢なトレーニングのために曖昧なイメージをよりよく扱うように注意しながら、意味的な相違を考慮すべきである、と我々は主張する。
本稿では,画像の意味的特徴とあいまいさを記述した,意味的埋め込みだけでなく,付随する不確実性埋め込みを用いて画像を表現することを提案する。
提案したIDMLフレームワークは,不確実性モデリングによるディープメトリック学習の性能向上を実現し,広く使用されているCUB-200-2011,Cars196,Stanford Online Productsデータセットの最先端結果を得る。
論文 参考訳(メタデータ) (2022-05-09T17:51:44Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。