論文の概要: Energy-Based Constraint Networks: Learning Structural Coherence Across Modalities
- arxiv url: http://arxiv.org/abs/2605.00960v1
- Date: Fri, 01 May 2026 13:11:12 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-05 20:33:49.514192
- Title: Energy-Based Constraint Networks: Learning Structural Coherence Across Modalities
- Title(参考訳): エネルギーに基づく制約ネットワーク:モダリティ間の構造的コヒーレンスを学習する
- Authors: Chirag Shinde,
- Abstract要約: 対照的なペアから構造的コヒーレンスを学習するモダリティに依存しないアーキテクチャを導入する。
テキストでは、トレーニング済みの汚職タイプでは93.4%の精度で、凍結したBERTと7.4Mのトレーニング可能なパラメータを使用して、9つの目に見えないタイプでは87.2%の精度を達成している。
FaceForensics++ Deepfakesの0.959 AUC、Celeb-DFのトレーニングデータなしでCeleb-DFの0.870である。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: We introduce energy-based constraint networks -- a modality-agnostic architecture that learns structural coherence from contrastive pairs. The system processes frozen encoder embeddings through a state-space model with dual-head attention, producing a scalar energy measuring structural consistency alongside per-position energy scores that localize violations. Multiple independently trained branches detect different violation types and compose at inference without interference. We demonstrate the framework in two domains. In text, the system achieves 93.4% accuracy on trained corruption types and 87.2% on 9 unseen types, using frozen BERT and 7.4M trainable parameters. In vision, the same architecture achieves competitive deepfake detection: 0.959 AUC on FaceForensics++ Deepfakes and 0.870 on Celeb-DF without any Celeb-DF training data, using frozen DINOv2 and 3.6M parameters per branch. The framework supports flexible training: branches learn from designer-specified corruptions, real-world paired data, or both. Composable branches require representation compatibility -- a finding validated through extensive experimentation where five incompatible approaches failed before the compatible one succeeded. The architecture is encoder-agnostic and domain-agnostic: changing the domain requires only new corruption strategies; changing the encoder requires only a new input projection layer. To our knowledge, this is the first architecture to learn within-modality structural coherence as an explicit energy landscape with per-position decomposition, and to demonstrate that the same architecture transfers across modalities via corruption respecification alone.
- Abstract(参考訳): エネルギーに基づく制約ネットワーク - 対照的なペアから構造的コヒーレンスを学ぶモダリティに依存しないアーキテクチャを導入する。
このシステムは、二重ヘッドの注意を持つ状態空間モデルを通して凍結エンコーダの埋め込みを処理し、違反をローカライズする配置毎のエネルギースコアとともに構造的一貫性を測定するスカラーエネルギーを生成する。
複数の独立に訓練された分岐は、異なる違反タイプを検出し、干渉なしに推論時に構成する。
フレームワークを2つのドメインでデモします。
テキストでは、トレーニング済みの汚職タイプでは93.4%の精度で、凍結したBERTと7.4Mのトレーニング可能なパラメータを使用して、9つの目に見えないタイプでは87.2%の精度を実現している。
FaceForensics++ Deepfakesで0.959 AUC、Celeb-DFで0.870、凍結したDINOv2と3.6Mパラメータを使用して、Celeb-DFのトレーニングデータがない。
ブランチはデザイナが指定した汚職、現実世界のペアデータ、あるいはその両方から学習する。
5つの互換性のないアプローチが失敗し、互換性のないアプローチが成功する前に、広範な実験を通じて検証された。
アーキテクチャはエンコーダに依存しないドメインに依存しない: ドメインを変更するには新しい汚職戦略が必要だ; エンコーダを変更するには新しい入力プロジェクション層が必要である。
我々の知る限りでは、これは構造的コヒーレンスを配置毎の分解を伴う明示的なエネルギーランドスケープとして学習し、同じアーキテクチャが汚職再定義のみでモダリティ間で伝達されることを実証する最初のアーキテクチャである。
関連論文リスト
- Why Does the LLM Stop Computing: An Empirical Study of User-Reported Failures in Open-Source LLMs [50.075587392477935]
オープンソースのDeepSeek、Llama、Qwenのエコシステムから、705の現実世界の失敗に関する大規模な実証的研究を行った。
ホワイトボックスオーケストレーションは、モデルアルゴリズムの欠陥からデプロイメントスタックのシステム的脆弱性へと、信頼性のボトルネックを移動させます。
論文 参考訳(メタデータ) (2026-01-20T06:42:56Z) - C3Net: Context-Contrast Network for Camouflaged Object Detection [18.878603418735224]
カモフラージュされた物体検出は、同様の色、テクスチャ、パターンを通じて周囲とシームレスに融合する物体を特定する。
CODの基本的な課題は、内在的類似性、エッジ破壊、極端スケール破壊、環境複雑さ、文脈依存、正当性カモフラージュ対象の曖昧さの6つである。
我々はC3Netを提案する。C3Netは、特殊なデュアルパスウェイデコーダアーキテクチャによって、全ての課題に対処する。
論文 参考訳(メタデータ) (2025-11-16T14:35:39Z) - From Imperfect Signals to Trustworthy Structure: Confidence-Aware Inference from Heterogeneous and Reliability-Varying Utility Data [8.390328146420211]
我々は,不均一なデータを体系的に統合することで,信頼に値するグリッドトポロジを再構築するスケーラブルなフレームワークを提案する。
提案するフレームワークは,Oncorのサービス領域内の3つのフィーダーにわたる8000m以上のデータを用いて検証されている。
論文 参考訳(メタデータ) (2025-08-07T19:05:19Z) - Cross-architecture universal feature coding via distribution alignment [88.73189953617594]
クロスアーキテクチャユニバーサル特徴符号化(CAUFC)という新しい研究課題を導入する。
まず,CNN と Transformer が一貫した2次元トークン形式に特徴付けるフォーマットアライメント手法を設計し,また,トランケーションと正規化によって統計分布を調和させる特徴値アライメント手法を提案する。
本稿では,CAUFCを最初に研究する試みとして,画像分類作業における手法の評価を行い,本手法がアーキテクチャ固有のベースラインに比べて高いレート精度のトレードオフを実現することを示す。
論文 参考訳(メタデータ) (2025-06-15T06:14:02Z) - From Objects to Events: Unlocking Complex Visual Understanding in Object Detectors via LLM-guided Symbolic Reasoning [71.41062111470414]
現在のオブジェクト検出器は、エンティティのローカライゼーションと分類において優れているが、イベント認識機能には固有の制限がある。
本稿では,単なるオブジェクト認識以上の標準オブジェクト検出能力を,複雑なイベント理解に拡張する新しいフレームワークを提案する。
私たちの重要なイノベーションは、高価なタスク固有のトレーニングを必要とせずに、オブジェクト検出とイベント理解のセマンティックなギャップを埋めることです。
論文 参考訳(メタデータ) (2025-02-09T10:30:54Z) - Embracing Events and Frames with Hierarchical Feature Refinement Network for Object Detection [17.406051477690134]
イベントカメラはスパースと非同期のイベントを出力し、これらの問題を解決する潜在的な解決策を提供する。
イベントフレーム融合のための新しい階層的特徴改善ネットワークを提案する。
本手法は, フレーム画像に15種類の汚損タイプを導入する際に, 極めて優れたロバスト性を示す。
論文 参考訳(メタデータ) (2024-07-17T14:09:46Z) - Object Segmentation by Mining Cross-Modal Semantics [68.88086621181628]
マルチモーダル特徴の融合と復号を導くために,クロスモーダル・セマンティックスをマイニングする手法を提案する。
具体的には,(1)全周減衰核融合(AF),(2)粗大デコーダ(CFD),(3)多層自己超越からなる新しいネットワークXMSNetを提案する。
論文 参考訳(メタデータ) (2023-05-17T14:30:11Z) - Auto-Panoptic: Cooperative Multi-Component Architecture Search for
Panoptic Segmentation [144.50154657257605]
本稿では、バックボーン、セグメンテーションブランチ、フィーチャーフュージョンモジュールを含むすべての主要コンポーネントを同時に検索する効率的なフレームワークを提案する。
検索したアーキテクチャ、すなわちAuto-Panopticは、挑戦的なCOCOとADE20Kベンチマークに関する新しい最先端技術を実現します。
論文 参考訳(メタデータ) (2020-10-30T08:34:35Z) - Suppress and Balance: A Simple Gated Network for Salient Object
Detection [89.88222217065858]
両問題を同時に解くための単純なゲートネットワーク(GateNet)を提案する。
多レベルゲートユニットの助けを借りて、エンコーダからの貴重なコンテキスト情報をデコーダに最適に送信することができる。
さらに,提案したFold-ASPP操作(Fold-ASPP)に基づくアトラス空間ピラミッドプーリングを用いて,様々なスケールのサリアンオブジェクトを正確に位置決めする。
論文 参考訳(メタデータ) (2020-07-16T02:00:53Z) - Dataless Model Selection with the Deep Frame Potential [45.16941644841897]
ネットワークをその固有の能力で定量化し、ユニークでロバストな表現を行う。
本稿では,表現安定性にほぼ関係するが,ネットワーク構造にのみ依存する最小限のコヒーレンス尺度であるディープフレームポテンシャルを提案する。
モデル選択の基準としての利用を検証するとともに,ネットワークアーキテクチャの多種多様な残差および密結合化について,一般化誤差との相関性を示す。
論文 参考訳(メタデータ) (2020-03-30T23:27:25Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。