論文の概要: Hierarchical Channel Stacking: A Structured Decision Framework for AI-Generated Image Detection
- arxiv url: http://arxiv.org/abs/2608.26648v2
- Date: Wed, 02 Sep 2026 21:51:02 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-04 13:51:58.103148
- Title: Hierarchical Channel Stacking: A Structured Decision Framework for AI-Generated Image Detection
- Title(参考訳): Hierarchical Channel Stacking:AI生成画像検出のための構造化決定フレームワーク
- Authors: Saifullah Shoaib, Akash Borigi, Rupendra Lekkala, Amaury Lendasse, Edward Ratner, Sai Sowjanya Bhamidipati, Alexander Schlager, Peggy Lindner,
- Abstract要約: 本稿では,AI生成画像検出のためのコンパクトなフレームワークである階層チャネル・スタッキングを紹介する。
中間のCNN活性化を3つのより深いバックボーンのステージにまたがって構成された60次元の表現に変換する。
GANと拡散生成器にまたがるベンチマークで86.7%の精度と86.7%のマクロF1を達成する。
- 参考スコア(独自算出の注目度): 32.505127447635864
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Many synthetic-image detectors produce accurate predictions but offer limited insight into how those decisions are formed. This paper introduces Hierarchical Channel Stacking (HCS), a compact framework for AI-generated image detection that converts intermediate CNN activations into a structured 60-dimensional representation organized across three progressively deeper backbone stages. HCS uses per-channel Level-1 classifiers and a Level-2 aggregator to produce image-level predictions while preserving explicit hierarchical structure for analysis. On a benchmark spanning GAN and diffusion generators, HCS achieves 86.7% accuracy and 86.7% macro-F1 on the held-out test set. Stage ablation shows that the full three-stage system outperforms reduced single-stage and two-stage variants, indicating that the hierarchy carries complementary predictive information. Stage-level contribution analysis further shows that, in the analyzed detector setting, fake GAN and fake diffusion images exhibit distinct stage-level contribution profiles. These results position HCS not simply as a compact detector, but as a structured framework for studying how synthetic-image detectors assemble evidence across representation levels.
- Abstract(参考訳): 多くの合成画像検出器は正確な予測を行うが、これらの決定がどのように形成されるかについては限定的な洞察を与える。
本稿では、中間CNNアクティベーションを3つのより深いバックボーンステージに配置した60次元の構造化表現に変換する、AI生成画像検出のためのコンパクトなフレームワークである階層チャネル・スタックリング(HCS)を紹介する。
HCSは、チャンネルごとのレベル1分類器とレベル2アグリゲータを使用して画像レベルの予測を生成し、分析のために明確な階層構造を保っている。
GANと拡散発生器にまたがるベンチマークでは、HCSは86.7%の精度と86.7%のマクロF1を達成する。
段階的アブレーションは、完全な3段階システムは1段階と2段階の変異を減らし、階層構造が相補的な予測情報を持っていることを示す。
ステージレベルのコントリビューション分析では、解析された検出器設定では、偽のGANと偽の拡散画像が異なるステージレベルのコントリビューションプロファイルを示す。
これらの結果は、HCSを単にコンパクト検出器としてではなく、合成像検出器がどのように表現レベルを越えて証拠を組み立てるかを研究するための構造化された枠組みとして位置づけた。
関連論文リスト
- PE-Mamba: Bidirectional Selective Layer Aggregation for AI-Generated Image Detection [2.1410799064827235]
textbfPE-Mambaは、軽量なLoRA適応を備えたトレーニング済みのPE-Coreビジョントランスフォーマ上に構築された新しいフレームワークである。
双方向選択的アグリゲータ(BSA)は、前方および後方選択的スキャンを通じて層単位での分類トークンを処理する。
ソフトマックス重み付けアグリゲータ(SWA)は、すべての層トークンの学習されたグローバルサマリを相補的な集約パスとして計算する。
シグモノイドゲートブレンド(SGA)は、学習可能なスカラーゲートを介してBSAおよびSWA出力を適応的に融合させる。
論文 参考訳(メタデータ) (2026-08-08T08:24:44Z) - FLORO: A Multimodal Geospatial Foundation Model for Ecological Remote Sensing Across Sensors and Scales [65.4821703903285]
FLOROは、小さなが高度に多様なリモートセンシングコーパスから転送可能な表現を学習するために設計されたマルチモーダル基礎モデルである。
FLOROは、Sentinel-1、Sentinel-2、SkySAT画像、標高、UAV由来のデータとの不均一な組み合わせによるマスク付きオートエンコーディングを用いて事前訓練される。
我々は、シーン分類、セグメンテーション、回帰タスクにまたがる凍結エンコーダプロトコルを用いて、PANGAEAベンチマーク上でFLOROを評価した。
論文 参考訳(メタデータ) (2026-05-27T08:55:54Z) - Hierarchical Consistency Learning for Test-time Adaptation in Camouflage Perception [50.278200968044665]
カモフラージュされた物体検出(COD)は、物理的属性を通して背景から最小限の知覚差を示すターゲットをローカライズすることを目的としている。
既存のメソッドは、静的なTrain-then-freezeパラダイムによって制約されており、ドメインの剛性と依存性のアノテーションに悩まされている。
動的表現再構成のためのテスト時間適応を統合した階層的一貫性学習フレームワークを提案する。
論文 参考訳(メタデータ) (2026-05-25T09:57:46Z) - Layout-Guided Controllable Pathology Image Generation with In-Context Diffusion Transformers [57.54843029965778]
制御可能な病理画像合成には、空間配置、組織形態、意味的詳細の信頼できる規制が必要である。
In-Context Diffusion Transformer (IC-DiT) は,空間レイアウト,テキスト記述,視覚的埋め込みを統合拡散変換器に組み込んだレイアウト認識生成モデルである。
IC-DiTは既存の方法よりも忠実度が高く、空間制御性が強く、診断の整合性が良くなる。
論文 参考訳(メタデータ) (2026-03-11T06:14:11Z) - Beyond Binary Classification: A Semi-supervised Approach to Generalized AI-generated Image Detection [1.189955933770711]
現在の法医学における重大な脆弱性は、検出器がクロスジェネレータの一般化を達成できないことである。
本稿では,「フェイク」クラス内の潜在アーキテクチャパターンを発見することによって,バイナリ分類を強化する半教師付きアプローチを提案する。
論文 参考訳(メタデータ) (2025-11-23T16:02:27Z) - Complementary Information Guided Occupancy Prediction via Multi-Level Representation Fusion [73.11061598576798]
カメラによる占有予測は、自動運転における3D知覚の主流のアプローチである。
textbfCIGOccはマルチレベル表現融合に基づく2段階の占有予測フレームワークである。
textbfCIGOccは、入力画像からセグメンテーション、グラフィックス、深さの特徴を抽出し、変形可能なマルチレベル融合機構を導入する。
論文 参考訳(メタデータ) (2025-10-15T06:37:33Z) - Transformers Fusion across Disjoint Samples for Hyperspectral Image Classification [2.1223532600703385]
3Dスウィントランス(3D-ST)は、画像内の複雑な空間的関係を捉えるのに優れる。
SSTは、自己アテンション機構による長距離依存関係のモデリングを専門とする。
本稿では、ハイパースペクトル画像(HSI)の分類性能を大幅に向上させるために、これらの2つの変換器の注意融合を導入する。
論文 参考訳(メタデータ) (2024-05-02T08:49:01Z) - DiffSpectralNet : Unveiling the Potential of Diffusion Models for
Hyperspectral Image Classification [6.521187080027966]
我々は拡散と変圧器技術を組み合わせたDiffSpectralNetと呼ばれる新しいネットワークを提案する。
まず,拡散モデルに基づく教師なし学習フレームワークを用いて,高レベル・低レベルのスペクトル空間的特徴を抽出する。
この拡散法はスペクトル空間の特徴を多様かつ有意義に抽出し,HSI分類の改善につながる。
論文 参考訳(メタデータ) (2023-10-29T15:26:37Z) - You Only Train Once: A Unified Framework for Both Full-Reference and No-Reference Image Quality Assessment [45.62136459502005]
本稿では,完全な参照 (FR) と非参照 (NR) IQA を行うネットワークを提案する。
まず、入力画像から多レベル特徴を抽出するためにエンコーダを用いる。
FRおよびNR入力のユニバーサルアダプタとして階層的注意(HA)モジュールを提案する。
エンコーダの浅い層と深い層との間の特徴相関を調べるために, セマンティック・ディストーション・アウェア (SDA) モジュールを提案する。
論文 参考訳(メタデータ) (2023-10-14T11:03:04Z) - HKNAS: Classification of Hyperspectral Imagery Based on Hyper Kernel
Neural Architecture Search [104.45426861115972]
設計したハイパーカーネルを利用して,構造パラメータを直接生成することを提案する。
我々は1次元または3次元の畳み込みを伴う画素レベルの分類と画像レベルの分類を別々に行う3種類のネットワークを得る。
6つの公開データセットに関する一連の実験は、提案手法が最先端の結果を得ることを示した。
論文 参考訳(メタデータ) (2023-04-23T17:27:40Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。