論文の概要: Are Image Generators Zero-Shot Perceivers? A Rigorous Evaluation
- arxiv url: http://arxiv.org/abs/2609.07884v1
- Date: Mon, 07 Sep 2026 18:48:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-11 20:16:12.845365
- Title: Are Image Generators Zero-Shot Perceivers? A Rigorous Evaluation
- Title(参考訳): 画像生成装置はゼロショット知覚器か? : 厳密な評価
- Abstract要約: ゼロショット設定で、イメージジェネレータがパブリックな視覚知覚ベンチマークにどこまで到達できるかを尋ねる。
本稿では,単眼深度推定を行うゼロショット生成知覚のベンチマークであるProbeGenを紹介する。
予め訓練した画像生成装置は、ゼロショットの知覚能力が測定可能であるが、明確なトレードオフがある。
- 参考スコア(独自算出の注目度): 54.18771863630389
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Recent work, such as Vision Banana, shows that lightweight instruction tuning can enable an image generator to achieve state-of-the-art performance across multiple visual perception tasks. Motivated by this perspective, we ask how far image generators can go on public visual perception benchmarks in a zero-shot setting. We introduce ProbeGen, a benchmark for zero-shot generative perception that casts monocular depth estimation, referring/reasoning segmentation, and object counting as conditional generation tasks specified through text prompts, and compares 20 models in total---including proprietary and open-weight image generators, specialist perception models, and MLLMs---across 11 published benchmarks. We observe that pretrained image generators show measurable zero-shot perceptual competence, but with a clear trade-off: specialist models remain stronger for in-distribution accuracy and efficiency, while generative models are often more robust under distribution shift and better at compositional semantic reasoning. We hope this study helps establish zero-shot generative perception as a meaningful research direction and provides a useful foundation for future work at the intersection of visual generation and understanding.
- Abstract(参考訳): ビジョンバナ(Vision Banana)のような最近の研究は、軽量なインストラクションチューニングにより、イメージジェネレータが複数の視覚的知覚タスクで最先端のパフォーマンスを達成できることを示している。
この観点から、画像生成装置は、ゼロショット設定でパブリックな視覚知覚ベンチマークにどこまで到達できるかを尋ねる。
ProbeGenは、単眼深度推定、参照/推論セグメンテーション、オブジェクトカウントをテキストプロンプトで指定した条件生成タスクとしてキャストするゼロショット生成知覚のベンチマークであり、20種類のモデル(プロプライエタリおよびオープンウェイト画像ジェネレータ、スペシャリスト認識モデル、MLLM)を11のベンチマークで比較する。
事前学習した画像生成装置は、ゼロショットの知覚能力を示すが、明確なトレードオフがある: 専門的モデルは、分配精度と効率が強く、生成モデルは、分散シフト下でより堅牢であり、構成意味推論においてより優れている。
本研究は、ゼロショット生成知覚を有意義な研究方向として確立し、視覚生成と理解の交差点における将来の研究に有用な基礎となることを願っている。
関連論文リスト
- SSAFE: Simple and Strong AI-Generated Image Detection via Frozen Vision Encoders [61.07733730455141]
現代のマルチモーダル視覚表現において,画像の真正性に関する情報がどのように符号化されているかを検討する。
我々は,学習用代表生成器のコンパクトな集合を選択する表現対応型データキュレーション戦略を開発した。
実験により、凍結したマルチモーダル表現と慎重にキュレートされたトレーニングデータを組み合わせることで、AI生成画像検出に対するシンプルで効果的なアプローチが示される。
論文 参考訳(メタデータ) (2026-06-07T13:56:17Z) - MiraGe: Multimodal Discriminative Representation Learning for Generalizable AI-Generated Image Detection [32.662682253295486]
一般化可能なAI生成画像検出のためのマルチモーダル識別学習(MiraGegenerator)を提案する。
テキスト埋め込みをセマンティックアンカーとして活用し、効果的な識別的表現学習を実現するために、マルチモーダル・プロンプト・ラーニングを適用した。
MiraGegeneratorは最先端のパフォーマンスを実現し、Soraのような目に見えないジェネレータに対してさえ堅牢性を維持している。
論文 参考訳(メタデータ) (2025-08-03T00:19:18Z) - Prefilled responses enhance zero-shot detection of AI-generated images [2.6581858762749997]
我々は、AI生成画像のゼロショット検出のために、事前訓練された視覚言語モデル(VLM)を探索する。
人間の顔,物体,動物の合成画像を含む3つのベンチマークを用いて,VLMの性能を評価する。
特に「スタイルと合成アーティファクトを調べよう」というタスク対応のフレーズでVLM応答をプリフィルすると、3つの広く使われているオープンソースVLMのマクロF1スコアが最大24%向上する。
論文 参考訳(メタデータ) (2025-05-20T22:44:04Z) - Manifold Induced Biases for Zero-shot and Few-shot Detection of Generated Images [4.597145995119321]
我々は,(1)理論的な根拠の欠如,(2)ゼロショットと少数ショットの制度における性能改善のための重要な余地,の2つの主要なギャップを同定する。
具体的には,事前学習した拡散モデルにより得られた暗黙的確率多様体のバイアスについて検討する。
スコア関数解析により、確率多様体上の点に対する曲率、勾配、偏りを近似し、ゼロショット状態における検出基準を確立する。
20個の生成モデルにまたがる実験結果から,本手法はゼロショット設定と少数ショット設定の両方において,現在の手法よりも優れていることが示された。
論文 参考訳(メタデータ) (2025-04-21T22:39:24Z) - GH-Feat: Learning Versatile Generative Hierarchical Features from GANs [61.208757845344074]
画像合成から学習した生成機能は、幅広いコンピュータビジョンタスクを解く上で大きな可能性を秘めていることを示す。
まず,事前学習したStyleGANジェネレータを学習損失関数として考慮し,エンコーダを訓練する。
GH-Feat(Generative Hierarchical Features)と呼ばれるエンコーダが生成する視覚的特徴は、階層的なGAN表現と高度に一致している。
論文 参考訳(メタデータ) (2023-01-12T21:59:46Z) - Composing Ensembles of Pre-trained Models via Iterative Consensus [95.10641301155232]
本稿では,異なる事前学習モデルのアンサンブルを構成するための統一的なフレームワークを提案する。
事前学習したモデルを「ジェネレータ」あるいは「スコーラ」として使用し、クローズドループ反復コンセンサス最適化により構成する。
スコアラーのアンサンブルによって達成されたコンセンサスは、シングルスコアラーのフィードバックよりも優れていることを示す。
論文 参考訳(メタデータ) (2022-10-20T18:46:31Z) - GRIT: General Robust Image Task Benchmark [32.556726698322755]
本稿では,GRIT(General Robust Image Task)ベンチマークを紹介する。
GRITは、様々な画像予測タスク、概念、データソースにわたるビジョンシステムの性能、堅牢性、キャリブレーションを評価する。
ビジョンモデルによって学習されたスキルや概念を徹底的に評価するための統一プラットフォームを提供することにより、GRITが高性能で堅牢な汎用的なビジョンシステムの開発を促進することを期待する。
論文 参考訳(メタデータ) (2022-04-28T17:13:23Z) - Learning to Prompt for Vision-Language Models [82.25005817904027]
視覚言語による事前学習が表現学習の有望な代替手段として登場した。
画像と離散ラベルを使って、視覚的な概念と見なされる一連の重みを学習する伝統から、2つの異なるエンコーダのための画像と生のテキストの整列へと移行する。
このようなパラダイムは、より広範な監視源の恩恵を受け、下流タスクへのゼロショット転送を可能にします。
論文 参考訳(メタデータ) (2021-09-02T17:57:31Z) - Generative Hierarchical Features from Synthesizing Images [65.66756821069124]
画像合成の学習は、広範囲のアプリケーションにまたがって一般化可能な顕著な階層的な視覚的特徴をもたらす可能性があることを示す。
生成的階層的特徴(Generative Hierarchical Feature, GH-Feat)と呼ばれるエンコーダが生成する視覚的特徴は、生成的タスクと識別的タスクの両方に強い伝達性を有する。
論文 参考訳(メタデータ) (2020-07-20T18:04:14Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。