論文の概要: Open-Source Image Editing Models Are Zero-Shot Vision Learners
- arxiv url: http://arxiv.org/abs/2605.04566v1
- Date: Wed, 06 May 2026 07:11:50 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-07 18:41:07.691431
- Title: Open-Source Image Editing Models Are Zero-Shot Vision Learners
- Title(参考訳): オープンソース画像編集モデルがゼロショットビジョン学習者になる
- Abstract要約: Qwen-Image-Edit、FireRed-Image-Edit、LongCat-Image-Editの3つのオープンソースイメージ編集モデルを、密集した視覚的予測タスクで評価する。
その結果、オープンソースの画像編集モデルは、非自明なゼロショット視覚的理解を示すことがわかった。
- 参考スコア(独自算出の注目度): 8.09316966436924
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Recent studies have shown that large generative models can solve vision tasks they were not explicitly trained for. However, existing evidence relies on closed-source models~(Veo~3, Nano Banana Pro) or requires task-specific instruction tuning, leaving open whether publicly available image-editing models possess zero-shot vision abilities out of the box. We conduct a systematic evaluation of three open-source image-editing models -- Qwen-Image-Edit, FireRed-Image-Edit, and LongCat-Image-Edit -- on dense visual prediction tasks \emph{without any fine-tuning}. We benchmark monocular depth estimation on NYUv2 and DIODE, surface normal estimation on NYUv2, and semantic segmentation on Cityscapes, covering both geometric and semantic scene understanding. Results show that open-source image-editing models exhibit non-trivial zero-shot visual understanding. On NYUv2 surface normals, FireRed-Image-Edit achieves a mean angular error of $17.69^\circ$, surpassing the fine-tuned Marigold ($20.86^\circ$) and matching the instruction-tuned Vision Banana ($17.78^\circ$) without any task-specific training. On NYUv2 depth estimation, LongCat-Image-Edit obtains $δ_1{=}0.822$ with affine alignment, and Qwen-Image-Edit leads on DIODE Indoor ($δ_1{=}0.868$). On Cityscapes semantic segmentation, Qwen-Image-Edit reaches 25.7 mIoU at the 19-class level and 49.5 mIoU at a coarser 7-category level. By comparing three independently trained editors, we test whether zero-shot vision ability is an emergent property of image-editing pretraining rather than a model-specific artifact. Code, evaluation scripts, and all results are publicly released to serve as a reproducible baseline for future work.
- Abstract(参考訳): 近年の研究では、大規模な生成モデルは、明示的に訓練されていない視覚課題を解決できることが示されている。
しかし、既存の証拠はクローズドソースモデル~(Veo~3, Nano Banana Pro)に依存するか、タスク固有のインストラクションチューニングが必要であり、一般に公開されている画像編集モデルがゼロショットの視覚能力を持っているかどうかを未解決のまま残している。
Qwen-Image-Edit,FireRed-Image-Edit,LongCat-Image-Editの3つのオープンソース画像編集モデルの,高密度な視覚的予測タスク \emph{without any fine-tuning} に関する体系的な評価を行う。
我々は,NYUv2とDIODEの単眼深度推定,NYUv2の表面正規度推定,都市景観のセマンティックセマンティックセグメンテーションをベンチマークし,幾何学的および意味的シーン理解の両面をカバーする。
その結果、オープンソースの画像編集モデルは、非自明なゼロショット視覚的理解を示すことがわかった。
通常のNYUv2では、FireRed-Image-Editは17.69^\circ$の平均角誤差を達成し、微調整のMarigold(20.86^\circ$)を越え、命令調整のVision Banana(17.78^\circ$)をタスク固有のトレーニングなしでマッチングする。
NYUv2の深さ推定では、LongCat-Image-Editはアフィンアライメントを持つ$δ_1{=}0.822$を取得し、Qwen-Image-EditはDIODE Indoor(δ_1{=}0.868$)をリードする。
都市景観のセマンティックセグメンテーションでは、Qwen-Image-Editは19級で25.7 mIoU、粗い7級で49.5 mIoUに達する。
独立に訓練された3つのエディタを比較して、ゼロショットビジョン能力が、モデル固有のアーティファクトではなく、画像編集事前学習の創発的特性であるかどうかを検証する。
コード、評価スクリプト、および全ての結果は公開され、将来の作業の再現可能なベースラインとして機能する。
関連論文リスト
- Depth Anything 3: Recovering the Visual Space from Any Views [64.12492264286522]
任意の数の視覚入力から空間的に一貫した幾何を予測するモデルとして,Depth Anything 3 (DA3) を提案する。
我々は、カメラのポーズ推定、任意のビュー幾何学、視覚レンダリングを含む新しいビジュアルジオメトリ・ベンチマークを構築した。
このベンチマークでは、DA3は全てのタスクをまたいで新しい最先端を設定し、以前のSOTA VGGTを平均44.3%の精度で上回り、幾何学的精度は25.1%である。
論文 参考訳(メタデータ) (2025-11-13T18:59:53Z) - From Editor to Dense Geometry Estimator [77.21804448599009]
密度幾何予測のための拡散変換器(DiT)アーキテクチャに基づく高度な編集モデルを適用するフレームワークである textbfFE2E を紹介する。
FE2EはETH3Dデータセットで35%以上のパフォーマンス向上を実現し、100$times$データでトレーニングされたDepthAnythingシリーズを上回っている。
論文 参考訳(メタデータ) (2025-09-04T15:58:50Z) - Multi-Reward as Condition for Instruction-based Image Editing [32.77114231615961]
インストラクションベースの画像編集には、高品質なトレーニング三脚(インストラクション、オリジナル画像、編集画像)が不可欠である。
これらのデータセットは、指示の不正確さ、詳細保存の貧弱さ、生成アーティファクトに悩まされている。
そこで本研究では,地味画像の品質を改良する代わりに,多視点報酬データを用いたトレーニングデータ品質問題に対処することを提案する。
論文 参考訳(メタデータ) (2024-11-06T05:02:29Z) - DistillNeRF: Perceiving 3D Scenes from Single-Glance Images by Distilling Neural Fields and Foundation Model Features [65.8738034806085]
DistillNeRFは、自動運転シーンにおける3D環境を理解するための自己教師型学習フレームワークである。
本手法は,スパースで単一フレームのマルチビューカメラ入力からリッチなニューラルシーン表現を予測する一般化可能なフィードフォワードモデルである。
論文 参考訳(メタデータ) (2024-06-17T21:15:13Z) - GenWarp: Single Image to Novel Views with Semantic-Preserving Generative Warping [47.38125925469167]
一つの画像から新しいビューを生成するための意味保存型生成ワープフレームワークを提案する。
提案手法は,ソースビューイメージに生成モデルを条件付けすることで,既存の手法の限界に対処する。
我々のモデルは、ドメイン内シナリオとドメイン外シナリオの両方において、既存のメソッドよりも優れています。
論文 参考訳(メタデータ) (2024-05-27T15:07:04Z) - Learning Naturally Aggregated Appearance for Efficient 3D Editing [90.57414218888536]
カラーフィールドは、標準画像(canonical image)とも呼ばれる、明示的な2次元の外観アグリゲーションとして学習する。
テクスチャクエリのために3Dポイントを2Dピクセルにマッピングする投影場を標準画像に補完する。
提案手法は,既存のNeRFベースの編集手法に比べて,編集1回あたり20倍高速であることを示す。
論文 参考訳(メタデータ) (2023-12-11T18:59:31Z) - The Change You Want to See (Now in 3D) [65.61789642291636]
本稿の目的は、同じ3Dシーンの2つの「野生」画像の間で何が変わったかを検出することである。
我々は,全合成データに基づいて学習し,クラスに依存しない変化検出モデルに貢献する。
我々は,人間に注釈を付けた実世界のイメージペアによる評価データセットを新たにリリースした。
論文 参考訳(メタデータ) (2023-08-21T01:59:45Z) - Learning 3D Photography Videos via Self-supervised Diffusion on Single
Images [105.81348348510551]
3D写真は、静止画を3D視覚効果のあるビデオにレンダリングする。
既存のアプローチは通常、まず単眼深度推定を行い、次に様々な視点で入力フレームを後続のフレームに描画する。
我々は、入力オブジェクトの空間と時間を拡張する、新しいタスク、out-animationを提案する。
論文 参考訳(メタデータ) (2023-02-21T16:18:40Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。