論文の概要: Does AI Understand Imaging? A Systematic Benchmark of Agentic AI for Computational Imaging Tasks
- arxiv url: http://arxiv.org/abs/2607.07189v1
- Date: Wed, 08 Jul 2026 09:23:56 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-09 22:50:30.342339
- Title: Does AI Understand Imaging? A Systematic Benchmark of Agentic AI for Computational Imaging Tasks
- Title(参考訳): AIはイメージングを理解できるか? : コンピュータイメージングタスクのためのエージェントAIの体系的ベンチマーク
- Abstract要約: 視覚言語モデル(VLM)とエージェントAIは、セマンティックビジュアルタスクに強いパフォーマンスを示している。
計算画像の根底にある物理問題や逆問題に対処できるかどうかはまだ不明である。
我々は5つのカテゴリにまたがる20の計算画像処理タスクのベンチマークである ImagingBench を提示する。
- 参考スコア(独自算出の注目度): 3.146480929844211
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Vision-language models (VLMs) and agentic AI have shown strong performance on semantic visual tasks, but it remains unclear whether they can handle the physics and inverse problems that underlie computational imaging. We present ImagingBench, a benchmark of 20 computational imaging tasks spanning five categories: ray and wave optics, image signal processing, inverse reconstruction, computational sensing, and calibration. ImagingBench evaluates three complementary settings: Expert, fixed expert-guided inverse reconstruction; Planner, planner-guided inverse reconstruction; and Forward, forward-system simulation for consistency checking. We benchmark leading proprietary and open-source image-centric multimodal systems, including Gemini, GPT, and Qwen, and compare them with representative task-specific non-agentic baselines. Across tasks, agentic models remain consistently weaker than specialized methods, especially on computational sensing problems such as lensless imaging, event-based reconstruction, time-of-flight imaging, and holography. Planner guidance provides only modest and inconsistent gains over the fixed-prompt Expert baseline. Although the models often generate visually plausible outputs, their reference-based fidelity remains poor, revealing a substantial gap between semantic visual competence and physically grounded imaging performance. ImagingBench provides a unified testbed for measuring this gap and tracking progress in agentic AI for computational imaging.
- Abstract(参考訳): 視覚言語モデル(VLM)とエージェントAIは、セマンティック・ビジュアル・タスクにおいて強い性能を示してきたが、それらが計算画像の根底にある物理問題や逆問題に対処できるかどうかは不明だ。
我々は、光線と波動光学、画像信号処理、逆再構成、コンピュータセンシング、キャリブレーションの5つのカテゴリにまたがる20の計算画像タスクのベンチマークである ImagingBenchを提案する。
ImagingBenchは、エキスパート、固定専門家誘導逆変換、プランナー、プランナー誘導逆再構成、整合性チェックのためのフォワードシステムシミュレーションの3つの相補的な設定を評価している。
我々は、Gemini、GPT、Qwenなど、プロプライエタリでオープンソースの画像中心のマルチモーダルシステムをベンチマークし、それらを代表的タスク固有の非エージェントベースラインと比較する。
タスク全体にわたって、エージェントモデルは、特にレンズレスイメージング、イベントベース再構成、飛行時間イメージング、ホログラフィーなどの計算センシング問題において、特殊手法よりも一貫して弱いままである。
プランナーガイダンスは、固定プロンプトのExpertベースラインに対して、控えめで一貫性のない利得しか提供しない。
モデルはしばしば視覚的に可視な出力を生成するが、その参照ベースの忠実度は依然として貧弱であり、意味的な視覚能力と物理的にグラデーションされた画像性能の間に大きなギャップが生じる。
ImagingBenchは、このギャップを測定し、計算イメージングのためのエージェントAIの進捗を追跡するための統合テストベッドを提供する。
関連論文リスト
- Can Vision-Language Models Reason about AI Edits in Images? [78.04125956307838]
VLM(Vision-Language Models)は、強力な視覚的理解と推論能力のために、有望な代替手段を提供する。
簡単な精度と形式報酬を利用するGRPOベースのトレーニングフレームワークを提案する。
提案手法は,最先端画像フォージェリ検出器と比較して,競合検出と局所化性能を実現する。
論文 参考訳(メタデータ) (2026-07-30T16:23:40Z) - Imaging-101: Benchmarking LLM Coding Agents on Scientific Computational Imaging [9.890461939894694]
我々は、6つの科学領域にまたがる57の専門的な計算画像タスクのベンチマークである Imaging-101 を紹介した。
3つの評価トラック(計画、機能レベルの単体テスト、エンドツーエンドの再構築)は、完全なパイプライン全体にわたって異なるエージェント能力を探索する。
論文 参考訳(メタデータ) (2026-07-12T14:42:57Z) - GenShield: Unified Detection and Artifact Correction for AI-Generated Images [65.11434977803509]
GenShieldは、診断から修復までのクローズドループでAIGI検出とアーティファクト修正を実行するフレームワークである。
大規模なアーティファクト-restored'ペアを備えた高品質データセットは、統一された評価パイプラインと共に構築される。
論文 参考訳(メタデータ) (2026-05-15T16:06:20Z) - Q-DeepSight: Incentivizing Thinking with Images for Image Quality Assessment and Refinement [58.15004031934379]
我々は、この人間のようなプロセスをエミュレートする思考とイメージのフレームワークであるQ-DeepSightを提案する。
Q-DeepSightは、自然、復元、AI生成コンテンツなど、さまざまなベンチマークで最先端のパフォーマンスを実現している。
本稿では,Q-DeepSight の診断が反復画像強調を導くトレーニングフリーフレームワークであるPerceptual-in-Generation (PiG) を用いて,その実用的価値を示す。
論文 参考訳(メタデータ) (2026-04-18T06:10:57Z) - How Well Do Models Follow Visual Instructions? VIBE: A Systematic Benchmark for Visual Instruction-Driven Image Editing [56.60465182650588]
我々は,3段階の相互作用階層を導入し,決定的接地,形態的操作,因果推論を捉える。
本稿では,スケーラブルできめ細かい評価を実現するために,タスク固有のメトリクスを備えた堅牢なLMM-as-a-judge評価フレームワークを提案する。
プロプライエタリなモデルは早期の視覚指示追従能力を示し、一貫してオープンソースモデルを上回っていることがわかった。
論文 参考訳(メタデータ) (2026-02-02T09:24:45Z) - More Images, More Problems? A Controlled Analysis of VLM Failure Modes [80.64323947730905]
大規模視覚言語モデル (LVLM) は目覚ましい能力を示しているが、複数の画像に対する理解と推論の能力は未解明のままである。
LVLMのマルチイメージ能力を厳格に評価する新しいベンチマークMIMICを紹介する。
論文 参考訳(メタデータ) (2026-01-12T18:45:13Z) - Semantic-Aware Reconstruction Error for Detecting AI-Generated Images [22.83053631078616]
本稿では,画像とキャプション誘導再構成のセマンティック・アウェア・リコンストラクション・エラー(SARE)を計測する新しい表現を提案する。
SAREは、さまざまな生成モデル間で偽画像を検出するための堅牢で差別的な機能を提供する。
また,SAREを背骨検出器に統合する融合モジュールを,クロスアテンション機構を介して導入する。
論文 参考訳(メタデータ) (2025-08-13T04:37:36Z) - RIGID: A Training-free and Model-Agnostic Framework for Robust AI-Generated Image Detection [60.960988614701414]
RIGIDは、堅牢なAI生成画像検出のためのトレーニング不要でモデルに依存しない方法である。
RIGIDは、既存のトレーニングベースおよびトレーニング不要な検出器を著しく上回っている。
論文 参考訳(メタデータ) (2024-05-30T14:49:54Z) - Analysis of Deep Image Prior and Exploiting Self-Guidance for Image
Reconstruction [13.277067849874756]
DIPがアンダーサンプドイメージング計測からどのように情報を回収するかを検討する。
ネットワーク重みと入力の両方を同時に最適化する自己駆動型再構築プロセスを導入する。
提案手法は,ネットワーク入力画像と再構成画像の両方の堅牢かつ安定した関節推定を可能にする,新しいデノイザ正規化項を組み込んだものである。
論文 参考訳(メタデータ) (2024-02-06T15:52:23Z) - Learning to Exploit Temporal Structure for Biomedical Vision-Language
Processing [53.89917396428747]
視覚言語処理における自己教師あり学習は、画像とテキストのモダリティのセマンティックアライメントを利用する。
トレーニングと微調整の両方で利用できる場合、事前のイメージとレポートを明示的に説明します。
我々のアプローチはBioViL-Tと呼ばれ、テキストモデルと共同で訓練されたCNN-Transformerハイブリッドマルチイメージエンコーダを使用する。
論文 参考訳(メタデータ) (2023-01-11T16:35:33Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。