論文の概要: VLM-Aware Meta-Optic Front-End Design for Frozen Vision-Language Models
- arxiv url: http://arxiv.org/abs/2606.27646v1
- Date: Fri, 26 Jun 2026 01:54:22 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-29 18:24:25.350336
- Title: VLM-Aware Meta-Optic Front-End Design for Frozen Vision-Language Models
- Title(参考訳): 凍結ビジョンランゲージモデルのためのVLM対応メタオプティカルフロントエンド設計
- Authors: Chanik Kang, Raphaël Pestourie, Haejun Chung,
- Abstract要約: 凍結モデル認識のための連続密度メタ光学フロントエンドを最適化する協調設計フレームワークCODAを提案する。
CODAはCLIP ViT-L/14ゼロショット精度を53.75$pm$3.57$%$から65.41$pm$3.99$%$に改善している。
これらの結果は、制約されたメタ光学イメージングの下では、光設計と凍結した視覚モデル目標を整列させることにより、下流認識を改善することができることを示している。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Conventional machine-vision pipelines typically rely on high-quality optics that produce clean, human-interpretable images, and optical design has therefore been driven by image-level criteria such as resolution, aberration correction, and pixel fidelity. However, such optics are often impractical for size-, cost-, or form-factor-constrained applications, where compact meta-optics offer an attractive alternative but operate under strict physical efficiency limits. We propose CODA, a co-design framework that optimizes a continuous-density meta-optic front-end for frozen-model recognition using differentiable image formation and adjoint-gradient updates of Maxwell-based simulations. CODA directly optimizes the cross-entropy loss of a fixed zero-shot CLIP classifier without learned reconstruction, image signal processing, or image-fidelity auxiliary objectives. In a two-dimensional simulated imaging benchmark on ImageNet-100, CODA improves CLIP ViT-L/14 zero-shot accuracy from 53.75 $\pm$ 3.57$\%$ with a focal-concentration baseline to 65.41 $\pm$ 3.99$\%$. The optimized optics further transfer without re-optimization across CLIP, SigLIP, and DINOv2 on ImageNet-100, CIFAR-100, and Food-101. These results demonstrate that, under constrained meta-optic imaging, downstream recognition can be improved by aligning optical design with frozen vision-model objectives rather than conventional image-formation criteria.
- Abstract(参考訳): 従来のマシンビジョンパイプラインは通常、クリーンで人間の解釈可能な画像を生成する高品質な光学技術に依存しており、光学設計は解像度、収差補正、ピクセルの忠実さといった画像レベルの基準によって駆動されている。
しかし、そのような光学は、コンパクトなメタ光学が魅力的な代替手段を提供するが、厳密な物理的効率の限界の下で運用される、サイズ、コスト、フォームファクタ制約の用途では実用的でないことが多い。
微分可能画像形成とマクスウェルシミュレーションの随伴次更新を用いた凍結モデル認識のための連続密度メタ光学フロントエンドを最適化した協調設計フレームワークCODAを提案する。
CODAは、修正ゼロショットCLIP分類器のクロスエントロピー損失を直接最適化する。
ImageNet-100の2次元シミュレーション画像ベンチマークにおいて、CODAはCLIP ViT-L/14ゼロショット精度を53.75$\pm$3.57$\%$から65.41$\pm$3.99$\%$に改善した。
最適化された光学系は、ImageNet-100、CIFAR-100、Food-101上でCLIP、SigLIP、DINOv2を再最適化することなく、さらなる転送を行う。
これらの結果は、制約されたメタ光学画像下では、従来の画像形成基準ではなく、光設計と凍結した視覚モデル目標を整列させることにより、下流認識を改善することができることを示している。
関連論文リスト
- LithoGRPO: Fast Inverse Lithography via GRPO Reinforced Flow Matching [51.14153938143746]
Inverse Lithography Technology (ILT) は、ウェハへのパターン転送の忠実度を高める最適化マスクを生成する。
本稿では,フローマッチングパラダイムとGRPOに基づく強化学習(RL)ファインチューニングを統合したILTフレームワークLithoGRPOを紹介する。
RLサンプリング効率を向上させるために,130倍以上の高速化を実現し,製造性評価のための高速ショットカウントアルゴリズムを提案する。
論文 参考訳(メタデータ) (2026-05-29T18:01:59Z) - Multi-Contrast MRI Motion Correction via Parameter-Informed Disentanglement and Adaptive Experts [56.74856091904914]
パラメータインフォームドコントラストと重度適応補正を組み合わせた統合フレームワークを提案する。
ScanCLIPは、取得パラメータからアンタングルコントラストスタイルへのコントラスト埋め込みを解剖学的内容から導き、コントラストのない特徴をもたらす。
ビジョントランスフォーマーは、動きの重大度を推定し、Mixture-of-Expertsネットワークを介して特徴をルーティングし、ターゲットのアーティファクト修正を可能にする。
論文 参考訳(メタデータ) (2026-05-29T02:48:23Z) - Accelerating 3D Photoacoustic Computed Tomography with End-to-End Physics-Aware Neural Operators [74.65171736966131]
光音響計算トモグラフィ(PACT)は、光コントラストと超音波分解能を組み合わせることで、光拡散限界を超える深部像を実現する。
現在の実装では、高密度トランスデューサアレイと長い取得時間を必要とし、臨床翻訳を制限している。
本研究では,センサ計測からボリューム再構成まで,逆音響マッピングを直接学習する物理認識モデルであるPanoを紹介する。
論文 参考訳(メタデータ) (2025-09-11T23:12:55Z) - Computationally Efficient Information-Driven Optical Design with Interchanging Optimization [2.519074131450768]
勾配に基づく最適化により,情報駆動分析学習(I)を自動化した。
私は、高いメモリ使用量、長いランタイム、そしてエンドツーエンドの差別化要件のために、潜在的に不一致の客観的機能に悩まされています。
我々は、光学パラメータ最適化から密度推定をスケーラブルに分離するI with Interchanging Optimization (I-IO)を紹介した。
論文 参考訳(メタデータ) (2025-07-10T14:14:08Z) - Successive optimization of optics and post-processing with differentiable coherent PSF operator and field information [9.527960631238173]
我々は正確な光学シミュレーションモデルを導入し、パイプライン内の全ての操作は微分可能である。
様々な劣化に効率的に対処するために,フィールド情報を活用する共同最適化手法を設計する。
論文 参考訳(メタデータ) (2024-12-19T07:49:40Z) - EGIC: Enhanced Low-Bit-Rate Generative Image Compression Guided by Semantic Segmentation [0.030448596365296413]
EGICは、単一のモデルから歪み知覚曲線を効率的にトラバースできる拡張生成画像圧縮法である。
EGICは実装が簡単で、非常に軽量であり、優れた特性を提供する。
論文 参考訳(メタデータ) (2023-09-06T08:50:04Z) - Classification robustness to common optical aberrations [64.08840063305313]
本稿では,現実的かつ実用的な光ぼけ効果に対するロバスト性を調べるためのベンチマークである OpticsBench を提案する。
ImageNetの実験では、様々な訓練済みのDNNに対して、ディスク形状のカーネルと比較して、パフォーマンスが強いことが示されている。
我々は,光カーネルをデータ拡張として使用することにより,拡張可能なImageNet-100について述べる。
論文 参考訳(メタデータ) (2023-08-29T08:36:00Z) - Effective Invertible Arbitrary Image Rescaling [77.46732646918936]
Invertible Neural Networks (INN)は、ダウンスケーリングとアップスケーリングのサイクルを共同で最適化することにより、アップスケーリングの精度を大幅に向上させることができる。
本研究の1つのモデルのみをトレーニングすることにより、任意の画像再スケーリングを実現するために、単純で効果的な非可逆的再スケーリングネットワーク(IARN)を提案する。
LR出力の知覚品質を損なうことなく、双方向任意再スケーリングにおいて最先端(SOTA)性能を実現する。
論文 参考訳(メタデータ) (2022-09-26T22:22:30Z) - Universal and Flexible Optical Aberration Correction Using Deep-Prior
Based Deconvolution [51.274657266928315]
そこで本研究では,収差画像とpsfマップを入力とし,レンズ固有深層プリエントを組み込んだ潜在高品質版を生成する,psf対応プラグイン・アンド・プレイ深層ネットワークを提案する。
具体的には、多彩なレンズの集合からベースモデルを事前訓練し、パラメータを迅速に精製して特定のレンズに適応させる。
論文 参考訳(メタデータ) (2021-04-07T12:00:38Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。