論文の概要: GTF: Omnidirectional EPI Transformer for Light Field Super-Resolution
- arxiv url: http://arxiv.org/abs/2605.04581v1
- Date: Wed, 06 May 2026 07:31:05 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-07 18:41:07.700035
- Title: GTF: Omnidirectional EPI Transformer for Light Field Super-Resolution
- Title(参考訳): GTF:光電界超解像用全方位EPI変換器
- Authors: Kunyu Li, Fei Wang, Lichao Zhang, Junjie Liu, Bihong Li,
- Abstract要約: GTFは、水平、垂直、45度、135度のEPIを統一的な再構築フレームワーク内でモデル化する全方位EPI変換器である。
5つの標準LF SRベンチマークでは、GTFは推論時間拡張なしで32.78dBに達し、EPSWとテスト時間拡張による推論設定がさらに向上した。
NTIRE 2026 Light Field Image Super-Resolution Challengeでは、トラック1で3位、トラック2で3位、トラック2で4位にランクインした。
- 参考スコア(独自算出の注目度): 12.46427483493548
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Light field (LF) image super-resolution benefits from Epipolar Plane Images (EPIs), whose line slopes explicitly encode disparity. However, existing Transformer-based LF SR methods mainly attend to horizontal and vertical EPIs, leaving diagonal epipolar geometry underexplored. We present GTF, an omnidirectional EPI Transformer that explicitly models horizontal, vertical, 45-degree, and 135-degree EPIs within a unified reconstruction framework. GTF combines directional EPI processing, MacPI-based prior injection, adaptive directional fusion, and a topology-preserving feed-forward network to better exploit LF geometry. For the NTIRE 2026 fidelity tracks, we use GTF as the main model, while a lightweight GTF-Tiny variant targets the efficiency track. On five standard LF SR benchmarks covering both real-captured and synthetic scenes, GTF reaches 32.78 dB without inference-time enhancement, and stronger inference settings with EPSW and test-time augmentation further improve performance. Under the NTIRE 2026 efficiency constraint, GTF-Tiny attains 32.57 dB with only 0.915M parameters and 19.81 GFLOPs. In the NTIRE 2026 Light Field Image Super-Resolution Challenge, our submissions rank 3rd on Track 1 and Track 3 and 4th on Track 2. Architecture-evolution, channel-width, and inference analyses further support the effectiveness of diagonal EPI modeling, directional fusion, and the lightweight design.
- Abstract(参考訳): 光電場(LF)画像の超解像効果は、線傾斜が明確に相違をコードするエピポーラ平面画像(EPIs)から得られる。
しかし、トランスフォーマーをベースとした既存のLF SR法は、主に水平と垂直の EPI に対応しており、対角線エピポーラ幾何学は未探索のままである。
GTFは水平,垂直,45度,135度のEPIを一元的にモデル化した全方位EPI変換器である。
GTFは、指向性EPI処理、MacPIベースの事前注入、適応指向性融合、およびLF幾何をよりうまく活用するための位相保存フィードフォワードネットワークを組み合わせる。
NTIRE 2026の忠実度トラックでは、GTFをメインモデルとし、軽量のGTF-Tinyは効率トラックをターゲットにしている。
実写シーンと合成シーンの両方をカバーする5つの標準LF SRベンチマークでは、GTFは推論時間拡張なしで32.78dBに達し、EPSWとテスト時間拡張による推論設定がさらに向上した。
NTIRE 2026 の効率制約の下で、GTF-Tiny は 0.915M パラメータと 19.81 GFLOP しか持たない 32.57 dB に達した。
NTIRE 2026 Light Field Image Super-Resolution Challengeでは、トラック1で3位、トラック2で3位、トラック2で4位にランクインした。
アーキテクチャ進化、チャネル幅、推論分析は、対角形EPIモデリング、方向融合、軽量設計の有効性をさらに支援している。
関連論文リスト
- $D^3$-RSMDE: 40$\times$ Faster and High-Fidelity Remote Sensing Monocular Depth Estimation [72.9912717963138]
リモートセンシング画像からのリアルタイムで高忠実な単眼深度推定は、多くのアプリケーションにとって不可欠である。
視覚変換器(ViT)のバックボーンを高密度な予測に使用するのは速いが、知覚品質は低いことが多い。
リモートセンシング単眼深度推定のための深度詳細拡散法(D3$-RSMDE)を提案する。
D3$-RSMDEは、Learninged Perceptual Image Patch similarity (LPIPS)の知覚距離を11.85%削減する。
論文 参考訳(メタデータ) (2026-03-17T10:50:36Z) - Alternating Gradient Flow Utility: A Unified Metric for Structural Pruning and Dynamic Routing in Deep Networks [52.153950303594684]
交互勾配流(Alternating Gradient Flow, AGF)に着想を得た非結合型運動パラダイムを提案する。
AGFはネットワークの構造的「運動ユーティリティ」を正確にキャプチャする
我々は、AGFに誘導されるオフライン構造探索を、ゼロコストの物理プリミティブを介してオンライン実行から切り離すハイブリッドルーティングフレームワークを設計する。
論文 参考訳(メタデータ) (2026-03-12T18:19:21Z) - Enhancing Underwater Light Field Images via Global Geometry-aware Diffusion Process [93.00033672476206]
GeoDiff-LFは、SD-Turbo上に構築された新しい拡散ベースのフレームワークで、水中4次元LFイメージングを強化する。
拡散先行とLF幾何を統合することにより、GeoDiff-LFは水中のシーンにおける色歪みを効果的に緩和する。
論文 参考訳(メタデータ) (2026-01-29T02:27:22Z) - REL-SF4PASS: Panoramic Semantic Segmentation with REL Depth Representation and Spherical Fusion [9.487755927754952]
REL-SF4PASSは、人気のあるベンチマークであるStanford2D3D Panoramicデータセットのパフォーマンスと堅牢性を大幅に改善する。
3つの折り目で平均mIoUが2.35%向上し、3D乱れに直面すると、性能のばらつきが約70%減少する。
論文 参考訳(メタデータ) (2026-01-23T14:33:49Z) - Physics-Inspired Modeling and Content Adaptive Routing in an Infrared Gas Leak Detection Network [19.83756107644484]
赤外線ガス漏れを検出する物理エッジハイブリッドガスダイナミックルーティングネットワーク(PEG-DRNet)を提案する。
PEG-DRNetは、精度と計算効率の最良のバランスで、より優れた全体的な性能を達成する。
論文 参考訳(メタデータ) (2025-12-29T06:28:20Z) - DEFT: Differentiable Automatic Test Pattern Generation [2.5544566098297397]
DEFT(Disfferentiable Automatic Test Pattern Generation)は、離散ATPG問題を連続最適化タスクとして再構成する新しいATPG手法である。
HTDの障害検出を21.1%改善し、同じパターン予算のランタイムで平均48.9%向上した。
これらの結果から、DEFTは有望で効果的なATPGエンジンであり、既存のATPGエンジンを補完する価値があることが示された。
論文 参考訳(メタデータ) (2025-12-26T16:47:59Z) - High-resolution Photo Enhancement in Real-time: A Laplacian Pyramid Network [73.19214585791268]
本稿では,LLF-LUT++と呼ばれるピラミッドネットワークについて紹介する。
具体的には,ダウンサンプリング画像のグローバル音節特性を活かした画像適応型3D LUTを利用する。
LLF-LUT++は、HDR+データセット上でPSNRが2.64dB改善されただけでなく、4K解像度の画像を1つのGPUでわずか13msで処理することで、さらに削減されている。
論文 参考訳(メタデータ) (2025-10-13T16:52:32Z) - LGFN: Lightweight Light Field Image Super-Resolution using Local Convolution Modulation and Global Attention Feature Extraction [5.461017270708014]
本稿では,LGFN という軽量なモデルを提案する。このモデルでは,異なるビューの局所的特徴とグローバル的特徴と,LF 画像 SR のための異なるチャネルの特徴を統合している。
我々のモデルは0.45Mのパラメータと19.33GのFLOPを持つ。
論文 参考訳(メタデータ) (2024-09-26T11:53:25Z) - Diffusion-based Light Field Synthesis [50.24624071354433]
LFdiffは、LF合成に適した拡散ベースの生成フレームワークである。
本稿では,遠絡型雑音推定ネットワークDistgUnetを提案する。
広範囲な実験により、LFdiffは視覚的に快く、不均一に制御可能な光電場を合成する際に優れていることが示されている。
論文 参考訳(メタデータ) (2024-02-01T13:13:16Z) - Global Vision Transformer Pruning with Hessian-Aware Saliency [93.33895899995224]
この研究はヴィジュアルトランスフォーマー(ViT)モデルの共通設計哲学に挑戦する。
遅延を意識した規則化による直接遅延低減を実現し,すべての層や構造に匹敵する新しいヘッセン型構造解析基準を導出する。
DeiT-Baseモデルで反復的なプルーニングを実行すると、NViT(Novel ViT)と呼ばれる新しいアーキテクチャファミリが生まれ、パラメータをより効率的に利用する新しいパラメータが現れる。
論文 参考訳(メタデータ) (2021-10-10T18:04:59Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。