論文の概要: From Phase to Phenomenon: Self-Supervised Learning of Subsurface Scattering with Minimal Phase-shift Inputs
- arxiv url: http://arxiv.org/abs/2606.29461v1
- Date: Sun, 28 Jun 2026 15:32:40 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-30 18:07:15.918944
- Title: From Phase to Phenomenon: Self-Supervised Learning of Subsurface Scattering with Minimal Phase-shift Inputs
- Title(参考訳): 位相から現象へ:最小位相シフト入力による地下散乱の自己教師付き学習
- Authors: Arjun Majumdar, Raphael Braun, Andreas Engelhardt, Hendrik PA. Lensch,
- Abstract要約: 本稿では,最小限の入力から地下散乱(SSS)光輸送表現を学習するための自己教師付き事前学習フレームワークを提案する。
本手法では,8つの位相シフトプロファイロメトリ(PSP)画像のみを表示できるステレオプロジェクタ・カメラのセットアップを利用する。
我々は,PSPベースのSSSデータに対する調整された拡張戦略を導入し,SSLプリトレーニングのための標準イメージNetスタイルの強化よりも大幅に優れていることを示す。
- 参考スコア(独自算出の注目度): 14.024934760886298
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: We propose a self-supervised pretraining framework for learning sub-surface scattering (SSS) light transport representations from minimal input. Our method leverages a stereo projector-camera setup that captures only eight high-frequency phase-shift profilometry (PSP) images per view to pretrain an encoder in a multi-view, multi-object setting. We introduce a tailored augmentation strategy for PSP-based SSS data, and show that it significantly outperforms standard ImageNet-style augmentations for SSL pretraining. The pretrained encoder learns generalizable SSS representations that transfer effectively to downstream tasks, including spatially varying relighting and representation evaluation using a kNN classifier. Combined with a decoder, the model reconstructs dense scattering footprint responses, trained using a dedicated cost function that improves accuracy, particularly for anisotropic footprints. Despite using only eight input images per view, our approach generalizes to unseen objects with complex geometry and material properties, achieving high-fidelity reconstructions while requiring orders of magnitude fewer images than prior methods.
- Abstract(参考訳): 本稿では,最小限の入力から地下散乱(SSS)光輸送表現を学習するための自己教師付き事前学習フレームワークを提案する。
本手法では,高周波位相シフトプロファイロメトリ (PSP) 画像が8つしかないステレオプロジェクタ・カメラを用いて,マルチビュー・マルチオブジェクト設定でエンコーダを事前訓練する。
我々は,PSPベースのSSSデータに対する調整された拡張戦略を導入し,SSLプリトレーニングのための標準イメージNetスタイルの強化よりも大幅に優れていることを示す。
予め訓練されたエンコーダは、kNN分類器を用いて、空間的に変化するリライトや表現評価を含む下流タスクに効果的に転送する一般化可能なSSS表現を学習する。
デコーダと組み合わせることで、特に異方性フットプリントの精度を向上させる専用のコスト関数を使用して、密度の低い散乱フットプリント応答を再構成する。
1ビューあたりの入力画像は8枚に過ぎなかったが、複雑な幾何学と材料特性を持つオブジェクトに一般化し、従来手法よりも桁違いに少ない画像を必要とする高忠実度再構成を実現した。
関連論文リスト
- SIGMAE: A Spectral-Index-Guided Foundation Model for Multispectral Remote Sensing [43.39478017496301]
Masked Autoencoder (MAE) ベースの事前訓練は、マスク付き画像領域を再構成することで、一般的な特徴表現を学習する強力な能力である。
多スペクトルリモートセンシング画像へのMAEの適用は、複雑な背景、不明瞭なターゲット、マスキング中の意味的ガイダンスの欠如など、依然として困難である。
SIGMAEは、ドメイン固有のスペクトル指標を事前知識として組み込んで、動的トークンマスキングを情報領域へ導く。
論文 参考訳(メタデータ) (2026-03-08T04:55:41Z) - Wavelet-Driven Masked Image Modeling: A Path to Efficient Visual Representation [27.576174611043367]
Masked Image Modeling (MIM)は、下流タスクに適したスケーラブルな視覚表現を学習する能力のおかげで、自己教師付き学習において大きな注目を集めている。
しかし、画像は本質的に冗長な情報を含んでいるため、画素ベースのMIM再構成プロセスはテクスチャなどの細部に過度に集中し、不要なトレーニング時間を延ばすことになる。
本研究では,MIMの学習過程を高速化するために,ウェーブレット変換を効率的な表現学習のツールとして活用する。
論文 参考訳(メタデータ) (2025-03-02T08:11:26Z) - Hyper-VolTran: Fast and Generalizable One-Shot Image to 3D Object
Structure via HyperNetworks [53.67497327319569]
画像から3Dまでを1つの視点から解く新しいニューラルレンダリング手法を提案する。
提案手法では, 符号付き距離関数を表面表現として使用し, 幾何エンコードボリュームとハイパーネットワークスによる一般化可能な事前処理を取り入れた。
本実験は,一貫した結果と高速な生成による提案手法の利点を示す。
論文 参考訳(メタデータ) (2023-12-24T08:42:37Z) - FocDepthFormer: Transformer with latent LSTM for Depth Estimation from Focal Stack [11.433602615992516]
本稿では,トランスフォーマーをLSTMモジュールとCNNデコーダと統合した新しいトランスフォーマーネットワークFocDepthFormerを提案する。
LSTMを組み込むことで、FocDepthFormerは大規模な単分子RGB深さ推定データセットで事前トレーニングすることができる。
我々のモデルは、複数の評価指標で最先端のアプローチより優れています。
論文 参考訳(メタデータ) (2023-10-17T11:53:32Z) - Scale Attention for Learning Deep Face Representation: A Study Against
Visual Scale Variation [69.45176408639483]
我々はスケール空間理論に頼って凸層を再構築する。
我々はSCale AttentioN Conv Neural Network(textbfSCAN-CNN)という新しいスタイルを構築した。
単発方式として、推論はマルチショット融合よりも効率的である。
論文 参考訳(メタデータ) (2022-09-19T06:35:04Z) - DynaST: Dynamic Sparse Transformer for Exemplar-Guided Image Generation [56.514462874501675]
本稿では,動的スパースアテンションに基づくトランスフォーマーモデルを提案する。
このアプローチの核心は、ある位置がフォーカスすべき最適なトークン数の変化をカバーすることに特化した、新しいダイナミックアテンションユニットです。
3つの応用、ポーズ誘導型人物画像生成、エッジベース顔合成、歪みのない画像スタイル転送の実験により、DynaSTは局所的な詳細において優れた性能を発揮することが示された。
論文 参考訳(メタデータ) (2022-07-13T11:12:03Z) - Modeling Image Composition for Complex Scene Generation [77.10533862854706]
本稿では,レイアウト・ツー・イメージ生成タスクにおける最先端結果を実現する手法を提案する。
本稿では,RGB画像をパッチトークンに圧縮した後,オブジェクト・トゥ・オブジェクト,オブジェクト・トゥ・パッチ,パッチ・トゥ・パッチの依存関係を探索するTransformer with Focal Attention (TwFA)を提案する。
論文 参考訳(メタデータ) (2022-06-02T08:34:25Z) - Multiscale Convolutional Transformer with Center Mask Pretraining for
Hyperspectral Image Classificationtion [14.33259265286265]
本稿では,空間スペクトル情報の効率的な抽出を実現するために,高スペクトル画像(HSI)のための高速多スケール畳み込みモジュールを提案する。
マスクオートエンコーダと同様に、我々の事前学習法は、エンコーダ内の中央画素の対応するトークンのみをマスクし、残りのトークンをデコーダに入力し、中央画素のスペクトル情報を再構成する。
論文 参考訳(メタデータ) (2022-03-09T14:42:26Z) - Less is More: Pay Less Attention in Vision Transformers [61.05787583247392]
注意の少ないvIsion Transformerは、畳み込み、完全接続層、自己アテンションが、画像パッチシーケンスを処理するためにほぼ同等な数学的表現を持つという事実に基づいている。
提案したLITは、画像分類、オブジェクト検出、インスタンス分割を含む画像認識タスクにおいて有望な性能を達成する。
論文 参考訳(メタデータ) (2021-05-29T05:26:07Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。