論文の概要: Naturalness Predicts but Does Not Cause Transferability in Image Encodings of Real-World Streams
- arxiv url: http://arxiv.org/abs/2606.25844v1
- Date: Wed, 24 Jun 2026 13:57:43 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-25 17:05:30.35349
- Title: Naturalness Predicts but Does Not Cause Transferability in Image Encodings of Real-World Streams
- Title(参考訳): 実世界ストリームの画像符号化における自然性予測
- Abstract要約: 一般的な慣行では、1次元の信号を画像に変換して、自然写真に予め訓練された視覚バックボーンを認識のために再利用する。
符号化された画像の視覚的自然度が、凍結したバックボーンの下での転送精度とどのように関係しているかを問う。
- 参考スコア(独自算出の注目度): 0.2864713389096699
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: A common practice converts a one-dimensional signal into an image so that a vision backbone pretrained on natural photographs can be reused for recognition, yet the encoded image is rarely examined. We ask how the visual naturalness of an encoded image relates to its transfer accuracy under a frozen backbone. We build WorldStream, a corpus of 299 heterogeneous current-value series from key-free public APIs (weather, air quality, earthquakes, gold and oil, equities, crypto, foreign exchange, web activity and space weather), with a nine-way source-recognition task over 3143 temporally split windows. Across seven encodings and six frozen backbones, the Frechet distance of an encoding to natural images (FID) predicts its accuracy: Spearman $ρ=-0.72$. Two controlled interventions show this is not causal in the spectrum. Our invertible encoder has a single adjustable part, a spectral exponent $β$ (power $\propto |f|^{-β}$); varying $β$ moves the image toward or away from the natural-image manifold at fixed content. FID is lowest near the natural value $β\approx 2$, but frozen accuracy stays flat and far below the structured baselines (19.2% vs. 73.0%), and FID and accuracy are only weakly related over the sweep (Pearson $-0.32$). A second intervention, phase scrambling, holds the power spectrum exactly fixed while removing local structure; now FID and accuracy fall together (Pearson $-0.89$). The cross-encoding correlation is thus mediated by local structure, not spectral naturalness: FID predicts accuracy because Inception reads the same structure the backbones do. Full fine-tuning does not close the gap (27% vs. 67%), so the deficit is structural. The encoder is exactly invertible, recovering the signal from the 8-bit image at 72.9 dB, so the image doubles as a lossless record of the data.
- Abstract(参考訳): 一般的な慣行では、1次元の信号を画像に変換して、自然写真に事前訓練された視覚バックボーンを認識に再利用することができるが、符号化された画像はほとんど検査されない。
符号化された画像の視覚的自然度が、凍結したバックボーンの下での転送精度とどのように関係しているかを問う。
Weather, air quality, earthquakes, gold and oil, equities, crypto, foreign exchange, web activity and space weather)というキーフリーの公開APIから、299個の異種電流値のコーパスを構築する。
7つのエンコーディングと6つの冷凍バックボーンで、自然な画像(FID)へのエンコーディングのフレシェ距離はその精度を予測する。
2つの制御された介入は、スペクトルに因果関係がないことを示している。
我々の可逆エンコーダは1つの調整可能な部分を持ち、スペクトル指数$β$ (power $\propto |f|^{-β}$) である。
FID は自然値 $β\approx 2$ に最も近いが、凍結された精度は構造されたベースライン(19.2% 対 73.0% )よりずっと低く保たれ、FID と精度はスイープ上で弱い関係にある(ピアソン$-0.32$)。
第2の介入、位相スクランブルは、局所構造を除去しながら、パワースペクトルを正確に固定し、FIDと精度は共に低下する(ピアソン$-0.89$)。
FIDは、インセプションがバックボーンと同じ構造を読み取るため、精度を予測する。
完全な微調整はギャップを埋めない(27%対67%)ため、欠陥は構造的だ。
エンコーダは正確には可逆であり、8ビット画像からの信号を72.9dBで回復するので、画像はデータのロスレス記録として2倍になる。
関連論文リスト
- Disparity Has a Sign: Stereo Matching Beyond the Zero-Disparity Plane [52.210414985125816]
立体視内容が、負の相違に対応するゼロの相違面の背後にある物体をどう含んでいるかを示す。
撮影者が作成した7本の公開映画から21,495ドルのステレオペアのベンチマークである textitZDPShift を提案する。
同じシーンコンテンツでは、ファンデーションは25.24ドルEPEから75.33ドルpxに上昇し、すべてのバックボーンが3ピクセルの差分誤差を超えるピクセルの約半分を残している。
論文 参考訳(メタデータ) (2026-09-06T19:58:35Z) - LeVJEPA: Efficient & Scalable Video Pretraining without the Heuristics [50.45297537821907]
我々はLeJEPAの崩壊のない目的の下で訓練された最初のビデオエンコーダLeVJEPAを紹介する。
単一のエンコーダは、クリップのグローバルおよびローカルビューよりも分散損失で訓練される。
LeVJEPAはV-JEPA 2とVT-S/B/Lの5.6から20.8倍の速さで一致または超える。
論文 参考訳(メタデータ) (2026-08-27T17:26:24Z) - SpreadMark: Robust Image Watermarking via Spread-Spectrum Embedding [35.24760637584417]
古典的な透かし原理である拡散スペクトル埋め込みを、現代のニューラルなポストホット透かしアーキテクチャの中で再検討する。
既存のエンコーダデコーダでは、各メッセージビットが画像のごく一部を占める。
SpreadMarkは、各ビットを画像全体に密度の高い擬似ランダムコードワードとして展開し、学習した隠蔽チップ表現にマッチしたフィルタリングによってそれを復元する。
論文 参考訳(メタデータ) (2026-08-04T05:52:17Z) - A High-Accuracy Optical Music Recognition Method Based on Bottleneck Residual Convolutions [0.036971941442545786]
光音楽認識は、印刷または手書きの楽譜画像を編集可能な記号表現に変換することを目的としている。
本稿では、残差ボトルネック畳み込みと双方向ゲート再帰ユニット(BiGRU)に基づくシーケンスモデリングを組み合わせたエンドツーエンドのOMRフレームワークを提案する。
Camera-PrIMuSとPrIMuSデータセットの実験結果から,提案フレームワークの有効性が示された。
論文 参考訳(メタデータ) (2026-04-07T14:32:16Z) - Representation Alignment for Just Image Transformers is not Easier than You Think [25.669017380539064]
Representation Alignment (REPA) は、潜時空間における拡散変換器の訓練を加速する簡単な方法として登場した。
本稿では、Just Image Transformers (JiT) に対してREPAがフェール可能であることを示す。
我々は,Masked Transformer Adapter を用いてアライメントターゲットと制約アライメントを変換する PixelREPA を提案する。
論文 参考訳(メタデータ) (2026-03-15T13:08:31Z) - Rapid Salient Object Detection with Difference Convolutional Neural Networks [49.838283141381716]
本稿では,資源制約のあるデバイスにSODをリアルタイムに展開する上での課題について述べる。
SODにおける従来の知恵と現代のCNNの表現力を組み合わせたネットワーク設計を提案する。
論文 参考訳(メタデータ) (2025-07-01T20:41:05Z) - Improving the Diffusability of Autoencoders [54.920783089085035]
高品質な画像やビデオを生成するための主要なアプローチとして、潜伏拡散モデルが登場している。
我々は、現代のオートエンコーダのスペクトル分析を行い、その潜在空間における不規則な高周波成分を同定する。
我々は、この高周波成分が拡散合成プロセスの粗大な微細な性質に干渉し、生成品質を阻害する仮説を立てた。
論文 参考訳(メタデータ) (2025-02-20T18:45:44Z) - Global Context Aggregation Network for Lightweight Saliency Detection of
Surface Defects [70.48554424894728]
我々は,エンコーダ・デコーダ構造上の表面欠陥を簡易に検出するためのGCANet(Global Context Aggregation Network)を開発した。
まず、軽量バックボーンの上部層に新しいトランスフォーマーエンコーダを導入し、DSA(Depth-wise Self-Attention)モジュールを通じてグローバルなコンテキスト情報をキャプチャする。
3つの公開欠陥データセットの実験結果から,提案したネットワークは,他の17の最先端手法と比較して,精度と実行効率のトレードオフを良好に達成できることが示された。
論文 参考訳(メタデータ) (2023-09-22T06:19:11Z) - Why Accuracy Is Not Enough: The Need for Consistency in Object Detection [3.1320553947135203]
現代のオブジェクト検出器の一貫性は、異なるビデオデータセット上で83.2%から97.1%の範囲である。
WEBP画像圧縮やUnsharp Maskingなどの画像歪み補正を適用することで、一貫性を最大5.1%向上させることができる。
論文 参考訳(メタデータ) (2022-07-28T05:51:18Z) - Stereoscopic Universal Perturbations across Different Architectures and
Datasets [60.021985610201156]
本研究では,画像の逆摂動が不均一性推定タスクの深部ステレオマッチングネットワークに与える影響について検討する。
本稿では,データセット内の任意のステレオ画像対に追加されると,ステレオネットワークを騙すことのできる,単一の摂動セットを構築する方法を提案する。
我々の摂動は、最先端のステレオネットワークのD1エラーを1%から87%に増やすことができる。
論文 参考訳(メタデータ) (2021-12-12T02:11:31Z) - Rethinking and Improving Relative Position Encoding for Vision
Transformer [61.559777439200744]
リレーショナル位置符号化(RPE)は、トランスフォーマーが入力トークンのシーケンス順序をキャプチャする上で重要である。
画像RPE(iRPE)と呼ばれる2次元画像専用の新しい相対的位置符号化法を提案する。
論文 参考訳(メタデータ) (2021-07-29T17:55:10Z) - Synthetic Image Augmentation for Damage Region Segmentation using
Conditional GAN with Structure Edge [0.0]
画像から画像への変換マッピングを用いて、損傷画像を生成する合成拡張手法を提案する。
我々は,FCN-8s,SegNet,DeepLabv3+Xception-v2などの画素ごとのセグメンテーションアルゴリズムを適用した。
合成拡張法で加算されたデータセットの再トレーニングは、平均IoU、興味の損傷領域IoU、精度、リコール、BFスコアに基づいて、テスト画像の予測時に精度が高くなることを示した。
論文 参考訳(メタデータ) (2020-05-07T06:04:02Z) - Pretraining Image Encoders without Reconstruction via Feature Prediction
Loss [0.1529342790344802]
本研究では,画像エンコーダのオートエンコーダによる事前学習における損失を計算する3つの手法について検討する。
損失ネットワークの特徴を復号化することを提案する。
論文 参考訳(メタデータ) (2020-03-16T21:08:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。