論文の概要: JLD: Perceptual Distance Through A Jacobian Lens
- arxiv url: http://arxiv.org/abs/2610.05967v1
- Date: Mon, 05 Oct 2026 08:18:37 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-10 02:48:51.376588
- Title: JLD: Perceptual Distance Through A Jacobian Lens
- Title(参考訳): JLD:ジャコビアンレンズによる知覚距離
- Abstract要約: 人間のラベルではなく、凍結した視覚エンコーダから知覚幾何学を導出するヤコビアンレンズディスタンスを導入する。
4つの標準的な知覚データベースの中で、JLDは最先端のパフォーマンスを達成し、LPIPS、disTS、PieAPP、DreamSimを一貫して上回っている。
また、JLDは画像解像度の変化に対して堅牢であり、TID2013では、解像度が2倍になった時点でレンズ長相関はほとんど変化せず、0.850から0.845までしか減少しない。
- 参考スコア(独自算出の注目度): 30.48963330093841
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Image compression, restoration, and generation all require a way to measure how different two images look to a person. Pixel error ignores how people see, while the most accurate perceptual distances are typically fitted to human judgments, tying them to a fixed data and resolution. For example, when image resolution is doubled, the correlation of DISTS with human scores on TID2013 drops from 0.815 to 0.717. We introduce the Jacobian Lens Distance (JLD), which derives its perceptual geometry from a frozen vision encoder rather than from human labels. JLD combines the locality of early patch features with the perceptual sensitivity captured by later encoder representations. Specifically, we use the encoder Jacobian to identify directions in the early feature space that most strongly affect the encoder output, producing a fixed metric tensor, $E[J^\top J]$, which we call the Jacobian lens. The lens is fitted only once from 100 unlabeled images, taking about 35 seconds. Locally, this construction defines a pullback metric in pixel space, giving JLD a clear geometric interpretation that can be directly analyzed on real images. Across four standard perceptual databases, JLD achieves state-of-the-art performance and consistently outperforms LPIPS, DISTS, PieAPP, and DreamSim. JLD is also robust to changes in image resolution, on TID2013, its lens-term correlation remains nearly unchanged when the resolution is doubled, decreasing only from 0.850 to 0.845. We further introduce JLD-fast, which is $4\times$ faster than LPIPS-VGG while achieving a mean correlation of 0.911. Finally, JLD naturally extends to video, reaching a correlation of 0.786 on Waterloo IVC 4K compared with 0.611 for VMAF.
- Abstract(参考訳): 画像の圧縮、復元、生成は、それぞれ異なる2つの画像が人に対してどのように見えるかを測定する方法を必要とする。
ピクセルエラーは人々の視線を無視するが、最も正確な知覚距離は人間の判断に当てはまる。
例えば、画像解像度が倍になった場合、TID2013におけるDITSと人間のスコアの相関は0.815から0.717に低下する。
人間のラベルではなく、凍結した視覚エンコーダから知覚幾何学を導出するジャコビアンレンズ距離(JLD)を導入する。
JLDは初期パッチ機能の局所性と、後続のエンコーダ表現によってキャプチャされた知覚感度を組み合わせる。
具体的には、エンコーダヤコビアンを用いて、エンコーダ出力に最も強い影響を与える初期特徴空間の方向を識別し、固定計量テンソルである$E[J^\top J]$を生成し、ヤコビアンレンズと呼ぶ。
レンズは100枚の未表示画像から1回だけ取り付けられ、約35秒かかる。
局所的に、この構成はピクセル空間におけるプルバック計量を定義し、JLDは実画像上で直接解析できる明確な幾何学的解釈を与える。
4つの標準的な知覚データベースの中で、JLDは最先端のパフォーマンスを達成し、LPIPS、disTS、PieAPP、DreamSimを一貫して上回っている。
また、JLDは画像解像度の変化に対して堅牢であり、TID2013では、解像度が2倍になった時点でレンズ長相関はほとんど変化せず、0.850から0.845までしか減少しない。
JLD-fastはLPIPS-VGGよりも4\times$速いが、平均相関は0.911である。
最後に、JLDはビデオに自然に拡張され、Waterloo IVC 4Kでは0.786、VMAFでは0.611となる。
関連論文リスト
- Corrupted but Correct: Why Vision-Language Models Lie to Themselves Internally [0.713496583173065]
目標摂動は、固定された目標キャプションに対する教師による訓練損失を、視覚シリアルモデル(VLM)のほぼゼロに駆動することができる。
我々はこの解離を列車/干渉ギャップと呼び、Qwen2.5-VL-7B-Instructの正確な機械的説明を与える。
論文 参考訳(メタデータ) (2026-10-02T15:27:28Z) - Rethinking Generative Image Compression at Extremely Low Bitrates [56.035931340138006]
本稿では、圧縮された表現とソース表現を直接アライメントする表現オートエンコーダ(RAE)空間上に構築された圧縮指向拡散(CoD)であるRAE-CoDを紹介する。
5つの視覚基盤モデル(VFM)と視覚言語モデルプロトコルを用いて,この枠組みを評価する。
論文 参考訳(メタデータ) (2026-09-30T08:53:11Z) - LeVJEPA: Efficient & Scalable Video Pretraining without the Heuristics [50.45297537821907]
我々はLeJEPAの崩壊のない目的の下で訓練された最初のビデオエンコーダLeVJEPAを紹介する。
単一のエンコーダは、クリップのグローバルおよびローカルビューよりも分散損失で訓練される。
LeVJEPAはV-JEPA 2とVT-S/B/Lの5.6から20.8倍の速さで一致または超える。
論文 参考訳(メタデータ) (2026-08-27T17:26:24Z) - Self-Calibrating Dense Displacement Fields for Reliable Co-Registration of Large Optical Satellite Imagery [4.730120849611304]
共同登録は、光学衛星画像の時間・マルチセンサー利用のほぼすべての基盤となる。
SCDF, トレーニング不要なGPUフリーな推定器で, 動きモデル自体が画素あたりの高密度変位場である。
実際のSentinel Landsat-8/9とNAIP画像から構築された584基の地上トラスペアでは、SCDFは故障のない全てのペアを登録する。
論文 参考訳(メタデータ) (2026-08-23T08:50:59Z) - Parameter-Efficient Architectural Modifications for Translation-Invariant CNNs [2.111646739533638]
畳み込みニューラルネットワーク(CNN)は、翻訳不変であると広く考えられているが、標準的なアーキテクチャは驚くべき脆弱性を示している。
我々は,グローバル平均プール層を様々なネットワーク深度に戦略的に挿入し,軽量な「オンラインアーキテクチャ」戦略を提案する。
この戦略は、トレーニング可能なパラメータ(5.2Mから82Kまで)の98%の大幅な削減と、ネットワークサイズ全体の90%の削減を実現している。
論文 参考訳(メタデータ) (2026-04-30T13:52:42Z) - WEBEYETRACK: Scalable Eye-Tracking for the Browser via On-Device Few-Shot Personalization [3.884714448890651]
We bEyeTrackは軽量なSOTA視線推定モデルをブラウザに直接統合するフレームワークです。
モデルベースの頭部ポーズ推定と、デバイス上でのいくつかのショット学習と、9つのキャリブレーションサンプルが組み込まれている。
WebEyeTrackは新しいユーザーに適応し、GazeCaptureでエラーマージンが2.32cm、iPhone 14で2.4ミリ秒のリアルタイム推論速度でSOTAのパフォーマンスを達成する。
論文 参考訳(メタデータ) (2025-08-27T03:38:58Z) - MirrorCalib: Utilizing Human Pose Information for Mirror-based Virtual Camera Calibration [3.776930498297967]
本稿では,鏡を用いたエクササイズビデオにおいて,実際のカメラと比較して仮想カメラのパラメータを推定する新しいタスクを提案する。
人体と2次元関節位置の事前知識を用いて、カメラ外在パラメータを推定する。
MirrorCalibは、実世界のデータセットで1.82degの回転誤差と69.51mmの翻訳誤差を達成する。
論文 参考訳(メタデータ) (2023-11-05T23:25:21Z) - PixelFolder: An Efficient Progressive Pixel Synthesis Network for Image
Generation [88.55256389703082]
Pixelは画像生成のための有望な研究パラダイムである。
本稿では,Pixel のような効率的な画像生成に向けたプログレッシブピクセル合成ネットワークを提案する。
Pixelは支出を大幅に減らし、2つのベンチマークデータセットで新しい最先端(SOTA)パフォーマンスを得る。
論文 参考訳(メタデータ) (2022-04-02T10:55:11Z) - Feature Space Targeted Attacks by Statistic Alignment [74.40447383387574]
特徴空間ターゲットは、中間特徴写像を変調して摂動画像を攻撃する。
画素ワイドユークリッド距離の現在の選択は、ソースとターゲットの特徴に不合理に空間整合性制約を課すため、不一致を測定することが疑問視されている。
本稿では,Pair-wise Alignment AttackとGlobal-wise Alignment Attackという2つの新しい手法を提案する。
論文 参考訳(メタデータ) (2021-05-25T03:46:39Z) - PANDA: A Gigapixel-level Human-centric Video Dataset [74.12377583050142]
大規模・長期・多目的視覚分析のための,最初のギガPixelレベルのフガン中心のViDeo dAtasetであるPANDAを提示する。
PANDAのビデオは、ギガピクセルのカメラで撮影され、広い視野と高解像度の細部の両方で現実世界のシーンをカバーしている。
PANDAは15,974.6kのバウンディングボックス、111.8kの微粒な属性ラベル、12.7kの軌道、2.2kのグループ、2.9kの相互作用を含む、リッチで階層的な基底構造アノテーションを提供する。
論文 参考訳(メタデータ) (2020-03-10T16:58:32Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。