論文の概要: Adaptive Radial Projection on Fourier Magnitude Spectrum for Document Image Skew Estimation
- arxiv url: http://arxiv.org/abs/2603.05942v1
- Date: Fri, 06 Mar 2026 06:20:41 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-09 13:17:45.181923
- Title: Adaptive Radial Projection on Fourier Magnitude Spectrum for Document Image Skew Estimation
- Title(参考訳): 文書画像スキュー推定のためのフーリエマグニチュードスペクトルの適応的放射射影
- Abstract要約: まず、与えられた文書画像の主軸スキュー角を抽出する新しいスキュー推定法を提案する。
本研究では,異なる推定器の性能を評価するために,高品質なスキュー推定データセットdisE-2021を提案する。
その結果,提案手法は頑健で信頼性が高く,比較手法のすべてに優れることがわかった。
- 参考スコア(独自算出の注目度): 0.2624902795082451
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Skew estimation is one of the vital tasks in document processing systems, especially for scanned document images, because its performance impacts subsequent steps directly. Over the years, an enormous number of researches focus on this challenging problem in the rise of digitization age. In this research, we first propose a novel skew estimation method that extracts the dominant skew angle of the given document image by applying an Adaptive Radial Projection on the 2D Discrete Fourier Magnitude spectrum. Second, we introduce a high quality skew estimation dataset DISE-2021 to assess the performance of different estimators. Finally, we provide comprehensive analyses that focus on multiple improvement aspects of Fourier-based methods. Our results show that the proposed method is robust, reliable, and outperforms all compared methods. The source code is available at https://github.com/phamquiluan/jdeskew.
- Abstract(参考訳): スキュー推定は文書処理システム、特にスキャンされた文書画像において重要なタスクの1つである。
何年にもわたって、デジタル化時代の台頭において、この困難な問題に焦点が当てられている研究は膨大な数ある。
本研究では,まず,2次元離散フーリエマグニチュードスペクトルに適応放射射影を適用することで,与えられた文書画像の主スキュー角を抽出する新しいスキュー推定法を提案する。
第2に、異なる推定器の性能を評価するために、高品質なスキュー推定データセットdisE-2021を導入する。
最後に,フーリエ法の改良点に着目した包括的分析を行った。
その結果,提案手法は頑健で信頼性が高く,比較手法のすべてに優れることがわかった。
ソースコードはhttps://github.com/phamquiluan/jdeskew.comで入手できる。
関連論文リスト
- From Editor to Dense Geometry Estimator [77.21804448599009]
密度幾何予測のための拡散変換器(DiT)アーキテクチャに基づく高度な編集モデルを適用するフレームワークである textbfFE2E を紹介する。
FE2EはETH3Dデータセットで35%以上のパフォーマンス向上を実現し、100$times$データでトレーニングされたDepthAnythingシリーズを上回っている。
論文 参考訳(メタデータ) (2025-09-04T15:58:50Z) - PF3plat: Pose-Free Feed-Forward 3D Gaussian Splatting [54.7468067660037]
PF3platは、設計選択を検証した包括的なアブレーション研究によってサポートされた、すべてのベンチマークに新しい最先端を設定します。
本フレームワークは,3DGSの高速,スケーラビリティ,高品質な3D再構成とビュー合成機能を活用している。
論文 参考訳(メタデータ) (2024-10-29T15:28:15Z) - Robust Two-View Geometry Estimation with Implicit Differentiation [2.048226951354646]
本稿では,新しい2次元幾何推定フレームワークを提案する。
これは微分可能なロバスト損失関数のフィッティングに基づいている。
本研究では,屋外シナリオと屋内シナリオの両方において,カメラポーズ推定タスクに対するアプローチを評価する。
論文 参考訳(メタデータ) (2024-10-23T15:51:33Z) - Rethinking Score Distillation as a Bridge Between Image Distributions [97.27476302077545]
提案手法は, 劣化した画像(ソース)を自然画像分布(ターゲット)に転送することを目的としている。
本手法は,複数の領域にまたがって容易に適用可能であり,特殊な手法の性能のマッチングや評価を行うことができる。
テキストから2D、テキストベースのNeRF最適化、絵画を実画像に変換すること、光学錯視生成、および3Dスケッチから実画像に変換することにおいて、その実用性を実証する。
論文 参考訳(メタデータ) (2024-06-13T17:59:58Z) - On the representation and methodology for wide and short range head pose
estimation [48.87319013701136]
頭部ポーズ推定(HPE)はコンピュータビジョンにおける問題である。
近年の応用には、全360度回転範囲の顔の分析が必要である。
半フロントケースとプロファイルケースを解く従来のアプローチは、フルローテーションケースには直接適用できない。
論文 参考訳(メタデータ) (2024-01-11T10:20:37Z) - FFPN: Fourier Feature Pyramid Network for Ultrasound Image Segmentation [15.011573950064424]
超音波(US)画像セグメンテーションは多くのシナリオにおいてリアルタイムかつ高精度な解析を必要とする活発な研究領域である。
既存のアプローチは、不適切な輪郭符号化に悩まされるか、エンコードされた結果の有効活用に失敗する可能性がある。
本稿では,Fourier Feature Pyramid Network (FFPN) と呼ばれる新しいFourier-anchor-based DTSフレームワークについて述べる。
論文 参考訳(メタデータ) (2023-08-26T07:28:09Z) - Towards General Visual-Linguistic Face Forgery Detection [95.73987327101143]
ディープフェイクは現実的な顔操作であり、セキュリティ、プライバシー、信頼に深刻な脅威をもたらす可能性がある。
既存の方法は、このタスクを、デジタルラベルまたはマスク信号を使用して検出モデルをトレーニングするバイナリ分類として扱う。
本稿では, 微粒な文レベルのプロンプトをアノテーションとして用いた, VLFFD (Visual-Linguistic Face Forgery Detection) という新しいパラダイムを提案する。
論文 参考訳(メタデータ) (2023-07-31T10:22:33Z) - Differentiable Forward Projector for X-ray Computed Tomography [6.1868857343691115]
データ駆動型深層学習は、様々な計算トモグラフィー再構成問題にうまく適用されている。
本稿では,予測画像と元の計測値との整合性を確保するために,精度の高い前方・後方プロジェクションソフトウェアライブラリを提案する。
論文 参考訳(メタデータ) (2023-07-11T20:52:46Z) - Disentangled Pre-training for Image Matting [74.10407744483526]
画像マッチングは、深層モデルのトレーニングをサポートするために高品質なピクセルレベルの人間のアノテーションを必要とする。
本研究では、無限個のデータを活用する自己教師付き事前学習手法を提案し、マッチング性能を向上する。
論文 参考訳(メタデータ) (2023-04-03T08:16:02Z) - DeepRM: Deep Recurrent Matching for 6D Pose Refinement [77.34726150561087]
DeepRMは、6Dポーズ改善のための新しいリカレントネットワークアーキテクチャである。
アーキテクチャにはLSTMユニットが組み込まれ、各改善ステップを通じて情報を伝達する。
DeepRMは、2つの広く受け入れられている課題データセットで最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2022-05-28T16:18:08Z) - Learning to Recognize Patch-Wise Consistency for Deepfake Detection [39.186451993950044]
パッチワイド一貫性学習(PCL)という,このタスクのための表現学習手法を提案する。
PCLは、画像のソース機能の一貫性を測定し、複数の偽造方法に対する優れた解釈性と堅牢性で表現することを学びます。
7つの一般的なDeepfake検出データセットに対するアプローチを評価します。
論文 参考訳(メタデータ) (2020-12-16T23:06:56Z) - Deep Learning Methods For Synthetic Aperture Radar Image Despeckling: An
Overview Of Trends And Perspectives [45.87348004985991]
このようなノイズを除去し、下流の画像処理タスクの精度を向上させるために、デスペクリングは重要なタスクである。
本稿では,sarデスペックリングに適用する深層学習手法に関する文献を調査し,教師ありアプローチと近年の自己教師ありアプローチの両方をカバーする。
論文 参考訳(メタデータ) (2020-12-10T08:30:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。