論文の概要: Open Annotations and Synthetic Data for Field Localisation in Indian Bank Cheques
- arxiv url: http://arxiv.org/abs/2606.20682v1
- Date: Sun, 14 Jun 2026 02:59:51 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-26 16:11:40.827087
- Title: Open Annotations and Synthetic Data for Field Localisation in Indian Bank Cheques
- Title(参考訳): インド・バンク・チェークにおけるフィールドローカライゼーションのためのオープンアノテーションと合成データ
- Abstract要約: データセット内の112個のチェークすべてに対して、6フィールドのバウンディングボックスアノテーションをリリースします。
我々は,カットペーストパイプラインで生成した295個の完全再分配可能な合成チーク画像をリリースする。
合成データは、実際のデータだけでは測定不可能な改善をもたらす。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: Automated cheque processing requires localising key fields (date, legal amount, IFSC code, account number, signature, and payee name) before any recognition step. The IDRBT Cheque Image Dataset is, to our knowledge, the only public collection of Indian bank cheques, but it ships without field annotations and with no stated licence, so its redistribution terms are unclear. We address both limitations. First, we release six-field bounding-box annotations for all 112 cheques in the dataset, distributed annotations-only and keyed to the original filenames so that the IDRBT redistribution terms are respected. Second, we release 295 fully redistributable synthetic cheque images produced by a cut-paste pipeline that composites annotated field regions from real cheques onto content-erased, bank-specific canvas templates; because patches are pasted at their source coordinates, annotations carry forward unchanged. Third, we provide a ResNet-50 direct-regression baseline that predicts all six fields in a single forward pass, and use it for a controlled test of the synthetic data. The test is sobering: because cheque layouts are rigid, a no-learning baseline that simply predicts each field's mean training box already reaches 0.691 mean IoU and 80% accuracy at IoU >= 0.5, and once seed variance and training compute are accounted for, the cut-paste synthetic data yields no measurable improvement over real data alone (an equal-compute real-only model matches or beats the synthetic-augmented model on every aggregate metric). We report this negative result in full, since it cautions against assuming appearance-only augmentation helps fixed-layout documents and points instead to layout-varying synthesis. The annotations and synthetic images are released as reusable resources on the Hugging Face Hub under permissive licences.
- Abstract(参考訳): 自動チェーク処理では、認識ステップの前にキーフィールド(日付、法的金額、IFSCコード、アカウント番号、署名、給与名)をローカライズする必要がある。
IDRBTのCheque Image Datasetは、私たちの知る限り、インド銀行のChequeの唯一の公開コレクションですが、フィールドアノテーションなしで出荷され、ライセンスが記載されていないため、再配布条件は不明確です。
どちらの制限にも対処する。
まず、データセット内の112個のキーに対して6フィールドのバウンディングボックスアノテーションをリリースし、分散アノテーションのみを分散し、元のファイル名にキーを付けて、IDRBT再配布用語を尊重する。
第2に,カットペーストパイプラインが生成した295個の完全再配布可能な合成チーク画像を,実際のチークからバンク固有のキャンバステンプレートへの注釈付きフィールド領域を合成する。
第三に、ResNet-50直接回帰ベースラインを提供し、単一のフォワードパスで6つのフィールド全てを予測し、合成データの制御テストに使用します。
チェークレイアウトは厳密なため、各フィールドの平均トレーニングボックスは、IoU >=0.5で0.691の平均IoUと80%の精度に達しており、シード分散とトレーニング計算が説明されると、カットペースト合成データは実データ単独で測定可能な改善が得られない(同値のリアルタイムモデルが一致し、各集約メトリック上で合成強化モデルに匹敵する)。
この否定的な結果が完全に報告されるのは、外見のみの拡張がドキュメントの固定化に役立ち、レイアウトの異なる合成に代えてポイントが有効である、と警告するからである。
アノテーションと合成画像は、許容ライセンス下でHugging Face Hub上で再利用可能なリソースとしてリリースされている。
関連論文リスト
- PatchHead: Learning Spatial Patch Evidence for Generalizable AI-Generated Image Detection [6.466210485064843]
本稿では,DINOパッチトークンの2次元構造を保存し,近隣地域の証拠を統合する軽量な空間アグリゲーションヘッドであるPatchHeadを紹介する。
PatchHeadは、手動でキュレートされた9つのクロスデータセットベンチマークと、それに続く2つのデータセットで第1位、第2位である。
平均平衡精度(+3.0点)では91.6%から94.6%に改善され、最悪の場合の精度は82.4%から89.4%(+6.9点)に上昇する。
論文 参考訳(メタデータ) (2026-08-10T07:47:22Z) - Constraint-Anchored Reasoning Traces [9.39195684989942]
MLLM(Autoregressive Multimodal Large Language Model)は、ミススノーボールに悩まされる。
最先端のオープンソースMLLMでは、最初のエラーが発生すると、これらのケースの65%で、残りのステップすべてにわたって推論カスケードが失敗する。
本稿では,MLLMを学習し,言語推論のステップを記号的制約アサーションでインターリーブする,ニューロシンボリック・シンボリック・フレームワークであるConstraint-Anchored Reasoning Traces (CART)を提案する。
論文 参考訳(メタデータ) (2026-07-18T09:24:45Z) - What Can Verifiable Decapsulation Tests Certify? Pass Bounds and Fault-Recognition Limits for FO-Based KEMs [0.0]
藤崎・岡本脱カプセル化のブラックボックス試験では, ハーネスが観察した検体を観察した。
本報告では, 信頼度向上型KEM変種について, 誠実な参照手法を用いて検討する。
論文 参考訳(メタデータ) (2026-06-03T04:46:17Z) - Improving MoE Compute Efficiency by Composing Weight and Data Sparsity [50.654297246411545]
Mixture-of-Experts 層は重量空間によって計算効率を向上する。
各専門家がトークンのサブセットだけを処理するようなデータスパシティは、補完的な軸を提供する。
論文 参考訳(メタデータ) (2026-01-21T18:53:58Z) - STAMP Your Content: Proving Dataset Membership via Watermarked Rephrasings [17.175065729425825]
STAMPはデータセットのメンバシップを検出するフレームワークである。
トレーニングデータに1回しか表示されない4つのベンチマークにおける汚染を,我々のフレームワークが検出できることが示される。
論文 参考訳(メタデータ) (2025-04-18T02:25:08Z) - Fact Checking Beyond Training Set [64.88575826304024]
本稿では,レトリバーリーダが,あるドメインのラベル付きデータに基づいてトレーニングし,別のドメインで使用する場合,性能劣化に悩まされることを示す。
本稿では,レトリバー成分を分散シフトに対して頑健にするための逆アルゴリズムを提案する。
次に、これらのデータセットから8つの事実チェックシナリオを構築し、モデルと強力なベースラインモデルのセットを比較します。
論文 参考訳(メタデータ) (2024-03-27T15:15:14Z) - Bridging Synthetic and Real Worlds for Pre-training Scene Text Detectors [54.80516786370663]
FreeRealは、SDと実際のデータの相補的な強みを可能にする、実際のドメイン整合型事前トレーニングパラダイムである。
GlyphMixは、合成画像を落書きのようなユニットとして実際の画像に埋め込む。
FreeRealは、4つの公開データセットで、既存の事前トレーニングメソッドよりも大幅にパフォーマンスが向上している。
論文 参考訳(メタデータ) (2023-12-08T15:10:55Z) - Consistent Diffusion Models: Mitigating Sampling Drift by Learning to be
Consistent [97.64313409741614]
本稿では, モデルが生成したデータ上での予測が時間とともに一定であることを示す, 両立性特性を強制することを提案する。
CIFAR-10の条件および非条件生成とAFHQとFFHQのベースライン改良について,本研究の新たな訓練目標が得られた。
論文 参考訳(メタデータ) (2023-02-17T18:45:04Z) - Auditing AI models for Verified Deployment under Semantic Specifications [65.12401653917838]
AuditAIは、解釈可能な形式検証とスケーラビリティのギャップを埋める。
AuditAIは、画素空間の摂動のみを用いた検証の限界に対処しながら、検証と認定トレーニングのための制御されたバリエーションを得られるかを示す。
論文 参考訳(メタデータ) (2021-09-25T22:53:24Z) - Shared Certificates for Neural Network Verification [8.777291205946444]
既存のニューラルネットワーク検証器は、与えられた摂動の下で各入力が正しく処理されるという証明を計算する。
このプロセスは、各入力に対して独立してスクラッチから繰り返される。
精度を損なわずにこの検証コストを削減する新しい方法を提案する。
論文 参考訳(メタデータ) (2021-09-01T16:59:09Z) - UnrealPerson: An Adaptive Pipeline towards Costless Person
Re-identification [102.58619642363959]
本稿では,unrealpersonという,非現実的な画像データをフル活用して,トレーニングとデプロイメントの両面でコストを削減する新しいパイプラインを提案する。
3,000のIDと12万のインスタンスで、MSMT17に直接転送されると38.5%のランク-1の精度が得られる。
論文 参考訳(メタデータ) (2020-12-08T08:15:30Z) - A ground-truth dataset and classification model for detecting bots in
GitHub issue and PR comments [70.1864008701113]
ボットはGithubリポジトリで、分散ソフトウェア開発プロセスの一部である反復的なアクティビティを自動化するために使用されている。
本稿では,5000のGithubアカウントのプルリクエストとコメント発行に関する,高い相互契約を伴う手動分析に基づいて,基幹トラスデータセットを提案する。
ボットを検出する自動分類モデルを提案し,各アカウントの空のコメント数と空でないコメント数,コメントパターンの数,コメントパターン内のコメント間の不平等を主特徴とする。
論文 参考訳(メタデータ) (2020-10-07T09:30:52Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。