論文の概要: HAT Super-Resolution and a PARSeq+CLIP4STR Voting Ensemble for Extreme In-the-Wild License Plate Recognition
- arxiv url: http://arxiv.org/abs/2607.08896v1
- Date: Thu, 09 Jul 2026 19:36:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-13 14:47:12.733912
- Title: HAT Super-Resolution and a PARSeq+CLIP4STR Voting Ensemble for Extreme In-the-Wild License Plate Recognition
- Title(参考訳): HAT超解像とPARSeq+CLIP4STR投票アンサンブル
- Authors: Karthik Sivarama Krishnan, Koushik Sivarama Krishnan,
- Abstract要約: ICIP 2026 Grand Challenge on Extreme In-the-Wild License Plate Super-Resolution (XLPSR) に参加して
このシステムは、Hybrid Attention Transformerの超高解像度フロントエンドと、2つのシーンテキスト認識器のアンサンブルと、不確実な位置を無視する自信に富んだ文字投票方式を組み合わせている。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We describe our entry to the ICIP 2026 Grand Challenge on Extreme In-the-Wild License Plate Super-Resolution (XLPSR), which scored 9.73 wECR on the public validation leaderboard. The system pairs a Hybrid Attention Transformer super-resolution (HAT) front-end with an ensemble of two scene-text recognisers (PARSeq-S and CLIP4STR-B) and a confidence-weighted character-voting scheme that abstains on uncertain positions. We treat XLPSR as a recognition task gated by image legibility: the SR step exists to lift characters out of sub-pixel territory, and the asymmetric scoring rule (+2 / -1 / 0) is exploited explicitly through abstention. Our pipeline runs in 1.7 s per sequence on RTX 3090 (max 2.7 s, p99 2.4 s), well under the 60 s/sequence Docker budget.
- Abstract(参考訳): 我々はICIP 2026 Grand Challenge on Extreme In-the-Wild License Plate Super-Resolution (XLPSR)への参加について述べる。
このシステムは、HAT(Hybrid Attention Transformer Super- resolution)フロントエンドと、2つのシーンテキスト認識器(PARSeq-SとCLIP4STR-B)のアンサンブルと、不確実な位置を保留する自信重み付き文字投票方式を組み合わせている。
我々は、XLPSRを画像の可視性によって表される認識タスクとして扱う:SRステップは、サブピクセル領域から文字を持ち上げるために存在し、非対称スコアリングルール(+2 / -1 / 0)は、棄権によって明示的に活用される。
パイプラインはRTX 3090 (max 2.7 s, p99 2.4 s)でシーケンス当たり1.7 sで動作する。
関連論文リスト
- Arena-T2I Hard: Benchmarking and Improving Faithfulness with Dependency-Aware Checklist [69.81453995715673]
既存の忠実度ベンチマークは単純な原子命令に依存している。
本稿では,実アリーナT2Iログから抽出した310プロンプトの応力ベンチマークであるArena-T2I Hardを紹介する。
本稿では,各プロンプトをイエス/ノー質問のDAGに分解し,失敗する両親の子孫をゼロにする依存性対応チェックリスト報酬を提案する。
論文 参考訳(メタデータ) (2026-06-30T14:17:05Z) - SkillDAG: Self-Evolving Typed Skill Graphs for LLM Skill Selection at Scale [54.70985426016736]
本稿では,スキル間関係を型付き有向グラフとしてモデル化したSkillDAGを提案する。
各検索はベクトルマッチング、型付きエッジ隣人、競合信号を返す。
ALFWorldとSkillsBench with MiniMax-M2.7では、SkillDAGは67.1%の成功と27.3%の報酬を得た。
論文 参考訳(メタデータ) (2026-06-02T02:45:21Z) - TempRet: Temporal Enhancement and Two-Stage Reranking for CVPR 2026 EPIC-KITCHENS-100 Multi-Instance Retrieval Challenge [71.10535279591527]
我々は,CVPR 2026 EPIC-KITCHENS-100 MIRチャレンジに対して,TempRetと呼ばれるソリューションを提示する。
当社のアプローチは,CLIPベースのデュアルエンコーダのバックボーン上に構築されており,時間的および横断的な課題に対処するための2つの重要なコンポーネントを導入している。
EK-100 MIRベンチマークでは,平均mAPは67.97%,平均nDCGは82.92%であった。
論文 参考訳(メタデータ) (2026-05-23T08:37:39Z) - Lightweight True In-Pixel Encryption with FeFET Enabled Pixel Design for Secure Imaging [1.7783108003124413]
SecurePixはCMOS互換のコンパクトなピクセルアーキテクチャで、真にピクセル内暗号化を行う。
フルイメージ評価では、ResNet-18の認識精度は、暗号化後、MNISTで99.29パーセントから9.58パーセント、CIFAR-10で91.33パーセントから6.98パーセントに低下している。
論文 参考訳(メタデータ) (2026-04-06T20:20:07Z) - Panoramic Out-of-Distribution Segmentation for Autonomous Driving [25.32165408678185]
パノラマ・アウト・オブ・ディストリビューション(PanOoS)を導入し,包括的で安全なシーン理解を実現する。
POSはテキスト誘導の即時分布学習によりパノラマ画像の特徴に適応する。
POSは、主要なクローズドセットセグメンテーション機能を実現し、パノラマ理解の開発を進める。
論文 参考訳(メタデータ) (2025-05-06T13:51:26Z) - Optimizing Sharpe Ratio: Risk-Adjusted Decision-Making in Multi-Armed Bandits [3.5502600490147196]
我々は、シャープ比(SR)が金融時系列の特徴付けにおける重要なパラメータであると考えている。
我々は、レギュレット最小化(RM)とBest Arm Identification(BAI)のために、UCB-RSSRと呼ばれるSRを最適化する新しいアルゴリズムを提案する。
UCB-RSSRは、他のSR最適化バンディットアルゴリズムであるU-UCB Cassel et al(2023)よりも優れていることを示す。
論文 参考訳(メタデータ) (2024-05-28T14:24:36Z) - The NPU-ASLP-LiAuto System Description for Visual Speech Recognition in
CNVSRC 2023 [67.11294606070278]
本稿では,第1回中国連続視覚音声認識チャレンジ(CNVSRC)2023において,NPU-ASLP-LiAuto(Team 237)が導入した視覚音声認識システムについて述べる。
データ処理に関しては,ベースライン1からリップモーション抽出器を利用してマルチスケール映像データを生成する。
トレーニング中に、速度摂動、ランダム回転、水平反転、色変換を含む様々な拡張技術が適用される。
論文 参考訳(メタデータ) (2024-01-07T14:20:52Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。