論文の概要: Zero-Shot SAM2 Segmentation and Vision Transformer-Based Recognition of Elamite Cuneiform Symbols from Degraded Tablet Images
- arxiv url: http://arxiv.org/abs/2608.18544v1
- Date: Wed, 19 Aug 2026 05:02:41 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-20 20:13:55.282972
- Title: Zero-Shot SAM2 Segmentation and Vision Transformer-Based Recognition of Elamite Cuneiform Symbols from Degraded Tablet Images
- Title(参考訳): 劣化タブレット画像からのゼロショットSAM2セグメンテーションと視変換器によるエラム状シンボルの認識
- Abstract要約: 本稿では,Persepolis Fortification Archiveで評価されたセグメンテーション誘導型トランスフォーマーパイプラインであるEpigraphNetを紹介する。
1,239の注釈付きタブレット画像から、明るさ適応型形態素前処理とゼロショットSAM2-Largeセグメンテーションがクリーンなバイナリシンボルマスクを生成する。
EpigraphNetは、132クラスのベンチマークで86.41%のトップ-1の精度に達した。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Automated recognition of ancient cuneiform script poses a compound signal-degradation problem: the three-dimensional relief of clay tablets creates spatially varying illumination and cast shadows, surface erosion introduces structured noise that overlaps with genuine sign impressions, and severe class imbalance across 141 sign categories undermines classifier reliability. We introduce EpigraphNet, a segmentation-guided transformer pipeline evaluated on the Persepolis Fortification Archive. From 1,239 annotated tablet images, brightness-adaptive morphological preprocessing and zero-shot SAM2-Large segmentation generate clean binary symbol masks, which a fine-tuned Vision Transformer (ViT-B/16) with inverse-frequency class weighting then classifies. EpigraphNet reaches 86.41% top-1 accuracy on a 132-class benchmark, a 17.21 percentage-point gain over the strongest CNN baseline (ResNet-101, 69.20%) and 5.31-12.91% over four modern backbones (DeiT-B/16, Swin-B, ConvNeXt-B, EfficientNet-B4) under identical conditions. The full pipeline runs at approximately 18 ms per sign on an NVIDIA A100 GPU. A lower Spearman correlation between sign frequency and per-class performance indicates more balanced recognition across frequent and rare classes. Implementation is available at: github.com/r11up/sam-guided-vit
- Abstract(参考訳): 粘土板の3次元リリーフは空間的に異なる照明と鋳造影を発生させ、表面侵食は本物の記号の印象と重なる構造的ノイズを導入し、141の記号カテゴリーにわたる深刻な階級不均衡は分類器の信頼性を損なう。
本稿では,Persepolis Fortification Archiveで評価されたセグメンテーション誘導型トランスフォーマーパイプラインであるEpigraphNetを紹介する。
1,239の注釈付きタブレット画像から、明るさ適応型形態素前処理とゼロショットSAM2-Largeセグメンテーションがクリーンなバイナリシンボルマスクを生成し、それを微調整された視覚変換器(ViT-B/16)と逆周波数のクラス重み付けで分類する。
EpigraphNetは132クラスのベンチマークで86.41%、CNNベースライン(ResNet-101, 69.20%)で17.21ポイント、モダンバックボーン(DeiT-B/16, Swin-B, ConvNeXt-B, EfficientNet-B4)で5.31-12.91%に達している。
完全なパイプラインはNVIDIA A100 GPU上で1サインあたり約18ミリ秒で動作する。
符号周波数とクラスごとのパフォーマンスの低いスピアマン相関は、頻繁なクラスと稀なクラスの間でよりバランスの取れた認識を示す。
github.com/r11up/sam-guided-vit
関連論文リスト
- Spatial Attention Supervision for Defect Localization: Exploiting Ground-Truth Masks as Training Signal in Diffusion-Augmented Defect Detection [0.0]
産業用データセットの地道欠陥マスクは一般に評価のために予約されている。
本稿では,分類ネットワークの訓練中に空間的監視信号として再利用する。
論文 参考訳(メタデータ) (2026-09-05T19:20:23Z) - On the Design of Qwen3.8-Next Architecture: Evaluation, Efficiency, and Training Stability [57.03393882933515]
Qwen3.8-Flash-Nextは125Bパラメータ、トークンあたり6Bアクティベートされ、加速器から保持されるn-gram埋め込みテーブルの51Bパラメータを持つスパースミックス・オブ・エキスパートモデルである。
トレーニング前の14のベンチマークでは、このモデルは前モデルの397B-A17Bを8点、残りを少なくとも2.6ポイント、アクティベートされたパラメータが1/3、トレーニングトークンが1/3、トレーニング用FLOPが1/9であった。
論文 参考訳(メタデータ) (2026-08-31T06:35:07Z) - GLID: Gated Local Intrinsic Dimension Repairs the Blind Spots of Face-Forgery Detectors [4.564848621539382]
ファインチューニングされたファウンデーションモデル検出器がフェイスフォージェリーベンチマークを支配しているが、訓練を受けていないジェネレータファミリーには目が見えていない。
GLIDは、データの代わりに幾何学でこの盲点を修復する検出器である。
GLIDは、単一の画像のパッチトークンを多様体からのサンプルとして扱い、その局所固有次元(LID)を凍結視覚変換器のいくつかの深さで推定する。
論文 参考訳(メタデータ) (2026-07-21T06:52:46Z) - Learnable Token Sparsification for Efficient Gigapixel Whole Slide Image Reasoning [8.596353244934853]
本研究では,スライディング画像全体のトークン削減をトレーニング可能なスペーシング問題として再検討する。
我々のフレームワークはSlideBench (TCGA) で73.32%の精度を実現していることを示す。
この研究は、エンド・ツー・エンドのギガピクセル全体の画像推論に非常に効率的なパラダイムを提供する。
論文 参考訳(メタデータ) (2026-06-07T14:07:28Z) - The Rescue Effect: Spatio-Semantic Early Exit Bypasses Quantization Collapse in CLIP [6.450516062706025]
CLIPのような共同埋め込みアーキテクチャでは、量子化されたCNN分類器とは異なる障害モードが導入されている。
我々はこれをQIRC(Quantization-induced Representation Collapse)と呼び、CLIP ViT-B/32を置き換えるINT8上で定量化する。
雑音飽和層をバイパスするLRA-EE(Layer-wise Representation-Aware Early Exit)を提案する。
ImageNet-1K ゼロショット分類では、LRA-EE は FLOP を 13.4% 削減し、Top-1 の精度を +2.44%p (58.72% -> 61.16%) 向上させる。
論文 参考訳(メタデータ) (2026-05-26T00:45:46Z) - Linear Differential Vision Transformer: Learning Visual Contrasts via Pairwise Differentials [34.77694214755808]
MHSA(Multi-Head Self-Attention)の代替品であるVCA(Visual-Contrast Attention)を導入する。
VCAは、O(N N C) から O(N n C) への理論複雑性を n N で減少させながら、識別の明示的な概念を注入する。
モジュールはDeiT-Tinyのバックボーンに0.3M以下のパラメータを追加し、追加のFLOPを必要とせず、完全にアーキテクチャに依存しない。
論文 参考訳(メタデータ) (2025-11-02T07:04:12Z) - Representation Entanglement for Generation: Training Diffusion Transformers Is Much Easier Than You Think [63.25744258438214]
REPAとその変種は、事前訓練されたモデルから外部の視覚表現を取り入れることで、拡散モデルのトレーニング課題を効果的に軽減する。
偏見推論過程全体において欠落している外部アライメントは、識別的表現の可能性を完全に活用するに足らないと我々は主張する。
本稿では,事前学習した基礎モデルから,低レベル画像ラテントを1つの高レベルクラストークンで絡み合わせるRepresentation Entanglement for Generation (REG)を提案する。
論文 参考訳(メタデータ) (2025-07-02T08:29:18Z) - ClusterFormer: Clustering As A Universal Visual Learner [80.79669078819562]
CLUSTERFORMERは、トランスフォーマーを用いたCLUSTERingパラダイムに基づくユニバーサルビジョンモデルである。
不均一な視覚タスクに様々なレベルのクラスタリングの粒度で対処することができる。
その有効性のために、コンピュータビジョンにおける普遍モデルにおけるパラダイムシフトを触媒できることを期待します。
論文 参考訳(メタデータ) (2023-09-22T22:12:30Z) - Making Vision Transformers Efficient from A Token Sparsification View [26.42498120556985]
本稿では,グローバル・ローカル・ビジョン・トランスフォーマのための新しいセマンティック・トークンViT(STViT)を提案する。
提案手法は,対象検出やインスタンスセグメンテーションにおける元のネットワークと比較して,30%以上のFLOPを削減できる。
さらに,STViTに基づいて詳細な空間情報を復元するためのSTViT-R(ecover)ネットワークを設計し,下流タスクに有効である。
論文 参考訳(メタデータ) (2023-03-15T15:12:36Z) - Attribute Surrogates Learning and Spectral Tokens Pooling in
Transformers for Few-shot Learning [50.95116994162883]
ビジョントランスフォーマーは、視覚認識のための畳み込みニューラルネットワークに代わる有望な選択肢だと考えられている。
本稿では,スペクトルトークンプールによる固有画像構造を利用した階層的カスケード変換器を提案する。
HCTransformersはDINOベースラインを9.7%の5ウェイの1ショット精度と9.17%の5ウェイの5ショット精度で上回っている。
論文 参考訳(メタデータ) (2022-03-17T03:49:58Z) - VATT: Transformers for Multimodal Self-Supervised Learning from Raw
Video, Audio and Text [60.97904439526213]
video-audio-text transformer (vatt) は生の信号を入力として取り、様々な下流タスクに役立つほどリッチなマルチモーダル表現を抽出する。
マルチモーダルなコントラスト損失を用いて,vattのエンドツーエンドをスクラッチからトレーニングし,映像動作認識,音声イベント分類,画像分類,テキストからビデオへの検索といった下流タスクによってその性能を評価する。
論文 参考訳(メタデータ) (2021-04-22T17:07:41Z) - End-to-End Multi-speaker Speech Recognition with Transformer [88.22355110349933]
音声認識モデルにおけるRNNベースのエンコーダデコーダをトランスフォーマーアーキテクチャに置き換える。
また、計算量を削減するために、シーケンス全体ではなくセグメントに制限されるセルフアテンションコンポーネントを変更します。
論文 参考訳(メタデータ) (2020-02-10T16:29:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。