論文の概要: SEED: Simple ViT and Evolving Harness for Explainable Text Forgery Detection
- arxiv url: http://arxiv.org/abs/2606.21138v1
- Date: Fri, 19 Jun 2026 06:22:49 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-26 08:02:23.935923
- Title: SEED: Simple ViT and Evolving Harness for Explainable Text Forgery Detection
- Title(参考訳): SEED:説明可能なテキスト偽造検出のためのシンプルなViTと進化するハーネス
- Authors: Kahim Wong, Kemou Li, Yiming Chen, Haiwei Wu, Jiantao Zhou,
- Abstract要約: ACM MM 2026のGenText-Forensics Challengeでは、検出、ピクセルレベルのローカライゼーション、多言語テキスト中心の画像偽造の自然言語説明の統合といった、構造化された法医学的なレポートが求められている。
3つのコンポーネントを持つモジュールシステムであるSEEDを提案する。
まず、類似性誘導パイプラインは、多様な合成フォージェリーによるトレーニングを増強する。
第二に、DINOv3上にLoRAを適応させて構築された単一のViTは、最小限のトレーニング可能なパラメータでトレーニング済みの事前保存をしながら、検出とピクセルレベルのローカライゼーションを共同で行う。
第三に、進化するハーネスは検出器の予測を受け取り、MLを介して完全な法医学レポートを生成する。
- 参考スコア(独自算出の注目度): 20.95071534060867
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: AI-assisted image editing threatens trust in financial, legal, and identity records. The GenText-Forensics Challenge at ACM MM 2026 addresses this by requiring structured forensic reports, in which integrating detection, pixel-level localization, and natural language explanation for multilingual text-centric forgery images. We present SEED, a modular system with three components. First, a similarity-guided pipeline augments training with diverse synthetic forgeries. Second, a single ViT, built on DINOv3 with LoRA adaptation, jointly performs detection and pixel-level localization while preserving pre-trained priors with minimal trainable parameters. Third, an evolving harness takes the detector's predictions and generates a complete forensic report via an MLLM, iteratively improved through a proposer-evaluator loop optimizing report quality. SEED ranked 3rd in the GenText-Forensics Challenge. Code and data are available at https://github.com/KahimWong/GenText-Forensics-3rd-Place.
- Abstract(参考訳): AIによる画像編集は、財務、法律、身元記録への信頼を脅かす。
ACM MM 2026のGenText-Forensics Challengeでは、マルチリンガルなテキスト中心の偽画像に対して、検出、ピクセルレベルのローカライゼーション、自然言語説明を統合した構造化された法医学的なレポートを必要とすることで、この問題に対処している。
3つのコンポーネントを持つモジュールシステムであるSEEDを提案する。
まず、類似性誘導パイプラインは、多様な合成フォージェリーによるトレーニングを増強する。
第二に、DINOv3上にLoRAを適応させて構築された単一のViTは、最小限のトレーニング可能なパラメータでトレーニング済みの事前保存をしながら、検出とピクセルレベルのローカライゼーションを共同で行う。
第三に、進化するハーネスは検出器の予測を受け、MLLMを介して完全な法医学的なレポートを生成し、レポートの品質を最適化するプロジェクタ・評価器ループによって反復的に改善する。
SEEDはGenText-Forensics Challengeで3位にランクインした。
コードとデータはhttps://github.com/KahimWong/GenText-Forensics-3rd-Placeで公開されている。
関連論文リスト
- TextSculptor: Training and Benchmarking Scene Text Editing [88.11688559021628]
データ構築とシーンテキスト編集評価のための総合的なフレームワークであるTextSculptorを提案する。
TextSculptorはオープンソースのテキスト編集性能を改善し、プロプライエタリなモデルとのギャップを狭める。
論文 参考訳(メタデータ) (2026-05-20T12:22:26Z) - Align then Refine: Text-Guided 3D Prostate Lesion Segmentation [5.284052813431228]
体積法は、解剖学的整合性を確保しながら複数のモードを組み合わせる必要がある。
現在のモデルは、クロスモーダル情報を確実に統合するのに苦労している。
3つの重要なイノベーションを取り入れた新しいマルチエンコーダU-Netアーキテクチャを提案する。
論文 参考訳(メタデータ) (2026-04-20T18:13:52Z) - LRANet++: Low-Rank Approximation Network for Accurate and Efficient Text Spotting [118.93173826110815]
高精度検出のための低ランク近似に基づく新しいパラメータ化テキスト形状法を提案する。
異なるテキストの輪郭間の固有形状相関を利用して、形状表現の一貫性とコンパクト性を実現する。
我々は、LRANet++と呼ばれるエンドツーエンドテキストスポッティングフレームワークを構築するために、拡張検出モジュールを軽量な認識ブランチに統合する。
論文 参考訳(メタデータ) (2025-11-08T03:08:03Z) - Benchmarking Robustness of Text-Image Composed Retrieval [46.98557472744255]
テキスト画像合成検索は、合成されたクエリを通してターゲット画像を取得することを目的としている。
近年,情報に富む画像と簡潔な言語の両方を活用する能力に注目が集まっている。
しかし、現実世界の腐敗やさらなるテキスト理解に対するこれらのアプローチの堅牢性は研究されていない。
論文 参考訳(メタデータ) (2023-11-24T20:16:38Z) - Towards General Visual-Linguistic Face Forgery Detection [95.73987327101143]
ディープフェイクは現実的な顔操作であり、セキュリティ、プライバシー、信頼に深刻な脅威をもたらす可能性がある。
既存の方法は、このタスクを、デジタルラベルまたはマスク信号を使用して検出モデルをトレーニングするバイナリ分類として扱う。
本稿では, 微粒な文レベルのプロンプトをアノテーションとして用いた, VLFFD (Visual-Linguistic Face Forgery Detection) という新しいパラダイムを提案する。
論文 参考訳(メタデータ) (2023-07-31T10:22:33Z) - TextFormer: A Query-based End-to-End Text Spotter with Mixed Supervision [61.186488081379]
Transformerアーキテクチャを用いた問合せベースのエンドツーエンドテキストスポッターであるTextFormerを提案する。
TextFormerは、画像エンコーダとテキストデコーダの上に構築され、マルチタスクモデリングのための共同セマンティック理解を学ぶ。
分類、セグメンテーション、認識のブランチの相互訓練と最適化を可能にし、より深い特徴共有をもたらす。
論文 参考訳(メタデータ) (2023-06-06T03:37:41Z) - SwinTextSpotter: Scene Text Spotting via Better Synergy between Text
Detection and Text Recognition [73.61592015908353]
本稿では,SwinTextSpotter と呼ばれるシーンテキストスポッティングフレームワークを提案する。
動的頭部を検出器とするトランスを用いて、2つのタスクを新しい認識変換機構で統一する。
この設計は、追加の修正モジュールも文字レベルのアノテーションも必要としない簡潔なフレームワークをもたらす。
論文 参考訳(メタデータ) (2022-03-19T01:14:42Z) - TRIG: Transformer-Based Text Recognizer with Initial Embedding Guidance [15.72669617789124]
シーンテキスト認識(STR)は画像とテキストの間の重要なブリッジである。
最近の手法では、凍結初期埋め込みを使用してデコーダを誘導し、特徴をテキストにデコードし、精度が低下する。
TRansformer-based text recognizer with Initial embeddeding Guidance (TRIG) という,テキスト認識のための新しいアーキテクチャを提案する。
論文 参考訳(メタデータ) (2021-11-16T09:10:39Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。