論文の概要: PersianAnonymizer: Evaluating LLM-Labeled Training for Efficient NER-based Anonymization in Persian
- arxiv url: http://arxiv.org/abs/2609.00958v1
- Date: Tue, 01 Sep 2026 09:18:11 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.494633
- Title: PersianAnonymizer: Evaluating LLM-Labeled Training for Efficient NER-based Anonymization in Persian
- Title(参考訳): ペルシャ匿名化 : ペルシャにおける高効率NERによる匿名化のためのLLMラベルトレーニングの評価
- Authors: Mohammad Hossein Shalchian, Mostafa Amiri, Amir Mahdi Sadeghzadeh,
- Abstract要約: LLMラベルによる監視からコンパクトなNERモデルをトレーニングし、デプロイメントに最適なラベルを選択できる。
我々は、DeepSeek-V3-0324、GPT-OSS-120B、Qwen3-235B-A22B-Instruct-2507の3つの命令調整LDMを比較し、共有プロトコルでスパンアノテーションを生成する。
MatinaRobertaベースのトークン分類器は、クラス毎にトレーニングされ、トークンレベルのPrecision/Recall/F1(すべてとクラス毎に)で評価される。
我々は、非Oとして予測される金非Oトークンの割合であるカバレッジ・リコール(LCR)を報告する。
- 参考スコア(独自算出の注目度): 2.064612766965483
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: We target practical anonymization of Persian customer chats by training a compact NER model from LLM-labeled supervision and selecting the best labeler for deployment. We compare three instruction-tuned LLMs: DeepSeek-V3-0324, GPT-OSS-120B, and Qwen3-235B-A22B-Instruct-2507, to produce span annotations under a shared JSON protocol, yielding four corpora (OSS_ZeroShot, Qwen_ZeroShot, Qwen_FewShot, DeepSeek_FewShot). A MatinaRoberta-based token-classifier is trained per corpus and evaluated with token-level Precision/Recall/F1 (overall and per-class). We also report Label Coverage Recall (LCR), the proportion of gold non-O tokens predicted as non-O, and quantify cross-labeler behavior via a token-level Venn on test annotations. Finally, we contrast test-set annotation latency of the LLMs on H200 nodes with the trained NER's test-time labeling on a single RTX 3090. Results show that supervision from OSS_ZeroShot yields the strongest macro-F1 and LCR, while the resulting NER labels an entire 40K-message test set in approximately 2 minutes on one consumer GPU. This establishes a practical path to high-quality, low-cost anonymization for Persian industrial data.
- Abstract(参考訳): LLMラベルによる監視からコンパクトなNERモデルをトレーニングし,デプロイメントに適したラベル付けを選択することで,ペルシャの顧客チャットの実用的な匿名化を目標とする。
我々は、DepSeek-V3-0324、GPT-OSS-120B、Qwen3-235B-A22B-Instruct-2507の3つの命令調整LDMを比較し、共有JSONプロトコルでアノテーションを生成し、4つのコーパス(OSS_ZeroShot、Qwen_ZeroShot、Qwen_FewShot、DeepSeek_FewShot)を生成する。
MatinaRobertaベースのトークン分類器は、コーパス毎にトレーニングされ、トークンレベルのPrecision/Recall/F1(オーバーオールとクラス毎)で評価される。
また、非Oとして予測される金非Oトークンの割合であるラベルカバーリコール(LCR)を報告し、テストアノテーション上のトークンレベルVennを介してラベル間の振る舞いを定量化する。
最後に,H200ノード上でのLCMのテストセットアノテーションレイテンシと,RTX 3090でトレーニングされたNERのテストタイムラベルとを比較した。
その結果,OSS_ZeroShotの監視は最強のマクロF1とLCRが得られ,NERは1つのGPU上で40Kメッセージ全体のセットを約2分でラベル付けした。
これにより、ペルシアの工業データに対する高品質で低コストな匿名化への実践的な道が確立される。
関連論文リスト
- Towards Improved Sentence Representations using Token Graphs [41.412173502714225]
GLOTは構造を意識したプールモジュールで、リレーショナル学習後にアグリゲーションとしてプールを再構成する。
トークンの90%がランダムなイントラクタである診断ストレステストでは、GLOTは97%以上の精度を維持し、ベースラインメソッドは崩壊する。
GLUEやMTEBのようなベンチマークの最先端技術と競合し、トレーニング可能なパラメータは20倍少なく、パラメータ効率のよい微調整手法と比較してトレーニング時間を100倍以上高速化する。
論文 参考訳(メタデータ) (2026-03-03T09:00:01Z) - BiRQ: Bi-Level Self-Labeling Random Quantization for Self-Supervised Speech Recognition [63.45645200463539]
BiRQは、BEST-RQの効率とHuBERTスタイルのラベル拡張の強化の利点を組み合わせた、双方向SSLフレームワークである。
提案手法は,960時間のLibriSpeech,150時間のAMIミーティング,5,000時間のYODASなど,さまざまなデータセットで検証する。
論文 参考訳(メタデータ) (2025-09-18T21:09:29Z) - Co-training for Low Resource Scientific Natural Language Inference [65.37685198688538]
遠隔教師付きラベルに分類器のトレーニング力学に基づいて重みを割り当てる新しいコトレーニング手法を提案する。
予測された信頼度に対する任意のしきい値に基づいてサンプルをフィルタリングするのではなく、重要重みを割り当てることにより、自動ラベル付きデータの使用を最大化する。
提案手法は、遠隔監視ベースラインに対するマクロF1の1.5%の改善と、他の強力なSSLベースラインよりも大幅に改善されている。
論文 参考訳(メタデータ) (2024-06-20T18:35:47Z) - SAM as the Guide: Mastering Pseudo-Label Refinement in Semi-Supervised Referring Expression Segmentation [66.92696817276288]
SemiRESは、RESを実行するためにラベル付きデータとラベルなしデータの組み合わせを効果的に活用する半教師付きフレームワークである。
SemiRESはSegment Anything Model (SAM) を組み込んでいる。
利用可能な候補と正確なマスクが一致しない場合、Pixel-Wise Adjustment(PWA)戦略を開発する。
論文 参考訳(メタデータ) (2024-06-03T15:42:30Z) - Re-Examine Distantly Supervised NER: A New Benchmark and a Simple Approach [14.801411392475439]
実生活DS-NERデータセットであるQTLを導入し、ドメイン辞書を用いてトレーニングデータをアノテートし、テストデータをドメインの専門家がアノテートする。
既存のDS-NERアプローチはQTLに適用されると失敗し、既存のDS-NERアプローチを再検討する動機となる。
そこで我々は,カリキュラム学習を用いて学習サンプルを簡単から難易度まで注文する,トークンレベルの正正解学習(CuPUL)を提案する。
論文 参考訳(メタデータ) (2024-02-22T20:07:02Z) - Prompt-based Pseudo-labeling Strategy for Sample-Efficient Semi-Supervised Extractive Summarization [12.582774521907227]
半教師付き学習(SSL)は、ラベル付きデータが不足し、ラベルなしデータが豊富であるシナリオで広く使われているテクニックである。
標準SSLメソッドは、まず分類モデルをトレーニングし、次に分類器の信頼性値を使用して擬似ラベルを選択するために教師-学生パラダイムに従う。
より正確な擬似ラベルでラベルなしのサンプルを抽出するLLMを用いたプロンプトベースの擬似ラベル方式を提案する。
論文 参考訳(メタデータ) (2023-11-16T04:29:41Z) - MarginMatch: Improving Semi-Supervised Learning with Pseudo-Margins [73.17295479535161]
MarginMatchは、一貫性の正規化と擬似ラベルを組み合わせた新しいSSLアプローチである。
トレーニングが進むにつれて、擬似ラベル付きモデル上でのモデルの振る舞いを分析し、低品質な予測が隠蔽されることを確かめる。
CIFAR-100では,クラス毎に25ラベル,STL-10では3.78%,クラス毎に4ラベルで3.25%の誤差率向上を実現した。
論文 参考訳(メタデータ) (2023-08-17T15:19:04Z) - Neighborhood-Regularized Self-Training for Learning with Few Labels [21.7848889781112]
自己学習の欠点の1つは、誤った擬似ラベルからのラベルノイズに弱いことである。
そこで我々は, 周辺住民によるサンプル選択手法を開発し, ノイズのある擬似ラベルの問題に対処する。
提案したデータ選択戦略は擬似ラベルのノイズを36.8%削減し、最良のベースラインと比較して57.3%の時間を節約する。
論文 参考訳(メタデータ) (2023-01-10T00:07:33Z) - Boosting Semi-Supervised Face Recognition with Noise Robustness [54.342992887966616]
本稿では,自動ラベルによるラベル雑音に対して頑健な半教師付き顔認識に対する効果的な解法を提案する。
そこで我々は,gnが強化するロバストな学習能力に基づく,ノイズロバスト学習ラベリング(nroll)という,半教師付き顔認識ソリューションを開発した。
論文 参考訳(メタデータ) (2021-05-10T14:43:11Z) - Coping with Label Shift via Distributionally Robust Optimisation [72.80971421083937]
分散ロバスト最適化(DRO)に基づく目的最小化モデルを提案する。
そこで我々は,提案した目的を最適化するために,大規模問題に適した勾配降下近位ミラー上昇アルゴリズムを設計し,解析する。
論文 参考訳(メタデータ) (2020-10-23T08:33:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。