論文の概要: CANDLE: Character-level Arabic Noise Deduplication using Lightweight Encoder
- arxiv url: http://arxiv.org/abs/2606.24758v1
- Date: Tue, 23 Jun 2026 16:17:24 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-24 22:16:49.049804
- Title: CANDLE: Character-level Arabic Noise Deduplication using Lightweight Encoder
- Title(参考訳): CANDLE:軽量エンコーダを用いた文字レベルアラビアノイズ重複
- Authors: Faris Alasmary, Taif Nono, Orjuwan Zaafarani, Kholood Al Tabash, Ahmad Ghannam, Anas Salamah, Shouq Sadah, Lahouari Ghouti,
- Abstract要約: CANDLEは文字レベルアラビア雑音復調のための軽量なシステムである。
CANDLEの中心には、コネクショニストの時間分類(CTC)の新たな応用がある。
CTCモデルは、SER(Sentence Error Rate)を5.37%$で達成し、分類ベースのベースラインを大きなマージンで一貫して上回る。
- 参考スコア(独自算出の注目度): 1.0399316033225514
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Handling repeated characters in text can be tricky, since they can represent either the correct spelling of a word or informal character elongation often seen in social media posts. We present CANDLE, a lightweight system for character-level Arabic noise deduplication that addresses this challenge without relying on handcrafted rules, dictionaries, or morphological analyzers. At the heart of CANDLE is a novel application of Connectionist Temporal Classification (CTC) to this task, a formulation not previously explored for character deduplication, which frames normalization as a sequence alignment problem over a character-based encoder. Evaluated on three benchmarks spanning clean newspaper, manually curated ambiguous cases, and real-world social media text, the CTC model achieves a Sentence Error Rate (SER) as low as $5.37\%$ and consistently outperforms a classification-based baseline by a large margin. To reduce inference overhead, we distill the 6-layer CTC model into a 2-layer student, achieving a $3\times$ depth reduction with minimal performance degradation. Beyond deduplication accuracy, normalization yields a practical downstream benefit: a relative reduction in tokenizer fertility of up to $12.8\%$ across a diverse set of Arabic LLM tokenizers, directly lowering inference costs and improving context window utilization. We release all code and models publicly to support reproducibility and advance future research\footnote{https://github.com/abjadai/candle}.
- Abstract(参考訳): 繰り返し文字をテキストで扱うのは、言葉の正しい綴りか、ソーシャルメディアの投稿でよく見られる非公式な文字伸長のどちらかを表現できるため、難易度が高い。
CANDLEは,手作りの規則や辞書,形態素解析に頼らずに,文字レベルのアラビアノイズの重複を解消する軽量なシステムである。
CANDLEの核心はコネクショニストテンポラル分類(CTC)のこのタスクへの新たな応用であり、文字復号化のためにこれまで検討されていなかった定式化であり、文字ベースのエンコーダ上のシーケンスアライメント問題として正規化をフレーム化している。
CTCモデルは、クリーン新聞、手動でキュレートされたあいまいなケース、実世界のソーシャルメディアテキストの3つのベンチマークで評価され、SER(Sentence Error Rate)を5.37 %$で達成し、分類ベースのベースラインをはるかに上回っている。
推定オーバーヘッドを低減するため,6層CTCモデルを2層留学生に蒸留し,性能劣化を最小限に抑え,3倍の深さ低減を実現した。
希釈精度の他に、正規化は実用的な下流の利点をもたらす: 様々なアラビアのLLMトークン化剤のセットで、トークン化剤の肥料の相対的な減価は、12.8 %までであり、推論コストを直接低減し、コンテキストウィンドウの利用を改善する。
再現性をサポートし、将来の研究を進めるために、すべてのコードとモデルを公開します。
関連論文リスト
- Cross-Lingual Token Arbitrage: Optimizing Code Agent Context Windows via Local LLM Preprocessing [0.0]
生の人間の入力の2つの病理は、非英語のテキストに対するトークン化の非効率性と会話のプロンプトにおける構造的エントロピーの2つのオーバーヘッドを駆動している。
既存のアプローチは、すでに肥大しているコンテキストを圧縮したり、障害が発生した後に介入することで、リアクティブに動作します。
我々は、開発者とクラウドエージェントの間で動作する、飛行前のエッジサイドのプロンプトリライトを導入します。
論文 参考訳(メタデータ) (2026-06-02T13:17:45Z) - Text-Preserving Lossy Text Compression: A Study of Strategic Deletion and LLM Reconstruction [3.008906408145323]
エンコーダはテキストの一部を戦略的に削除する。
我々は、一様ステップ削除、ワード長誘導削除(WordLen)、ワード周波数誘導削除(WordFreq)、LP最適化削除(Opt)、GPT-2によるエントロピーに基づく削除、周波数と副次信号を組み合わせたハイブリッド手法などの削除戦略の進捗をベンチマークする。
論文 参考訳(メタデータ) (2026-05-27T18:58:30Z) - From Early Encoding to Late Suppression: Interpreting LLMs on Character Counting Tasks [49.57538588967748]
LLM(Large Language Model)は、複雑なベンチマークでは優れているにもかかわらず、単語中の文字数などの基本的な記号的タスクにおいて失敗を示す。
我々は、LLaMA、Qwen、Gemmaなど、現代のアーキテクチャにまたがる一貫した現象を発見した。
LLMにおけるシンボリック推論失敗は,表現不足やスケール不足によるものではなく,モデル計算グラフ内の構造的干渉によるものであることを示す。
論文 参考訳(メタデータ) (2026-04-01T11:40:12Z) - PointAlign: Feature-Level Alignment Regularization for 3D Vision-Language Models [23.263895549689863]
既存の手法は、言語のトークンのみを監督に用いながら、次世代の予測損失にのみ依存する。
mnameは、微粒な3次元幾何学的意味情報を保持するために、中間点のクラウドトークンを明示的に監督する。
モデルNet40および逆データセットを用いた実験により,本手法は,分類タスクの平均値に対して,textbf2.08ppの改善を達成できることを示した。
論文 参考訳(メタデータ) (2026-02-28T02:17:46Z) - Behavior-Equivalent Token: Single-Token Replacement for Long Prompts in LLMs [55.827877498548965]
単一プロンプト固有の振る舞い等価トークン([BE])を学習する軽量なトレーニングフレームワークを提案する。
フレームワークはまず[BE]に、元のシステムプロンプトの自然言語内容を再構成してエンコードし、その後、プロンプトの下流の振る舞いをこの単一のトークンに蒸留するように訓練する。
3つのデータセットに対する実証的な評価は、1つの[BE]トークンが3000倍の高速化を実現し、元のシステムの下流性能の約98%を維持していることを示している。
論文 参考訳(メタデータ) (2025-11-28T15:22:52Z) - Reinforcement Learning with Verifiable yet Noisy Rewards under Imperfect Verifiers [90.50039419576807]
RLVR(Reinforcement Learning with Verifiable Rewards)は、人為的なラベル付けを避けるために、自動検証に対するポリシーを訓練する。
認証ハッキングの脆弱性を軽減するため、多くのRLVRシステムはトレーニング中にバイナリ$0,1$の報酬を破棄する。
この選択にはコストがかかる:textitfalse negatives(正しい回答、FNを拒絶)とtextitfalse positives(間違った回答、FPを受け入れる)を導入する。
論文 参考訳(メタデータ) (2025-10-01T13:56:44Z) - Fast Controlled Generation from Language Models with Adaptive Weighted Rejection Sampling [90.86991492288487]
トークンの制約を評価するのは 違法にコストがかかる
LCDは文字列上のグローバル分布を歪め、ローカル情報のみに基づいてトークンをサンプリングすることができる。
我々のアプローチは最先端のベースラインよりも優れていることを示す。
論文 参考訳(メタデータ) (2025-04-07T18:30:18Z) - RetroMAE v2: Duplex Masked Auto-Encoder For Pre-Training
Retrieval-Oriented Language Models [3.4523793651427113]
本稿では,[] と通常のトークンの両方のコンテキスト化埋め込みにおける意味表現能力の向上を目標とする,二重マスク付き自動エンコーダ DupMAE を提案する。
DupMAEは単純だが経験的競争力があり、デコードコストが小さいため、モデルの表現能力と転送可能性に大きく貢献する。
論文 参考訳(メタデータ) (2022-11-16T08:57:55Z) - Capitalization Normalization for Language Modeling with an Accurate and
Efficient Hierarchical RNN Model [12.53710938104476]
本稿では,高速で高精度でコンパクトな2階層型単語と文字に基づくリカレントニューラルネットワークモデルを提案する。
言語モデリングのためのFederated Learningフレームワークでは、 truecaserを使ってユーザ生成テキストを正規化しています。
論文 参考訳(メタデータ) (2022-02-16T16:21:53Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。