論文の概要: Explicit Boundary Markers for Subword Vocabularies
- arxiv url: http://arxiv.org/abs/2608.08847v2
- Date: Wed, 12 Aug 2026 07:06:26 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-13 14:28:20.462421
- Title: Explicit Boundary Markers for Subword Vocabularies
- Title(参考訳): 単語語彙の明示的境界マーカ
- Abstract要約: サブワードトークン化器は、スペース用途の書き込みシステムにおいて、多くの一般的な単語を2回表現する。
明示的な単語境界マーカーを用いた標準ホワイトスペース規則の代替を提案する。
- 参考スコア(独自算出の注目度): 12.858857146500414
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: Subword tokenizers represent many common words twice in space-using writing systems, once with a leading space and once without. The two entries have separate embeddings in models, so occurrences of one word are divided across rows that are trained independently, and the two forms need not even segment the string the same way: " together" may be a single entry while the same word without a preceding space is tokenized as "to|gether". Capitalization divides a word further, into as many as six forms. We introduce an alternative to standard whitespace conventions using an explicit word boundary marker, which prevents such duplication. Words are delimited by the boundary markers, and spaces between words are represented as pairs of such markers. Two shift codes do the same for title case and upper case, allowing one internal representation of a word to be re-used across different settings. Switching to this convention mitigates the duplicate-entry issue, but does not improve tokenization compression: for both vocabulary-learning algorithms, the best marker scheme stays within one percent of the baseline in characters per token, averaged across six languages. It does result in better language modeling performance. Every marker scheme tested downstream reaches lower bits per byte than the baseline, suggesting that duplication carries a cost that compression does not capture.
- Abstract(参考訳): サブワードトークン化器は、スペースを使用する書き込みシステムにおいて、一度は先頭のスペースを持ち、一度は不要である多くの一般的な単語を2回表現する。
2つのエントリはモデルに別々の埋め込みを持つので、1つの単語の出現は独立に訓練された行に分割されるので、2つのフォームは弦を同じようにセグメントする必要はない:「一緒に」は単一のエントリであり、前の空間を持たない同じ単語は「to|gether」としてトークン化される。
資本化は1つの単語を最大6つの形式に分割する。
このような重複を防止するために,明示的な単語境界マーカーを用いた標準ホワイトスペース規則の代替を提案する。
単語は境界マーカーによって区切られ、単語間の空間はそのようなマーカーのペアとして表現される。
2つのシフトコードはタイトルケースと上位ケースで同じであり、単語の内部表現を異なる設定で再使用することができる。
両方の語彙学習アルゴリズムでは、最高のマーカースキームはトークンあたりの文字のベースラインの1%に留まり、6つの言語で平均化されている。
結果として、言語モデリングのパフォーマンスが向上します。
下流でテストされたすべてのマーカースキームは、ベースラインよりも1バイトあたり低いビットに到達し、重複は圧縮が捕捉しないコストをもたらすことを示唆している。
関連論文リスト
- All You Need Is Non-Commutative Words [0.0]
語彙トークンをユニタリ行列として表現し、各文を順序付けられた積としてエンコードする。
同じ代数は、クエリー、キー、または値射影を持たない反対称自己アテンションを含むいくつかの機能をもたらす。
IMDBでは精度が高く、AG Newsでは同等のパフォーマンスを実現しています。
論文 参考訳(メタデータ) (2026-08-29T14:56:57Z) - Vocab Diet: Reshaping the Vocabulary of LLMs with Vector Arithmetic [9.273273023595065]
大型言語モデル (LLM) は「ウォーク」>「ウォーク」のような単語形式のバリエーションを埋め込み空間における線形方向としてエンコードする。
標準的なトークン化アルゴリズムは、これらのバリエーションを異なるトークンとして扱う。
本稿では,各面形状に一意なトークンを割り当てるのではなく,共有基底形状と変換ベクトルから構成する,語彙のコンパクトな再構成を提案する。
論文 参考訳(メタデータ) (2025-10-19T20:56:58Z) - Boundless Byte Pair Encoding: Breaking the Pre-tokenization Barrier [11.131061652781192]
事前トークン化は、コーパス内のトークンの分布を一般的なフル長の単語に歪ませる原因となる。
本研究では,境界制約を緩和する改良型BPEアルゴリズムであるBoundlessBを提案する。
我々のアプローチは、2つの完全プレトケンを選択的にスーパーワードと呼ぶより大きな単位にマージする。
論文 参考訳(メタデータ) (2025-03-31T19:36:29Z) - A Collocation-based Method for Addressing Challenges in Word-level Metric Differential Privacy [3.0177210416625124]
ワードレベルの$textitMetric$ Differential Privacyアプローチが提案されている。
構成された民営化出力のセマンティックコヒーレンスと可変長を向上する手法を考案する。
本手法を実用性とプライバシテストで評価することにより,単語レベルを超えてトークン化戦略を明確にする。
論文 参考訳(メタデータ) (2024-06-30T09:37:34Z) - DP-Parse: Finding Word Boundaries from Raw Speech with an Instance
Lexicon [18.05179713472479]
DP-Parseも同様の原理を用いるが、ワードトークンのインスタンスレキシコンにのみ依存する。
Zero Resource Speech Benchmark 2017で、我々のモデルは5つの言語で新しい音声セグメンテーション状態を設定する。
型レキシコンが欠如しているにもかかわらず、DP-Parseは言語モデルにパイプライン化され、新しい音声単語埋め込みベンチマークで評価されるように、セマンティック表現を学ぶことができる。
論文 参考訳(メタデータ) (2022-06-22T19:15:57Z) - Hierarchical Context Tagging for Utterance Rewriting [51.251400047377324]
配列を線形に生成するのではなくタグ付けする方法は、ドメイン内および外部の書き直し設定においてより強力であることが証明されている。
本稿では,スロット付きルールを予測してこの問題を緩和する階層型コンテキストタグを提案する。
いくつかのベンチマーク実験により、HCTは2つのBLEUポイントで最先端の書き換えシステムより優れていることが示された。
論文 参考訳(メタデータ) (2022-06-22T17:09:34Z) - MarkBERT: Marking Word Boundaries Improves Chinese BERT [67.53732128091747]
MarkBERTは、語彙を漢字として保持し、連続した単語間の境界マーカーを挿入する。
従来の単語ベースのBERTモデルと比較して、MarkBERTはテキスト分類、キーワード認識、意味的類似性タスクにおいて精度が向上している。
論文 参考訳(メタデータ) (2022-03-12T08:43:06Z) - Simple, Interpretable and Stable Method for Detecting Words with Usage
Change across Corpora [54.757845511368814]
2つの文体を比較し、その用法が異なる単語を探すという問題は、しばしばデジタル人文科学や計算社会科学において生じる。
これは一般に、各コーパスに単語の埋め込みを訓練し、ベクトル空間を整列させ、整列空間における余弦距離が大きい単語を探すことでアプローチされる。
本稿では,ベクトル空間アライメントを使わず,各単語の近傍を考慮した代替手法を提案する。
論文 参考訳(メタデータ) (2021-12-28T23:46:00Z) - UniRE: A Unified Label Space for Entity Relation Extraction [67.53850477281058]
合同エンティティ関係抽出モデルでは、2つのサブタスクに対して2つの分離ラベル空間を設定する。
この設定は、エンティティとリレーション間の情報相互作用を妨げる可能性があると我々は主張する。
本研究では,2つのサブタスクのラベル空間における異なる処理を除去することを提案する。
論文 参考訳(メタデータ) (2021-07-09T08:09:37Z) - Multi-view Subword Regularization [111.04350390045705]
マルチビューサブワード正規化(MVR)は、標準でトークン化された入力と確率的セグメンテーションとの整合性を強制する手法です。
XTREMEマルチ言語ベンチマークの結果は、MVRが標準セグメンテーションアルゴリズムよりも最大2.5ポイントの一貫性のある改善をもたらすことを示している。
論文 参考訳(メタデータ) (2021-03-15T16:07:42Z) - Char2Subword: Extending the Subword Embedding Space Using Robust
Character Compositionality [24.80654159288458]
本稿では,BERT のような事前学習モデルにおけるサブワード埋め込みテーブルを学習する文字ベースのサブワードモジュール (char2subword) を提案する。
私たちのモジュールは、ミススペル、単語のインフレクション、ケーシング、句読点などの文字レベルの変更に対して堅牢です。
我々は,mBERTにモジュールを組み込むことで,ソーシャルメディア言語コードスイッチング評価(LinCE)ベンチマークの性能が大幅に向上することを示した。
論文 参考訳(メタデータ) (2020-10-24T01:08:28Z) - 2kenize: Tying Subword Sequences for Chinese Script Conversion [54.33749520569979]
本稿では,2つのスクリプト間のマッピングと変換をあいまいにできるモデルを提案する。
提案手法は,従来の漢字変換手法よりも精度が6ポイント向上した。
論文 参考訳(メタデータ) (2020-05-07T10:53:05Z) - Discovering linguistic (ir)regularities in word embeddings through
max-margin separating hyperplanes [0.0]
単語埋め込み空間において,関係する単語の相対的な位置を学習するための新しい手法を示す。
私たちのモデルであるSVMCosは、単語埋め込みのトレーニングにおいて、さまざまな実験的な選択に対して堅牢です。
論文 参考訳(メタデータ) (2020-03-07T20:21:50Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。