論文の概要: PairAlign: A Framework for Sequence Tokenization via Self-Alignment with Applications to Audio Tokenization
- arxiv url: http://arxiv.org/abs/2605.06582v1
- Date: Thu, 07 May 2026 17:11:22 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-08 22:27:12.022956
- Title: PairAlign: A Framework for Sequence Tokenization via Self-Alignment with Applications to Audio Tokenization
- Title(参考訳): PairAlign: 自己アライメントによるシーケンストークン化フレームワークとオーディオトークン化への応用
- Authors: Adhiraj Banerjee, Vipul Arora,
- Abstract要約: PairAlignは、シーケンスレベルの自己アライメントによるコンパクトなオーディオトークン化のためのフレームワークである。
広義の語彙を用いたコンパクトで非退化配列を学習する。
編集距離検索を保存し、アーカイブトークン数を55%削減する。
- 参考スコア(独自算出の注目度): 8.126475706520063
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Many operations on sensory data -- comparison, memory, retrieval, and reasoning -- are naturally expressed over discrete symbolic structures. In language this interface is given by tokens; in audio, it must be learned. Existing audio tokenizers rely on quantization, clustering, or codec reconstruction, assigning tokens locally, so sequence consistency, compactness, length control, termination, and edit similarity are rarely optimized directly. We introduce PairAlign, a framework for compact audio tokenization through sequence-level self-alignment. PairAlign treats tokenization as conditional sequence generation: an encoder maps speech to a continuous condition, and an autoregressive decoder generates tokens from BOS, learning token identity, order, length, and EOS placement. Given two content-preserving views, each view's sequence is trained to be likely under the other's representation, while unrelated examples provide competing sequences. This gives a scalable surrogate for edit-distance preservation while discouraging many-to-one collapse. PairAlign starts from VQ-style tokenization and refines it with EMA-teacher targets, cross-paired teacher forcing, prefix corruption, likelihood contrast, and length control. On 3-second speech, PairAlign learns compact, non-degenerate sequences with broad vocabulary usage and strong cross-view consistency. On TIMIT retrieval, it preserves edit-distance search while reducing archive token count by 55%. A continuous-sweep probe shows lower local overlap than a dense geometric tokenizer, but stronger length control and bounded edit trajectories under 100 ms shifts. PairAlign is a sequence-symbolic predictive learner: like JEPA-style objectives, it predicts an abstract target from another view as a learned variable-length symbolic sequence, not a continuous latent.
- Abstract(参考訳): 知覚データ(比較、記憶、検索、推論)に関する多くの操作は、離散的なシンボル構造上で自然に表現される。
言語では、このインターフェースはトークンによって与えられる。
既存のオーディオトークンライザは量子化、クラスタリング、コーデック再構成に頼っており、トークンを局所的に割り当てているため、シーケンス一貫性、コンパクト性、長さ制御、終了、編集の類似性が直接最適化されることは滅多にない。
シーケンスレベルの自己アライメントによるコンパクトな音声トークン化のためのフレームワークであるPairAlignを紹介する。
PairAlignは、トークン化を条件付きシーケンス生成として扱う:エンコーダは、音声を連続した条件にマッピングし、自己回帰デコーダは、BOSからトークンを生成し、トークンのアイデンティティ、順序、長さ、EOS配置を学習する。
2つのコンテンツ保存ビューが与えられた場合、各ビューのシーケンスは、他のビューの表現の下にある可能性が高いように訓練され、非関連な例は競合するシーケンスを提供する。
これにより、多対一の崩壊を回避しつつ、編集距離保存のためのスケーラブルなサロゲートが実現される。
PairAlignは、VQスタイルのトークン化から始まり、EMA-Teacherターゲット、クロスペアの教師強制、プレフィックスの汚職、コントラスト、長さ制御でそれを洗練する。
3秒の音声で、PairAlignは、広い語彙使用と強いクロスビュー一貫性を持つコンパクトで非退化シーケンスを学習する。
TIMIT検索では、編集距離検索を保存し、アーカイブトークン数を55%削減する。
連続スウィーププローブは、密度の高い幾何トークン化器よりも局所的な重なり合いが低いが、より強い長さ制御と100ms以下の編集軌道を持つ。
PairAlignはシーケンスシンボリックな予測学習であり、JEPAスタイルの目的と同様に、学習された可変長のシンボルシーケンスとして他のビューから抽象的なターゲットを予測する。
関連論文リスト
- Zonkey: A Hierarchical Diffusion Language Model with Differentiable Tokenization and Probabilistic Attention [0.0]
Zonkeyは階層的な拡散モデルであり、生文字から文書レベルの表現まで、完全にトレーニング可能なパイプラインを通じて制限に対処する。
コアとなるのは、確率的開始順序(BOS)決定を学習する、差別化可能なトークンである。
Zonkeyは、ノイズからコヒーレントで可変長のテキストを生成し、創発的な階層を示す。
論文 参考訳(メタデータ) (2026-01-29T14:17:37Z) - DSA-Tokenizer: Disentangled Semantic-Acoustic Tokenization via Flow Matching-based Hierarchical Fusion [28.204167153140506]
音声トークン化器は、離散音声大言語モデルの基盤となる。
本稿では,DSA-Tokenizerを提案する。
論文 参考訳(メタデータ) (2026-01-14T07:22:24Z) - MergeDNA: Context-aware Genome Modeling with Dynamic Tokenization through Token Merging [65.07273789940116]
本稿では,動的ゲノミクストークンと潜在トランスフォーマーをコンテキスト対応事前学習タスクで協調的に最適化する階層型アーキテクチャを提案する。
MergeDNAは3つの人気のあるDNAベンチマークと、微調整やゼロショット評価を伴う複数のマルチオミクスタスクにおいて優れたパフォーマンスを実現している。
論文 参考訳(メタデータ) (2025-11-17T19:27:41Z) - VQToken: Neural Discrete Token Representation Learning for Extreme Token Reduction in Video Large Language Models [35.38573641029626]
最小限の離散トークンを用いてビデオ全体を表現することを目的としたExtreme Short Token Reductionという新しいタスクを紹介した。
Extreme Short Token Reductionタスクでは、私たちのVQTokenはシーケンスをオリジナルの長さのわずか0.07パーセントまで圧縮し、NextQA-MCベンチマークでは0.6%の精度しか達成していません。
論文 参考訳(メタデータ) (2025-03-21T09:46:31Z) - CosyVoice: A Scalable Multilingual Zero-shot Text-to-speech Synthesizer based on Supervised Semantic Tokens [49.569695524535454]
本稿では, ベクトル量子化をエンコーダに挿入することにより, 多言語音声認識モデルから導出される, 教師付きセマンティックトークンを用いた音声表現を提案する。
トークンをベースとした拡張性のあるゼロショットTSシンセサイザーであるCosyVoiceは,テキスト・ツー・ツー・ケン生成のためのLLMと,トークン・ツー・音声合成のための条件付きフローマッチングモデルから構成される。
論文 参考訳(メタデータ) (2024-07-07T15:16:19Z) - Linear-Time Modeling of Linguistic Structure: An Order-Theoretic
Perspective [97.57162770792182]
文字列内のトークンのペア間の関係をモデル化するタスクは、自然言語を理解する上で不可欠な部分である。
これらの徹底的な比較は避けられ、さらに、トークン間の関係を文字列上の部分順序としてキャストすることで、複雑さを線形に減らすことができる。
提案手法は,文字列中の各トークンの実際の数を並列に予測し,それに従ってトークンをソートすることで,文字列内のトークンの総順序を決定する。
論文 参考訳(メタデータ) (2023-05-24T11:47:35Z) - Byte Pair Encoding for Symbolic Music [0.0]
Byte Pair 埋め込みは語彙サイズを増大させながらシーケンス長を著しく減少させる。
我々は、より表現力のあるトークンでそのようなモデルの埋め込み能力を活用し、その結果、より優れた結果と、生成および分類タスクにおける高速な推論の両方をもたらす。
ソースコードはGithubと同伴のウェブサイトで共有されている。
論文 参考訳(メタデータ) (2023-01-27T20:22:18Z) - Fast End-to-End Speech Recognition via a Non-Autoregressive Model and
Cross-Modal Knowledge Transferring from BERT [72.93855288283059]
LASO (Listen Attentively, and Spell Once) と呼ばれる非自動回帰音声認識モデルを提案する。
モデルは、エンコーダ、デコーダ、および位置依存集合体(PDS)からなる。
論文 参考訳(メタデータ) (2021-02-15T15:18:59Z) - Consistent Multiple Sequence Decoding [36.46573114422263]
一貫性のある多重シーケンスデコーディングアーキテクチャを導入する。
このアーキテクチャは任意の数のシーケンスを一貫した同時復号化を可能にする。
重回帰画像キャプションにおける一貫した多重シーケンスデコーダの有効性を示す。
論文 参考訳(メタデータ) (2020-04-02T00:43:54Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。