論文の概要: When Tokenization is Secretly Output Supervision
- arxiv url: http://arxiv.org/abs/2609.01386v1
- Date: Tue, 01 Sep 2026 15:16:19 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.795605
- Title: When Tokenization is Secretly Output Supervision
- Title(参考訳): トークン化が秘かにアウトプット・スーパービジョンのとき
- Authors: Tanja Baeumel, Josef van Genabith, Simon Ostermann,
- Abstract要約: 言語モデルのトークン化は、入力前処理決定としてデフォルトで扱われる。
自己回帰モデルでは、トークン化器の粒度は、1つの前方通過でモデルが解決しなければならないものを決定する。
これは学習問題の難しさとモデルの内部に現れる表現の両方に影響を与える。
- 参考スコア(独自算出の注目度): 10.546694596577057
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Tokenization in language models is treated by default as an input preprocessing decision. We argue that this framing is incomplete: in autoregressive models, tokenizer granularity determines what the model must resolve in a single forward pass, and therefore the supervision signal it receives. This affects both the difficulty of the learning problem and the representations that emerge inside the model. We test this in a controlled experiment on numeric reasoning with a novel decoupling of input and output tokenization. As the output supervision view predicts, differences in task performance, training dynamics, and model internals are induced by output tokenization and largely invariant to input tokenization. This may matter in practice, because models with different tokenization strategies differ not only in input representation but in the task they were trained on. Comparisons between models may thus partly reflect task definition rather than ability. A survey of 120 recent *CL papers on numeric reasoning confirms that this is rarely acknowledged: only about 10% report the numeric tokenization of the models they evaluate, while 69% compare across tokenization, and thus supervision, regimes without reporting it. While prior work documents that tokenization consistently affects model performance, there is no principled account of why. We argue that framing tokenization as output supervision provides that account.
- Abstract(参考訳): 言語モデルのトークン化は、入力前処理決定としてデフォルトで扱われる。
自己回帰モデルでは、トークンーザの粒度は、1つの前方通過でモデルが解決しなければならないものを決定し、従ってそれが受け取る監督信号を決定する。
これは学習問題の難しさとモデル内部に現れる表現の両方に影響を与える。
我々は、入力と出力のトークン化を分離した新しい数値推論の制御実験でこれを検証した。
出力監視ビューが予測すると、タスクパフォーマンス、トレーニングダイナミクス、モデル内部の違いは、出力トークン化によって誘導され、入力トークン化にほとんど不変である。
なぜなら、異なるトークン化戦略を持つモデルは入力表現だけでなく、訓練されたタスクでも異なるからです。
したがって、モデル間の比較は、能力よりもタスク定義を部分的に反映する可能性がある。
数値推論に関する最近の120の*CL論文の調査では、これがほとんど認められていないことが確認されている: 評価したモデルの数値トークン化を報告したのは10%程度であり、一方、69%はトークン化を比較し、その結果、それを報告せずにレジームを監督している。
トークン化がモデルパフォーマンスに一貫した影響を及ぼすような以前の作業資料は存在するが、その理由に関する原則的な説明はない。
我々は、フレーミングトークン化をアウトプットの監督として提供すると論じている。
関連論文リスト
- Instructions Shape Production of Language, not Processing [26.122385256608208]
インストラクションは、言語モデルで生産中心のメカニズムをトリガーする。
本稿では,このメカニズムを2段階間の非対称性として,タスク固有情報を階層的に探索することによって明らかにする。
本研究は,モデル能力の理解には内部と行動の協調的評価が必要であることを示唆する。
論文 参考訳(メタデータ) (2026-05-11T20:21:04Z) - Pando: Do Interpretability Methods Work When Models Won't Explain Themselves? [53.07826484214082]
モデル・オーガニゼーションのベンチマークであるPandoを紹介します。
Pandoは、ラベル付きクエリ-レスポンスペアから、ホールドアウトモデル決定を予測する。
説明が忠実であれば、ブラックボックスの引用はすべてのホワイトボックスメソッドに一致するか、超える。
論文 参考訳(メタデータ) (2026-04-13T06:42:24Z) - Broken Tokens? Your Language Model can Secretly Handle Non-Canonical Tokenizations [83.93566096400723]
ランダムにサンプリングされたトークン化が与えられた場合、命令調整されたモデルは元の性能の最大93.4%を維持している。
文字レベルのセグメンテーションは文字列操作とコード理解タスクを最大+14%改善する。
右列桁のグルーピングは、大数の算術を+33%向上させる。
論文 参考訳(メタデータ) (2025-06-23T18:02:26Z) - Understanding and Mitigating Tokenization Bias in Language Models [6.418593476658017]
State-of-the-art言語モデルは自己回帰型であり、トークンとして知られるサブワード単位で動作する。
一般的な符号化方式は、より多くのトレーニングやデータで緩和できないサンプリングバイアスを引き起こすことを示す。
トークン化データに基づいて訓練された任意の言語モデルからバイアスのない推定値を得るための新しいアルゴリズムを提案する。
論文 参考訳(メタデータ) (2024-06-24T17:38:02Z) - Tokenization counts: the impact of tokenization on arithmetic in
frontier LLMs [3.6722413665749674]
トークン化とは、入力テキストを入力トークンに分割することである。
この選択が算術的タスクを用いて数値推論に与える影響について検討する。
論文 参考訳(メタデータ) (2024-02-22T18:14:09Z) - Tokenization Consistency Matters for Generative Models on Extractive NLP
Tasks [54.306234256074255]
生成モデルの訓練において一般的に無視されるトークン化の不整合の問題を特定する。
この問題は、入力と出力が無矛盾にトークン化されると、これらのタスクの抽出特性を損なう。
一貫性のあるトークン化では、ドメイン内のデータセットとドメイン外のデータセットの両方で、モデルのパフォーマンスが向上することを示す。
論文 参考訳(メタデータ) (2022-12-19T23:33:21Z) - Counterfactual Invariance to Spurious Correlations: Why and How to Pass
Stress Tests [87.60900567941428]
素早い相関」とは、アナリストが重要とすべきでないと考える入力データのある側面に対するモデルの依存である。
機械学習では、これらにはノウ・イ・ウ・ウ・ウ・ウ・ウ・ウ・ウ・ウ・ウ・ウ・ウ・ウ・ウ・ウ・ウ・ウ・ウ・ウ・ウ・ウ・ウ・ウ・ウ・ウ・ウ・ウ・ウ・ウ・ウ・ウ」という特徴がある。
因果推論ツールを用いたストレステストについて検討した。
論文 参考訳(メタデータ) (2021-05-31T14:39:38Z) - How do Decisions Emerge across Layers in Neural Models? Interpretation
with Differentiable Masking [70.92463223410225]
DiffMaskは、差分性を維持しながら入力のサブセットをマスクアウトすることを学ぶ。
入力トークンを包含または無視する決定は、中間隠蔽層に基づく単純なモデルで行われる。
これにより、属性のヒートマップをプロットするだけでなく、ネットワーク層間で意思決定がどのように形成されるかを分析することができます。
論文 参考訳(メタデータ) (2020-04-30T17:36:14Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。