論文の概要: Same Text, Different Prediction: Serving-Context Nondeterminism in Text Classifiers
- arxiv url: http://arxiv.org/abs/2610.09111v1
- Date: Tue, 06 Oct 2026 21:02:25 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 21:58:22.604702
- Title: Same Text, Different Prediction: Serving-Context Nondeterminism in Text Classifiers
- Title(参考訳): 同じテキスト, 異なる予測: テキスト分類器における実時間非決定性
- Abstract要約: バッチサイズ、バッチ構成、ハードウェア、推論エンジンなどの変更要素は、生成されたテキストを変更することができる。
テキスト分類にどの程度、いつ、どの程度、同じ要因が影響するかは、まだ不明である。
差別的,疑似生成的,完全生成的分類器の定式化にまたがる180のモデルを訓練し,それぞれがサービスコンテキストの4つのカテゴリにまたがって評価する。
- 参考スコア(独自算出の注目度): 3.700463358780727
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Deterministic inference is essential for reliable and trustworthy machine learning. Prior studies of text generation have shown that changing factors such as batch size, batch composition, hardware, or inference engine can alter the generated text, even when the prompt, model parameters, and sampling randomness are fixed. These differences have been attributed in part to floating-point non-associativity, shape-dependent kernel selection, and other implementation-level differences in numerical execution. However, it remains unclear whether, when, and to what extent the same factors affect text classification. We present a systematic study of serving-context non-invariance in text classifiers, which prior work has measured only through generated text. We train 180 models spanning discriminative, pseudo-generative, and fully generative classifier formulations and evaluate each across four categories of serving contexts, holding the checkpoint and the text fixed. Label stability does not imply score stability. Changing only the batch shape changes no labels across fp32 comparisons, yet under bf16 it moves up to 56.7 percentage points of predicted probability mass, with label changes concentrated at small margins. Fully generative classifiers change more labels than their discriminative counterparts under the same serving changes. We derive sufficient conditions for label stability under each serving change and give a separate mitigation for each mechanism. Our results identify and quantify the serving conditions that must be fixed for reproducible text classification.
- Abstract(参考訳): 決定論的推論は信頼性と信頼性のある機械学習に不可欠である。
テキスト生成の以前の研究では、プロンプト、モデルパラメータ、サンプリングランダムネスが固定された場合でも、バッチサイズ、バッチ合成、ハードウェア、推論エンジンなどの変更要因が生成したテキストを変更可能であることが示されている。
これらの違いは、浮動小数点非連想性、形状に依存しないカーネル選択、その他の数値実行における実装レベルの違いに起因する。
しかし、いつ、いつ、どの程度、同じ要因がテキスト分類に影響を及ぼすかは定かではない。
本稿では,テキスト分類器におけるサービス・コンテキストの非不変性に関する体系的研究を行い,それ以前の作業は生成したテキストによってのみ測定された。
識別型,擬似生成型,完全生成型分類器の定式化を対象とする180のモデルを訓練し,チェックポイントとテキストを固定した4つのカテゴリで評価する。
ラベル安定性は安定性を損なうものではない。
fp32の比較でラベルは変更されていないが、bf16では予測される確率質量の56.7ポイントまで移動し、ラベルの変更は小さなマージンに集中している。
完全な生成的分類器は、同じサービス変更の下で識別的分類器よりも多くのラベルを変更する。
我々は各サービス変更の下でラベル安定性の十分な条件を導出し、各メカニズムを個別に緩和する。
本結果は,再現性のあるテキスト分類のために修正しなければならないサービス条件を特定し,定量化する。
関連論文リスト
- Accurate and Efficient Statistical Testing for Word Semantic Breadth [0.0]
分散に基づく統計は、文脈的多様性のプロキシとして機能する。
そこで本研究では,方向の相違から相違点を分離するために,世帯適応型変質試験を提案する。
本手法は, 真の広帯域差に対する感度を保ちながら, Type-I誤差を32.5%削減する。
論文 参考訳(メタデータ) (2026-05-08T17:38:36Z) - Uncertainty Estimation for the Open-Set Text Classification systems [1.0557657302168184]
テキスト領域に対するホロスティック不確実性推定法(HolUE)を適用する。
テキスト認識システムにおける予測誤りの主な原因は,不規則な定式化クエリに起因するテキストの不確かさと,データ分布のあいまいさに関連するギャラリーの不確かさである。
論文 参考訳(メタデータ) (2026-03-17T12:25:34Z) - One Size Does Not Fit All: Exploring Variable Thresholds for Distance-Based Multi-Label Text Classification [1.8165993946919816]
距離に基づく教師なしテキスト分類では、ラベルとテキスト間の意味的類似性を使用してラベルの関連性を決定する。
類似度分布は、モデル、データセット、さらにはラベルセットの間で統計的に有意な差異を示す。
検証セットを用いてラベル固有の閾値を最適化する新しい手法を提案する。
論文 参考訳(メタデータ) (2025-10-13T08:52:14Z) - Group-Adaptive Threshold Optimization for Robust AI-Generated Text Detection [58.419940585826744]
本稿では,確率的AIテキスト検出のためのグループ固有しきい値最適化アルゴリズムであるFairOPTを紹介する。
属性(例えば、テキストの長さと書き込みスタイル)に基づいてデータをサブグループに分割し、FairOPTを実装して、各グループに対する決定しきい値の学習を行い、不一致を低減しました。
我々のフレームワークは、後処理によるAI生成コンテンツ検出において、より堅牢な分類の道を開く。
論文 参考訳(メタデータ) (2025-02-06T21:58:48Z) - Estimating Confidence of Predictions of Individual Classifiers and Their
Ensembles for the Genre Classification Task [0.0]
Genre IDは、非トピックテキスト分類のサブクラスである。
BERTやXLM-RoBERTaのような事前訓練されたトランスフォーマーに基づく神経モデルは、多くのNLPタスクにおいてSOTA結果を示す。
論文 参考訳(メタデータ) (2022-06-15T09:59:05Z) - Class-Similarity Based Label Smoothing for Confidence Calibration [2.055949720959582]
信頼性校正を改善するため,新しいラベルスムーシング方式を提案する。
異なるクラスは固有の類似性が異なるため、より類似したクラスは最終的な出力においてより近い確率値をもたらす。
これは、ラベル値が参照クラスと類似性に基づいている新しいスムーズなラベルの開発を動機付けている。
論文 参考訳(メタデータ) (2020-06-24T20:26:22Z) - Certified Robustness to Label-Flipping Attacks via Randomized Smoothing [105.91827623768724]
機械学習アルゴリズムは、データ中毒攻撃の影響を受けやすい。
任意の関数に対するランダム化スムージングの統一的なビューを示す。
本稿では,一般的なデータ中毒攻撃に対して,ポイントワイズで確実に堅牢な分類器を構築するための新しい戦略を提案する。
論文 参考訳(メタデータ) (2020-02-07T21:28:30Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。