論文の概要: Amplifying, Not Learning: Fine-Tuned AI Text Detectors Amplify a Pretrained Direction
- arxiv url: http://arxiv.org/abs/2605.21653v1
- Date: Wed, 20 May 2026 19:08:38 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-22 16:35:41.967453
- Title: Amplifying, Not Learning: Fine-Tuned AI Text Detectors Amplify a Pretrained Direction
- Title(参考訳): Amplifying, not learning: Fine-Tuned AI Text Detectors Amplify a Pretrained Direction
- Authors: Alexander Smirnov,
- Abstract要約: テキスト検出器は、事前訓練された典型軸を増幅する。
タスク監督前の生エンコーダでは、3つのアーキテクチャでNYT-vs-HC3 AUROC 0.806/0.944/0.834を達成する。
RoBERTaベースでは、生のプロジェクションは微調整を超えるが、RoBERTaベースでは、フル微調整は、試験された流線型人口の双方で生よりも識別を小さくする。
- 参考スコア(独自算出の注目度): 51.56484100374058
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: AI text detectors amplify a pretrained typicality axis; they do not construct an AI-vs-human boundary. On raw encoders before any task supervision, projecting onto centroid(AI)-centroid(HC3) achieves NYT-vs-HC3 AUROC 0.806/0.944/0.834 across three architectures (86-106% of the fine-tuned discrimination ceiling: on RoBERTa-base, raw projection exceeds fine-tuning); on RoBERTa-base, full fine-tuning reduces discrimination below raw on both fluent-formal populations tested. The same axis inverts on non-native ESL writing (AUROC 0.06-0.20) -- a falsifiable prediction unique to the typicality reading. A 24-example frozen probe matches full fine-tuning (0.900 vs 0.895). A closed-form Jacobian predictor parameterises axis-manipulating interventions with R^2 = 1.000 universal, lifts ELECTRA-CE deployment TPR from 0.000 to 0.904 at FPR = 1%, and transfers to three independently-trained third-party RoBERTa detectors at 16/16 oracle-equivalence (57% NYT-FPR reduction on the OpenAI detector). Scope: encoder family; mechanism magnitude HC3-anchored; population-level shared axis with per-text mechanisms varying across architectures. Three operationally distinct probes -- text-surface caps_rate residualisation, geometric signed-epsilon ablation, closed-form text-pair predictor -- agree at cos 0.74/0.81/1.00 across three architectures, confirming observer-invariance. Under matched-TPR-0.90 evaluation, the published intervention zoo (CC, dealign-f2c) is calibration-equivalent across 27 cells (|Delta AUROC| <= 0.0081), and >= 97% of the LoRA->full-FT bias gap on ELECTRA is calibration shift, not learned representation -- the central claim's prediction confirmed.
- Abstract(参考訳): AIテキスト検出器は、トレーニング済みの典型軸を増幅する。
タスク監督前の生のエンコーダでは、Centroid(AI)-centroid(HC3)に投影すると、3つのアーキテクチャでNYT-vs-HC3 AUROC 0.806/0.944/0.834が得られる(RoBERTaベースでは生のプロジェクションが微調整される)。
同じ軸は、非ネイティブESL書き込み(AUROC 0.06-0.20)を反転させる。
24サンプルの凍結プローブは完全な微調整(0.900対0.895)と一致する。
閉形式ジャコビアン予測器は、R^2 = 1.000ユニバーサルでの軸方向操作の介入をパラメータ化し、ELECTRA-CEデプロイメントTPRを0.000から0.904までFPR = 1%に引き上げ、独立に訓練された3つのサードパーティのRoBERTa検出器に16/16のオラクル等価度で転送する(OpenAI検出器の57% NYT-FPR削減)。
スコープ:エンコーダファミリー、機構の大きさ HC3-アンコール; アーキテクチャによって異なるテキスト単位のメカニズムを持つ集団レベルの共有軸。
操作的に異なる3つのプローブ、すなわち、テキスト表面のキャップ_rate残基化、幾何学的符号付きエプシロンアブレーション、クローズドフォームのテキストペア予測器は、3つのアーキテクチャにわたるcos 0.74/0.81/1.00で一致し、オブザーバ不変性を確認する。
AUROC| <= 0.0081) と >== ELECTRA における LoRA->full-FT バイアスギャップの 97% は校正シフトであり、表現は学習されていない。
関連論文リスト
- Optimised Support Vector Regression for California Housing Price Prediction: The Critical Role of Feature Engineering and Hyperparameter Tuning [0.0]
Support Vector Regressionは、California Housingベンチマークデータセットで最も弱いパフォーマーの1つとして引用されている。
本稿では,従来報告されていた性能が,アルゴリズムに固有の制限ではなく,実験的な構成選択を反映しているかどうかを検討する。
チューニングされたSVRは、以前報告されたSVR結果よりも0.123ポイントの絶対的な改善である0.723の試験R2を達成する。
論文 参考訳(メタデータ) (2026-05-09T03:58:50Z) - Harmful Intent as a Geometrically Recoverable Feature of LLM Residual Streams [0.0]
有害な意図は、大きな言語モデル残ストリームから幾何的に回復可能である。
我々はこの幾何学を6つの方向決定戦略によって特徴づける。
AdvBenchはホールドアウトのHarmBenchとJailbreakBenchにAUROC 0.96で転送される。
論文 参考訳(メタデータ) (2026-04-20T23:02:37Z) - LEADER: Learning Reliable Local-to-Global Correspondences for LiDAR Relocalization [44.37632368250295]
我々は,単純かつ効果的な幾何エンコーダによって強化されたロバストなLiDARベースの再ローカライズフレームワークであるLEADERを提案する。
オックスフォード・ロボットカーとNCLTデータセットの実験は、LEADERが最先端の手法より優れていることを示した。
論文 参考訳(メタデータ) (2026-04-13T11:52:29Z) - Spectral Signatures of Data Quality: Eigenvalue Tail Index as a Diagnostic for Label Noise in Neural Networks [0.0]
ニューラルネットワークの重み行列のスペクトル特性がテスト精度を予測できるかどうかを検討する。
制御されたラベルノイズの下では、ネットワークのボトルネック層における固有値分布のテール指数アルファは、残響R2 = 0.984(21ノイズレベル、3シードレベル)でテスト精度を予測する。
我々は,この署名の軌跡として情報処理ボトルネック層を同定し,ランダム行列モデルにおけるBBP相転移と観測を結びつける。
論文 参考訳(メタデータ) (2026-03-29T21:53:24Z) - Multi-Task Deep Learning for Surface Metrology [0.0]
表面テクスチャパラメータを予測するために,再現可能な深層学習フレームワークを提案する。
不確実性は、量子的およびヘテロセダスティックなヘッドによってモデル化され、ポストホック共形キャリブレーションにより、キャリブレーションされた間隔が生成される。
論文 参考訳(メタデータ) (2025-10-23T08:38:18Z) - Real-time nonlinear inversion of magnetic resonance elastography with operator learning [0.06797079068199119]
oNLIフレームワークは、NLIに匹敵する空間精度を持つエラストグラムのリアルタイムMREインバージョン(30,000倍高速化)を可能にする。
MRE文学におけるソフト事前正規化に類似した構造的事前機構が,空間的精度を向上させるために組み込まれている。
論文 参考訳(メタデータ) (2025-10-03T08:55:40Z) - Group-Adaptive Threshold Optimization for Robust AI-Generated Text Detection [58.419940585826744]
本稿では,確率的AIテキスト検出のためのグループ固有しきい値最適化アルゴリズムであるFairOPTを紹介する。
属性(例えば、テキストの長さと書き込みスタイル)に基づいてデータをサブグループに分割し、FairOPTを実装して、各グループに対する決定しきい値の学習を行い、不一致を低減しました。
我々のフレームワークは、後処理によるAI生成コンテンツ検出において、より堅牢な分類の道を開く。
論文 参考訳(メタデータ) (2025-02-06T21:58:48Z) - Robust Representation via Dynamic Feature Aggregation [44.927408735490005]
ディープ畳み込みニューラルネットワーク(CNN)ベースのモデルは、敵の攻撃に対して脆弱である。
本稿では,新しい正規化により埋め込み空間を圧縮する動的特徴集約法を提案する。
CIFAR-10における攻撃法の平均精度は56.91%である。
論文 参考訳(メタデータ) (2022-05-16T06:22:15Z) - Uncertainty-Aware Camera Pose Estimation from Points and Lines [101.03675842534415]
Perspective-n-Point-and-Line (Pn$PL) は、2D-3D特徴座標の3Dモデルに関して、高速で正確で堅牢なカメラローカライゼーションを目指している。
論文 参考訳(メタデータ) (2021-07-08T15:19:36Z) - HuBERT: Self-Supervised Speech Representation Learning by Masked
Prediction of Hidden Units [81.53783563025084]
本稿では、BERTのような予測損失に対して、アライメントされたターゲットラベルを提供するオフラインクラスタリングステップを提案する。
提案手法の重要な要素は,マスク領域にのみ予測損失を適用することである。
HuBERTは、より困難なdev-otherおよびtest-other評価サブセットに対して、最大19%と13%の相対的なWER削減を示す。
論文 参考訳(メタデータ) (2021-06-14T14:14:28Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。