論文の概要: When a Data Artifact Isn't a Shortcut: Causal Auditing of Synthetic RLVR Corpora
- arxiv url: http://arxiv.org/abs/2610.00202v1
- Date: Sun, 20 Sep 2026 11:31:26 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-05 14:48:16.396194
- Title: When a Data Artifact Isn't a Shortcut: Causal Auditing of Synthetic RLVR Corpora
- Title(参考訳): データアーチファクトがショートカットでない場合:合成RLVRコーパスの因果監査
- Abstract要約: 我々は、パラフレーズマッチング制御コーパスを構築し、腕に同じ大きさのトレーニングセットを保持し、1つの固定予算の下で2つのポリシーを訓練する。
エクスプロイトギャップは、修正されていないデータアームを好まない: 0.021 対 0.027 対 0.021 である。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Several recent pipelines build RLVR training data by masking a span of real corpus text and asking a language model to invent plausible wrong answers around it. The correct option is therefore genuine human prose; every distractor is synthetic. Correctness and provenance become entangled, and a policy could in principle learn the second instead of the first. We audit that possibility in GooseReason-0.7M. First we ask whether the asymmetry is visible at all: a classifier reading only five surface statistics (never the meaning) reaches AUROC 0.562 over 315,499 options, barely above chance. The aggregate hides something, though. Code sits at 0.416, below chance, and manual inspection explains why: code distractors turn out to be single-operator mutations of the gold answer rather than freely written alternatives, so the two classes are nearly identical by construction. Detecting a signal is not the same as showing a model uses it, so we then run an intervention. We build a paraphrase-matched control corpus, hold training-set size identical across arms, and train two policies under one fixed budget. The exploitation gap does not favour the unmodified-data arm: 0.021 against 0.027 for the control. Under our budget, in other words, a detectable artifact went unexploited. We think that dissociation, along with the domain-specific construction finding, is worth knowing for anyone curating corpora of this kind, and we release the audit as a mostly CPU-only protocol.
- Abstract(参考訳): いくつかの最近のパイプラインは、実際のコーパステキストのスパンを隠蔽し、言語モデルに、その周りのもっともらしい間違った回答を発明するよう求めて、RLVRトレーニングデータを構築している。
したがって、正しい選択は本物の人間の散文であり、すべての散文は合成される。
正確さと証明が絡み合うようになり、原則として、ポリシーは1つではなく2つを学ぶことができる。
GooseReason-0.7Mでその可能性を監査する。
まず、非対称性が全く見えていないかどうかを問う: 5つの曲面統計値のみを読む分類器(意味なし)は、315,499のオプションでAUROC 0.562に達する。
しかし、集合体は何かを隠している。
コードインタプリタは、自由に書かれた代替案ではなく、金の答えの単一演算子変異であることが判明したので、2つのクラスはほぼ同じです。
信号の検出は、モデルが使用するものと同じではないので、介入を実行します。
我々は、パラフレーズマッチング制御コーパスを構築し、腕に同じ大きさのトレーニングセットを保持し、1つの固定予算の下で2つのポリシーを訓練する。
エクスプロイトギャップは、修正されていないデータアームを好まない: 0.021 対 0.027 対 0.021 である。
言い換えれば、私たちの予算の下では、検出可能なアーティファクトが公開されませんでした。
我々は、解離とドメイン固有の構成発見は、このようなコーパスをキュレートする人なら誰でも知っておく価値があると考えており、監査を主にCPUのみのプロトコルとしてリリースしています。
関連論文リスト
- Fusion Under Component Failure: Negative Results and Failure Modes in Ensemble AI-Generated Image Detection [1.3330055788395634]
我々は、AI生成画像検出のための通常の積み重ねアンサンブルを構築する。
3つのオープン・ディテクターが5つのスコアを発生させ、ディテクターの故障をデータ不足として扱います。
本稿は、これまでの結論を覆すものも含めて、どのようなコントロールが見つかったのかを報告する。
論文 参考訳(メタデータ) (2026-09-23T08:14:20Z) - Explaining AI-Image Detection: What the Heatmap Actually Shows [65.01025489527173]
私たちは検出器を構築し、その証拠として属性マップを添付します。
私たちは、そのペアがコントロール下の186,527のイメージにもたらすものを測定します。
属性ランキングが存在するかどうかは、検出器が画像に反応するかどうかに依存する。
論文 参考訳(メタデータ) (2026-07-31T16:07:05Z) - Adversarial Test-Hardening for AI-Written Code: An Instrument Autopsy and a Pre-Registered Causal Estimate of the Critic Loop [0.0]
メカニカルオラクル下での対向試験硬化ループについて検討した。
テスタモデルはテストを書き、変異テスト名は生き残った欠陥を注入し、Cryticモデルはテストを書き、それらを正確に実行します。
私たちは、すべてのレシートと分析コードの両方のプロトコルをリリースします。
論文 参考訳(メタデータ) (2026-07-25T02:38:07Z) - Retrying vs Resampling in AI Control [0.42970700836450476]
我々は、AI制御の観点から再試行を行い、モデルが潜在的に敵対的なものとして扱う。
再試行は正直な疑念のスコアを減少させるが、信頼できないモデルは監視の合理性を利用してスニーカー攻撃を構築することができる。
論文 参考訳(メタデータ) (2026-05-25T17:10:41Z) - The Geometry of Forgetting: Temporal Knowledge Drift as an Independent Axis in LLM Representations [50.43168858368539]
大規模言語モデルは自信を持って時代遅れの回答を生成し、既存の方法では検出できない。
これは工学的な失敗ではなく構造的な失敗であり、時間的ドリフトは、幾何的に残留流の方向として、正確性と不確実性の両方に符号化される。
論文 参考訳(メタデータ) (2026-05-09T22:27:31Z) - Beating the Style Detector: Three Hours of Agentic Research on the AI-Text Arms Race [3.9508043303559828]
実験的なNLP研究を再現するには数週間を要した。
全コード、648ドル(約6,800円)の原案、訓練された検出器、診断、および敵の軌道がリリースされている。
論文 参考訳(メタデータ) (2026-05-04T14:10:41Z) - Certified Robustness Under Bounded Levenshtein Distance [55.54271307451233]
畳み込み型分類器のリプシッツ定数をレヴェンシュテイン距離に対して計算する最初の方法を提案する。
我々の方法であるLipsLevは、それぞれ18.80ドル%と13.93ドル%の精度を1ドルと2ドルで得ることができる。
論文 参考訳(メタデータ) (2025-01-23T13:58:53Z) - Linear Contextual Bandits with Adversarial Corruptions [91.38793800392108]
本稿では,敵対的腐敗の存在下での線形文脈的包帯問題について検討する。
逆汚染レベルに適応する分散認識アルゴリズムをC$で提案する。
論文 参考訳(メタデータ) (2021-10-25T02:53:24Z) - Detection in Crowded Scenes: One Proposal, Multiple Predictions [79.28850977968833]
混み合ったシーンにおける高過度なインスタンスを検出することを目的とした,提案手法によるオブジェクト検出手法を提案する。
このアプローチの鍵は、各提案が以前の提案ベースのフレームワークの1つではなく、関連したインスタンスのセットを予測できるようにすることです。
我々の検出器は、CrowdHumanデータセットの挑戦に対して4.9%のAPゲインを得ることができ、CityPersonsデータセットでは1.0%$textMR-2$の改善がある。
論文 参考訳(メタデータ) (2020-03-20T09:48:53Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。