論文の概要: Adversarial Test-Hardening for AI-Written Code: An Instrument Autopsy and a Pre-Registered Causal Estimate of the Critic Loop
- arxiv url: http://arxiv.org/abs/2607.23002v1
- Date: Sat, 25 Jul 2026 02:38:07 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 22:34:14.962955
- Title: Adversarial Test-Hardening for AI-Written Code: An Instrument Autopsy and a Pre-Registered Causal Estimate of the Critic Loop
- Title(参考訳): AI書字コードに対する対角的テストハーデニング:機器オートプシーと批判ループの事前登録因果推定
- Abstract要約: メカニカルオラクル下での対向試験硬化ループについて検討した。
テスタモデルはテストを書き、変異テスト名は生き残った欠陥を注入し、Cryticモデルはテストを書き、それらを正確に実行します。
私たちは、すべてのレシートと分析コードの両方のプロトコルをリリースします。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language models increasingly write both code and the tests meant to check it; coverage records what ran, not what was verified. We study an adversarial test-hardening loop under a mechanical oracle: a Tester model writes tests, mutation testing names surviving injected defects, and a Critic model writes tests to kill exactly those, with every verdict decided mechanically, so no model judges another's output. In Experiment 1, on five Python subjects (one same-lineage-loop cell could not be scored), the loop killed 105 mutants that one-shot generation missed and lost none, and the cross-lineage-Critic question returned a pre-declared null. The central finding was an autopsy: an earlier analysis reported a cross-lineage effect at p = 9.5e-66 that was an instrument artifact, an output cap silently truncating the verbose model, caught only by adversarial review of the completed analysis. Review then found a further confound, each arm resampling its own initial suite; Experiment 2 removes it. Under a pre-registered frozen-shared-round-0 design (five replicates on each of four subjects, seeds committed in advance), same-lineage Critic rounds killed 78% of the survivors the frozen initial suite left standing (mean incremental kill rate 0.783, 95% cluster-bootstrap interval [0.592, 0.935]), a within-replicate causal estimate; the cross-provider configuration showed a positive pilot difference (rate gap 0.178, 95% interval [0.039, 0.347]; magnitude dominated by a single replicate) at 5.5x lower arm cost. This compares two named model-provider-harness configurations, not an isolated lineage effect: part of the gap is one configuration's receipted operational failures, including truncation recurrences, now detected and scored rather than laundered. Cross-model comparisons can inherit the asymmetries of the harness that runs them. We release both protocols, all receipts, and the analysis code.
- Abstract(参考訳): 大規模な言語モデルでは,コードとテストの両方をチェック対象として記述するようになっている。
テスタモデルは、テストを書き、変異テストの名前が残っている欠陥を注入し、批判モデルは、正確にそれらを殺すためにテストを書き、全ての判定が機械的に決定されるので、モデルは、他のモデルの出力を判断しない。
実験1では、Pythonの5つの被験者(同じ行数ループの細胞が1つ獲得できなかった)において、ループは1ショット世代が見逃して失くした105のミュータントを殺害し、クロスライン数-Criticの質問は事前に宣言されたnullを返す。
p = 9.5e-66 は楽器のアーチファクトであり、出力キャップは無声で動詞のモデルを切断し、完了した解析の逆のレビューによってのみ捕捉される。
レビューではさらに、各アームが独自の初期スイートを再サンプリングし、実験2で取り除いた。
予備登録された冷凍Shared-round-0の設計(4つの被験者の5つの複製、前もって行われたシード)の下で、同系批判弾は生存者の78%を死亡させ、凍結された初期組立体が残った(即ち増分的なキルレート 0.783, 95% クラスタブートストラップ間隔 [0.592, 0.935])、また、クロスプロビデント構成は、前向きなパイロット差(レートギャップ 0.178, 95% インターバル [0.039, 0.347]; 単一複製で圧倒される)を5.5倍の低いアームコストで示した。
これは、分離された系統効果ではなく、2つの名前のモデル-プロジェクタ-ハーネス構成を比較する: ギャップの一部は、1つの構成が受け入れた運用上の障害であり、トランケーションの再発を含む。
モデル間の比較は、それらを実行するハーネスの対称性を継承することができる。
私たちは、すべてのレシートと分析コードの両方のプロトコルをリリースします。
関連論文リスト
- The Model Proposes, the Code Disposes: A Pre-Registered Ablation of a Verifier-and-Acceptance Stage in an LLM-Orchestrated Offensive-Security Agent [0.0]
決定的コードによって検証が強制されるモデル検証装置である検証受理段階が、LCMが主導する攻撃セキュリティエージェントが報告するものを変更するかどうかを評価する。
本報告では,15回の探索パイロット,20回の予備登録検定アブレーション,および2回の故意に脆弱な検査対象を40回実施した2×2因子分析を行った。
検証者はシステムが提供するものを変更し、決定論的コードは強制と監査性を提供します。
論文 参考訳(メタデータ) (2026-09-14T17:13:05Z) - Clean Engineering, Unstable Measurement: A Preregistered Reliability Failure of Black-Box LLM Observers on Shared Endpoints [4.41537705949485]
言語モデル審査員は、トレーニングデータをゲートし、世代をスコアし、リーダーボードを駆動する。
我々は、事前登録された2つのキャンペーンにおいて、すべてのしきい値が事前に固定された状態で、その仮定を監査した。
52,988件の要求を監査し、スピアマン0.400で0.90と一致した。
証拠を3段階のスナップショット識別はしご、8つの設計ルール、レポートチェックリストに抽出する。
論文 参考訳(メタデータ) (2026-09-03T17:59:43Z) - The Blending Ratio Is Not Where the Performance Is: Diagnosing Prototype Blending for Few-Shot Adaptation of Vision-Language Models [22.461983628330277]
多くの少数ショット適応手法は、ゼロショットテキストプロトタイプとKラベル付き画像特徴の平均の凸の組み合わせで分類される。
正しい比率は何か、検証データなしで見積もることができるのか、パフォーマンスがどこにあるのかを尋ねる。
4800以上の細胞(SigLIPを含む5つのバックボーン、5つのショットカウント、5つのシード、4つのプロンプトレベル)が、理論上最適な比率は間違った量の信頼できる推定値である。
検証不要な線形プローブは、オラクルチューニングされたブレンド(CLAPは+1.9ポイント、LP++は+1.5ポイント)を破る。
論文 参考訳(メタデータ) (2026-08-23T15:02:33Z) - Agent Behavioral Contracts II: Certifying Compositional Reliability Without Assuming Independence [0.0]
1つのモデルの2つの例は、2つのエージェントのハンドオフにおいて、ミッションの90.0%で共失敗する。
異なるモデルの置換は、6つのコントラストのうち6つのコントラストの関連を減少させる。
論文 参考訳(メタデータ) (2026-08-13T07:25:05Z) - Excess Separability: Nuisance-Controlled Residual-Stream Probing for Benchmark Contamination Detection [0.0]
ベンチマーク汚染はn-gram重なり、可能性に基づくメンバーシップ推論、カナリア文字列と診断される。
これを行う自然な方法はうまくいかないことを示し、測定を生き残るものを特定し、それを動作させる補正が、テストされるnullよりも多くのばらつきをもたらすことを見つけます。
論文 参考訳(メタデータ) (2026-08-12T23:27:20Z) - Caliber: Cross-Architecture Extraction-Cost Control for Score-Returning APIs [27.21644231867863]
Caliberは、キャリブレーション問題としてノイズ選択を定式化するモデル抽出に対する防御である。
知識蒸留に返却されたスコアを使用する攻撃者に対して、Caliberは独立して同一に分散したガウスノイズを内部ロジットに追加する。
Caliberは、正方形中央2対数辺による雑音分散を正規化し、その結果の雑音効用関係をロジスティック曲線に適合させる。
論文 参考訳(メタデータ) (2026-08-02T05:58:00Z) - Layer-Isolated Evaluation: Gating the Deterministic Scaffold of a Production LLM Agent with a No-LLM, Regression-Locked Test Harness [45.148328075418156]
デプロイされた注文エージェントは、階層の固定された分類に分解される。
純粋なスイートは、ロックされたスライス単位のベースラインに対して、すべての変更でCIで動作する。
制御されたレグレッションインジェクションにより、安全でない7つの層に一度に1つの層を分解し、検証する。
論文 参考訳(メタデータ) (2026-06-10T05:55:13Z) - Let the Results Speak: A Replication-First Paradigm for LLM Behavioral Benchmarking [22.825786049667602]
本稿では,1つのヒト・ラタのコンセンサスに有効性を確保するために,複製第一パラダイムを提案する。
楽器を4つの特性で認証する - Kランの信頼性、アーキテクチャ的に異なる審査員間のクロスインストラクトレプリケーション、以前のトレーニングコホートからの審査員による歴史的フットプリントキャリブレーション、事前登録された予測。
本研究は, 自己発達型データ駆動による情緒的伴奏で, 次元は事前に決められず, 手順は9次元に安定化する。
論文 参考訳(メタデータ) (2026-05-27T03:41:11Z) - Retrying vs Resampling in AI Control [0.42970700836450476]
我々は、AI制御の観点から再試行を行い、モデルが潜在的に敵対的なものとして扱う。
再試行は正直な疑念のスコアを減少させるが、信頼できないモデルは監視の合理性を利用してスニーカー攻撃を構築することができる。
論文 参考訳(メタデータ) (2026-05-25T17:10:41Z) - When Do LLM Agents Treat Surface Noise Differently from Semantic Noise? A 68-Cell Measurement Study with a Held-Out Trace-Level Validation [9.055086193088083]
10大言語モデルによって駆動されるチェーン・オブ・シンクとReActエージェントに経験的現象を記述した。
平均的な摂動は、同等の厳しさのプレゼンテーション摂動よりも、最終的な答えを頻繁に変更する。
論文 参考訳(メタデータ) (2026-05-25T15:57:11Z) - Distributional Energy-Based Models for Uncertainty-Aware Structured LLM Reasoning [40.342912574072024]
大規模言語モデルは、旅行計画やコードソリューションのような構造化されたアウトプットを生成する。
個々の推論ステップは正しく見えるが、アウトプット全体が予算に違反したり、テストケースに失敗したり、あるいは以前の推論に矛盾することがある。
構造化LCM出力の検証のための決定論的解析制約付き学習品質スコアラを提案する。
論文 参考訳(メタデータ) (2026-05-15T17:08:27Z) - Auto Research with Specialist Agents Develops Effective and Non-Trivial Training Recipes [24.516406575400016]
外部測定により駆動される閉じた経験ループとしての自動車研究について検討する。
提出された各トライアルには、仮説、実行可能なコード編集、評価者が所有する結果、次の提案を形作るフィードバックが含まれる。
このループを、レシピの表面を分割し、試行錯誤で測定された系統を共有する専門エージェントでインスタンス化する。
論文 参考訳(メタデータ) (2026-05-07T06:13:43Z) - Causal Understanding by LLMs: The Role of Uncertainty [43.87879175532034]
近年の論文では、LLMは因果関係分類においてほぼランダムな精度を達成している。
因果的事例への事前曝露が因果的理解を改善するか否かを検討する。
論文 参考訳(メタデータ) (2025-09-24T13:06:35Z) - RULSurv: A probabilistic survival-based method for early censoring-aware prediction of remaining useful life in ball bearings [39.58317527488534]
Kullback-Leibler分散とRUL推定を用いた早期故障検出のための新しいフレキシブルな手法を提案する。
我々は,XJTU-SYデータセットにおいて,3つの異なる操作条件にまたがる5倍のクロスバリデーション戦略を用いてアプローチを実証する。
提案手法は,最大荷重下での5軸受の平均累積相対精度(CRA)を0.7586で達成し,複数の最先端ベースラインを改良する。
論文 参考訳(メタデータ) (2024-05-02T16:17:29Z) - Predicting Survival Time of Ball Bearings in the Presence of Censoring [44.99833362998488]
本研究では,ボール軸受の故障時期を生存解析を用いて予測する新しい手法を提案する。
我々は、周波数領域におけるベアリングデータを解析し、Kullback-Leiblerの発散と標準偏差を比較することで、ベアリングが故障した場合にアノテートする。
我々は、注釈付きデータに基づいて失敗する時間を推定するために、いくつかの生存モデルを訓練する。
論文 参考訳(メタデータ) (2023-09-13T08:30:31Z) - TACRED Revisited: A Thorough Evaluation of the TACRED Relation
Extraction Task [80.38130122127882]
TACREDはリレーショナル抽出(RE)において最も大きく、最も広く使われているクラウドソースデータセットの1つである
パフォーマンスの天井に到達したのか、改善の余地はあるのか?
ラベルエラーは絶対F1テストエラーの8%を占めており、例の50%以上を可逆化する必要がある。
論文 参考訳(メタデータ) (2020-04-30T15:07:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。