論文の概要: When Post-Anchor Metrics Fail: Stabilization Regimes in AI-Evidence Open-Source Projects
- arxiv url: http://arxiv.org/abs/2607.16979v1
- Date: Sat, 18 Jul 2026 22:04:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-21 18:48:37.314573
- Title: When Post-Anchor Metrics Fail: Stabilization Regimes in AI-Evidence Open-Source Projects
- Title(参考訳): AIエビデンスオープンソースプロジェクトの安定化レジーム
- Abstract要約: 耐久境界が導入された後に現れるテスト、CIゲート、ドキュメント、修正をカウントする、自然なメトリック、アンカーの安定化後の密度。
このメトリクスは、338の高可視性2026のGitHubリポジトリで失敗することを示している。
我々は、安定化体制を導入し、密度測定が失敗する理由を説明する6つの繰り返しパターンを導入し、人間の検証を使ってそれらを校正する。
- 参考スコア(独自算出の注目度): 0.6693008811143216
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Repository mining studies increasingly analyze AI-evidence projects, yet it remains unclear how to measure whether architectural changes create deferred stabilization obligations. A natural metric, post-anchor stabilization density, counts tests, CI gates, documentation, and fixes appearing after a durable boundary is introduced. We show that this metric fails. In a diff-level study of 338 high-visibility 2026 GitHub repositories, anchors are common (321 of 338 contain real changed-file anchor evidence), but a controlled 308-event contiguous-window experiment finds no post-anchor uplift: broad and strict stabilization signals both yield median post/pre density ratios near 1.0, and non-anchor controls are equally dense. We introduce stabilization regimes, six recurring patterns that explain why the density metric fails, and use human validation to calibrate them. Two independent coders label 100 stratified candidate-anchor events from blinded packets (kappa = 0.50 on debt attribution). The validation exposes a two-layer trap: many candidate anchors are not durable boundaries (45 of 100), and even among valid anchors in this calibration sample the no-uplift result holds: only 3 of 100 events survive as attributable delayed obligations; the remaining 97 are explained by classifier error, anchor-local hardening, background maintenance, or pre-anchor hardening. Post-anchor density conflates pervasive maintenance with genuine debt; controlled designs with regime-aware attribution are necessary before repository mining can reliably identify stabilization obligations.
- Abstract(参考訳): リポジトリマイニングの研究は、AIエビデンスプロジェクトの分析をますます進めているが、アーキテクチャの変更が遅延安定化義務を生み出すかどうかを計測する方法は、まだ不明である。
耐久境界が導入された後に現れるテスト、CIゲート、ドキュメント、修正をカウントする、自然なメトリック、アンカーの安定化後の密度。
私たちはこの指標が失敗することを示します。
338の高可視性2026のGitHubレポジトリを対象とした差分レベルの調査では、アンカーが一般的(321の338には、実際のファイルアンカー証拠が含まれている)であるが、コントロールされた308の連続ウィンドウ実験では、アンカーの上昇がない。
我々は、安定化体制を導入し、密度測定が失敗する理由を説明する6つの繰り返しパターンを導入し、人間の検証を使ってそれらを校正する。
2つの独立したコーダは、ブラインドパケットから100の階層化された候補アンカーイベントをラベル付けしている(Kappa = 0.50 on debt attribution)。
多くの候補アンカーが耐久性のあるバウンダリ(100のうち45)ではなく、このキャリブレーションサンプルの有効なアンカーであっても、ノー・アップリフトの結果は、100のイベントのうち3つだけが帰属的遅延義務として存続し、残りの97は分類器エラー、アンカー局所硬化、バックグラウンド保守、前アンカー硬化によって説明される。
リポジトリ・マイニングが安定化義務を確実に特定する前には、レシック・アウェア・アトリビューションによる制御された設計が必要である。
関連論文リスト
- When Validation Stops Learning: Auditing Update Admission for Continual Embodied Agents [8.579680185421324]
更新の受け入れは、エラー制御と学習機会の維持によって評価されなければならない、と我々は主張する。
標準対二項構成は、結果の不一致が稀な場合、この負担を軽減する。
学習力学のストレステストは、モデルバイアスとフィードバック選択誤差を区別する。
論文 参考訳(メタデータ) (2026-09-09T22:25:16Z) - SANE: State Anomaly Neutralization for Stable Extreme-Context Delta-Rule Models [53.86918766240095]
Delta-Ruleリカレントモデルは固定サイズの状態を維持しており、$O(1)$の推論メモリが可能であるが、極端なコンテキスト外挿では不安定になる可能性がある。
我々は,チャンク内並列構造を保ちながら,チャンク境界における適応$tanh$圧縮を適用したtextbfState Anomaly Neutralization (SANE)を提案する。
論文 参考訳(メタデータ) (2026-08-23T10:41:07Z) - An Omitted Mode Is a Rare Rule: The Sampling-Verification Danger Law in Continuous Code World Models [0.0]
GPT-5.xは111モードを含む合成ドローのうち105個の省略された1Dクランプを修復する。
2D領域では、ルールを回復するアーティファクトは存在しない(0/156)。
我々は、入場規則のクラスを、演奏中の全てのサンプルと正確に一致しているが、無害であることを示すので、識別性は楽器の計測可能な特性である。
論文 参考訳(メタデータ) (2026-08-18T16:09:51Z) - Conformal Changepoint Localization and Root Cause Analysis with Corrupted Observations [55.76952683833966]
本稿では,データ破損時の信頼性設定サイズを低減するために,重み付きCONCH(W-CONCH)と重み付きCROC(W-CROC)を提案する。
画像ベースおよび実世界の変化点と根本原因ベンチマークの実験は、不確実性ベースの重み付けが信頼性セットのサイズを大幅に減少させることを示している。
論文 参考訳(メタデータ) (2026-07-29T05:16:59Z) - Semantic Drift in Bug Resolution: How Behavioral Signals Propagate from Reports to Tests and Patches [18.727291516223115]
Desc2Fixは、バグレポートのセマンティックアライメント、テストのトリガー、開発者による修正を測定するフレームワークである。
GPT-4o と DeepSeek-Chat を用いて,Defects4J と SWT-Bench の2,857 個のレポート・パッチを解析した。
論文 参考訳(メタデータ) (2026-07-20T22:32:23Z) - Metric Aggregation Divergence: A Hidden Validity Threat in Agent-Based Policy Optimization and a Contractual Remedy [7.1976264551575895]
メートル法アグリゲーション分散(英: Metric aggregate divergence、MAD)は、エージェントベースのモデルにおいて、異なるパイプラインステージで発生するサイレント不整合である。
私たちは、ディスパッチ時に実施される単一の呼び出し可能なランタイムであるメトリックコントラクトを、対策として紹介します。
論文 参考訳(メタデータ) (2026-06-27T18:17:33Z) - What Accuracy and Gradient Cosine Miss: Evaluating Feedback Alignment via Scale Stability, Reference Validity, and Depth Utility [48.10132234701036]
本稿では,3つのチェック(スケール安定性,参照妥当性,深度ユーティリティ)に基づく診断評価プロトコルを提案する。
複数のアーキテクチャや手法にまたがって、我々のプロトコルは広い校正マージンを持つ全ての障害を識別する。
論文 参考訳(メタデータ) (2026-06-19T06:04:17Z) - Adaptive Stabilizer State Fidelity Certification [3.2669518901121672]
完全認定忠実区間を報告する適応的拡張を開発する。
単調な締め付け,非自明なスタビライザーがすべてカバーされた場合の正確な回復,そして全カバーの最悪のケースの必要性を証明した。
論文 参考訳(メタデータ) (2026-05-28T12:02:58Z) - Converted, Not Equivalent: Benchmarking Codebase Conversion via Observational Equivalence [56.25095230687242]
コーディングエージェントは、しばしば自身のローカル検証ルーチンを過度に信頼し、表面チェックを満たすアーティファクトの成功を宣言する。
この問題は、事前評価が結果駆動である変換において特に深刻である。
ブラインド・コンバージョンは26.7-28.9%に達し、スペック・パスレートは91.1%まで上昇した。
このことは、失敗は限られた予算やバックボーンの強さよりも、契約ミスによる自己検証に起因していることを示唆している。
論文 参考訳(メタデータ) (2026-05-27T19:57:15Z) - Are We Overconfident in Models and Results for Semi-Supervised 3D Medical Image Segmentation? [4.120238673372104]
半教師付き学習は、アノテーションのコストを削減する主要なパラダイムとなっている。
現在の進歩は2倍の過信問題によって曇っていると我々は主張する。
本稿では,二軸信頼性評価エンジン上に構築した三空間原理分割フレームワークを提案する。
論文 参考訳(メタデータ) (2026-05-25T08:16:40Z) - The Geometric Canary: Predicting Steerability and Detecting Drift via Representational Stability [0.0]
表現の対距離構造の整合性である幾何学的安定性は、2つの関数に対処することを示す。
教師なしの安定性は、現実のタスクを操るために完全に失敗します。
ドリフト検出に優れ、トレーニング後のアライメントでCKAよりも2倍近い幾何変化を計測する。
論文 参考訳(メタデータ) (2026-04-20T01:24:45Z) - BadCLIP++: Stealthy and Persistent Backdoors in Multimodal Contrastive Learning [73.46118996284888]
マルチモーダル・コントラスト学習モデルに対するバックドア攻撃の研究は、ステルスネスと永続性という2つの大きな課題に直面している。
両課題に対処する統合フレームワークであるBadCLIP++を提案する。
ステルスネスのために,タスク関連領域付近に知覚不可能なパターンを埋め込むセマンティックフュージョンQRマイクロトリガーを導入する。
持続性については、半径縮小とセントロイドアライメントによるトリガ埋め込みを安定化する。
論文 参考訳(メタデータ) (2026-02-19T08:31:16Z) - DRAFT: Task Decoupled Latent Reasoning for Agent Safety [59.46137757545185]
DRAFT(Task Decoupled Latent Reasoning for Agent Safety)を提案する。
エクストラクターは、完全な軌跡をコンパクトな連続的な潜伏ドラフトに蒸留し、リゾナーはドラフトと元の軌跡に共同で参加して安全性を予測する。
DRAFTの精度は63.27%(LoRA)から91.18%に向上した。
論文 参考訳(メタデータ) (2026-02-11T07:45:14Z) - Uncertainty-aware Unsupervised Multi-Object Tracking [33.53331700312752]
教師なしマルチオブジェクトトラッカーは、信頼できる機能埋め込みの学習に劣る。
最近の自己監督技術は採用されているが、時間的関係を捉えられなかった。
本稿では、不確実性問題は避けられないが、不確実性自体を活用して学習された一貫性を向上させることができると論じる。
論文 参考訳(メタデータ) (2023-07-28T09:03:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。