論文の概要: Fidelity Probes for Specification--Code Alignment
- arxiv url: http://arxiv.org/abs/2605.17246v1
- Date: Sun, 17 May 2026 04:05:54 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-19 17:57:47.801875
- Title: Fidelity Probes for Specification--Code Alignment
- Title(参考訳): 仕様のための忠実度プローブ-コードアライメント
- Abstract要約: 我々は,コード由来の接地真実解を持つ参照アーティファクトから生成した自然依存問題である忠実度プローブを紹介する。
忠実度プローブは矛盾とカバレッジギャップ率に分解され、ターゲット仕様の編集を収束させる。
15のプログラムで約12kラインのベンチマークを行い、8回のイテレーションで0.63から0.94に凍結テスト仕様の忠実度を上げました。
- 参考スコア(独自算出の注目度): 7.754687669049819
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: We introduce fidelity probes: natural-language questions generated from a reference artifact with code-derived ground-truth answers, answered from a candidate specification. The fraction of agreeing probes, which we call the fidelity, decomposes into contradiction and coverage-gap rates that drive targeted spec edits to convergence. On a 15-program, roughly 12k-line COBOL benchmark (AWS CardDemo), we raise frozen-test specification fidelity from 0.63 to 0.94 over eight iterations, with the plateau location predicted by a two-state Markov fixed point $F^\dagger$ from just four iterations of rate data. Probes come from an LLM reading the code or from a static-analysis pipeline over its control-flow, data-flow, and system-dependence graphs, with a tunable mixture. A probe-resampling protocol with a frozen held-out set gives a Hoeffding-bounded overfitting discriminant; our measured train/test gap stays more than an order of magnitude below this envelope. Three graph-grounded mixtures lift fidelity by +16 to +30 points; cross-distribution evaluation shows the LLM and symbolic channels are empirically complementary. A cross-family generator sweep on five independent LLM lineages (Anthropic, DeepSeek, Google, Alibaba, OpenAI) confirms the convergence behaviour is not tied to any single model family: three of five non-Claude generators produce trajectories consistent with the Markov fixed-point prediction, and the frozen-test protocol actively falsifies the two generators whose probe distributions drift across iterations. The method applies to any pair of artifacts that are supposed to describe the same behaviour.
- Abstract(参考訳): 提案手法では,コード由来の真理応答を持つ参照アーティファクトから生成した自然言語質問を,候補仕様から回答する。
整合性(fidelity)と呼ばれるコンセンサスプローブのごく一部は矛盾とカバレッジギャップ率に分解され、ターゲット仕様の編集を収束させる。
15プログラムで約12kラインのCOBOLベンチマーク(AWS CardDemo)では、たった4回のレートデータから2状態のMarkov固定点$F^\dagger$によって予測される高原位置で、フリーズテスト仕様の忠実度を0.63から0.94に引き上げました。
プローブは、コードを読み込むLLMや、制御フロー、データフロー、システム依存性グラフをスタティック分析パイプラインから、調整可能なミックスで作成する。
凍結したホールドアウトセットを持つプローブサンプリングプロトコルは,Hoeffdingに結合したオーバーフィッティング判別器を与え,このエンベロープより1桁以上低い速度で列車/テストギャップを計測した。
3つのグラフ基底混合物は、忠実度+16から+30の値を持ち上げるが、交叉分布評価は、LLMとシンボルチャネルが経験的に相補的であることを示している。
5つの独立したLLM系統(Anthropic、DeepSeek、Google、Alibaba、OpenAI)のクロスファミリージェネレータは、収束動作が任意のモデルファミリに結び付けられていないことを確認している。
この方法は、同じ振る舞いを記述すべきアーティファクトのペアに適用される。
関連論文リスト
- The Dice Roll Method: A Standardized Protocol for Repeated-Query Auditing of Large Language Model Brand Recommendations [0.0]
我々は,ブランドレコメンデーションの繰り返し監査のための再利用可能なプロトコルとして,Dice Roll Methodを定式化した。
D-studyでは、探索、確認、厳密な3段階のイテレーションガイダンスが登場している。
3つの独立したコーパスに対する事前登録された外部検証は、障害のない39細胞のうち37細胞においてD-studyの信頼性予測を再現する。
論文 参考訳(メタデータ) (2026-09-03T16:22:06Z) - Lévy Attention: Single-Pass Predictive Uncertainty for Continuous-Time Attention [0.0]
レヴィ・アテンション(英: Lévy Attention)は、不均質なランダム測度に対して出力が積分的なクロスアテンション作用素である。
t-PatchGNNオペレーターは、一致した制御に対してコストを5.6%の精度でスワップする。
1回のパスでは3,383人の未確認患者が1.4秒で信頼されている。
論文 参考訳(メタデータ) (2026-08-19T17:50:16Z) - Mapping CVEs to MITRE ATT&CK Techniques: A Curated Gold-Set Classifier and the Limits of LLM-Assisted Label Expansion [46.262619407930266]
我々は、専門家のMITRE Center for Threat-Informed Defense mappingsから1,207 CVEのキュレートされた金のデータセットにマルチラベル分類器をトレーニングする。
その結果得られたモデルは、ゼロショットの埋め込み類似性のベースラインと比較して、おおよそdoubles recall@5である。
次に,LLMによるラベリングが金のデータセットを拡張できるかどうかを検討する。
論文 参考訳(メタデータ) (2026-07-28T10:59:04Z) - Speculative Refinement: A Hybrid Autoregressive Diffusion Decoding Strategy and Its Behavior Across Benchmarks [1.9800951131982487]
我々はSpecRef(Speculative Refinement)を用いて、ARドラフトからマスク付き拡散言語モデルをウォームスタートする。
We evaluate SpecRef across six benchmarks (HumanEval, MBPP, GSM8K, BBH, ARC-Challenge, HellaSwag) with three distinct evaluation protocol。
これらの観察は、多段階または非自己回帰生成パイプラインに適用され、より診断評価の実践に向けて向けられる。
論文 参考訳(メタデータ) (2026-06-25T18:52:24Z) - Decoding in Order-Agnostic Language Models: Chain-Rule Deviation and Uniform Spreading [0.6916773850242582]
順序に依存しない言語モデル(OALM)は任意の条件セットの下でマスク付きトークンを予測するために訓練される。
学習条件はコヒーレントな関節分布の正確な分解ではないことを示す。
信頼性トレースの形状に基づく相補的診断を提案する。
論文 参考訳(メタデータ) (2026-05-31T04:25:36Z) - Convergence Theory for Iterative LLM-Based Neural Architecture Search: A Parametric Cross-Entropy Framework with Closed-Form Proxy Reliability [48.83701310501069]
大規模言語モデル(LLM)は、反復型ニューラルアーキテクチャサーチ(NAS)におけるジェネレータとしてますます使われている。
我々は,LCM-NASを,実行可能プログラム上でのパラメトリッククロスエントロピー(CE)法としてモデル化する。
我々は,(1)エリートアーキテクチャの反復LEM微調整は,LLMファミリーに制限されたCE更新と同等であり,(2)期待されるアーキテクチャ品質はサイクル毎に単調に低下せず,(3)エリートセットの確率は幾何率で一定点に収束する,という6つの結果を示した。
論文 参考訳(メタデータ) (2026-05-28T15:45:19Z) - Distributional Energy-Based Models for Uncertainty-Aware Structured LLM Reasoning [40.342912574072024]
大規模言語モデルは、旅行計画やコードソリューションのような構造化されたアウトプットを生成する。
個々の推論ステップは正しく見えるが、アウトプット全体が予算に違反したり、テストケースに失敗したり、あるいは以前の推論に矛盾することがある。
構造化LCM出力の検証のための決定論的解析制約付き学習品質スコアラを提案する。
論文 参考訳(メタデータ) (2026-05-15T17:08:27Z) - The Extrapolation Cliff in On-Policy Distillation of Near-Deterministic Structured Outputs [52.709361620508595]
ListOPDは、パラメータの5分の1で8B-SFTベースラインで、学生をドメイン内に持ち込む。
Amazon Fashionでは、3つの事前登録テスト — 細粒度崖間隔テスト、小さなクリップのクロス予測 — がロックされた予測ウィンドウ内に落下し、グリッド解像度以下のクローズドフォーム予測に一致する小さなクリップ値が設定されている。
論文 参考訳(メタデータ) (2026-05-09T06:48:00Z) - The Surprising Universality of LLM Outputs: A Real-Time Verification Primitive [0.0]
CPUのみのスコアリングプリミティブはトークン当たり2.6マイクロ秒で動作する。
トークンのランク周波数分布は同じ2パラメータのMandelbrotランキング分布に収束する。
利用可能な場合にモデルログの確率で構成し、クローズドAPIで使用可能なランクオンリーモードに分解するシングルパススコアリングプリミティブを導出する。
論文 参考訳(メタデータ) (2026-04-28T13:35:31Z) - Correction and Corruption: A Two-Rate View of Error Flow in LLM Protocols [51.56484100374058]
そこで本研究では,単一プロトコルステップを正確なマッチングタスクで監査するためのペアアウトカム計測インタフェースを提案する。
各インスタンスについて、インターフェースはベースラインの正当性ビットと後ステップの正当性ビットを記録する。
これらのレートは精度の変化を予測し、種、混合物、パイプライン間でテスト可能な再利用可能な経験的インターフェースを定義する。
論文 参考訳(メタデータ) (2026-04-20T13:25:40Z) - PROBE: Probabilistic Occupancy BEV Encoding with Analytical Translation Robustness for 3D Place Recognition [6.460745030735197]
PROBEは学習不要のLiDAR位置認識システムである。
連続カルテシアンジャコビアン摂動を解析的に極小化する。
手書き記述子の中では最も正確である。
論文 参考訳(メタデータ) (2026-03-06T07:00:26Z) - FSampler: Training Free Acceleration of Diffusion Sampling via Epsilon Extrapolation [0.0]
FSamplerは、NFE(Function Evaluations)の数を削減して拡散サンプリングを加速するトレーニングフリーのサンプル実行層である。
FSamplerは、最近の実モデル呼び出しからの信号の分解の歴史を短く保ち、有限差分予測器を用いて次のエプシロンを外挿する。
サンプルレベルで動作するFSamplerは、Euler/DDIM、DPM++ 2M/2S、LMS/AB2、RESファミリー指数的マルチステップメソッドと統合されている。
論文 参考訳(メタデータ) (2025-11-12T10:21:25Z) - Ensemble Threshold Calibration for Stable Sensitivity Control [0.0]
本稿では,数千万組の幾何対もの幾何に対して,過度に分散した正確なリコールを実現するエンド・ツー・エンドのフレームワークを提案する。
我々のアプローチは、小さなエラーで常にリコールターゲットにヒットし、他のキャリブレーションと比較して冗長な検証を減らし、単一のTPU v3コア上でエンドツーエンドで実行します。
論文 参考訳(メタデータ) (2025-10-02T15:22:28Z) - Contrastive Flow Matching [61.60002028726023]
コントラストフローマッチング(Contrastive Flow Matching)は、全ての条件フローに対して一意性を明示するフローマッチング対象の拡張である。
提案手法は,任意のサンプル対からの予測フロー間の相違を最大化するための対照的な目的を与える。
比較フローマッチングによるトレーニングモデル(1)は最大9倍のトレーニング速度,(2)は最大5倍のノイズ除去ステップ,(3)FIDを最大8.9以下に向上させる。
論文 参考訳(メタデータ) (2025-06-05T17:59:58Z) - A Kernel-Based Conditional Two-Sample Test Using Nearest Neighbors (with Applications to Calibration, Regression Curves, and Simulation-Based Inference) [3.622435665395788]
本稿では,2つの条件分布の違いを検出するカーネルベースの尺度を提案する。
2つの条件分布が同じである場合、推定はガウス極限を持ち、その分散はデータから容易に推定できる単純な形式を持つ。
また、条件付き適合性問題に適用可能な推定値を用いた再サンプリングベースのテストも提供する。
論文 参考訳(メタデータ) (2024-07-23T15:04:38Z) - Disentangle Your Dense Object Detector [82.22771433419727]
深層学習に基づく高密度物体検出器はここ数年で大きな成功を収め、ビデオ理解などのマルチメディアアプリケーションにも応用されてきた。
しかし、現在の高密度検出器の訓練パイプラインは、保持できない多くの接続に妥協されている。
そこで本研究では, 簡易かつ効果的な遠心分離機構を設計し, 現在の最先端検出器に統合するDED(Disentangled Dense Object Detector)を提案する。
論文 参考訳(メタデータ) (2021-07-07T00:52:16Z) - On the Practicality of Differential Privacy in Federated Learning by
Tuning Iteration Times [51.61278695776151]
フェデレートラーニング(FL)は、分散クライアント間で機械学習モデルを協調的にトレーニングする際のプライバシ保護でよく知られている。
最近の研究では、naive flは勾配リーク攻撃の影響を受けやすいことが指摘されている。
ディファレンシャルプライバシ(dp)は、勾配漏洩攻撃を防御するための有望な対策として現れる。
論文 参考訳(メタデータ) (2021-01-11T19:43:12Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。