論文の概要: Pinning Decisions Before Failure: Executable Records of Underspecified Choices in AI-Assisted Code Generation
- arxiv url: http://arxiv.org/abs/2610.03237v1
- Date: Fri, 02 Oct 2026 12:46:07 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-06 00:14:30.374396
- Title: Pinning Decisions Before Failure: Executable Records of Underspecified Choices in AI-Assisted Code Generation
- Title(参考訳): 失敗前の決定をピン留めする:AIによるコード生成における不特定選択の実行可能な記録
- Abstract要約: 自然言語の要件は質問をオープンにし、それを実装するよう要求されたモデルが静かに解決する。
3つのモデルから600以上のテストスイートが生成され、42.7%は競合するリードを区別するテストを含んでいない。
要件の未特定点を名前で列挙し、それぞれのコンストラクタに対して、そのポイントでのみ異なる2つの捨てられた実装を列挙します。
結果は、名前付きポイント、確認された入力、および2つの結果の中から選択した値の判定ピンとして記録される。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: A natural-language requirement leaves questions open, and a model asked to implement it settles them silently: across 600 generated test suites from three models, 42.7% contain no test that distinguishes the competing readings. An acceptance example written before implementing is the usual remedy, but an example both readings satisfy resolves nothing. We insert two steps into that practice: enumerate the requirement's underspecified points by name, then for each construct two throwaway implementations differing only in that point and keep a candidate input only if executing both shows they disagree. The result is recorded as a decision pin: the named point, the confirmed input, and the value the person chose between the two exhibited results. The same record then constrains generation and decides compliance by execution. On a benchmark of 40 tasks with paired reference implementations and two models, a separating input is obtained for 92.5% of decision points and a pin identifying the intended decision for 85-90%. As checks on 703 independently generated implementations, pins agree with the benchmark's classification on 96-97%, with disagreements on three tasks, one where both classifiers erred. As generation constraints, pins are honoured at the pinned input in all 210 generations and are never worse than a prose rule on held-out inputs in 38 cells, though no better than prose stating the same scope. Every compliance failure under a prose rule came from the model deciding the rule's scope itself; one such case silently overturned another recorded decision, was attributed to a single rule by leave-one-out on both models, and was missed by text-level reconciliation but caught by re-running the recorded input. The setting yields too few such conflicts to evaluate a regression step, and we say why.
- Abstract(参考訳): 自然言語の要件は、質問をオープンにし、それを実装するよう要求されたモデルが静かに解決する: 3つのモデルから600個の生成されたテストスイートで42.7%は競合するリードを区別するテストを含んでいない。
実装前に書かれた受け入れ例は通常の治療法であるが、両方の読み込みが満足する例は何も解決しない。
要件の未特定点を名前で列挙し、それぞれのコンストラクタに対して、そのポイントだけが異なる2つの捨てられた実装を列挙し、両者が一致しないことを示す場合にのみ候補入力を保持する。
結果は、名前付きポイント、確認された入力、および2つの結果の中から選択した値の判定ピンとして記録される。
同じレコードが生成を制限し、実行によってコンプライアンスを決定する。
ペア化された参照実装と2つのモデルを備えた40のタスクのベンチマークでは、決定ポイントの92.5%の分離入力と85-90%の意図された決定を識別するピンが得られた。
703が独立して生成された実装をチェックすると、ピンはベンチマークの分類に96-97%で一致し、3つのタスクについて意見の相違がある。
生成制約として、ピンは210世代すべてにおいてピンインプットに敬意を表し、38のセルにおけるホールドアウトインプットに対する散文規則よりも悪いことはないが、同じスコープを示す散文に劣らない。
1つのケースは、記録された別の決定を静かに覆い、両方のモデルで1回限りの停止によって1つのルールに起因し、テキストレベルの和解によって見落とされたが、記録された入力を再実行した。
この設定は、レグレッションステップを評価するために、そのような衝突があまりに少なく、その理由を述べています。
関連論文リスト
- Benchmarking Candidate Coverage in Typed Decision Models [7.736174008951463]
本稿では,AG News, DBpedia, Emotion, TRECにまたがる候補被覆ベンチマークプロトコルと, Laya と Jev の初期評価について述べる。
本稿では,AG News, DBpedia, Emotion, TRECにまたがる候補被覆ベンチマークプロトコルと, Laya と Jev の初期評価について述べる。
論文 参考訳(メタデータ) (2026-10-02T14:36:46Z) - Self-Repulsive Sampling for Diffusion Language Models [42.61658629762382]
Self-Repulsion (SR) は、マスク付き拡散言語モデルのサンプルである。
パスはバッチ化されたフォワードパスを共有し、次に順番にコミットする。
投票の得票率は、主に正しい回答のより高いカバレッジから生じる。
論文 参考訳(メタデータ) (2026-09-30T11:58:40Z) - On Scope Classification and Current Knowledge-Editing Benchmarks: A Negative Result, with INLAY as a Gradient-Free Case Study [0.0]
INLAYは、クエリごとの正確な真実を得るために作られた勾配のないエディタである。
我々は3つのデータセットと3つの入力条件にまたがる1,689のクエリに対して、すべての候補ルータアクションを実行する。
棄権は1,689回中0回のみの勝利である。
論文 参考訳(メタデータ) (2026-08-26T18:16:24Z) - IndicQE-APE: A Benchmark for Quality Estimation and Automatic Post-Editing for Indic Languages [77.88427845181154]
我々はWMT 2020-2024の共有タスクの系統を、英語のリソースを拡張してインディクシーに集約する:9つの方向対に対して126,754ドルのインスタンス。
セグメントレベルのQEでは,LSMが6つ,COMETが3つ,APEでは3つのシステムをベンチマークした。
論文 参考訳(メタデータ) (2026-08-17T09:50:52Z) - Certifying Compressed Language Models: An Audit and a Statistical Toolkit [0.0]
正解率は, 正解率の約5倍であり, 正解率と正解率は同一であり, 個々の項目では相変わらず一致しない。
誰も有望な数値等価マージンを示しておらず、タスクマッチングされた各イテム出力はリリースしない。
欠落した機器: 宣言されたマージンでペア同値テストを行い、認定表に評価要求を与えます。
論文 参考訳(メタデータ) (2026-08-15T05:15:35Z) - Privileged Likelihood Is Not Automatically Value: Three Checks for Token Credit in On-Policy Self-Distillation [41.01488608247856]
アウトカム検証器は、完了した推論トレースをスコアするが、中間トークンにクレジットを割り当てない。
原始的な自己蒸留は、モデル自身のロールアウトをトレーニング専用の情報で再現することで、このギャップを埋めようとする。
スコアがより良い行動を追跡するか、フィードバック構築が比較対象を変えるか、トレーニング損失が強化されるか、という3つの質問を分離する。
論文 参考訳(メタデータ) (2026-08-10T08:18:48Z) - When Many Answers Are Valid, Voting Fails: Symbolic Verification for Best-of-K Causal Reasoning in LLMs [42.32694162421078]
CALVERは、パールの因果基準に対して構造化されたトレースをスコアする訓練不要なシンボル検証器である。
CALVERは、複数のグラフ正解を許容するCLEAR検索1価クエリにおいて、報酬モデル、LLM審査員、モデルの信頼性が30%近く残っている42.1%に達する。
論文 参考訳(メタデータ) (2026-08-04T11:45:46Z) - Accuracy Hides How Language Models Fail: Measuring Failure States Under Matched Output Budgets [0.0]
言語モデルベンチマークは、2つの異なる測定質問を1つの精度スコアに分解する。
スコアラーに依存しない実行証拠を分離する2層評価フレームワークを提案する。
論文 参考訳(メタデータ) (2026-07-27T11:04:17Z) - Off-the-Shelf LLMs as Process Scorers: Training-Free Alternative to PRMs for Mathematical Reasoning [51.88950852117154]
Chunk-Level Guided Generationは、既製の大規模言語モデルをプロセススコアラとして使用する、トレーニング不要の代替手段である。
本研究では,系統的な長さバイアスのため,大モデル確率の可変長推論ステップが信頼できないことを示す。
Chunk-Level Guided Generation は PRM guided search よりもかなり短い推論トレースを生成する。
論文 参考訳(メタデータ) (2026-06-01T04:43:36Z) - Distributional Energy-Based Models for Uncertainty-Aware Structured LLM Reasoning [40.342912574072024]
大規模言語モデルは、旅行計画やコードソリューションのような構造化されたアウトプットを生成する。
個々の推論ステップは正しく見えるが、アウトプット全体が予算に違反したり、テストケースに失敗したり、あるいは以前の推論に矛盾することがある。
構造化LCM出力の検証のための決定論的解析制約付き学習品質スコアラを提案する。
論文 参考訳(メタデータ) (2026-05-15T17:08:27Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。