論文の概要: The Complexity Kink: A Prompt-Side Structural Complexity Index for Code-Generation Reliability
- arxiv url: http://arxiv.org/abs/2609.19616v1
- Date: Thu, 17 Sep 2026 03:07:39 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-20 08:55:54.07424
- Title: The Complexity Kink: A Prompt-Side Structural Complexity Index for Code-Generation Reliability
- Title(参考訳): 複雑度キンク:コード生成信頼性のためのプロンプト側構造複雑度指数
- Abstract要約: 6次元のプロンプト側構造複雑度指数は、生成前にスコアし、正確性から分離する。
予備的なシングルラタールーブリックの6つのバンドで5,000のPythonプロンプトを選択します。
人間の合意は穏健であり、不一致に富んだ校正セットに依存している。
- 参考スコア(独自算出の注目度): 0.3186130813218338
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Complexity measured from generated code is failure-dependent: a difficult prompt can yield a short failing program and be assigned low output complexity. We introduce a six-dimension prompt-side structural-complexity index scored before generation and kept separate from correctness. We select 5,000 Python prompts across six bands of a preliminary single-rater rubric. Four out-of-panel LLM raters rescore the locked prompts, giving 19,997 score rows; composite inter-rater reliability is ICC = 0.872 on the 4,998 prompts with all four ratings. We evaluate 21 models per prompt, yielding 105,000 generations. In the unadjusted mean-pooled analysis, pass rate has a nonmonotone breakpoint at composite 13.75, with 79.9% at or below and 87.6% above. This is not a universal failure cutoff. Task-type fixed effects shift the breakpoint to 10.75 and cut the regime gap from 7.6 to 2.1 points. A construction-frame control shifts it to 8.50 with a raw gap of -3.5 points, and neither frame alone reproduces the pooled +7.6-point change. Model-specific fits include 16 upward and five downward changes. A 365-prompt audit-clean extension matches the original five-model estimates at bins 15 and 16 but adds only 14 prompts above bin 16. Among zero-pass generations with computable Lizard complexity, 28.5% pair a prompt composite above 8 with output complexity at most 10. Human agreement is moderate and rater-dependent on a disagreement-enriched calibration set; paraphrase and cross-language rescoring preserve score ordering. Overidentification tests reject the joint restrictions on the six dimensions, so we treat the composite as an index and make no causal interpretation of the 2SLS estimates. The contribution is a pre-generation measurement framework and a bounded observational analysis of reliability regimes.
- Abstract(参考訳): 難しいプロンプトは、短いフェールプログラムを生成し、低い出力の複雑さを割り当てる。
生成前に得られた6次元のプロンプト側構造複雑度指数を導入し,正確性から分離した。
予備的なシングルラタールーブリックの6つのバンドで5,000のPythonプロンプトを選択します。
4つのアウト・オブ・パネルのLSMラガーがロックされたプロンプトをリスコアし、19,997のスコア列を与え、総合的なインターレータ信頼性は4,998プロンプトのICC = 0.872である。
我々は1プロンプト当たり21モデルを評価し、10万5000世代を産出する。
非調整平均プール分析では、パスレートは合成13.75で非モノトンブレークポイントを持ち、79.9%はそれ以下、87.6%は上である。
これは普遍的な障害カットオフではありません。
タスクタイプの固定効果はブレークポイントを10.75にシフトし、レギュラーギャップを7.6から2.1ポイントに削減する。
構成フレーム制御は、-3.5点の生の隙間で8.50にシフトし、どちらのフレームも+7.6点のプールを再現しない。
モデル固有のフィットには、上向きと下向きの5つの変更が含まれる。
365プロンプトの監査クリーン拡張は、元々の5モデル推定値のビン15と16と一致するが、ビン16の上に14のプロンプトを追加するだけでよい。
計算可能なリザード複雑性を持つゼロパス世代の中で、28.5%は出力複雑性が最大10の8以上のプロンプト合成をペアにしている。
人間の合意は、不一致に富んだキャリブレーションセット、パラフレーズとクロスランゲージ・リスコリング・レザーブ・スコア・オーダリング(英語版)に依存し、適度であり、レーダに依存している。
過剰識別試験は6次元の関節制限を拒絶するため,合成物を指標として扱い,2SLS推定の因果的解釈は行わない。
コントリビューションは、プライジェネレーション前の測定フレームワークであり、信頼性レシエーションの有界な観察分析である。
関連論文リスト
- QuoteBench: How Matched Scores Can Hide Command-Path Failures [30.480838412827907]
実行スコアだけでは、ジェネレーションエラーとジェネレーション後に導入された失敗を区別できない。
QuoteBenchはこの境界線を、インシデントから派生した14のファミリーから56のワンショットタスクに対して正確に最終状態の検証を行う。
コマンド発行エージェントの評価は、一致したスコアを本質的なモデル特性として扱うよりも、モデル構成、生成契約、実行経路、操作点、最終状態などを報告すべきである。
論文 参考訳(メタデータ) (2026-08-13T17:57:20Z) - TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models [40.42873860258522]
優先順序等調スコア編集(POISE)を備えたマルチパラダイム報酬モデリングフレームワークであるTrustRoboRewardを提案する。
POISEはポイントワイズスコアを修正し、TrustJudgeが未解決のクロスパラダイム逆転競合を取り除く。
POISEでトレーニングされたQwen3-VL-4Bは、全体的な報酬スコアが77.96%に達し、GPT-5-mini(78.09%、ギャップ0.13%)とほぼ一致し、最強のRoboReward-4Bベースラインを10.13%上回った。
論文 参考訳(メタデータ) (2026-08-09T05:25:22Z) - Passing Coarse Marginal Checks Can Be Cheap: Persona Mixtures and Imprecise Treatment-Response Estimates in an LLM Persona Panel [0.0]
戦略ゲームにおける16個の軽量人格条件付きGPT-4.1構成の固定パネルについて検討した。
変化は急激なインデクシングであったが、そのシェアは不確実性の仮定に依存していた。
結果は、1つの固定されたモデル・プロンプトパネルに関係し、人間の置換性を確立しない。
論文 参考訳(メタデータ) (2026-08-02T04:10:11Z) - Automated Proving of Shannon-Type Entropy Inequalities via Fine-Tuned Language Models and Guided Tree Search [50.16356451328644]
シャノン型エントロピーの不等式を証明することは情報理論の基本的な課題である。
我々は,原子実証のステップを微調整した小規模大規模言語モデルがこのプロセスを自動化することができるか検討する。
GPT-5.5は0ショットプロンプトで1.7%のサンプルを解き、Psitipは33.3%のサンプルを解いた。
論文 参考訳(メタデータ) (2026-06-04T05:43:12Z) - SkillDAG: Self-Evolving Typed Skill Graphs for LLM Skill Selection at Scale [54.70985426016736]
本稿では,スキル間関係を型付き有向グラフとしてモデル化したSkillDAGを提案する。
各検索はベクトルマッチング、型付きエッジ隣人、競合信号を返す。
ALFWorldとSkillsBench with MiniMax-M2.7では、SkillDAGは67.1%の成功と27.3%の報酬を得た。
論文 参考訳(メタデータ) (2026-06-02T02:45:21Z) - Distributional Energy-Based Models for Uncertainty-Aware Structured LLM Reasoning [40.342912574072024]
大規模言語モデルは、旅行計画やコードソリューションのような構造化されたアウトプットを生成する。
個々の推論ステップは正しく見えるが、アウトプット全体が予算に違反したり、テストケースに失敗したり、あるいは以前の推論に矛盾することがある。
構造化LCM出力の検証のための決定論的解析制約付き学習品質スコアラを提案する。
論文 参考訳(メタデータ) (2026-05-15T17:08:27Z) - Models Recall What They Violate: Constraint Adherence in Multi-Turn LLM Ideation [0.0]
DriftBenchは、科学的思考における制約の順守を評価するためのベンチマークである。
繰り返し圧力は構造的複雑さを確実に増加させ、しばしば元の制約への固執を減少させる。
オープンベンチマークとして、すべてのブリーフ、プロンプト、ルックス、書き起こし、スコアをリリースします。
論文 参考訳(メタデータ) (2026-04-30T15:46:33Z) - The Autocorrelation Blind Spot: Why 42% of Turn-Level Findings in LLM Conversation Analysis May Be Spurious [35.76482964927589]
202のマルチターン会話における66のターンレベルメトリクスの自己相関構造を特徴付ける。
標準プールテストでは,42%のアソシエーションがクラスタ・ロバスト補正に成功しなかった。
我々は、Chelton (1983) の有効自由度と会話レベルのブロックブートストラップを組み合わせた2段階補正フレームワークを提案する。
論文 参考訳(メタデータ) (2026-04-15T20:54:39Z) - From Black Box to Glass Box: Cross-Model ASR Disagreement to Prioto Review in Ambient AI Scribe Documentation [43.148402136307716]
異種ASRシステム間のクロスモデル不一致は、基準のない不確実性信号として機能する。
商用APIとオープンソースエンジンにまたがる8つのASRシステムを備えた,50の公開医療用オーディオクリップを転写した。
低アグリメント領域は内容の不一致に富み、高リスク質量のクインタイル全体では53.9%から73.9%に増加した。
論文 参考訳(メタデータ) (2026-03-02T13:02:13Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。