論文の概要: Scaffold, Not Vocabulary? A Controlled, Two-Tier, Pre-Registered Study of a Popperian Code-Generation Skill
- arxiv url: http://arxiv.org/abs/2606.06454v1
- Date: Thu, 04 Jun 2026 17:49:00 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-05 22:39:45.008656
- Title: Scaffold, Not Vocabulary? A Controlled, Two-Tier, Pre-Registered Study of a Popperian Code-Generation Skill
- Title(参考訳): 語彙ではないのか?ポペリアのコード生成スキルの制御された2階層の事前登録
- Authors: Mehmet Iscan,
- Abstract要約: 大規模な言語モデルは、コードを書き、レビューし、判断するようになっている。
顕著な例は、モデルにポパーリアのファルシフィケーション奏者として振る舞うように指示する。
スキルのPopperianコンテンツから、あるいは構造から得られるものは何か?
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large language models increasingly write, review, and judge code, and a fast-growing practice equips them with prompt 'skills' that ask the model to reason like a scientist. A prominent example tells the model to act as a Popperian falsificationist, and such skills are reported to improve generated code. But these gains are almost always read off an LLM-as-a-judge, an instrument with documented positional, self-preference, and stylistic biases. We ask: if it appears to help, is the gain from the skill's Popperian content, or from the structure any scaffold imposes? We pre-register a two-tier ablation with three controls: a length-matched placebo, a labels-only scaffold that keeps the Popperian headers but strips the procedure, and an execution oracle (HumanEval+ unit tests), plus a vocabulary-halo sentinel and a same-model self-judge audit. On a frontier model (Claude Sonnet 4.6, N=163) all conditions sit near the benchmark ceiling and do not separate, so the pre-registered +5-point improvement is not supported (a ceiling-limited non-detection). On a small model (Qwen2.5-Coder-0.5B, N=164) structured arms lift best-of-eight correctness by 20-22 points, but the full skill shows no separable benefit over a labels-only scaffold (aggregate F@8=L@8 vs V@8=34.8%), and the placebo trails by only 2.4 points. A 0.5B self-judge applying the Popperian rubric does not beat random selection and concentrates 60% of its picks on one index. In the two settings tested, the skill's Popperian procedural content adds no separable execution-correctness benefit beyond a labels-only scaffold, so the gains track scaffold structure. We contribute a calibrated negative result and a reusable disambiguation protocol; the finding bounds an engineering claim about one prompt-skill family and is not an evaluation of Popperian methodology in general.
- Abstract(参考訳): 大規模言語モデルでは、コードを書き、レビューし、判断するようになり、急速に成長するプラクティスでは、モデルに科学者のような推論を求める「スキル」が与えられている。
顕著な例は、モデルをポペリアのファルシフィケーション奏者として振る舞うように指示し、そのようなスキルは生成されたコードを改善するために報告される。
しかし、これらの利得はほとんど常にLCM-as-a-judge(位置、自己選好、スタイルバイアスを文書化した楽器)から読み取られている。
もしそれが役に立つように見えるなら、スキルのPopperianコンテンツから得られるものなのか、あるいは構造から課される足場から得られるものなのか?
長さマッチングされたプラセボ,ポペリアのヘッダを保持するが手順を省略するラベルのみの足場,実行オラクル(HumanEval+単体テスト),ボキャブラリ・ハロ・センティネル,同モデルのセルフジャッジ監査の3つのコントロールを備えた2層アブレーションを事前登録する。
フロンティアモデル(Claude Sonnet 4.6, N=163)では、全ての条件がベンチマーク天井の近くにあり、分離されないため、事前登録された+5点の改善はサポートされない(天井制限の非検出)。
小型モデル(Qwen2.5-Coder-0.5B, N=164)では8点の精度を20-22ポイント引き上げるが、フルスキルはラベルのみの足場(F@8=L@8対V@8=34.8%)とプラセボパスをわずか2.4ポイント引き上げる。
Popperian rubric を適用した0.5Bの自己判断は、ランダムな選択に勝らず、1つのインデックスにそのピックの60%を集中させる。
テストされた2つの設定では、スキルのPopperianプロシージャコンテンツはラベルのみの足場を超えて、分離可能な実行精度のメリットを追加している。
この発見は,1つのプロンプトスキルファミリーに関する工学的主張を拘束するものであり,一般にポペリアの方法論の評価にはならない。
関連論文リスト
- Not All Synthetic Data Is Yours to Learn From [68.13136636413601]
弱い自己学習は、事前訓練モデルにすでに存在する能力を増幅できることを示す。
我々はこれを、プロンプトフリーな無条件自己学習の最小設定で研究する。
論文 参考訳(メタデータ) (2026-05-29T10:34:11Z) - Let the Results Speak: A Replication-First Paradigm for LLM Behavioral Benchmarking [22.825786049667602]
本稿では,1つのヒト・ラタのコンセンサスに有効性を確保するために,複製第一パラダイムを提案する。
楽器を4つの特性で認証する - Kランの信頼性、アーキテクチャ的に異なる審査員間のクロスインストラクトレプリケーション、以前のトレーニングコホートからの審査員による歴史的フットプリントキャリブレーション、事前登録された予測。
本研究は, 自己発達型データ駆動による情緒的伴奏で, 次元は事前に決められず, 手順は9次元に安定化する。
論文 参考訳(メタデータ) (2026-05-27T03:41:11Z) - TypedCSIP: Typed Counterfactual Pretraining for Chinese Legislative Conflict Classification [3.5137191090796054]
TypedCSIPはLCR-CNベンチマークのコンフリクト分類タスクの型付き対実事前学習手法である。
我々は、LCR-CNの専門家による最小限の修正を、訓練時対実監督として活用する。
論文 参考訳(メタデータ) (2026-05-25T06:26:46Z) - RefusalBench: Why Refusal Rate Misranks Frontier LLMs on Biological Research Prompts [0.0]
厳格な拒絶率は、同じプロンプトで0.1%から94.6%である。
18のフロンティアモデルのうち9つは、バイナリーリフェールメトリクスが検出できないデュアルユース層で、ヘッジ・ブット・ヘルプ部分コンプライアンスパターンを示す。
論文 参考訳(メタデータ) (2026-05-20T09:53:31Z) - Deployment-Relevant Alignment Cannot Be Inferred from Model-Level Evaluation Alone [11.663456969895462]
機械学習におけるアライメント評価は、主にモデルの評価となっている。
本稿では, モデルレベルの評価だけでは, 配置関連アライメントを推定できないことを論じる。
論文 参考訳(メタデータ) (2026-05-06T03:28:30Z) - Pando: Do Interpretability Methods Work When Models Won't Explain Themselves? [53.07826484214082]
モデル・オーガニゼーションのベンチマークであるPandoを紹介します。
Pandoは、ラベル付きクエリ-レスポンスペアから、ホールドアウトモデル決定を予測する。
説明が忠実であれば、ブラックボックスの引用はすべてのホワイトボックスメソッドに一致するか、超える。
論文 参考訳(メタデータ) (2026-04-13T06:42:24Z) - Do Large Language Models Get Caught in Hofstadter-Mobius Loops? [0.0]
本稿では、現代のRLHF学習言語モデルが構造的に類似した矛盾の対象となっていることを論じる。
トレーニングプロセスは、ユーザの嗜好の遵守とユーザの意図に対する疑念を同時に報いる。
結果として生じる行動プロファイルは、クラークがHofstadter-Mobiusループと呼んだものと一致している。
論文 参考訳(メタデータ) (2026-03-10T20:43:37Z) - Appeal: Allow Mislabeled Samples the Chance to be Rectified in Partial Label Learning [55.4510979153023]
部分ラベル学習(PLL)では、各インスタンスは候補ラベルのセットに関連付けられ、そのうち1つだけが接地真実である。
誤記されたサンプルの「アペアル」を支援するため,最初の魅力に基づくフレームワークを提案する。
論文 参考訳(メタデータ) (2023-12-18T09:09:52Z) - Shrinking Class Space for Enhanced Certainty in Semi-Supervised Learning [59.44422468242455]
そこで我々はShrinkMatchと呼ばれる新しい手法を提案し、不確実なサンプルを学習する。
それぞれの不確実なサンプルに対して、元の Top-1 クラスを単に含むスランク類空間を適応的に求める。
次に、スランク空間における強と弱に強化された2つのサンプル間の整合正則化を課し、識別的表現を試みます。
論文 参考訳(メタデータ) (2023-08-13T14:05:24Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。