論文の概要: Form, Not Content? A Preregistered, Placebo-Controlled Evaluation of Learned Error-Conditioned Self-Repair Through Prompts and Weights in Frozen Small Code Models
- arxiv url: http://arxiv.org/abs/2607.12962v1
- Date: Tue, 14 Jul 2026 16:59:42 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-15 17:08:30.226139
- Title: Form, Not Content? A Preregistered, Placebo-Controlled Evaluation of Learned Error-Conditioned Self-Repair Through Prompts and Weights in Frozen Small Code Models
- Title(参考訳): 形式は含まないか? 未登録プラセボ制御による凍結型小型コードモデルにおける学習誤りの自己修復過程の評価
- Abstract要約: 本稿では,Popperian Placebo制御評価法(PoPE:Popperian Placebo-control Evaluation)を紹介する。
PoPEでは、エラーコンテンツとチャネル固有のプラセボがペアになって、事前に宣言されたスキャフォールドを保持しながら、タスク関連コンテンツを非難したり、タスクエラーの割り当てをデアレンジする。
発見は等価性や非劣等性の証拠にはならない。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Frozen small code LLMs are deployed locally, yet the information guiding a retry after a failed attempt is still measured without placebo controls in the self-repair literature. We treat a failed program as a conjecture and an execution counterexample as an oracle-relative refutation, and introduce PoPE (Popperian Placebo-controlled Evaluation): a methodology for measuring whether evidence that falsifies LLM-generated code can be used operationally by that same model. In PoPE, error content is paired with channel-specific placebos that keep the predeclared scaffold while ablating task-relevant content or deranging the task-error assignment. Frozen small code models (0.5-1.5B) are evaluated under preregistered rules through a prompt channel and a weight channel (small-data adapter training), with four generations per arm-unit pair. In the prompt channel, public-tier screening unlocked 12 units under the content-ablated form placebo versus 10 under the live error-pattern arm on a 40-unit resistant band; the result was recorded as mechanism-null. In the weight channel, an 8-8 tie was observed between the error-content adapter and the intervention-free baseline (p=1.0), while the SHA-deranged placebo adapter stayed ahead with 10 unlocks; content-attributable superiority was not confirmed. These results do not constitute evidence of equivalence or non-inferiority. Equivalence was not tested separately. Findings are restricted to the public-tier screening endpoint; hidden-tier confirmation was deferred by design. We read this not as compiled criticism disappearing as information, but as the loss of its external role in testing a new conjecture: when a representation learned from the oracle is written back into the generation state, testing is replaced by conditioning. No working JEPA-RL controller is claimed. PoPE is presented as a placebo-controlled, retestable measurement standard.
- Abstract(参考訳): 凍結した小さなコードLLMはローカルにデプロイされるが、失敗した後の再試行を導く情報は、自己修復文学においてプラセボ制御なしで測定される。
提案手法は,LLM生成コードを偽造した証拠が同一モデルで動作可能であるかどうかを判断する手法であるPoPE(Popperian Placebo- controlled Evaluation)を導入する。
PoPEでは、エラーコンテンツとチャネル固有のプラセボがペアになって、事前に宣言されたスキャフォールドを保持しながら、タスク関連コンテンツを非難したり、タスクエラーの割り当てをデアレンジする。
凍結された小型コードモデル (0.5-1.5B) は、プロンプトチャネルとウェイトチャネル (小データアダプタトレーニング) を通じて事前登録されたルールの下で評価され、アームユニットペアあたり4世代である。
プロンプトチャンネルでは、40ユニット耐性バンドのライブエラーパターンアームで、コンテント付きプラセボで12ユニットをアンロックし、その結果をメカニズムヌルとして記録した。
重み付きチャネルでは, ミスコンテントアダプタと介入フリーベースライン (p=1.0) との間に8~8本のネクタイがみられ, SHAで脱着したプラセボアダプタは10個のアンロックで先行し, 内容依存性の優位性は確認されなかった。
これらの結果は、等価性や非劣等性の証拠にはならない。
等価性は別々にテストされなかった。
発見はパブリック層スクリーニングエンドポイントに制限され、隠れ層確認は設計によって延期された。
我々はこれを、情報として消滅するコンパイルされた批判ではなく、新しい予想をテストする上での外的役割の欠如である、すなわち、神託から学んだ表現が生成状態に書き戻されると、テストは条件付けに置き換えられる。
動作中のJEPA-RLコントローラは要求されない。
PoPEはプラセボ制御、再テスト可能な測定基準として提示される。
関連論文リスト
- A distribution-free certification framework for trustworthy crash-severity prediction [1.089614199781423]
厳密なモデルを修正せずにラップする認証層を開発します。
テキサス州の7つのベースモデルにまたがる520万件の記録では、同層は同一の妥当性を持つ。
フレームワークは定理レベルのテストを備えたオープンソースパッケージとしてリリースされている。
論文 参考訳(メタデータ) (2026-09-10T14:20:08Z) - Calibrating Criterion Revision in LLM Agents: Failure Modes and a Trace-Anchored Protocol [3.202978695204522]
言語モデルエージェントは、失敗後に改善したり、成功と見なすものを再検討することなく、エピソード間でテキストを運ぶことができる。
CMB-0.1を12例,腕4例で検討した。
モデルトライアルが5つの条件すべてを満たすことはないが、このゼロは一般能力の欠如を証明していない。
論文 参考訳(メタデータ) (2026-08-21T04:21:28Z) - Conformalized Large Language Models under Configuration Shift [46.502741608809174]
コンフォーマル予測は不確実性定量化のための分布のないフレームワークである。
非整合性スコアは、単に固定モデルではなく、推論パイプラインによって引き起こされることが多い。
構成シフトがCPの妥当性を損なうことを示す。
論文 参考訳(メタデータ) (2026-08-02T19:34:41Z) - Fixed-Set Robustness in Programming by Example: Example Corruption and Semantic Partition Recovery [2.054408744752205]
本稿では,異なる障害モード,つまり合成器を目にした相手が,復帰プログラムを最も損なうような事例を選択することについて検討する。
我々は,有限 PBE バージョン空間の最悪ケースを固定セットし,厳密なバウンドプールを実装し,文字列変換 DSL の汚職検索を行った。
論文 参考訳(メタデータ) (2026-07-01T07:38:35Z) - DriftScope: Measuring The Hidden Effects of Diffusion Model Adaptation [50.584834483403675]
新しい視覚概念を学習するか、望ましくないものを消去するか、事前学習したテキスト・画像拡散モデルに適応させることは、意図した効果だけで日常的に評価される。
適応が意味論的に無関係な概念を、構造的にメトリクスを集約することができない方法で体系的に損なうことを実証する。
DriftScopeは、任意の2つのモデルチェックポイントを取り込み、視覚的概念が最も移行したトークンのランクリストを返す、プロンプトレベルの診断ツールである。
論文 参考訳(メタデータ) (2026-06-30T20:57:51Z) - Falsification, Not Exposure: An Internally Preregistered Placebo-Controlled Decomposition of Self-Repair Feedback in Frozen Small Code Models [0.0]
本研究では、ブラインドサンプリングベースラインに対してフィードバックパケットを分解するプラセボ制御装置を構築する。
この体制では、ファルシフィケーションは語彙や自己批判としてではなく、外部の実行可能な反例と比較するのに役立つ。
論文 参考訳(メタデータ) (2026-06-30T11:26:14Z) - On the Inseparability of Instructions and Data in Shared-Embedding Sequence Models [0.0]
我々は、制御権威行動を伴うプロンプトアクションモデルとして、誘導されたシステムを定式化する。
共有パイプライン内では,SFC(Semantic-Faithful Control)が実現不可能であることを示す。
根本原因とそれが要求するソリューションのクラスを特定します。
論文 参考訳(メタデータ) (2026-06-25T21:52:29Z) - Selection Without Signal, Recovery Through Expression: A Measurement Study of Post-Hoc Falsification Operators for Frozen Small Code Models [0.0]
小型のコードモデルは、しばしばプラルーシブル・ブライト・プログラムを出力する。
意味論的ポストホック演算子が役立つかどうかを測定する。
ここで唯一の精度向上である式層リカバリ(M1)は、標準抽出器が破棄した正しいプログラムを復元する。
論文 参考訳(メタデータ) (2026-06-15T17:36:23Z) - CIAware-Bench: Benchmarking Control Intervention Awareness Across Frontier LLMs [100.38986535324284]
我々は、フロンティアモデル全体でのtextbfcontrol textbfintervention (CI) の認識を測定するベンチマークである textbfCIAware-Bench を紹介する。
CIAware-Benchは、モデルが自身の軌跡を制御介入によって修正されたものと区別できるかどうかをテストする。
論文 参考訳(メタデータ) (2026-06-09T16:24:16Z) - Diagnosing Evidence Utilization in Long-Context and Retrieval-Augmented Language Models under Matched Evidence Conditions [0.0]
モデルはパラメトリックの先行情報から回答したり、存在する証拠を使わなかったり、関連するテキストを最終回答に変換することなく引用したりすることができる。
本稿では,エビデンス利用評価のための4条件診断プロトコルを提案する。
論文 参考訳(メタデータ) (2026-06-04T22:44:57Z) - What Are We Actually Decoding? Source Attribution for Non-Invasive Brain-to-Language Retrieval [42.66754319854329]
我々は,刺激同期MEG-to-audio検索を監査フレームワークとして再放送した。
構造的ショートカット、ウィンドウレベルの刺激ロックされたエビデンス、ウィンドウ間のコンテキストアグリゲーションを使用します。
これらの結果は、脳から言語へのパフォーマンスは、単に報告されるのではなく、ソース属性であるべきだことを示唆している。
論文 参考訳(メタデータ) (2026-05-23T11:23:39Z) - Decomposed Prompting Does Not Fix Knowledge Gaps, But Helps Models Say "I Don't Know" [47.930782177987446]
大規模言語モデルは、クローズドブックの質問応答において知識限界を認識するのに苦労することが多く、自信ある幻覚へと繋がる。
我々は、モデルスケールの異なるDirect、Assistive、Incrementalの3つのタスク等価プロンプトとマルチホップQAベンチマークを評価した。
幻覚が一致している間に事実知識が安定しているため、クロスレジームは内部の不確実性の正確なシグナルを与える。
論文 参考訳(メタデータ) (2026-02-04T18:39:58Z) - A Granular Study of Safety Pretraining under Model Abliteration [64.24346997570275]
本稿では,リフレクションに敏感な方向を除去する軽量プロジェクション技術であるモデルアブリーブレーションについて検討する。
我々は、バランスのとれた有害かつ無害なケースで100のプロンプトを発行し、複数の判断を用いて**Refusal*または***Non-Refusal*として応答を分類し、判断の忠実さを検証する。
本研究は,データ中心の安全コンポーネントが失語中も頑健であるチェックポイントレベルの特徴付けを行う。
論文 参考訳(メタデータ) (2025-10-03T07:01:45Z) - Detecting LLM-Generated Peer Reviews [37.51215252353345]
大規模言語モデル(LLM)の台頭は、一部のレビュアーが独立して記述するのではなく、レビューを生成するためにこれらのツールに依存するのではないかという懸念を提起している。
論文のPDFを通じて間接的インジェクションを行うアプローチを考察し,LLMが生成したレビューに隠された透かしを埋め込むよう促す。
本稿では,複数のレビューにまたがって家族的誤り率を制御し,標準的な修正よりも高い統計力を実現する透かし方式と仮説テストを導入する。
論文 参考訳(メタデータ) (2025-03-20T01:11:35Z) - Fact-Checking the Output of Large Language Models via Token-Level Uncertainty Quantification [116.77055746066375]
大型言語モデル(LLM)は幻覚、すなわちその出力に誤った主張を生じさせることで有名である。
本稿では,トークンレベルの不確実性定量化に基づくファクトチェックと幻覚検出パイプラインを提案する。
論文 参考訳(メタデータ) (2024-03-07T17:44:17Z) - Setting the Trap: Capturing and Defeating Backdoors in Pretrained
Language Models through Honeypots [68.84056762301329]
近年の研究では、バックドア攻撃に対するプレトレーニング言語モデル(PLM)の感受性が明らかにされている。
バックドア情報のみを吸収するために,ハニーポットモジュールをオリジナルのPLMに統合する。
我々の設計は、PLMの低層表現が十分なバックドア特徴を持っているという観察に動機づけられている。
論文 参考訳(メタデータ) (2023-10-28T08:21:16Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。