論文の概要: Try Again, Don't Look Back: Blind Resampling Outperforms Self-Repair in Small Code Models
- arxiv url: http://arxiv.org/abs/2607.26117v1
- Date: Tue, 28 Jul 2026 16:58:27 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-30 21:06:25.434319
- Title: Try Again, Don't Look Back: Blind Resampling Outperforms Self-Repair in Small Code Models
- Title(参考訳): もう一度試してみて、振り返るな - Blindが小さなコードモデルで自己修復を成功させる
- Authors: Yuvraj Verma,
- Abstract要約: Self-repairはコードエージェントの標準コンポーネントであり、ほとんど常にリトライしないベースラインに対して評価されている。
MBPP+を3つのモデルスケールでプラセボ制御した設計を用いて, 整合型再試行条件を4つ比較した。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Self-repair - returning a failed program to the model together with its test output and asking for a correction - is a standard component of code agents, and is almost always evaluated against a baseline that does not retry at all. We argue that this comparison confounds the value of the feedback with the value of the extra attempt. Using a placebo-controlled design on MBPP+ at three model scales (1.5B, 3B, 7B), we compare four matched-budget retry conditions: blind resampling, a content-free failure notice, genuine execution feedback, and feedback augmented with verbal self-reflection. Blind resampling is the strongest condition below 7B, and remains statistically tied with the best condition at 7B, while consuming 2.5-5.5x fewer tokens; conditioning on the model's own failed attempt costs 6.1 points at 1.5B (p=0.006), and the informational content of execution feedback adds nothing measurable over the placebo. We attribute this to anchoring: when shown its previous attempt, a model reproduces a near-identical program in 33-68% of retries, against 2-14% under blind resampling. Two further experiments delimit the effect. Retrieved solutions to other tasks change nothing (bounded to +/-3.5 points), which localizes the harm to self-conditioning rather than context length; and reflection, the only condition that measurably weakens the anchor, remains dominated on cost. Replication rules out two competing explanations: the penalty is unchanged at full precision, and it reproduces on an independent model family. Across six configurations spanning two families and two precisions, its magnitude is predicted by baseline quality alone (r=0.96) - the cost of anchoring is the cost of committing to a bad first attempt.
- Abstract(参考訳): 自己修復 – テスト出力とともに失敗するプログラムをモデルに返却し、修正を求める – は、コードエージェントの標準コンポーネントであり、ほとんど常にリトライしないベースラインに対して評価されている。
この比較は、フィードバックの価値と余分な試みの価値とを一致させる。
MBPP+を3つのモデルスケール(1.5B, 3B, 7B)でプラセボ制御した設計を用いて, ブラインドリサンプリング, コンテンツフリー障害通知, 真の実行フィードバック, 言語自己回帰によるフィードバックの4つの整合型再試行条件を比較した。
ブラインド再サンプリングは7B以下の最も強い条件であり、7Bの最良の条件と統計的に結びついており、2.5-5.5倍のトークンを消費している。
従来の試みでは,33~68%のリトライでほぼ同一のプログラムを再現し,視覚的再サンプリングでは2~14%であった。
さらに2つの実験が効果を減らした。
他のタスクに対する解は、文脈長ではなく自己条件に対する害をローカライズする(+/-3.5 点にバウンドする)ため、何も変化しない; リフレクションは、測定可能なアンカーを弱める唯一の条件であり、コストで支配される。
レプリケーションは2つの競合する説明を除外する: ペナルティは完全な精度で変化せず、独立したモデルファミリで再現される。
2つのファミリーと2つの精度にまたがる6つの構成で、その大きさはベースラインの品質だけで予測される(r=0.96)。
関連論文リスト
- Abliteration Is Not a Scalpel: Off-Target Effects of Refusal Removal on Decision Disposition Across Model Families [51.56484100374058]
放棄 — モデルの拒絶方向を重みから取り除く — は、一般的な"アンセンソルド"なオープンウェイトモデルの標準的なレシピである。
ディスポジションプローブとして21,600個の決定を不確実性の下で使用し、凍結パイプラインを通じて再生することにより、決定層モデルが唯一の変数となる。
3つのエフェクトは2つのファミリーにまたがって複製される(ゼロを除く週間クラスターCI)
4つ目の効果は符号を逆転する:同じ操作によりGemmaで読み取られた方が自信が弱まり、Qwenで読み取られたものがより多くなる(ファミリーCIは重複しない)。
論文 参考訳(メタデータ) (2026-07-19T22:27:00Z) - Distribution-First Population Simulation: Collapse, Calibration, and Recall in Non-WEIRD LLM Persona Modeling [0.0]
合成親和性ツールは、独立大規模言語モデル(LLM)エージェントとして各個人を動作させる。
このパラダイムには基本的な障害モードがあることを示し、分散優先の修正をそれに対して設定する。
論文 参考訳(メタデータ) (2026-07-17T15:45:57Z) - Falsification, Not Exposure: An Internally Preregistered Placebo-Controlled Decomposition of Self-Repair Feedback in Frozen Small Code Models [0.0]
本研究では、ブラインドサンプリングベースラインに対してフィードバックパケットを分解するプラセボ制御装置を構築する。
この体制では、ファルシフィケーションは語彙や自己批判としてではなく、外部の実行可能な反例と比較するのに役立つ。
論文 参考訳(メタデータ) (2026-06-30T11:26:14Z) - Right Makes Might: Aligning Verified Hidden States Empowers RL Reasoning [55.264863369127774]
現在の方法では、それぞれの正しいロールアウトを単一の報酬ビットに減らし、隠れた状態間で共有される幾何学的構造を無視している。
本稿では,RLトレーニングにおけるアンカートークンにおける正ロールアウトの最終層を,トレーニングと推論の両方においてゼロオーバーヘッドで整列する補助損失関数Hidden-Alignを提案する。
8つの数学的推論ベンチマークでは、Hidden-AlignはDAPOベースラインの平均パス@1をQwen3-1.7B, 4B, 14Bで3.8, 6.2, 5.4ポイント改善し、3つのスケールで一貫したパス@kゲインを得る。
論文 参考訳(メタデータ) (2026-06-02T06:51:15Z) - Retrying vs Resampling in AI Control [0.42970700836450476]
我々は、AI制御の観点から再試行を行い、モデルが潜在的に敵対的なものとして扱う。
再試行は正直な疑念のスコアを減少させるが、信頼できないモデルは監視の合理性を利用してスニーカー攻撃を構築することができる。
論文 参考訳(メタデータ) (2026-05-25T17:10:41Z) - Quantization Undoes Alignment: Bias Emergence in Compressed LLMs Across Models and Precision Levels [0.0]
大規模言語モデルは、クラウドおよびエッジデプロイメントの推論コストとメモリフットプリントを低減するために、トレーニング後の量子化を通じて定期的に圧縮される。
既存の研究は通常、2つの条件のみを比較し、集約バイアスメトリクスに依存し、単一のモデルファミリを評価する。
12,148 BBQ バイアスベンチマーク項目の5つの精度レベル (BF16 - 3-bit) における3つの命令調整モデルの制御実験を行った。
論文 参考訳(メタデータ) (2026-05-02T05:41:47Z) - One Token Away from Collapse: The Fragility of Instruction-Tuned Helpfulness [12.183451602438753]
単純な語彙制約(句読解文字または共通単語の禁止)により、命令調整されたLLMが応答を崩壊させることを示す。
ベースモデルでは,同じ制約の下で,小さな,騒々しい,双方向的な効果を伴って,体系的な崩壊を示さないことを示す。
論文 参考訳(メタデータ) (2026-04-14T17:40:01Z) - CARE What Fails: Contrastive Anchored-REflection for Verifiable Multimodal [84.71254539482369]
検証可能な報酬を伴うグループ相対的強化学習(RLVR)は、しばしば、すでに失敗している最も情報に富むデータを浪費する。
エラーを監督するマルチモーダル推論のための,障害中心のポストトレーニングフレームワークであるCAREを提案する。
CAREは正確さを改善し、スムーズさをトレーニングすると同時に、障害からの学習信号のシェアを明示的に増やします。
論文 参考訳(メタデータ) (2025-12-22T16:34:21Z) - Token-Level Inference-Time Alignment for Vision-Language Models [58.41370989069588]
VLM(Vision-Language Models)は、現代のマルチモーダルインテリジェンスの重要なバックボーンとなっている。
本稿では,基本VLMを凍結し,その分布を近似する報酬モデルをトレーニングする軽量フレームワークTITAを提案する。
推測中、暗黙の選好信号は報酬モデルと目標VLMの対数確率比として抽出され、密集した自己回帰フィードバックが得られる。
論文 参考訳(メタデータ) (2025-10-20T09:58:03Z) - Language Model Preference Evaluation with Multiple Weak Evaluators [89.90733463933431]
PGEDは,複数のモデルに基づく評価器を用いて嗜好グラフを構築し,非循環的非競合性評価結果に対してこれらのグラフをアンサンブルし,デノテーズする手法である。
1)評価のためのモデルランキング、2)テスト時間スケーリングのための応答選択、3)モデル微調整のためのデータ選択である。
論文 参考訳(メタデータ) (2024-10-14T01:57:25Z) - TACRED Revisited: A Thorough Evaluation of the TACRED Relation
Extraction Task [80.38130122127882]
TACREDはリレーショナル抽出(RE)において最も大きく、最も広く使われているクラウドソースデータセットの1つである
パフォーマンスの天井に到達したのか、改善の余地はあるのか?
ラベルエラーは絶対F1テストエラーの8%を占めており、例の50%以上を可逆化する必要がある。
論文 参考訳(メタデータ) (2020-04-30T15:07:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。