論文の概要: Hints Help But Do They Teach? Evaluating Skills Transfer in Code Generation
- arxiv url: http://arxiv.org/abs/2609.01106v1
- Date: Tue, 01 Sep 2026 11:47:39 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.609913
- Title: Hints Help But Do They Teach? Evaluating Skills Transfer in Code Generation
- Title(参考訳): ヒントは教えるのに役立つか? コード生成におけるスキル伝達の評価
- Authors: Will Badr,
- Abstract要約: Qwen2.5-3B-インストラクションで選択された79の障害のうち36の適切な関連ヒントが回収された。
Qwenのメカニスティックテストは、関連するヒントと無関係なヒントによって共有される安定した活性化方向を特定する。
ポストジェネレーション後の隠れ状態プローブは、AUROC 0.806と0.780のプールを持つベンチマーク間で転送されるが、トークンの信頼性よりもトップワンの選択優位性は統計的に未解決である。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: When a hint turns a failing generated program into a passing one, does it provide missing information or merely steer the model toward a solution it could already produce? We test these hypotheses on HumanEval+ and MBPP+ using executable evaluation. For Qwen2.5-3B-Instruct, adaptive relevant hints rescue 36 of 79 selected failures; an unrelated hint rescues 19, while eight unhinted samples solve 46 and recover 31 of the 36 relevant-hint rescues. Phi-3.5-mini shows the same pattern: relevant hints rescue 42 of 101 failures, an unrelated hint rescues 17, and unhinted sampling solves 57, including 36 of the 42 relevant-hint rescues. Because the hint conditions use different attempt budgets, these comparisons do not isolate a purely semantic effect. Mechanistic tests on Qwen identify a stable activation direction shared by relevant and unrelated hints. Persistently adding this direction yields 14 rescues and 18 regressions, with no detectable net accuracy gain; learned low-rank interventions have a positive but imprecise estimated effect. Full textual specifications solve 22 of 24 context-defined problems, versus 5-11 for tested virtual-KV prefixes. Post-generation hidden-state probes transfer across benchmarks, with pooled AUROC 0.806 and 0.780, but their top-one selection advantage over token confidence is statistically unresolved. Overall, relevant hints can rescue failures, but most rescued solutions are already reachable through ordinary sampling, and the internal interventions tested here do not establish task-general capability transfer.
- Abstract(参考訳): ヒントがフェールしたプログラムをパスするプログラムに変えたとき、不足した情報を提供するのか、あるいは、既に生成可能なソリューションに向けて単にモデルを動かすのか?
これらの仮説をHumanEval+とMBPP+で実行可能評価を用いて検証した。
Qwen2.5-3B-インストラクションでは、適合性のあるヒントが79件の障害のうち36件、無関係なヒントが19件、非隠れたサンプルが8件、非隠れたサンプルが46件、そして36件の救助のうち31件を回収する。
Phi-3.5-miniも同様のパターンを示しており、関連するヒントが101件の障害42件、無関係なヒントが17件、不明なサンプリングが57件であり、42件の隠れた救助のうち36件が含まれている。
ヒント条件は異なる試行予算を使用するため、これらの比較は純粋に意味論的効果を分離しない。
Qwenのメカニスティックテストは、関連するヒントと無関係なヒントによって共有される安定した活性化方向を特定する。
この方向を持続的に追加すると、14の救助と18の回帰が得られ、検出可能なネットの精度が向上しない。
完全なテキスト仕様は、テストされた仮想KVプレフィックスの5-11に対して、コンテキスト定義の問題24のうち22を解決している。
ポストジェネレーション後の隠れ状態プローブは、AUROC 0.806と0.780のプールを持つベンチマーク間で転送されるが、トークンの信頼性よりもトップワンの選択優位性は統計的に未解決である。
全体としては、関連するヒントは障害を救えるが、ほとんどの救助されたソリューションは、通常のサンプリングによって既に到達可能であり、ここでテストされた内部介入は、タスク・ジェネリックな能力伝達を確立していない。
関連論文リスト
- Demystifying Agent Skills: Why They Work-Until They Don't [58.92875630998418]
既存の評価は、スキルが集約されたタスクの成功を改善するかどうかを主に測定する。
我々は、表現、結果アノテーション、検索難易度、スキルのクロスフレームワークの影響を分離する。
我々はこれらの観察を3つの高レベルカテゴリと12のスキルユースモードの分類に集約する。
論文 参考訳(メタデータ) (2026-08-14T07:26:38Z) - DarwinX: Evolving Agent Harnesses Through Natural Selection [48.64258219266629]
ダーウィンXは自己進化を、モデルが凍結されたハーネスの集団の選択として扱う。
一般的なエージェント能力はベンチマーク固有のパッチではなく、タスク、検証、ベースモデルの変更を生き残る。
論文 参考訳(メタデータ) (2026-07-31T05:34:02Z) - Beyond Self-Knowledge: Propagating Uncertainty Across Reasoning and Retrieval in LLMs [4.476374205849672]
ブラックボックス言語モデルの言語的信頼度は、検索ルーティングのための実用的な信号として機能する。
6つのQAベンチマーク、3つのモデルファミリー、3つの検索ポリシーで27,000のポリシーインスタンスを評価した。
論文 参考訳(メタデータ) (2026-07-28T11:30:25Z) - Operational Proto-Introspection in Looped Language Models: Process-Quality Taps, Executable Branching, and the Readout-Control Boundary [0.0]
言語モデルは、進行中の計算の質を読み取ることができるか?
外部介入は、その読み出しをより良い結果に変えることができるか?
凍結した2.6Bループ変換器,Ouro-RLTTで両質問を検証した。
論文 参考訳(メタデータ) (2026-07-20T22:40:36Z) - Efficient Visual Pointing for Embodied AI:Agent-Driven Data Synthesis, Cross-Block Attention, and Iterative Correction [55.11480729304395]
PointArena 2026は77.2%の精度でベンチマークで2位である。
ap proachは3つの障害モードをターゲットにしている。第一に、エージェント駆動のシンセシスは大きなセマンティクスとアンカー相対的な候補プールを構築する。
次に、determinis tic steerable-dataパイプラインは、認証された10,000サンプルのメインセットと、マスク、テンプレート、パス検証を使用するリザーブサンプルを生成する。
論文 参考訳(メタデータ) (2026-06-29T06:39:03Z) - Speculative Decoding at Temperature Zero: A Scoped Safety-Invariance Screen with a 48,072-Sample Expansion [0.0]
投機的復号化は、ターゲットモデルを検証するためのトークンをドラフトモデルに提案させることで推論を加速する。
温度0では、ドラフトサイドの動作が安全マークの出力に漏れる可能性があることを示す。
論文 参考訳(メタデータ) (2026-06-23T19:06:42Z) - Automated Proving of Shannon-Type Entropy Inequalities via Fine-Tuned Language Models and Guided Tree Search [50.16356451328644]
シャノン型エントロピーの不等式を証明することは情報理論の基本的な課題である。
我々は,原子実証のステップを微調整した小規模大規模言語モデルがこのプロセスを自動化することができるか検討する。
GPT-5.5は0ショットプロンプトで1.7%のサンプルを解き、Psitipは33.3%のサンプルを解いた。
論文 参考訳(メタデータ) (2026-06-04T05:43:12Z) - Step-wise Rubric Rewards for LLM Reasoning [72.17879367869503]
RLVR(Reinforcement Learning with Verifiable Rewards)は、大規模言語モデルの推論を改善するために広く使われている。
正しい回答の18.2%は間違っているが、肯定的な報酬がある。
6つの数学的推論ベンチマークで、SRaRはRaRの平均精度を3.57ポイント改善した。
論文 参考訳(メタデータ) (2026-05-17T07:08:14Z) - ContractBench: Can LLM Agents Preserve Observation Contracts? [9.057486468322933]
観察契約の遵守は、緊急かつ回帰的な能力であることを示す。
ContractBenchは、2つの障害モードを探索する33の二重軸タスクのベンチマークである。
i)評価モデルが80%,Claude-Opus-4.6が77.8%, (ii)Qwen 3.5で4B (0%) から9B (56.6%) の急激な家庭内能力崖が397B-A17Bで70.7%, (iii) GPT-5ファミリーでの非単調性スケーリングが消失した。
論文 参考訳(メタデータ) (2026-05-17T06:37:04Z) - Fact or Facsimile? Evaluating the Factual Robustness of Modern Retrievers [34.31192184496381]
デンスレトリバーとリランカーは、検索強化世代(RAG)パイプラインの中心である。
我々は,これらのコンポーネントがベースとする大規模言語モデル(LLM)をどの程度の事実的能力で継承するか,あるいは失うかを評価する。
全ての埋め込みモデルにおいて、クエリと正しい完了の間のコサイン類似度スコアは、間違ったものよりも著しく高い。
論文 参考訳(メタデータ) (2025-08-28T04:13:51Z) - Conservative Prediction via Data-Driven Confidence Minimization [70.93946578046003]
機械学習の安全性クリティカルな応用においては、モデルが保守的であることが望ましいことが多い。
本研究では,不確実性データセットに対する信頼性を最小化するデータ駆動信頼性最小化フレームワークを提案する。
論文 参考訳(メタデータ) (2023-06-08T07:05:36Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。