論文の概要: Distilling Reasoning Traces into Advisory Prompts for Software Engineering Tasks
- arxiv url: http://arxiv.org/abs/2608.00437v1
- Date: Sat, 01 Aug 2026 04:32:18 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:54:11.095162
- Title: Distilling Reasoning Traces into Advisory Prompts for Software Engineering Tasks
- Title(参考訳): ソフトウェアエンジニアリングタスクのための助言プロンプトに推論トレースを蒸留する
- Abstract要約: ハイブリッド推論モデルによってトリガ可能な機能として露呈された"推論"あるいは"思考"モードは、エラーを低減します。
本稿では,常に推論コストを発生させることなく,より良い性能が得られるかどうかを問う。
- 参考スコア(独自算出の注目度): 3.4482431747857674
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Language models are widely used for generating and otherwise processing code (e.g., identifying code hallucinations, possible inputs, or predicting outputs); however, LLMs can make mistakes, which can be serious. One key issue is that models are trained on (still) largely human-written, and thus imperfect, code; it's not easy to find sufficiently large code corpora that are entirely free of bugs. Thus, other inference-time ways of reducing LLM errors, without additional training, are desirable. "Reasoning" or "thinking" modes, exposed as a togglable feature by hybrid reasoning models, do reduce errors; however, reasoning consumes additional resources. This paper asks if better performance can be achieved without always incurring the cost of reasoning. Human students of programming learn to avoid mistakes by (a) identifying them, (b) reflecting upon the cognitive lapses that led to them (essentially, "thinking through" the errors), (c) inferring general rules or lessons from these reflections, and (d) internalizing these lessons into rules. In tutorial sessions with an instructor, this is a common Socratic interaction. Examples of such internalizable rules might include the nugget "Before coding, restate the requirements to clarify them." Inspired by this process, this paper describes an approach where we first identify examples in which "thinking mode" in a (low-resource) LLM avoids errors. These errors, and their avoidance via "thinking" in the same LLM, are then examined by a bigger LLM to generate summary explanations; these are then summarized by a large LLM into brief advisory prompts. This approach works on many modest-sized models; in some cases, the "advisory prompts" thus learned can also be gainfully transferred to other models. We also present investigations into the nature of coding errors that language models make, and a characterization of when this approach can be helpful.
- Abstract(参考訳): 言語モデルは、コードの生成およびその他の処理(例えば、コード幻覚の識別、入力の可能性、出力の予測)に広く使用されているが、LLMはミスを犯しうるため、深刻な可能性がある。
重要な問題のひとつは、モデルが(まだ)主に人間によって書かれており、不完全なコードで訓練されていることです。
したがって、追加のトレーニングを伴わずにLLMエラーを削減する他の推論時方法が望ましい。
ハイブリッド推論モデルによってトグル可能な機能として露呈された"推論"あるいは"思考"モードは、エラーを低減しますが、推論は追加のリソースを消費します。
本稿では,常に推論コストを発生させることなく,より良い性能が得られるかどうかを問う。
プログラミングの人間の学生はミスを避けるために学ぶ
(a)それらを特定する。
b) それらに繋がった認知的過失(本質的には「誤りを乗り越える」こと)を反映すること。
(c)これらの反射から一般的な規則や教訓を推測すること、
(d) これらの教訓をルールに内包する。
インストラクターとのチュートリアルセッションでは、ソクラテス的な対話が一般的である。
このような内部化可能なルールの例としては、"コーディングの前に、それらを明確にするために要求を再定義する"というナゲットがある。
このプロセスにインスパイアされた本論文では,(低リソースの)LCMにおける「思考モード」がエラーを回避する事例を最初に特定する手法について述べる。
これらの誤りと、同じLSMで「考える」ことによる回避は、より大きなLSMによって検証され、要約説明が生成される。
このアプローチは多くのモデストサイズのモデルで機能するが、場合によっては、学習した"アドバイザリープロンプト"を他のモデルに適切に転送することもできる。
また、言語モデルが生成するコーディングエラーの性質や、このアプローチがいつ役に立つかという特徴についても検討する。
関連論文リスト
- Unreliable in Practice? A Comprehensive Study of Errors in LLM-Generated Code [0.8921166277011344]
大規模言語モデル(LLM)はコーディングに広く使われており、AIが生産コードのシェアを拡大していることが報告されている。
コンパイルや実行時のエラーを含む86,726のコードサンプルのコーパスを分析した。
結果は、エラータイプは言語やモデルによって大きく異なるが、最大のモデルでさえしばしば単純な誤りを犯すことを示している。
論文 参考訳(メタデータ) (2026-08-01T13:31:42Z) - Think Anywhere in Code Generation [89.9273351013764]
Think-Anywhereは、LLMがコード生成中にオンデマンドで思考を実行することを可能にする、新しい推論メカニズムである。
我々は,Think-Anywhereが既存の推論手法と最近のポストトレーニング手法の両方に対して最先端の性能を達成することを示す。
分析の結果,Think-Anywhereは高エントロピー位置での推論を適応的に実行し,解釈可能性を高めることができることがわかった。
論文 参考訳(メタデータ) (2026-03-31T16:24:03Z) - Large Language Model Hacking: Quantifying the Hidden Risks of Using LLMs for Text Annotation [66.84286617519258]
大規模言語モデルは、データアノテーションやテキスト分析といった労働集約的なタスクの自動化を可能にすることで、社会科学の研究を変革している。
このような変異は、系統的なバイアスやランダムなエラーを導入し、下流の分析に伝播し、タイプI(偽陽性)、タイプII(偽陰性)、タイプS(重み付け効果)、タイプM(誇張効果)のエラーを引き起こす。
意図的なLSMハッキングは驚くほど単純であることがわかった。21の社会科学研究から37のデータアノテーションタスクを複製することで、ほんのわずかのプロンプトの言い回しで、事実上何であれ統計的に重要なものとして表現できることがわかりました。
論文 参考訳(メタデータ) (2025-09-10T17:58:53Z) - Navigating Pitfalls: Evaluating LLMs in Machine Learning Programming Education [2.9248916859490173]
本研究では,機械学習教育における学習支援における大規模言語モデルの利用について検討する。
機械学習コードにおけるプラクティスの一般的なエラーを識別するLLMの機能と、学習をガイドできるフィードバックを提供する能力に焦点を当てている。
論文 参考訳(メタデータ) (2025-05-23T08:39:58Z) - Type-Constrained Code Generation with Language Models [51.03439021895432]
本稿では,型システムを利用してコード生成を誘導する型制約デコード手法を提案する。
そこで本研究では,新しい接頭辞オートマトンと,在来型を探索する手法を開発し,LLM生成コードに適切な型付けを強制するための健全なアプローチを構築した。
提案手法は,コード合成,翻訳,修復作業において,コンパイルエラーを半分以上削減し,機能的正しさを著しく向上させる。
論文 参考訳(メタデータ) (2025-04-12T15:03:00Z) - A Deep Dive Into Large Language Model Code Generation Mistakes: What and Why? [9.246899995643918]
大規模な言語モデルは、仕様から逸脱する欠陥コードを生成することができる。
広範囲な手動分析により, ノンシンタクティックな誤りの7つのカテゴリーが同定された。
評価の結果,LPMの誤りの原因を特定すると,ReActプロンプト技術を用いたGPT-4が最大0.65のF1スコアを達成できることがわかった。
論文 参考訳(メタデータ) (2024-11-03T02:47:03Z) - Can LLMs Learn from Previous Mistakes? Investigating LLMs' Errors to Boost for Reasoning [34.34977150518316]
textscCoTErrorSetは609,432の質問を持つ新しいベンチマークで、それぞれが正しい参照とエラー参照の両方で設計されている。
textbfSelf-rethinking guideing LLMsは、彼らが同じような間違いを犯したかどうかを再考するよう促している。
textbfMistakeチューニングは、正しい推論ドメインと間違った推論ドメインの両方でモデルを微調整する。
論文 参考訳(メタデータ) (2024-03-29T08:30:34Z) - Decoding Logic Errors: A Comparative Study on Bug Detection by Students
and Large Language Models [5.162225137921625]
大規模言語モデル(LLM)は、最近、様々な計算タスクにおいて驚くべきパフォーマンスを示した。
GPT-3 と GPT-4 の2つの LLM の性能について検討した。
論文 参考訳(メタデータ) (2023-11-27T17:28:33Z) - Large Language Models can Learn Rules [106.40747309894236]
大規模言語モデル(LLM)を用いた推論のためのルールライブラリを学習するフレームワークであるHtTを提案する。
リレーショナル推論、数値推論、概念学習に関する実験は、HtTが既存のプロンプト法を改善することを示す。
学習されたルールは、異なるモデルや同じ問題の異なる形式にも転送可能である。
論文 参考訳(メタデータ) (2023-10-10T23:07:01Z) - SelfCheck: Using LLMs to Zero-Shot Check Their Own Step-by-Step
Reasoning [55.76083560152823]
SelfCheckは、ステップバイステップの推論でエラーを認識する汎用的なゼロショット検証スキーマである。
我々は,3つのデータセット(GSM8K,MathQA,MATH)上でSelfCheckをテストし,エラーの認識に成功し,最終的な回答精度が向上することを確認した。
論文 参考訳(メタデータ) (2023-08-01T10:31:36Z) - Language models are weak learners [71.33837923104808]
本研究では,プロンプトベースの大規模言語モデルは弱い学習者として効果的に動作可能であることを示す。
これらのモデルをブースティングアプローチに組み込むことで、モデル内の知識を活用して、従来のツリーベースのブースティングよりも優れています。
結果は、プロンプトベースのLLMが、少数の学習者だけでなく、より大きな機械学習パイプラインのコンポーネントとして機能する可能性を示している。
論文 参考訳(メタデータ) (2023-06-25T02:39:19Z) - Do Large Language Models Pay Similar Attention Like Human Programmers When Generating Code? [10.249771123421432]
我々は,Large Language Models (LLMs) が,コード生成中に人間のプログラマと同じタスク記述に係わるかどうかを検討する。
手動で211の間違ったコードスニペットを分析し、多くのコード生成エラーを説明するのに使える5つの注意パターンを見つけました。
この結果から,人間によるLLMの理解性向上とプログラマの信頼度向上の必要性が浮き彫りになった。
論文 参考訳(メタデータ) (2023-06-02T00:57:03Z) - Rethinking with Retrieval: Faithful Large Language Model Inference [91.66406351103484]
我々は検索(RR)で再考する新しいポストプロセッシング手法を提案する。
RRは、チェーン・オブ・シークレット・プロンプトから得られた推論ステップに基づいて、関連する外部知識を検索する。
複雑な3つの推論課題に対する GPT-3 を用いた広範囲な実験により RR の有効性を評価する。
論文 参考訳(メタデータ) (2022-12-31T22:35:34Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。