論文の概要: Structured Feedback Improves Repair in an LLM Agent Loop
- arxiv url: http://arxiv.org/abs/2607.14167v1
- Date: Wed, 15 Jul 2026 06:14:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-17 17:01:32.848804
- Title: Structured Feedback Improves Repair in an LLM Agent Loop
- Title(参考訳): LLMエージェントループにおける構造フィードバックの改善
- Authors: Jaideep Ray, Ankit Goyal,
- Abstract要約: LLMエージェントは、外部から候補を拒否した後で再試行されることが多いが、検証と次のモデル呼び出しの間のインターフェースは未特定のままである。
コード制御エージェントループであるVeriHarnessを導入し、モデルが候補を生成し、外部検証者が受け入れ、予算、トレースを制御する。
生の診断と、失敗位置、観測値、許容可能な代替品を識別するフィードバックを比較します。
- 参考スコア(独自算出の注目度): 2.8890052855500143
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: LLM agents often retry after external validation rejects a candidate, but the interface between validation and the next model call remains underspecified. We introduce VeriHarness, a code-controlled agent loop in which models generate candidates while external validators control acceptance, budgets, and traces. We use it to compare raw diagnostics with feedback that identifies the failure location, observed value, and admissible alternatives. Across 50 paired TextWorld games under a four-call cap, feedback containing all three fields raises terminal success from 14/50 to 36/50 for Qwen2.5-Coder-14B (+44 percentage points) and from 8/50 to 29/50 for Llama-3.1-8B (+42 points). Ablations locate most of the gain in the admissible alternatives: feedback containing only the location and observed value remains near the raw diagnostic baseline. Presenting the complete repair information in prose instead of a keyed JSON record yields nearly the same success, providing no evidence that JSON syntax itself improves repair. The ordering persists across the tested call budgets and one sampled-decoding setting.
- Abstract(参考訳): LLMエージェントは、外部のバリデーションが候補を拒否した後で再試行されることが多いが、バリデーションと次のモデル呼び出しのインターフェースは未定のままである。
コード制御エージェントループであるVeriHarnessを導入し、モデルが候補を生成し、外部検証者が受け入れ、予算、トレースを制御する。
生の診断と、失敗位置、観測値、許容可能な代替品を識別するフィードバックを比較します。
4コールキャップの下の50組のTextWorldゲームでは、Qwen2.5-Coder-14Bでは14/50から36/50に、Llama-3.1-8Bでは8/50から29/50に、全3つのフィールドを含むフィードバックが端末の成功を14/50から36/50に引き上げている。
アブレーションは、許容可能な代替手段のほとんどの利得を突き止める: 位置と観測値のみを含むフィードバックは、生の診断基準線の近くに残っている。
キー付きJSONレコードの代わりに、散文で完全な修復情報を提示することは、ほぼ同じ成功をもたらし、JSON構文自体が修復を改善する証拠を与えない。
テストされたコール予算と1つのサンプルデコード設定で順序が持続する。
関連論文リスト
- Data and Evaluation Closed-Loop for Model Capability Enhancement [8.245706308161504]
評価は直感的ではなく,日常的,監査可能,実験的に検証可能であることを示す。
評価データ間推論は直感的ではなく,日常的,監査可能,実験的に検証可能であることを示す。
論文 参考訳(メタデータ) (2026-06-26T14:45:57Z) - Code Correctness Signals in LLM Hidden States: Pre-Generation Probing and Repair Geometry [0.0]
モデルのファーストアタプティブコードの正しさは、プロンプト-ファイナル隠れ状態から線形にデオード可能である。
モデルが失敗した最初の試みを修復しようとするケース236では、失敗した試みからその修復への隠れ状態シフトが統計的に検出可能なコントラスト方向をもたらす。
論文 参考訳(メタデータ) (2026-06-12T15:06:15Z) - Beyond Pass Rate: A Multilingual, Execution-Grounded Evaluation of Open Code LLMs [0.0]
ベストモデルの平均正しさは23.64%に達し、人間受け入れベースラインは57.2%である。
Qwen2.5-Coder-14B-Instructは、難しい問題と明確なプロブレムカバレッジで最強である。
Gemma-2-27B-ITは全言語でのリント通過率が最も高い。
論文 参考訳(メタデータ) (2026-06-07T21:10:30Z) - ReacTOD: Bounded Neuro-Symbolic Agentic NLU for Zero-Shot Dialogue State Tracking [2.2573512203799626]
本稿では,NLUを独立したツールコールとして再構成する有界神経シンボルアーキテクチャであるReacTODを提案する。
有界ReActループは反復自己補正を可能にし、MultiWOZ上のシングルパス推論よりも最大9.3ポイント精度を向上させる。
論文 参考訳(メタデータ) (2026-05-18T20:06:04Z) - ReVSI: Rebuilding Visual Spatial Intelligence Evaluation for Accurate Assessment of VLM 3D Reasoning [59.558706734431276]
空間知能の現在の評価は、現代の視覚言語モデル(VLM)設定下で体系的に無効にすることができる。
本稿では,各QAペアが実際の入力の下で応答可能で正しいことを保証するためのベンチマークとプロトコルであるReVSIを紹介する。
論文 参考訳(メタデータ) (2026-04-27T10:45:51Z) - DebugRepair: Enhancing LLM-Based Automated Program Repair via Self-Directed Debugging [20.747648291211338]
DebugRepairは自動プログラム修復のためのセルフダイレクトフレームワークである。
中間ランタイムエビデンスによるパッチ改善を改善する。
15のアプローチに対して最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2026-04-21T10:11:59Z) - HLE-Verified: A Systematic Verification and Structured Revision of Humanity's Last Exam [63.84155758655084]
HumanityのLast Exam (HLE)は、フロンティアの大規模言語モデルを評価するために広く使われているベンチマークである。
HLE-Verifiedは,透過的検証プロトコルときめ細かい誤り分類法を備えたHLEの検証および改訂版である。
我々は,HLEとHLE-Verifiedの7つの最先端言語モデルを評価し,平均7~10ポイントの絶対精度を観測した。
論文 参考訳(メタデータ) (2026-02-15T02:50:15Z) - CLUE: Non-parametric Verification from Experience via Hidden-State Clustering [64.50919789875233]
隠れアクティベーションの軌跡内の幾何的に分離可能なシグネチャとして解の正しさが符号化されていることを示す。
ClUE は LLM-as-a-judge ベースラインを一貫して上回り、候補者の再選において近代的な信頼に基づく手法に適合または超えている。
論文 参考訳(メタデータ) (2025-10-02T02:14:33Z) - Eigen-1: Adaptive Multi-Agent Refinement with Monitor-Based RAG for Scientific Reasoning [53.45095336430027]
暗黙的な検索と構造化された協調を組み合わせた統合フレームワークを開発する。
Humanity's Last Exam (HLE) Bio/Chem Goldでは,48.3%の精度を実現している。
SuperGPQAとTRQAの結果はドメイン間の堅牢性を確認した。
論文 参考訳(メタデータ) (2025-09-25T14:05:55Z) - High Accuracy, Less Talk (HALT): Reliable LLMs through Capability-Aligned Finetuning [84.52940628494879]
大規模言語モデル(LLM)は現在、すべてのプロンプトに応答する。
LLMは、知識や能力の欠如によって、誤った答えを生み出すことができる。
本稿では,その正確性に自信を持った場合にのみコンテンツを生成するためのLCMのポストトレーニングを提案する。
論文 参考訳(メタデータ) (2025-06-04T15:16:21Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。