論文の概要: Exact Feedback Is Not Control: Evaluating Text-based Closed-Loop Revision in LLMs
- arxiv url: http://arxiv.org/abs/2609.28150v1
- Date: Wed, 23 Sep 2026 14:06:52 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-25 00:05:18.056576
- Title: Exact Feedback Is Not Control: Evaluating Text-based Closed-Loop Revision in LLMs
- Title(参考訳): 厳密なフィードバックは制御されない: LLMにおけるテキストベースのクローズドループ修正の評価
- Abstract要約: 本稿では, 正確な長さ, 語彙, 構成制約にまたがるすべての違反を, 決定論的検証を行う固定予算修正プロトコルを提案する。
フィードバックの正しさと完全さの修正はモデル側のリビジョン動作を分離する。
一致した状態の介入は、最終的な成功を確実に改善することなく、現在のドラフトを保持しながら以前の対話を削除し、フィードバックが変更を修正したことを示している。
- 参考スコア(独自算出の注目度): 11.49266427505128
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Closed-loop revision is increasingly used in large language model (LLM) applications, but failures may reflect incomplete feedback or ineffective responses to correct feedback. We introduce a fixed-budget revision protocol with deterministic verifiers that report all remaining violations across exact-length, lexical, and compositional constraints. Fixing feedback correctness and completeness isolates model-side revision behavior. Across 19 open- and closed-source models, controller-level mean final joint success ranges from 17.4% to 99.8%, with substantial cross-model gaps persisting under identical initial drafts. Controlled experiments reveal reproducible model-specific responses to exact feedback. Post-training and scale reshape these responses without consistently bringing them closer to exact correction. Across all constraint families, failed trajectories often repeat earlier outputs, and prior recurrence is associated with lower subsequent recoverability. Matched-state interventions show that removing earlier dialogue while holding the current draft and feedback fixed changes recurrence escape without reliably improving final success; effects depend on the model, task, and trigger-state composition. Exact feedback makes revision errors observable, but does not make the closed loop reliable. Code and reproduction instructions: https://github.com/kevinjiang0121-cyber/exact-feedback-code.
- Abstract(参考訳): 閉ループリビジョンは、大規模言語モデル(LLM)アプリケーションでますます使われているが、失敗は不完全なフィードバックや、正しいフィードバックに対する不効果的な応答を反映する可能性がある。
本稿では, 正確な長さ, 語彙, 構成制約にまたがるすべての違反を, 決定論的検証を行う固定予算修正プロトコルを提案する。
フィードバックの正しさと完全さの修正は、モデル側のリビジョン動作を分離する。
19のオープンソースモデルとクローズドソースモデルの合計で、コントローラレベルの平均的なジョイント成功率は17.4%から99.8%の範囲であり、同じ初期ドラフトの下ではかなりのクロスモデルギャップが持続する。
制御された実験は、正確なフィードバックに対する再現可能なモデル固有応答を明らかにする。
トレーニング後の応答とスケールは、常に正確な修正に近づくことなく、これらの応答を再形成する。
すべての制約された族全体で、失敗した軌道はしばしば初期の出力を繰り返す。
一致した状態の介入は、現在のドラフトを保持しながら以前の対話を削除し、フィードバックが修正され、最終的な成功を確実に改善することなく、再発回避が修正されたことを示している。
厳密なフィードバックはリビジョンエラーを観測できるが、クローズドループを信頼できない。
コードと再生命令:https://github.com/kevinjiang0121-cyber/exact-feedback-code
関連論文リスト
- Same Scores, Different Decisions: Evaluating JEV and Language Models for Legal Document Understanding [65.85599131866623]
私たちはJevとContractNLIの9つの言語モデルを比較します。
制御された比較は、仮説の可視性、要求された出力、および出力順序によって異なる。
Jevは、評価された構成の中で、最低コストと中央値のレスポンス時間を持っています。
論文 参考訳(メタデータ) (2026-09-23T10:53:01Z) - When Residualization Helps an Audit: Format Effects, Slice Gains, and Their Limits [0.7734726150561088]
LLMシステムで使用される評価スコアは、測定する品質ではなく、表面形状を追跡することができる。
観測的NLIおよびQA設定では、不随伴アノテータのラベルを用いて評価する前に、保持された複製を凍結し、再評価する。
完全な人口合意は、報告された正のスライスゲインを持つすべての観測条件に該当し、要求内ランキングはそのようなQA設定すべてに該当する。
論文 参考訳(メタデータ) (2026-09-21T07:06:37Z) - User Feedback Provides a Unique Signal that LLMs Can not Detect [25.849928795741672]
ユーザからのフィードバックが、改善のための非常に実用的なシグナルであることを実証します。
フィードバックインフォームドリビジョンでは,ベースラインリビジョンよりもはるかに高いレートで目標課題を解決できることが示されている。
論文 参考訳(メタデータ) (2026-09-02T17:42:44Z) - ReDeck: Step-Level Render-Grounded Refinement for Document-to-Slide Generation [50.508786206669605]
本稿では,文書・スライド生成のためのステップレベルのレンダリング・グラウンド・リファインメント・フレームワークであるReDeckを提案する。
局所的な修復とグローバルな品質のバランスをとるために、ReDeckでは、空間的エラーに対する複数のグラニュラフィードバック、セマンティックとデザインのガイダンスに対するターンレベルの適応的批判、ハードレイアウトの検証のための提出レベルゲートを使用している。
GPT-5.4、Claude-4.6、Gemini-3.1の他、ReDeckは既存のスライド生成エージェントより一貫して優れている。
論文 参考訳(メタデータ) (2026-08-31T18:12:10Z) - ReTrace: Rejected-Trajectory Conditioning for Speculative Decoding [46.17292752074153]
本稿では,前回のラウンドから削除された接尾辞に対して,各ドラフトブロックを条件付けするReTraceを紹介する。
ReTraceは、DFlashバックボーン上で、平均受信長とエンドツーエンドの復号速度を継続的に改善する。
論文 参考訳(メタデータ) (2026-08-30T12:20:54Z) - Benchmarking Code Improvement with Progressive, Adaptive, and Interactive Feedback [13.976149104483449]
PAIR-Benchは、大規模言語モデル(LLM)を評価するためのプログレッシブベンチマークである。
不正確なプログラムや不完全なプログラムを、フィードバック誘導による改善によって、より正しいプログラムに変換する。
モデルがターゲットの障害を修復するかどうかを計測し、ヒントを超えて一般化し、すでに正しい振る舞いを保持し、どのくらいの助けが必要なのかを測定します。
論文 参考訳(メタデータ) (2026-07-01T18:20:27Z) - CARE What Fails: Contrastive Anchored-REflection for Verifiable Multimodal [84.71254539482369]
検証可能な報酬を伴うグループ相対的強化学習(RLVR)は、しばしば、すでに失敗している最も情報に富むデータを浪費する。
エラーを監督するマルチモーダル推論のための,障害中心のポストトレーニングフレームワークであるCAREを提案する。
CAREは正確さを改善し、スムーズさをトレーニングすると同時に、障害からの学習信号のシェアを明示的に増やします。
論文 参考訳(メタデータ) (2025-12-22T16:34:21Z) - Feedback Friction: LLMs Struggle to Fully Incorporate External Feedback [35.13591109493438]
提案手法は,フィードバックに対する抵抗性,すなわちフィードバック摩擦と呼ばれる制限を一貫して示している。
フィードバック摩擦を解析し、セマンティックエントロピーによって測定された特定の質問に対するモデルの信頼度が、フィードバック抵抗を予測する。
論文 参考訳(メタデータ) (2025-06-13T16:31:51Z) - RCOT: Detecting and Rectifying Factual Inconsistency in Reasoning by
Reversing Chain-of-Thought [56.558892336235914]
Reversing Chain-of-Thought (RCoT) は、大規模言語モデルの推論能力を改善する新しい手法である。
RCoTは生成したソリューションにおける事実の不整合を自動的に検出し、修正する。
手書きのきめ細かいフィードバックがLLMの推論能力を大幅に向上させることを示す。
論文 参考訳(メタデータ) (2023-05-19T08:02:52Z) - Factual Error Correction for Abstractive Summaries Using Entity
Retrieval [57.01193722520597]
本稿では,エンティティ検索後処理に基づく効率的な事実誤り訂正システムRFECを提案する。
RFECは、原文と対象要約とを比較して、原文から証拠文を検索する。
次に、RFECは、エビデンス文を考慮し、要約中のエンティティレベルのエラーを検出し、エビデンス文から正確なエンティティに置換する。
論文 参考訳(メタデータ) (2022-04-18T11:35:02Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。