論文の概要: After the Fix: How Corrected Agent Histories Transfer to Related Tasks
- arxiv url: http://arxiv.org/abs/2609.34603v1
- Date: Mon, 28 Sep 2026 08:35:23 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-30 21:28:46.752828
- Title: After the Fix: How Corrected Agent Histories Transfer to Related Tasks
- Title(参考訳): 修正後:修正されたエージェント履歴が関連するタスクにどのように転送されるか
- Abstract要約: エピソードの修復は、次のタスクにおいて、その体験をより良く記憶できることを示す。
私たちの3300は100のThinkingBoxペアと100のAPEXペアをソース状態の継承なしでカバーしています。
- 参考スコア(独自算出の注目度): 1.1453564854745386
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Does repairing an episode make its experience a better memory for the next task? We transfer the same failed source before and after accepted repair to a fixed target, alongside independent execution. Our 3,300 runs cover 100 ThinkingBox pairs and the same 100 APEX pairs with and without source-state inheritance, under eleven conditions. ThinkingBox's Full/Skill/Hybrid correction gains are 44/29/32 percentage points, with corrected performance 25/22/18 points above independence; inference weakens at the task-family level. Yet 12 of Full's 15-point larger correction gap over Skill come from worse uncorrected performance, not better corrected memory. Moreover, 22 of Full's 46 upward transitions restore observed baseline success. Neither APEX regime establishes comparable aggregate correction benefits. Action evidence connects workflow gains with reusable obligations and convention conflicts with source-local choices. Text APEX's accepted execution reaches 52% versus its summary's 40%, without robust global/group-level superiority or an estab- lished advantage over independence. Smaller handoffs reduce input but increase calls. The value of repairing experience is therefore distinct from the value of reusing it: memory updates require both a previous-version reference and a fresh-start reference.
- Abstract(参考訳): エピソードの修復は、次のタスクにおいて、そのエクスペリエンスをよりよいメモリにしますか?
修正が受け入れられた前後で同じ失敗したソースを、独立した実行とともに固定されたターゲットに転送します。
当社の3300台は、ThinkingBoxの100台とAPEXの100台を、ソース状態の継承なしで11条件でカバーしています。
フル/スキル/ハイブリドの修正率は44/29/32ポイントであり、独立性よりも25/22/18ポイント高い。
しかし、フルの15ポイントのSkillよりも大きな補正ギャップのうち12つは、誤りのないパフォーマンスであり、改善されたメモリではない。
さらに、フル46の上昇遷移のうち22回はベースライン成功を観測した。
どちらのAPEX体制も同等のアグリゲーション補正の利点は確立していない。
アクションエビデンスによってワークフローのゲインが再利用可能な義務と結びつき、ソースローカルな選択とコンベンションが衝突する。
テキストAPEXの許容実行は、その要約の40%に対して52%に達する。
より小さなハンドオフは入力を減らすが、呼び出しを増やす。
メモリ更新は、以前のバージョン参照と、新しいスタート参照の両方を必要とする。
関連論文リスト
- ControlScope: Workflow Revision and Reliability in LLM Agents [0.7460935829208671]
ControlScopeは生成されたコードを比較し、次のツールコールのデータ引数を編集し、未完成のワークフローを同じ公開実行状態から置き換える。
タスク、ALFWorld、AppWorldで1回、繰り返しレビューを評価します。
論文 参考訳(メタデータ) (2026-09-28T04:53:45Z) - Relic: From Multi-Agent Collaboration to Persistent Organizational Capability [37.80629799707573]
繰り返し発生するコラボレーションの失敗を組織所有の実行可能なプロトコルに変えるRelicを紹介します。
メンバーは目に見える仕事を反映し、ルールを提案し、採用を管理します。
論文 参考訳(メタデータ) (2026-09-26T21:55:49Z) - Reviewer Capability Governs Rejection Targeting, Not Repair Skill: Evidence from LLM Execute-Review-Revise Pipelines [0.0]
マルチエージェントのLLMパイプラインは、実行と検証を含む役割を、異なる機能階層のモデルに割り当てる傾向にある。
以前の文献では、検証段階は必ずしも有益であるとは限らないが、実行者に対してほぼ固定されたレビュアー能力を有していることが確認されている。
我々は、レビュアーを能力の範囲を全く解決できないモデルに置き換え、個々の拒絶の結果を計測する。
論文 参考訳(メタデータ) (2026-09-02T19:21:49Z) - SkillGLoW: Procedural-Family Skill Consolidation for Self-Improving Agents on Long-Horizon Task Streams [55.90739575113059]
再利用の欠如は、関連するタスクのクラスタによって共有される解決手順であり、その周りでSkillGLoWを構築している、と我々は主張する。
4つのベンチマーク(数学的推論、端末の自動化、ソフトウェア修復、実施制御)と3つのモデルで、前者は平均17.2ポイント(ハード)を獲得している。
論文 参考訳(メタデータ) (2026-09-02T07:31:18Z) - REVISE: Validity-Guided Recovery for Online Revisions in Agent Workflows [5.5444120195759785]
textscReviseは構造化エージェントのきめ細かい回復に有効である。
無効な作業を止め、最初期の紛争を超えて有効に確立された進捗を保ち、影響を受けた地域のみを再計算する。
モデルコールをフルリスタートに対して40.6--56.0%、サフィックス再計算に対して31.3--43.6%削減する。
論文 参考訳(メタデータ) (2026-09-01T03:22:18Z) - When Not to Imitate: Boundary-Aware Skill Memory for Reliable Tool-Use LLM Agents [62.10623192614306]
過去の成功からスキルを抽出することは、Large Language Model (LLM)エージェントの効率的な進化に不可欠である。
textbfBoundary-Aware Skill Memory (BASM)を提案する。
BASMは、成功度の高いスキルメモリベースラインを一貫して上回る。
論文 参考訳(メタデータ) (2026-08-23T10:16:06Z) - Stage-Replay Divergence Follows the KV Cache: Fixed-Prefix Precision Controls and Bidirectional Cache Transplantation [51.56484100374058]
Stage-replayは中間トークンプレフィックスを再構築し、プレフィックスに最初に到達したデコーダ状態からの継続として、新しいプリフィル継続を処理する。
一致した200itemの実験では、保持されたライブキャッシュと同一の整数トークンのワンショットプリフィルを比較し、両側に正確なレプリカを配置する。
論文 参考訳(メタデータ) (2026-07-30T16:41:40Z) - Beyond Fail-to-Pass: Iterative Hardening of Co-Generated Bug Reproduction Tests and Fixes [55.114939648705395]
大規模言語モデル(LLM)は、現実のバグに対して、プログラムの自動修正をますます実用的にしている。
バグ再現テスト(BRT)は、バグレポートを実行可能なバグ固有の信号に変換することで、このギャップを埋めるのに役立つ。
本稿では,ループ内収束基準としてLax信号を用いるコジェネレーションフレームワークであるCoHardenを提案する。
論文 参考訳(メタデータ) (2026-07-22T07:30:07Z) - Zero2Skill: Bootstrapping Robot Skills through Autonomous Data Collection, Training, and Deployment [53.913175773174636]
既存のパイプラインは、自己リセット、VLM検証、言語指導による修正を通じて、人間の労力を減らす。
Zero2Skill(ゼロ2スキル)は、人ロボットの共生型エージェントシステムで、丸ごとの修正を維持・再利用する。
論文 参考訳(メタデータ) (2026-07-15T17:16:24Z) - MEMOREPAIR: Barrier-First Cascade Repair in Agentic Memory [6.860488391361694]
エージェント記憶のためのバリアファーストカスケード修復契約を提示する。
修理イベントは、無効化された子孫状態から検証された後継者状態への制御された遷移を誘導する。
本研究では, 発刊問題を最大重み付き前者閉鎖に還元し, 単一のs-t min-cutで正確に解けることを示す。
論文 参考訳(メタデータ) (2026-05-08T04:57:29Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。