論文の概要: APEX-EM: Non-Parametric Online Learning for Autonomous Agents via Structured Procedural-Episodic Experience Replay
- arxiv url: http://arxiv.org/abs/2603.29093v2
- Date: Thu, 02 Apr 2026 21:09:27 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-06 12:42:34.163139
- Title: APEX-EM: Non-Parametric Online Learning for Autonomous Agents via Structured Procedural-Episodic Experience Replay
- Title(参考訳): APEX-EM:構造化手続き型体験リプレイによる自律エージェントのための非パラメトリックオンライン学習
- Abstract要約: LLMベースの自律エージェントは、永続的な手続き記憶を欠いている。
我々は,構造化手続き計画の蓄積,検索,再利用を行う非パラメトリックオンライン学習フレームワークであるAPEX-EMを提案する。
- 参考スコア(独自算出の注目度): 7.370176470430802
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: LLM-based autonomous agents lack persistent procedural memory: they re-derive solutions from scratch even when structurally identical tasks have been solved before. We present APEX-EM, a non-parametric online learning framework that accumulates, retrieves, and reuses structured procedural plans without modifying model weights. APEX-EM introduces: (1) a structured experience representation encoding the full procedural-episodic trace of each execution -- planning steps, artifacts, iteration history with error analysis, and quality scores; (2) a Plan-Retrieve-Generate-Iterate-Ingest (PRGII) workflow with Task Verifiers providing multi-dimensional reward signals; and (3) a dual-outcome Experience Memory with hybrid retrieval combining semantic search, structural signature matching, and plan DAG traversal -- enabling cross-domain transfer between tasks sharing no lexical overlap but analogous operational structure. Successful experiences serve as positive in-context examples; failures as negative examples with structured error annotations. We evaluate on BigCodeBench, KGQAGen-10k, and Humanity's Last Exam using Claude Sonnet 4.5 and Opus 4.5. On KGQAGen-10k, APEX-EM achieves 89.6% accuracy versus 41.3% without memory (+48.3pp), surpassing the oracle-retrieval upper bound (84.9%). On BigCodeBench, it reaches 83.3% SR from a 53.9% baseline (+29.4pp), exceeding MemRL's +11.0pp gain under comparable frozen-backbone conditions (noting backbone differences controlled for in our analysis). On HLE, entity graph retrieval reaches 48.0% from 25.2% (+22.8pp). Ablations show component value is task-dependent: rich judge feedback is negligible for code generation but critical for structured queries (+10.3pp), while binary-signal iteration partially compensates for weaker feedback.
- Abstract(参考訳): LLMベースの自律型エージェントは永続的な手続き記憶に欠けており、構造的に同一のタスクが以前解決された場合でも、スクラッチから解を導出する。
モデル重みを変更することなく、構造化手続き計画の蓄積、検索、再利用を行う非パラメトリックオンライン学習フレームワークであるAPEX-EMを提案する。
APEX-EMは、(1)各実行の全プロシージャ・エポジカルなトレースをエンコードする構造化されたエクスペリエンス表現 -- 計画ステップ、アーティファクト、イテレーション履歴、エラー解析、品質スコア、(2)多次元報酬信号を提供するタスク検証器を備えたプラン-検索-生成-Iterate-Ingest(PRGII)ワークフロー、(3)セマンティック検索、構造的署名マッチング、プランDAGトラバーサルを組み合わせたハイブリッドな合成エクスペリエンスメモリ。
失敗は構造化エラーアノテーションによるネガティブな例である。
我々はClaude Sonnet 4.5 と Opus 4.5 を用いてBigCodeBench,KGQAGen-10k,Humanity's Last Exam の評価を行った。
KGQAGen-10kでは、APEX-EMの精度は89.6%、メモリ無しでは41.3%(+48.3pp)であり、オラクル-検索上界(84.9%)を上回っている。
BigCodeBenchでは、53.9%のベースライン(+29.4pp)から83.3%のSRに達し、同じフリーズバックボーン条件下でMemRLの+11.0ppを超える。
HLEでは、エンティティグラフ検索は25.2%(+22.8pp)から48.0%に達する。
リッチな判断フィードバックはコード生成には無視できるが、構造化クエリ(+10.3pp)には必須である。
関連論文リスト
- A-SR: Self-Evolving Agentic LLMs for Symbolic Regression via Hierarchical Coordination [51.06539604709775]
本稿では、制御ユニットを表現編集からロール条件のエビデンスビューへシフトさせる自己進化型エージェントフレームワークであるA-SRを提案する。
A-SRは、コーディネートプロトコル、オンライン評価器・リワードロールポリシー、および状態制御プロセスメモリ間のルーティングによる公式発見をコーディネートする。
論文 参考訳(メタデータ) (2026-08-05T14:01:10Z) - Fantastic Adaptive Taxonomies and How to Use Them [100.20614173157708]
AdaMASTは、実行トレースをコンパクトでエビデンスに基づく障害分類に変換する。
コードには手書きのコードはなく、人間による注釈もない。
エージェント・システム・サーチでは、失敗候補の分類コード診断が自由形式より優れている。
論文 参考訳(メタデータ) (2026-07-17T17:41:16Z) - Cost-Effective Agent Harnesses for Abstract Reasoning and Generalization on ARC-AGI-1 [4.486629113012585]
ARC-AGI-1の最近の進歩は、フロンティアモデルよりも重いテスト時間計算と、ARCデータに基づいて小さなモデルを微調整するベンチマーク固有のトレーニングの2つから来ている。
パターン発見とプログラム合成の段階を明示的に分解するエージェントハーネスを構築する。
論文 参考訳(メタデータ) (2026-07-07T19:49:35Z) - When the Database Fails: Prompting LLM Dialogue Agents for Safe Recovery in Task-Oriented Dialogue [1.9116784879310027]
本稿では,リトレーニングや追加のモデルコールを伴わずにロバスト性を向上させる軽量なプロンプトベースのリカバリ手法について検討する。
我々は,構造化データベースの状態に照らしたガイド付きリカバリプロンプトを含む3つの応答戦略を比較した。
30.5%の障害がMultiWOZで、20.9%がSGDで幻覚する。
論文 参考訳(メタデータ) (2026-06-30T08:18:11Z) - Efficient Visual Pointing for Embodied AI:Agent-Driven Data Synthesis, Cross-Block Attention, and Iterative Correction [55.11480729304395]
PointArena 2026は77.2%の精度でベンチマークで2位である。
ap proachは3つの障害モードをターゲットにしている。第一に、エージェント駆動のシンセシスは大きなセマンティクスとアンカー相対的な候補プールを構築する。
次に、determinis tic steerable-dataパイプラインは、認証された10,000サンプルのメインセットと、マスク、テンプレート、パス検証を使用するリザーブサンプルを生成する。
論文 参考訳(メタデータ) (2026-06-29T06:39:03Z) - InvestPhilBench: A Multi-Layer Dynamic Benchmark for Evaluating Large Language Model Procedural Reasoning in Expert Investment Philosophy [0.9924185669370708]
InvestPhilBenchは8つの認知層にまたがる動的ベンチマークである。
v0.6リリースには118のプライマリソース認証投資原則カードが含まれている。
大規模な再現可能なスコア付けには、Benchmark Automated Scoring Pipelineを紹介します。
論文 参考訳(メタデータ) (2026-06-24T15:53:20Z) - Plan, Watch, Recover: A Benchmark and Architectures for Proactive Procedural Assistance [49.46086226939232]
textbfEgoProactiveは、OOP(Out-of-Plan)アノテーションとリカバリ手順によるプロシージャアシストのためのウェアラブル中心のデータセットです。
本稿では、手続き状態、視覚的手がかり、リカバリインジェクションに特化して、textbfdecoupled Planner-interaction Architectureを提案する。
広範囲な実験において、Llama-4システムは、強力なプロプライエタリベースラインよりも客観的介入品質を大幅に向上させる。
論文 参考訳(メタデータ) (2026-06-03T14:52:03Z) - Converted, Not Equivalent: Benchmarking Codebase Conversion via Observational Equivalence [56.25095230687242]
コーディングエージェントは、しばしば自身のローカル検証ルーチンを過度に信頼し、表面チェックを満たすアーティファクトの成功を宣言する。
この問題は、事前評価が結果駆動である変換において特に深刻である。
ブラインド・コンバージョンは26.7-28.9%に達し、スペック・パスレートは91.1%まで上昇した。
このことは、失敗は限られた予算やバックボーンの強さよりも、契約ミスによる自己検証に起因していることを示唆している。
論文 参考訳(メタデータ) (2026-05-27T19:57:15Z) - Adaptive ToR: Complexity-Aware Tree-Based Retrieval for Pareto-Optimal Multi-Intent NLU [0.15293427903448018]
多言語自然言語理解には、高い精度と計算効率を同時に達成する検索システムが必要である。
本稿では,クエリ特性に基づいた検索トポロジを動的に構成する複雑性を考慮した検索アーキテクチャであるAdaptive Tree-of-Retrieval (Adaptive ToR)を提案する。
論文 参考訳(メタデータ) (2026-04-27T09:24:10Z) - Training LLMs for Multi-Step Tool Orchestration with Constrained Data Synthesis and Graduated Rewards [76.49428173793386]
LLMは、中間出力を伝搬しながら、正しい順序で複数の依存APIを呼び出す必要がある。
既存の環境は、シミュレーションデータを使った単純なターン毎の関数呼び出しとバイナリ報酬に重点を置いている。
まず、実APIレスポンスの大規模キャッシュを背景とした強化学習環境を構築し、有効なマルチステップオーケストレーショントレースをサンプリングするデータ合成パイプラインを実現する。
第二に、正当性を原子の妥当性とオーケストレーションに分解する、段階的な報酬設計を提案する。
論文 参考訳(メタデータ) (2026-03-25T18:31:39Z) - TopoChunker: Topology-Aware Agentic Document Chunking Framework [5.304983617085637]
TopoChunkerは異種文書を構造化中間表現(Structured Intermediate Representation, SIR)にマッピングするエージェントフレームワークである
構造的忠実度と計算コストのバランスをとるため、TopoChunkerはデュアルエージェントアーキテクチャを採用している。
絶対生成精度が8.0%向上し、83.26%のRecall@3を達成し、同時にトークンオーバーヘッドを23.5%削減した。
論文 参考訳(メタデータ) (2026-03-19T02:15:10Z) - Graph-Native Cognitive Memory for AI Agents: Formal Belief Revision Semantics for Versioned Memory Architectures [0.6091702876917279]
Kumihoは、形式的信念修正セマンティクスに基づくグラフネイティブな認知記憶アーキテクチャである。
アーキテクチャは、二重ストアモデル(Redisワーキングメモリ、Neo4j長期グラフ)を実装し、ハイブリッドフルテキストとベクトル検索を備える。
論文 参考訳(メタデータ) (2026-03-18T00:59:49Z) - ACAR: Adaptive Complexity Routing for Multi-Model Ensembles with Auditable Decision Traces [3.151184728006369]
本稿では,聴覚条件下でのマルチモデルオーケストレーションのための測定フレームワークACARを提案する。
ACARは、N=3プローブサンプルから計算した自己整合分散(sigma)を使用して、単一モデル、2モデル、3モデル実行モードでタスクをルーティングする。
我々は4つのベンチマークにまたがる1,510のタスクに対してACARを評価し、7,550以上の監査可能な実行を生成した。
論文 参考訳(メタデータ) (2026-02-06T23:27:17Z) - Solver-in-the-Loop: MDP-Based Benchmarks for Self-Correction and Behavioral Rationality in Operations Research [19.31559944205485]
運用 調査実践者は反復的なプロセスを通じて、不可能なモデルを日常的にデバッグする。
評価ループにtextbfsolver を配置するベンチマークを2つ導入する。
ドメイン固有のRLVRトレーニングによって、8BモデルがフロンティアAPIを越えられることが分かりました。
論文 参考訳(メタデータ) (2026-01-28T20:02:44Z) - Eigen-1: Adaptive Multi-Agent Refinement with Monitor-Based RAG for Scientific Reasoning [53.45095336430027]
暗黙的な検索と構造化された協調を組み合わせた統合フレームワークを開発する。
Humanity's Last Exam (HLE) Bio/Chem Goldでは,48.3%の精度を実現している。
SuperGPQAとTRQAの結果はドメイン間の堅牢性を確認した。
論文 参考訳(メタデータ) (2025-09-25T14:05:55Z) - Evaluating the Use of LLMs for Documentation to Code Traceability [3.076436880934678]
大規模言語モデルは、様々なソフトウェアドキュメンテーションとソースコードの間のトレースリンクを確立することができる。
私たちは2つのオープンソースプロジェクト(Unity CatalogとCrawl4AI)から2つの新しいデータセットを作成します。
その結果、最高の性能のLLMは2つのデータセットで79.4%と80.4%のF1スコアを達成した。
論文 参考訳(メタデータ) (2025-06-19T16:18:53Z) - ProofAug: Efficient Neural Theorem Proving via Fine-grained Proof Structure Analysis [50.020850767257095]
本稿では,LLMに様々な粒度で自動化手法を付加するProofAugを提案する。
本手法は,オープンソースのDeep-math-7bベースモデルとIsabelle証明アシスタントを用いて,MiniF2Fベンチマークで検証した。
また、ProofAugのLean 4バージョンを実装し、Kimina-Prover-seek-Distill-1.5Bのパス@1のパフォーマンスを44.3%から50.4%に改善します。
論文 参考訳(メタデータ) (2025-01-30T12:37:06Z) - ALoRE: Efficient Visual Adaptation via Aggregating Low Rank Experts [71.91042186338163]
ALoREは、Kroneckerによって構築された超複素パラメータ化空間をAggregate Low Rank Expertsに再利用する新しいPETL法である。
巧妙な設計のおかげで、ALoREは無視できる余分なパラメータを保持し、凍ったバックボーンに強制的にマージできる。
論文 参考訳(メタデータ) (2024-12-11T12:31:30Z) - Integral Continual Learning Along the Tangent Vector Field of Tasks [112.02761912526734]
本稿では,特殊データセットからの情報を段階的に組み込んだ軽量連続学習手法を提案する。
ソースデータセットの0.4%まで小さく、小さな固定サイズのメモリバッファを保持しており、単純な再サンプリングによって更新される。
提案手法は,異なるデータセットに対して,様々なバッファサイズで高い性能を実現する。
論文 参考訳(メタデータ) (2022-11-23T16:49:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。