論文の概要: TraceCompiler: Skill-Guided Mining and Compilation of LLM Agent Traces into Mostly Deterministic Workflows
- arxiv url: http://arxiv.org/abs/2608.02680v1
- Date: Mon, 03 Aug 2026 01:05:06 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-05 15:30:22.885866
- Title: TraceCompiler: Skill-Guided Mining and Compilation of LLM Agent Traces into Mostly Deterministic Workflows
- Title(参考訳): TraceCompiler: LLMエージェントトレースのスキルガイドによるマイニングとコンパイル
- Abstract要約: ノイズの多いトレースをトラジェクトリにコンパイルする,スキルガイドシステムであるTraceCompilerを提案する。
あらゆるハードエッジは監査可能な証拠を持ち、あいまいな関係が疑われる。
コールの削減を計測するが、オフラインのコンパイルコストはかからない。
- 参考スコア(独自算出の注目度): 2.435006380732194
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Tool-using language-model agents repeatedly rediscover procedures they have already executed, producing traces that mix reusable structure with retries, exploration, accidental ordering, and repeated lookups. We present TraceCompiler, a skill-guided system that mines clusters of noisy agent traces and compiles them into executable, mostly deterministic workflows. It admits an inter-tool dependency only when a consumer argument contains a value attributable uniquely to an earlier producer; every hard edge carries an auditable evidence tuple, and ambiguous relations are marked suspected and impose no ordering constraint. Bindings are classified as constants, user inputs, copied outputs, transforms, or residual LLM decisions. On T1, a mechanized form of the rule recovers producer-consumer dependencies at 0.928 precision and 0.943 recall over 15,775 def-use edges of its training split, against 0.711 F1 for adjacency and 0.712 for a frequency-thresholded directly-follows measure on identical data; the compiler skill run blind reaches 0.992 on 250 of those edges. On AppWorld we replay released trajectories in the deterministic simulator to recover masked return values and measure the rule against 563 token edges at 0.993 precision - a self-consistency check, since replay injects tokens by a related heuristic. We compile two recurring intents: a Venmo money-request intent reduces 34 observed API calls to 11 runtime calls and, under leave-one-out execution against the benchmark's own state tests, passes 15 of 21, the failing fold escalating rather than acting because its required branch was never observed; and a Spotify/Todoist intent the compiler correctly refuses to compile, because an irreversible side effect is under-determined. We measure call reduction but not offline compilation cost, so we claim no net efficiency result.
- Abstract(参考訳): ツールを使用する言語モデルエージェントは、実行済みの手順を再発見し、再試行、探索、偶発的な順序付け、反復的なルックアップと再利用可能な構造を混合したトレースを生成する。
我々は、ノイズの多いエージェントのクラスタをマイニングし、それらを実行可能な、主に決定論的ワークフローにコンパイルする、スキル誘導システムであるTraceCompilerを紹介する。
コンシューマ引数が以前のプロデューサに固有の値を含む場合にのみ、ツール間の依存性を認め、すべてのハードエッジが監査可能なエビデンスタプルを持ち、あいまいな関係が疑わしいとマークされ、秩序的な制約が課されない。
バインディングは定数、ユーザ入力、コピーアウトプット、変換、その他のLCM決定に分類される。
T1では、この規則の機械化された形式が製造者と消費者の依存関係を0.928精度で回復し、15,775個のデファクトユースエッジをリコールする。
AppWorldでは、決定論的シミュレータでリリースされたトラジェクトリをリプレイして、マスクされた戻り値の回復と、関連するヒューリスティックによってトークンを注入するセルフ一貫性チェックである0.993精度で593トークンエッジに対するルールの測定を行います。
Venmoは34回のAPIコールを11回のランタイムコールに減らし、ベンチマークのステートテストに対して1回限りの実行を終了し、21の15を突破し、必要なブランチが観測されていないために動作ではなく、フォールドがエスカレートする、という2つの繰り返しの意図をコンパイルします。
コールの削減を計測するが、オフラインのコンパイルコストはかからない。
関連論文リスト
- Guardrailed Meta-Agent Loops: Stress-Testing Policy Pinning, Budget Bounds, and Crash Recovery [7.414694666903067]
GuardrailLoopはシミュレーションベースのテストベッドで、3つの運用契約を共同でテスト可能にする。
ハッシュピン付ポリシーは、目標、スコープ、評価アイデンティティ、予算、リリース条件を修正します。
有用な適応、状態回復、反復実行を分離する。
論文 参考訳(メタデータ) (2026-09-10T21:22:08Z) - Threshold Choice, Not Sample Size, Bounds Trustless Verification of Nondeterministic Compound AI Workflows [0.0]
複合AIパイプライン LLMコール、レトリバー、ツールは非決定論的である。
各ステージのインプット、アウトプット、コンテキストのダイジェストをコミットします。
合成HotpotQAパイプラインでは、校正された固定しきい値が45個の正直な複製のうち44個を受け入れ、105個の発散ペアのうち104個を拒絶する。
論文 参考訳(メタデータ) (2026-09-07T22:10:54Z) - Parsing the Stream: A Live Trace Model for Long-Horizon Agents and Their Observers [4.008486665405814]
ロングホライゾンエージェントのトレースは、実行を監視している人間のオブザーバとエージェント自体の両方のコンシューマをオーバーホールする。
我々は、ライブトレースモデル、追加のみのイベント台帳を型付けされた実行状態に段階的に折り畳み、両方のコンシューマに対して評価する。
LLMリーダをプロキシとして評価したオブザーバ側では、コンパイルされたビューは、約14倍、15倍少ない入力トークンを使用して、質問に回答する。
論文 参考訳(メタデータ) (2026-09-01T16:03:54Z) - The Recall Trap: A Recall-Maximizing Retriever Configuration Reduces Issue Resolution in Fixed-Budget Code Context [45.88028371034407]
コード修復における制御ケーススタディを報告し,新しい現象ではない。
私たちは、同じスタック上の1つのフラグ(1チャンク毎の重複)を切り替えます。
BM25(3.2pp、重要なパラダイム間相互作用)を逆転させる。
厳格な固定予算では、ファイルごとのハードダイドプリケートや、タスクに対するA/Bパッケージングポリシは、メトリックフラグを調整しないことが示されます。
論文 参考訳(メタデータ) (2026-08-14T19:22:50Z) - Why Are GUI Agents Correct but Late? Decode on the Decision-Time Critical Path, Tested with Pre-Compiled Policy Trees [13.145367841870412]
コンピュータ使用エージェントは、関連するウィンドウがクローズされた後にのみ正しいアクションを生成するため、過渡的なGUIイベントで失敗することが多い。
本稿では,モデルを変更することなく,この遅延を解消する適応予測ポリシーツリー(AAPT)を提案する。
ライトウェイトオブザーバは、変更ゲートフレームを準備されたブランチにマッチさせ、新しいテキストを生成することなく、即座に対応するアクションを実行する。
論文 参考訳(メタデータ) (2026-07-30T15:50:10Z) - Operational Proto-Introspection in Looped Language Models: Process-Quality Taps, Executable Branching, and the Readout-Control Boundary [0.0]
言語モデルは、進行中の計算の質を読み取ることができるか?
外部介入は、その読み出しをより良い結果に変えることができるか?
凍結した2.6Bループ変換器,Ouro-RLTTで両質問を検証した。
論文 参考訳(メタデータ) (2026-07-20T22:40:36Z) - Fantastic Adaptive Taxonomies and How to Use Them [100.20614173157708]
AdaMASTは、実行トレースをコンパクトでエビデンスに基づく障害分類に変換する。
コードには手書きのコードはなく、人間による注釈もない。
エージェント・システム・サーチでは、失敗候補の分類コード診断が自由形式より優れている。
論文 参考訳(メタデータ) (2026-07-17T17:41:16Z) - Auto: The AGI Compiler [0.0]
Autoは、ライブエージェントの振る舞いを記録し、どの部分が秘密に決定論的かを測定し、それを検証プログラムや蒸留専門家に抽出し、認識バイナリを出力するコンパイラである。
我々は,「AGIコンパイラ」を狭義で実証可能な意味で使用し,新規体験を,未知の知識を計測しながら,永続的で検証された,ほぼ自由なスキルに自律的に変換するシステムを開発した。
論文 参考訳(メタデータ) (2026-07-05T23:09:24Z) - Getting Better at Working With You: Compiling User Corrections into Runtime Enforcement for Coding Agents [99.67681154381803]
Test-time Rule Acquisition and Compiled Enforcement (TRACE)は、コーディングエージェントランタイムのためのスキル層パイプラインである。
開発者が事前に記述した実行時チェックとは異なり、TRACEスキルはユーザのチャット修正に由来する。
論文 参考訳(メタデータ) (2026-06-11T10:43:40Z) - Trace2Policy: From Expert Behavior Traces to Self-Evolving Decision Agents [5.689042186242701]
企業の専門家が暗黙的に適用する決定ルールは、反復的エラー分析によって体系的に回復し、改善することができる。
基本機構は textbfEISR である textbfTrace2Policy について述べる。
各ラウンドは検証セット上でルールを実行し、ルート原因によるエラーをMISSING、WRONG、CONFLICTタイプにクラスタし、ターゲットパッチを適用し、レグレッションゲートを通過するもののみをコミットする。
論文 参考訳(メタデータ) (2026-06-09T06:05:29Z) - Causal Agent Replay: Counterfactual Attribution for LLM-Agent Failures [0.0]
Causal Agent Replay (CAR) は、エージェントが構造的因果モデルとして実行されることをモデル化する。
ステップにダブルオペレーションを適用し、同じポリシーの下で軌道を再実行します。
CARはオープンソースで、ホストまたはフリーのローカルモデルで動作する。
論文 参考訳(メタデータ) (2026-06-06T17:44:23Z) - Benchmarking Recursive-Collapse Warning Claims Under Matched False-Positive Control [0.0]
再帰的なシステムは、過度な失敗が見える前に、崩壊のような状態に入ることができる。
障害が指向性テレメトリパターンに従うかどうかをテストするためのクレームバウンド型ベンチマークフレームワークであるLoopzeroを紹介した。
凍結した2つの公開アーティファクトベンチマークのブリッジを評価する。
論文 参考訳(メタデータ) (2026-05-29T20:12:42Z) - Reliable Extraction of Clinical Follow-Up Instructions: A Hybrid Neural-Symbolic Pipeline [43.0484058393522]
我々は,ニューラルシンボリックなハイブリッドパイプラインを直接生成に対して試験する。
本研究は,2000点の合成外用コーパスについて検討した。
論文 参考訳(メタデータ) (2026-05-26T05:14:33Z) - Constraint-Guided Multi-Agent Decompilation for Executable Binary Recovery [47.704311990064554]
脱コンパイルは、セキュリティ分析、マルウェアのリバースエンジニアリング、レガシーソフトウェアメンテナンスに不可欠である。
マルチレベル制約誘導型デコンパイル(MCGD)により,デコンパイルされたコードを再実行可能なソースに変換するマルチエージェントフレームワークを提案する。
本フレームワークは,84~97%の再実行性を実現し,28~89ポイントのベースラインデコンパイラ出力を改善した。
論文 参考訳(メタデータ) (2026-04-27T01:28:11Z) - AgentProcessBench: Diagnosing Step-Level Process Quality in Tool-Using Agents [50.481033105867205]
我々はAgentProcessBenchを紹介した。AgentProcessBenchは、現実的なツール拡張トラジェクトリにおけるステップレベルの有効性を評価するための最初のベンチマークである。
ベンチマークは、1,000の多様な軌跡と8,509の人間ラベル付きステップアノテーションと89.1%のアノテーション間合意で構成されている。
探索をキャプチャする3つのラベリングスキームと、ラベルのあいまいさを減らすためのエラー伝搬ルールを備えている。
論文 参考訳(メタデータ) (2026-03-15T16:13:58Z) - SemGuard: Real-Time Semantic Evaluator for Correcting LLM-Generated Code [46.20378145112059]
ポストホック修復パイプラインは、実行後にのみそのような障害を検出する。
本稿では,実時間で行レベルのセマンティック監視を行うセマンティック評価フレームワークSemGuardを紹介する。
論文 参考訳(メタデータ) (2025-09-29T09:21:32Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。