論文の概要: Parsing the Stream: A Live Trace Model for Long-Horizon Agents and Their Observers
- arxiv url: http://arxiv.org/abs/2609.01466v1
- Date: Tue, 01 Sep 2026 16:03:54 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.829614
- Title: Parsing the Stream: A Live Trace Model for Long-Horizon Agents and Their Observers
- Title(参考訳): ストリームのパーシング: 長距離エージェントとそのオブザーバのライブトレースモデル
- Authors: Egor Pakhomov, Erik Nijkamp,
- Abstract要約: ロングホライゾンエージェントのトレースは、実行を監視している人間のオブザーバとエージェント自体の両方のコンシューマをオーバーホールする。
我々は、ライブトレースモデル、追加のみのイベント台帳を型付けされた実行状態に段階的に折り畳み、両方のコンシューマに対して評価する。
LLMリーダをプロキシとして評価したオブザーバ側では、コンパイルされたビューは、約14倍、15倍少ない入力トークンを使用して、質問に回答する。
- 参考スコア(独自算出の注目度): 4.008486665405814
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: A long-horizon agent's trace outgrows both of its consumers: the human observer monitoring the run, and the agent itself, whose bounded context the trace must be folded back into. We present a live trace model, an append-only event ledger folded incrementally into typed run state and compiled into per-consumer views, and evaluate it for both consumers against deterministic ground truth. For the observer side, evaluated with an LLM reader as proxy, the compiled view answers monitoring questions using approximately 14x and 15x fewer input tokens (by reader) and at 5-7x lower cost than a budget-capped single-call reading of the raw trace, with higher accuracy (0.85-0.87 versus 0.48). Because the questions were co-designed with the view schema, we treat the token and cost reduction, conditional on schema coverage, as the transferable result. For the agent, on 120-link sequential-dependency tasks, mechanisms that maintain the task's running statistic in per-step state succeed where full-context prompting fails (30/30 versus 8/30 under a clean protocol, n=30, labeled descriptive owing to benchmark-system co-development); a prompt-level scratchpad matches the fold's accuracy at lower cost, and a two-arm decomposition attributes the fold's accuracy to its deterministic aggregate and its cost advantage to its compactness. The fold's remaining value over cheaper alternatives is deterministic auditability and serving the observer from the same state. We derive eleven candidate requirements for trace folding from observed failures and delimit them with an order-sensitive task family on which the fold ceases to help. Code, benchmarks, a regenerable synthetic corpus, and all workbench traces are released.
- Abstract(参考訳): ロングホライゾンエージェントのトレースは、実行を監視する人間のオブザーバと、トレースを折り返さなければならないコンテキスト境界を持つエージェント自体の両方のコンシューマをオーバーラップする。
本稿では,ライブトレースモデルと,追加のみのイベント台帳を段階的に型付けされた実行状態に分解し,コンシューマごとのビューにコンパイルし,両コンシューマに対して決定論的根拠から評価する。
LLMリーダをプロキシとして評価したオブザーバ側では、コンパイルされたビューは、約14倍および15倍少ない入力トークン(リーダによって)を使用して、より高精度(0.85〜0.87対0.48)で、原トレースの予算付きシングルコール読み取りよりも5~7倍低いコストで、質問に回答する。
質問はビュースキーマと共同設計されているので、トークンとコスト削減、スキーマカバレッジの条件付けを転送可能な結果として扱います。
120リンクのシーケンシャル依存タスクでは、タスクの実行統計をステップ毎の状態に維持するメカニズムが成功し、フルコンテキストのプロンプトが失敗する(クリーンプロトコルでは30/30対8/30)。
安価な代替品に対する折り畳みの残りの価値は決定論的監査性であり、同じ状態のオブザーバに役立っている。
我々は、観測された故障からトレースフォールディングの候補となる11の要件を導出し、折りたたみが役に立たないオーダーセンシティブなタスクファミリでそれらを分離する。
コード、ベンチマーク、生成可能な合成コーパス、すべてのワークベンチトレースがリリースされる。
関連論文リスト
- Beyond Suspicious Steps: Ontological Trust in Long-Horizon Agents [13.208673657449175]
本稿では,軌道前置詞のタスク条件特性である存在論的信頼を導入し,それを RGE としてインスタンス化する。
RGEはロール、ゴール、エビデンスに沿って信頼を分解する。
我々はOSWorld, FinanceBench, EICU-ACからクロスドメイントラジェクトリコーパスを構築する。
論文 参考訳(メタデータ) (2026-08-18T12:44:43Z) - TELLER: Non-intrusive Cross-Layer Root-Cause Analysis for LLM Inference [47.62941623025392]
本稿では,非侵入的でログ対応なLLM推論フレームワークであるTELLERについて紹介する。
TELLERはモデルバイナリを変更することなく、NVTX/CUPTIトレースとサービスログを収集する。
リクエスト毎のコールチェーンツリーを再構築し、ログ行と対応する実行ステップをアライメントする。
これらの表現に加えて、TELLERは数値的候補のローカライゼーションとマルチモーダルな根起因モデルを組み合わせる。
論文 参考訳(メタデータ) (2026-08-03T09:39:11Z) - TraceCompiler: Skill-Guided Mining and Compilation of LLM Agent Traces into Mostly Deterministic Workflows [2.435006380732194]
ノイズの多いトレースをトラジェクトリにコンパイルする,スキルガイドシステムであるTraceCompilerを提案する。
あらゆるハードエッジは監査可能な証拠を持ち、あいまいな関係が疑われる。
コールの削減を計測するが、オフラインのコンパイルコストはかからない。
論文 参考訳(メタデータ) (2026-08-03T01:05:06Z) - PACE: A Proxy for Agentic Capability Evaluation [60.3743414796937]
PACEは、既存の非エージェント評価からインスタンスを選択することで、プロキシベンチマークを構築するフレームワークである。
14のモデル、4つのエージェントベンチマーク、19の非エージェントベンチマークによる実験では、PACE-Benchがエージェントスコアを予測し、LOOCVは絶対誤差(MAE)を4%以下、スピアマン相関は0.80以上、ペアワイズモデルの精度は85%で、いずれもエージェント評価コストの1%以下である。
論文 参考訳(メタデータ) (2026-07-02T10:59:03Z) - DCP-Prune: Ultra-Low Token Pruning with Distribution Consistency Preservation [55.38884985761757]
最近のビジョントークンプルーニング法は、中程度のトークン予算ではモデル性能を効果的に維持するが、超低トークン予算では不安定になる。
Anchor-Context Graph Recovery (ACGR) と Text-Aware Token Cluster Selection (TATCS) からなる2段階のプルーニングフレームワークを提案する。
超低トークン予算下で,本手法がより優れた,より安定した性能を実現することを示す実験を行った。
論文 参考訳(メタデータ) (2026-06-15T12:24:07Z) - ClawForge: Generating Executable Interactive Benchmarks for Command-Line Agents [59.626170560327274]
textbfClawForgeは、ステートコンフリクト下で実行可能なコマンドラインカテゴリのためのジェネレータベースのベンチマークフレームワークである。
私たちはこのフレームワークをClawForge-Bench(17のシナリオ、6の能力カテゴリ)としてインスタンス化します。
論文 参考訳(メタデータ) (2026-05-13T21:34:08Z) - ChromaFlow: A Negative Ablation Study of Orchestration Overhead in Tool-Augmented Agent Evaluation [0.0]
本稿では,プランナー指向実行,特殊なツール使用,テレメトリ駆動評価を中心に構築されたツール拡張型自律推論フレームワークを提案する。
クリーンな評価制約の下でGAIA 2023 Level-1バリデーションタスクのクロマフローを解析する。
論文 参考訳(メタデータ) (2026-05-13T20:40:37Z) - Slipstream: Trajectory-Grounded Compaction Validation for Long-Horizon Agents [8.880437352929315]
Slipstream(スリップストリーム)は、判断器を用いてエージェントの継続的な推論に対して候補の要約を検証する、軌道上の圧縮システムである。
タスクの精度を最大8.8ポイント改善し、エンドツーエンドのレイテンシを最大39.7%削減する。
論文 参考訳(メタデータ) (2026-05-09T00:47:43Z) - IMPACT-CYCLE: A Contract-Based Multi-Agent System for Claim-Level Supervisory Correction of Long-Video Semantic Memory [73.22944697933603]
既存のパイプラインは不透明でエンドツーエンドの出力を生成し、検査の中間状態は公開しない。
IMPACT-Cycleは,マルチモーダル反復クレームレベルのメンテナンスとして,長時間ビデオ理解を再構築するマルチエージェントシステムである。
論文 参考訳(メタデータ) (2026-04-22T03:03:33Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。