論文の概要: Automata from Agent Traces: Failure and Next-Step Prediction
- arxiv url: http://arxiv.org/abs/2608.23670v1
- Date: Mon, 24 Aug 2026 17:58:01 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-26 14:09:34.473103
- Title: Automata from Agent Traces: Failure and Next-Step Prediction
- Title(参考訳): エージェントトレースからのオートマタ:失敗と次のステップ予測
- Abstract要約: トレースコーパス全体を1つのコンパクト有限状態機械 (FSM) に分解し, LLM エージェントの挙動のための構造基板として機能する。
障害予測では、州ごとの行動特徴がAUROCで最大0.94まで到達し、オンラインのモニターが失敗点を通過点より上回っている。
- 参考スコア(独自算出の注目度): 1.16693435589939
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: LLM-based agents execute multi-step tasks, but their behavioral structure remains opaque: long unstructured traces resist the safety auditing and runtime monitoring that deployment requires. Existing approaches operate per-trace or success-only, so they miss the cross-run topology that links next-step and failure prediction. To recover that shared structure, we collapse an entire trace corpus into a single, compact finite-state machine (FSM) that serves as a structural substrate for the otherwise unpredictable behavior of LLM agents. Across twelve public datasets, the FSMs are compact (7-43 states), replay held-out data at >=0.997 fitness with near-identical topology across splits, and build in milliseconds. This substrate addresses both prediction goals. For next-step prediction, FSM-state context outperforms Agent Workflow Memory on every ground-truth-matched dataset. For failure prediction, per-state behavioral features reach held-out AUROC up to 0.94, and an online monitor ranks failing runs above passing ones from a partial trace, triggering early stopping well before completion. Behavioral topology thus appears shaped more by the deployment harness than by the LLM, providing a model-agnostic structural primitive for safety auditing and runtime monitoring.
- Abstract(参考訳): LLMベースのエージェントは、マルチステップタスクを実行するが、その動作構造は不透明である。
既存のアプローチでは、トレース単位あるいは成功のみを運用しているため、次のステップと失敗を予測するクロスラントポロジを見逃している。
共有構造を回復するため,LLM エージェントの予測不能な動作のための構造基板として機能する単一コンパクト有限状態機械 (FSM) にトレースコーパス全体を分解する。
12の公開データセット全体にわたって、FSMはコンパクト(7-43状態)で、 >=0.997 適合度でホールドアウトデータを再生し、分割するほぼ同一のトポロジーを持ち、ミリ秒で構築する。
この基板は、両方の予測目標に対処する。
次のステップの予測では、FSM状態のコンテキストがAgens Workflow Memoryよりパフォーマンスが高い。
障害予測では、州ごとの行動特徴は最大0.94AUROCまで到達し、オンラインのモニターは、部分的にトレースされた状態よりも上を走行し、完了前に早期に停止する。
したがって、振る舞いトポロジは、LLMよりもデプロイメントハーネスによって形作られ、安全監査と実行監視のためのモデルに依存しない構造的プリミティブを提供する。
関連論文リスト
- Beyond Suspicious Steps: Ontological Trust in Long-Horizon Agents [13.208673657449175]
本稿では,軌道前置詞のタスク条件特性である存在論的信頼を導入し,それを RGE としてインスタンス化する。
RGEはロール、ゴール、エビデンスに沿って信頼を分解する。
我々はOSWorld, FinanceBench, EICU-ACからクロスドメイントラジェクトリコーパスを構築する。
論文 参考訳(メタデータ) (2026-08-18T12:44:43Z) - From Sequence to Structure: Relational Uncertainty Propagation for LLM Agents [75.69180947909148]
大規模言語モデル(LLM)エージェントのためのトラジェクトリレベルのUQフレームワークを提案する。
RuPAは、推論状態、ツールインタラクション、環境フィードバックが時間的およびセマンティックな依存関係エッジで接続されたノードである、指向的なトラジェクトリグラフとして実行履歴を表現している。
我々は,複数のモデルファミリにまたがる6つのオープンソースLCMを用いて,代用エージェントベンチマーク($2, Terminal-Bench-2, GAIA)でRUPAを評価した。
論文 参考訳(メタデータ) (2026-08-17T01:40:14Z) - TELLER: Non-intrusive Cross-Layer Root-Cause Analysis for LLM Inference [47.62941623025392]
本稿では,非侵入的でログ対応なLLM推論フレームワークであるTELLERについて紹介する。
TELLERはモデルバイナリを変更することなく、NVTX/CUPTIトレースとサービスログを収集する。
リクエスト毎のコールチェーンツリーを再構築し、ログ行と対応する実行ステップをアライメントする。
これらの表現に加えて、TELLERは数値的候補のローカライゼーションとマルチモーダルな根起因モデルを組み合わせる。
論文 参考訳(メタデータ) (2026-08-03T09:39:11Z) - PhyAgentOS: A Self-Evolving Operating System for Embodied Agents with Decoupled Cognitive Planning and Physical Execution [49.776611937968]
我々は、スケジューリング、検証、メモリ、ベンチマーク、安全性をシステムレベルのサービスとして提供するPhyAgentOSを紹介します。
セッション中心のセッションは、スケジューリング、互換性、監督された実行、エビデンス収集、受け入れの最小単位として、アクションではなくセッションを扱う。
SessionVerifierは、実行終了とセマンティックタスク完了を、成功、失敗、または再計画のエビデンスに基づいて判断する。
ベンチマークはデプロイメントセッションと検証パスを再利用するので、結果は実際の実行に遡る。
論文 参考訳(メタデータ) (2026-07-18T04:46:53Z) - Compaction as Epistemic Failure: How Agentic LLM Tools Fabricate Confirmed Results from Killed Processes [0.0]
本稿では、タイムアウトコマンド(排他コード143)からの部分標準出力が、確認された結果として圧縮要約に記録されるクロードコードにおいて、障害モードを文書化する。
根底にあるメカニズムは、観測と永続化の融合であり、端末に現れた情報は、耐久性のある記憶に書き込まれた情報と同等のものとして扱われる。
論文 参考訳(メタデータ) (2026-07-11T07:45:13Z) - Monitoring Data-aware Temporal Properties (Extended Version) [56.386411908764494]
有限トレース上の任意のSMT理論に富む線形時間特性の予測モニタリングについて考察する。
この設定での予測モニタリングは非常に困難であり、監視状態はこれまでのトレースプレフィックスと可能な有限継続の両方に依存している。
本研究は,表現的フラグメントオフMTにおける特性モニタリングのための新しい基礎的枠組みの正しさを提示し,正式に証明するものである。
論文 参考訳(メタデータ) (2026-05-14T10:23:11Z) - AgentForesight: Online Auditing for Early Failure Prediction in Multi-Agent Systems [30.172832661173928]
LLMベースのマルチエージェントシステムは、長距離タスクにますますデプロイされている。
単一の決定的なエラーは、しばしば下流のエージェントやカスケードによって軌道レベルの障害として受け入れられる。
我々は,この問題をオンライン監査として再編成するフレームワークであるAgentForesightを紹介した。
論文 参考訳(メタデータ) (2026-05-09T05:55:19Z) - Trajectory Guard -- A Lightweight, Sequence-Aware Model for Real-Time Anomaly Detection in Agentic AI [0.0]
トラジェクトリガードはシームズ・リカレント・オートエンコーダであり、コントラスト学習によるタスク・トラジェクトリアライメントと、再構成によるシーケンシャル・アライメントを共同で学習するハイブリッド・ロス機能を備えている。
32ミリ秒のレイテンシで、当社のアプローチは LLM Judge のベースラインよりも17-27倍高速で動作し、実運用環境におけるリアルタイムの安全性検証を可能にします。
論文 参考訳(メタデータ) (2026-01-02T00:27:11Z) - Metacognitive Self-Correction for Multi-Agent System via Prototype-Guided Next-Execution Reconstruction [58.51530390018909]
大規模言語モデルに基づくマルチエージェントシステムは、協調的な問題解決において優れているが、エラーのカスケードには脆弱である。
我々は,MASにリアルタイム,教師なし,ステップレベルの誤り検出と自己補正を付与するメタ認知フレームワークMASCを提案する。
論文 参考訳(メタデータ) (2025-10-16T05:35:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。