論文の概要: ATLAS: Dual-Horizon Diagnostic Evaluation for Industrial Tool-Use Agents
- arxiv url: http://arxiv.org/abs/2608.30685v1
- Date: Mon, 31 Aug 2026 12:25:24 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-01 18:31:31.386896
- Title: ATLAS: Dual-Horizon Diagnostic Evaluation for Industrial Tool-Use Agents
- Title(参考訳): ATLAS:工業用工具使用剤の二重水平診断評価
- Abstract要約: ATLASは、産業用工具使用エージェントのための二重水平診断評価フレームワークである。
要求の地平線では、軌跡的診断信号は、実行場所と機能上の懸念に欠陥を関連付ける。
インタラクションの地平線において、ユーザワイズ信号は、継続的なインタラクション間でサービスが応答性を維持しているかどうかを評価する。
- 参考スコア(独自算出の注目度): 18.598576950739865
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large language model (LLM) agents are increasingly deployed in user-facing services that require iterative tool use under dynamic business conditions. Reliable evaluation is essential for sustained improvement: it must reveal capability deficiencies, inform priorities, and assess interventions. Yet industrial agent service unfolds both through the iterative trajectory of a current request and through continued user interaction. Final-outcome assessment can therefore obscure where deficiencies arise and whether later service remains aligned with context from earlier exchanges. We propose ATLAS, a dual-horizon diagnostic evaluation framework for industrial tool-use agents. At the request horizon, trajectory-wise diagnostic signals relate deficiencies to execution locations and capability concerns. At the interaction horizon, user-wise signals assess whether service remains responsive across continued interaction. Together, these views provide structured diagnostic evidence for analyzing execution deficiencies and sustained service behavior. ATLAS instantiates them as executable signals with explicit evidence scopes and decision boundaries. LLM judge interfaces are calibrated against high-confidence references from real business logs; when needed, their decision behavior is distilled into efficient diagnostic models for lower-latency, lower-cost evaluation. The resulting feedback supports policy optimization. We evaluate ATLAS on Meituan Xiaotuan production traffic. Offline experiments assess diagnostic-signal fidelity and replay-based policy improvement, while online A/B experiments show concurrent gains in user engagement, downstream business outcomes, and sampled human-audit quality.
- Abstract(参考訳): 大規模言語モデル(LLM)エージェントは、動的ビジネス条件下で反復的なツールの使用を必要とするユーザ対応サービスにますますデプロイされる。
信頼性の高い評価は継続的な改善に不可欠であり、能力不足を明らかにし、優先順位を知らせ、介入を評価する必要がある。
しかし、産業エージェントサービスは、現在の要求の反復軌道と継続的なユーザインタラクションの両方を通じて展開されます。
したがって、最終アウトカム評価は、障害が発生する場所や、後続のサービスが以前の取引所のコンテキストと整合しているかどうかを曖昧にすることができる。
産業用工具使用エージェントのための二重水平診断評価フレームワークATLASを提案する。
要求の地平線では、軌跡的診断信号は、実行場所と機能上の懸念に欠陥を関連付ける。
インタラクションの地平線において、ユーザワイズ信号は、継続的なインタラクション間でサービスが応答性を維持しているかどうかを評価する。
これらとともに、これらの見解は、実行不足と持続的なサービス行動を分析するための構造化された診断証拠を提供する。
ATLASはそれらを明確な証拠範囲と決定境界を持つ実行可能な信号としてインスタンス化する。
LLM判定インタフェースは実業務ログからの高信頼参照に対して校正され、必要に応じてその決定動作を低レイテンシで低コストな評価のための効率的な診断モデルに蒸留する。
結果として得られるフィードバックは、ポリシーの最適化をサポートする。
我々はMeituan Xiaotuanの生産量についてATLASを評価した。
オンラインA/B実験は、ユーザエンゲージメント、下流ビジネス成果、サンプリングされた人間の聴覚品質の同時的な向上を示す。
関連論文リスト
- CAFE: Self-Improving Search Agents Need Co-Evolving Feedback [64.5257526832476]
アウトカム管理された検索エージェントは、いつ、どのように証拠を回収するかを学習するが、端末の報酬は中間エラーのローカライズも、それらのエラーが複雑になる前に継続する軌道のリダイレクトもしない。
学習した軌道内での介入として修正的フィードバックを扱うことは、エージェントがいつフィードバックを要求し使用するかを決めなければならないのに対し、批評家は、エージェントが改善するにつれて障害パターンが変化する結果構築されたロールアウトから有用な修正を推測しなければならない。
論文 参考訳(メタデータ) (2026-08-25T16:39:00Z) - Beyond Fault Localization: A Trajectory-Level Study of LLM Agents for Microservice Root Cause Analysis [13.865176720288938]
我々は,根本原因分析(RCA)の性能評価にトラジェクトリレベルのフレームワークを用いる。
回答の正しさと診断の質の間には不一致がある。
私たちはこの分類を,2段階のディフェンス・イン・ディープスアーキテクチャであるDiagGuardとして運用しています。
論文 参考訳(メタデータ) (2026-08-21T17:13:45Z) - Terminal Agents: A Survey of AI Agents in Command-Line Environments [102.48222742145474]
大規模言語モデルエージェントは、ターミナルを通してますます行動するが、既存の調査は、ソフトウェア工学、ツールの使用、コンピュータ利用の研究にまたがって端末による振る舞いを分散させている。
我々は,端末エージェントを,端末コマンドの実行,テキストフィードバック,ステートフルな環境相互作用を介し,進行を伴う動作を主とするシステムとみなす。
我々の合成は、実現された行動はモデル、インターフェース、ハーネス、ランタイム、環境によって共同で形成されていることを示している。
論文 参考訳(メタデータ) (2026-08-20T18:16:44Z) - Persona Conditioning as an Assessor-Sensitivity Probe for LLM-Based IR Evaluation [8.942079114981052]
大規模言語モデル (LLM) は情報検索 (IR) 評価において関連性評価器としてますます利用されている。
LLM評価器の感度を明らかにするための診断機構としてのペルソナ条件付けについて検討した。
論文 参考訳(メタデータ) (2026-08-11T02:26:47Z) - Beyond Relevance: Bayesian Evidence Acquisition for Agentic Whole-Slide Image Reasoning [72.86819994769634]
全体スライド画像推論(WSI)では、診断問題に答える前に、エージェントが視覚的証拠を逐次取得する必要がある。
本稿では,WSI推論をベイズ証拠取得問題として再検討する,プラグイン・アンド・プレイのエージェント・フレームワークBEACONを提案する。
論文 参考訳(メタデータ) (2026-08-06T08:40:57Z) - AgentCompass: A Unified Evaluation Infrastructure for Agent Capabilities [55.23913617185508]
Agentは、LLM(Large Language Models)ベースのエージェントを評価するための、オープンソース、軽量、インフラストラクチャである。
Benchmark、Harness、Environmentという3つの独立したコンポーネントに関する評価プロセスを編成する。
フォールトトレラントなランタイムと、報酬ハックのような障害モードを透過的に診断する包括的なトラジェクトリ分析ツールを備えている。
論文 参考訳(メタデータ) (2026-07-15T11:11:17Z) - Time to REFLECT: Can We Trust LLM Judges for Evidence-based Research Agents? [61.49434544687523]
本稿では,エージェント環境におけるきめ細かい故障検出を目的としたメタ評価ベンチマークREFLECTを紹介する。
REFLECTはプロセスレベルの障害モードと結果レベルの障害モードの詳細な分類を定義し、制御および局所的な介入を実行することでインスタンス化する。
私たちの実験では、最高のパフォーマンスモデルでさえ、推論、ツール使用、レポート品質の失敗に対して、全体的なアキュラシーを55%以下に達成しています。
論文 参考訳(メタデータ) (2026-05-18T23:55:08Z) - Towards a Virtual Neuroscientist: Autonomous Neuroimaging Analysis via Multi-Agent Collaboration [53.772014300855375]
我々は,自律型エンドツーエンド神経画像解析のためのマルチエージェントシステムであるNIAgentを紹介する。
従来のフラットなツール呼び出しエージェントとは異なり、NIAgentはコード中心の実行パラダイムを採用している。
本稿では,コホートレベルの検定とエージェント視覚検査を組み合わせた,自律的品質管理のための階層的検証フレームワークを提案する。
論文 参考訳(メタデータ) (2026-05-10T06:30:19Z) - Adoption and Effectiveness of AI-Based Anomaly Detection for Cross Provider Health Data Exchange [0.0]
本研究は,説明可能性と継続的監視によって支援された,優先順位付けのためのカバレッジルールと機械学習を組み合わせた,段階的なデプロイメント戦略を提案する。
その結果、ルールベースの手法は高いリコールを実現するが、高い警告量を生成する一方、分離林は低感度で警報負担を軽減していることがわかった。
論文 参考訳(メタデータ) (2026-03-19T15:22:02Z) - LHAW: Controllable Underspecification for Long-Horizon Tasks [8.46227536869596]
LHAW(Long-Horizon Augmenteds)は、モジュール型でデータセットに依存しない合成パイプラインである。
あいまいさのLLM予測に依存するアプローチとは異なり、LHAWは経験的エージェント試行を通じて変種を検証し、観察された終端状態のばらつきに基づいて結果クリティカル、発散、良性として分類する。
TheAgentCompany、SWE-Bench Pro、MCP-Atlasから285のタスク変種をリリースし、現在のエージェントが不明瞭な設定に対して不特定性を検知し、推論し、解決する方法を測定した。
論文 参考訳(メタデータ) (2026-02-11T04:49:50Z) - Agentic Reward Modeling: Verifying GUI Agent via Online Proactive Interaction [7.731207237810125]
VAGENは、対話ツールを備えた検証エージェントを使用して、自律的に検証戦略を計画するフレームワークである。
VAGEN は LLM-as-a-Judge ベースラインと比較して評価精度が有意に向上することを示す。
論文 参考訳(メタデータ) (2026-01-31T07:36:54Z) - TestAgent: Automatic Benchmarking and Exploratory Interaction for Evaluating LLMs in Vertical Domains [19.492393243160244]
大規模言語モデル(LLM)は、高度に専門化された垂直ドメインにデプロイされることが多い。
既存の垂直領域の評価は、通常、静的な単一ターンデータセットの労働集約的な構築に依存している。
垂直領域における自動ベンチマークと探索動的評価のためのフレームワークであるTestAgentを提案する。
論文 参考訳(メタデータ) (2024-10-15T11:20:42Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。