論文の概要: TRIAGE: Three-level Routing and Intelligent Agent Guidance for Efficient Execution
- arxiv url: http://arxiv.org/abs/2609.01428v1
- Date: Tue, 01 Sep 2026 15:40:09 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.824114
- Title: TRIAGE: Three-level Routing and Intelligent Agent Guidance for Efficient Execution
- Title(参考訳): TRIAGE: 効率的な実行のための3レベルルーティングとインテリジェントエージェントガイダンス
- Authors: Ruocan Wei,
- Abstract要約: TRIAGEは3段階のルーティングフレームワークで、過去の実行軌跡を再利用することでトークン消費を減らす。
その中心となるイノベーションはTjectory-as-a-Skillであり、過去の実行軌跡を再利用可能なスキルに抽象化する。
1,007のセキュリティ監視クエリに関する大規模な実験では、TRIAGEは62.3%のトークンセーブを達成した。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large Language Model (LLM) agents based on the ReAct paradigm have demonstrated remarkable capabilities in tool use and task execution. However, ReAct suffers from a fundamental efficiency problem: every query triggers a complete reasoning loop from scratch, and similar queries repeat identical steps without leveraging historical experience. We propose TRIAGE,a three-level routing framework that reduces token consumption by reusing historical execution trajectories. Its core innovation is TaaS (Trajectory-as-a-Skill), which abstracts historical execution trajectories into reusable skills, realizing 'experience as a service'. TRIAGE classifies queries into three levels: (1) Direct Reuse-identical queries, 0 tokens; (2) Skill Substitution-similar queries, 0 tokens via deterministic parameter substitution; (3) Full ReAct-novel queries, automatically stored for future reuse. In large-scale experiments on 1,007 security monitoring queries, TRIAGE achieves 62.3% token savings, with 56.0% of queries at Level 2 and 5.5% at Level 1, both executing at zero cost. Cross-domain validation on ToolBench (15 domains, 345 queries) achieves 76.3% token reduction, confirming the generalizability of semantic routing. An online learning experiment demonstrates cold-start-to-mature evolution: the L2 hit rate rises from 0% to 57% within the first 100 queries, and the average token cost drops from 198 to 74.7. We also propose an automatic Skill extraction mechanism that distills high-frequency trajectory patterns into deterministic Skills, creating a positive feedback loop of 'the more you use it, the more efficient it becomes'.
- Abstract(参考訳): ReActパラダイムに基づくLarge Language Model (LLM)エージェントは、ツールの使用とタスク実行において顕著な能力を示した。
しかし、ReActは基本的な効率の問題に悩まされており、全てのクエリがゼロから完全な推論ループをトリガーし、同様のクエリは過去の経験を生かさずに同じステップを繰り返す。
本稿では,過去の実行軌跡を再利用してトークン消費量を削減する3段階ルーティングフレームワークTRIAGEを提案する。
その中心となるイノベーションはTaaS(Trajectory-as-a-Skill)である。
TRIAGEはクエリを3つのレベルに分類する: (1) 直接再利用IDクエリ、0トークン、(2) スキル置換類似クエリ、0トークン、決定論的パラメータ置換、(3) 完全なReAct-novelクエリ。
1,007のセキュリティ監視クエリに関する大規模な実験では、TRIAGEは62.3%のトークンセーブを達成し、レベル2では56.0%、レベル1では5.5%がゼロコストで実行される。
ToolBenchのクロスドメイン検証(15ドメイン、345クエリ)は76.3%のトークン削減を実現し、セマンティックルーティングの一般化性を確認する。
最初の100クエリでL2ヒット率は0%から57%に上昇し、平均トークンコストは198から74.7に低下する。
また, 高頻度軌道パターンを決定論的スキルに蒸留する自動スキル抽出機構を提案し, 「使用すればするほど, より効率的になる」という正のフィードバックループを生成する。
関連論文リスト
- Beyond Retrieval: Query-Conditioned Reuse of Long-Horizon Agent Trajectories [16.13133177152883]
Retrievalは、重要かもしれない過去の軌跡を特定することができるが、ユーザー、エンティティ、制約、環境状態が変わった後、エージェントがその軌跡をどのように使うべきかは明記していない。
我々は,この再検索後の再利用ステップを,長期記憶のボトルネックとして認識する。
クエリ条件の再利用(QCR)によってフレームワークをインスタンス化する。
論文 参考訳(メタデータ) (2026-08-13T05:39:49Z) - Learning Compositional Meta-Routing for Agentic Workflows: An Executable Benchmark [0.0]
本稿では,タスクテキストからヘテロジニアスな操作を構成する,実行可能ベンチマークと予算対応メタルータを紹介する。
結果: 学習成功率は75.9%、静的ルーティングは93.5%、残る49%が安価で34.3ポイントを超える。
論文 参考訳(メタデータ) (2026-07-31T07:00:49Z) - SingGuard-NSFA: Extensible Guardrails for Agentic AI via Generative Reasoning and Real-Time Classification [0.0]
nsfaguardは、エージェントAIシステムを運用上の脅威から保護するためのガードレールフレームワークである。
まず,185種のリスク変異をCIA-Triad-grounded 階層に分類するNSFA分類について紹介する。
凍結したバックボーン上の識別的分類ヘッドと解釈可能なオフライン監査のためのSFTに基づく生成推論を組み合わせたデュアルモードアプローチを開発した。
論文 参考訳(メタデータ) (2026-07-13T07:28:45Z) - When to Retrieve During Reasoning: Adaptive Retrieval for Large Reasoning Models [13.891522069967507]
本稿では、推論対応検索フレームワークReaLM-Retrieveを紹介する。
ステップレベルの不確実性検出は、トークンや文レベルではなく、推論ステップで知識ギャップを識別する。
検索介入政策は、外部証拠が進行中の推論に最大限の利益をもたらすことを学習する。
論文 参考訳(メタデータ) (2026-04-29T13:15:44Z) - ImplicitMemBench: Measuring Unconscious Behavioral Adaptation in Large Language Models [60.14219417402433]
LLMエージェントの既存のメモリベンチマークは、事実の明示的なリコールを評価するが、意識的な検索なしに、経験が自動的な振る舞いになる暗黙の記憶を見落としている。
IndicitMemBenchは、非宣言的メモリの標準的な認知科学のアカウントから引き出された3つの構造を通して暗黙的メモリを評価する最初の体系的なベンチマークである。
当社の300イテムスイートでは,初動採点を備えたLearning/Priming-Interfere-Testプロトコルを統一しています。
論文 参考訳(メタデータ) (2026-04-09T10:26:32Z) - Claw-Eval: Toward Trustworthy Evaluation of Autonomous Agents [66.97968363332465]
エージェントベンチマークの3つのギャップに対処するエンドツーエンド評価スイートであるClaw-Evalを紹介した。
Claw-Evalは3つのグループにまたがる9つのカテゴリにまたがる300の人間検証タスクで構成されている。
すべてのエージェントアクションは、3つの独立したエビデンスチャネルを通じて記録される。
論文 参考訳(メタデータ) (2026-04-07T17:43:18Z) - APEX-EM: Non-Parametric Online Learning for Autonomous Agents via Structured Procedural-Episodic Experience Replay [7.370176470430802]
LLMベースの自律エージェントは、永続的な手続き記憶を欠いている。
我々は,構造化手続き計画の蓄積,検索,再利用を行う非パラメトリックオンライン学習フレームワークであるAPEX-EMを提案する。
論文 参考訳(メタデータ) (2026-03-31T00:24:56Z) - Every Step Evolves: Scaling Reinforcement Learning for Trillion-Scale Thinking Model [100.86587937568832]
Ring-1Tは、数兆のパラメータを持つ最初のオープンソースの最先端の思考モデルである。
総パラメータは1兆で、1トークンあたり約500億を活性化する。
論文 参考訳(メタデータ) (2025-10-21T17:46:14Z) - Kolb-Based Experiential Learning for Generalist Agents with Human-Level Kaggle Data Science Performance [81.05882480184587]
本稿では,自律エージェントに対するVygotskyのZPDを用いて,Kolbの学習サイクルの計算フレームワークを提案する。
Agent Kは、KolbとVygotskyにインスパイアされた人間の認知学習をうまく統合する第1のAIシステムである。
金9個、銀8個、銅12個で、メダル獲得競争で金4個、銀4個を含む。エージェントKは、コルブとヴィーゴツキーにインスパイアされた人間の認知学習をうまく統合する第1のAIシステムである。
論文 参考訳(メタデータ) (2024-11-05T23:55:23Z) - ERNIE-SPARSE: Learning Hierarchical Efficient Transformer Through
Regularized Self-Attention [48.697458429460184]
情報ボトルネック感度と異なる注目トポロジ間の不整合の2つの要因がスパース変換器の性能に影響を及ぼす可能性がある。
本稿では,ERNIE-Sparseというモデルを提案する。
i) 局所情報とグローバル情報を逐次統一する階層スパース変換器(HST) と、(ii) 注意トポロジの異なる変換器の距離を最小化する自己注意正規化(SAR) の2つの特徴がある。
論文 参考訳(メタデータ) (2022-03-23T08:47:01Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。