論文の概要: Think Short, Defer Smart, Act, and Repeat: Calibrated Reasoning and Uncertainty-Aware Deferral for Edge LLM Agents
- arxiv url: http://arxiv.org/abs/2607.26865v1
- Date: Wed, 29 Jul 2026 12:47:05 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-30 21:06:25.672214
- Title: Think Short, Defer Smart, Act, and Repeat: Calibrated Reasoning and Uncertainty-Aware Deferral for Edge LLM Agents
- Title(参考訳): 短くて、スマートで、アクトで、リピート:エッジLLMエージェントのためのキャリブレーションされた推論と不確かさを意識したデフェラル
- Abstract要約: Defer Smart(TSDS)は、軽量収束プローブとパープレキシティに基づく遅延ルールを統合するフレームワークである。
算術的推論(GSM8K)、マルチホップ質問応答(HotpotQA)、コード生成(MBPP)、家庭用ロボットタスクにまたがる4つのReActベンチマーク上でTSDSを評価する。
- 参考スコア(独自算出の注目度): 31.006941545235396
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: LLM agents following the ReAct paradigm are promising enablers of complex multi-step tasks, including multi-hop question answering, code generation, and control of physical AI systems. Yet, when deployed at the edge, they must tightly manage their reasoning budget while remaining reliable and deferring to a cloud-side model only when local uncertainty is too high to act safely. We propose Think Short, Defer Smart (TSDS), a framework that synergistically integrates a lightweight convergence probe, which halts on-device reasoning once the intended action has stabilized, with a perplexity-based deferral rule that escalates uncertain actions to a cloud-side model. Both mechanisms are jointly calibrated on end-to-end episode trajectories via a multi-objective Learn-Then-Test (LTT) procedure, providing simultaneous finite-sample guarantees on expected episode reward and cloud-call rate. We evaluate TSDS on four ReAct benchmarks spanning arithmetic reasoning (GSM8K), multi-hop question answering (HotpotQA), code generation (MBPP), and multi-step embodied planning (household robot), and compare against thought-calibration-only and calibrated-deferral-only standalone baselines. TSDS reduces per-episode thinking compute by 43%-73% over deferral-only baselines across HotpotQA, MBPP, and the household robot task, while maintaining certified reward and cloud-call rate guarantees.
- Abstract(参考訳): ReActパラダイムに従うLLMエージェントは、マルチホップ質問応答、コード生成、物理AIシステムの制御など、複雑なマルチステップタスクの実現を約束している。
しかし、エッジにデプロイする場合は、信頼性を維持しながら推論予算を厳格に管理し、ローカルの不確実性が高すぎる場合にのみクラウドサイドモデルに延期する必要があります。
提案するフレームワークであるThink Short, Defer Smart (TSDS) は,意図した動作が安定するとデバイス上の推論を停止する,軽量収束プローブを相乗的に統合するフレームワークである。
どちらのメカニズムも、マルチオブジェクトのLearning-Then-Test (LTT) プロシージャを通じて、エンド・ツー・エンドのエピソード・トラジェクトリで共同で調整される。
算術的推論(GSM8K)、マルチホップ質問応答(HotpotQA)、コード生成(MBPP)、マルチステップ実施計画(ハウスホールドロボット)を対象とする4つのReActベンチマーク上でTSDSを評価し、思考校正専用および校正専用独立ベースラインとの比較を行った。
TSDSは、HotpotQA、MBPP、および家庭用ロボットタスクにまたがる遅延のみのベースラインを43%-73%削減し、認定報酬とクラウドコール率の保証を維持している。
関連論文リスト
- Loom: Weaving Diagnostic Strands into Free-Text Consensus via Embedding-Space Reweighting [0.0]
実世界の根本原因分析(RCA)のためにデプロイされた生成的コンセンサスフレームワークであるLoomについて紹介する。
ルームがモジュラー$sで出力されるオープンフォーム仮説を連続的な埋め込み空間に投影し、繰り返しセントロイドに基づく再重み付けアルゴリズムで競合する信号を解決する方法を示す。
我々は,エージェント深度と推論遅延のトレードオフ,冗長性検出の負の結果,および決定論的コンセンサスが対象事項専門家の信頼をいかに促進させるかについて,我々の展開経験について議論した。
論文 参考訳(メタデータ) (2026-09-02T14:24:32Z) - ASAP: Agent-System Co-Design for Wall-Clock-Centered Auto HPO Research for ML Experiments [45.577182866886126]
我々はHPOのエージェントシステムの共同設計であるASAPについて述べる。
我々は,ASAPが多種多様な帰納的バイアス付き一般化のプールを統合する方法を示し,各ラウンドで提案する提案の中から選択する。
また,ASAPがループを再構築して,残響品質を保ちながら,エンドツーエンドのウォールタイムを削減する方法も示す。
論文 参考訳(メタデータ) (2026-06-23T22:00:26Z) - Quantifying Self-Preservation Bias in Large Language Models [9.590157416396194]
本稿では,emphTwo-role Benchmark for Self-Preservationを紹介する。
役割アイデンティティが客観的ユーティリティを過度に上回る頻度を測定する。
我々は,低改善体制下では,モデルが解釈スラックを利用してポストホック合理化を行うのを観察する。
論文 参考訳(メタデータ) (2026-04-02T15:38:31Z) - Adaptive Stopping for Multi-Turn LLM Reasoning [19.992892941191577]
マルチターン推論のためのコンフォーマル予測(MiCP)を用いたマルチターン言語モデルを提案する。
MiCPはターン毎に異なるエラー予算を割り当て、全体的なカバレッジ保証を維持しながらモデルが早期に停止することを可能にする。
適応RAGとReActでMICPを実証し、シングルホップとマルチホップの問合せベンチマークの両方で対象範囲を達成した。
論文 参考訳(メタデータ) (2026-04-01T21:22:19Z) - LLM Readiness Harness: Evaluation, Observability, and CI Gates for LLM/RAG Applications [51.56484100374058]
評価をデプロイメント決定ワークフローに変換するLLMおよびRAGアプリケーションのための準備性ハーネスを提案する。
このシステムは、最小限のAPI契約の下で、自動ベンチマーク、OpenTelemetryオブザーバビリティ、CI品質ゲートを組み合わせる。
チケットルーティングとBEIRタスクのハーネスを、完全なAzureマトリックスカバレッジで評価する。
論文 参考訳(メタデータ) (2026-03-28T18:03:32Z) - Tiny-Critic RAG: Empowering Agentic Fallback with Parameter-Efficient Small Language Models [7.704706624419061]
Retrieval-Augmented Generations Grounds Large Language Models (LLMs) は、事実の幻覚を緩和する。
低ランク適応(LoRA)を用いたパラメータ効率小言語モデル(SLM)Tiny-Critic RAGを提案する。
Tiny-Critic RAGはGPT-4o-miniに匹敵するルーティング精度を達成し、レイテンシを桁違いに低減する。
論文 参考訳(メタデータ) (2026-03-01T00:16:31Z) - BAPO: Boundary-Aware Policy Optimization for Reliable Agentic Search [72.87861928940929]
バウンダリ・アウェア・ポリシー・オプティマイゼーション(BAPO)は、信頼性の高い境界認識を精度を損なうことなく育成する新しいRLフレームワークである。
BAPOは2つの重要な要素を導入する: (i) グループベースの境界対応報酬(i) 推論が限界に達したときのみIDK応答を促進させる) 適応報酬変調器(ii) 早期探索中にこの報酬を戦略的に停止させ、モデルがIDKをショートカットとして利用するのを防ぐ。
論文 参考訳(メタデータ) (2026-01-16T07:06:58Z) - Reliable LLM-Based Edge-Cloud-Expert Cascades for Telecom Knowledge Systems [54.916243942641444]
大規模言語モデル(LLM)は、通信などの分野において、自動化の鍵となる存在として浮上している。
本研究では,問合せパイプラインによる意思決定を支援する,エッジクラウドに精通したLLMベースの知識システムについて検討する。
論文 参考訳(メタデータ) (2025-12-23T03:10:09Z) - Unsupervised Conformal Inference: Bootstrapping and Alignment to Control LLM Uncertainty [49.19257648205146]
生成のための教師なし共形推論フレームワークを提案する。
我々のゲートは、分断されたUPPよりも厳密で安定した閾値を提供する。
その結果は、ラベルのない、API互換の、テスト時間フィルタリングのゲートになる。
論文 参考訳(メタデータ) (2025-09-26T23:40:47Z) - Conformal P-Value in Multiple-Choice Question Answering Tasks with Provable Risk Control [0.0]
本研究では,多目的質問応答(MCQA)における大規模言語モデル(LLM)の信頼性向上を目的とした,テスト強化型コンフォメーション予測(CP)フレームワークを提案する。
CPは予測セットに対して統計的に厳格な限界被覆保証を提供し、重要試験は確立された統計的厳密さを提供する。
本研究は,高度QAアプリケーションにおける信頼性の高いLCMデプロイメントの統計的枠組みを確立する。
論文 参考訳(メタデータ) (2025-08-07T16:46:47Z) - Counterfactual Conservative Q Learning for Offline Multi-agent
Reinforcement Learning [54.788422270960496]
我々はCounterFactual conservative Q-Learning (CFCQL) という新しいマルチエージェントオフラインRLアルゴリズムを提案する。
CFCQLは、各エージェントの保守的正規化を非現実的に別々に計算し、それらを線形に組み合わせて全体的な保守的価値推定を実現する。
単一エージェントの保守的手法のように, まだ過小評価特性と性能保証を享受していることが証明されているが, 誘導正規化と安全な政策改善境界はエージェント番号とは無関係である。
論文 参考訳(メタデータ) (2023-09-22T08:10:25Z) - Modular Deep Reinforcement Learning for Continuous Motion Planning with
Temporal Logic [59.94347858883343]
本稿では,マルコフ決定過程(MDP)をモデルとした自律動的システムの運動計画について検討する。
LDGBA と MDP の間に組込み製品 MDP (EP-MDP) を設計することである。
モデルフリー強化学習(RL)のためのLDGBAベースの報酬形成と割引スキームは、EP-MDP状態にのみ依存する。
論文 参考訳(メタデータ) (2021-02-24T01:11:25Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。