論文の概要: Doomed from the Start: Early Abort of LLM Agent Episodes via a Recall-Controlled Probe Cascade
- arxiv url: http://arxiv.org/abs/2607.06503v2
- Date: Thu, 16 Jul 2026 16:47:09 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-17 17:01:32.828288
- Title: Doomed from the Start: Early Abort of LLM Agent Episodes via a Recall-Controlled Probe Cascade
- Title(参考訳): LLMエージェント・エピソードの早期中止--リコール制御されたプローブ・カスケード-
- Abstract要約: 大規模言語モデル(LLM)エージェントは、既に失敗する運命にある複数ステップの軌道を継続することで、推論計算を無駄にすることが多い。
隠れ状態プローブを用いたLSMエージェントの早期故障予測と推定時早期停止について検討した。
LLMエージェント推論コストを削減するために,この信号をリコール制御された中止カスケードに変換する。
- 参考スコア(独自算出の注目度): 14.63102636181275
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language model (LLM) agents often waste inference compute by continuing multi-step trajectories that are already doomed to fail. We study early failure prediction and inference-time early stopping for LLM agents using hidden-state probes. Lightweight linear probes on internal activations predict eventual task failure from the first interaction round, substantially earlier than agent-monitoring methods based only on observable behavior. We turn this signal into a recall-controlled abort cascade for reducing LLM agent inference costs. The cascade applies a distribution-free calibrated failure detector at each early interaction round and jointly optimizes per-round recall budgets. This design ensures that eventually successful episodes survive all early-stopping gates at a user-specified global recall rate. After selection, the cascade is frozen and certified on independent data, providing an exact post-selection recall guarantee. We evaluate the method on TextCraft and WebShop with Qwen-2.5-7B, Llama-3.2-3B, and Qwen3-1.7B. The proposed LLM agent early-stopping cascade outperforms the best single-gate baseline in every model-environment pair, saving 1.5-8.8 times more compute at a 90% recall target. Achieved recall remains within one standard deviation of its target in all 24 configurations. The strongest settings reduce generated tokens by 60.2% on TextCraft and 54.9% on WebShop at 90% recall, while retaining savings of 45.0% and 41.5% at 95% recall. Behavior-only monitoring is consistently weaker, and adding behavioral features to hidden-state probes provides no further gain. We also characterize the sample complexity required to certify high-recall early-stopping policies. The code will be released soon.
- Abstract(参考訳): 大規模言語モデル(LLM)エージェントは、既に失敗する運命にある複数ステップの軌道を継続することで、推論計算を無駄にすることが多い。
隠れ状態プローブを用いたLSMエージェントの早期故障予測と推定時早期停止について検討した。
内部の活性化に関する軽量線形プローブは、観測可能な振る舞いのみに基づくエージェント監視法よりもかなり早く、第1の相互作用ラウンドから最終的なタスク障害を予測する。
LLMエージェント推論コストを削減するために,この信号をリコール制御された中止カスケードに変換する。
カスケードは、初期相互作用ラウンド毎に分布のないキャリブレーションされた故障検知装置を適用し、ラウンド毎のリコール予算を共同で最適化する。
この設計により、最終的に成功したエピソードは、ユーザが指定したグローバルリコールレートで、すべての早期停止ゲートを生き残ることができる。
選択後、カスケードは凍結され、独立したデータで認証され、選択後の正確なリコール保証を提供する。
Qwen-2.5-7B, Llama-3.2-3B, Qwen3-1.7B を用いて TextCraft と WebShop の手法を評価する。
提案されたLDMエージェントの早期停止カスケードは、モデル環境のペアごとに最高の単一ゲートベースラインを上回り、90%のリコールターゲットで1.5-8.8倍の計算量を節約した。
達成されたリコールは、24のすべての構成において、目標の標準偏差の1つに留まっている。
最強の設定はTextCraftで60.2%、WebShopで54.9%、リコールで45.0%、リコールで41.5%となっている。
振舞いのみの監視は一貫して弱く、隠れ状態のプローブに振舞いの機能を追加しても、それ以上の利益は得られない。
我々はまた、ハイリコール早期停止ポリシーを認定するために必要なサンプルの複雑さを特徴付ける。
コードはまもなくリリースされる。
関連論文リスト
- ReDraft, Don't Just Distill: Reference-Driven Revision for Continual VLLM Post-Training [66.72708893922605]
大規模なマルチモーダルモデルのポストトレーニングは、事前トレーニングから保護しながら、新しい機能を追加する必要がある。
SFTは、タスクをほぼゼロの精度から学習する明確なターゲット監視を提供するが、そのオフポリティックターゲットはモデルを十分に移動させ、忘れる原因となる。
モデル自身の失敗から両方を得るReDraftを紹介します。
論文 参考訳(メタデータ) (2026-09-15T04:59:03Z) - How to Speculate about Uncertainty in Agentic Coding? A Draft-Model Gate Method [4.37919186746582]
ブラックボックスエージェントの予測故障信号を復元する手法である投機的不確実性(SU)を提案する。
我々は、推論とアクションスパンを分離して位相認識の特徴を抽出し、検証対象に対して校正する。
SUは、ルーティング、人間の介入、テストタイムの余分な計算など、ダウンストリームポリシーが直接的に消費できる、障害に似たスコアを生成する。
論文 参考訳(メタデータ) (2026-09-04T15:30:22Z) - When Agents Commit Too Soon: Diagnosing Premature Commitment in LLM Agents [0.0]
長い答えのLSMエージェントは静かに失敗する可能性があり、彼らは証拠を早期に読み上げ、残りの期間をその証拠を守るのに費やした。
我々は、表現的コミットメントを、固定された推論ステップにおいて、クロスランな隠れ状態収束として定義する。
ランタイムモニタは、AUROCの隠れ状態から0.97までの不整合軌道を検出する(より厳密なスプリットの下で0.85-0.88)。
論文 参考訳(メタデータ) (2026-06-22T07:13:13Z) - Stop Early, Spend Less: Hidden-State Probes as a Practical Recipe for Streaming Moderation of LLM Outputs [0.0]
既存のアプローチは、生成後に適用される別のモデレーションモデルに依存している。
我々は、モデレーションに必要な信号が隠蔽状態のモデルにすでに存在することを観察する。
トークンレベルの軽量プローブをトレーニングし、内部アクティベーションを直接操作します。
論文 参考訳(メタデータ) (2026-06-09T07:01:43Z) - Strained Coherence: A Pre-Failure Signal in Coding Agent Execution Trajectories [0.0]
LLMベースのコーディングエージェントは、時には自身の推論で問題を認識し、いずれにせよ前進する。
我々はClaude Sonnet 4.6のジャッジを構築し、完全なトラジェクトリとフラグがパターンの発生する場所にまたがる。
Qwen3.5-35B-A3Bのバックボーンを用いて44個の終端ベンチ2軌道上で評価を行った。
論文 参考訳(メタデータ) (2026-06-05T22:52:16Z) - AEGIS: A Backup Reflex for Physical AI [0.0]
AEGISは、弱い政策の凍結活性化に対する軽量プローブを用いて高リスクステップを検出する選択的エスカレーション手法である。
プローブがステップをフラグすると、コントロールはより強力な分離ポリシーに切り替わるが、必要なステップのみに限られる。
LIBERO-Spatialでは、AIGISは10.1%のトラジェクトリを回復し、弱い政策だけでは負け、予算に適合したブラインドエスカレーションは4.6%、ランダムトリガーのプラセボは5.1%である。
論文 参考訳(メタデータ) (2026-06-04T19:09:22Z) - AttackPathGNN: Cross-function vulnerability detection in smart contracts using state interference graphs and conjunction pooling [3.8615905456206256]
Solidityスマートコントラクトのための既存の学習ベースの検出は、脆弱性検出を単一関数内のパターンマッチングに還元する。
本稿では,グラフニューラルネットワーク(GNN)であるAttackPathGNNを提案する。
論文 参考訳(メタデータ) (2026-06-04T10:30:24Z) - When Evidence is Sparse: Weakly Supervised Early Failure Alerting in Dialogs and LLM-Agent Trajectories [20.332123003765837]
早期の障害警告では、ダイアログやエージェントのトラジェクトリがまだ展開されている間に、フェールするかどうかを判断する必要がある。
一般的には、トラジェクトリレベルの成功/失敗ラベルとしてのみ、監視が利用可能であるのに対して、アラートは部分的なインタラクションから引き上げなければならないため、これは難しい。
本稿では、このスパースエビデンス構造から学習し、その結果のリスク推定を制御可能な早期警報に利用する2段階のアプローチを提案する。
論文 参考訳(メタデータ) (2026-06-03T20:28:27Z) - ESPO: Early-Stopping Proximal Policy Optimization [78.79610718910628]
ESPO(Early-Stopping Proximal Policy Optimization)は、軌道上の障害を検出し、ロールアウトを早期に終了する。
DeepSeek-R1-Distill-Qwen-7Bでは、ESPOはAIME2024(46.28%対45.25%)、AMC2023(85.83%対82.94%)、MATH-500(87.42%対85.43%)でPPOを上回っている。
論文 参考訳(メタデータ) (2026-05-28T12:40:22Z) - ImplicitMemBench: Measuring Unconscious Behavioral Adaptation in Large Language Models [60.14219417402433]
LLMエージェントの既存のメモリベンチマークは、事実の明示的なリコールを評価するが、意識的な検索なしに、経験が自動的な振る舞いになる暗黙の記憶を見落としている。
IndicitMemBenchは、非宣言的メモリの標準的な認知科学のアカウントから引き出された3つの構造を通して暗黙的メモリを評価する最初の体系的なベンチマークである。
当社の300イテムスイートでは,初動採点を備えたLearning/Priming-Interfere-Testプロトコルを統一しています。
論文 参考訳(メタデータ) (2026-04-09T10:26:32Z) - SafetyDrift: Predicting When AI Agents Cross the Line Before They Actually Do [0.0]
SafetyDriftモデルでは、安全軌道をマルコフ連鎖の吸収として扱う。
コミュニケーションタスクでは、軽度のリスク状態にまで達するエージェントは、5段階以内に安全を侵害する確率が85%である。
これらのモデル上に構築されたモニターは94.7%の違反を検知し、3.7ステップの事前警告を無視可能な計算コストで行う。
論文 参考訳(メタデータ) (2026-03-28T05:52:04Z) - AgentProcessBench: Diagnosing Step-Level Process Quality in Tool-Using Agents [50.481033105867205]
我々はAgentProcessBenchを紹介した。AgentProcessBenchは、現実的なツール拡張トラジェクトリにおけるステップレベルの有効性を評価するための最初のベンチマークである。
ベンチマークは、1,000の多様な軌跡と8,509の人間ラベル付きステップアノテーションと89.1%のアノテーション間合意で構成されている。
探索をキャプチャする3つのラベリングスキームと、ラベルのあいまいさを減らすためのエラー伝搬ルールを備えている。
論文 参考訳(メタデータ) (2026-03-15T16:13:58Z) - A Rubric-Supervised Critic from Sparse Real-World Outcomes [87.11204512676193]
現実のコーディングエージェントは、成功信号がノイズが多く、遅延し、スパースであるループで人間と動作します。
本稿では,RLに基づくトレーニングや推論時間スケーリングの報奨モデルとして,スパースとノイズの相互作用データから"批判的"モデルを学習するプロセスを提案する。
論文 参考訳(メタデータ) (2026-03-04T07:23:54Z) - BadCLIP++: Stealthy and Persistent Backdoors in Multimodal Contrastive Learning [73.46118996284888]
マルチモーダル・コントラスト学習モデルに対するバックドア攻撃の研究は、ステルスネスと永続性という2つの大きな課題に直面している。
両課題に対処する統合フレームワークであるBadCLIP++を提案する。
ステルスネスのために,タスク関連領域付近に知覚不可能なパターンを埋め込むセマンティックフュージョンQRマイクロトリガーを導入する。
持続性については、半径縮小とセントロイドアライメントによるトリガ埋め込みを安定化する。
論文 参考訳(メタデータ) (2026-02-19T08:31:16Z) - What Layers When: Learning to Skip Compute in LLMs with Residual Gates [66.23658560048241]
GateSkipは、デコーダのみのLMにおけるトークンワイド層スキップを可能にする残差ストリームゲーティング機構である。
各Attention/MLPブランチは、残ストリームに再入力する前に、ブランチの出力を凝縮するシグモイドリニアゲートを備えている。
論文 参考訳(メタデータ) (2025-10-13T16:31:50Z) - Lazy Layers to Make Fine-Tuned Diffusion Models More Traceable [70.77600345240867]
新たな任意の任意配置(AIAO)戦略は、微調整による除去に耐性を持たせる。
拡散モデルの入力/出力空間のバックドアを設計する既存の手法とは異なり,本手法では,サンプルサブパスの特徴空間にバックドアを埋め込む方法を提案する。
MS-COCO,AFHQ,LSUN,CUB-200,DreamBoothの各データセットに関する実証研究により,AIAOの堅牢性が確認された。
論文 参考訳(メタデータ) (2024-05-01T12:03:39Z) - Probing Model Signal-Awareness via Prediction-Preserving Input
Minimization [67.62847721118142]
モデルが正しい脆弱性信号を捕捉して予測する能力を評価する。
SAR(Signal-Aware Recall)と呼ばれる新しい指標を用いて,モデルの信号認識を計測する。
その結果,90年代以降のリコールから60年代以降のリコールは,新たな指標で大幅に減少した。
論文 参考訳(メタデータ) (2020-11-25T20:05:23Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。