論文の概要: Doomed from the Start: Early Abort of LLM Agent Episodes via a Recall-Controlled Probe Cascade
- arxiv url: http://arxiv.org/abs/2607.06503v1
- Date: Tue, 07 Jul 2026 17:03:55 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-08 21:24:51.595773
- Title: Doomed from the Start: Early Abort of LLM Agent Episodes via a Recall-Controlled Probe Cascade
- Title(参考訳): LLMエージェント・エピソードの早期中止--リコール制御されたプローブ・カスケード-
- Abstract要約: エージェントの内部表現から早期に障害が予測可能であることを示す。
私たちはこの信号を事実上の中止のカスケードに変える。
高いリコール目標を認証する際の複雑さについて述べる。
- 参考スコア(独自算出の注目度): 14.636086088745884
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language model (LLM) agents solving multi-step tasks frequently commit to trajectories that are doomed to fail, yet continue to consume substantial inference compute before the failure becomes observable. We show that failure is predictable early from the agent's internal representations: lightweight per-round probes on hidden activations anticipate eventual episode failure as early as the first interaction round, where scorers reading only the agent's observable behavior are barely better than chance. We turn this signal into a practical abort cascade: one distribution-free calibrated gate per round, with per-round recall budgets jointly searched so that eventually-successful episodes survive all gates at a user-specified global rate; this episode-level guarantee is the one that matters in deployment, since false-abort risk accumulates across gates. Across two agent models on TextCraft, the cascade meets every recall target from 90% to 97% and, at the 90% target, saves 47.1% +/- 10.3% (Qwen-2.5-7B) and 37.2% +/- 8.8% (Llama-3.2-3B) of inference compute, 1.6--1.7x the best single-gate policy. An otherwise-identical cascade reading only behavior saves roughly half as much, and adding behavioral features to the probe yields no further gain: the hidden states capture what behavior reveals. Finally, we characterize the sample complexity of certifying high recall targets, telling practitioners which recall promises their data can, and provably cannot, back. The code will be released soon.
- Abstract(参考訳): 大規模言語モデル(LLM)エージェントは、失敗する運命にあるトラジェクトリに頻繁にコミットする。
隠れたアクティベーションに関する軽量なラウンドごとのプローブは、第1回インタラクションラウンドの早い段階で最終的なエピソード障害を予測し、エージェントの観察可能な振る舞いのみを読むスコアは、偶然よりもわずかに良い。
我々は、この信号を事実上の中止のカスケードに変える: 1ラウンド当たりの配当なしのキャリブレーションゲート、1ラウンドあたりのリコール予算を共同で検索し、最終的に必要となるエピソードが全ゲートをユーザ指定のグローバルレートで生き残るようにする。
TextCraftの2つのエージェントモデル全体で、カスケードは90%から97%までのリコール目標を満たし、90%のターゲットでは47.1%+/-10.3%(Qwen-2.5-7B)と37.2%+/-8.8%(Llama-3.2-3B)の推論計算、1.6--1.7倍の最良の単一ゲートポリシーを節約している。
身元不明のカスケードは、行動のみを読み取り、約半分の時間を節約し、プローブに行動的特徴を加えると、それ以上の利得が得られない。
最後に、高いリコール目標を認証し、リコールを約束する実践者に対して、データを確実に返却できない、という、サンプルの複雑さを特徴付けます。
コードはまもなくリリースされる。
関連論文リスト
- ReDraft, Don't Just Distill: Reference-Driven Revision for Continual VLLM Post-Training [66.72708893922605]
大規模なマルチモーダルモデルのポストトレーニングは、事前トレーニングから保護しながら、新しい機能を追加する必要がある。
SFTは、タスクをほぼゼロの精度から学習する明確なターゲット監視を提供するが、そのオフポリティックターゲットはモデルを十分に移動させ、忘れる原因となる。
モデル自身の失敗から両方を得るReDraftを紹介します。
論文 参考訳(メタデータ) (2026-09-15T04:59:03Z) - How to Speculate about Uncertainty in Agentic Coding? A Draft-Model Gate Method [4.37919186746582]
ブラックボックスエージェントの予測故障信号を復元する手法である投機的不確実性(SU)を提案する。
我々は、推論とアクションスパンを分離して位相認識の特徴を抽出し、検証対象に対して校正する。
SUは、ルーティング、人間の介入、テストタイムの余分な計算など、ダウンストリームポリシーが直接的に消費できる、障害に似たスコアを生成する。
論文 参考訳(メタデータ) (2026-09-04T15:30:22Z) - When Agents Commit Too Soon: Diagnosing Premature Commitment in LLM Agents [0.0]
長い答えのLSMエージェントは静かに失敗する可能性があり、彼らは証拠を早期に読み上げ、残りの期間をその証拠を守るのに費やした。
我々は、表現的コミットメントを、固定された推論ステップにおいて、クロスランな隠れ状態収束として定義する。
ランタイムモニタは、AUROCの隠れ状態から0.97までの不整合軌道を検出する(より厳密なスプリットの下で0.85-0.88)。
論文 参考訳(メタデータ) (2026-06-22T07:13:13Z) - Stop Early, Spend Less: Hidden-State Probes as a Practical Recipe for Streaming Moderation of LLM Outputs [0.0]
既存のアプローチは、生成後に適用される別のモデレーションモデルに依存している。
我々は、モデレーションに必要な信号が隠蔽状態のモデルにすでに存在することを観察する。
トークンレベルの軽量プローブをトレーニングし、内部アクティベーションを直接操作します。
論文 参考訳(メタデータ) (2026-06-09T07:01:43Z) - Strained Coherence: A Pre-Failure Signal in Coding Agent Execution Trajectories [0.0]
LLMベースのコーディングエージェントは、時には自身の推論で問題を認識し、いずれにせよ前進する。
我々はClaude Sonnet 4.6のジャッジを構築し、完全なトラジェクトリとフラグがパターンの発生する場所にまたがる。
Qwen3.5-35B-A3Bのバックボーンを用いて44個の終端ベンチ2軌道上で評価を行った。
論文 参考訳(メタデータ) (2026-06-05T22:52:16Z) - AEGIS: A Backup Reflex for Physical AI [0.0]
AEGISは、弱い政策の凍結活性化に対する軽量プローブを用いて高リスクステップを検出する選択的エスカレーション手法である。
プローブがステップをフラグすると、コントロールはより強力な分離ポリシーに切り替わるが、必要なステップのみに限られる。
LIBERO-Spatialでは、AIGISは10.1%のトラジェクトリを回復し、弱い政策だけでは負け、予算に適合したブラインドエスカレーションは4.6%、ランダムトリガーのプラセボは5.1%である。
論文 参考訳(メタデータ) (2026-06-04T19:09:22Z) - AttackPathGNN: Cross-function vulnerability detection in smart contracts using state interference graphs and conjunction pooling [3.8615905456206256]
Solidityスマートコントラクトのための既存の学習ベースの検出は、脆弱性検出を単一関数内のパターンマッチングに還元する。
本稿では,グラフニューラルネットワーク(GNN)であるAttackPathGNNを提案する。
論文 参考訳(メタデータ) (2026-06-04T10:30:24Z) - When Evidence is Sparse: Weakly Supervised Early Failure Alerting in Dialogs and LLM-Agent Trajectories [20.332123003765837]
早期の障害警告では、ダイアログやエージェントのトラジェクトリがまだ展開されている間に、フェールするかどうかを判断する必要がある。
一般的には、トラジェクトリレベルの成功/失敗ラベルとしてのみ、監視が利用可能であるのに対して、アラートは部分的なインタラクションから引き上げなければならないため、これは難しい。
本稿では、このスパースエビデンス構造から学習し、その結果のリスク推定を制御可能な早期警報に利用する2段階のアプローチを提案する。
論文 参考訳(メタデータ) (2026-06-03T20:28:27Z) - ESPO: Early-Stopping Proximal Policy Optimization [78.79610718910628]
ESPO(Early-Stopping Proximal Policy Optimization)は、軌道上の障害を検出し、ロールアウトを早期に終了する。
DeepSeek-R1-Distill-Qwen-7Bでは、ESPOはAIME2024(46.28%対45.25%)、AMC2023(85.83%対82.94%)、MATH-500(87.42%対85.43%)でPPOを上回っている。
論文 参考訳(メタデータ) (2026-05-28T12:40:22Z) - ImplicitMemBench: Measuring Unconscious Behavioral Adaptation in Large Language Models [60.14219417402433]
LLMエージェントの既存のメモリベンチマークは、事実の明示的なリコールを評価するが、意識的な検索なしに、経験が自動的な振る舞いになる暗黙の記憶を見落としている。
IndicitMemBenchは、非宣言的メモリの標準的な認知科学のアカウントから引き出された3つの構造を通して暗黙的メモリを評価する最初の体系的なベンチマークである。
当社の300イテムスイートでは,初動採点を備えたLearning/Priming-Interfere-Testプロトコルを統一しています。
論文 参考訳(メタデータ) (2026-04-09T10:26:32Z) - SafetyDrift: Predicting When AI Agents Cross the Line Before They Actually Do [0.0]
SafetyDriftモデルでは、安全軌道をマルコフ連鎖の吸収として扱う。
コミュニケーションタスクでは、軽度のリスク状態にまで達するエージェントは、5段階以内に安全を侵害する確率が85%である。
これらのモデル上に構築されたモニターは94.7%の違反を検知し、3.7ステップの事前警告を無視可能な計算コストで行う。
論文 参考訳(メタデータ) (2026-03-28T05:52:04Z) - AgentProcessBench: Diagnosing Step-Level Process Quality in Tool-Using Agents [50.481033105867205]
我々はAgentProcessBenchを紹介した。AgentProcessBenchは、現実的なツール拡張トラジェクトリにおけるステップレベルの有効性を評価するための最初のベンチマークである。
ベンチマークは、1,000の多様な軌跡と8,509の人間ラベル付きステップアノテーションと89.1%のアノテーション間合意で構成されている。
探索をキャプチャする3つのラベリングスキームと、ラベルのあいまいさを減らすためのエラー伝搬ルールを備えている。
論文 参考訳(メタデータ) (2026-03-15T16:13:58Z) - A Rubric-Supervised Critic from Sparse Real-World Outcomes [87.11204512676193]
現実のコーディングエージェントは、成功信号がノイズが多く、遅延し、スパースであるループで人間と動作します。
本稿では,RLに基づくトレーニングや推論時間スケーリングの報奨モデルとして,スパースとノイズの相互作用データから"批判的"モデルを学習するプロセスを提案する。
論文 参考訳(メタデータ) (2026-03-04T07:23:54Z) - BadCLIP++: Stealthy and Persistent Backdoors in Multimodal Contrastive Learning [73.46118996284888]
マルチモーダル・コントラスト学習モデルに対するバックドア攻撃の研究は、ステルスネスと永続性という2つの大きな課題に直面している。
両課題に対処する統合フレームワークであるBadCLIP++を提案する。
ステルスネスのために,タスク関連領域付近に知覚不可能なパターンを埋め込むセマンティックフュージョンQRマイクロトリガーを導入する。
持続性については、半径縮小とセントロイドアライメントによるトリガ埋め込みを安定化する。
論文 参考訳(メタデータ) (2026-02-19T08:31:16Z) - What Layers When: Learning to Skip Compute in LLMs with Residual Gates [66.23658560048241]
GateSkipは、デコーダのみのLMにおけるトークンワイド層スキップを可能にする残差ストリームゲーティング機構である。
各Attention/MLPブランチは、残ストリームに再入力する前に、ブランチの出力を凝縮するシグモイドリニアゲートを備えている。
論文 参考訳(メタデータ) (2025-10-13T16:31:50Z) - Lazy Layers to Make Fine-Tuned Diffusion Models More Traceable [70.77600345240867]
新たな任意の任意配置(AIAO)戦略は、微調整による除去に耐性を持たせる。
拡散モデルの入力/出力空間のバックドアを設計する既存の手法とは異なり,本手法では,サンプルサブパスの特徴空間にバックドアを埋め込む方法を提案する。
MS-COCO,AFHQ,LSUN,CUB-200,DreamBoothの各データセットに関する実証研究により,AIAOの堅牢性が確認された。
論文 参考訳(メタデータ) (2024-05-01T12:03:39Z) - Probing Model Signal-Awareness via Prediction-Preserving Input
Minimization [67.62847721118142]
モデルが正しい脆弱性信号を捕捉して予測する能力を評価する。
SAR(Signal-Aware Recall)と呼ばれる新しい指標を用いて,モデルの信号認識を計測する。
その結果,90年代以降のリコールから60年代以降のリコールは,新たな指標で大幅に減少した。
論文 参考訳(メタデータ) (2020-11-25T20:05:23Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。