論文の概要: Long-Horizon State Tracking in LLMs: Executing MD5 through a Deep Sequence of Dependent Tool Calls
- arxiv url: http://arxiv.org/abs/2609.00012v1
- Date: Sun, 02 Aug 2026 09:38:02 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-06 19:38:41.472608
- Title: Long-Horizon State Tracking in LLMs: Executing MD5 through a Deep Sequence of Dependent Tool Calls
- Title(参考訳): LLMにおけるLong-Horizon State Tracking: 依存ツールコールの深部配列によるMD5の実行
- Abstract要約: ロングホライゾンタスクは、大きな言語モデル(LLM)評価では珍しくない。
LLMが多数のツールコールにまたがって、正確な中間状態を持てるかどうかをテストする。
モデル自身の推論をそれぞれの順番でコンテキストに保ち、思考可能な労働者に投票してモジュラー・アセスメティックス・スリップを除去する、という2つの要素が成功を決定づける。
- 参考スコア(独自算出の注目度): 0.5097809301149342
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Long-horizon tasks remain uncommon in large language model (LLM) evaluation, and for a reason: when each step depends on the last, per-step accuracy that looks excellent in isolation decays catastrophically, as errors cascade and the end-to-end failure probability grows sharply with length. Existing agentic benchmarks report end-to-end success but confound this state-tracking difficulty with instruction interpretation, give no control group that isolates it, and are vulnerable to shortcuts such as a hallucinated final answer, so they cannot say why a long run fails. Whether an LLM can carry exact intermediate state across many tool calls at all is itself not well established. We test this cleanly by having the model compute a cryptographic hash, MD5, step by step: a sequence of $196$ dependent tool calls over $64$ rounds while it carries four $32$-bit words $(a,b,c,d)$ in its own context from one call to the next. Interpretation is trivial and, because we implement MD5 from scratch (RFC~1321), we align every call to the ground-truth trace and check the digest to the bit, so any failure is pure bookkeeping. gpt-oss-120b, a mixture-of-experts model with only $\sim$5.5B active parameters per token, at temperature $0$ with a short fixed prompt, carries the full state across all $196$ calls and returns the correct digest on a majority of completed runs. In the strongest setting we replace every primitive tool with a second LLM, so a driver and a worker compute the whole hash from scratch with no exact-arithmetic oracle in the loop. Two ingredients decide success and neither changes the weights: keeping the model's own reasoning in its context each turn, and voting over a thinking-enabled worker to remove its modular-arithmetic slips. We localize the residual failures by origin, separating state-carrying from arithmetic and from serving.
- Abstract(参考訳): 大規模言語モデル(LLM)の評価では、長い水平タスクは珍しく、各ステップが最後のステップに依存すると、分離に優れたステップ毎の精度が破滅的に崩壊し、エラーカスケードとエンドツーエンドの失敗確率は、長さとともに急上昇する。
既存のエージェントベンチマークでは、エンドツーエンドの成功を報告しているが、この状態追跡の難しさを命令解釈と混同し、それを分離するコントロールグループを与えず、幻覚的な最終回答のようなショートカットに弱いため、なぜ長い実行が失敗するのかは説明できない。
LLMが多くのツールコールにまたがって正確な中間状態を持てるかどうかは、それ自体はよく分かっていない。
1回の呼び出しから次の呼び出しまで、4つの32$-bitワード$(a,b,c,d)$(a,b,c,d)$を自身のコンテキストで持つ間、6,4$のラウンドで196ドルの依存ツールコールを処理します。
解釈は簡単で、MD5をスクラッチから実装する(RFC~1321)ので、すべての呼び出しをグランドトルーストレースにアライメントし、ダイジェストをビットにチェックします。
gpt-oss-120bは、トークン当たり$5.5Bのアクティブパラメータしか持たない、短い固定プロンプトで0$の温度で、96ドルのコールすべてに完全な状態を持ち、完了した実行の大部分で正しいダイジェストを返す。
最強の設定では、すべてのプリミティブツールを第2のLDMに置き換えます。
モデル自身の推論を各ターンでコンテキストに保ち、思考可能な労働者に投票してモジュラー・アセスメティックス・スリップを除去する。
残り障害を起点としてローカライズし、ステートキャリングを算術から切り離し、サービスから切り離す。
関連論文リスト
- Structurally Close, Temporally Distant: Measuring Security Exposure in Long-Horizon LLM Agents [1.1659383493623567]
時間的リモートネスは、ステートフルエージェントのセキュリティ分離をオーバーステートできることを示す。
本稿では,決定論的状態,識別子,ツールを通じてエージェントイベントをリンクする証明型実行グラフを提案する。
実行構造は、ステップカウントによって隠された近接を示し、ターゲットの介入をサポートすることができる。
論文 参考訳(メタデータ) (2026-09-05T06:09:06Z) - TEMPO: Makespan-Aware Expert-Parallel Load Balancing Across Memory- and Compute-Bound Regimes [6.460910545652521]
TEMPOは、クリティカルパスからミリ秒でバッチ毎のディスパッチを解決するメースパン対応ディスパッチである。
SG統合はプロセスアウトで実行され、ディスパッチを1つのイングラフカーネルにフューズする。
Testbed Bのエンドツーエンドでは、Qwen3-235Bが4-6%のスループットを獲得し、p99のレイテンシを15.6%のコストで削減している。
論文 参考訳(メタデータ) (2026-08-13T10:21:11Z) - Isolating LLM Alignment from Regex: Zero Coverage and Metric-Dependent Divergence Under Adversarial Mutation [51.56484100374058]
以前の作業では、アクティブフィルタの背後にライブのGeminiバックエンドを追加することで、測定可能なカバレッジが得られなかった。
L_4$-real(Gemini-2.5-flash, token-budget cap, rate limit, output scrub)と同様の$L_5$-no-regexを導入するが、9パターンフィルタは無効である。
3つのサブ言語にまたがる敵対的プローブに対して評価を行った。
論文 参考訳(メタデータ) (2026-06-12T18:54:24Z) - The Security Budget of Code-LLM Prompt Hardening: Provable Limits Under Pass-Only Acceptance [0.0]
本稿では,emphTri-Audit Protocolとしてフロアを運用する。このプロトコルは,プロンプト側推論レジストリ属性をモデル側実証ログから分離する2軸レポーティングプロトコルである。
CodeLlama-7B, Qwen2.5-Coder-7B/1.5B and DeepSeek-Coder-6.7B at $n=164$ yields the emphCross-Model Tri-Audit Invariance: of 28 pass-serving rows, 12-changed-of-record learned-can
論文 参考訳(メタデータ) (2026-06-02T08:22:14Z) - Which Defense Closes Which Threat? Attributing OWASP-LLM-Top-10 Coverage and Its Brittleness Under Paraphrasing [51.56484100374058]
プロダクションLLMアプリケーションは、いくつかの防衛ファミリを積み重ねる -- 拒絶フレーズフィルタ、トークンバッジコントロール、モデル許容度リスト、レート制限、ツール登録認証 -- が、BASベンチマークでは、単一の集計カバレッジ番号を報告している。
21エージェントベースラインスキャナに4つのLLM-Top-10対応エージェントを追加し、4つの合成LDMエンドポイントの格子をターゲットとした。
論文 参考訳(メタデータ) (2026-06-01T19:39:25Z) - Scaling Laws for Agent Harnesses via Effective Feedback Compute [53.68149869349268]
emphEffective Feedback Compute (EFC)は、情報的、有効、非冗長な場合にのみフィードバックを信用し、その後の決定のために保持するトレースレベルのスケーリング座標である。
EFCベースの座標は、生の計算ベースラインよりも失敗率を常に予測する。
論文 参考訳(メタデータ) (2026-05-28T09:45:47Z) - LACUNA: Safe Agents as Recursive Program Holes [3.2613419151327343]
LLMエージェントはますますコードを記述することで振る舞うが、エージェントを駆動するランタイムとモデルが記述するコードの間には分割が持続する。
我々は、安全性を維持しながら、この分割を閉じるエージェントのためのプログラミングモデルであるLACUNAを紹介する。
我々のプリミティブは、通常の制御フローとしてReActループ、サブエージェント、スキル、並列分解、マルチモデル計画を表現する。
論文 参考訳(メタデータ) (2026-05-27T15:27:25Z) - From Patches to Trajectories: Privileged Process Supervision for Software-Engineering Agents [56.31499185764872]
教師の長い軌道上の監督された微調整(SFT)は、オープンソフトウェアエンジニアリング(SWE)エージェントに調査と推論を浸透させる主要な方法である。
本稿では,P2T (Patches-to-Trajectories) を提案する。P2T (Patches-to-Trajectories) は,P2T (Patches-to-Trajectories) において,P2T (Patches-to-Trajectories) とP2T (Patches-to-Trajectories) の2つの最適化法である。
論文 参考訳(メタデータ) (2026-05-21T04:54:55Z) - Large Language Models as Optimization Controllers: Adaptive Continuation for SIMP Topology Optimization [4.365822392824561]
本稿では,SIMP最適化のためのオンラインコントローラとして,大規模言語モデルが機能するフレームワークを提案する。
ハードグレーネスゲートは未熟なバイナライゼーションを防止し、メタ最適化ループは第2パスを使用してエージェントの呼び出し周波数を調整する。
エージェントはすべてのベンチマークの最終的なコンプライアンスを達成する:$5.7%$から$-1%、すべてのソリューションが完全にバイナリである。
論文 参考訳(メタデータ) (2026-03-26T07:14:31Z) - Runaway is Ashamed, But Helpful: On the Early-Exit Behavior of Large Language Model-based Agents in Embodied Environments [54.67512489842682]
大規模言語モデル(LLM)は、複雑な実施環境において、強力な計画と意思決定能力を示す。
LLMをベースとしたエージェントの早期退避行動を探究する第一歩を踏み出す。
論文 参考訳(メタデータ) (2025-05-23T08:23:36Z) - Simplifying and Understanding State Space Models with Diagonal Linear
RNNs [56.33053691749856]
本研究は、離散化ステップを解消し、バニラ対角線形RNNに基づくモデルを提案する。
概念的にはるかに単純であるにもかかわらず、$mathrmDLR$は以前提案したSSMと同じくらいのパフォーマンスを示す。
また、合成シーケンス・ツー・シーケンス・タスクのスイートによって、SSMとアテンションベースモデルの表現性も特徴付ける。
論文 参考訳(メタデータ) (2022-12-01T18:53:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。