論文の概要: Trace as State: Reasoning Traces as Conditional States for Long-Context Transformers
- arxiv url: http://arxiv.org/abs/2609.02702v1
- Date: Wed, 02 Sep 2026 15:06:46 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-03 17:53:18.443653
- Title: Trace as State: Reasoning Traces as Conditional States for Long-Context Transformers
- Title(参考訳): Trace as State: Long-Context Transformerの条件状態としてトレースを推論する
- Abstract要約: 因果状態更新プロセッサの場合、条件ファーストを提供するには、最悪の場合、指数関数的に少ないメモリを必要とする可能性がある。
我々は、タスク状態のテキストプロキシとして収集された推論トレースを使用し、それを新しいパスの長文ブロックの前に配置する。
3つのモデルと3つの長期コンテキストデータセット、Trace as StateがTrace Appendを26で上回り、モデル、タスク、メトリックの組み合わせが報告された。
- 参考スコア(独自算出の注目度): 16.546486176098323
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Transformers process information causally, but long-context reasoning may depend on task state discovered only later. We formalize this mismatch through conditional state update tasks. For causal state update processors, providing the condition first can require exponentially less memory in the worst case than providing it last. Motivated by this principle, we introduce Trace as State. We use collected reasoning traces as a textual proxy for task state and place it before the long-context block on a fresh pass, allowing information derived previously to guide rereading. We conduct extensive experiments on Trace as State and Trace Append, a matched control that uses the same task state proxy but put it after the context. Across three models and three long-context datasets, Trace as State outperforms Trace Append in 26 of 27 reported combinations of model, task, and metric. On GraphWalks Parents, exact match lifts DeepSeek V4 Pro Preview from 29.2% on the initial pass and 43.0% with Trace Appendto 81.8% with Trace as State, and from 66.4% and 83.2% to 100.0% for GLM-5.2. These results show that placing traces before the context can improve long-context reasoning while retaining the causal transformer structure.
- Abstract(参考訳): トランスフォーマーは情報を慎重に処理するが、長いコンテキスト推論は後になって発見されたタスク状態に依存することがある。
我々は条件付き状態更新タスクによってこのミスマッチを定式化する。
因果状態更新プロセッサの場合、最初の条件を提供することで、最悪の場合において最後の条件よりも指数関数的に少ないメモリを要求できる。
この原則に動機付けられて、Trace as Stateを導入します。
収集された推論トレースをタスク状態のテキストプロキシとして使用し、それを新しいパスの長文ブロックの前に配置することで、以前導出されていた情報を読み取ることができる。
Trace as StateとTrace Appendは、同じタスク状態プロキシを使用してコンテキストの後に配置する、マッチしたコントロールです。
3つのモデルと3つの長期コンテキストデータセット、Trace as StateがTrace Appendを26で上回り、モデル、タスク、メトリックの組み合わせが報告された。
GraphWalks Parentsでは、DeepSeek V4 Pro Previewが29.2%、Trace Appendto 81.8%、Trace as Stateが43.0%、GLM-5.2が66.4%、83.2%から100.0%となっている。
これらの結果から, 因果変換器の構造を維持しつつ, 文脈よりも先にトレースを配置することで, 長文推論を改善できることが示唆された。
関連論文リスト
- State of Thought Enables Endogenous Reasoning [48.902117018115256]
大規模言語モデル(LLM)の能力向上のための主要なアプローチとして、テスト時推論が登場した。
LLMにおける内在的推論を可能にする新しい推論パラダイムであるState of Thoughtを提案する。
SoTは平均ベースライン精度を一貫して改善し,生成トークンを62.6%,エンドツーエンドのレイテンシを44.6%削減した。
論文 参考訳(メタデータ) (2026-09-13T05:55:03Z) - EvolveScaler: Synthesizing Information-Evolution Contexts via Executable State Machines and Natural-Language Rendering [57.87517047585447]
我々はEvolveScalerを紹介した。EvolveScalerはコード駆動のフレームワークで、自然言語としてレンダリングする前に情報進化を定義する。
EvolveScalerを117のタスクプロトタイプと159のファイナルクエスト演算子でインスタンス当たり約7~1200のイベントにまたがる5つの難易度でインスタンス化する。
very_longティアでは、最強のモデルが59.3%のavg@5に達し、6つのモデルが10%以下である。
論文 参考訳(メタデータ) (2026-09-08T08:40:05Z) - APIFlow-Bench: Measuring Whether Agents Survive Long, Dependent API Workflows [23.621239974604205]
APIFlow-Benchは、長期依存のREST-APIパフォーマンスのための、完全に監査可能なベンチマークである。
サブタスクによってサブタスクとして,合成APIの世界を前方に生成する。
すべての応答キーと44,362個の未修正実行書き起こしをリリースします。
論文 参考訳(メタデータ) (2026-08-29T08:12:11Z) - Can Agent Memory Systems Track Evolving State? [19.24558136812374]
我々は、効果的なメモリシステムは世界の進化状態を追跡する必要があると主張している。
事実、制約、決定が長い相互作用によって修正されるため、答えは現在の状態を反映し、過小評価されるものではない。
この機能をステートトラッキングとして定義し、StateMemBenchでインスタンス化する。
論文 参考訳(メタデータ) (2026-08-20T05:41:23Z) - Turning Interaction History into Execution State: A Runtime Layer for Long-Horizon Coding Agents [48.967927222079965]
Ledgerは、エージェントの完了したインタラクションを明示的な実行状態に蒸留するランタイム層である。
Ledgerはこの状態をオンライン実行台帳に保持し、各ステップの2つのバウンダリに適用される。
500のSWE-bench検証インスタンス全体で、LedgerはPass@1を56.2%から64.2%に、GPT-5 miniを75.8%から81.0%に、MiniMax M2.5を81.0%に引き上げている。
論文 参考訳(メタデータ) (2026-08-01T18:25:00Z) - Learning Compositional Meta-Routing for Agentic Workflows: An Executable Benchmark [0.0]
本稿では,タスクテキストからヘテロジニアスな操作を構成する,実行可能ベンチマークと予算対応メタルータを紹介する。
結果: 学習成功率は75.9%、静的ルーティングは93.5%、残る49%が安価で34.3ポイントを超える。
論文 参考訳(メタデータ) (2026-07-31T07:00:49Z) - PULSE: An Executable Contract Language for Spatiotemporal Knowledge Graph Engineering [2.2262915480980063]
PULSEはObject-Process-Methodologyにインスパイアされた言語で、4つの運用ロールをローカライズし、その書き込み効果を1つの型付きランタイムで表現する。
実装されたコントラクトは、非オーバーライト、ブランチアイソレーション、接地されたマルチオブジェクトタイマー、ガードされた状態変更、時間と空間に関する宣言付きイベント順序のエビデンスを修正する。
Lean 4は、位置、エビデンス、クロック、モニター、アトミック性、ブランチソース保持のカーネルアナログをチェックする。
論文 参考訳(メタデータ) (2026-07-26T17:44:05Z) - TraceGraph: Shared Decision Landscapes for Diagnosing and Improving Agent Trajectories [61.51984029109709]
グラフベースのフレームワークであるTraceGraphを紹介した。
各タスクに対して、TraceGraphは、モデルIDが導入される前に、プールされたロールアウトから観測可能なアクション・オブザーブレーション状態のグラフを構築する。
次に、結果インフォームされた生産的なコアとトラップリージョンをオーバーレイし、各ロールアウトを3つのイベント – アクセス、トラップ露出、修復 – で要約する。
論文 参考訳(メタデータ) (2026-05-29T13:40:31Z) - Converted, Not Equivalent: Benchmarking Codebase Conversion via Observational Equivalence [56.25095230687242]
コーディングエージェントは、しばしば自身のローカル検証ルーチンを過度に信頼し、表面チェックを満たすアーティファクトの成功を宣言する。
この問題は、事前評価が結果駆動である変換において特に深刻である。
ブラインド・コンバージョンは26.7-28.9%に達し、スペック・パスレートは91.1%まで上昇した。
このことは、失敗は限られた予算やバックボーンの強さよりも、契約ミスによる自己検証に起因していることを示唆している。
論文 参考訳(メタデータ) (2026-05-27T19:57:15Z) - OpenPI-C: A Better Benchmark and Stronger Baseline for Open-Vocabulary
State Tracking [55.62705574507595]
OpenPIは、オープン語彙状態トラッキング用に注釈付けされた唯一のデータセットである。
手順レベル,ステップレベル,状態変化レベルの3つの問題を分類する。
評価指標として,クラスタベースの計量法を提案する。
論文 参考訳(メタデータ) (2023-06-01T16:48:20Z) - A New Bandit Setting Balancing Information from State Evolution and
Corrupted Context [52.67844649650687]
本稿では,2つの確立されたオンライン学習問題と包括的フィードバックを組み合わせた,逐次的意思決定方式を提案する。
任意の瞬間にプレーする最適なアクションは、エージェントによって直接観察できない基礎となる変化状態に付随する。
本稿では,レフェリーを用いて,コンテキストブレイジットとマルチアームブレイジットのポリシーを動的に組み合わせるアルゴリズムを提案する。
論文 参考訳(メタデータ) (2020-11-16T14:35:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。