論文の概要: Stateful CARS: Exact Cross-History Reuse for Policy-Constrained LLM Agents
- arxiv url: http://arxiv.org/abs/2608.08282v1
- Date: Sat, 08 Aug 2026 18:26:25 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:36.758179
- Title: Stateful CARS: Exact Cross-History Reuse for Policy-Constrained LLM Agents
- Title(参考訳): ステートフルCARS:政策制約LDMエージェントのクロスヒストリー・リユース
- Abstract要約: ハードステートフル検証器に条件付されたモデル分布の正確なサンプリングについて検討する。
ステートフルCARSはサウンドステートのバンクを凍結します。
クロスヒストリー転送は、内部整合キーアブレーションでのみ有効である。
- 参考スコア(独自算出の注目度): 0.9558392439655014
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Tool-using language-model agents face constraints whose meaning changes with observations and prior actions. We study exact sampling from the model distribution conditioned on a hard stateful validator while reusing invalidity certificates across histories. Stateful CARS freezes a bank of sound state--continuation schemas within each attempt and removes every trajectory containing a certified continuation at a matching abstract state. An exact residual Doob transform samples from the resulting proposal. We give a checkable future-validity bisimulation condition, prove schema soundness, adaptive exactness, i.i.d.\ outputs, almost-sure termination, monotone acceptance, and compression invariance, and characterize computation by the number of reachable full-history product states. This number can be exponential for a history-dependent language model; the evaluated method therefore makes no generic finite-trie scalability claim. On enumerable workflows, its analytic law matches the valid conditional to $10^{-16}$ at validity probability $6\times10^{-8}$, whereas state-aware local decoding can be $0.97$ away. A matched comparison is negative: observation-keyed official CARS is cheaper in sampler steps (root/Stateful ratio $0.942$ $[0.934,0.951]$), and the Qwen comparison is null ($0.99$ $[0.90,1.08]$). Cross-history transfer helps only in an internal matched-key ablation ($1.27\times$). Thus the evidence supports exact schema-induced conditioning, not a systems advantage over CARS.
- Abstract(参考訳): ツールを使用する言語モデルエージェントは、観察と事前アクションによって意味が変化する制約に直面します。
ハードステートフルなバリデータ上で条件付きモデル分布の正確なサンプリングと,履歴にまたがる無効性証明書の再利用について検討した。
ステートフルCARSは、各試行内で健全な状態-継続スキーマのバンクを凍結し、一致する抽象状態における証明された継続を含むすべての軌道を除去する。
得られた提案から、正確な残留するDoob変換サンプルが得られた。
我々は、チェック可能な将来正当性ビシミュレーション条件を与え、スキーマの健全性、適応的正確性、すなわち、ほぼ確実に終了する、モノトーンの受容、圧縮不変性を証明し、到達可能なフルヒストリー製品状態の数による計算を特徴付ける。
この数は、歴史に依存した言語モデルにとって指数関数的であり、評価された手法は、一般的な有限トレースケーラビリティの主張をしない。
可算ワークフローでは、その解析法則は有効条件を 10^{-16}$ に確率 6\times10^{-8}$ で一致させるが、状態対応の局所復号法は0.97$ まで離れることができる。
観測キー付きの公式CARSはサンプリングステップ(root/Stateful ratio $0.942$ $[0.934,0.951]$)で安価であり、Qwenの比較はnull$0.99$ $[0.90,1.08]$である。
クロスヒストリー転送は、内部のマッチキーアブレーション(1.27\times$)でのみ役立つ。
したがって、エビデンスはCARSに対するシステム上の優位性ではなく、正確なスキーマによる条件付けを支持している。
関連論文リスト
- Reference-Based Bias Detection in LLMs via Relative Representations of Hidden States [4.505185728893222]
本稿では,関連するモデル変種にまたがる隠れ状態表現のバイアスを監査する参照ベース手法を提案する。
微調整されたリサップ表現幾何学のため、絶対的な隠れ状態は直接的に同値ではない。
対象群が正・負の属性とどのように関連するかを測定する。
論文 参考訳(メタデータ) (2026-09-09T11:33:35Z) - Probabilistic Model Checking of Autoregressive Neural Sequence Models [4.570003973862485]
自己回帰型ニューラルシークエンスモデルをデプロイする上で問題となる2つの問題に対して、テストセットの精度は静かである。
テスト対象のシステムの質量は、サンプリング時に到達可能な制約違反の代替品にどの程度の確率があるか。
確率論的モデル検査で両方答える。
論文 参考訳(メタデータ) (2026-09-01T07:37:55Z) - Drift Variation Autoencoder: Unifying Generation and Representation Learning through Conditional Posterior Flow Matching [0.0]
この研究は、条件生成の共通統計対象として対応する後続の$P(Xmid C)$を取る。
ドリフト変動オートエンコーダは、マスク付きエンコーダ$Z=E(C)$と、1つのきれいな予測フローマッチング損失を持つ条件付きフローデコーダを訓練する。
論文 参考訳(メタデータ) (2026-08-25T20:38:50Z) - SANE: State Anomaly Neutralization for Stable Extreme-Context Delta-Rule Models [53.86918766240095]
Delta-Ruleリカレントモデルは固定サイズの状態を維持しており、$O(1)$の推論メモリが可能であるが、極端なコンテキスト外挿では不安定になる可能性がある。
我々は,チャンク内並列構造を保ちながら,チャンク境界における適応$tanh$圧縮を適用したtextbfState Anomaly Neutralization (SANE)を提案する。
論文 参考訳(メタデータ) (2026-08-23T10:41:07Z) - From Approachability Residuals to Anytime-Valid Evidence: The Online Convex Geometry of Testing by Betting [0.1624454100511275]
ギャンブリングベースのシーケンシャルテストとブラックウェルのアプローチ性は、支持関数による比例還元によってリンクされる。
正確な経路単位は$$dist(bar r_T,S) =frac1Tsum_t=1Tq_t+fracReg_TTである。
論文 参考訳(メタデータ) (2026-08-10T11:23:30Z) - Calibrated e-CUSUM Decoding for Quantized Reasoning Models: Why Token Log-Probability Is the Wrong Observable for Decoding Monitors [0.6999740786886536]
低ビット量子化により、小さな推論モデルは安価に展開できるが、思考の連鎖を分解することができる。
中心となるトークンのlog-probabilityは$log p(w_t)+H_t$が間違ったオブザーバブルであることを示します。
本稿では,トークンの不確実性と明示的な繰り返しを混在させるデジェネレーションを意識したアラームスコアを組み合わせた,トレーニング不要な復号制御手法を提案する。
論文 参考訳(メタデータ) (2026-07-13T09:34:36Z) - Certified Finite-Shot Operating Windows for Virtual Distillation and Symmetry Verification [0.0]
仮想蒸留 (VD) と対称性検証 (SV) で比較可能な有限ショット動窓理論を開発した。
VD の場合、この法則は商推定器の統計バイアスと分母不安定性を捉え、商が信頼できる範囲を超えてサンプルサイズを特定する濃度証明書を定めている。
SVでは、検出不能なエラーによって残されたバイアスフロアと、受信確率によって設定されたサンプリングペナルティを分離する。
論文 参考訳(メタデータ) (2026-06-13T20:42:40Z) - Scaling Laws for Agent Harnesses via Effective Feedback Compute [53.68149869349268]
emphEffective Feedback Compute (EFC)は、情報的、有効、非冗長な場合にのみフィードバックを信用し、その後の決定のために保持するトレースレベルのスケーリング座標である。
EFCベースの座標は、生の計算ベースラインよりも失敗率を常に予測する。
論文 参考訳(メタデータ) (2026-05-28T09:45:47Z) - When Are Trade-Off Functions Testable from Finite Samples? [4.706977254727891]
2つの未知確率分布のトレードオフ関数に対する有限サンプル推論について検討する。
テストの反転により、トレードオフ曲線全体に対する同時信頼バンドも得られる。
論文 参考訳(メタデータ) (2026-05-11T16:07:48Z) - The Geometry of Forgetting: Temporal Knowledge Drift as an Independent Axis in LLM Representations [50.43168858368539]
大規模言語モデルは自信を持って時代遅れの回答を生成し、既存の方法では検出できない。
これは工学的な失敗ではなく構造的な失敗であり、時間的ドリフトは、幾何的に残留流の方向として、正確性と不確実性の両方に符号化される。
論文 参考訳(メタデータ) (2026-05-09T22:27:31Z) - Correction and Corruption: A Two-Rate View of Error Flow in LLM Protocols [51.56484100374058]
そこで本研究では,単一プロトコルステップを正確なマッチングタスクで監査するためのペアアウトカム計測インタフェースを提案する。
各インスタンスについて、インターフェースはベースラインの正当性ビットと後ステップの正当性ビットを記録する。
これらのレートは精度の変化を予測し、種、混合物、パイプライン間でテスト可能な再利用可能な経験的インターフェースを定義する。
論文 参考訳(メタデータ) (2026-04-20T13:25:40Z) - See Less, Drive Better: Generalizable End-to-End Autonomous Driving via Foundation Models Stochastic Patch Selection [51.59559387222532]
エンドツーエンド自動運転の最近の進歩は、パッチアライメント機能で訓練されたポリシーが、アウト・オブ・ディストリビューション(OOD)よりも一般化していることを示している。
我々は、より堅牢で、一般化可能で、効率的な学習ポリシーのためのシンプルで効果的なアプローチである2.4-Patch-Selection(SPS)を提案する。
論文 参考訳(メタデータ) (2026-01-15T18:58:33Z) - Reinforcement Learning with Verifiable yet Noisy Rewards under Imperfect Verifiers [90.50039419576807]
RLVR(Reinforcement Learning with Verifiable Rewards)は、人為的なラベル付けを避けるために、自動検証に対するポリシーを訓練する。
認証ハッキングの脆弱性を軽減するため、多くのRLVRシステムはトレーニング中にバイナリ$0,1$の報酬を破棄する。
この選択にはコストがかかる:textitfalse negatives(正しい回答、FNを拒絶)とtextitfalse positives(間違った回答、FPを受け入れる)を導入する。
論文 参考訳(メタデータ) (2025-10-01T13:56:44Z) - Certifiably Robust Model Evaluation in Federated Learning under Meta-Distributional Shifts [8.700087812420687]
異なるネットワーク "B" 上でモデルの性能を保証する。
我々は、原則付きバニラDKWバウンダリが、同じ(ソース)ネットワーク内の未確認クライアント上で、モデルの真のパフォーマンスの認証を可能にする方法を示す。
論文 参考訳(メタデータ) (2024-10-26T18:45:15Z) - Generalized Differentiable RANSAC [95.95627475224231]
$nabla$-RANSACは、ランダム化された堅牢な推定パイプライン全体を学ぶことができる、微分可能なRANSACである。
$nabla$-RANSACは、精度という点では最先端のシステムよりも優れているが、精度は低い。
論文 参考訳(メタデータ) (2022-12-26T15:13:13Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。