論文の概要: Correct Now, Insufficient Later: Auditing Update Sufficiency in Context Compression
- arxiv url: http://arxiv.org/abs/2609.20045v1
- Date: Thu, 17 Sep 2026 10:51:37 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-20 08:55:54.234718
- Title: Correct Now, Insufficient Later: Auditing Update Sufficiency in Context Compression
- Title(参考訳): 正しい今, 不十分な後: 文脈圧縮における更新効率の検証
- Abstract要約: メモリは、後の更新で要求される区別を捨てながら、現在のクエリに正しく答えることができる。
我々はこの失敗を2つの歴史監査で調査する。
パイロットは6つの合成機構の24の履歴ペアを評価する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: A memory can answer a current query correctly while discarding distinctions required by a later update. We investigate this failure with a paired-history audit: two histories have the same current answer, receive a shared future update, and require different subsequent answers. A pilot evaluates 24 history pairs across six synthetic mechanisms, 12 memory conditions, two repeats, and two model backends. A deterministic frontier selector obtains strict reveal accuracy of 96/96 on DeepSeek and 82/96 on GLM; a structured writer obtains 62 successes with one unresolved outcome and 56/96. The configured four-outcome joint contrast has finite-sample identification intervals of [0.521, 0.542] and [0.292, 0.313], not confidence intervals. A record-level audit distinguishes retained-state adequacy, response delivery, and answer-schema compliance without changing those original scores. It finds 26 and 25 well-formed but semantically wrong structured reveal memories, while all 14 GLM frontier reveal failures contain correct values in the wrong wrapper. Tombstone removal produces 16/16 exact replay failures in the targeted mechanism. Identifier renaming then exposes a separate flaw: original frontier late-reference adequacy falls from 8/8 to 94/320 transformed instances. We provide and test a label-equivariant repair, but it preserves only 2/8 original late-reference answers: eliminating a naming shortcut does not solve unknown future relevance. These results support a scoped evaluation methodology and reproducible failure analysis, not general superiority of the repaired algorithm. Paid pilot evidence, retrospective diagnostics, and new offline tests are reported separately; no independent held-out or natural-task validation is claimed.
- Abstract(参考訳): メモリは、後の更新で要求される区別を捨てながら、現在のクエリに正しく答えることができる。
2つの履歴は、同じ現在の回答を持ち、共有された将来の更新を受け取り、異なる回答を必要とする。
パイロットは6つの合成メカニズム、12のメモリ条件、2つのリピート、2つのモデルバックエンドで24の履歴ペアを評価する。
決定論的フロンティアセレクタは、DeepSeekで96/96、GLMで82/96の厳密な明示精度を求め、構造化ライターは、1つの未解決結果と56/96の62の成功を得る。
構成された4出力ジョイントコントラストは、[0.521, 0.542]と[0.292, 0.313]の有限サンプル識別間隔を持ち、信頼区間ではない。
記録レベル監査は、元のスコアを変更することなく、保持状態の妥当性、応答配信、および応答スキーマコンプライアンスを区別する。
26と25はよく形成されているが、セマンティックに間違っている構造上の記憶を示し、14のGLMフロンティアはすべて、失敗が間違ったラッパーに正しい値を含むことを明らかにした。
トンブストーン除去は、ターゲット機構における16/16の正確なリプレイ障害を発生させる。
元のフロンティアの遅延参照精度は8/8から94/320の変換インスタンスに該当する。
我々は,ラベル同変の修復を行い,検証するが,遅延参照応答は2/8のみであり,命名ショートカットの除去は,未知の今後の関連性を解決するものではない。
これらの結果は、修復アルゴリズムの一般的な優位性ではなく、スコープ評価手法と再現可能な故障解析をサポートする。
有償パイロットエビデンス、振り返り診断、新しいオフラインテストは別々に報告される。
関連論文リスト
- IBIB: A Protocol for Measuring Enterprise AI Systems by Serving Route, Not Model Identifier [0.0]
監査された18のベンチマークはすべて、広告付きモデルの識別子をスコア付けする。
ゴールドブラインド機能バインディングプレフライトは、どのタスクが到達する前に、ルートが評価契約を実行可能であることを確認する。
信頼性非包括的なファーストパススコアリングルールは、有効性を保ちながらスコアの失敗を維持する。
論文 参考訳(メタデータ) (2026-09-09T17:31:29Z) - What Eviction Destroys: A Restore-Counterfactual Audit of Forgetting in Agent Memory [1.6558929815405155]
我々は,質問ごとのペアによる介入であるリストア対策を導入し,質問のゴールドエビデンスをリードタイムの文脈で再記録する。
我々は,LongMemEval-SにおけるFIFO,ランダム,冗長,LLMの重要性を3つの予算と2つの検索条件で評価した。
論文 参考訳(メタデータ) (2026-09-08T05:48:10Z) - Wrong but Useful: Trajectory Value Beyond Answer Correctness in Multi-Agent Messages [44.340269814027174]
マルチエージェント推論システムは、合意、信頼、あるいは自動スコアを使用して、どのメッセージが最終回答になるかを決定する。
しかし、間違った答えは、有用な分解、制約、または科学的原理を含むことができる。
この区別は、5つの独立に生成されたメッセージをキャッシュする制御された測定プロトコルであるDHD(Diverse hypothesis Deliberation)で検証する。
論文 参考訳(メタデータ) (2026-08-14T15:16:57Z) - When Many Answers Are Valid, Voting Fails: Symbolic Verification for Best-of-K Causal Reasoning in LLMs [42.32694162421078]
CALVERは、パールの因果基準に対して構造化されたトレースをスコアする訓練不要なシンボル検証器である。
CALVERは、複数のグラフ正解を許容するCLEAR検索1価クエリにおいて、報酬モデル、LLM審査員、モデルの信頼性が30%近く残っている42.1%に達する。
論文 参考訳(メタデータ) (2026-08-04T11:45:46Z) - Judging Is Not Enumerating: Silent Omissions in LLM-Authored Acceptable Sets [13.85834524293015]
私たちは、ロールが想定する能力を測定し、通常、ロールが配置されるプロトコルの下でそれを欠いていることを見つけます。
モデルは、その候補がセット自体の作者よりもはるかに優れているかどうかを判断する。
論文 参考訳(メタデータ) (2026-08-02T05:00:44Z) - Stage-Replay Divergence Follows the KV Cache: Fixed-Prefix Precision Controls and Bidirectional Cache Transplantation [51.56484100374058]
Stage-replayは中間トークンプレフィックスを再構築し、プレフィックスに最初に到達したデコーダ状態からの継続として、新しいプリフィル継続を処理する。
一致した200itemの実験では、保持されたライブキャッシュと同一の整数トークンのワンショットプリフィルを比較し、両側に正確なレプリカを配置する。
論文 参考訳(メタデータ) (2026-07-30T16:41:40Z) - CUSUM-Shaped Inference-Time Monitoring and Targeted Re-Decoding for Quantized Small Language Model Reasoning [0.6999740786886536]
MGT-Bは、事前サンプリングの不確かさと変性の特徴の重なり合う窓を、位置条件による経験的尾の確率にマップする。
ログしきい値h=10のマニュアル選択後に最初に観察された問題同一性に対して,その効果が持続するかどうかを検証した。
どちらの分析も確証がなく、実証的要因は有効な電子プロセスや電子検出器として確立されていない。
論文 参考訳(メタデータ) (2026-07-22T13:34:17Z) - What Accuracy and Gradient Cosine Miss: Evaluating Feedback Alignment via Scale Stability, Reference Validity, and Depth Utility [48.10132234701036]
本稿では,3つのチェック(スケール安定性,参照妥当性,深度ユーティリティ)に基づく診断評価プロトコルを提案する。
複数のアーキテクチャや手法にまたがって、我々のプロトコルは広い校正マージンを持つ全ての障害を識別する。
論文 参考訳(メタデータ) (2026-06-19T06:04:17Z) - Code Correctness Signals in LLM Hidden States: Pre-Generation Probing and Repair Geometry [0.0]
モデルのファーストアタプティブコードの正しさは、プロンプト-ファイナル隠れ状態から線形にデオード可能である。
モデルが失敗した最初の試みを修復しようとするケース236では、失敗した試みからその修復への隠れ状態シフトが統計的に検出可能なコントラスト方向をもたらす。
論文 参考訳(メタデータ) (2026-06-12T15:06:15Z) - Distributional Energy-Based Models for Uncertainty-Aware Structured LLM Reasoning [40.342912574072024]
大規模言語モデルは、旅行計画やコードソリューションのような構造化されたアウトプットを生成する。
個々の推論ステップは正しく見えるが、アウトプット全体が予算に違反したり、テストケースに失敗したり、あるいは以前の推論に矛盾することがある。
構造化LCM出力の検証のための決定論的解析制約付き学習品質スコアラを提案する。
論文 参考訳(メタデータ) (2026-05-15T17:08:27Z) - Causal Understanding by LLMs: The Role of Uncertainty [43.87879175532034]
近年の論文では、LLMは因果関係分類においてほぼランダムな精度を達成している。
因果的事例への事前曝露が因果的理解を改善するか否かを検討する。
論文 参考訳(メタデータ) (2025-09-24T13:06:35Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。