論文の概要: Plan Pointers and Record-Directive Form in Budgeted Verification of Inherited Agent Memory
- arxiv url: http://arxiv.org/abs/2609.03450v1
- Date: Thu, 03 Sep 2026 07:05:38 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-04 18:28:38.963567
- Title: Plan Pointers and Record-Directive Form in Budgeted Verification of Inherited Agent Memory
- Title(参考訳): 継承エージェントメモリの予算検証におけるプランポインターと記録指示形式
- Authors: Kazuki Nakayashiki,
- Abstract要約: ストアに書かれたディレクティブは、レコードへのポインタ、それを識別するクレーター、あるいはその両方を選択することができる。
12件の登録研究(14,760件の試行)で、要求がどの形に下るかを測定した。
すべての結果は、登録間隔とメカニズムクレームのない固定パネルに対する正確な編集の記述的な効果である。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: An agent that inherits six one-line memories may pull at most one archived source record before acting; a directive written into the store can steer that choice: a pointer to the record, a criterion that identifies it, or both. Across twelve registered studies on one instrument lineage (14,760 attempts) we measured where the request goes under each form. On six direct-provider models a length-matched criterion exceeded a bare id by +35.0 points [+31.2, +38.8] (Study D); the contrast failed its registered superiority rule on a nine-model OpenRouter-served panel (Study E). Appending the id cancelled the criterion on three Claude models (Opus 5: 40/40 to 0/40; Study F-x); six byte-matched edits gave each exact string its own effect (Study G), and a re-run at eighty runs per cell left fifteen of thirty replication contrasts within the margin, fifteen unresolved and none beyond (Study G'). A ratification line (+96.0 points on Opus 5) and a budget of two credits restored the target on all three (Study J); across five criterion strings the suffix's cancellation held for four of the five wordings on Opus 5 and all five wordings on Fable 5.1 (Study H2); in a second store every model followed the criterion (Study H1). Continued into a decision, the criterion moved the choice toward the current record (+100.0 points, Opus 5) and away from it on Fable 5.1 (Study I). A one-character plan pointer's effect (+78.0 points; Study B, after a correction of its first repository report) returned the same verdict under a prospectively registered re-run (+81.7 points; Study B'). All results are descriptive effects of exact edits on fixed panels with registered intervals and no mechanism claim.
- Abstract(参考訳): 6つの1行の記憶を継承するエージェントは、行動する前に少なくとも1つのアーカイブされたソースレコードをプルすることができる。
1つの楽器の系統(14,760件の試行)に関する12の登録研究で、リクエストが各形態の下を通るかを測定しました。
6つの直接プロジェクタモデルでは、長さマッチングされた基準は、+35.0ポイント[+31.2, +38.8](Study D)で裸のidを超えたが、コントラストは9モデルのOpenRouter-served panel(Study E)で登録された優越性規則に失敗した。
3つのクロードモデル(Opus 5: 40/40 - 0/40; Study F-x; 研究 F-x)にIDを適用すると、6つのバイトマッチング編集がそれぞれの正確な文字列に独自の効果を与えた(Study G)。
批准線(オプス5で+96.0点)と2クレジットの予算が3つ全ての目標を復活させた(スタディJ)。
決定が下された後、判定基準は現在の記録(+100.0ポイント、Opus 5)に移行し、Fable 5.1(Study I)から離脱した。
1文字プランポインタの効果(+78.0ポイント、研究B、最初のレポジトリレポートの修正後)は、前向きに登録された再実行(+81.7ポイント、研究B')の下で、同じ評定を返却した。
すべての結果は、登録間隔とメカニズムクレームのない固定パネルに対する正確な編集の記述的な効果である。
関連論文リスト
- MemToC: Benchmarking Memory-Tool Conflict Resolution in Large Language Models [49.47300047353726]
MemToCは、実行時ツールによるポストツール-リターン仲裁のベンチマークである。
MemToCは、542の質制御された事実質問から構築された6,504回の評価エピソードで構成されている。
オープンウェイトな7-9Bモデルでは、ツールが強く支配的なクローズドブックの回答を返す。
論文 参考訳(メタデータ) (2026-08-26T18:22:03Z) - Gating Before Commitment: Anticipating Intent Divergence to Prevent Post-Interaction Decision Failures in Autonomous Driving [11.206758778146282]
本研究では,言語誘導型インテントモジュールが構造化記述子を読み出し,スムーズなインテント・ジオメトリ・ダイバージェンススコアを計算し,コミット前に計画された操作をゲートする決定層について検討する。
リプレイされたオフロードの出発と、凍結して公表された実装の下での4つのクラッシュクリップで、ゲーティングは計画を修復する唯一のレイヤーである。
このモデルの実証された役割は、これらの失敗を最も早く検出し、幾何学的規則に対する不確実な拒否である。
論文 参考訳(メタデータ) (2026-08-26T17:42:03Z) - When Stale Constraints Go Unchecked: Budgeted Verification Failures in Inherited Agent Memory [0.0]
証拠リンクは、継承された信条の裏にある証拠を保持しており、検証予算を持つエージェントは、検査するリンクを選択する必要がある。
我々は、決定制約を記述し、ソースレコードを削除したレコードに置き換えた統合記憶について研究する。
16の言語モデルは、落ち着いたように読む制約を再検証することはめったにない。
ひとたび制約が過小評価されると、77.3%、74.7%、74.7%のエピソードが一次実行、複製、保留領域で安定的な決定を下した。
論文 参考訳(メタデータ) (2026-08-26T09:04:21Z) - BOUND: Brief-Guided Corrective Preference Distillation at Search-Control Boundaries [82.41764922522565]
BOUNDは、永続的な探索ドリフトのための短いガイド付き修正選好蒸留フレームワークである。
Trajectory SFT は Bamboogle で 5.6 EM 、BrowseComp-Plus で 4.8 の精度で上回っている。
論文 参考訳(メタデータ) (2026-08-09T15:32:16Z) - Judging Is Not Enumerating: Silent Omissions in LLM-Authored Acceptable Sets [13.85834524293015]
私たちは、ロールが想定する能力を測定し、通常、ロールが配置されるプロトコルの下でそれを欠いていることを見つけます。
モデルは、その候補がセット自体の作者よりもはるかに優れているかどうかを判断する。
論文 参考訳(メタデータ) (2026-08-02T05:00:44Z) - Win by Silence: Deletion Non-Monotonicity, Autonomous Exploitation, and Typed-State Gating in LLM Plan Evaluation [0.0]
計画評価者は、明確化の少ない戦略的計画に報いることができる。
GATEは、単にポストホックフィルタではなく、決定論的検索整形制約として機能する。
論文 参考訳(メタデータ) (2026-07-14T17:29:28Z) - TASR: Training-Free Adaptive Stopping for Iterative Retrieval [12.177557521540082]
反復的検索拡張生成エージェントは、モデルが解答に収束した後も検索を続けることで、一般的にオーバースペンドされる。
TASR(Training-Free Adaptive Stopping Rule)は,モデルが前ラウンドの正規化を繰り返すと発火する一行述語である。
論文 参考訳(メタデータ) (2026-06-11T18:35:14Z) - Knowledge Index of Noah's Ark [63.143852586221534]
KINAは,261分野にわたる899項目のベンチマークである。
ボーナス・オン・バートーナメントがFOSDを弱く支配していることを示す。
トップモデルであるGemini-3.1-Pro-Previewは53.17%、Claude-Opus-4.6は49.92%、GPT-5.4は48.55%に達した。
論文 参考訳(メタデータ) (2026-06-03T17:06:49Z) - Right Makes Might: Aligning Verified Hidden States Empowers RL Reasoning [55.264863369127774]
現在の方法では、それぞれの正しいロールアウトを単一の報酬ビットに減らし、隠れた状態間で共有される幾何学的構造を無視している。
本稿では,RLトレーニングにおけるアンカートークンにおける正ロールアウトの最終層を,トレーニングと推論の両方においてゼロオーバーヘッドで整列する補助損失関数Hidden-Alignを提案する。
8つの数学的推論ベンチマークでは、Hidden-AlignはDAPOベースラインの平均パス@1をQwen3-1.7B, 4B, 14Bで3.8, 6.2, 5.4ポイント改善し、3つのスケールで一貫したパス@kゲインを得る。
論文 参考訳(メタデータ) (2026-06-02T06:51:15Z) - Step-wise Rubric Rewards for LLM Reasoning [72.17879367869503]
RLVR(Reinforcement Learning with Verifiable Rewards)は、大規模言語モデルの推論を改善するために広く使われている。
正しい回答の18.2%は間違っているが、肯定的な報酬がある。
6つの数学的推論ベンチマークで、SRaRはRaRの平均精度を3.57ポイント改善した。
論文 参考訳(メタデータ) (2026-05-17T07:08:14Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。