論文の概要: Bookkeeping, Composition, or Unreachable Gold? Reading MemoryAgentBench's Conflict-Resolution Scores Against a Frozen Last-Write Resolver
- arxiv url: http://arxiv.org/abs/2610.09193v1
- Date: Tue, 06 Oct 2026 22:44:32 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 21:58:22.638177
- Title: Bookkeeping, Composition, or Unreachable Gold? Reading MemoryAgentBench's Conflict-Resolution Scores Against a Frozen Last-Write Resolver
- Title(参考訳): 書記・作曲・未読金? MemoryAgentBench's Conflict-Resolution Scores against a Frozen Last-Write Resolver
- Abstract要約: MemoryBench の Conflict Resolution split は "elective forgetting" の測定として読み上げられる
4つのファクトリストのうちの1つに凍結されたゼロラーニングリゾルバとしてベンチマーク独自のルールを実行する。
- 参考スコア(独自算出の注目度): 4.008486665405814
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: MemoryAgentBench's Conflict Resolution split is read as measuring "selective forgetting". We execute the benchmark's own rule - the newest statement about a fact wins - as a zero-learning resolver frozen on one of the four fact lists. Under the official metric the rule answers 80.25% of the questions (74.5% on the three held-out lists). Of the rest, 67 items have a released gold that the last-write graph cannot reach but overwritten statements would ("The capital of India is New Delhi." superseded by "The capital of India is Grosseto."; gold New Delhi); such items are a third of the multi-hop questions at 262K. Two long-context models and our pre-registered approximate re-implementation of the benchmark's BM25 agent, one retained run per item and outcomes only, score 84.7%, 82.6% and 41.6% on the items the rule solves against 10.4%, 11.9% and 6.0% on those 67. The failures are a reachability split plus a small parser-scope residual; the per-item split, not the aggregate, is the unit at which a score here can be read.
- Abstract(参考訳): MemoryAgentBench の Conflict Resolution split は「選択的忘れる」測定として読み上げられる。
4つのファクトリストの1つに凍結されたゼロラーニングリゾルバとして、ベンチマーク独自のルール(事実が勝つという最新の声明)を実行します。
公式の基準では、このルールは質問の80.25%(3つの保留リストの74.5%)を答えている。
その他の67品目のうち、最後の筆記グラフは到達できないが、上書きされた文言(「インドの首都はニューデリー」)は「インドの首都はグロセト」、金はニューデリー」に置き換わる。
2つの長期コンテキストモデルと、ベンチマークのBM25エージェントの概算実装を事前登録し、1項目あたりのランと結果のみを保持、ルールが解決した項目の84.7%、82.6%、41.6%を10.4%、11.9%、および6.0%と評価した。
故障はリーチビリティスプリットと小さなパーサスコープ残量であり、アグリゲーションではなく、各イテムスプリットはここでスコアを読むことができる単位である。
関連論文リスト
- Fair Fact-Checking: Closing the Cross-Lingual Gap in LLM Factual Judgement with RoSh [37.08044812250237]
英語はすべてのモデルで他のどの言語よりも優れていると判断され、その差は最小の言語よりも大きい。
3層で閉じた形で計算した残差ストリームの言語ごとのシフトと回転であるRoShを提案する。
Llama-3Bのアラビア語は偶然からほぼ英語のレベルへと変化し、英語で正しく答えられた主張のうち5分の1は翻訳で失われている。
論文 参考訳(メタデータ) (2026-09-28T09:08:47Z) - The Missing Complement: State-Conditioned Minimal Sufficient Evidence for Coding Agents [26.90440158198578]
捕獲されたエージェントの状態が与えられた場合、次の決定を支援するためのコンパクトなエビデンスの組み合わせは依然として欠落している。
SERBenchは45のリポジトリから保持された500の状態を計測し、エージェントが見たことを記録し、現在の決定が要求されるすべての事実をカバーするセットのみをクレジットする。
キャリブレーションデータに固定された1つの構成では、これらの状態の73.0%が5つの項目で、80.6%が8つの項目で、61.4%と72.4%が再ランク付けされたQwen3埋め込みである。
論文 参考訳(メタデータ) (2026-09-17T10:56:47Z) - Measuring the Checker: Mutation Analysis for GPU-Kernel Benchmark Oracles [86.41218924166775]
LLM生成のGPUカーネルのベンチマークは、ランダムな入力とゆるやかな浮動小数点耐性で正確性を決定する。
最近の研究は、これらのチェッカーは弱く、手動でパッチを当てることに同意している。
本稿では,カーネルベンチマークの精度指標として突然変異解析を導入する。
論文 参考訳(メタデータ) (2026-09-02T10:30:05Z) - CatchBench: When Can an Agent Failure Be Caught? [6.230697997280125]
CatchBenchは、監査人の質問を3つの情報状態に分類する。
以前のベンチマークでは、これらの状態の1つを修正したり、テレメトリを変更したりする。
各州は異なる質問を認めており、7つのタスク契約は独自のラベルとメトリクスを持っている。
論文 参考訳(メタデータ) (2026-08-24T05:09:41Z) - Gated Against One Model, Open to the Next: Option-Only Solvability in Legal Multiple-Choice Benchmarks [0.0]
複数選択のベンチマークは、モデルが正しい選択肢を選ぶかどうか、質問が必要なかどうかで評価される。
UA-JudgeExam: 11,990件の4つのオプション項目を公式キーで測定し、ウクライナの高等審査委員会(Higher Qualification Commission of Judges)が公表した。
11.8%のアイテムは、偶然に予想される0.2項目に対して、8つのオプションのすべてで盲目で答えられる。
論文 参考訳(メタデータ) (2026-08-15T22:11:00Z) - Beyond Top-K: Replacing Black-Box Retrieval with Interpretable Agentic Operations [0.0]
長いドキュメントに対する検索拡張生成は、テキストをチャンクし、チャンクを埋め、クエリの最も近い隣人にサーフェスする、という1つの設計によって支配されている。
我々は、財務報告、監査報告、規制リターンといった重要な文書のクラスにとって、この設計は構造的に不正確であると主張する。
本稿では,READ(Reliable Embedding-free Agentic Document-search)を提案する。
論文 参考訳(メタデータ) (2026-08-06T17:23:13Z) - Voice Memory for Agentic Speech Recognition [66.69623133635868]
エージェント音声認識のための推論専用スキームであるVoice Memoryを提案する。
同期的に、スコア付き例は、境界編集を通じてそのファイルを更新する。
10のHyPoradiseドメインにオープン修正器、Voice Memory、重み付き単語エラー率8.36%から7.52%の10のドメインがある。
論文 参考訳(メタデータ) (2026-07-29T02:42:56Z) - Evaluating Commercial AI Chatbots as News Intermediaries [85.32040752972836]
ベストシステムは、数時間前に報告されたイベントに関する質問に対して、90%以上の多重選択精度を達成する。
すべてのモデルはヒンディー語で最小の精度を達成する。
原因ではなく検索は エラーの70%以上を 引き起こします
論文 参考訳(メタデータ) (2026-05-21T17:42:07Z) - Step-wise Rubric Rewards for LLM Reasoning [72.17879367869503]
RLVR(Reinforcement Learning with Verifiable Rewards)は、大規模言語モデルの推論を改善するために広く使われている。
正しい回答の18.2%は間違っているが、肯定的な報酬がある。
6つの数学的推論ベンチマークで、SRaRはRaRの平均精度を3.57ポイント改善した。
論文 参考訳(メタデータ) (2026-05-17T07:08:14Z) - Tracing LLM Reasoning Processes with Strategic Games: A Framework for Planning, Revision, and Resource-Constrained Decision Making [38.75183725659772]
大規模言語モデル(LLM)は、複雑な推論を必要とするタスクにますます使われている。
モデル動作の理解と信頼性向上には,内部プロセスの測定が不可欠である,と我々は主張する。
計画,修正,資源制約のある意思決定という3つの中核的な側面に沿ってLCMを評価する枠組みを導入する。
論文 参考訳(メタデータ) (2025-06-13T17:59:10Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。