論文の概要: MemToC: Benchmarking Memory-Tool Conflict Resolution in Large Language Models
- arxiv url: http://arxiv.org/abs/2608.26295v1
- Date: Wed, 26 Aug 2026 18:22:03 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-28 16:30:58.143517
- Title: MemToC: Benchmarking Memory-Tool Conflict Resolution in Large Language Models
- Title(参考訳): MemToC:大規模言語モデルにおけるメモリツール競合解決のベンチマーク
- Authors: Arseniy Varlamov, Rishat Zinnatullin, Elisei Rykov, Alexander Panchenko, Ilseyar Alimova,
- Abstract要約: MemToCは、実行時ツールによるポストツール-リターン仲裁のベンチマークである。
MemToCは、542の質制御された事実質問から構築された6,504回の評価エピソードで構成されている。
オープンウェイトな7-9Bモデルでは、ツールが強く支配的なクローズドブックの回答を返す。
- 参考スコア(独自算出の注目度): 49.47300047353726
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Tool-augmented LLMs must arbitrate between two fallible sources when a tool return conflicts with their parametric memory, yet existing evaluations measure source preference without establishing source correctness. We introduce MemToC, a controlled benchmark for post-tool-return arbitration with executable tools. MemToC comprises 6,504 evaluation episodes constructed from 542 quality-controlled factual questions, independently elicited model-specific closed-book answers, and controlled tool returns of known correctness. These components instantiate four source-correctness cases; tool-error and no-tool conditions are separate controls. Across five open-weight 7-9B models, tool returns strongly dominate elicited closed-book answers. The four instruction-tuned models retain a verified-correct answer against an incorrect tool in only 6.5-17.1% of eligible cases, follow a correct tool in 86.0-93.1%, and repeat the tool return in 78.4-86.0% of cases where both sources are wrong. No cross-model ordering remains stable across three instruction-wording variants with the question and episode content held fixed. We compare prompting with SFT and DPO using chain-level cross-fitting over ToolHop, so questions sharing an underlying fact never straddle training and evaluation. We apply an asymmetric success criterion: correct-answer retention must improve without a detected reduction in correct-tool following. SFT and DPO meet this criterion on the same two of four instruction-tuned backbones. Improvements rarely come cleanly: 19 of 20 tested method-model combinations reduce abstention after tool errors or on unanswerable inputs. Transfer beyond MemToC is positive but partial and depends on the model and presentation frame. Correctness-conditioned arbitration can be improved through fine-tuning, but gains must be evaluated jointly with correct tool use, abstention, and robustness to formulation.
- Abstract(参考訳): ツール拡張LDMは、ツールがパラメトリックメモリと競合するときに2つの誤りのあるソースを仲裁しなければならないが、既存の評価では、ソースの正確性を確立することなくソースの選好を測定する。
我々は,実行可能ツールを用いたポストツール・リターン調停のための制御されたベンチマークであるMemToCを紹介する。
MemToCは、542の質制御された事実質問から構築された6,504の評価エピソードと、独立したモデル固有のクローズドブック回答と、既知の正しさの制御ツールリターンから構成される。
これらのコンポーネントは4つのソース修正ケースをインスタンス化する。
オープンウェイトな7-9Bモデルでは、ツールが強く支配的なクローズドブックの回答を返す。
命令調整された4つのモデルは、6.5-17.1%の適当なケースで不正確なツールに対する検証済みの正解を保持し、86.0-93.1%で正しいツールに従い、両方のソースが間違っているケースの78.4-86.0%でツールの返却を繰り返す。
質問内容とエピソード内容が固定された3つの命令ワードの変種において、クロスモデル順序付けは安定していない。
チェーンレベルのクロスフィッティングを用いたSFTとDPOのプロンプトを比較した。
非対称な成功基準を適用した: 正解の保持は、検出された正解の追従の減少を伴わずに改善しなければならない。
SFTとDPOは、4つの命令調整されたバックボーンの同じ2つの基準を満たす。
テストされた20のメソッドモデル組み合わせのうち19は、ツールエラーや解決不可能なインプット後の中断を減らす。
MemToC以外の転送は肯定的だが部分的であり、モデルとプレゼンテーションフレームに依存している。
正確性条件付き仲裁は微調整によって改善できるが、利得は正しい道具の使用、棄却、そして定式化に対する頑健さと共同で評価されなければならない。
関連論文リスト
- Joint Optimization of Tool Creation and Use for Large Language Model Agents [69.07066297088187]
SMITH (-grounded Multi-task Iterative Tool Honing) は、単一のポリシー内でツールの作成とツールの使用を訓練する。
SMITHで訓練された4B Qwen3は、正確に検証された13の手続き的推論タスクで、保持されたタスクで平均79.8のマクロ平均精度に達する。
また、TabMWP-Hardでは40.4、ドメイン外のGQAでは42.6に到達している。
論文 参考訳(メタデータ) (2026-08-25T13:59:34Z) - BeTaL-GBI: Admission-Aware Benchmark Tuning and Full-Stack Verification of Geometric Belief Interfaces [2.894286977279531]
本研究は,企業検証アーキテクチャが要求を監査しつつ,インターフェース障害,タスク能力,ポリシー適合性,整合性を分離できるかどうかを検討する。
BeTaL-GBI v0.2 は LLM-in-the-loop を2,218,750,380 以上のグリッドポイントで適用し、条件付き性能からフォーマットの入力を分離する。
512の総合的なタスクにおいて、16ゲートポリシーは、116の激しい矛盾を全て検出し、99のクリーンレコードを全て受け入れる。幻覚剤とエビデンスフォーガーサロゲートは無音のプロモーションでブロックされる。
論文 参考訳(メタデータ) (2026-08-21T16:52:38Z) - Agent Explorative Policy Optimization for Multimodal Agentic Reasoning [97.64835302176056]
エージェント推論は2つの行動と構造的非対称性(思考と道具の使用)をインターリーブする。
GRPOのような標準的なRLレシピでは、ギャップはトレーニング中に2つの診断症状として現れる。
AXPO (Agent eXplorative Policy Optimization) を提案する。
論文 参考訳(メタデータ) (2026-05-27T17:36:39Z) - Beyond Inference-Time Search: Reinforcement Learning Synthesizes Reusable Solvers [0.0]
大規模言語モデル(LLM)は一般的に、各インスタンスを個別に解決する推論時プロシージャとして最適化にアプローチする。
本稿では,制約付きクナプサックの制御変種であるSDS(Synergistic Dependency Selection)について考察する。
Qwen2.5-Coder-14B-Instruct with Group Relative Policy Optimization using a feasibility-gated reward and light Structure scaffolding。
論文 参考訳(メタデータ) (2026-05-18T13:21:40Z) - RubricRefine: Improving Tool-Use Agent Reliability with Training-Free Pre-Execution Refinement [0.36165327398913766]
反復自己複製は、推論時の信頼性技術として人気がある。
しかし、コードモードツールの使用効率はフィードバック信号の構造に大きく依存する。
本稿では,事前実行型セマンティックコントラクト検証のためのトレーニング不要な手法Refineを紹介する。
論文 参考訳(メタデータ) (2026-05-10T19:57:32Z) - Controllable and Verifiable Tool-Use Data Synthesis for Agentic Reinforcement Learning [82.89535601592739]
マルチレベル検証を用いた自己進化型合成により,信頼性の高い基本ツール利用軌跡を生成する2段階パイプラインを提案する。
これらの拡張は、トラクタツール、間接的または曖昧なユーザクエリ、ノイズ、マルチフォーマット、あるいは誤ったツール出力を導入します。
本設計では,標準事例に対する参照マッチングによる報酬の自動計算と,エラー検出などの特別な動作に対する軽量な判断支援検証を実現する。
論文 参考訳(メタデータ) (2026-04-10T18:38:52Z) - When to Trust Tools? Adaptive Tool Trust Calibration For Tool-Integrated Math Reasoning [58.75883713573783]
Tool-Integrated Reasoningは、推論軌道にツール呼び出しと実行を組み込む有望なパラダイムとして登場した。
モデルの推論がツールの結果と矛盾する場合、モデルは自身の推論を信じる傾向にあります。
アダプティブ・ツール・トラスト(ATTC、Adaptive Tool Trust)は、モデルに対して、ツール結果の信頼性や無視を適応的に選択するフレームワークである。
論文 参考訳(メタデータ) (2026-04-09T14:14:37Z) - CARE What Fails: Contrastive Anchored-REflection for Verifiable Multimodal [84.71254539482369]
検証可能な報酬を伴うグループ相対的強化学習(RLVR)は、しばしば、すでに失敗している最も情報に富むデータを浪費する。
エラーを監督するマルチモーダル推論のための,障害中心のポストトレーニングフレームワークであるCAREを提案する。
CAREは正確さを改善し、スムーズさをトレーニングすると同時に、障害からの学習信号のシェアを明示的に増やします。
論文 参考訳(メタデータ) (2025-12-22T16:34:21Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。