論文の概要: Calibrating Criterion Revision in LLM Agents: Failure Modes and a Trace-Anchored Protocol
- arxiv url: http://arxiv.org/abs/2608.20729v1
- Date: Fri, 21 Aug 2026 04:21:28 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-24 14:49:32.375607
- Title: Calibrating Criterion Revision in LLM Agents: Failure Modes and a Trace-Anchored Protocol
- Title(参考訳): LLMエージェントの校正基準:障害モードとトレースアンコレッドプロトコル
- Authors: Guodong Xu,
- Abstract要約: 言語モデルエージェントは、失敗後に改善したり、成功と見なすものを再検討することなく、エピソード間でテキストを運ぶことができる。
CMB-0.1を12例,腕4例で検討した。
モデルトライアルが5つの条件すべてを満たすことはないが、このゼロは一般能力の欠如を証明していない。
- 参考スコア(独自算出の注目度): 3.202978695204522
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Language-model agents can improve after failure or carry text across episodes without revising what counts as success. We study the narrower attribution problem of criterion revision: when criterion K0 accepts an outcome violating a broader commitment B, what observations justify saying that the system formed and persistently used K1? We require five non-compensatory conditions: criterion-failure detection, a model-emitted proposal, new-episode transfer, intervention sensitivity on the claimed carrier, and preservation. We evaluate CMB-0.1 on twelve cross-domain cases and four arms: stateless inference, append-only history, model-generated but harness-committed state, and evaluator-written oracle state. Seven mechanism fixtures yield 84 deterministic scorer trials; four local quantized artifacts yield 96 calls and 192 model-case-arm trials. No model trial satisfies all five conditions, but this zero does not establish general capability absence. Eleven calls remain invalid after one retry; several commitments disclose the target distinction; the harness performs commits; deletion reuses a stateless call; and conflict changes multiple factors. Qwen2.5-7B answers every transfer and preservation item without revision state, exposing zero-state reconstruction. These failures make CMB-0.1 an instrument-calibration result rather than a model ranking. We derive a prospective, trace-anchored CMB-0.4 protocol requiring concealed transfer, explicit WRITE/NO-WRITE/ESCALATE actions, a separately logged policy-selected commit, matched interventions, repeated hidden items, and a frozen executable oracle. It is a successor design, not a completed confirmatory result. The paper contributes a measurement chain, an empirical diagnosis of its first implementation, and a more discriminating protocol for future tests of criterion revision.
- Abstract(参考訳): 言語モデルエージェントは、失敗後に改善したり、成功と見なすものを再検討することなく、エピソード間でテキストを運ぶことができる。
基準K0がより広いコミットメントBに違反する結果を受け入れると、このシステムがK1を持続的に生成し、使用したことを示す観察結果が正当化されるのか、というより、より狭い帰属問題について検討する。
我々は, 基準欠陥検出, モデル推定提案, 新規エピソード転送, 請求キャリアへの介入感度, 保存の5つの非補償条件を必要とする。
我々はCMB-0.1を12のクロスドメインと4つのアームで評価し、ステートレス推論、追加オンリー履歴、モデル生成とハーネスコミット状態、評価器書きのオラクル状態について検討した。
7つの機構のフィクスチャは84の決定論的スコアリング試験、そして4つの局所的な量子化されたアーティファクトは96の呼び出しと192のモデルケースアーム試験をもたらす。
モデルトライアルが5つの条件すべてを満たすことはないが、このゼロは一般能力の欠如を証明していない。
11回の呼び出しは1回のリトライ後に無効のままで、いくつかのコミットがターゲットの区別を開示し、ハーネスがコミットを実行し、削除がステートレスコールを再利用し、コンフリクトが複数の要因を変える。
Qwen2.5-7Bは、更新状態のないすべての転送および保存項目に回答し、ゼロステート再構築を公開する。
これらの失敗により、CMB-0.1はモデルランキングではなく、計器校正結果となる。
我々は、隠蔽転送、明示的なWRITE/NO-WRITE/ESCALATEアクション、個別にログされたポリシー選択コミット、一致した介入、繰り返し隠蔽されたアイテム、凍結可能なオラクルを必要とする、予測的かつトレースされたCMB-0.4プロトコルを導出する。
これは後継設計であり、完全な確認結果ではない。
本報告では, 評価チェーン, 初期実装の実証診断, 今後の基準修正試験のための識別プロトコルについて述べる。
関連論文リスト
- Agent Behavioral Contracts II: Certifying Compositional Reliability Without Assuming Independence [0.0]
1つのモデルの2つの例は、2つのエージェントのハンドオフにおいて、ミッションの90.0%で共失敗する。
異なるモデルの置換は、6つのコントラストのうち6つのコントラストの関連を減少させる。
論文 参考訳(メタデータ) (2026-08-13T07:25:05Z) - Best Friends, Not Forever: Evaluating Long-Horizon Persona Collapse and Behavioral Drift in AI Companions [34.277389276831435]
本研究では,2つの長期的障害について検討する。「人的崩壊」,展開された役割の喪失,境界,値,スタイル,および「行動漂流」である。
本稿では,人的行為とトラジェクティブリコールを別々に計測する制御型総合監査システムANCHORを紹介する。
この研究には、27人のペルソナにまたがる2,008の会話、9つのインタラクションスケジュール、3つの生成されたメモリ設定、そして4つの評価モデルが含まれている。
論文 参考訳(メタデータ) (2026-07-30T20:18:39Z) - Fantastic Adaptive Taxonomies and How to Use Them [100.20614173157708]
AdaMASTは、実行トレースをコンパクトでエビデンスに基づく障害分類に変換する。
コードには手書きのコードはなく、人間による注釈もない。
エージェント・システム・サーチでは、失敗候補の分類コード診断が自由形式より優れている。
論文 参考訳(メタデータ) (2026-07-17T17:41:16Z) - Forgetting Is Not a Fix: Path Dependence in Sequential Engram Editing [35.76482964927589]
本研究では,概念固有のメモリトレースが1回,1回,1回を算術的に組み合わせて抽出できる線形オブジェクトとなるという仮説を検証した。
そのテストは、著者自身の参照実装に基づいて、報告された最高の編集強度で実行します。
アンラーニング・アズ・コンプライアンス:今日認定された消去は、次の編集後にアーティファクトを認定しない。
論文 参考訳(メタデータ) (2026-07-06T23:45:06Z) - Let the Results Speak: A Replication-First Paradigm for LLM Behavioral Benchmarking [22.825786049667602]
本稿では,1つのヒト・ラタのコンセンサスに有効性を確保するために,複製第一パラダイムを提案する。
楽器を4つの特性で認証する - Kランの信頼性、アーキテクチャ的に異なる審査員間のクロスインストラクトレプリケーション、以前のトレーニングコホートからの審査員による歴史的フットプリントキャリブレーション、事前登録された予測。
本研究は, 自己発達型データ駆動による情緒的伴奏で, 次元は事前に決められず, 手順は9次元に安定化する。
論文 参考訳(メタデータ) (2026-05-27T03:41:11Z) - Distributional Energy-Based Models for Uncertainty-Aware Structured LLM Reasoning [40.342912574072024]
大規模言語モデルは、旅行計画やコードソリューションのような構造化されたアウトプットを生成する。
個々の推論ステップは正しく見えるが、アウトプット全体が予算に違反したり、テストケースに失敗したり、あるいは以前の推論に矛盾することがある。
構造化LCM出力の検証のための決定論的解析制約付き学習品質スコアラを提案する。
論文 参考訳(メタデータ) (2026-05-15T17:08:27Z) - Done, But Not Sure: Disentangling World Completion from Self-Termination in Embodied Agents [11.233308795768465]
VIGILは、端末のコミットメントを独立して測定できる評価フレームワークである。
VIGILのデフォルトプロトコルでは、エージェントはエゴセントリックなRGBのみを観察し、アクション・サクセス・シグナルを受信せず、各エピソードは、隠された世界状態に対して決定論的にチェックされたセマンティック・レポートで終了しなければならない。
これにより、ワールドステートコンプリート(W)とベンチマーク成功(B)の2つのスコアが得られます。
論文 参考訳(メタデータ) (2026-05-09T07:24:07Z) - Mitigating LLM Hallucination via Behaviorally Calibrated Reinforcement Learning [32.32593439144886]
振舞い校正された強化学習により、小さなモデルは不確実な定量化においてフロンティアモデルを超えることができる。
当社のモデルでは,GPT-5の0.207を超える精度向上率(0.806)を挑戦的なドメイン内評価において達成している。
論文 参考訳(メタデータ) (2025-12-22T22:51:48Z) - CARE What Fails: Contrastive Anchored-REflection for Verifiable Multimodal [84.71254539482369]
検証可能な報酬を伴うグループ相対的強化学習(RLVR)は、しばしば、すでに失敗している最も情報に富むデータを浪費する。
エラーを監督するマルチモーダル推論のための,障害中心のポストトレーニングフレームワークであるCAREを提案する。
CAREは正確さを改善し、スムーズさをトレーニングすると同時に、障害からの学習信号のシェアを明示的に増やします。
論文 参考訳(メタデータ) (2025-12-22T16:34:21Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。