論文の概要: Self-Reports Are Not Verification: Environment-Grounded Auditing of LLM Operators in Evolutionary Search
- arxiv url: http://arxiv.org/abs/2609.00652v1
- Date: Tue, 01 Sep 2026 03:28:37 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.269342
- Title: Self-Reports Are Not Verification: Environment-Grounded Auditing of LLM Operators in Evolutionary Search
- Title(参考訳): 自己報告は検証されていない:進化的探索におけるLLMオペレータの環境監査
- Authors: Enrong Pan, Ryan Zhou, Ting Hu,
- Abstract要約: 各中間提案が正確な結果を受け取る環境監査を導入する。
言語モデルは進化的コンテキスト検索を演算し、フィードバック関数は人間のアノテーションなしで正確なランクを推測する全ての有効な推測を割り当てる。
信頼度は校正され、継承された合理的性は後続の提案に影響を及ぼし、フィットネスベースの選択はレポートの品質を改善する。
- 参考スコア(独自算出の注目度): 1.402200998845899
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Language model agents increasingly propose actions, observe external feedback, and explain their own behavior. Their confidence and rationales are convenient monitoring signals, but convenience is not verification. We introduce an environment-grounded audit in which every intermediate proposal receives an exact outcome. A language model operates an evolutionary Contexto search whose feedback function assigns every valid guess an exact rank without human annotation. Across 200 runs spanning five configurations and three model families, four reporting configurations produce 12,249 self-reports. We test three assumptions: stated confidence is calibrated, inherited rationales affect later proposals, and fitness-based selection improves report quality. All three fail. Operators overstate top-100 success by factors of 4.8 to 9.3, while calibration and discrimination dissociate across model families. Controlled interventions on 754 inherited rationales bound any measured benefit of the genuine rationale to roughly 250 ranks. Neither fitness-based nor random selection produces a detectable selection differential or parent-to-offspring transmission in report accuracy, despite sharply different search behavior. Agent self-reports should therefore be treated as claims to verify against the environment, not as evidence of their own reliability.
- Abstract(参考訳): 言語モデルエージェントはますますアクションを提案し、外部からのフィードバックを観察し、自身の振る舞いを説明する。
彼らの自信と合理性は便利なモニタリング信号であるが、利便性は検証されていない。
各中間提案が正確な結果を受け取る環境監査を導入する。
言語モデルは進化的コンテキスト検索を演算し、フィードバック関数は人間のアノテーションなしで正確なランクを推測する全ての有効な推測を割り当てる。
Across 200は5つの構成と3つのモデルファミリで動作し、4つのレポート構成は12,249の自己レポートを生成する。
信頼度は校正され、継承された合理的性は後続の提案に影響を及ぼし、フィットネスベースの選択はレポートの品質を改善する。
3回とも失敗。
オペレーターはトップ100の成功を4.8から9.3の要因で誇張し、キャリブレーションと差別はモデルファミリー間で解離している。
754の有理数に対する制御された介入は、真の有理数のあらゆる測定された利益をおよそ250の階級に制限した。
適合性に基づく選択もランダムな選択も、調査行動が著しく異なるにもかかわらず、レポートの正確さで検出可能な選択差や親子間伝達を生成しない。
したがって、エージェントの自己報告は、自分たちの信頼性の証拠としてではなく、環境に対する検証のクレームとして扱われるべきである。
関連論文リスト
- Admission Without Answers: Label-Free Certification and Experience Learning for LLM-Based Optimization Modeling [8.467936416935986]
Admitorは、校正された外部行動証拠に基づいて構築された入場ゲートである。
これは、明確に校正された偽発見ターゲットを中心に設計された最初のラベルなし入場機構である。
論文 参考訳(メタデータ) (2026-08-16T06:18:54Z) - Two Regimes of Chain-of-Thought Unfaithfulness: Behavioral Detection Fails Where Models Are Wrong [1.2744523252873352]
ブラックボックス(行動)によるFaithCoT-Benchの人間のアノテーションに対する不誠実なCoTの検出。
答えの正しさはあらゆるレベルで問題を構成する。
論文 参考訳(メタデータ) (2026-07-26T04:43:53Z) - Fantastic Adaptive Taxonomies and How to Use Them [100.20614173157708]
AdaMASTは、実行トレースをコンパクトでエビデンスに基づく障害分類に変換する。
コードには手書きのコードはなく、人間による注釈もない。
エージェント・システム・サーチでは、失敗候補の分類コード診断が自由形式より優れている。
論文 参考訳(メタデータ) (2026-07-17T17:41:16Z) - What Single-Prompt Accuracy Misses: A Multi-Variant Reliability Audit of Language Models [0.0]
シングルプロンプト精度は、言語モデルをベンチマークする主要な方法であるが、重要な信頼性障害を見逃す可能性がある。
15モデルオープンウェイトコーパスの評価を行い,5つの分類と推論ベンチマークによる10のインストラクトモデルに着目した信頼性解析を行った。
まず、評価設計は結論を根本的に変えることができる。
第2に、信頼信号は脆弱である。MMLU-Proでは、各プライマリモデルは、その精度と同一行上のトークン確率信頼の両方よりもかなり高い信頼度を言語的に報告し、単一のプロンプト変種における単一のモデルに対して、動詞のパースレートが崩壊する可能性がある。
論文 参考訳(メタデータ) (2026-05-03T20:05:08Z) - Pando: Do Interpretability Methods Work When Models Won't Explain Themselves? [53.07826484214082]
モデル・オーガニゼーションのベンチマークであるPandoを紹介します。
Pandoは、ラベル付きクエリ-レスポンスペアから、ホールドアウトモデル決定を予測する。
説明が忠実であれば、ブラックボックスの引用はすべてのホワイトボックスメソッドに一致するか、超える。
論文 参考訳(メタデータ) (2026-04-13T06:42:24Z) - Claw-Eval: Toward Trustworthy Evaluation of Autonomous Agents [66.97968363332465]
エージェントベンチマークの3つのギャップに対処するエンドツーエンド評価スイートであるClaw-Evalを紹介した。
Claw-Evalは3つのグループにまたがる9つのカテゴリにまたがる300の人間検証タスクで構成されている。
すべてのエージェントアクションは、3つの独立したエビデンスチャネルを通じて記録される。
論文 参考訳(メタデータ) (2026-04-07T17:43:18Z) - ClawArena: Benchmarking AI Agents in Evolving Information Environments [61.664633997138004]
ClawArenaは、進化する情報環境におけるAIエージェントの評価のためのベンチマークである。
それぞれのシナリオは、エージェントをノイズ、部分的、時には矛盾するトレースだけに露呈しながら、完全に隠された地上の真実を維持します。
評価は、マルチソースコンフリクト推論、動的信念修正、暗黙のパーソナライゼーションという3つの複合的な課題に基づいて構成される。
論文 参考訳(メタデータ) (2026-04-05T17:55:23Z) - Correct Answers from Sound Reasoning: Verifiable Process Supervision for Language Models [94.68358825189738]
本稿では,予測精度と推論品質を協調的に最適化する検証済み領域の学習後フレームワークを提案する。
我々は,エンジン信号に対して推論ステップを確定的に検証できる制御テストベッドであるチェスのVPSを評価する。
VPSは、推論品質を著しく向上させながら精度を保ち、勝利率エラーを最大30%削減し、一貫性をほぼ飽和状態に回復する。
論文 参考訳(メタデータ) (2026-04-03T15:19:46Z) - Epistemic Observability in Language Models [0.0]
製造時に高い信頼性を報告できるモデルがあることがわかりました。
正式な仮定では、これは能力ギャップではなく観察的なギャップである。
我々は,計算副産物を輸出することで不合理性から逃れるテンソルインタフェースを構築した。
論文 参考訳(メタデータ) (2026-03-20T21:59:34Z) - CoVerRL: Breaking the Consensus Trap in Label-Free Reasoning via Generator-Verifier Co-Evolution [52.691495954442985]
CoVerRLは1つのモデルがジェネレータと検証ロールを交換するフレームワークで、各機能が他方をブートストラップする。
Qwen と Llama のモデルファミリーでの実験では、CoVerRL は数理推論のベンチマークで4.7-5.9% でラベルなしのベースラインを上回っている。
自己検証の精度は55%から85%以上改善され、両方の能力が真に共存することを確認した。
論文 参考訳(メタデータ) (2026-03-18T14:38:55Z) - Replayable Financial Agents: A Determinism-Faithfulness Assurance Harness for Tool-Using LLM Agents [0.7699235580548228]
LLMエージェントは、規制監査のリプレイに苦労する: トランザクションフラグ付き決定を同じ入力で再現するように要求された場合、ほとんどのデプロイメントは一貫性のある結果を返すことができません。
本稿では,金融サービスに展開するツール利用エージェントにおけるトラジェクティブ決定性およびエビデンス条件の忠実度を測定するためのフレームワークであるDFAHを紹介する。
論文 参考訳(メタデータ) (2026-01-17T19:47:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。