論文の概要: Compaction as Epistemic Failure: How Agentic LLM Tools Fabricate Confirmed Results from Killed Processes
- arxiv url: http://arxiv.org/abs/2607.13071v1
- Date: Sat, 11 Jul 2026 07:45:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-16 16:39:12.518999
- Title: Compaction as Epistemic Failure: How Agentic LLM Tools Fabricate Confirmed Results from Killed Processes
- Title(参考訳): てんかん性不全としてのコンパクト化 : 治療用LDMツールが致死過程の結果をどのように確認したか
- Abstract要約: 本稿では、タイムアウトコマンド(排他コード143)からの部分標準出力が、確認された結果として圧縮要約に記録されるクロードコードにおいて、障害モードを文書化する。
根底にあるメカニズムは、観測と永続化の融合であり、端末に現れた情報は、耐久性のある記憶に書き込まれた情報と同等のものとして扱われる。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Agentic LLM coding tools compress long session histories into compaction summaries that subsequent sessions inherit as ground truth. This paper documents a failure mode in Claude Code where partial standard output from timed-out commands (exit code 143) is recorded in compaction summaries as confirmed results, propagating false positives across sessions and model versions without re-verification. The underlying mechanism is a conflation of observation and persistence, where information that appeared in the terminal is treated as equivalent to information written to durable storage. This finding extends the analysis of LLM self-evaluation failures reported in prior work on non-determinism in LLM-as-judge grading by showing that agentic tools exhibit analogous reliability deficits when reporting on their own operational outcomes. The failure has direct implications for any workflow that relies on agentic session continuity for data processing, scientific computation, or multi-step automation.
- Abstract(参考訳): エージェントLDM符号化ツールは、長いセッション履歴を圧縮サマリーに圧縮し、その後のセッションは基礎的な真実として継承する。
本稿では,時間外コマンドからの標準出力の一部が確認結果として圧縮要約に記録され,セッションやモデルバージョン間で偽陽性が再検証されずに伝播されるClaude Codeのフェールモードを文書化する。
根底にあるメカニズムは、観測と永続化の融合であり、端末に現れた情報は、耐久性のある記憶に書き込まれた情報と同等のものとして扱われる。
この発見は, LLM-as-judge グレーディングにおける非決定性に関する先行研究で報告された自己評価失敗の分析を拡張し, エージェントツールが自身の運用成果を報告する際に, 類似した信頼性欠陥を示すことを示した。
この失敗は、データ処理、科学計算、マルチステップ自動化のエージェントセッション継続性に依存するワークフローに直接的な意味を持つ。
関連論文リスト
- Automata from Agent Traces: Failure and Next-Step Prediction [1.16693435589939]
トレースコーパス全体を1つのコンパクト有限状態機械 (FSM) に分解し, LLM エージェントの挙動のための構造基板として機能する。
障害予測では、州ごとの行動特徴がAUROCで最大0.94まで到達し、オンラインのモニターが失敗点を通過点より上回っている。
論文 参考訳(メタデータ) (2026-08-24T17:58:01Z) - From Sequence to Structure: Relational Uncertainty Propagation for LLM Agents [75.69180947909148]
大規模言語モデル(LLM)エージェントのためのトラジェクトリレベルのUQフレームワークを提案する。
RuPAは、推論状態、ツールインタラクション、環境フィードバックが時間的およびセマンティックな依存関係エッジで接続されたノードである、指向的なトラジェクトリグラフとして実行履歴を表現している。
我々は,複数のモデルファミリにまたがる6つのオープンソースLCMを用いて,代用エージェントベンチマーク($2, Terminal-Bench-2, GAIA)でRUPAを評価した。
論文 参考訳(メタデータ) (2026-08-17T01:40:14Z) - A Mechanistic Lens on Semantic Conflicts: Using Activation Patching to Understand LLM Behavior [7.506391522879222]
本稿では,意味的対立の下での大規模言語モデル(LLM)の振る舞いについて,制御された最初の機械論的研究を示す。
本研究では,2つのタスク(アウトプット予測と単体テスト生成)における4つのオープンウェイトLLMを評価する。
以上の結果から,セマンティックコンフリクトが両タスクの実行地上精度を大幅に低下させることが示唆された。
論文 参考訳(メタデータ) (2026-07-06T19:35:04Z) - Constraint Tax in Open-Weight LLMs: An Empirical Study of Tool Calling Suppression Under Structured Output Constraints [37.92327096151557]
本稿では,生産エージェントシステムで観測された再現可能な現象について報告する。
複数のオープンウェイトモデルでは、高いスキーマ準拠を維持しながら、ツールの起動を中止している。
本稿では,スキーマ制約された応答生成からツールの実行を分離する推論時間戦略であるTransparent Two-Executionを提案する。
論文 参考訳(メタデータ) (2026-06-24T09:14:18Z) - LiveFMBench: Unveiling the Power and Limits of Agentic Workflows in Specification Generation [75.05397479715576]
大規模言語モデル(LLM)とエージェントは有望な進歩を示しているが、その真の能力と失敗モードは未だ不明である。
CプログラムのためのLCMおよびエージェントベースの形式仕様生成に関する、最初の体系的および汚染に配慮した研究を提案する。
論文 参考訳(メタデータ) (2026-05-02T11:31:33Z) - Diagnosing Structural Failures in LLM-Based Evidence Extraction for Meta-Analysis [0.8193467416247519]
レビューとメタ分析は、物語を構造化され、数値化された研究記録に変換することに頼っている。
大規模言語モデル(LLM)の急速な進歩にもかかわらず、このプロセスの構造的要件を満たすことができるかどうかは不明だ。
本稿では,LLMに基づくエビデンス抽出をスキーマ制約クエリの進行として評価する構造的診断フレームワークを提案する。
論文 参考訳(メタデータ) (2026-02-11T14:09:43Z) - The Bitter Lesson of Diffusion Language Models for Agentic Workflows: A Comprehensive Reality Check [54.08619694620588]
本稿では,2つの異なるエージェントパラダイムであるEmbodied AgentsとTool-Calling AgentsにまたがるdLLMの包括的評価を行う。
Agentboard と BFCL では,現在の dLLM が信頼できるエージェントバックボーンとして機能しないという,"ビットレッスン" が報告されている。
論文 参考訳(メタデータ) (2026-01-19T11:45:39Z) - TS-Agent: A Time Series Reasoning Agent with Iterative Statistical Insight Gathering [16.95452463476229]
大規模言語モデル(LLM)のための時系列推論エージェントTS-Agentを提案する。
時系列をテキストトークン、画像、埋め込みにマッピングする代わりに、我々のエージェントは原子演算子を介して生の数値列と相互作用する。
実験の結果,TS-Agent は理解ベンチマークの最先端 LLM に匹敵する性能を達成できた。
論文 参考訳(メタデータ) (2025-10-08T18:31:53Z) - When the Code Autopilot Breaks: Why LLMs Falter in Embedded Machine Learning [0.8880611506199766]
我々は、形式、モデル行動、構造的仮定が成功率と失敗特性の両方にどのように影響するかを示す。
私たちの分析では、フォーマットによる誤解釈や、コンパイルされるが下流で壊れる実行時ディスラプティブコードなど、さまざまなエラーが発生しやすい挙動を明らかにしています。
論文 参考訳(メタデータ) (2025-09-13T19:00:04Z) - IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis [60.32962597618861]
IDA-Benchは、多ラウンドの対話シナリオで大規模言語モデルを評価する新しいベンチマークである。
エージェント性能は、最終的な数値出力と人間由来のベースラインを比較して判断する。
最先端のコーディングエージェント(Claude-3.7-thinkingなど)でさえ50%のタスクを成功させ、シングルターンテストでは明らかでない制限を強調している。
論文 参考訳(メタデータ) (2025-05-23T09:37:52Z) - ReEval: Automatic Hallucination Evaluation for Retrieval-Augmented Large Language Models via Transferable Adversarial Attacks [91.55895047448249]
本稿では,LLMベースのフレームワークであるReEvalについて述べる。
本稿では、ChatGPTを用いてReEvalを実装し、2つの人気のあるオープンドメインQAデータセットのバリエーションを評価する。
我々の生成したデータは人間可読であり、大きな言語モデルで幻覚を引き起こすのに役立ちます。
論文 参考訳(メタデータ) (2023-10-19T06:37:32Z) - Assessing the Reliability of Large Language Model Knowledge [78.38870272050106]
大規模言語モデル(LLM)は、知識探索タスクにおける高い性能のため、知識ベースとして扱われてきた。
LLMが実際に正しい答えを連続的に生成する能力をどのように評価するか。
LLMの信頼性を直接測定するための新しい指標であるMOdel kNowledge relIabiliTy score (MONITOR)を提案する。
論文 参考訳(メタデータ) (2023-10-15T12:40:30Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。