論文の概要: Mechanizing the User's Eye: Pre-Registered Deployment of a Sabotage-Validated Fail-Plausible Observer in a Production LLM Agent Runtime
- arxiv url: http://arxiv.org/abs/2610.05981v1
- Date: Mon, 05 Oct 2026 08:34:18 GMT
- ステータス: 情報取得中
- システム内更新日: 2026-10-06 21:47:40.775091
- Title: Mechanizing the User's Eye: Pre-Registered Deployment of a Sabotage-Validated Fail-Plausible Observer in a Production LLM Agent Runtime
- Title(参考訳): ユーザの視線を機械化する: 生産型LLMエージェントのサボタージュバリデーション型フェールプラッシブルオブザーバの事前登録
- Abstract要約: 生産LLMエージェントランタイムにおけるサイレント障害の事前の縦断調査では、ユーザとして製品を見ている人間によって約70%が発見された。
私たちは、最も危険な、フェール宣言可能な失敗をターゲットとした、自動化されたユーザ視点オブザーバを構築しました。
- 参考スコア(独自算出の注目度): 4.56904471801595
- License:
- Abstract: A prior longitudinal study of silent failures in a production LLM agent runtime (arXiv:2606.14589) found that about 70% were discovered by a human looking at the product as a user while thousands of tests and governance checks stayed green, and posed mechanizing part of what the human eye does as an open problem. This paper reports our attempt. We built an automated user-viewpoint observer targeting the most dangerous class, fail-plausible failure, in which an internal error becomes fluent, plausible output to the user. It is a two-layer pipeline: five deterministic signals distilled from incident postmortems escalate to an LLM judge whose verdicts must cite verbatim evidence or be discarded. Ground truth is 24 labeled production postmortems with explicit honesty boundaries: 16 of 24 are structurally invisible to any content-reading observer, and we say so. Offline, the deterministic layer achieves 6/6 regression detection with 0/4 false positives, each detector proven load-bearing by sabotage; held-out recall on novel patterns is 0/4. It is, so far, a regression engine. Deployment followed pre-registration: shadow mode caught and retired one systematic false positive on its first run, the 26-day shadow window then ran clean, flip criteria were fixed before the shadow data was read, and the analysis protocol was frozen before the enforcing-mode window opened. That window (12 observed days) fired zero verdicts; per the pre-registered path we report live precision as undefined rather than narrating quiet as success. The observer also produced ten silent failures of its own, confirming that the judge inherits the taxonomy it judges. We release the corpus, detector, and scorecard as a runnable bench: mechanization today retires the human's regression scanning so the eye can specialize in novelty; prediction remains open but is now measurable under frozen rules.
- Abstract(参考訳): 生産LLMエージェントランタイム(arXiv:2606.14589)におけるサイレント障害の先行調査では、何千ものテストとガバナンスチェックが緑のままであり、人間の目がオープンな問題として何をするかを機械化している間に、約70%がユーザーとして製品を見ている人間によって発見された。
本稿は我々の試みを報告する。
我々は、最も危険な、フェール証明可能な失敗をターゲットとした、自動化されたユーザ視点オブザーバを構築した。
インシデント後から抽出された5つの決定論的信号は、評決が口頭弁論的な証拠を引用するか、破棄されなければならないLLM判事にエスカレートされる。
24の内16は、どんなコンテンツを読む観察者にも構造的に見えず、我々はそう言っている。
オフラインにおいて、決定論的層は、0/4の偽陽性で6/6の回帰検出を達成し、各検出器はサボタージュにより負荷増大を証明し、新規パターンの保留リコールは0/4である。
今のところは回帰エンジンです。
26日間のシャドウウィンドウはクリーンに、フリップ基準はシャドウデータが読まれる前に修正され、解析プロトコルは強制モードウィンドウが開く前に凍結された。
事前登録されたパスでは、ライブの正確さは成功として静かに語るのではなく、未定義であると報告しています。
観察者はまた、裁判官が判断する分類を継承することを確認するために、それ自身で10の静かな失敗を生んだ。
現在、機械化は人間の回帰スキャンを引退させ、目がノベルティを専門化できるようにしている。
関連論文リスト
- Opening LLM Judges: Recovering Preference Signals Beyond the Final Verdict [16.03390601181823]
判断が間違っている場合、正しく判断するために必要な情報はモデルから外れているか、内部表現に存在しているが出力に反映されていないか?
41名の裁判官に対する因果的介入を含む,64名のオープンウェイト評価者と14名のデータセットを対象に,これについて検討した。
論文 参考訳(メタデータ) (2026-09-26T09:26:36Z) - Clean Engineering, Unstable Measurement: A Preregistered Reliability Failure of Black-Box LLM Observers on Shared Endpoints [4.41537705949485]
言語モデル審査員は、トレーニングデータをゲートし、世代をスコアし、リーダーボードを駆動する。
我々は、事前登録された2つのキャンペーンにおいて、すべてのしきい値が事前に固定された状態で、その仮定を監査した。
52,988件の要求を監査し、スピアマン0.400で0.90と一致した。
証拠を3段階のスナップショット識別はしご、8つの設計ルール、レポートチェックリストに抽出する。
論文 参考訳(メタデータ) (2026-09-03T17:59:43Z) - VeriPhy: Agentic Physical Reasoning for World Model Evaluation and Refinement [57.86962208273888]
テキストのみのプランナが入力された物理義務にプロンプトをコンパイルする監査可能な物理検証システムを提案する。
それぞれのアクションは、ペイロードがタイプされた測定か、明示的にタグ付けされた学習状態である証明付きエビデンスレコードを返す。
我々は, 実発生障害を即時参照, 空間, 時間でローカライズする, 1500クリックの欠陥記録のコーパスにおいて, 評価をアンロックする。
論文 参考訳(メタデータ) (2026-09-02T20:36:45Z) - Prior Audit-Repair Context Shifts LLM Verifier Thresholds Toward Leniency [0.025718125188898048]
我々は,現時点のタスクを個別に保持するプロセスベンチトレースに対して,擬似アラームを計測する。
完了した監査 -> モデルのコンテキストにすでにある修復エピソードは、15のモデルxワードの組み合わせのうち15の偽のアラームを低くする。
論文 参考訳(メタデータ) (2026-08-17T01:41:43Z) - Zero Hallucination, by Construction: Hallucination-Aware Layered Oversight for Trustworthy Enterprise AI [39.17006317116773]
我々は、「ゼロ幻覚」はモデルが持つ性質ではなく、システムが強制する性質であると主張する。
本稿では,幻覚を最小限の障害モードではなく,持続可能な障害モードとして扱う保証アーキテクチャであるHALOを提案する。
論文 参考訳(メタデータ) (2026-07-20T12:34:44Z) - Abliteration Is Not a Scalpel: Off-Target Effects of Refusal Removal on Decision Disposition Across Model Families [51.56484100374058]
放棄 — モデルの拒絶方向を重みから取り除く — は、一般的な"アンセンソルド"なオープンウェイトモデルの標準的なレシピである。
ディスポジションプローブとして21,600個の決定を不確実性の下で使用し、凍結パイプラインを通じて再生することにより、決定層モデルが唯一の変数となる。
3つのエフェクトは2つのファミリーにまたがって複製される(ゼロを除く週間クラスターCI)
4つ目の効果は符号を逆転する:同じ操作によりGemmaで読み取られた方が自信が弱まり、Qwenで読み取られたものがより多くなる(ファミリーCIは重複しない)。
論文 参考訳(メタデータ) (2026-07-19T22:27:00Z) - When Errors Become Narratives: A Longitudinal Taxonomy of Silent Failures in a Production LLM Agent Runtime [4.56904471801595]
2026年3月以降の連続生産におけるパーソナルエージェントランタイムにおけるサイレント障害の経時的観察を行った。
症例は22例, 完全根因性後遺症で, メタパターンは28回以上出現した。
我々は, (A) 環境, プラットフォーム構造, (B) 設計・評価ミスマッチ, (C) 誤飲・希釈, (D) 連鎖幻覚・製造, (E) 運用停止, 法医学的盲点の5種類の分類を導出する。
論文 参考訳(メタデータ) (2026-06-12T16:06:55Z) - Catching One in Five: LLM-as-Judge Blind Spots in Production Multi-Turn Transaction Agents [45.148328075418156]
デプロイされた多ターン食品・飲料注文エージェントについて検討し,実際の品質問題の数を測定した。
私たちの盲点分類は、失敗はランダムではなく構造化されていることを示している。
プロダクションマルチターンエージェントでは、自動判断はリグレッションフロアであり、人間のレビューの代わりにはならない。
論文 参考訳(メタデータ) (2026-06-09T02:11:01Z) - Can Humans Tell? A Dual-Axis Study of Human Perception of LLM-Generated News [47.03825808787752]
人間は、ニュース記事が人によって書かれたか、あるいは大きな言語モデル(LLM)によって書かれたかを知ることができますか?
本稿では,人間対機械(人間対機械)と正当性判定(正当性対偽判定)を連続的なスケールで測定する研究プラットフォームであるJiceGPTを用いて,この問題を考察する。
筆者らは,(1) 被験者が人文テキストから機械生成物を確実に識別できないこと,(2) 認知疲労による約30回の連続的な評価の後,その精度が低下すること,の5つを報告した。
論文 参考訳(メタデータ) (2026-04-04T15:03:42Z) - A Coin Flip for Safety: LLM Judges Fail to Reliably Measure Adversarial Robustness [57.510025257780306]
既存の検証プロトコルは、レッドチーム固有の分散シフトを考慮できないことを示す。
我々は、より一貫して判断可能な振る舞いのベンチマークであるReliableBenchと、判断失敗を公開するために設計されたデータセットであるJiceStressTestを提案する。
論文 参考訳(メタデータ) (2026-02-04T15:13:35Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。