論文の概要: ObserverBench: Testing Mechanistic Estimates for Intervention and Control
- arxiv url: http://arxiv.org/abs/2609.03026v1
- Date: Wed, 02 Sep 2026 18:01:17 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-04 18:28:38.820769
- Title: ObserverBench: Testing Mechanistic Estimates for Intervention and Control
- Title(参考訳): ObserverBench: 介入と制御のためのメカニスティック見積をテストする
- Abstract要約: 機械的解釈可能性(Mechanistic interpretability)は、活性化ステアリング、回路除去、安全監視などの介入を導くためにますます用いられる。
ObserverBenchは、内部推定器が、それが指示する介入、制御、安全タスクに適切かどうかをテストするためのベンチマークフレームワークである。
ベンチマークは、選択された動作による損失とは別途、推定精度を報告する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Mechanistic interpretability is increasingly used to guide interventions such as activation steering, circuit removal, and safety monitoring. Yet an internal estimate that is accurate on average can still choose a poor action. We present ObserverBench, a benchmark framework for testing whether an internal estimator---an observer---is adequate for the intervention, control, or safety task it directs. Each task fixes the model, information boundary, allowed actions, decision rule, held-out cases, and loss. The benchmark reports estimation accuracy separately from the loss caused by the chosen action. Theory and experiments show why both are needed. In closed-loop control, observer errors matter at the starting point and along directions the allowed intervention can reach. On circuit-intervention tasks in GPT-2-small and Qwen2.5-7B, pairwise observers predict unseen effects more accurately without always choosing better actions; observers trained on action loss choose lower-loss actions. In safety triage, a score that perfectly separates violations can allocate a fixed intervention budget poorly when violations have different costs. Across Qwen2.5-7B, Gemma-2-9B-it, and prospectively frozen Qwen3.5-9B APPS tasks, AUROC can rank monitors differently from deployment loss, and the best information source changes across models. Sparse SAE readouts also trail their layer-matched dense controls on the reported Qwen panels, under disclosed activation-density or checkpoint mismatches. ObserverBench provides fixed task contracts, runnable baselines, and table-based submissions for evaluating interpretability methods through the actions they enable.
- Abstract(参考訳): 機械的解釈可能性(Mechanistic interpretability)は、活性化ステアリング、回路除去、安全監視などの介入を導くためにますます用いられる。
しかし、平均的に正確である内部見積は、依然として貧弱な行動を選択することができる。
我々は、内部推定器(オブザーバ)が指示する介入、制御、安全タスクに適しているかどうかをテストするためのベンチマークフレームワークであるObserverBenchを紹介する。
各タスクはモデル、情報境界、許容されたアクション、決定ルール、ホールドアウトケース、損失を修正します。
ベンチマークは、選択された動作による損失とは別途、推定精度を報告する。
理論と実験は、両方が必要な理由を示している。
クローズドループ制御では、オブザーバは開始点と許可された介入が到達できる方向で重要なエラーを発生させる。
GPT-2-smallとQwen2.5-7Bの回路干渉タスクでは、ペアワイドオブザーバーは、常により良いアクションを選択することなく、より正確に見えない効果を予測する。
安全トリアージでは、違反を完全に分離するスコアは、違反のコストが異なる場合、固定された介入予算を低く割り当てることができる。
Qwen2.5-7B、Gemma-2-9B-it、そして予想通り凍結されたQwen3.5-9B APPSタスクを通して、AUROCは、配置損失と、モデル間で最高の情報ソースの変更をモニターにランク付けすることができる。
スパースSAEの読み出しは、アクティベーション密度やチェックポイントミスマッチを公表し、報告されたQwenパネルの層が密集した制御を追及する。
ObserverBenchは、固定されたタスクコントラクト、実行可能なベースライン、テーブルベースのサブミッションを提供して、それらを可能にするアクションを通じて解釈可能性メソッドを評価する。
関連論文リスト
- Calibration is the Bottleneck: An Action-Class Diagnostic of Multi-Turn Tool-Calling [65.03665015319457]
本稿では,マルチターン障害を2つのモードに分解するアクションクラス指向診断フレームワークを提案する。
複数のマルチターンベンチマークにまたがるツールコールモデルのパネル上で検証を行う。
論文 参考訳(メタデータ) (2026-09-01T09:08:15Z) - The Intervention Gap in Latent World Models [0.0]
計画時介入の忠実さは、学習された世界モデルの際立った、測定可能な特性である。
リリースされたTD-MPC2チェックポイントサイズ全体で、タスクオブザーバのオペレータエラー診断が増加するにつれて、エピソードリターンが減少する。
タスク信号無しで訓練された自己教師付き世界モデルは、共有タスク上のタスク選択モデルよりもかなり優れた演算子を保存する。
論文 参考訳(メタデータ) (2026-08-30T19:47:51Z) - Chain-of-Thought Monitoring Can Be Unreliable in Implicit-Influence Settings [2.065887219290771]
CoT(Chain-of- Thought)モニタリングは、フロンティア推論モデルにとって重要な安全レイヤとして扱われる。
CoTモニタ評価の補完軸は暗黙的な影響設定であり、プロンプトには隠す命令がない。
2つの体制下でCoTの監視可能性を直接比較した最初のベンチマークを紹介する。
論文 参考訳(メタデータ) (2026-08-05T11:59:20Z) - Calibration Is Not Control: Why LLM-Agent Oversight Needs Intervention [14.376426170653707]
2つのトラジェクトリプレフィックスは、異なるアクションを必要とする間、同じリスク見積を持つことができる。
我々は、このミスマッチをターゲットエラーとして形式化し、介入の利点を特定する。
論文 参考訳(メタデータ) (2026-06-19T13:08:17Z) - CIAware-Bench: Benchmarking Control Intervention Awareness Across Frontier LLMs [100.38986535324284]
我々は、フロンティアモデル全体でのtextbfcontrol textbfintervention (CI) の認識を測定するベンチマークである textbfCIAware-Bench を紹介する。
CIAware-Benchは、モデルが自身の軌跡を制御介入によって修正されたものと区別できるかどうかをテストする。
論文 参考訳(メタデータ) (2026-06-09T16:24:16Z) - Agentic Control in Variational Language Models [0.0]
本研究では,変分言語モデルが,内的根拠に基づく最小かつ測定可能なエージェント制御をサポートできるかどうかを考察する。
本モデルでは, 局所変動隠蔽計算(EVE), ホメオスタティック潜伏制御器, 構造的に認識されたチェックポイント保持と, 保持モデル上で動作する校正不確実性認識コントローラを組み合わせる。
論文 参考訳(メタデータ) (2026-04-14T09:47:53Z) - When Actions Go Off-Task: Detecting and Correcting Misaligned Actions in Computer-Use Agents [50.5814495434565]
この研究は、コンピュータ利用エージェント(CUA)における不整合検出を定義し、研究する最初の試みである。
実世界のCUAデプロイメントにおける3つの一般的なカテゴリを特定し、人間の注釈付きアクションレベルのアライメントラベルを用いたリアルな軌跡のベンチマークであるMisActBenchを構築した。
本稿では,実行前に不整合を検知し,構造化されたフィードバックによって繰り返し修正する,実用的で普遍的なガードレールであるDeActionを提案する。
論文 参考訳(メタデータ) (2026-02-09T18:41:15Z) - A Granular Study of Safety Pretraining under Model Abliteration [64.24346997570275]
本稿では,リフレクションに敏感な方向を除去する軽量プロジェクション技術であるモデルアブリーブレーションについて検討する。
我々は、バランスのとれた有害かつ無害なケースで100のプロンプトを発行し、複数の判断を用いて**Refusal*または***Non-Refusal*として応答を分類し、判断の忠実さを検証する。
本研究は,データ中心の安全コンポーネントが失語中も頑健であるチェックポイントレベルの特徴付けを行う。
論文 参考訳(メタデータ) (2025-10-03T07:01:45Z) - Preemptive Detection and Correction of Misaligned Actions in LLM Agents [58.39520480675366]
InferActは、実行前に不整合アクションを検出する新しいアプローチである。
タイムリーな修正をユーザーに警告し、有害な結果を防ぐ。
InferActは、ミスアライメントされたアクション検出におけるベースラインに対するMarco-F1の最大20%の改善を実現している。
論文 参考訳(メタデータ) (2024-07-16T15:24:44Z) - Control-Aware Prediction Objectives for Autonomous Driving [78.19515972466063]
本研究では,制御に対する予測の下流効果を評価するための制御認識予測目標(CAPOs)を提案する。
本稿では,エージェント間の注意モデルを用いた重み付けと,予測軌跡を接地真実軌跡に交換する際の制御変動に基づく重み付けの2つの方法を提案する。
論文 参考訳(メタデータ) (2022-04-28T07:37:21Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。