論文の概要: SAEScientist-Bench: Can AI Agents Conduct Autonomous SAE Interpretability Research?
- arxiv url: http://arxiv.org/abs/2609.09113v2
- Date: Fri, 11 Sep 2026 04:21:12 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-15 07:38:31.454621
- Title: SAEScientist-Bench: Can AI Agents Conduct Autonomous SAE Interpretability Research?
- Title(参考訳): SAEScientist-Bench: AIエージェントは自律的なSAE解釈可能性の研究を実行できるか?
- Authors: Yuqiao Tan, Shizhu He, Jun Zhao, Kang Liu,
- Abstract要約: 我々はSAEScientist-Benchを導入し、AIエージェントがSAEツールを利用して自律的な機械的発見を行うことができるかどうかを評価する。
ターゲット概念が与えられた場合、エージェントはコントラストプローブを設計し、最適な特徴を発見するために131K以上の特徴のGemma Scope辞書をナビゲートする。
10のエージェント構成と20のタスクにまたがって、フロンティアエージェントは真の発見能力を示すが、エキスパートベースラインのかなり後方にある。
- 参考スコア(独自算出の注目度): 26.940600916534446
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: While research on recursive self-improvement (RSI) has predominantly automated model training pipelines, reliable autonomous development demands a missing pillar: post-hoc monitoring and auditing to understand what models learn and ensure safe alignment. Mechanistic interpretability tools are essential to bridge this gap, among which Sparse Autoencoders (SAEs) serve as a cornerstone by isolating interpretable features for model inspection and steering. In this paper, we introduce SAEScientist-Bench to evaluate whether AI agents can act as scientists utilizing SAE tools for autonomous mechanistic discovery. Given a target concept, an agent designs contrastive probes and navigates a Gemma Scope dictionary of 131K+ features in Gemma-2-9B-IT to discover the optimal feature, evaluated against curated expert reference features anchored on Neuronpedia across activation rank, concept selectivity on contrastive texts, and causal steering. Across 10 agent configurations and 20 tasks, frontier agents demonstrate genuine discovery capabilities and lead different evaluation dimensions, but remain well behind the expert baseline, approaching expert levels on separating target concepts from contrastive controls while lagging substantially in causal generation steering. Further analysis reveals that although agents can design contrasts to rule out spurious candidates, they frequently misinterpret experimental measurements. These results establish experimental model understanding as a measurable capability for closed-loop autonomous AI R&D. Our code is available at https://github.com/Trae1ounG/SAEScientist.
- Abstract(参考訳): 再帰的自己改善(RSI)の研究は、主にモデルトレーニングパイプラインを自動化しているが、信頼性の高い自律開発には欠落する柱が必要だ。
Sparse Autoencoders (SAEs) は、モデル検査とステアリングのための解釈可能な機能を分離することで、基盤となる。
本稿では,SAEScientist-Benchを用いて,AIエージェントがSAEツールを用いて自律的な機械的発見を行うことができるかどうかを評価する。
ターゲット概念が与えられた場合、エージェントは、比較プローブを設計し、Gemma-2-9B-ITの131K+特徴のGemma Scope辞書をナビゲートし、最適な特徴を発見する。
10のエージェント構成と20のタスクで、フロンティアエージェントは真の発見能力を示し、異なる評価次元を導くが、専門家のベースラインの後方に留まり、対照的なコントロールからターゲット概念を分離する専門家レベルに近づいている。
さらに分析した結果、エージェントは素早い候補を除外するためにコントラストを設計できるが、しばしば実験的な測定を誤って解釈することがわかった。
これらの結果は、クローズドループ自律型AIR&Dのための測定可能な能力として実験モデル理解を確立する。
私たちのコードはhttps://github.com/Trae1ounG/SAEScientist.comで公開されています。
関連論文リスト
- From Knowing to Acting: Benchmarking Self-Awareness Capability of LLM Agents [69.07911499189129]
エージェントのメタ認知判断(Knowing)を自発的実行(Acting)から切り離して認知行動アライメントを評価するフレームワークであるKAPROを紹介する。
実験の結果,自己認識能力はタスク成功と強く相関するが,内部能力設定では著しく低下することがわかった。
プロプライエタリで推論指向のモデルは、より信頼性の高い認知ゲーティングを示します。
論文 参考訳(メタデータ) (2026-06-09T17:17:08Z) - Qwen-Scope: Turning Sparse Features into Development Tools for Large Language Models [80.45129499188461]
我々はQwenモデルファミリ上に構築されたスパースオートエンコーダ(SAE)のオープンソーススイートであるQwen-Scopeを紹介する。
SAEはポストホック解析を超越して,4方向のモデル開発のための実用的なインターフェースとして機能することを示す。
論文 参考訳(メタデータ) (2026-05-12T10:01:06Z) - Taming Actor-Observer Asymmetry in Agents via Dialectical Alignment [59.536125286960186]
セルフリフレクションと相互監査を可能にするために、専門的な役割を割り当てるマルチエージェントフレームワークがますます採用されている。
アクター・オブザーバ非対称性(Actor-Observer Asymmetric)と呼ばれる認知バイアスを同時に誘発する。
ReTASは、対立する視点を客観的なコンセンサスに合成するためにエージェントを誘導する。
論文 参考訳(メタデータ) (2026-04-21T15:05:58Z) - When the Coffee Feature Activates on Coffins: An Analysis of Feature Extraction and Steering for Mechanistic Interpretability [0.0]
機械的解釈可能性に関する人類学の最近の研究は、大規模言語モデルを理解し制御することを主張している。
我々は、Llama 3.1のオープンソースSAEで主要な結果を複製することで、これらの主張の最初のストレステストを行う。
機能ステアリングは, 層選択, ステアリングサイズ, コンテキストに敏感で, かなり脆弱であることがわかった。
論文 参考訳(メタデータ) (2026-01-06T14:29:51Z) - The Geometry of Benchmarks: A New Path Toward AGI [0.0]
本稿では,AIエージェントのすべての心理測定バッテリーを,構造化されたモジュライ空間の点として扱う幾何学的枠組みを提案する。
まず、測定可能なパフォーマンスに基づいて、Kardashevスタイルの自律性階層であるAutonomous AI(AAI)スケールを定義します。
第二に、バッテリーのモジュライ空間を構築し、エージェントの順序や能力推定のレベルで区別できないベンチマークの等価クラスを特定する。
第3に、強化学習、自己再生、討論、検証に基づく微調整を前提としたジェネラルジェネレータ-検証更新演算子(GVU)を導入する。
論文 参考訳(メタデータ) (2025-12-03T21:34:09Z) - Impatient Users Confuse AI Agents: High-fidelity Simulations of Human Traits for Testing Agents [58.00130492861884]
TraitBasisは、AIエージェントを体系的にストレステストするための軽量でモデルに依存しない方法である。
TraitBasisは、ステアブルなユーザ特性に対応するアクティベーション空間で方向を学習する。
We observed on average a 2%-30% performance degradation on $tau$-Trait across frontier model。
論文 参考訳(メタデータ) (2025-10-06T05:03:57Z) - AgentThink: A Unified Framework for Tool-Augmented Chain-of-Thought Reasoning in Vision-Language Models for Autonomous Driving [31.127210974372456]
VLM(Vision-Language Models)は、自律走行を約束するが、幻覚、非効率な推論、限られた実世界の検証は、正確な知覚と堅牢なステップバイステップ推論を妨げる。
我々は、Chain-of-Thought(CoT)推論と、自律運転タスクのための動的エージェントスタイルのツール呼び出しを統合した、先駆的な統合フレームワークであるtextbfAgentThinkを紹介した。
論文 参考訳(メタデータ) (2025-05-21T09:27:43Z) - Interactive Autonomous Navigation with Internal State Inference and
Interactivity Estimation [58.21683603243387]
本稿では,関係時間的推論を伴う3つの補助的タスクを提案し,それらを標準のディープラーニングフレームワークに統合する。
これらの補助的なタスクは、他の対話的エージェントの行動パターンを推測するための追加の監視信号を提供する。
提案手法は,標準評価指標の観点から,頑健かつ最先端のパフォーマンスを実現する。
論文 参考訳(メタデータ) (2023-11-27T18:57:42Z) - RCAgent: Cloud Root Cause Analysis by Autonomous Agents with Tool-Augmented Large Language Models [46.476439550746136]
近年,クラウド根本原因分析(RCA)における言語モデル (LLM) の適用が活発に検討されている。
RCAgentは、実用的でプライバシに配慮した産業RCA利用のためのツール強化LDM自律エージェントフレームワークである。
RCAgentはGPTファミリではなく、内部的にデプロイされたモデル上で動作し、フリーフォームのデータ収集とツールによる包括的な分析を行うことができる。
論文 参考訳(メタデータ) (2023-10-25T03:53:31Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。