論文の概要: Retrieval is Enough: Training-Free Interpretability with a Tool-Using Agent
- arxiv url: http://arxiv.org/abs/2607.16448v1
- Date: Fri, 17 Jul 2026 18:47:31 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-21 18:48:37.151198
- Title: Retrieval is Enough: Training-Free Interpretability with a Tool-Using Agent
- Title(参考訳): 検索は十分である: ツール・ユース・エージェントによる学習不要の解釈可能性
- Abstract要約: トレーニングベースのメソッドは、トレーニング中に大きなアクティベーションデータセットを活用するため、一般的にはより強力である。
これは自然な疑問を引き起こします – トレーニングデータセット自体から回復可能なもの以上の洞察を実際に提示するのでしょうか?
LLMエージェントに、アクティベーションを操作するツールとともに、テキストコンテキストと組み合わせたアクティベーションのベクトルデータベースを装備する。
エージェントはデータベースを反復的にクエリし、検索したサンプルから仮説を作成し、線形プローブを構築して検証する。
- 参考スコア(独自算出の注目度): 56.93673666934672
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Interpretability methods for neural network activations span a wide cost spectrum, from cheap, training-free techniques (such as linear probes, PCA, SVD) to more expensive training-based ones (such as SAEs and activation oracles). Training-based methods are typically more powerful, in part because they leverage large activation datasets during training. This raises a natural question - do they actually surface insights that go beyond what is recoverable from the training dataset itself? To address this, we equip an LLM agent with a vector database of activations paired with their textual contexts, along with tools for manipulating activations - projecting out directions in latent space, computing activation differences and averages. The agent iteratively queries the database, forms hypotheses from the retrieved samples, and validates them by constructing linear probes. We call this method HARP, for Hypothesis-driven Agentic Retrieval and Probing. Despite not involving any training, HARP outperforms both activation oracles and SAE-based agents on concept discovery, concept detection, model steering, and secret elicitation. The training-free design also makes HARP substantially cheaper and more flexible: new datasets can be indexed on demand whenever existing ones prove insufficient. More broadly, our results suggest that current training-based methods do not yet extract insights beyond their training data, and motivate benchmarks that explicitly require interpretability methods to demonstrate such insights. We release our code at https://github.com/SriramB-98/HARP
- Abstract(参考訳): ニューラルネットワークのアクティベーションの解釈方法は、安価でトレーニング不要な技術(リニアプローブ、PCA、SVDなど)から、より高価なトレーニングベース技術(SAEやアクティベーションオラクルなど)まで、幅広いコストスペクトルにまたがる。
トレーニングベースのメソッドは、トレーニング中に大きなアクティベーションデータセットを活用するため、一般的にはより強力である。
これは自然な疑問を引き起こします – トレーニングデータセット自体から回復可能なもの以上の洞察を実際に提示するのでしょうか?
これを解決するために, LLMエージェントに, テキストコンテキストと組み合わせたアクティベーションのベクトルデータベースと, アクティベーションを操作するツールを装備する。
エージェントはデータベースを反復的にクエリし、検索したサンプルから仮説を作成し、線形プローブを構築して検証する。
仮説駆動型エージェント検索と探索のために,この手法をHARPと呼ぶ。
HARPは、いかなる訓練も含まないにもかかわらず、概念発見、概念検出、モデルステアリング、シークレット・エリケーションにおいて、アクティベーション・オークルとSAEベースのエージェントの両方より優れている。
トレーニング不要の設計により、HARPは大幅に安くなり、柔軟性も向上する。
より広範に、我々の結果は、現在のトレーニングベースの手法が、トレーニングデータ以外の洞察をまだ抽出していないことを示唆し、そのような洞察を実証するために解釈可能性法を明示的に要求するベンチマークを動機付けている。
コードをhttps://github.com/SriramB-98/HARPでリリースします。
関連論文リスト
- Efficient Agentic Reinforcement Learning with On-Policy Intrinsic Knowledge Boundary Enhancement [16.192937389387982]
モデル固有の知識境界を動的に探索するオンライン手法であるAKBE(Agentic Knowledge boundary Enhancement)を提案する。
7つのQAベンチマークの実験では、AKBEはタスクの精度を平均で+1.85改善し、標準のエージェントRLよりも18%向上した。
論文 参考訳(メタデータ) (2026-05-26T12:42:23Z) - Data-Centric Interpretability for LLM-based Multi-Agent Reinforcement Learning [39.84288631342219]
フルストレス外交の高度環境から大規模強化学習訓練を実施する。
本稿では,SAE特徴をトレーニング力学に関する解釈可能な仮説にグループ化するメタオートインタプリタを紹介する。
私たちは、主観的に興味深く、一見有用なSAE機能でさえ、人間にとって役に立たないよりも悪いかもしれないことに気付きました。
論文 参考訳(メタデータ) (2026-02-05T01:21:22Z) - Investigating task-specific prompts and sparse autoencoders for activation monitoring [0.0]
言語モデルの内部アクティベーションは、これに役立つ追加情報をエンコードする。
最近の研究は、単純線形探索を改善するいくつかのアプローチを提案している。
我々は,これらの手法の新たな改良を開発し,検証し,比較する。
論文 参考訳(メタデータ) (2025-04-28T21:28:17Z) - Leveraging Skills from Unlabeled Prior Data for Efficient Online Exploration [54.8229698058649]
ラベルなしのオフライン軌道データは、効率的な探索戦略を学ぶために利用することができる。
提案手法は,42の長軸,スパース・リワードタスクからなるスイートにおいて,従来戦略よりも一貫して優れていた。
論文 参考訳(メタデータ) (2024-10-23T17:58:45Z) - BoostAdapter: Improving Vision-Language Test-Time Adaptation via Regional Bootstrapping [64.8477128397529]
本稿では,テスト時間適応フレームワークを提案する。
我々は、インスタンスに依存しない履歴サンプルとインスタンスを意識したブースティングサンプルから特徴を検索するための軽量なキー値メモリを維持している。
理論的には,本手法の背後にある合理性を正当化し,アウト・オブ・ディストリビューションとクロスドメイン・データセットの両方において,その有効性を実証的に検証する。
論文 参考訳(メタデータ) (2024-10-20T15:58:43Z) - Reinforcement Learning from Passive Data via Latent Intentions [86.4969514480008]
我々は、下流RLを加速する機能を学ぶために、受動的データが引き続き使用できることを示す。
我々のアプローチは、意図をモデル化することで受動的データから学習する。
実験では、クロス・エボディメント・ビデオデータやYouTubeビデオなど、さまざまな形式の受動的データから学習できることを実証した。
論文 参考訳(メタデータ) (2023-04-10T17:59:05Z) - Offline Robot Reinforcement Learning with Uncertainty-Guided Human
Expert Sampling [11.751910133386254]
バッチ(オフライン)強化学習の最近の進歩は、利用可能なオフラインデータから学習する上で有望な結果を示している。
本研究では,不確実性推定を用いて人間の実演データを注入する手法を提案する。
実験の結果,本手法は,専門家データと準最適エージェントから収集したデータを組み合わせる方法に比べて,よりサンプル効率が高いことがわかった。
論文 参考訳(メタデータ) (2022-12-16T01:41:59Z) - Extremely Simple Activation Shaping for Out-of-Distribution Detection [10.539058676970267]
アウト・オブ・ディストリビューション(OOD)検出は、モデルが目に見えない状況に対処する能力をテストする重要な領域である。
既存のOOD検出方法は、追加のトレーニングステップ、追加データ、あるいはトレーニングされたネットワークに非自明な変更を加える。
本稿では, 試料の後期層での活性化の大部分を除去する, 極めて単純で, ホック後のオンザフライ活性化形成法であるASHを提案する。
実験により、このような単純な治療は、最先端のOODを可能にするために、分布内と分布外の違いを高めることが示されている。
論文 参考訳(メタデータ) (2022-09-20T17:09:49Z) - Retrieval-Augmented Reinforcement Learning [63.32076191982944]
過去の経験のデータセットを最適な行動にマップするために、ネットワークをトレーニングします。
検索プロセスは、現在のコンテキストで有用なデータセットから情報を取得するために訓練される。
検索強化R2D2はベースラインR2D2エージェントよりもかなり高速に学習し,より高いスコアを得ることを示す。
論文 参考訳(メタデータ) (2022-02-17T02:44:05Z) - Learning Dexterous Manipulation from Suboptimal Experts [69.8017067648129]
相対エントロピーQラーニング(Relative Entropy Q-Learning、REQ)は、オフラインおよび従来のRLアルゴリズムのアイデアを組み合わせた単純なポリシーアルゴリズムである。
本稿では、REQが、デモから一般の政治外RL、オフラインRL、およびRLにどのように有効であるかを示す。
論文 参考訳(メタデータ) (2020-10-16T18:48:49Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。