論文の概要: Interpretable GOHR Agents via Sparse Autoencoders
- arxiv url: http://arxiv.org/abs/2607.25132v2
- Date: Wed, 29 Jul 2026 05:15:05 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-30 14:21:10.719546
- Title: Interpretable GOHR Agents via Sparse Autoencoders
- Title(参考訳): スパースオートエンコーダによるGOHRエージェントの解釈
- Authors: Shiwei Tan, Yusong Zhao, Weiyi Qin, Wentian Wang, Jacob Feldman, Lazaros K. Gallos, Paul B. Kantor, Vladimir Menkov, Hao Wang,
- Abstract要約: 隠れルールゲーム(GOHR)におけるトークン化自己回帰変換器エージェントの解釈可能性実験について報告する。
両方の隠れルールは、オブジェクトの形状をターゲットのバケットにマッピングするが、異なる順列を持つ、コンパクトな2ルールタスクに焦点を当てる。
このポリシーは、これらの2つの隠れルールからサンプリングされたエピソードに基づいてトレーニングされ、固定重量で評価される。
- 参考スコア(独自算出の注目度): 4.098164130443029
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: A central challenge in interpreting learned decision-making systems is to determine whether their internal representations contain concepts that help explain their behavior. We report interpretability experiments for a tokenized autoregressive Transformer agent in the Game of Hidden Rules (GOHR). We focus on a compact two-rule task in which both hidden rules map object shapes to target buckets, but with different permutations. The policy is trained on episodes sampled from these two hidden rules and then evaluated with fixed weights. It is never given a rule label and does not use an explicit rule classifier; any rule information must be inferred implicitly from interaction history. In this setting, the correct rule is not identifiable before the agent tries an informative move and observes accept/reject feedback. Sparse autoencoders (SAEs) trained on the agent's decision-token embeddings recover this structure. When held-out decisions are labeled by simple concepts such as the chosen shape or bucket, SAE dimensions that are highly selective for a concept cover most decisions where that concept is present. Individual SAE dimensions also correspond to interpretable strategies such as probing one rule hypothesis and switching after negative feedback.
- Abstract(参考訳): 学習した意思決定システムの解釈における中心的な課題は、彼らの内部表現が彼らの振る舞いを説明するのに役立つ概念を含むかどうかを決定することである。
本稿では,GOHR(Game of Hidden Rules)におけるトークン化自己回帰トランスフォーマーエージェントの解釈可能性実験について報告する。
両方の隠れルールは、オブジェクトの形状をターゲットのバケットにマッピングするが、異なる順列を持つ、コンパクトな2ルールタスクに焦点を当てる。
このポリシーは、これらの2つの隠れルールからサンプリングされたエピソードに基づいてトレーニングされ、固定重量で評価される。
ルールラベルは与えられず、明示的なルール分類器を使用せず、いかなるルール情報も相互作用履歴から暗黙的に推論されなければならない。
この設定では、エージェントが情報的動きを試み、受け入れ/拒絶のフィードバックを観察する前に、正しいルールは特定できない。
スパースオートエンコーダ (SAEs) はエージェントの意思決定のための埋め込みを訓練し、この構造を回復する。
保持された決定が選択された形やバケットのような単純な概念によってラベル付けされる場合、概念に非常に選択的なSAE次元は、その概念が存在する場所のほとんどの決定をカバーする。
個々のSAE次元は、1つのルール仮説の探索や負のフィードバックの後の切り替えといった解釈可能な戦略に対応している。
関連論文リスト
- Erasing Without Collateral Damage: Precise Concept Removal in Diffusion Models [10.269961654607108]
トレーニング不要の概念消去は、テキスト間拡散モデルを制御するための魅力的なメカニズムである。
しかし、正確な消去は、しばしば意味論的に関連する非ターゲット概念を損なうコストがかかる。
原ターゲット方向を宇宙空間に意識した方向で置き換えるクローズドフォームの概念消去演算子であるCAREを紹介する。
論文 参考訳(メタデータ) (2026-07-06T16:21:09Z) - Resolving Ambiguity in Composed Image Retrieval via Calibrated Interaction [0.0]
合成画像検索(CIR)は、コーパスに参照画像と修正方法を記述するテキストを検索する。
本稿では,CIRRの休眠補助アノテーションと対話アノテーションを復活させる,ベンチマークおよび人間検証型ユーザシミュレータであるAmbiCIRを紹介する。
論文 参考訳(メタデータ) (2026-05-23T15:49:16Z) - Extracting Rule-based Descriptions of Attention Features in Transformers [68.33953232728204]
注意層出力に基づいて学習したSAE特徴の規則に基づく記述について検討した。
ほとんどの機能は、約100のスキップグラムルールでうまく記述されているかもしれません。
本稿では,ルールに基づく特徴記述の今後の研究の基盤となる課題について述べる。
論文 参考訳(メタデータ) (2025-10-20T22:52:40Z) - A Granular Study of Safety Pretraining under Model Abliteration [64.24346997570275]
本稿では,リフレクションに敏感な方向を除去する軽量プロジェクション技術であるモデルアブリーブレーションについて検討する。
我々は、バランスのとれた有害かつ無害なケースで100のプロンプトを発行し、複数の判断を用いて**Refusal*または***Non-Refusal*として応答を分類し、判断の忠実さを検証する。
本研究は,データ中心の安全コンポーネントが失語中も頑健であるチェックポイントレベルの特徴付けを行う。
論文 参考訳(メタデータ) (2025-10-03T07:01:45Z) - Explaining Time Series Classifiers with PHAR: Rule Extraction and Fusion from Post-hoc Attributions [7.51289645756884]
PHARは、数値的特徴属性を構造化された可読性ルールに変換するフレームワークである。
専用ルール融合ステップは、重み付け選択やラッソベースの精錬のような戦略を用いてルールセットを統合する。
UCR/UEA時系列分類アーカイブの実験は、PHARがTS分類タスクの解釈可能性、決定透明性、実用的な適用性を改善することを実証している。
論文 参考訳(メタデータ) (2025-08-03T09:45:40Z) - Does Representation Intervention Really Identify Desired Concepts and Elicit Alignment? [73.80382983108997]
表現の介入(Representation intervention)は、大規模言語モデルにおいて基礎となる概念を符号化する表現の発見と修正を目的としている。
介入が忠実であれば、介入されたLLMは有害な概念を消去し、非分配的敵のプロンプトとアウト・オブ・ディストリビューションのジェイルブレイクの両方に対して堅牢であるべきである。
本研究では,有害表現と良性表現の境界を簡易化する概念集中(COCA)を提案する。
論文 参考訳(メタデータ) (2025-05-24T12:23:52Z) - Abstracting Concept-Changing Rules for Solving Raven's Progressive
Matrix Problems [54.26307134687171]
Raven's Progressive Matrix (RPM) は、候補者の中から選択することで、機械知能においてそのような能力を実現する古典的なテストである。
近年の研究では、RPMの解法はルールの深い理解を促進することが示唆されている。
本稿では、解釈可能な概念を学習し、潜在空間における概念変更ルールを解析することにより、概念変更ルールABstraction(CRAB)の潜時変数モデルを提案する。
論文 参考訳(メタデータ) (2023-07-15T07:16:38Z) - LEACE: Perfect linear concept erasure in closed form [97.78661458934953]
概念消去は、埋め込みから特定の機能を削除することを目的としている。
LEAst-squares Concept Erasure (LEACE) は、すべての線形分類器が可能な限り少ない埋め込みで概念を検出することを確実に防止する閉形式手法である。
LEACEを"concept scrubbing"と呼ばれる新しい手法で大規模言語モデルに適用し、ネットワーク内の各層からターゲット概念情報を消去する。
論文 参考訳(メタデータ) (2023-06-06T16:07:24Z) - Explaining $\mathcal{ELH}$ Concept Descriptions through Counterfactual
Reasoning [3.5323691899538128]
分類を本質的に透過的に行う方法は、記述論理の概念を使用することである。
一つの解決策は、「異なる分類を得るために特徴値をどう変えなければならないか」という疑問に答えるために反事実を用いることである。
論文 参考訳(メタデータ) (2023-01-12T16:06:06Z) - Measuring the Interpretability of Unsupervised Representations via
Quantized Reverse Probing [97.70862116338554]
本稿では,自己教師付き表現の解釈可能性の測定問題について検討する。
我々は、後者を、表現と手動でラベル付けされた概念の空間の間の相互情報を推定するものとして定式化する。
提案手法は,多人数の自己教師付き表現の評価に利用し,解釈可能性による評価を行う。
論文 参考訳(メタデータ) (2022-09-07T16:18:50Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。