論文の概要: The Model Organism Lottery: Model Organism Interpretability Strongly Depends on Training Methodology
- arxiv url: http://arxiv.org/abs/2607.01033v1
- Date: Wed, 01 Jul 2026 15:01:30 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-02 19:56:07.948528
- Title: The Model Organism Lottery: Model Organism Interpretability Strongly Depends on Training Methodology
- Title(参考訳): モデル・オーガナイゼーション・ロタリー:モデル・オーガナイゼーション・インタプリタビリティはトレーニング・方法論に強く依存する
- Abstract要約: 54ドルの$verb|OLMo2-1B|$-および$verb|gemma-3-1b-it|$-ベースのMOを7つの異なる手法で訓練した。
その結果,現在のMOを解釈可能性プロキシとしての有効性に疑念が持たれた。
- 参考スコア(独自算出の注目度): 0.5411464093493726
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Model organisms (MOs) - language models trained to exhibit undesired or unnatural behaviours - are frequently used as testbeds for evaluating white-box interpretability techniques. Current MOs are typically constructed via post-hoc supervised fine-tuning (SFT) on behavioural transcripts or synthetic documents. Prior research has shown that interpretability methods can easily identify hidden behaviours in these MOs. However, recent work suggests that such post-hoc training methods may make interpretability unrealistically easy. We investigate this claim by constructing a suite of 54 $\verb|OLMo2-1B|$- and $\verb|gemma-3-1b-it|$-based MOs trained with seven different techniques, including standard post-hoc SFT, post-hoc DPO, and more realistic integration of MO data into the OLMo post-training DPO phase. We use these MO variants to benchmark activation oracles, activation steering, logit lens, and sparse autoencoders. Our findings show that (i) MO interpretability depends strongly on training objective, target behaviour, model architecture, and training data generation pipeline; (ii) substantial variance remains even after controlling for differences in the strength of target behaviour expression; and (iii) our more realistic $\textit{integrated training}$ often yields less interpretable MOs than standard post-hoc methods. Our results cast substantial doubt on the validity of current MOs as interpretability proxies.
- Abstract(参考訳): モデル生物(MO) - 望ましくない行動や不自然な行動を示すために訓練された言語モデル - は、しばしばホワイトボックスの解釈可能性技術を評価するテストベッドとして使用される。
現在のMOは通常、行動記録や合成文書のポストホック管理された微調整(SFT)によって構築される。
以前の研究では、解釈可能性の手法はこれらのMOに隠された振る舞いを容易に識別できることが示されている。
しかし、最近の研究は、そのようなポストホックトレーニング手法が解釈可能性を非現実的に容易にする可能性を示唆している。
この主張は、標準のポストホックSFT、ポストホックDPO、およびより現実的なOLMO後のDPOフェーズへのMOデータの統合を含む7つの異なるテクニックで訓練された54$\verb|OLMo2-1B|$-および$\verb|gemma-3-1b-it|$-ベースのMOを構築して検討する。
これらのMO変異体を用いて、アクティベーションオーラクル、アクティベーションステアリング、ロジトレンズ、スパースオートエンコーダのベンチマークを行う。
以上の結果から
(i)MO解釈可能性は、トレーニング目標、目標行動、モデルアーキテクチャ、トレーニングデータ生成パイプラインに強く依存する。
二 標的行動表現の強度の差を制御した後においても、実質的な分散が残ること。
(iii)より現実的な$\textit{integrated training}$は、標準的なポストホックメソッドよりも解釈可能なMOが少ないことが多い。
その結果,現在のMOを解釈可能性プロキシとしての有効性に疑念が持たれた。
関連論文リスト
- MMEB-V3: Measuring the Performance Gaps of Omni-Modality Embedding Models [70.34265674686516]
マルチモーダル埋め込みモデルは、テキスト、画像、ビデオ、オーディオなどの異種入力を共有意味空間にマッピングすることを目的としている。
本稿では,テキスト,画像,ビデオ,オーディオ,エージェント中心のシナリオにまたがる埋め込みを評価するベンチマークであるMMEB-V3を紹介する。
本研究は, 完全モダリティ埋め込みの系統的解析を行い, 3つの重要な知見を同定する。
論文 参考訳(メタデータ) (2026-04-25T14:15:05Z) - UniICL: Systematizing Unified Multimodal In-context Learning through a Capability-Oriented Taxonomy [99.95663439922937]
文脈内学習の有効性は、しばしば単調でタスクに依存しない。
実証の機能的役割を分類する6段階の能力指向分類法を導入する。
大規模コーパスであるUniICL-760Kを構築する。
アーキテクチャの介入として、コンテキスト適応型プロトタイプモジュレータを提案する。
論文 参考訳(メタデータ) (2026-03-25T18:09:33Z) - Do LLM-Driven Agents Exhibit Engagement Mechanisms? Controlled Tests of Information Load, Descriptive Norms, and Popularity Cues [28.621781661498545]
テストケースとしてソーシャルメディア上での情報エンゲージメントを用いて,LCMによるシミュレーションが確実にサポートできることを評価する。
Weiboのような環境では、情報負荷や記述規範を操作しつつ、人気度を内在的に進化させる。
これらの制御された変動の下では、単に可塑性トレースを生成するのではなく、理論的に解釈可能な方法でシミュレートされた振る舞いが変化するかどうかを問う。
論文 参考訳(メタデータ) (2026-03-21T18:50:22Z) - Towards Simulating Social Media Users with LLMs: Evaluating the Operational Validity of Conditioned Comment Prediction [2.5450067638785945]
本研究は,ユーザが所定の刺激に対してどのようにコメントするかをモデルが予測するタスクである条件付きコメント予測(CCP)を紹介する。
オープンウェイトな8Bモデル(Llama3.1、Qwen3、Ministral)を英語、ドイツ語、ルクセンブルク語のシナリオで評価する。
論文 参考訳(メタデータ) (2026-02-26T08:40:21Z) - MOTIF: Learning Action Motifs for Few-shot Cross-Embodiment Transfer [55.982504915794514]
クロス・エボディメント・ポリシーは一般的に共有プライベート・アーキテクチャに依存している。
本報告では,MOTIFを効率よく数発のクロスボディーメントトランスファーに適用する。
我々はMOTIFが数発の転送シナリオにおいて強いベースラインを著しく上回ることを示す。
論文 参考訳(メタデータ) (2026-02-14T13:21:40Z) - Guided Verifier: Collaborative Multimodal Reasoning via Dynamic Process Supervision [11.159231524113764]
マルチモーダル大規模言語モデル(MLLM)の複雑な推論能力を高めるための重要なメカニズムとして強化学習(RL)が登場した。
本稿では,これらの構造的制約に対処する textbfGuided Verifier フレームワークを提案する。
我々は,マルチモーダル幻覚をターゲットとした特殊なデータ合成パイプラインを開発し,プロセスレベルの負の textbfCoRe データセットとtextbfCorrect-guide textbfReasoning トラジェクトリを構築し,ガイド付き検証器を訓練する。
論文 参考訳(メタデータ) (2026-02-04T07:38:42Z) - Drift No More? Context Equilibria in Multi-Turn LLM Interactions [58.69551510148673]
コンテキストドリフト(Contexts drift)とは、ターン間のゴール一貫性のある振る舞いからモデルが出力する出力の段階的なばらつきである。
シングルターンエラーとは異なり、ドリフトは時間的に展開し、静的な評価指標では捉えにくい。
マルチターンドリフトは、避けられない崩壊というよりも、制御可能な平衡現象として理解できることを示す。
論文 参考訳(メタデータ) (2025-10-09T04:48:49Z) - Model Utility Law: Evaluating LLMs beyond Performance through Mechanism Interpretable Metric [99.56567010306807]
大規模言語モデル(LLM)は、学術、産業、そして日々のアプリケーションに欠かせないものになっている。
大規模言語モデル (LLM) 時代における評価の課題の1つは一般化問題である。
従来の性能スコアを補完するメカニズムの解釈可能性向上指標であるモデル利用指数(MUI)を提案する。
論文 参考訳(メタデータ) (2025-04-10T04:09:47Z) - Log Probabilities Are a Reliable Estimate of Semantic Plausibility in Base and Instruction-Tuned Language Models [50.15455336684986]
意味的妥当性を評価するため,LogProbsの有効性と基本的なプロンプトを評価した。
LogProbsは、直接ゼロショットプロンプトよりも、より信頼性の高いセマンティックな妥当性を提供する。
我々は,プロンプトベースの評価の時代においても,LogProbsは意味的妥当性の有用な指標である,と結論付けた。
論文 参考訳(メタデータ) (2024-03-21T22:08:44Z) - On Fast Adversarial Robustness Adaptation in Model-Agnostic
Meta-Learning [100.14809391594109]
モデルに依存しないメタラーニング(MAML)は、数発の学習において最も成功したメタラーニング手法の1つである。
メタモデルの一般化力にもかかわらず、マルチショット学習においてMDLがいかに敵対的堅牢性を維持することができるかは明らかではない。
本稿では,ラベルなしデータ拡張,高速な攻撃生成,計算量軽微な微調整を可能にする,汎用的かつ最適化が容易なロバストネス正規化メタラーニングフレームワークを提案する。
論文 参考訳(メタデータ) (2021-02-20T22:03:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。