論文の概要: Representational Depth of Evaluation Awareness Shifts With Scale in Open-Weight Language Models
- arxiv url: http://arxiv.org/abs/2606.29196v1
- Date: Sun, 28 Jun 2026 04:48:17 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-30 18:07:15.830094
- Title: Representational Depth of Evaluation Awareness Shifts With Scale in Open-Weight Language Models
- Title(参考訳): オープンウェイト言語モデルにおける尺度による評価意識の変化の表現的深さ
- Authors: Archit Manek,
- Abstract要約: 評価コンテキストを認識するモデルは、その振る舞いを戦略的に変化させ、下流のベンチマークを解釈しにくくする。
Qwen 2.5, Gemma 2, およびLlama 3.2にまたがる11のモデルを用いて、表現深さの体系的な大きさ依存的なシフトを求める。
このことは,評価意識の強さだけでなく,ネットワーク上で最も線形に回復可能な場所でのスケール変化を示唆している。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Do language models know when they are being tested? This question matters for AI safety: a model that recognises an evaluation context could alter its behaviour strategically, making downstream benchmarks harder to interpret. Using 11 models spanning Qwen 2.5, Gemma 2, and Llama 3.2, we find a systematic size-dependent shift in representational depth: in both Qwen 2.5 and Gemma 2, the layer at which evaluation-awareness is most linearly recoverable moves from late layers in smaller models to early layers in larger ones. This suggests that scale changes not only the strength of evaluation-awareness but also where it is most linearly recoverable in the network. This depth shift helps explain why within-family scaling trajectories are non-monotonic or inverse rather than smooth and family-general, showing that a simple universal power-law account is not supported under denser within-family sampling. Finally, white-box probe signals are consistently stronger than black-box behavioural expression, and the relationship between the two varies by family in ways not predicted by probe AUROC alone.
- Abstract(参考訳): 言語モデルはいつテストされているか知っていますか?
評価コンテキストを認識するモデルは、その振る舞いを戦略的に変更し、ダウンストリームベンチマークの解釈が困難になる可能性がある。
Qwen 2.5, Gemma 2, およびLlama 3.2にまたがる11のモデルを用いて, 表現深さの体系的な大きさ依存的な変化を見出した。
このことは,評価意識の強さだけでなく,ネットワーク上で最も線形に回復可能な場所でのスケール変化を示唆している。
この深さシフトは、家庭内スケーリングトラジェクトリがスムーズで家族一般よりも非モノトニックまたは逆である理由を説明するのに役立ち、単純な普遍的なパワーローアカウントは、より高密度な家庭内サンプリングではサポートされないことを示す。
最後に、ホワイトボックスプローブ信号はブラックボックスの行動表現よりも一貫して強く、両者の関係はAUROCだけでは予測できない方法で家族によって異なる。
関連論文リスト
- LogitDynamics: Reliable ViT Error Detection from Layerwise Logit Trajectories [1.4610038284393168]
視覚変換器(ViT)の誤差予測に関する研究
大規模言語モデルにおける内信号幻覚検出の動機付けにより、類似の深度信号がViTに存在するかどうかを考察する。
中間層に軽量な線形ヘッドを付加することにより、予測クラスのロジットとトップK競合の両方をキャプチャする最後のL層から特徴を抽出する。
これらの特徴に基づいて訓練された線形プローブは、エラーインジケータを予測する。
論文 参考訳(メタデータ) (2026-04-12T13:43:40Z) - MAR-MAER: Metric-Aware and Ambiguity-Adaptive Autoregressive Image Generation [1.4552327135549117]
本稿では,革新的階層的自己回帰フレームワークであるMAR-MAERを紹介する。
これは、メートル法を意識した埋め込み正規化法であり、曖昧な意味論を扱うために使われる潜在モデルである。
提案手法は,CLIPScore や HPSv2 などの品質指標とモデルの内部表現を一致させる。
メトリクスの一貫性とセマンティックな柔軟性の両方において優れたパフォーマンスを達成する。
論文 参考訳(メタデータ) (2026-04-02T10:19:46Z) - From Early Encoding to Late Suppression: Interpreting LLMs on Character Counting Tasks [49.57538588967748]
LLM(Large Language Model)は、複雑なベンチマークでは優れているにもかかわらず、単語中の文字数などの基本的な記号的タスクにおいて失敗を示す。
我々は、LLaMA、Qwen、Gemmaなど、現代のアーキテクチャにまたがる一貫した現象を発見した。
LLMにおけるシンボリック推論失敗は,表現不足やスケール不足によるものではなく,モデル計算グラフ内の構造的干渉によるものであることを示す。
論文 参考訳(メタデータ) (2026-04-01T11:40:12Z) - Sparse Semantic Dimension as a Generalization Certificate for LLMs [53.681678236115836]
Sparse Semantic Dimension (SSD)は,モデル層上で訓練されたSparse Autoencoder (SAE)のアクティブな特徴語彙から導かれる複雑性尺度である。
我々はGPT-2 Small と Gemma-2B でこの枠組みを検証し、実際のサンプルサイズで非空き証明書を提供することを実証した。
論文 参考訳(メタデータ) (2026-02-11T21:45:18Z) - Same Answer, Different Representations: Hidden instability in VLMs [65.36933543377346]
本稿では,内部埋め込みドリフト,スペクトル感度,構造的滑らかさを計測する表現認識・周波数認識評価フレームワークを提案する。
このフレームワークを,SEEDBench,MMMU,POPEデータセットを対象とする最新のビジョン言語モデル(VLM)に適用する。
論文 参考訳(メタデータ) (2026-02-06T12:24:26Z) - Superposition Yields Robust Neural Scaling [22.05527470952902]
表現重畳は、LLMが次元よりも多くの特徴を表現していることを意味するが、損失や神経スケーリングの原因となる重要な要因であることを示す。
結果は,表現重畳をニューラルスケーリング法則の中心的要因として認識し,ニューラルスケーリング法則がいつ改善され,いつ崩壊するかといった問題に対する洞察を提供する。
論文 参考訳(メタデータ) (2025-05-15T16:18:13Z) - Interpretability at Scale: Identifying Causal Mechanisms in Alpaca [62.65877150123775]
本研究では、Boundless DASを用いて、命令に従う間、大規模言語モデルにおける解釈可能な因果構造を効率的に探索する。
私たちの発見は、成長し、最も広くデプロイされている言語モデルの内部構造を忠実に理解するための第一歩です。
論文 参考訳(メタデータ) (2023-05-15T17:15:40Z) - Second-Moment Loss: A Novel Regression Objective for Improved
Uncertainties [7.766663822644739]
不確実性の定量化は、安全な機械学習を確立する最も有望なアプローチの1つである。
これまでの最も一般的なアプローチの1つはモンテカルロドロップアウトで、計算量的に安価で、実際に簡単に適用できる。
この問題に対処するため,第2モーメント損失(UCI)と呼ばれる新たな目標を提案する。
論文 参考訳(メタデータ) (2020-12-23T14:17:33Z) - How do Decisions Emerge across Layers in Neural Models? Interpretation
with Differentiable Masking [70.92463223410225]
DiffMaskは、差分性を維持しながら入力のサブセットをマスクアウトすることを学ぶ。
入力トークンを包含または無視する決定は、中間隠蔽層に基づく単純なモデルで行われる。
これにより、属性のヒートマップをプロットするだけでなく、ネットワーク層間で意思決定がどのように形成されるかを分析することができます。
論文 参考訳(メタデータ) (2020-04-30T17:36:14Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。