論文の概要: Measuring Evaluation-Context Divergence in Open-Weight LLMs: A Paired-Prompt Protocol with Pilot Evidence of Alignment-Pipeline-Specific Heterogeneity
- arxiv url: http://arxiv.org/abs/2605.06327v1
- Date: Thu, 07 May 2026 14:23:31 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-08 22:27:11.891783
- Title: Measuring Evaluation-Context Divergence in Open-Weight LLMs: A Paired-Prompt Protocol with Pilot Evidence of Alignment-Pipeline-Specific Heterogeneity
- Title(参考訳): オープンウェイトLDMにおける評価文脈の多様性の測定:アライメント-ピペリン比重不均一性のパイロットエビデンスを用いたペア型プロンプトプロトコル
- Abstract要約: 安全ベンチマークは、言語モデルが一度デプロイされたらどのように振る舞うかを示す証拠として、定期的に扱われるが、この推論は、振る舞いがプロンプトが評価のように見えるかどうかに依存する場合、脆弱である。
我々は、評価コンテキストのばらつきを、一定のタスクのフレーミングによって引き起こされる行動の観測可能な内部的変化として定義する。
パラフレーズ変動,ベンチマーク親しみ,およびフレーミング感度を制御しながら,オープンウェイトLLMで測定するペアプロンプトプロトコルを提案する。
- 参考スコア(独自算出の注目度): 1.253312107729806
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Safety benchmarks are routinely treated as evidence about how a language model will behave once deployed, but this inference is fragile if behavior depends on whether a prompt looks like an evaluation. We define evaluation-context divergence as an observable within-item change in behavior induced by framing a fixed task as an evaluation, a live deployment interaction, or a neutral request, and present a paired-prompt protocol that measures it in open-weight LLMs while controlling for paraphrase variation, benchmark familiarity, and judge framing-sensitivity. Across five instruction-tuned checkpoints from four open-weight families plus a matched OLMo-3 base/instruct ablation ($20$ paired items, $840$ generations per checkpoint), we find striking heterogeneity. OLMo-3-Instruct alone is eval-cautious -- evaluation framing raises refusal vs. neutral by $11.8$pp ($p=0.007$) and reduces harmful compliance vs. deployment by $3.6$pp ($p=0.024$, $0/20$ items inverted) -- while Mistral-Small-3.2, Phi-3.5-mini, and Llama-3.1-8B are deployment-cautious}, with marginal eval-vs-deployment refusal effects of $-9$ to $-20$pp. The matched OLMo-3 base also exhibits the deployment-cautious pattern, identifying alignment as the inversion stage; within Llama-3.1, the $70$B model preserves direction with attenuated magnitude, ruling out a simple ``small-model effect that reverses at scale.'' One caveat: the cross-family heterogeneity is judge-dependent. Re-judging with a different-family safety classifier (Llama-Guard-3-8B) preserves the within-OLMo eval-cautious direction but flattens the cross-family contrast, indicating that the two judges operationalize distinct constructs.
- Abstract(参考訳): 安全ベンチマークは、言語モデルが一度デプロイされたらどのように振る舞うかを示す証拠として、定期的に扱われるが、この推論は、振る舞いがプロンプトが評価のように見えるかどうかに依存する場合、脆弱である。
評価コンテキストのばらつきは、一定のタスクのフレーミングによって引き起こされる行動の観測可能な内部変化として定義し、パラメータ変動、ベンチマークの親しみ、フレーミング感度を制御しながら、オープンウェイトLLMでそれを測定するペア・プロンプトプロトコルを提案する。
4つのオープンウェイトファミリーの5つのインストラクションチューニングされたチェックポイントに加えて、マッチしたOLMo-3ベース/インストラクションアブレーション(20ドルペアアイテム、1チェックポイントあたり840ドル世代)は、著しく異質である。
OLMo-3-インストラクトのみはeval-coutiousである -- 評価フレーミングは11.8$pp (p=0.007$) の拒絶と、有害なコンプライアンス対デプロイメントを3.6$pp (p=0.024$, $0/20$) に減らし、Mistral-Small-3.2、Phi-3.5-mini、Llama-3.1-8Bはデプロイ-coutiousである。
Llama-3.1 では、70$B のモデルが方向を減衰等級で保ち、スケールを逆転する単純な ‘小モデル’ 効果を除外している。
一つの注意:家族間の異質性は判断に依存している。
異なる家族の安全分類器(Llama-Guard-3-8B)による再判断は、OLMo内部のeval-cautious方向を保ちながら、横断的なコントラストをフラットにし、2人の裁判官が異なる構成体を運用していることを示す。
関連論文リスト
- Beyond Local Accuracy: A Protocol-Level Identifiability Audit for Controlled LLM Reasoning Evaluation [6.047519836191728]
有限行動ポリシークラス上でプロトコルレベルの識別可能性監査を形式化する。
監査はモデルコールをゼロにし、診断ケースを解決します。
このケースは、モデル推論の前に、どのように評価設計の妥当性を構造的に確認できるかを示す。
論文 参考訳(メタデータ) (2026-08-13T14:49:47Z) - BRiG-AFA: Bellman Risk-to-Go Learning for Non-Myopic Active Feature Acquisition [8.363536351727978]
アクティブな機能取得は、予算の下で各テストインスタンスの次を計測する観測されていない機能を要求する。
本稿では,残予算毎に個別の候補条件付きリスク・ツー・ゴー関数を学習する,デプロイ可能な教師付き代替手段であるメソッドを導入する。
論文 参考訳(メタデータ) (2026-08-03T14:30:44Z) - Beyond Value Benchmarks: Measuring Value-Structure Alignment in Large Language Models via Symmetric Q-Sorts [47.02978329409663]
そこで本研究では,Q手法に基づく対称型人間-LLM評価フレームワークを提案する。
私たちのプロトコルでは、人間とモデルは同一の140項目の道徳的ステートメントを、共有された9カラムの強制分布に分類します。
240個の複製されたQ-sortを2つの温度設定で4つのモデルファミリーにまたがる12個のLLMを評価した。
論文 参考訳(メタデータ) (2026-06-20T08:15:41Z) - Coherence Under Commitment: Probing Generalization and Vacuous Memorization in LLM Logical Reasoning [0.9023847175654603]
コヒーレンス・アンダー・コミット(CUC: Coherence Under Commitment)は、一貫性と決定性を共同で測定する二重クエリ評価パラダイムである。
CUC は,(1) コミットメントスコア $c(varphi) = p(varphi) + p(lnotvarphi)$ 決定的な結果に割り当てられた確率質量の定量化,(2) 正規化YES/NOログ確率によるテキストbf決定論的推論プロトコルによるサンプリング分散の排除,(3) コヒーレンス・コミットトレードオフをメトリクスに運用する3方向決定フレームワーク (True/False/Uncertain) の3つの革新に寄与する。
論文 参考訳(メタデータ) (2026-06-19T04:12:56Z) - Should LLM Agents Decide in Social Simulations? Comparing Finite-State and LLM-Based Decision Policies [44.05636851266385]
本稿では,大規模言語モデルがオンラインソーシャルネットワークシミュレーションにおいて解釈可能な参照ポリシーを維持しているかどうかを評価する。
LLaMA 3.1、GPT-OSS、Mistral 24Bの3つのオープンウェイトLCMが試験されている。
その結果、LCMは参照ポリシーをいくつかの構成で近似できるが、確実に保存できないことがわかった。
論文 参考訳(メタデータ) (2026-06-10T17:35:32Z) - Representation Without Reward: A JEPA Audit for LLM Fine-Tuning [1.2691047660244335]
JEPA(Joint-embedding predictive Architectures)は、モデルが観測された出力よりも遅延表現を予測できるように訓練された時に、より有用な抽象化を学ぶべきであることを提案している。
自己回帰型言語モデルの微調整には、この原理はより厳密な要件を必要とする。
我々は、Llama-3.2-1B-Instruct LoRA を用いて、自然言語からレジェックス生成におけるその要件を検証した。
論文 参考訳(メタデータ) (2026-05-14T20:27:32Z) - ComplexMCP: Evaluation of LLM Agents in Dynamic, Interdependent, and Large-Scale Tool Sandbox [61.862814740220806]
$textbfComplexMCP$は厳格な条件下でエージェントを評価するために設計されたベンチマークである。
Model Context Protocol (MCP)上に構築された$textbfComplexMCP$は300以上の精巧にテストされたツールを提供する。
論文 参考訳(メタデータ) (2026-05-11T16:20:51Z) - Empowering VLMs for Few-Shot Multimodal Time Series Classification via Tailored Agentic Reasoning [44.69766273765273]
VL$underlinetextbfM$$underlinetextbfa$gentic $underlinetextbfr$easoning framework for few-$underlinetextbfs$hot multimodal $underlinetextbfT$ime $underlinetextbfS$eries $underlinetextbfC$lassification$textbfMarsTSC$(source)を提案する。
論文 参考訳(メタデータ) (2026-05-10T07:47:09Z) - MEMSAD: Gradient-Coupled Anomaly Detection for Memory Poisoning in Retrieval-Augmented Agents [0.0]
検索強化エージェントに対するメモリ中毒攻撃を,統合評価フレームワークを用いたStackelbergゲームとして定式化する。
ASR-R: 0.25〜1.00$) による攻撃成功度を4倍に向上させる。
私たちの主な貢献は、勾配結合に接地したキャリブレーションに基づく防御であるMEMSADである。
論文 参考訳(メタデータ) (2026-05-05T08:15:41Z) - How Independent are Large Language Models? A Statistical Framework for Auditing Behavioral Entanglement and Reweighting Verifier Ensembles [46.63622714488747]
共有事前学習データ、蒸留、アライメントパイプラインは、隠れた振る舞い依存、潜伏絡みを誘導することができる。
実際には、これは相関した推論パターンと同期された障害として現れます。
ブラックボックス言語モデル間の行動絡みを監査するための統計的枠組みを開発する。
論文 参考訳(メタデータ) (2026-04-08T23:32:06Z) - The Geometry of Harmful Intent: Training-Free Anomaly Detection via Angular Deviation in LLM Residual Streams [0.0]
本研究では,大規模言語モデルにおける残差ストリームアクティベーションの幾何を分析し,有害なプロンプトを検出するためのトレーニング不要な方法であるLatentBiopsyを提案する。
我々はQwen3.5-0.8BファミリーとQwen2.5-0.5Bファミリーの2つの完全モデル三重項を評価した。
latentBiopsyは、有害なvs-ノルミティブ検出のためのAUROC$geq$0.937と、良性攻撃的プロンプトから有害なプロンプトを識別するためのAUROC = 1.000を達成している。
論文 参考訳(メタデータ) (2026-03-28T21:19:58Z) - Between the Layers Lies the Truth: Uncertainty Estimation in LLMs Using Intra-Layer Local Information Scores [36.86032736109853]
大きな言語モデル(LLM)は、しばしば自信を持って間違っているため、確実な不確実性推定(UE)が不可欠である。
本稿では,1つのフォワードパスを用いて内部表現における層間パターンをスコアリングする,コンパクトでインスタンスごとのUE手法を提案する。
論文 参考訳(メタデータ) (2026-03-17T08:35:14Z) - Adversarial Intent is a Latent Variable: Stateful Trust Inference for Securing Multimodal Agentic RAG [5.4716896485317195]
マルチモーダルエージェントRAGに対する現在のステートレスディフェンスは、悪意のあるセマンティクスを配布する敵の戦略を検出するのに失敗する。
MMA-RAGTは,MTA (Modular Trust Agent) が管理する推定時制御フレームワークで,ほぼ信頼状態を維持している。
論文 参考訳(メタデータ) (2026-02-24T23:52:27Z) - TrustJudge: Inconsistencies of LLM-as-a-Judge and How to Alleviate Them [58.04324690859212]
自動評価器(LLM-as-a-judge)としての大規模言語モデル(LLM)は、現在の評価フレームワークにおいて重大な矛盾を明らかにしている。
スコア比較不整合とペアワイズ・トランジティビティ不整合という2つの基本的不整合を同定する。
我々は2つの重要なイノベーションを通じてこれらの制限に対処する確率的フレームワークであるTrustJudgeを提案する。
論文 参考訳(メタデータ) (2025-09-25T13:04:29Z) - Uncertainty in Language Models: Assessment through Rank-Calibration [65.10149293133846]
言語モデル(LM)は、自然言語生成において有望な性能を示している。
与えられた入力に応答する際の不確実性を正確に定量化することは重要である。
我々は、LMの確実性と信頼性を評価するために、Rank$-$Calibration$と呼ばれる斬新で実用的なフレームワークを開発する。
論文 参考訳(メタデータ) (2024-04-04T02:31:05Z) - Clustered Switchback Designs for Experimentation Under Spatio-temporal Interference [44.644520116360106]
我々は, 平均治療効果 (GATE) を推定し, 全単位を常に治療やコントロールに曝露した平均結果の差を推定した。
そこで我々は,単位をクラスタにグループ化し,時間ステップをブロックにグループ化する,クラスタ化されたスイッチバック設計を提案する。
良好なクラスタリングを許容するグラフに対して, トラッピングされたHorvitz-Thompson推定器が$tilde O(1/NT)$平均二乗誤差(MSE)を達成することを示す。
我々の結果は、citethu2022switchback、ugander2013graph、citetleung2022rateの結果を同時に一般化する。
論文 参考訳(メタデータ) (2023-12-25T01:00:58Z) - Multi-label Contrastive Predictive Coding [125.03510235962095]
差分相互情報(MI)推定器は、コントラスト予測符号化(CPC)のような教師なし表現学習法で広く利用されている。
本稿では,複数の正のサンプルを同時に同定する必要がある多ラベル分類問題に基づく新しい推定器を提案する。
同一量の負のサンプルを用いて複数ラベルのCPCが$log m$boundを超えることができる一方で、相互情報の有意な下限であることを示す。
論文 参考訳(メタデータ) (2020-07-20T02:46:21Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。