論文の概要: Off-Target Effects of Response-Style Alignment in a Korean 27B Language Model
- arxiv url: http://arxiv.org/abs/2609.11291v2
- Date: Mon, 14 Sep 2026 22:24:38 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-16 14:56:08.069528
- Title: Off-Target Effects of Response-Style Alignment in a Korean 27B Language Model
- Title(参考訳): 韓国27B言語モデルにおける応答スタイルアライメントのオフターゲット効果
- Abstract要約: 本研究の目的は,不明瞭な社会的質問の棄却と証券ガイダンスの未公表の2つの行動を測定することである。
一致したターゲットフォームコントロールは、回答の妥当性がトレーニング対象に依存していることを示し、プロンプトセットやレシピのみに依存しない。
- 参考スコア(独自算出の注目度): 2.8678936590409028
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We post-train Qwen3.8-27B for Korean response style -- verbosity, list and markdown usage, discourse structure and register -- and measure two behaviours the objective never targets: abstention on ambiguous social questions in KoBBQ, where the benchmark-correct answer is UNKNOWN, and unprompted disclosure in securities guidance. Both move, and the changes are expressed primarily through the model's emission policy: how often it answers and how much it says. Matched target-form controls show that answer propensity depends on the training target, not the prompt set or recipe alone. Holding prompts, recipe, data volume and serving fixed and changing only the target text, three style seeds give positive answer-rate point estimates (mean +0.82 pp) and three neutral seeds negative ones (mean -1.53 pp); the observed seed ranges do not overlap and the means differ by 2.34 pp. A length-matched arm lies between them, and a fourth arm that stays short while preserving hedging is unstable across seeds, so which feature of the form is responsible is unresolved. For absolute stereotyped exposure the decomposition into an answer-propensity term and a conditional-composition term is an algebraic identity, not a finding; its empirical content is where the movement went. Across the trained checkpoints the changes are dominated by answer propensity while the composition term stays small, and because that term is evaluated on treatment-dependent answered subsets we do not read it as evidence about latent preference. Two measurement results follow. A between-arm contrast in conditional stereotyped share does not identify a change in conditional content preference when answer status is treatment-dependent. And agreement between two rule detectors for the same construct runs from 0.44 to 0.99 depending on which checkpoint produced the text -- observable without any reference labels.
- Abstract(参考訳): 我々は、韓国の対応スタイルに関するQwen3.8-27Bの訓練後、冗長性、リストとマークダウンの使用、談話構造、レジスターの2つの行動を測定する。
両方の動きと変化は、主にモデルの排出政策によって表現される。
一致したターゲットフォームコントロールは、回答の妥当性がトレーニング対象に依存していることを示し、プロンプトセットやレシピのみに依存しない。
プロンプト、レシピ、データボリューム、固定されたテキストのみを保ち、変化させる3つのスタイルの種は正の応答速度点推定(平均+0.82pp)、3つの中性種子陰性推定(平均-1.53pp)を与え、観察された種子範囲は重複せず、平均は2.34ppと異なる。
両腕の間には長さが合わさった腕があり、湿気を保ちながら短く保つ第4の腕は種子間で不安定であり、形の特徴は未解決である。
絶対ステレオタイプ露光の場合、解の正当性項と条件合成項への分解は、発見ではなく代数的アイデンティティであり、その経験的内容は運動がどこへ行ったかである。
訓練されたチェックポイント全体では、変化は回答の正当性によって支配されるが、構成項は小さいままであり、その項は治療依存の回答サブセットで評価されるので、潜在的嗜好の証拠として読めない。
2つの測定結果が続く。
条件付きステレオタイプ共有における腕間コントラストは、応答状態が治療に依存している場合の条件付きコンテンツ嗜好の変化を識別しない。
そして、同じ構成のための2つのルール検出器間の合意は、どのチェックポイントがテキストを生成するかによって0.44から0.99まで実行されます。
関連論文リスト
- Do Large Language Models Know What They Don't Know II? A Fully Behavioral, Non-Cognitive Measure of Epistemic Honesty [8.148357447770893]
大規模言語モデル(LLM)は、しばしば自信を持ち、雄弁で、よく理解されている。
彼らは知らないことを知っていますか。
我々は,LLMがその知識の境界を適切に認識するかどうかを評価するための新しい指標を開発した。
論文 参考訳(メタデータ) (2026-09-07T18:40:08Z) - FramingQA: Does the Question Shape the Answer? Measuring the Compositional Framing Effect [69.8983512616053]
大規模な言語モデルは、しばしばユーザによる暗黙のスタンスと一致する微妙な言い換えに応答を変更する。
これによってユーザーは、根拠となる事実ではなく、どのようにして質問を言い表したかというアドバイスをユーザーに残すことができる。
FramingQAは、法律、医学、ファイナンス、ロボットシミュレーションにまたがるフレーミングに疑問を呈するモデル感度を測定するベンチマークである。
論文 参考訳(メタデータ) (2026-09-07T12:56:44Z) - How Correct Is Your Answer? A Semantic Correctness Framework for Open QA Evaluation [38.482877747109946]
本研究では,8つのクラスに有意な回答を割り当てる意味的正当性分類を導入し,有意な内容によって汚染されたものから有意な回答を分離する。
次に、広く使用されているQAデータセットにまたがる8.8kサンプルベンチマークであるCAP-Correctnessと、質問応答ペアを宣言文に変換する11kサンプルデータセットであるCAP-Statementsをリリースする。
第三にCAP(Context-Aware Precision)は、双方向NLIを用いて質問条件文をスコアする参照ベースのメトリクスである。
論文 参考訳(メタデータ) (2026-09-01T15:06:39Z) - Consistency Without Alignment: Item-Sensitive Language Models Indistinguishable From Random [0.0]
項目感度は、モデルの選択が自身の出力よりも特定の入力に依存するかどうかとして定義され、タスク能力の証拠として広く報告されている。
この証拠は、香港のボードゲーム『Deception: Murder: Hong Kong』から抜粋された強制選択シグナリングタスクを用いて、必要だが不十分であることを示す。
7つの言語モデル、2つのモデルファミリー、訓練後のアブレーション、3つの独立したスコアリングルールは、21のモデル・バイ・ルール・セルのうちの1つが確実にアイテムに敏感である。
我々はこの一貫性をアライメントなしで呼び、アイテム感度、置換整合性に依存するあらゆる評価に一般化する。
論文 参考訳(メタデータ) (2026-09-01T02:12:10Z) - Feature Priming in Online Linear Regression: Sparse-Regret Lower Bounds and a Tight Univariate Rate [47.36630149538994]
高次元のオンライン予測では、最良の予測子はいくつかの機能にのみ依存する可能性があるため、後悔は周囲の次元ではなく、疎らさでスケールすべきである。
WarmuthとAmidはCOLT 2023で、これらの3つのルールのいずれかが競合するオンライン後悔の保証を認めているかどうかを尋ねた。
安価なニュアンスは、リフィットが真の予測座標を過度に重くする原因となる。
論文 参考訳(メタデータ) (2026-08-18T09:32:03Z) - Abliteration Is Not a Scalpel: Off-Target Effects of Refusal Removal on Decision Disposition Across Model Families [51.56484100374058]
放棄 — モデルの拒絶方向を重みから取り除く — は、一般的な"アンセンソルド"なオープンウェイトモデルの標準的なレシピである。
ディスポジションプローブとして21,600個の決定を不確実性の下で使用し、凍結パイプラインを通じて再生することにより、決定層モデルが唯一の変数となる。
3つのエフェクトは2つのファミリーにまたがって複製される(ゼロを除く週間クラスターCI)
4つ目の効果は符号を逆転する:同じ操作によりGemmaで読み取られた方が自信が弱まり、Qwenで読み取られたものがより多くなる(ファミリーCIは重複しない)。
論文 参考訳(メタデータ) (2026-07-19T22:27:00Z) - How Much Human Label Variation Does Formal Semantic Structure Explain?: Group-Level Effects and Item-Level Ceilings in NLI [1.9177583131035885]
自然言語推論における人間のラベルの変化は、ノイズよりも信号として扱われることが増えている。
ルールベース演算子と単調タグを用いたChaosNLIのSNLIとMNLIの3,113項目をMEDに対して検証した。
このサンプルでは、形式的な意味構造は、アノテータが少人数で不一致しているかどうかをシフトし、それらが不一致していることを検出できない。
論文 参考訳(メタデータ) (2026-07-17T11:34:30Z) - Detecting Hallucinations in Retrieval-Augmented Generation through Grounding-Aware Sensitivity by Perturbation (GASP) [1.827510863075184]
Grounding-Aware Sensitivity by Perturbation (GASP) は、抽出された証拠にどれだけ強く依存するかによって、各回答文をスコアするスパンレベル検出器である。
GASPは、完全なコンテキスト下で修正され、コンテキストなしで再スコアされ、各チャンクが削除された後、ログライクなドロップとJensen-Shannonの発散を測定する。
2つのモデルファミリーの3つのインストラクションチューニングスコアを用いた3つのベンチマーク(RAGTruth, TofuEval, RAGBench)でGASPを評価する。
論文 参考訳(メタデータ) (2026-07-05T10:35:30Z) - On the Structural Non-Preservation of Epistemic Behaviour under Policy Transformation [51.56484100374058]
このような情報条件の相互作用パターンを振る舞い依存として定式化する。
これにより、$$-behavioural equivalenceというプローブ相対的な概念と、政治内行動距離が導かれる。
その結果、共通政策変換の下でプローブ条件の挙動分離が保存されない構造条件が明らかになった。
論文 参考訳(メタデータ) (2026-02-24T22:55:21Z) - Towards Self-Supervised Covariance Estimation in Deep Heteroscedastic Regression [102.24287051757469]
深部異方性回帰における自己教師付き共分散推定について検討する。
正規分布の間の2-ワッサーシュタイン距離の上界を導出する。
幅広い合成データセットと実データセットに対する実験により、提案された2-ワッサーシュタインと擬似ラベルアノテーションが結合した結果、計算的に安価で正確な深部ヘテロ代用回帰が導かれることが示された。
論文 参考訳(メタデータ) (2025-02-14T22:37:11Z) - Constructing interval variables via faceted Rasch measurement and
multitask deep learning: a hate speech application [63.10266319378212]
本稿では,教師付き深層学習と多面的ラッシュアイテム応答理論(IRT)構築手法を組み合わせることで,連続区間スペクトル上の複素変数を測定する手法を提案する。
われわれは、YouTube、Twitter、Redditから5万件のソーシャルメディアコメントを収集し、1万1000人の米国拠点のAmazon Mechanical Turkの労働者によってラベル付けされたデータセット上で、この新しい手法を実証した。
論文 参考訳(メタデータ) (2020-09-22T02:15:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。