論文の概要: Consistency Without Alignment: Item-Sensitive Language Models Indistinguishable From Random
- arxiv url: http://arxiv.org/abs/2609.00576v1
- Date: Tue, 01 Sep 2026 02:12:10 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.238229
- Title: Consistency Without Alignment: Item-Sensitive Language Models Indistinguishable From Random
- Title(参考訳): アライメントのない一貫性: アイテム感性言語モデルがランダムと区別できない
- Authors: Cris Huynh,
- Abstract要約: 項目感度は、モデルの選択が自身の出力よりも特定の入力に依存するかどうかとして定義され、タスク能力の証拠として広く報告されている。
この証拠は、香港のボードゲーム『Deception: Murder: Hong Kong』から抜粋された強制選択シグナリングタスクを用いて、必要だが不十分であることを示す。
7つの言語モデル、2つのモデルファミリー、訓練後のアブレーション、3つの独立したスコアリングルールは、21のモデル・バイ・ルール・セルのうちの1つが確実にアイテムに敏感である。
我々はこの一貫性をアライメントなしで呼び、アイテム感度、置換整合性に依存するあらゆる評価に一般化する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Item-sensitivity, defined as whether a model's choice depends on the specific input rather than on its own output prior, is widely reported as evidence of task competence. We show this evidence is necessary but not sufficient using a forced-choice signalling task abstracted from the board game Deception: Murder in Hong Kong. In this environment, the reference points against which a coordinate should be judged (a fit-maximising strategy, a posterior-maximising strategy, and uniform random selection) are all computable in closed form. Across seven language models, two model families, a post-training ablation, and three independent scoring rules, every one of 21 model-by-rule cells is reliably item-sensitive. Yet 8 of those 21 cells are not statistically distinguishable from a chooser that ignores the item and selects at random, and 5 score worse than random at describing the target. Item-sensitivity and distance from random correlate at only r = 0.30. We call this consistency without alignment and argue it generalises to any evaluation that relies on item-sensitivity, permutation consistency, or self-consistency without an independent reference for the measured quantity. We further find that a literal-similarity baseline with no pragmatics outperforms most tested language models, that adding a pragmatic layer over two baseline similarity sources moves choosers toward random rather than toward the Bayesian reference, and that a standard labelled multiple-choice format carries no measurable content signal here. All results represent the model side of a pre-registered instrument; a matched human condition is designed and piloted but not yet collected.
- Abstract(参考訳): 項目感度は、モデルの選択が自身の出力よりも特定の入力に依存するかどうかとして定義され、タスク能力の証拠として広く報告されている。
この証拠は、香港のボードゲーム『Deception: Murder: Hong Kong』から抜粋された強制選択シグナリングタスクを用いて、必要だが不十分であることを示す。
この環境では、座標を判断すべき基準点(適合最大化戦略、後続最大化戦略、均一ランダム選択)はすべて閉形式で計算可能である。
7つの言語モデル、2つのモデルファミリー、訓練後のアブレーション、3つの独立したスコアリングルールは、21のモデル・バイ・ルール・セルのうちの1つが確実にアイテムに敏感である。
しかし、これらの21の細胞のうち8つは、アイテムを無視してランダムに選択するセレクタと統計的に区別できない。
アイテム感度とランダムからの距離は、r = 0.30で相関する。
この一貫性をアライメントなしで呼び、アイテム感度、置換整合性、あるいは測定量に対する独立参照のない自己整合性に依存する評価に一般化する。
さらに、2つのベースライン類似性ソースに実用的層を追加することで、ベイズ参照ではなくランダムに選択できるようになり、標準のラベル付き多重選択形式は、ここで測定可能なコンテンツ信号を持たないことが判明した。
すべての結果は、事前登録された機器のモデル側を表しており、一致した人間の状態は設計され、操縦されるが、まだ収集されていない。
関連論文リスト
- Accuracy and Order Sensitivity Diverge Under Label-Free Strategies [4.127762845164668]
複数選択ベンチマークは、大きな言語モデルを評価するために広く使われている。
複数の選択は、選択順序に対する感度で知識を分割する。
本稿では,モデルが回答をコミットしながらオプションラベルを見るのを防ぐことが,位置の影響を除去するかどうかを検証する。
論文 参考訳(メタデータ) (2026-08-12T11:34:45Z) - The Matching Principle: A Geometric Theory of Loss Functions for Nuisance-Robust Representation Learning [0.5854803320592717]
線形ガウスモデル (Thm.A) における最適性を証明し, 展開のドリフトをゼロにする2次ペナルティに対する範囲被覆の必要性 (Thm.G) を示す。
13ブロック(MLからQwen2.5-7Bまで)のテストは、幾何と展開のドリフトに対する等方性対間違った方向の罰則と一致した。
Sigma_taskを推定し、Sigmaにマッチし、コントロールを実行し、タスクとジオメトリを別々にレポートする。
論文 参考訳(メタデータ) (2026-05-21T17:53:28Z) - EigenBench: A Comparative Behavioral Measure of Value Alignment [0.28707625120094377]
EigenBenchは、言語モデルの値をベンチマークするためのブラックボックスメソッドである。
合理的な判断者が正しいラベルに同意できない主観的な特性を定量化するように設計されている。
GPQAベンチマークのモデルランキングを、客観的ラベルにアクセスすることなく復元することができる。
論文 参考訳(メタデータ) (2025-09-02T04:14:26Z) - SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models [0.27309692684728604]
大規模言語モデル(LLM)は、選択肢の位置やラベルに固有のバイアスを生かして、複数の選択タスクの膨らませたスコアを達成できる。
本研究では,データセットに依存しない方法で選択バイアスを計測・緩和するSCOPEを提案する。
論文 参考訳(メタデータ) (2025-07-24T08:28:17Z) - Towards Self-Supervised Covariance Estimation in Deep Heteroscedastic Regression [102.24287051757469]
深部異方性回帰における自己教師付き共分散推定について検討する。
正規分布の間の2-ワッサーシュタイン距離の上界を導出する。
幅広い合成データセットと実データセットに対する実験により、提案された2-ワッサーシュタインと擬似ラベルアノテーションが結合した結果、計算的に安価で正確な深部ヘテロ代用回帰が導かれることが示された。
論文 参考訳(メタデータ) (2025-02-14T22:37:11Z) - Confidence-Based Model Selection: When to Take Shortcuts for
Subpopulation Shifts [119.22672589020394]
モデル信頼度がモデル選択を効果的に導くことができるConfidence-based Model Selection (CosMoS)を提案する。
我々はCosMoSを,データ分散シフトのレベルが異なる複数のテストセットを持つ4つのデータセットで評価した。
論文 参考訳(メタデータ) (2023-06-19T18:48:15Z) - Robust Outlier Rejection for 3D Registration with Variational Bayes [70.98659381852787]
我々は、ロバストアライメントのための新しい変分非局所ネットワークベース外乱除去フレームワークを開発した。
そこで本稿では, 投票に基づく不整合探索手法を提案し, 変換推定のための高品質な仮説的不整合をクラスタリングする。
論文 参考訳(メタデータ) (2023-04-04T03:48:56Z) - Modeling Sequences as Distributions with Uncertainty for Sequential
Recommendation [63.77513071533095]
既存のシーケンシャルメソッドの多くは、ユーザが決定論的であると仮定する。
項目-項目遷移は、いくつかの項目において著しく変動し、ユーザの興味のランダム性を示す。
本稿では,不確実性を逐次モデルに注入する分散型トランスフォーマーシークエンシャルレコメンデーション(DT4SR)を提案する。
論文 参考訳(メタデータ) (2021-06-11T04:35:21Z) - Consensus-Guided Correspondence Denoising [67.35345850146393]
本稿では,地域間コンセンサス学習フレームワークと対応関係を異色化し,対応関係をロバストに識別する。
ローカル地域からグローバル地域への動的グラフから推定されるコンセンサススコアに基づいて,信頼度の高い候補を初期マッチングから蒸留する新しい「プルーニング」ブロックを導入した。
本手法は、堅牢なラインフィッティング、ワイドベースライン画像マッチング、画像ローカリゼーションベンチマークを顕著なマージンで上回る。
論文 参考訳(メタデータ) (2021-01-03T09:10:00Z) - AvgOut: A Simple Output-Probability Measure to Eliminate Dull Responses [97.50616524350123]
機能エンジニアリングなしで、どの発話やトークンが退屈であるかを動的に認識する対話モデルを構築します。
最初のモデルMinAvgOutは、各バッチの出力分布を通して、ダイバーシティスコアを直接最大化する。
第2のモデルであるラベルファインチューニング(LFT)は、多様性スコアによって連続的にスケールされたラベルをソースシーケンスにプリペイドし、多様性レベルを制御する。
3つ目のモデルであるRLは強化学習を採用し、多様性スコアを報奨信号として扱う。
論文 参考訳(メタデータ) (2020-01-15T18:32:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。