論文の概要: Auditing Question-Order Effects in Large Language Models with the QQ Equality: Mechanism Characterization and a Saturation Caveat
- arxiv url: http://arxiv.org/abs/2607.17219v1
- Date: Sun, 19 Jul 2026 12:22:06 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-21 18:48:37.395488
- Title: Auditing Question-Order Effects in Large Language Models with the QQ Equality: Mechanism Characterization and a Saturation Caveat
- Title(参考訳): QQ品質を持つ大規模言語モデルにおける質問順の影響:メカニズム評価と飽和曲線
- Authors: Pilsung Kang,
- Abstract要約: 人間の調査回答者はQQ(量子質問)平等を満たす質問順序効果を示す。
自己回帰的大言語モデルの逐次判断のための監査基準としてQQ等式を開発する。
- 参考スコア(独自算出の注目度): 4.07636450847048
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Human survey respondents exhibit question-order effects that satisfy the QQ (quantum question) equality, an a priori, parameter-free prediction of the projective quantum question-order model. We develop the QQ equality into an audit criterion for sequential judgments of autoregressive large language models (LLMs). Theoretically, we characterize which mechanism classes satisfy it robustly: marginal-independent kernels satisfy QQ iff all four mismatch transition rates coincide (a class containing the 2D rank-1 projective model with a fixed measurement pair under state variation); a polarity- and position-dependent repetition family is characterized by an exact cross-symmetry condition with closed-form violations; QQ-satisfying behaviors are closed under order-matched mixing; and the rank-2 Contextuality-by-Default criterion translates into audit coordinates as $|\qQQ|\le\OSS$, where $\OSS$ (the order-sensitivity score) totals the order sensitivity of the two marginals. Methodologically, we develop a pre-specified, audit-logged pipeline applicable to any model exposing next-token log-probabilities; it combines worst-case robustness envelopes, sampling-consistency spot checks, full label counterbalancing, and a saturation diagnostic. Empirically, in a first-signal pilot on an open-weight instruction-tuned model under two framings, all pre-specified health gates passed, yet 17/18 and 7/8 item pairs, respectively, were saturated (near-deterministic), and no item was certified residually contextual. Forced-binary next-token log-probabilities were thus inadequate for distribution-level QQ audits under the tested model and prompting conditions; we recommend pre-specified saturation diagnostics whenever next-token distributions are treated as survey-response distributions.
- Abstract(参考訳): 人間の調査回答者は、QQ(量子質問)の等式を満たす質問順序効果を示す。
自己回帰型大規模言語モデル(LLM)の逐次判断のための監査基準としてQQ等式を開発する。
境界非依存のカーネルがQQの4つのミスマッチ遷移率すべてに一致する(状態変動の下での2次元階数-1射影モデルを含むクラス)、極性および位置依存の繰り返し族は、閉じた形式違反を伴う正確な対称性の条件で特徴づけられる、QQに満足する振る舞いは、オーダーマッチングされた混合の下で閉じられる、ランク2のコンテキスト-バイ-Defaultの基準は監査座標に変換され、$|\qQQ|\le\OSS$となる。
提案手法は, 最短ケースのロバストネスエンベロープ, サンプリング整合性スポットチェック, ラベルのフルバランス, 飽和診断を組み合わせた, 次世代のログ確率を示すモデルに適用可能な, 事前仕様の監査ログパイプラインを開発する。
実験では、2つのフレーミングの下で、オープンウェイトな指導訓練モデル上で、すべての事前指定された健康ゲートが通過したが、それぞれ17/18と7/8のアイテムペアが飽和しており(ほぼ決定論的)、残余の文脈で確認されなかった。
そこで, テストモデル下での分散レベルQQ監査や条件の促進には, 強制二分二次次対数確率が不十分であり, 次対数分布をサーベイ応答分布として扱う場合, 予め特定した飽和度診断を推奨する。
関連論文リスト
- Decoding in Order-Agnostic Language Models: Chain-Rule Deviation and Uniform Spreading [0.6916773850242582]
順序に依存しない言語モデル(OALM)は任意の条件セットの下でマスク付きトークンを予測するために訓練される。
学習条件はコヒーレントな関節分布の正確な分解ではないことを示す。
信頼性トレースの形状に基づく相補的診断を提案する。
論文 参考訳(メタデータ) (2026-05-31T04:25:36Z) - A Semantic-Sampling Framework for Evaluating Calibration in Open-Ended Question Answering [19.55210880950831]
予測されたモデルの信頼度がその経験的精度と一致しているかを測り、大規模言語モデル(LLM)の信頼性デプロイメントの中心となる。
オープンエンド質問応答(QA)のための校正評価フレームワークSem-ECEを紹介する。
フレームワーク内の2つの推定器について検討する。同じサンプルの自己整合性スコアであるSem$-ECEと、自信評価から回答の選択を分離する保留変数であるSem$-ECEである。
論文 参考訳(メタデータ) (2026-05-08T19:53:49Z) - From Calibration to Refinement: Seeking Certainty via Probabilistic Evidence Propagation for Noisy-Label Person Re-Identification [40.73759251488672]
既存のノイズロスのある人物Re-ID法は、ソフトマックス出力を用いた損失補正やサンプル選択方式に依存している。
本稿では,キャリブレーションからリファインメントへ伝播する確率的証拠を通じて確実性を求める2段階フレームワークであるCARE法を提案する。
精製段階では, クリーン試料とノイズ試料をより正確に識別できるエビデンス伝搬精製法(EPR)を設計する。
論文 参考訳(メタデータ) (2026-02-26T15:50:15Z) - Statistical Inference for Matching Decisions via Matrix Completion under Dependent Missingness [6.28693385008859]
本研究では,3つの正準機構,すなわち1対1,1対1のランダム到着と1対1のランダム到着,および2対2のランダム到着の非最適進入アルゴリズムを提案する。
実験により,提案手法は精度の高い信頼区間推定と効率的な評価を提供することを示した。
論文 参考訳(メタデータ) (2025-10-30T13:31:32Z) - Unsupervised Conformal Inference: Bootstrapping and Alignment to Control LLM Uncertainty [49.19257648205146]
生成のための教師なし共形推論フレームワークを提案する。
我々のゲートは、分断されたUPPよりも厳密で安定した閾値を提供する。
その結果は、ラベルのない、API互換の、テスト時間フィルタリングのゲートになる。
論文 参考訳(メタデータ) (2025-09-26T23:40:47Z) - Mitigating LLM Hallucinations via Conformal Abstention [70.83870602967625]
我々は,大言語モデルが一般ドメインでの応答をいつ無視すべきかを決定するための,原則化された手順を開発する。
我々は、幻覚率(エラー率)の厳密な理論的保証の恩恵を受けるため、共形予測手法を活用して、禁忌手順を開発する。
実験によって得られた共形禁忌法は, 種々の閉書, オープンドメイン生成質問応答データセットに, 幻覚率を確実に拘束する。
論文 参考訳(メタデータ) (2024-04-04T11:32:03Z) - Regularized Vector Quantization for Tokenized Image Synthesis [126.96880843754066]
画像の離散表現への量子化は、統合生成モデリングにおける根本的な問題である。
決定論的量子化は、厳しいコードブックの崩壊と推論段階の誤調整に悩まされ、一方、量子化は、コードブックの利用率の低下と再構築の目的に悩まされる。
本稿では、2つの視点から正規化を適用することにより、上記の問題を効果的に緩和できる正規化ベクトル量子化フレームワークを提案する。
論文 参考訳(メタデータ) (2023-03-11T15:20:54Z) - Breaking the Spurious Causality of Conditional Generation via Fairness
Intervention with Corrective Sampling [77.15766509677348]
条件生成モデルは、トレーニングデータセットから急激な相関を継承することが多い。
これは別の潜在属性に対して不均衡なラベル条件分布をもたらす。
この問題を緩和するための一般的な2段階戦略を提案する。
論文 参考訳(メタデータ) (2022-12-05T08:09:33Z) - Distribution-free uncertainty quantification for classification under
label shift [105.27463615756733]
2つの経路による分類問題に対する不確実性定量化(UQ)に焦点を当てる。
まず、ラベルシフトはカバレッジとキャリブレーションの低下を示すことでuqを損なうと論じる。
これらの手法を, 理論上, 分散性のない枠組みで検討し, その優れた実用性を示す。
論文 参考訳(メタデータ) (2021-03-04T20:51:03Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。