論文の概要: Scored vs. Generated Readouts in Behavioral Language Models: An Empirical Study of Elicitation Format
- arxiv url: http://arxiv.org/abs/2609.09882v1
- Date: Wed, 09 Sep 2026 08:37:46 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-10 19:44:08.953554
- Title: Scored vs. Generated Readouts in Behavioral Language Models: An Empirical Study of Elicitation Format
- Title(参考訳): 行動言語モデルにおけるscored vs. Generated Readouts: 引用形式に関する実証的研究
- Abstract要約: 回答トークンのスコアリングによって得られる確率と、文章の合理化後に生成された予測とを比較した。
13個のモデルドメイン細胞が4つの小売業務を網羅し、13個の細胞のうち12個で結果がより正確にランク付けされた。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Language models fine-tuned on customer behavior can predict outcomes and generate explanations, but these readouts are often treated as interchangeable. Holding model checkpoint and prompt content fixed, we compare probabilities obtained by scoring answer tokens with predictions generated after a written rationale. Across 13 model-domain cells covering four retail tasks in three markets, including two using fully public data and checkpoints, the scored readout ranks outcomes more accurately in 12 of 13 cells (two-sided sign test, p approximately 0.003), by 1.5 to 14.5 points in area under the receiver operating characteristic curve (AUC). Paired bootstrap confidence intervals exclude zero in every newly measured cell. The gap varies with task-specific supervision and mismatch between training and serving formats, ranging from -2.2 points for an untuned base model to +13.7 for rationale-format supervision. Analysis of approximately 9,000 rationales identifies two correlates: reduced reliance on the dominant predictive feature and convergence on stock formulations. Probability saturation does not track the gap. A third readout, eliciting a probability before any verdict, improves calibration (Brier score from 0.47 to 0.15) while ranking within noise of scoring, but only for outcome rates represented in training; it is worse than scoring when the scored head is already calibrated. We interpret these differences through the objectives matched by each readout, identify training choices that narrow the gap, and propose retaining generated rationales while sourcing ranking from the scored head.
- Abstract(参考訳): 顧客の行動に微調整された言語モデルは、成果を予測し、説明を生成することができるが、これらの読み出しはしばしば交換可能なものとして扱われる。
モデルチェックポイントとプロンプトコンテンツを固定した上で,回答トークンのスコアリングによって得られた確率と,文章の合理化後に生成された予測とを比較した。
完全公開データとチェックポイントの2つを含む3つの市場における4つの小売業務をカバーする13個のモデルドメインセルの合計は、13個のセルのうち12個(両側のサインテスト、約0.003)において、受信操作特性曲線(AUC)の下で1.5から14.5ポイントの精度でランク付けされる。
ペアリングされたブートストラップの信頼区間は、新しく測定されたセルごとにゼロを除外する。
このギャップは、トレーニングとサービス形式の間のタスク固有の監督とミスマッチによって異なり、未調整のベースモデルの-2.2ポイントから合理化形式の監督のための+13.7まで様々である。
約9,000の有理数の解析は、支配的な予測的特徴への依存の減少と、株価の定式化への収束の2つの相関を識別する。
確率飽和はギャップを追跡できない。
判定前の確率を付与する第3の読み出しは、スコアのノイズの中でランク付けしながらキャリブレーションを改善する(ブリアスコアは0.47から0.15)が、トレーニングで表される結果率に限られる。
それぞれの読み出しによって一致した目的を通じてこれらの違いを解釈し、ギャップを狭める訓練選択を特定し、スコアヘッドからランキングを抽出しながら生成した合理性を維持することを提案する。
関連論文リスト
- Target-Checked Reliability Score Refinement for Video Question Answering [3.8271803328378677]
モデルの再トレーニングや回答の変更を伴わずに、目標シフトの下で回答レベルの信頼性スコアを改善できるかどうかを検討する。
3つの固定されたビデオ言語モデルから、4つの決定論的ビデオサンプリングに基づいてオプション確率リストを収集する。
選択した回答に割り当てられた確率として定義される原点スコアと,開発データセットに基づいて学習したヒストグラムに基づく勾配ボスティング(HGB)スコアを比較した。
候補は、ビデオレベルの繰り返しチェックがポジティブで安定した改善を示す場合にのみ、元のスコアを置き換える。
論文 参考訳(メタデータ) (2026-09-09T08:29:00Z) - Anchoring Bias in LLM-as-a-Judge Systems: Prior Scores Compromise Evaluation Independence [0.7340017786387767]
先行スコアは,文脈メタデータにのみ含まれていても,判断をアンカーし,評価を評価値に体系的にシフトすることを示す。
人間のラベル付き地上真実によるカテゴリー産業データでは、アンカーされたメタデータは誤り訂正の48%をブロックし、割り当てられた間違ったラベルに対して正しい判断の10.18%をフリップする。
論文 参考訳(メタデータ) (2026-08-26T14:41:24Z) - Recursive Agentic Reasoning [4.7490116928645065]
反復精製、分解、繰り返しサンプリングといったテスト時間推論手法は、しばしば分離して評価される。
エージェントの推論トレース上の再帰演算子として,これらの手法の統一ビューを導入する。
同一のプロンプト、トークン予算、グレーディングコードを持つ共有ハーネスの下で、3つの演算子全てをシングルパスチェーン・オブ・ソートベースラインに対して評価する。
論文 参考訳(メタデータ) (2026-08-25T01:34:08Z) - PerceptionRubrics: Calibrating Multimodal Evaluation to Human Perception [75.70273182182397]
PerceptionRubricsはルーブリックベースの評価フレームワークである。
飽和ベンチマークスコアと現実世界の脆さのギャップに対処する。
1,038枚のインフォメーションセンス画像と1万個以上のインスタンス固有のルーリックをペアリングする。
論文 参考訳(メタデータ) (2026-06-26T17:59:15Z) - Reliable to Expressive: A Curriculum for Rubric-Following Safety Judges [2.8523456804049885]
安全審査員は、進化する基準に対してモデルアウトプットを評価するためにますます配置される。
最近のメタ評価研究は、プロンプトとルーブリックの変動下では脆く保たれていることを示している。
本稿では,インスタンス条件の動的ルーブリックと,信頼性と表現性を備えたカリキュラムを組み合わせたトレーニング戦略を提案する。
論文 参考訳(メタデータ) (2026-06-08T08:02:57Z) - Right Makes Might: Aligning Verified Hidden States Empowers RL Reasoning [55.264863369127774]
現在の方法では、それぞれの正しいロールアウトを単一の報酬ビットに減らし、隠れた状態間で共有される幾何学的構造を無視している。
本稿では,RLトレーニングにおけるアンカートークンにおける正ロールアウトの最終層を,トレーニングと推論の両方においてゼロオーバーヘッドで整列する補助損失関数Hidden-Alignを提案する。
8つの数学的推論ベンチマークでは、Hidden-AlignはDAPOベースラインの平均パス@1をQwen3-1.7B, 4B, 14Bで3.8, 6.2, 5.4ポイント改善し、3つのスケールで一貫したパス@kゲインを得る。
論文 参考訳(メタデータ) (2026-06-02T06:51:15Z) - What Single-Prompt Accuracy Misses: A Multi-Variant Reliability Audit of Language Models [0.0]
シングルプロンプト精度は、言語モデルをベンチマークする主要な方法であるが、重要な信頼性障害を見逃す可能性がある。
15モデルオープンウェイトコーパスの評価を行い,5つの分類と推論ベンチマークによる10のインストラクトモデルに着目した信頼性解析を行った。
まず、評価設計は結論を根本的に変えることができる。
第2に、信頼信号は脆弱である。MMLU-Proでは、各プライマリモデルは、その精度と同一行上のトークン確率信頼の両方よりもかなり高い信頼度を言語的に報告し、単一のプロンプト変種における単一のモデルに対して、動詞のパースレートが崩壊する可能性がある。
論文 参考訳(メタデータ) (2026-05-03T20:05:08Z) - Claw-Eval: Toward Trustworthy Evaluation of Autonomous Agents [66.97968363332465]
エージェントベンチマークの3つのギャップに対処するエンドツーエンド評価スイートであるClaw-Evalを紹介した。
Claw-Evalは3つのグループにまたがる9つのカテゴリにまたがる300の人間検証タスクで構成されている。
すべてのエージェントアクションは、3つの独立したエビデンスチャネルを通じて記録される。
論文 参考訳(メタデータ) (2026-04-07T17:43:18Z) - SpatialBench-UC: Uncertainty-Aware Evaluation of Spatial Prompt Following in Text-to-Image Generation [0.0]
SpaceBench-UCは、ペアの空間関係を再現可能な小さなベンチマークである。
ベンチマークパッケージ、バージョン付きプロンプト、ピン付き構成、サンプルごとのチェッカー出力、レポートテーブルをリリースします。
安定拡散1.5, SD 1.5 BoxDiff, SD 1.4 GLIGENの3つのベースラインについて検討した。
論文 参考訳(メタデータ) (2026-01-19T23:37:10Z) - Reference-Free Rating of LLM Responses via Latent Information [53.463883683503106]
本研究では,判断モデルに対して,自由テキスト応答にQuattスケールのスコアを割り当てるよう依頼する一般的な実践について検討する。
次に、内部モデル信号からスカラー評価を導出する潜在裁判官を提案し、評価する。
ペアとシングルレーティングのベンチマークの幅広いスイートの中で、潜在メソッドは標準のプロンプトにマッチするか、超えている。
論文 参考訳(メタデータ) (2025-09-29T12:15:52Z) - Selective Classification Can Magnify Disparities Across Groups [89.14499988774985]
選択的分類は平均的精度を向上させることができるが、既存の精度格差を同時に増大させることができる。
禁忌の増大は、一部のグループでのアキュラシーを減少させることもある。
我々は,グループ間で類似のフルカバレッジ精度を実現する分散ロバストモデルを訓練し,選択分類が各グループを均一に改善することを示す。
論文 参考訳(メタデータ) (2020-10-27T08:51:30Z) - Distribution-free binary classification: prediction sets, confidence
intervals and calibration [106.50279469344937]
分布自由条件における二項分類のための不確実性定量化(キャリブレーション、信頼区間、予測セット)の3つの概念について検討する。
固定幅と一様質量の両双対の双対確率に対する信頼区間を導出する。
我々の「三脚」定理の結果として、双有理確率に対するこれらの信頼区間は分布自由キャリブレーションに繋がる。
論文 参考訳(メタデータ) (2020-06-18T14:17:29Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。