論文の概要: PACT: Pairwise-Anchored Calibrated Tuning for Single-Token Typed Decisions
- arxiv url: http://arxiv.org/abs/2609.35865v1
- Date: Sat, 26 Sep 2026 01:07:09 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-30 21:28:46.868834
- Title: PACT: Pairwise-Anchored Calibrated Tuning for Single-Token Typed Decisions
- Title(参考訳): PACT: Pairwise-Anchored Calibrated Tuning for Single-Token Typed Decisions
- Abstract要約: 単一トークン型決定モデルは、少数の1文字の応答コードのロジットを1つの位置で読み取ることで、スキーマ問題に答える。
本研究では,データを比較ペアとしてキュレートしたモデルについて検討する。
我々は、この構造を新しいアノテーションを必要としない4つのトレーニング用語に変換するPACTを提案する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Single-token typed-decision models answer a schema question by reading the logits of a few one-letter answer codes at a single position: they are fast and return a probability for every allowed answer, but they are trained with plain cross-entropy that ignores most of the structure in their training data. We study such a model whose data is curated as contrastive pairs---two contexts that differ in one edited fact that flips the answer---each carrying a machine-checked certificate that deleting the decisive sentence makes the fact unknown. We propose PACT, which turns this structure into four training terms that need no new annotation: a difference-in-differences margin over each pair that is invariant to any shared logit offset, a permutation-consistency term against answer-code position bias, an evidence-necessity term on certificate-verified ablated contexts, and an ordinal transport cost for rubric fields, plus a three-parameter contextual temperature. On a frozen 324-item holdout with three seeds, PACT matches the published recipe in accuracy ($84.6\%$ vs. $85.2\%$; McNemar $p \ge 0.50$ at every seed) while giving the lowest position bias of all runs (answer flips under relabelling $9.8\%$ vs. $13.8\%$) and the lowest ordinal error on rubric fields (MAE $0.232$ vs. $0.311$). Against a control with the same optimiser and schedule but cross-entropy only, PACT is significantly more accurate at two of three seeds, halves the seed-to-seed spread and lowers NLL by $26\%$. Seed-matched ablations and pre-specified falsification tests locate these gains precisely: no single term raises raw accuracy, and the method's value lies in robustness and stability rather than headline accuracy. Code, data splits, trained adapters, and all run records are available at https://github.com/BennyLinntu/PACT-Pairwise-Anchored-Calibrated-Tuning-for-Single-Token-Typed-Decis ions.
- Abstract(参考訳): シングルトークン型決定モデルは、いくつかの1文字の応答コードのロジットを1つの位置で読み取ることで、スキーマ問題に答える: 高速で、全ての回答に対して確率を返すが、トレーニングデータのほとんどの構造を無視した、プレーンなクロスエントロピーでトレーニングされる。
比較的ペアとしてデータをキュレートしたモデルについて検討する。2つのコンテキストは、その解答を反転させる1つの編集事実が異なる - 決定文を削除したマシンチェック証明書をそれぞれ持っていて、その事実が不明になる。
我々は,この構造を新たなアノテーションを必要としない4つのトレーニング用語に変換する PACT を提案する: 共有ロジットオフセットに不変な各ペアに対する差分差分マージン, 応答符号位置バイアスに対する置換整合項, 証明検証された短縮コンテキストに対する証拠必要項, および3パラメータの文脈温度。
冷凍された324イテムホールドアウトに3つのシードが入り、PACTは発行されたレシピを精度でマッチさせる(84.6\% vs. 8,5.2\%$; McNemar $p \ge 0.50$ at every seed)と同時に、すべてのランの最低位置バイアス(9.8\% vs. $113.8\%$)を与え、ルーリックフィールドの最低順序誤差(MAE $0.232$ vs. 0.11$)を与える。
同じオプティマイザとスケジュールを持つが、クロスエントロピーのみの制御に対して、PACTは3つの種子のうち2つの種子において有意に正確であり、種子から種子への拡散を半分にし、NLLを26\%$に下げる。
単一の項が生の精度を上げることはなく、その方法の価値は見出しの精度よりも頑丈さと安定性にある。
コード、データ分割、トレーニングされたアダプタ、およびすべての実行レコードはhttps://github.com/BennyLinntu/PACT-Pairwise-Anchored-Calibrated-for-Single-Token-Typed-Decisionsで入手できる。
関連論文リスト
- Counterfactual Probing for Parallel Unmasking with Hidden Forest Structure [50.58119214447535]
Masked生成モデルは並列トークン予測を提供するが、正確な並列サンプリングはトークン間の依存関係を考慮しなければならない。
本研究は,発見を含む全評価がシーケンス長$N$のサブ線形であるかどうかを考察する。
本研究では, 森林構造を隠蔽した離散分布を, 固定された近似条件オラクルを通してアクセスする。
論文 参考訳(メタデータ) (2026-09-29T15:39:50Z) - ZO-COSMO: Index-Free One-Hop Mixing for Decentralized Zeroth-Order Optimization [8.805992680570933]
平均保存マスクコンセンサスと2クエリ推定を結合したtextsfZO-COSMO を開発した。
グローバルサポートは、すべての隣のミキシングを提供し、一致した更新は、各ペア内でのみ合意を必要とする。
一致するクラス内のスカラー毎の鋭い収縮境界と、コアおよびスパースモーメント更新の収束保証を導出する。
論文 参考訳(メタデータ) (2026-09-23T01:05:56Z) - IndicQE-APE: A Benchmark for Quality Estimation and Automatic Post-Editing for Indic Languages [77.88427845181154]
我々はWMT 2020-2024の共有タスクの系統を、英語のリソースを拡張してインディクシーに集約する:9つの方向対に対して126,754ドルのインスタンス。
セグメントレベルのQEでは,LSMが6つ,COMETが3つ,APEでは3つのシステムをベンチマークした。
論文 参考訳(メタデータ) (2026-08-17T09:50:52Z) - Teach it to stop, not just to click [0.0]
修復された政策の成功率は上流の足場に支配されていることを示す。
通常のk-seedレポートのためのライブラリ(cua_reliability)をリリースする。
論文 参考訳(メタデータ) (2026-07-19T08:46:06Z) - Re-feeding Is Not Replaying: Measuring Replay Noise in Counterfactual Token-Credit Estimation [0.0]
言語モデルのロールアウトにおいて、どのトークンが最終回答が正しいか間違っているかを尋ねる。
我々は、この仮定がストック推論エンジンのコストを3パスの設計で測定する。
6つの構成と3つのモデルにまたがって、リフィーディングはレプリカフロアよりも14-28ポイント高いレートでクレジットの見積もりを変更する。
論文 参考訳(メタデータ) (2026-06-14T06:09:16Z) - Correction and Corruption: A Two-Rate View of Error Flow in LLM Protocols [51.56484100374058]
そこで本研究では,単一プロトコルステップを正確なマッチングタスクで監査するためのペアアウトカム計測インタフェースを提案する。
各インスタンスについて、インターフェースはベースラインの正当性ビットと後ステップの正当性ビットを記録する。
これらのレートは精度の変化を予測し、種、混合物、パイプライン間でテスト可能な再利用可能な経験的インターフェースを定義する。
論文 参考訳(メタデータ) (2026-04-20T13:25:40Z) - Reinforcement Learning with Verifiable yet Noisy Rewards under Imperfect Verifiers [90.50039419576807]
RLVR(Reinforcement Learning with Verifiable Rewards)は、人為的なラベル付けを避けるために、自動検証に対するポリシーを訓練する。
認証ハッキングの脆弱性を軽減するため、多くのRLVRシステムはトレーニング中にバイナリ$0,1$の報酬を破棄する。
この選択にはコストがかかる:textitfalse negatives(正しい回答、FNを拒絶)とtextitfalse positives(間違った回答、FPを受け入れる)を導入する。
論文 参考訳(メタデータ) (2025-10-01T13:56:44Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。