論文の概要: FAER: Auditable Utility-Aligned Trajectory Replay for Language Model Post-Training
- arxiv url: http://arxiv.org/abs/2610.00385v1
- Date: Wed, 30 Sep 2026 09:41:08 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 01:19:23.629954
- Title: FAER: Auditable Utility-Aligned Trajectory Replay for Language Model Post-Training
- Title(参考訳): FAER: 学習後の言語モデルのための聴取可能なユーティリティ指向の軌道リプレイ
- Abstract要約: リプレイセレクタは、しばしばフォーマットフィードバック、信頼、鮮度、応答長によってキャッシュされた軌跡をランク付けする。
この選択と学習のギャップを形式化し、FAERを監査可能なフルトラック再生フレームワークとして導入する。
- 参考スコア(独自算出の注目度): 21.87319355077669
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Replay selectors often rank cached trajectories by format feedback, confidence, freshness, or response length, although cache-level correctness and downstream learner utility are distinct objectives. We formalize this selection-to-learning gap and introduce FAER as an auditable full-trajectory replay framework. Its training-free fixed selector is a protocol baseline; FAER-UTILITY is the learner-aware selector fitted on disjoint calibration blocks. The normalized gradient alignment is reported as a baseline, while a disposable optimizer-aware virtual update supplies a magnitude-aware utility surface. The audit contract freezes observed fields and replay traces before evaluation labels are joined. On GSM8K with Qwen2.5-1.5B-Instruct, the matched learner study reports quality 0.6329 for the fixed selector, compared with 0.5482 for uniform and 0.6037 for format-feedback under 128 updates. Metadata-only cross-fitted calibration reaches $0.6476\!\pm\!0.0139$ over eight seeds (median 0.6481; paired 95% interval $[+0.079,+0.122]$) at 63,276 target-run tokens; its recorded full cost is 189,642 tokens and 3.48 GPU-hours including calibration. The completed FAER-UTILITY row reaches 0.6624 at 62,844 target-run tokens and 4.26 GPU-hours. Format-feedback selects records with correctness 0.6953, compared with 0.3594 for the fixed selector, despite the different downstream ranking. The completed comparison surfaces report the learner-aware ablation, same-seed gap, policy-optimization rows, and strict zero-shot transfer.
- Abstract(参考訳): リプレイセレクタは、フォーマットフィードバック、信頼性、鮮度、応答長によってキャッシュされた軌跡をランク付けすることが多いが、キャッシュレベルの正確さと下流学習ユーティリティは異なる目的である。
この選択と学習のギャップを形式化し、FAERを監査可能なフルトラック再生フレームワークとして導入する。
FAER-UTILITYは不整合校正ブロックに取り付けられた学習者対応セレクタである。
正規化勾配アライメントはベースラインとして報告され、使い捨てオプティマイザ対応の仮想更新は、マグニチュード対応のユーティリティサーフェスを提供する。
監査契約は、評価ラベルが結合する前に観察されたフィールドと再生トレースを凍結する。
Qwen2.5-1.5B-InstructのGSM8Kでは、一致した学習者は、固定セレクタの品質0.6329を報告している。
メタデータのみのクロスフィットキャリブレーションが$0.6476\!
さよなら!
0.0139$ over eight seed (median 0.6481; paired 95% interval $[+0.079,+0.122]$) at 63,276 target-run tokens; the record full cost is 189,642 tokens and 3.48 GPU-hours including calibration。
完了したFAER-UTILITY行は、62,844個のターゲットラントークンと4.26個のGPU時間で0.6624に達する。
Format-feedbackは、ダウンストリームランキングが異なるにもかかわらず、固定セレクタの0.3594に対して、正確性0.6953のレコードを選択する。
得られた比較結果から,学習者によるアブレーション,同種ギャップ,ポリシー最適化行,厳密なゼロショット転送が報告される。
関連論文リスト
- Offline Reinforcement Learning for Distribution-Grid Protection [42.05746375597851]
我々は,CIGRE中電圧ネットワークの静的軌跡からの線選択的トリップについて検討した。
畳み込みQネットワークは、因果電圧電流ファサーおよび見かけインピーダンス特徴を受信する。
その結果,密度予測性能と終端保護挙動がモデルランキングに影響を及ぼす可能性が示唆された。
論文 参考訳(メタデータ) (2026-09-21T14:49:04Z) - MemToC: Benchmarking Memory-Tool Conflict Resolution in Large Language Models [49.47300047353726]
MemToCは、実行時ツールによるポストツール-リターン仲裁のベンチマークである。
MemToCは、542の質制御された事実質問から構築された6,504回の評価エピソードで構成されている。
オープンウェイトな7-9Bモデルでは、ツールが強く支配的なクローズドブックの回答を返す。
論文 参考訳(メタデータ) (2026-08-26T18:22:03Z) - The Recall Trap: A Recall-Maximizing Retriever Configuration Reduces Issue Resolution in Fixed-Budget Code Context [45.88028371034407]
コード修復における制御ケーススタディを報告し,新しい現象ではない。
私たちは、同じスタック上の1つのフラグ(1チャンク毎の重複)を切り替えます。
BM25(3.2pp、重要なパラダイム間相互作用)を逆転させる。
厳格な固定予算では、ファイルごとのハードダイドプリケートや、タスクに対するA/Bパッケージングポリシは、メトリックフラグを調整しないことが示されます。
論文 参考訳(メタデータ) (2026-08-14T19:22:50Z) - WDL-OPD: Weak-Driven On-Policy Distillation via Mixture-Constrained Co-Training [48.290951447286744]
WDL-OPDは2つの訓練可能なポリシーを持つ混合制約付き協調訓練法である。
アンカーポリシはロールアウト毎に生成し、補助ポリシは同じ訪問状態を評価し、それらのトークン分布の幾何学的混合を逆KLで凍結教師にマッチングする。
凍結はPD$2とW2S-OPDと密接に関連するアンカープラスコントラストのプロキシターゲットを回復させるが,ジョイントトレーニングは静的デルタが表現できない分岐レベル自由度を生成する。
論文 参考訳(メタデータ) (2026-08-10T11:22:53Z) - Forgetful Attention: A Trainable Support-Vector Memory with Certified Selection and Exact Unlearning [0.16921396880325776]
固定ボックスパラメータCの1クラスSfpの支持係数が重みを持つメモリであるSupport Vector Attention(SV-Attention)を導入する。
アクティブセットのパーティションは、リザーブトークンを正確にゼロウェイト、出力ウェイトを与え、インクリメンタルインクリメンタルソルバトークンは、同じCの下で再トレーニングせずに生成した状態を回復する。
また,実文埋め込み上での外科的排除,正確な編集,患者記録の削除,忘れやすい検索メモリも示す。
論文 参考訳(メタデータ) (2026-07-13T23:13:57Z) - Efficient Visual Pointing for Embodied AI:Agent-Driven Data Synthesis, Cross-Block Attention, and Iterative Correction [55.11480729304395]
PointArena 2026は77.2%の精度でベンチマークで2位である。
ap proachは3つの障害モードをターゲットにしている。第一に、エージェント駆動のシンセシスは大きなセマンティクスとアンカー相対的な候補プールを構築する。
次に、determinis tic steerable-dataパイプラインは、認証された10,000サンプルのメインセットと、マスク、テンプレート、パス検証を使用するリザーブサンプルを生成する。
論文 参考訳(メタデータ) (2026-06-29T06:39:03Z) - Multilingual Verifier Bias in RLVR: Benchmark, Rollout Diagnosis, and the Cross-Lingual Selection Bottleneck [6.406377225565017]
正確なマッチング検証器は、形式とスクリプトのバリエーションを言語依存の偽陰性報酬雑音に変換する。
マルチリンガルなRLVR報酬を監査するための再利用可能なプロトコルを提案する。
論文 参考訳(メタデータ) (2026-06-17T15:55:54Z) - TASR: Training-Free Adaptive Stopping for Iterative Retrieval [12.177557521540082]
反復的検索拡張生成エージェントは、モデルが解答に収束した後も検索を続けることで、一般的にオーバースペンドされる。
TASR(Training-Free Adaptive Stopping Rule)は,モデルが前ラウンドの正規化を繰り返すと発火する一行述語である。
論文 参考訳(メタデータ) (2026-06-11T18:35:14Z) - A Paired Testing Protocol for Batch-Conditioned Refusal Robustness in LLM Serving [0.0]
言語モデルの安全性評価は、サービス構成を固定されたバックグラウンドインフラストラクチャとして扱うことが多い。
我々は4つのアーティファクト支援研究をペアテストプロトコルに合成する。
標準vLLMは、現在のスコアフリップ候補に対して22/55ラベルのフリップを再生し、VLLM_BATCH_INIANT=1を有効にすることで、同じテストを0/55フリップに削減する。
論文 参考訳(メタデータ) (2026-05-26T23:22:55Z) - Distributional Energy-Based Models for Uncertainty-Aware Structured LLM Reasoning [40.342912574072024]
大規模言語モデルは、旅行計画やコードソリューションのような構造化されたアウトプットを生成する。
個々の推論ステップは正しく見えるが、アウトプット全体が予算に違反したり、テストケースに失敗したり、あるいは以前の推論に矛盾することがある。
構造化LCM出力の検証のための決定論的解析制約付き学習品質スコアラを提案する。
論文 参考訳(メタデータ) (2026-05-15T17:08:27Z) - Reframing preprocessing selection as model-internal calibration in near-infrared spectroscopy: A large-scale benchmark of operator-adaptive PLS and Ridge models [0.2609784101826761]
本稿では,探索を1つのキャリブレーションステップに分解できる事例について検討する。
線形演算子適応キャリブレーションは、徹底的な前処理スクリーニングに匹敵する予測品質を与える。
論文 参考訳(メタデータ) (2026-05-13T14:23:00Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。