論文の概要: QVal: Cheaply Evaluating Dense Supervision Signals for Long-Horizon LLM Agents
- arxiv url: http://arxiv.org/abs/2606.32034v1
- Date: Tue, 30 Jun 2026 17:58:23 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-01 18:27:19.348717
- Title: QVal: Cheaply Evaluating Dense Supervision Signals for Long-Horizon LLM Agents
- Title(参考訳): QVal: 長距離LDMエージェントのための高密度スーパービジョン信号の迅速評価
- Authors: Sergio Hernández-Gutiérrez, Matteo Merler, Ilze Amanda Auzina, Joschka Strüber, Ameya Prabhu, Matthias Bethge,
- Abstract要約: 統合したトレーニングパイプラインの下流性能を測定することで、密集した監視手法を評価するのが一般的である。
これは高価で、監督品質をトレーニングエンジニアリングの共同創設者と融合させ、異なる方法論の家族に個別のトレーニング設定を要求させる。
我々は、密集した監視信号を直接評価するためのトレーニング不要なテストベッドであるQValを紹介する。
- 参考スコア(独自算出の注目度): 19.761502572132887
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: LLM agents increasingly act over long horizons, where a single trajectory can contain hundreds or thousands of actions. In these settings, outcome-only rewards provide too sparse guidance, failing to inform the model about the goodness of intermediate actions. Dense supervision methods aim to solve this problem by scoring intermediate steps, from intrinsic confidence to self-distillation and embedding similarities. However, it is common practice to evaluate them by measuring the downstream performance of a training pipeline that integrates them. This is expensive, conflates supervision quality with training engineering confounders, and renders different methodological families requiring distinct training setups incomparable. As a result, dense supervision methods are rarely benchmarked on common ground. We introduce QVal, a training-free testbed for directly evaluating dense supervision signals. Given a state-action pair, QVal measures how well a method's score is Q-aligned: whether it orders actions according to the Q-values of a strong reference-policy. This lets us compare signals before any training run and separate signal quality from other engineering choices. We instantiate QVal as QVal-v1.0, benchmarking 21 dense supervision methods across four diverse environments and seven methodological families, with over 1.2K evaluation experiments across six open-weight model backbones. We find that simple prompting baselines consistently outperform recent dense supervision methods from the literature, and that performance clusters strongly by family. These findings hold across model sizes, environments, and observation modalities. QVal is designed to be easily extensible to new environments and methods, enabling researchers to iterate on dense supervision methods before any training run.
- Abstract(参考訳): LLMエージェントは長い地平線上で働き、単一の軌道は数百から数千のアクションを含むことができる。
これらの設定では、結果のみの報酬はスパースなガイダンスを提供し、中間アクションの良さをモデルに知らせることができない。
デンス監視法は,本質的な信頼から自己蒸留,類似点の埋め込みに至るまで,中間段階を採点してこの問題を解決することを目的としている。
しかし、それらを統合したトレーニングパイプラインの下流のパフォーマンスを測定して評価することは一般的である。
これは高価で、監督品質をトレーニングエンジニアリングの共同創設者と融合させ、異なる方法論の家族に異なるトレーニング設定を非互換性に要求する。
その結果、高密度の監視手法が共通基盤でベンチマークされることは稀である。
我々は、密集した監視信号を直接評価するためのトレーニング不要なテストベッドであるQValを紹介する。
状態-作用対が与えられた場合、QValは、あるメソッドのスコアがいかにQ整列であるかを測定する。
これにより、トレーニング実行前に信号を比較し、他のエンジニアリング選択と信号品質を分離することができます。
QValをQVal-v1.0としてインスタンス化し、4つの異なる環境と7つの方法論ファミリにまたがる21の密集した監視手法をベンチマークし、6つのオープンウェイトモデルバックボーンに対して1.2K以上の評価実験を行った。
文献から得られた近年の厳密な監視手法は, 簡便なベースラインのプロンプトが一貫して優れており, パフォーマンス・クラスタは家族によって強く評価されている。
これらの発見は、モデルのサイズ、環境、観察のモダリティにまたがる。
QValは、新しい環境や方法に容易に拡張できるように設計されており、研究者はトレーニングを実行する前に、密集した監視方法を繰り返すことができる。
関連論文リスト
- A Controlled Study of Decoding-Time Truthfulness Methods on Instruction-Tuned LLMs [3.4007995136788]
レイヤコントラスト復号、推論時間介入、学習ロジットアダプタは、TrathfulQAで10~30ポイントのゲインを示した。
現代の命令調整型LLMは、既にかなり高いベースラインを実現している。
熟考的推進法は、評価体制においてより堅牢であるように見える。
論文 参考訳(メタデータ) (2026-06-10T14:48:05Z) - Truncated Step-Level Sampling with Process Rewards for Retrieval-Augmented Reasoning [32.295907409325615]
強化学習による検索エンジンの推論のための大規模言語モデルの訓練は、信用代行問題によって妨げられる。
2つの相補的なアイデアに基づいて構築されたフレームワークであるSLATEを提案する。
7つのQAベンチマークの実験では、SLATEがスパース・リワードとプロセス・リワードのベースラインを一貫して上回っていることが確認された。
論文 参考訳(メタデータ) (2026-02-26T19:05:40Z) - Toward Reliable Machine Unlearning: Theory, Algorithms, and Evaluation [1.7767466724342065]
本稿では,SOTA MIAスコアに基づく画像分類の最先端手法を超越したAdrial Machine UNlearning(AMUN)を提案する。
既存の手法は、最寄りの会員推定攻撃(MIA-NN)を導入して、再訓練されたモデルの動作を再現できないことを示す。
そこで我々は,スクラッチから再学習したモデルが生成する残りのクラスに対する分布を,クラス入力に対して近似することで,このリークを緩和する微調整対象を提案する。
論文 参考訳(メタデータ) (2025-12-07T20:57:25Z) - Instability in Downstream Task Performance During LLM Pretraining [12.840216854750565]
多様なWebスケールコーパスで学習した大規模言語モデル(LLM)における下流タスク性能の安定性について検討する。
タスクスコアは、アグリゲーションレベルとサンプルレベルの両方で、トレーニングを通して頻繁に変動する。
この不安定性に対処するために、チェックポイント平均化とアンサンブルという2つのポストホックチェックポイント統合手法について検討する。
論文 参考訳(メタデータ) (2025-10-06T14:33:38Z) - Simulating Training Data Leakage in Multiple-Choice Benchmarks for LLM Evaluation [6.4212082894269535]
既存のリーク検出技術である置換法とn-gram法を比較した。
解析の結果,n-gram法は高いF1スコアが得られることがわかった。
MMLUとHellaSwagのクリーンバージョンを作成し、複数のLLMを再評価する。
論文 参考訳(メタデータ) (2025-05-30T06:37:39Z) - Boosting Virtual Agent Learning and Reasoning: A Step-Wise, Multi-Dimensional, and Generalist Reward Model with Benchmark [72.46357004059661]
Generalist Virtual Agents (GVA) は自律的なタスク実行において大きな可能性を示している。
これらの課題に対処するため,ステップワイズ多次元ジェネラリスト・リワードモデルを提案する。
同様に、エージェントトレーニング用のきめ細かい信号を提供し、推論時間スケーリングのためのより良いアクションを選択することができる。
論文 参考訳(メタデータ) (2025-03-24T13:30:47Z) - Uncertainty Quantification for LLMs through Minimum Bayes Risk: Bridging Confidence and Consistency [66.96286531087549]
大規模言語モデル(LLM)のための不確実性定量化(UQ)手法は、様々なアプローチを含んでいる。
本稿では,モデル信頼度と出力整合性を統合する新しい手法を提案する。
我々は,質問応答,抽象要約,機械翻訳など,様々なタスクに対するアプローチを評価する。
論文 参考訳(メタデータ) (2025-02-07T14:30:12Z) - Rethinking Classifier Re-Training in Long-Tailed Recognition: A Simple
Logits Retargeting Approach [102.0769560460338]
我々は,クラスごとのサンプル数に関する事前知識を必要とせず,シンプルなロジットアプローチ(LORT)を開発した。
提案手法は,CIFAR100-LT, ImageNet-LT, iNaturalist 2018など,様々な不均衡データセットの最先端性能を実現する。
論文 参考訳(メタデータ) (2024-03-01T03:27:08Z) - Solving Continuous Control via Q-learning [54.05120662838286]
深いQ-ラーニングの簡単な修正は、アクター批判的手法による問題を大幅に軽減することを示します。
バンバン動作の離散化と値分解、協調マルチエージェント強化学習(MARL)としての単一エージェント制御のフレーミングにより、このシンプルな批判のみのアプローチは、最先端の連続アクター批判法の性能と一致する。
論文 参考訳(メタデータ) (2022-10-22T22:55:50Z) - FewNLU: Benchmarking State-of-the-Art Methods for Few-Shot Natural
Language Understanding [89.92513889132825]
本稿では,従来の評価手順を,テスト性能,開発-テスト相関,安定性の3つの重要な側面で改善する評価フレームワークを提案する。
評価フレームワークを実装したツールキットFewNLUと、最先端のメソッドをオープンソースとして公開しています。
論文 参考訳(メタデータ) (2021-09-27T00:57:30Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。