論文の概要: The Cost of Knowing: A Resource-Aware Protocol for Benchmarking Hallucination Beyond Static Leaderboards
- arxiv url: http://arxiv.org/abs/2607.24063v2
- Date: Wed, 29 Jul 2026 12:23:50 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-30 14:21:10.709257
- Title: The Cost of Knowing: A Resource-Aware Protocol for Benchmarking Hallucination Beyond Static Leaderboards
- Title(参考訳): 知識のコスト:静的リーダーボードを超えて幻覚をベンチマークするためのリソース対応プロトコル
- Abstract要約: MAS-HQ (Multi-Agent System Hallucination Quest) は、リソースを意識した評価プロトコルである。
事実検知器を包み、コストを正規化する。
Q-Scoreは、競合する試合において、現実性は正規化コストをマイナスにする。
- 参考スコア(独自算出の注目度): 27.694287638709643
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: On standard factuality tasks, frontier models now cluster near the top of the scale. The question is therefore shifting from how factual a system is toward how much compute that factuality costs. Static leaderboards score factuality in isolation and treat compute as free, so they cannot tell a genuinely better system apart from one that simply spends more. Consider a ranking reversal. A brute-force Best-of-4 agent posts the higher raw factuality score (H-Score 0.9169 vs 0.9103) and would top a static leaderboard, but once cost is counted it is the worse system, losing on Q-Score (0.5169 vs 0.5217) at roughly four times the tokens and latency, under a reported cost weight whose sensitivity we sweep. So the system that tops a static leaderboard can be the worse one to deploy. To make this trade-off visible, we introduce MAS-HQ (Multi-Agent System Hallucination Quest), a resource-aware evaluation protocol. It wraps any factuality detector and normalizes for cost, and it pits systems against each other rather than scoring them in isolation. The Q-Score measures factuality minus normalized cost under a competitive match. Across summarization and open-domain QA, single-agent baselines drift into resource-heavy over-optimization, while competition elicits more resource-efficient policies. These gains are small but consistent, and stable across 100 trials. The axis stays discriminative for frontier systems (Gemini-2.5-Pro, and GPT-5) whose raw factuality scores are already bunched near the ceiling. MAS-HQ provides a reproducible way to measure how much a factual answer costs.
- Abstract(参考訳): 標準的な事実性タスクでは、フロンティアモデルがスケールの最上位付近にクラスタ化されている。
それゆえ、問題はシステムがいかに現実的であるかから、その事実性にどれだけの費用がかかるかへとシフトしている。
静的なリーダーボードは、単独で事実性を評価し、計算を自由として扱う。
ランクの逆転を考える。
ブルートフォースのBest-of-4エージェントは、より高い生の事実性スコア(H-Score 0.9169 vs 0.9103)を投稿し、静的なリーダーボードの上位に立つが、コストがカウントされると、Q-Score (0.5169 vs 0.5217)を約4倍のトークンと遅延で失う、より悪いシステムである。
ですから、静的なリーダボードの上位にあるシステムは、デプロイする上で最悪のものになり得るのです。
このトレードオフを可視化するために,資源対応評価プロトコルであるMAS-HQ(Multi-Agent System Hallucination Quest)を導入する。
事実検知器をラップしてコストを正規化し、システムを個別にスコアリングするのではなく、互いにピットする。
Qスコアは、競合する試合において、現実性は正規化コストをマイナスにする。
要約とオープンドメインのQA全体を通じて、単一エージェントのベースラインはリソースの過剰な最適化へと流れ込み、競合はリソース効率の高いポリシーを引き出す。
これらの利得は小さいが一貫性があり、100回の試行で安定している。
この軸はフロンティア系(Gemini-2.5-Pro、GPT-5)に対して差別的であり、その実際の実測値は既に天井付近に束ねられている。
MAS-HQは、実際の回答コストを再現可能な方法で測定する。
関連論文リスト
- CoArena: Evaluating Computer-Use and Multi-Agent Systems in Real Time [0.0]
CoArenaは直接使用します。
実時間で5つの測定可能な特性。
211票の5システム例は、投票行列からレーティング、インターバル、ランクバンドに運ばれる。
論文 参考訳(メタデータ) (2026-09-13T02:22:37Z) - Rubric Dropout: A Simple Way to Mitigate Reward Hacking in Rubric-as-Reward RL [11.857468467125505]
トレーニング中に2つのスコアが分岐していることが分かりました。
一定のバイアスを持つ審査員は、トレーニングスコアが上昇している間に、金の曲線を一定にシフトさせる。
我々は、ニューロンのドロップアウトから借りた1行の修正であるDropoutを提案する。
論文 参考訳(メタデータ) (2026-08-12T05:29:21Z) - CoRE: Consensus Rewards via Equilibrium for Test-Time Reinforcement Learning [6.071121358322323]
emphCoREはトレーニングされていないベースを平均で+21.7ドル、多数投票で$20.4ドルで改善する。
投票ボックスではなくグラフとしてロールアウトグループを扱い、不安定な投票を、余分なロールアウトコストなしで、校正され、格付けされ、自己監督された報酬に変える。
論文 参考訳(メタデータ) (2026-08-10T09:06:03Z) - On the Limits of Machine-Learned Ranking for Modern Microarchitectural Policies [1.9175849355388896]
機械学習予測器はサイクルレベルのシミュレーションよりもはるかに高速にプロセッサ性能を推定する。
2つの設計形態でML予測器を4つ評価する。
論文 参考訳(メタデータ) (2026-08-02T06:55:43Z) - Reasoning Arena: Trace Tournaments When Verifiable Rewards Fall Short [51.667769734342635]
検証可能な報酬付き強化学習(RLVR)は,大規模言語モデルの推論能力向上のための主要なパラダイムとなっている。
本研究では,非多変量報酬群を判定システムにルーティングする適応学習フレームワークであるReasoning Arenaを提案する。
我々は、Reasoning Arenaが、競争数学やコーディングベンチマークにおいて、RLVRベースラインを平均で7.6%上回っていることを示す。
論文 参考訳(メタデータ) (2026-06-08T11:57:17Z) - Scaling Laws for Agent Harnesses via Effective Feedback Compute [53.68149869349268]
emphEffective Feedback Compute (EFC)は、情報的、有効、非冗長な場合にのみフィードバックを信用し、その後の決定のために保持するトレースレベルのスケーリング座標である。
EFCベースの座標は、生の計算ベースラインよりも失敗率を常に予測する。
論文 参考訳(メタデータ) (2026-05-28T09:45:47Z) - Survive or Collapse: The Asymmetric Roles of Data Gating and Reward Grounding in Self-Play RL [76.45061154544568]
セルフプレイ強化学習は、言語モデルを独自の生成タスクで訓練し、人間ラベルなしでプロジェクタとソルバを共進化させる。
最近のシステムでは強い推理効果が報告されているが、崩壊と不安定性は広く観察され、理解されていない。
代わりに、自己プレイの安定性は、提案者生成タスクがトレーニングプールに入るかを判断するデータレベルゲートと、すでに認められたタスクに関するポリシーを更新する報酬信号の2つの異なるレバーによって管理されていると論じる。
論文 参考訳(メタデータ) (2026-05-21T09:19:23Z) - The Scaling Law of Evaluation Failure: Why Simple Averaging Collapses Under Data Sparsity and Item Difficulty Gaps, and How Item Response Theory Recovers Ground Truth Across Domains [0.0]
AIと安全クリティカルドメイン間のベンチマーク評価は、圧倒的に単純な平均化に依存している。
2つの条件が共起した場合に、このプラクティスがかなり誤解を招くことを実証する。
論文 参考訳(メタデータ) (2026-05-11T20:17:55Z) - AgentPulse: A Continuous Multi-Signal Framework for Evaluating AI Agents in Deployment [1.2299000423193074]
静的ベンチマークは、AIエージェントが一定時点で何ができるかを測定するが、どのように採用され、維持され、デプロイの経験があるかは測らない。
AgentPulseは,10のワークロードカテゴリにまたがる50のエージェントを4つの要因から評価する継続的評価フレームワークである。
すべての収集信号、スコア出力、評価ハーネスをCC BY 4.0でリリースする。
論文 参考訳(メタデータ) (2026-04-27T04:48:13Z) - LLM Readiness Harness: Evaluation, Observability, and CI Gates for LLM/RAG Applications [51.56484100374058]
評価をデプロイメント決定ワークフローに変換するLLMおよびRAGアプリケーションのための準備性ハーネスを提案する。
このシステムは、最小限のAPI契約の下で、自動ベンチマーク、OpenTelemetryオブザーバビリティ、CI品質ゲートを組み合わせる。
チケットルーティングとBEIRタスクのハーネスを、完全なAzureマトリックスカバレッジで評価する。
論文 参考訳(メタデータ) (2026-03-28T18:03:32Z) - The Price Reversal Phenomenon: When Cheaper Reasoning Models End Up Costing More [76.93600828673503]
リストAPIの価格設定は、実際のコストに対する信頼性の低いプロキシである。
思考トークンのコストの削減は、ランキングの反転を70%削減します。
この結果から,コスト意識モデル選択と透過的な要求毎のコスト監視の必要性が示唆された。
論文 参考訳(メタデータ) (2026-03-25T06:07:39Z) - QANTIS: A Hardware-Validated Quantum Platform for POMDP Planning and Multi-Target Data Association [4.11040996037715]
本稿では、量子信念更新(Grover振幅増幅とBIQAE)、FPC-QAOAによるQUBOベースのデータアソシエーション、および構成可能なエラー軽減を統合するモジュールプラットフォームであるQSを紹介する。
ハードウェア上では、タイガーの信念に適用される単一のグローバー反復は、ベイズの後部を保ちながら、0.179$から9.07$(5.1times$; ISA 18)の稀な観測確率を増幅する。
さらに、我々の知る限り、超伝導ハードウェア上で最初のクローズドループハイブリッド量子古典型Tiger POMDPを実証する。
論文 参考訳(メタデータ) (2026-02-28T19:13:44Z) - ReLE: A Scalable System and Structured Benchmark for Diagnosing Capability Anisotropy in Chinese LLMs [37.23311145049677]
本稿では,機能異方性(Capability Anisotropy)を診断するためのスケーラブルなシステムであるReLEを提案する。
我々は,207,843サンプルからなる領域$times$ Capability SymbolicMatrixの304モデルを評価した。
論文 参考訳(メタデータ) (2026-01-24T09:57:59Z) - ZIP-RC: Optimizing Test-Time Compute via Zero-Overhead Joint Reward-Cost Prediction [57.799425838564]
ZIP-RCは、モデルに報酬とコストのゼロオーバーヘッド推論時間予測を持たせる適応推論手法である。
ZIP-RCは、同じまたはより低い平均コストで過半数投票よりも最大12%精度が向上する。
論文 参考訳(メタデータ) (2025-12-01T09:44:31Z) - Reinforcement Learning with Verifiable yet Noisy Rewards under Imperfect Verifiers [90.50039419576807]
RLVR(Reinforcement Learning with Verifiable Rewards)は、人為的なラベル付けを避けるために、自動検証に対するポリシーを訓練する。
認証ハッキングの脆弱性を軽減するため、多くのRLVRシステムはトレーニング中にバイナリ$0,1$の報酬を破棄する。
この選択にはコストがかかる:textitfalse negatives(正しい回答、FNを拒絶)とtextitfalse positives(間違った回答、FPを受け入れる)を導入する。
論文 参考訳(メタデータ) (2025-10-01T13:56:44Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。