論文の概要: Reachability Is Not Realization: Tracing the Sources of LLM Benchmark Gains
- arxiv url: http://arxiv.org/abs/2608.03219v1
- Date: Tue, 04 Aug 2026 06:52:27 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-05 15:30:23.066944
- Title: Reachability Is Not Realization: Tracing the Sources of LLM Benchmark Gains
- Title(参考訳): リーチ容易性は実現していない - LLMベンチマークの出所の追跡
- Authors: Yanchao Li, Wanhao Liu, Jiaqing Xie, Ben Gao, Yanbo Wang, Tianfan Fu, Yuqiang Li,
- Abstract要約: モデルは、新しい回答に到達したり、既に到達範囲内にあった回答を生成できる。
我々は,一定の予算,温度,回答形式の下で質問レベルの監査を行う。
まず、推論時層ルーティングが到達可能性を高めるかどうかを検証する。
- 参考スコア(独自算出の注目度): 15.723674503598948
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Benchmark gains are often treated as evidence of greater LLM capability. Yet the same gain can reflect different changes in model behavior. A model may reach new answers, or produce answers that were already within reach. Aggregate scores do not distinguish these changes question by question. We establish a question-level audit under fixed budgets, temperatures, and answer formats. A question is realized when the default deployment procedure produces the correct answer. A question is reachable when a specified probe finds that answer within a fixed budget. We first test whether inference-time layer routing can expand reachability. Under a matched budget, random routes match or exceed structured search in all 43 model and task settings. Answer-blind procedures retain almost none of this gain, which instead requires access to the correct answer. We then ask why reachable answers sometimes fail to appear. Across six cases spanning 0.5B to 31B, silencing one identified MLP block repairs 68 to 92 percent of a predefined failure set. We next test whether training closes the gap by expanding reachability. In five of six matched evaluations, deployed performance rises while the reachable ceiling remains flat or falls. For DAPO, the deployed score rises by 14.7 points while the reachable ceiling falls by 13.3 points. Across the settings we audit, realization and reachability therefore do not always change together. Claims of capability expansion should report both realized performance and reachability under matched evaluation conditions. Code is available at https://github.com/LiZaiyuan0619/reachability-not-realization
- Abstract(参考訳): ベンチマークゲインは、しばしばより大きなLLM能力の証拠として扱われる。
しかし、同じ利益はモデルの振る舞いの異なる変化を反映することができる。
モデルは、新しい回答に到達したり、既に到達範囲内にあった回答を生成できる。
集計スコアは、これらの変更を質問によって区別しない。
我々は,一定の予算,温度,回答形式の下で質問レベルの監査を行う。
デフォルトのデプロイメント手順が正しい回答を生成すると、問題は解決される。
特定のプローブが一定の予算内でその答えを見つけると、質問は到達可能である。
まず、推論時層ルーティングが到達可能性を高めるかどうかを検証する。
一致した予算の下では、ランダムルートは43のモデルとタスク設定すべてにおいて構造化された検索と一致または超過する。
Answer-blindプロシージャは、この利益のほとんどを保持せず、代わりに正しい回答にアクセスする必要がある。
そして、なぜ到達可能な答えが時々現れないのか尋ねます。
0.5Bから31Bにまたがる6例のうち、1例は事前に定義された障害セットの68~92%のMLPブロック修復をサイレンシングした。
次に、到達可能性を広げることで、トレーニングがギャップを埋めるかどうかをテストする。
6つのうち5つが一致した評価では、配置された性能が上昇し、到達可能な天井は平らで、落下する。
DAPOの場合、配置されたスコアは14.7ポイント上昇し、到達可能な天井は13.3ポイント低下する。
ですから、監査、実現、到達性といった設定は、必ずしも一緒に変更される訳ではありません。
性能拡張の主張は、一致した評価条件下で実現された性能と到達性の両方を報告すべきである。
コードはhttps://github.com/LiZaiyuan0619/reachability-not-realizationで公開されている。
関連論文リスト
- Rethinking Self-Evolving Agent Skills: Feedback Dynamics over Multiple Rounds [43.5891705224868]
自己進化型スキルシステムは、基礎となるモデルを変更することなく、実行フィードバックを永続的なスキル更新に変換することでエージェントを改善することを約束する。
5つのベンチマークと3つのモデルで制御された評価フレームワークを提案する。
全体として、永続的なスキルの自己進化は、モデル依存リターンとベンチマーク依存リターンを備えたスパース、バリデーションフィルタリング検索として理解されている。
論文 参考訳(メタデータ) (2026-07-31T04:02:51Z) - Closing the Loop on Latent Reasoning via Test-Time Reconstruction [45.08180971427891]
最近の研究は、中間推論を自然言語のトレースから潜時あるいはキャッシュレベルの表現に移行している。
本稿では,クエリ自体を参照としてループをクローズする自己教師型テストタイムトレーニング手法であるRELATを提案する。
ReLATは、単一モデル推論、テキストベースのコラボレーション、オープンループラテントコラボレーション、代替テストタイムトレーニング目標よりも一貫して改善されていることを示す。
論文 参考訳(メタデータ) (2026-06-04T14:54:40Z) - Beyond Inference-Time Search: Reinforcement Learning Synthesizes Reusable Solvers [0.0]
大規模言語モデル(LLM)は一般的に、各インスタンスを個別に解決する推論時プロシージャとして最適化にアプローチする。
本稿では,制約付きクナプサックの制御変種であるSDS(Synergistic Dependency Selection)について考察する。
Qwen2.5-Coder-14B-Instruct with Group Relative Policy Optimization using a feasibility-gated reward and light Structure scaffolding。
論文 参考訳(メタデータ) (2026-05-18T13:21:40Z) - Grounded Continuation: A Linear-Time Runtime Verifier for LLM Conversations [15.537674351419234]
デプロイされたエージェントに対するコンテキスト操作攻撃は、このギャップを積極的に活用する。
明示的な依存性グラフを保持するランタイム検証器でそれをクローズします。
継続がサポートされるかどうかを確認することは、グラフウォークに還元され、リトラクションは同じグラフを通して、サポートを失う結論を正確に宣言する。
論文 参考訳(メタデータ) (2026-05-13T22:54:16Z) - When Reasoning Traces Become Performative: Step-Level Evidence that Chain-of-Thought Is an Imperfect Oversight Channel [5.106950500256654]
CoT(Chain-of- Thought)トレースは、言語モデルの能力向上とモデルの振る舞いの監査にますます利用されている。
我々は、この仮定を、回答コミットプロキシを中心に構築されたステップレベルのDect-Classify-Compareフレームワークでテストする。
9つのモデルと7つの推論ベンチマーク、潜在コミットメント、明示的な回答到着は平均61.9%のステップで一致している。
論文 参考訳(メタデータ) (2026-05-12T08:24:47Z) - HiL-Bench (Human-in-Loop Benchmark): Do Agents Know When to Ask for Help? [32.54022440678003]
コーディングエージェントは、完全なコンテキストが与えられたときに複雑なタスクを解決します。
現在のベンチマークは、この障害モードに盲目です。
我々はこの選択的エスカレーションスキルを測定するためにHiL-Benchを提案する。
論文 参考訳(メタデータ) (2026-04-10T15:21:44Z) - AdaFuse: Adaptive Ensemble Decoding with Test-Time Scaling for LLMs [46.52320938421707]
推論時のアンサンブルは、大規模な言語モデル機能を再訓練せずに組み合わせる実用的な方法を提供する。
生成時に意味的に適切な融合単位を動的に選択する適応型アンサンブルデコーディングフレームワークであるAdaFuseを提案する。
AdaFuseは一貫して強力なアンサンブルベースラインを上回り、6.88%の平均的な相対的な改善を達成している。
論文 参考訳(メタデータ) (2026-01-09T18:58:22Z) - SABER: Small Actions, Big Errors -- Safeguarding Mutating Steps in LLM Agents [52.20768003832476]
我々は$$-Bench (Airline/Retail) および SWE-Bench Verified 上での実行トレースを分析する。
成功を失敗に戻すための、先進的な逸脱、最初期の行動、レベル分岐を形式化する。
モデルに依存しない,勾配のない,テスト時のセーフガードである cm を導入します。
論文 参考訳(メタデータ) (2025-11-26T01:28:22Z) - Eigen-1: Adaptive Multi-Agent Refinement with Monitor-Based RAG for Scientific Reasoning [53.45095336430027]
暗黙的な検索と構造化された協調を組み合わせた統合フレームワークを開発する。
Humanity's Last Exam (HLE) Bio/Chem Goldでは,48.3%の精度を実現している。
SuperGPQAとTRQAの結果はドメイン間の堅牢性を確認した。
論文 参考訳(メタデータ) (2025-09-25T14:05:55Z) - RankAlign: A Ranking View of the Generator-Validator Gap in Large Language Models [43.89751891729739]
我々は,モデルが生成した解答と,その解答の検証,ジェネレータとバリケータのギャップとの相違について考察する。
この測定結果から,質問応答,語彙意味論タスク,次の単語予測など,さまざまな設定に大きなギャップがあることが分かる。
次にランキングベースのトレーニング手法である RankAlign を提案する。
論文 参考訳(メタデータ) (2025-04-15T16:53:31Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。