論文の概要: PerfReasoning: How Well Do LLMs Reason on Hardware Performance?
- arxiv url: http://arxiv.org/abs/2609.04476v1
- Date: Thu, 03 Sep 2026 21:00:06 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-07 18:15:23.819425
- Title: PerfReasoning: How Well Do LLMs Reason on Hardware Performance?
- Title(参考訳): PerfReasoning: LLMはハードウエアパフォーマンスにどの程度の理由があるのか?
- Abstract要約: 本稿では,LLMを直接性能推論器として,解析的性能モデルコードの生成元として評価するベンチマークであるPerfReasoningを紹介する。
最強のクローズドソースモデルは推論ベースのQ&Aで90%を超え、最高のオープンウェイトモデルは82.4%に達した。
PerfReasoningは、妥当なアーキテクチャ推論と信頼性のあるパフォーマンスモデル構築のギャップを露呈する。
- 参考スコア(独自算出の注目度): 5.027383840710352
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Performance modeling is central to hardware design and software optimization, yet constructing these models requires structured reasoning about computation, data reuse, storage, and movement. We introduce PerfReasoning, a benchmark that evaluates LLMs both as direct performance reasoners and as generators of analytical performance-model code. Given workload, architecture, and mapping specifications, models compare mappings and predict off-chip traffic and buffer requirements. The strongest closed-source models exceed 90% on reasoning-based Q&A, and the best open-weight model reaches 82.4%. However, model construction is substantially harder: while GPT-5.6 Sol exceeds 80% pass rate, all other model configurations average below 15% and vary markedly across runs. Task-specific RL raises a 4B model's mapping-reasoning accuracy by 15.7 points, whereas feedback-free multi-round self-revision prompting is not reliably effective. PerfReasoning exposes the gap between plausible architectural reasoning and reliable performance-model construction. We will publicly release the benchmark to support reproducible evaluation and track future progress.
- Abstract(参考訳): 性能モデリングはハードウェア設計とソフトウェア最適化の中心であるが、これらのモデルを構築するには、計算、データの再利用、ストレージ、移動に関する構造化された推論が必要である。
本稿では,LLMを直接性能推論器として,解析的性能モデルコードの生成器として評価するベンチマークであるPerfReasoningを紹介する。
ワークロード、アーキテクチャ、マッピングの仕様が与えられた場合、モデルはマッピングを比較し、チップ外のトラフィックとバッファ要求を予測する。
最強のクローズドソースモデルは推論ベースのQ&Aで90%を超え、最高のオープンウェイトモデルは82.4%に達した。
GPT-5.6 Solのパスレートは80%を超え、他の全てのモデル構成は平均15%以下であり、ラン毎に著しく異なる。
タスク固有RLは4Bモデルのマッピング推論精度を15.7ポイント引き上げるが、フィードバックなしのマルチラウンド自己修正プロンプトは確実に有効ではない。
PerfReasoningは、妥当なアーキテクチャ推論と信頼性のあるパフォーマンスモデル構築のギャップを露呈する。
再現可能な評価をサポートし、今後の進捗を追跡するためのベンチマークを公開します。
関連論文リスト
- Very Exciting: Zero-Shot Model Predictive Control of Buildings via Excitation-Based Generalized Transfer Learning Models [0.0]
トランスファーラーニングは、ターゲット・ビルディング・モデリングの注目を集めている。
State-of-the-art TLアプローチは、標準的な運用データを使用して、複数のソースビルディング上の一般化モデルを事前訓練した。
良好な制御性能を達成するには,このアプローチが不十分であることを示す。
論文 参考訳(メタデータ) (2026-09-11T13:42:45Z) - The Capability Frontier: Benchmarks Miss 82% of Model Performance [7.258179693117413]
既存のベンチマークでは、1回のランで1つのモデルの精度が報告されるのが一般的である。
これにより、実世界のLLM能力、特に異種データ分布を体系的に下降させる。
論文 参考訳(メタデータ) (2026-06-25T10:20:47Z) - Opt-Verifier: Unleashing the Power of LLMs for Optimization Modeling via Dual-Side Verification [53.763212981479455]
本稿では、構造と解の両方の観点から、デュアルサイド検証(Opt-Verifier)を用いた新しいフレームワークを提案する。
一般的なベンチマーク実験により、我々の手法は精度が20%以上向上していることが示された。
論文 参考訳(メタデータ) (2026-05-28T08:09:52Z) - Performance Trade-offs of Optimizing Small Language Models for E-Commerce [1.0312968200748118]
大規模言語モデル(LLM)は、自然言語の理解と生成タスクにおける最先端のパフォーマンスを提供する。
本稿では,資源効率の代替として,より小型でオープンウェイトなモデルの実現可能性について検討する。
論文 参考訳(メタデータ) (2025-10-24T18:49:28Z) - ToolRM: Outcome Reward Models for Tool-Calling Large Language Models [18.60378078755052]
ツールコールシナリオにおける報酬モデルの性能を評価するための最初のベンチマークであるFC-RewardBenchを紹介する。
我々の分析は、現在の報酬モデルが効果的なツール使用のキーシグナルを見逃すことがしばしばあり、ドメイン固有のモデリングの必要性を強調していることを示している。
我々は1.7Bから14Bまでのモデルをトレーニングし、7つのドメイン外のベンチマークで評価する。
論文 参考訳(メタデータ) (2025-09-15T14:17:17Z) - Accelerated Test-Time Scaling with Model-Free Speculative Sampling [58.69141724095398]
STAND(Stochastic Adaptive N-gram Drafting)は,新しいモデルフリーな投機的デコード手法である。
従来の自己回帰復号法と比較して,STANDは推論遅延を60~65%削減することを示した。
モデルフリーのアプローチとして、STANDは追加のトレーニングなしで既存の言語モデルに適用できる。
論文 参考訳(メタデータ) (2025-06-05T07:31:18Z) - R-PRM: Reasoning-Driven Process Reward Modeling [53.06844294668382]
プロセス・リワード・モデル(Process Reward Models, PRM)は、各推論ステップを評価することによって、有望なソリューションとして登場した。
既存のPRMは評価スコアを直接出力し、学習効率と評価精度の両方を制限する。
推論駆動プロセスリワードモデリング(R-PRM)を提案する。
R-PRMは限られたアノテーションからシードデータを生成し、効果的にモデルの推論能力をブートストラップします。
論文 参考訳(メタデータ) (2025-03-27T09:23:08Z) - Optimizing Sequential Recommendation Models with Scaling Laws and Approximate Entropy [104.48511402784763]
SRモデルの性能法則は,モデルの性能とデータ品質の関係を理論的に調査し,モデル化することを目的としている。
データ品質を評価するために、従来のデータ量メトリクスと比較して、より曖昧なアプローチを示すために、近似エントロピー(ApEn)を提案する。
論文 参考訳(メタデータ) (2024-11-30T10:56:30Z) - Language Models are Hidden Reasoners: Unlocking Latent Reasoning Capabilities via Self-Rewarding [74.31981011985681]
大きな言語モデル(LLM)は印象的な機能を示しているが、それでも複数のステップを必要とする複雑な推論タスクに苦戦している。
LaTRO(LaTent Reasoning Optimization)は、潜在分布からのサンプリングとして推論を定式化するためのフレームワークである。
複数のモデルアーキテクチャを用いて、GSM8KおよびARC-Challengeデータセットの実験を通してLaTROを検証する。
論文 参考訳(メタデータ) (2024-11-06T22:02:30Z) - Fine-Tuning or Fine-Failing? Debunking Performance Myths in Large Language Models [0.8399688944263842]
大きな言語モデル(LLM)は、入力クエリから人間のようなテキストを理解し、生成する能力を持つ。
本研究では、この概念を、レトリーバル拡張生成(RAG)パイプライン内のLLMの統合に拡張する。
データ抽出と文脈理解における微調整がLLMの能力に与える影響を評価する。
論文 参考訳(メタデータ) (2024-06-17T04:35:17Z) - VisFIS: Visual Feature Importance Supervision with
Right-for-the-Right-Reason Objectives [84.48039784446166]
モデルFI監督は、VQAモデルの精度と、Right-to-the-Right-Reasonメトリクスの性能を有意義に向上させることができることを示す。
我々の最高のパフォーマンス手法であるVisual Feature Importance Supervision (VisFIS)は、ベンチマークVQAデータセットで強いベースラインを上回ります。
説明が妥当で忠実な場合には予測がより正確になる。
論文 参考訳(メタデータ) (2022-06-22T17:02:01Z) - Models, Pixels, and Rewards: Evaluating Design Trade-offs in Visual
Model-Based Reinforcement Learning [109.74041512359476]
視覚的MBRLアルゴリズムにおける予測モデルの設計決定について検討する。
潜在空間の使用など、しばしば重要と見なされる設計上の決定は、タスクのパフォーマンスにはほとんど影響しないことが分かりました。
我々は,この現象が探索とどのように関係しているか,および標準ベンチマークにおける下位スコーリングモデルのいくつかが,同じトレーニングデータでトレーニングされた場合のベストパフォーマンスモデルと同等の性能を発揮するかを示す。
論文 参考訳(メタデータ) (2020-12-08T18:03:21Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。