論文の概要: VEHBench: A Stage-Local Diagnostic Benchmark for LLM-Assisted Vibration Energy Harvester Design
- arxiv url: http://arxiv.org/abs/2607.18181v1
- Date: Mon, 20 Jul 2026 17:17:05 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-21 18:48:37.720784
- Title: VEHBench: A Stage-Local Diagnostic Benchmark for LLM-Assisted Vibration Energy Harvester Design
- Title(参考訳): VEHBench:LCMを用いた振動エネルギーハーベスター設計のための段差診断ベンチマーク
- Abstract要約: 電池レスモノのインターネット(IoT)では、振動エネルギー収穫装置(VEH)の物理的制約を反復的に設計する必要がある。
既存のエンジニアリングベンチマークは主に最終的なアーティファクトの有効性を評価する。
LLM支援VEH設計のためのエンジニアリングネイティブ診断ベンチマークであるVEHBenchを紹介する。
- 参考スコア(独自算出の注目度): 7.0235067646585
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Battery-free Internet of Things (IoT) requires iterative design of vibration energy harvesters (VEHs) under coupled physical constraints, while LLMs are emerging as interface layers for engineering workflows. However, existing engineering benchmarks primarily assess final artifact validity, offering limited insights into how LLMs behave across different stages of coupled physical design. We introduce VEHBench, an engineering-native diagnostic benchmark for LLM-assisted VEH design, featuring 763 literature-grounded tasks scored by an analytical physical oracle. VEHBench evaluates four design roles: specification triage, verifier-guided search, corrupted-state recovery, and policy-conditioned selection. Experimental results reveal that LLM capability is strongly stage-dependent: no single model consistently dominates the entire workflow, and response-control profiles expose distinct behavioral patterns across design roles. VEHBench thus provides a stage-aware foundation for evaluating, selecting, routing, and improving verifier-grounded engineering LLMs. The benchmark artifact is available at https://huggingface.co/datasets/AnonymousVehbench/vehbench
- Abstract(参考訳): バッテリフリーモノのインターネット(IoT)は、物理的制約が組み合わさった振動エネルギー収穫装置(VEH)の反復設計を必要とする。
しかし、既存のエンジニアリングベンチマークは主に最終的なアーティファクトの有効性を評価し、LLMが結合された物理的設計の異なる段階にわたってどのように振る舞うかについての限られた洞察を提供する。
LLM支援VEH設計のためのエンジニアリングネイティブ診断ベンチマークであるVEHBenchを紹介する。
VEHBenchは、仕様トリアージ、検証者誘導検索、破損状態回復、ポリシー条件選択の4つの設計役割を評価している。
単一のモデルがワークフロー全体を支配することはなく、応答制御プロファイルはデザインロール全体で異なる振る舞いパターンを明らかにする。
VEHBenchは、検証済みのエンジニアリングLLMを評価し、選択し、ルーティングし、改善するためのステージアウェア基盤を提供する。
ベンチマークアーティファクトはhttps://huggingface.co/datasets/AnonymousVehbench/vehbenchで公開されている。
関連論文リスト
- LLM-enabled Behavior Driven Development Workflow for Formally Verified Hardware Designs [6.993866597392993]
制御された自然言語(CNL)仕様は中核として機能し、解釈可能性を維持しながら曖昧さを低減できる。
我々は,CNL仕様を正式に検証されたハードウェア設計の基礎として,FV Gherkin Scenarios(Formal Verification Gherkin Scenarios)を導入し,定義する。
論文 参考訳(メタデータ) (2026-09-14T10:08:48Z) - Deliberate Evolution: Agentic Reasoning for Sample-Efficient Symbolic Regression with LLMs [52.89778838903305]
Deliberate Evolution (DE) は、検索制御からシンボル生成を分離するエージェントフレームワークである。
LLM-SRBenchの実験では、DEMは様々な科学領域でLLMベースのSRベースラインを一貫して上回っている。
論文 参考訳(メタデータ) (2026-06-03T02:22:16Z) - Step-Level Sparse Autoencoder for Reasoning Process Interpretation [48.99201531966593]
大規模言語モデル(LLM)は、Chain-of-Thought(CoT)推論を通じて、強力な複雑な推論機能を実現している。
本稿では,ステップレベルスパースオートエンコーダ (SSAE) を提案する。
複数の基本モデルと推論タスクの実験により,抽出した特徴の有効性が示された。
論文 参考訳(メタデータ) (2026-03-03T14:25:02Z) - Visualizing token importance for black-box language models [48.747801442240565]
我々は,ブラックボックスの大規模言語モデル(LLM)を監査して,本運用環境にデプロイした場合に確実に動作させるという課題を考察する。
本稿では,各入力トークンに対する言語モデルの出力の感度を評価するために,分布ベース感性分析(DBSA)を提案する。
論文 参考訳(メタデータ) (2025-12-12T14:01:43Z) - Automating High Energy Physics Data Analysis with LLM-Powered Agents [6.8676809101926075]
本稿では,大規模言語モデル (LLM) エージェントを用いた代表的高エネルギー物理学 (HEP) 解析の自動化を実証する。
ヒッグス粒子二光子断面積測定をATLAS Open Dataのケーススタディとして用いて,LLMベースのスーパーバイザコーダエージェントとSnakemakeワークフローマネージャを組み合わせたハイブリッドシステムを構築した。
このアーキテクチャでは、ワークフローマネージャは決定性を強制し、エージェントはユーザーの指示に応じて分析コードを自動生成し、実行し、反復的に修正する。
論文 参考訳(メタデータ) (2025-12-08T18:13:13Z) - A Fano-Style Accuracy Upper Bound for LLM Single-Pass Reasoning in Multi-Hop QA [65.38186593873313]
MHQA(Multi-Hop Question Answering)は、ノイズ下でのシーケンシャルな推論を通じて、分散した相互依存的な証拠を統合する必要がある。
我々はMHQAのための概念実証マルチコールフレームワークをInfoQAで紹介する。
我々は、理論とフレームワークを検証するために、厳密で騒音に富んだベンチマークを構築した。
論文 参考訳(メタデータ) (2025-09-25T14:11:57Z) - Evaluating LLM-based Workflows for Switched-Mode Power Supply Design [0.3823356975862005]
2つのベンチマーク実験を行い、異なる設計タスクのためのLCMベースのアシスタントの性能を解析した。
実験の結果,SPICEシミュレーションのフィードバックと推理などの現在の進歩により,手作業によるベンチマークタスク269件の解決率は15%から91%に大幅に向上した。
論文 参考訳(メタデータ) (2025-07-14T13:41:12Z) - Evaluating Large Language Models for Real-World Engineering Tasks [75.97299249823972]
本稿では,実運用指向のエンジニアリングシナリオから得られた100以上の質問をキュレートしたデータベースを提案する。
このデータセットを用いて、4つの最先端の大規模言語モデル(LLM)を評価する。
以上の結果から,LLMは時間的および構造的推論において強みを示すが,抽象的推論や形式的モデリング,文脈に敏感な工学的論理にはかなり苦労することがわかった。
論文 参考訳(メタデータ) (2025-05-12T14:05:23Z) - HLS-Eval: A Benchmark and Framework for Evaluating LLMs on High-Level Synthesis Design Tasks [4.71707720395444]
HLS-Evalは、HLS駆動設計のための最初の完全なベンチマークおよび評価フレームワークである。
ベンチマークには、標準のHLSベンチマークと新しいソースから描かれた94のユニークな設計が含まれている。
ベンチマーク以外にも、HLS-Evalは、ローカルおよびホストされたLLMの自動化、並列評価のためのモジュール型のPythonフレームワークを提供している。
論文 参考訳(メタデータ) (2025-04-16T17:30:36Z) - AutoBench-V: Can Large Vision-Language Models Benchmark Themselves? [65.92331309449015]
本稿では,モデル能力の特定の側面に基づいてLVLMをベンチマークする,オンデマンドで評価を行う自動フレームワークであるAutoBench-Vを紹介する。
5つの要求されたユーザ入力に対して9つの人気のあるLVLMを広範囲に評価することにより、このフレームワークの有効性と信頼性を示す。
論文 参考訳(メタデータ) (2024-10-28T17:55:08Z) - FVEval: Understanding Language Model Capabilities in Formal Verification of Digital Hardware [4.480157114854711]
FVEvalは,形式的検証(FV)に関わるタスクにおいて,大規模言語モデル(LLM)のパフォーマンスを特徴付ける最初の総合ベンチマークである。
ベンチマークは3つのサブタスクで構成され、異なるレベルでLLM能力を測定する。
本稿では,FVに整合した合成例を生成するための,専門家による検証手法と手法のコレクションについて述べる。
論文 参考訳(メタデータ) (2024-10-15T21:48:57Z) - ChIRAAG: ChatGPT Informed Rapid and Automated Assertion Generation [10.503097140635374]
ChIRAAGはOpenAI GPT4をベースとして、設計の自然言語仕様からSystem Verilog Assertion (SVA)を生成する。
実験では、LSM生成した生のアサーションの27%に誤りがあり、数回の反復で修正された。
以上の結果から,LLMはアサーション生成プロセスにおいて技術者を合理化し,支援し,検証を再構築できることが示唆された。
論文 参考訳(メタデータ) (2024-01-31T12:41:27Z) - LLM4EDA: Emerging Progress in Large Language Models for Electronic
Design Automation [74.7163199054881]
大規模言語モデル(LLM)は、文脈理解、論理推論、回答生成においてその能力を実証している。
本稿では,EDA分野におけるLLMの応用に関する系統的研究を行う。
論理合成,物理設計,マルチモーダル特徴抽出,回路のアライメントにLLMを適用することに焦点を当て,今後の研究の方向性を強調した。
論文 参考訳(メタデータ) (2023-12-28T15:09:14Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。