論文の概要: Knowledge Boundary Probing and Demand-Guided Intervention for LLM-Based Power System Code Generation
- arxiv url: http://arxiv.org/abs/2605.31478v1
- Date: Fri, 29 May 2026 16:06:34 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-01 20:56:50.723535
- Title: Knowledge Boundary Probing and Demand-Guided Intervention for LLM-Based Power System Code Generation
- Title(参考訳): LLMに基づく電力系統コード生成のための知識境界探索と需要誘導介入
- Abstract要約: 電力系統のコード生成におけるファーストパス障害は, 幻覚関数名, 誤用パラメータ, 不正処理結果表など, 構造化されたAPI知識境界によって支配されていることを示す。
我々は,自然言語演算子クエリとパンダパワーコードと数値基底真理を組み合わせた実行検証ベンチマークジェネレータPowerCodeBenchを紹介する。
また、モデルごとのAPI知識プロファイルを測定するL0-L3ドキュメンテーション駆動のプロファイリング手順も導入する。
- 参考スコア(独自算出の注目度): 8.136015158683694
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Large language models (LLMs) are increasingly used to automate power-system analysis, but many utilities and energy-research labs require on-premise serving for confidentiality, regulatory, reproducibility, and cost reasons. This makes the reliability of open-weight models a deployment issue. We show that first-pass failures in power-system code generation are dominated not by reasoning alone, but by structured API-knowledge boundary errors: hallucinated function names, misused parameters, and mishandled result tables in versioned simulation libraries. We introduce PowerCodeBench, an execution-validated benchmark generator that pairs natural-language operator queries with pandapower code and numerical ground truth; an L0-L3 documentation-driven probing procedure that measures per-model API knowledge profiles; and a boundary-aware intervention that combines query-side API demand estimation with targeted proactive documentation injection and routed reactive correction. On a 2,000-task frozen release, we evaluate ten open-weight LLMs (1.5B-480B parameters) and four commercial mid-tier APIs. The intervention improves every evaluated open-weight model of at least 7B parameters and every commercial API by 32 to 56 accuracy points. Open-weight models in the 70B-120B range match the commercial mid-tier accuracy range, while Llama-3.1-405B and Qwen3-Coder-480B lead the panel. The targeted prompts preserve the full-context accuracy ceiling while using 41% of the prompt-token cost. The result is an accuracy-side, deployment-time path toward reliable on-premise LLM assistance for grid-analysis workflows without fine-tuning or cloud inference.
- Abstract(参考訳): 大規模言語モデル(LLM)は、電力システム分析の自動化にますます利用されているが、多くのユーティリティやエネルギー研究所は、機密性、規制、再現性、コストの理由から、オンプレミスでの利用を必要とする。
これにより、オープンウェイトモデルの信頼性が問題となる。
電力系統のコード生成におけるファーストパス障害は、推論だけでなく、構造化されたAPI知識境界誤差(幻覚関数名、誤用パラメータ、バージョン管理されたシミュレーションライブラリにおける誤処理結果テーブル)によって支配されていることを示す。
我々は,自然言語演算子クエリとパンダパワーコードと数値基底真理を組み合わせた実行検証型ベンチマークジェネレータPowerCodeBench,モデルごとのAPI知識プロファイルを測定するL0-L3ドキュメンテーション駆動のプロービング手順,クエリ側API要求推定とターゲットのプロアクティブドキュメンテーションインジェクションとルーティングされたリアクティブ修正を組み合わせたバウンダリ認識の介入を紹介する。
2,000タスクのフリーズリリースでは、オープンウェイトLLM(1.5B-480Bパラメータ)と4つの商用中間層APIを評価した。
この介入は、少なくとも7Bパラメータのすべての評価されたオープンウェイトモデルと、すべての商用APIを32から56の精度ポイントで改善する。
70B-120Bのオープンウェイトモデルは商業用中間層の精度範囲と一致し、Llama-3.1-405BとQwen3-Coder-480Bはパネルをリードした。
ターゲットプロンプトは、プロンプトトーケンコストの41%を使用しながら、フルコンテキストの精度天井を保存する。
その結果、微調整やクラウド推論を伴わないグリッド分析ワークフローに対して、信頼性の高いオンプレミスのLLM支援への、精度の高いデプロイメントタイムパスが実現した。
関連論文リスト
- Neuro-Symbolic Software Verification: Hyper-charging Local Language Models with Symbolic Reasoning at Scale [11.088680803534785]
局所展開可能なオープンウェイト言語モデルとシンボリック不変量生成を組み合わせた,ニューロシンボリックパイプラインであるVerIbmcを提案する。
すべての推論は、クラウドAPIやプロプライエタリモデルを必要としないオープンウェイトモデルを使用して、単一のローカルマシン上で完全に実行される。
論文 参考訳(メタデータ) (2026-06-15T15:59:10Z) - LiveFMBench: Unveiling the Power and Limits of Agentic Workflows in Specification Generation [75.05397479715576]
大規模言語モデル(LLM)とエージェントは有望な進歩を示しているが、その真の能力と失敗モードは未だ不明である。
CプログラムのためのLCMおよびエージェントベースの形式仕様生成に関する、最初の体系的および汚染に配慮した研究を提案する。
論文 参考訳(メタデータ) (2026-05-02T11:31:33Z) - Authority Inversion in LLM-Mediated Ubiquitous Systems: When Models Trust Users Over Sensors [6.414826816896125]
センサ計測とユーザ主張の衝突が未検討のままである場合に,大規模言語モデルがどのように権威を暗黙的に割り当てるかを検討する。
数値センサデータが解答関連モデル方向への統合に失敗し、自然言語によるクレームが最終決定を支配できることがわかった。
提案するGeometric Authority (GAC) は,不適切なユーザ権限を抑えるための推論時間層レベルの介入である。
論文 参考訳(メタデータ) (2026-04-28T04:59:03Z) - Compiled AI: Deterministic Code Generation for LLM-Based Workflow Automation [3.225273674498579]
我々は,大言語モデルがコンパイルフェーズ中に実行可能なコードアーティファクトを生成するパラダイムであるコンパイルAIについて研究し,その後,さらなるモデル実行を必要とせずに決定的に実行する。
当社のコントリビューションは、ハイテイクなランタイムエンタープライズへの適用に関するシステム指向の研究です。
論文 参考訳(メタデータ) (2026-04-06T20:25:20Z) - LLM Readiness Harness: Evaluation, Observability, and CI Gates for LLM/RAG Applications [51.56484100374058]
評価をデプロイメント決定ワークフローに変換するLLMおよびRAGアプリケーションのための準備性ハーネスを提案する。
このシステムは、最小限のAPI契約の下で、自動ベンチマーク、OpenTelemetryオブザーバビリティ、CI品質ゲートを組み合わせる。
チケットルーティングとBEIRタスクのハーネスを、完全なAzureマトリックスカバレッジで評価する。
論文 参考訳(メタデータ) (2026-03-28T18:03:32Z) - From Stochastic Answers to Verifiable Reasoning: Interpretable Decision-Making with LLM-Generated Code [0.0]
大規模言語モデル(LLM)は、高い意思決定にますます使われている。
ブラックボックスモデルはそれらの推論を曖昧にし、最近のLCMベースのルールシステムはサンプル単位の評価に依存している。
我々は,LLMをインスタンスごとの評価器ではなくコードジェネレータとして再フレーミングすることを提案する。
論文 参考訳(メタデータ) (2026-02-28T00:27:29Z) - HuggingR$^{4}$: A Progressive Reasoning Framework for Discovering Optimal Model Companions [50.61510609116118]
HuggingR$4$は、Reasoning、Retrieval、Refinement、Reflectionを組み合わせて効率的にモデルを選択する新しいフレームワークである。
作業性率は92.03%、理性率は82.46%に達し、それぞれ26.51%、33.25%を超える。
論文 参考訳(メタデータ) (2025-11-24T03:13:45Z) - Reasoning with Confidence: Efficient Verification of LLM Reasoning Steps via Uncertainty Heads [104.9566359759396]
データ駆動の不確実性スコアに基づくステップレベルの推論検証の軽量な代替案を提案する。
本研究は, LLMの内部状態が不確実性を符号化し, 信頼性の高い検証信号として機能することが示唆された。
論文 参考訳(メタデータ) (2025-11-09T03:38:29Z) - Are You Getting What You Pay For? Auditing Model Substitution in LLM APIs [71.7892165868749]
LLM(Commercial Large Language Model) APIは基本的な信頼の問題を生み出します。
ユーザーは特定のモデルに課金するが、プロバイダが忠実に提供できることを保証することはない。
我々は,このモデル置換問題を定式化し,現実的な逆条件下での検出方法を評価する。
我々は,信頼された実行環境(TEE)を実用的で堅牢なソリューションとして使用し,評価する。
論文 参考訳(メタデータ) (2025-04-07T03:57:41Z) - Identifying and Mitigating API Misuse in Large Language Models [26.4403427473915]
大規模言語モデル(LLM)が生成するコードのAPI誤用は、ソフトウェア開発において深刻な課題となっている。
本稿では LLM 生成コードにおける API の誤用パターンについて,Python および Java 間でのメソッド選択とパラメータ使用法の両方を解析し,総合的研究を行った。
上記の分類に基づくAPI誤用に対する新しいLCMベースの自動プログラム修復手法であるDr.Fixを提案する。
論文 参考訳(メタデータ) (2025-03-28T18:43:12Z) - SOPBench: Evaluating Language Agents at Following Standard Operating Procedures and Constraints [59.645885492637845]
SOPBenchは、各サービス固有のSOPコードプログラムを実行可能な関数の有向グラフに変換する評価パイプラインである。
提案手法では,各サービス固有のSOPコードプログラムを実行可能関数の有向グラフに変換し,自然言語SOP記述に基づいてこれらの関数を呼び出しなければならない。
我々は18の先行モデルを評価し、上位モデルでさえタスクが困難であることを示す。
論文 参考訳(メタデータ) (2025-03-11T17:53:02Z) - CaLM: Contrasting Large and Small Language Models to Verify Grounded Generation [76.31621715032558]
グラウンデッドジェネレーションは、言語モデル(LM)に、より信頼性が高く説明可能な応答を生成する能力を持たせることを目的としている。
本稿では,新しい検証フレームワークであるCaLMを紹介する。
我々のフレームワークは、より少ないパラメトリックメモリに依存する小さなLMを有効活用し、より大きなLMの出力を検証する。
論文 参考訳(メタデータ) (2024-06-08T06:04:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。