論文の概要: SemaPLC: A Project-Grounded, Verification-Gated Agent Harness for PLC Code Generation
- arxiv url: http://arxiv.org/abs/2608.18565v1
- Date: Wed, 19 Aug 2026 05:44:29 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-20 20:13:55.288703
- Title: SemaPLC: A Project-Grounded, Verification-Gated Agent Harness for PLC Code Generation
- Title(参考訳): SemaPLC: PLCコード生成のためのプロジェクトGrounded, Verification-Gated Agent Harness
- Abstract要約: textscSemaPLCはプロジェクトベースで検証済みのエージェントハーネスである。
ログされた外部チェックがそれを確認した場合のみ、タスクが完了すると宣言する。
textscSemaPLCは7つのモデルの中で最も厳格なパスレートを達成した。
- 参考スコア(独自算出の注目度): 18.566580423046908
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Programmable logic controllers (PLCs) run industrial plants, and large language models can already generate independent program organization units (POUs) for them. Whether such logic integrates into an existing PLC project and then runs correctly has been checked only in limited tests. We present \textsc{SemaPLC}, a project-grounded and verification-gated agent harness assembled from conventional tools but governed by a strict completion rule. Rather than stopping when the model judges its own output adequate, \textsc{SemaPLC} declares a task complete only when logged external checks confirm it. Those checks cover the specification, the compilation, and the behavior on a live runtime. On 117 independent-POU tasks matching existing benchmarks, it attains the highest strict verified pass rate on all seven models (72.6\% mean). On a project-context track of 65 tasks whose generated logic must compile and run inside a real project, it attains the highest mean on integrated compilation, static behavior, and dynamic behavior. Of the three layers, dynamic behavior is the most revealing. We measure it by deploying the generated and the reference logic to a live PLC runtime and comparing their executed traces. All methods fall within 10 static points of one another, whereas dynamic scores separate them sharply, from 22.4 to 31.4 for the baselines against 52.2 for \textsc{SemaPLC}. Overall, our verification-gated harness raises the mean at every layer and most sharply at runtime. Execution, not static scoring, is the faithful test of whether generated control logic actually works. \textsc{SemaPLC} is open-sourced at https://github.com/midea-ai/SemaPLC.
- Abstract(参考訳): プログラム可能な論理制御器 (PLC) は産業プラントを動作させ、大規模言語モデルはすでに独立プログラム組織単位 (POU) を生成できる。
そのようなロジックが既存のPLCプロジェクトに統合され、それから正しく実行されるかは、限られたテストでのみチェックされている。
本稿では、従来のツールから組み立てられたプロジェクト・グラウンドで検証されたエージェント・ハーネスである \textsc{SemaPLC} について述べる。
モデルが自身の出力を適切に判断する時に停止する代わりに、 \textsc{SemaPLC} はログされた外部チェックがそれを確認する場合にのみタスクが完了することを宣言する。
これらのチェックは、仕様、コンパイル、およびライブランタイム上の振る舞いをカバーします。
既存のベンチマークと一致した117の独立POUタスクでは、7つのモデル(平均72.6\%)で最も厳密な認証パスレートを達成した。
生成されたロジックを実際のプロジェクト内でコンパイルし実行しなければならない65のタスクからなるプロジェクトコンテキストトラックでは、統合されたコンパイル、静的な振る舞い、動的振る舞いにおいて最高の平均値に達する。
3つのレイヤの中で、動的な振る舞いが最も顕著です。
生成されたおよび参照ロジックをライブPLCランタイムにデプロイし、実行されたトレースを比較することで測定する。
すべてのメソッドは互いに10の静的なポイントに収まるが、動的スコアは22.4から31.4のベースラインと、 \textsc{SemaPLC}の52.2に対して、それらを鋭く分離する。
全体として、検証付きハーネスは各レイヤの平均値を上げ、実行時に最も急上昇します。
実行は静的スコアリングではなく、生成した制御ロジックが実際に動作するかどうかの忠実なテストである。
\textsc{SemaPLC}はhttps://github.com/midea-ai/SemaPLCでオープンソース化されている。
関連論文リスト
- ClawProBench: Trace-Aware Evaluation of AI Agents with Runtime Coverage and Frozen Workplace-Style Holdouts [0.0]
エージェントベンチマークは、エージェントがステートフルランタイム上で実行されている場合でも、最終回答のみを評価することが多い。
OpenClaw上でインスタンス化されたランタイムネイティブエージェント評価のためのトレース対応ベンチマークであるClawProBenchを提案する。
論文 参考訳(メタデータ) (2026-08-23T17:09:02Z) - PhyAgentOS: A Self-Evolving Operating System for Embodied Agents with Decoupled Cognitive Planning and Physical Execution [49.776611937968]
我々は、スケジューリング、検証、メモリ、ベンチマーク、安全性をシステムレベルのサービスとして提供するPhyAgentOSを紹介します。
セッション中心のセッションは、スケジューリング、互換性、監督された実行、エビデンス収集、受け入れの最小単位として、アクションではなくセッションを扱う。
SessionVerifierは、実行終了とセマンティックタスク完了を、成功、失敗、または再計画のエビデンスに基づいて判断する。
ベンチマークはデプロイメントセッションと検証パスを再利用するので、結果は実際の実行に遡る。
論文 参考訳(メタデータ) (2026-07-18T04:46:53Z) - Compile, Then Page: Executable SOP Programs and a Capability-Gated Runtime for Procedural LLM Agents [28.708170100907612]
エンタープライズエージェントは、長期的、条件付き、安全クリティカルな標準運用手順に従う必要がある。
6つのモデルにまたがる3つのSOPBench研究は、実行時ガイダンスから表現を分離する。
フルプログラムカーソルアブレーション(アクティブフレーム第一、完全プログラム保持)は、強いモデル拒絶ゲインの多くを回復する。
バンクでは3つの主要な武器が70.4から86.4から92.8に上昇し、100%の正当性を拒絶している。
論文 参考訳(メタデータ) (2026-07-13T10:07:50Z) - PairCoder++: Pair Programming as a Universal Paradigm for Verified Code-Driven Multimodal and Structured-Artifact Generation [51.92442051257354]
PairCoderは、実行のみではなく、完全な公式メトリックスイート上で、アーティファクトが検証可能なすべてのベンチマークを本質的に改善する。
TikZのコンパイルレートは、各モデルで10から30ポイント、シングルモデルの2.9から9.2倍である。
論文 参考訳(メタデータ) (2026-07-02T08:36:02Z) - Closed-Loop Control with Rule-Aligned Small Language Models and Multi-Agent Self-Correction [17.527470001317685]
本研究では,コンパクトな小言語モデル (SLM) を制御推論のために再訓練し,検証器誘導補正ループに組み込むことができるかを検討する。
ランダム化熱制御シミュレーション(それぞれ500段の30の実験)では、平均的なアクションアライメント精度が91.5%に達する。
シンボリック・リマッピングの下では95%のインレンジレートを維持しており、トークンレベルの合意が減ったにもかかわらず、堅牢な物理的規制を示している。
論文 参考訳(メタデータ) (2026-06-24T13:49:01Z) - Trustworthy Software Project Generation : a Case Study with an Interactive Theorem Prover [2.6146136791093104]
本稿では,対話型定理証明器(ITP)が大規模ソフトウェア生成を支援するかどうかを考察する。
ITPは純粋全関数を扱うが、I/Oのような効果はないため、エージェントは実効的なコードを純粋論理から分離する。
本稿では, RISC-V RV32I ベースの47命令すべてに対して, CPU インタプリタの完全自動開発を通じて, この経路について検討する。
論文 参考訳(メタデータ) (2026-05-25T16:35:36Z) - ClawForge: Generating Executable Interactive Benchmarks for Command-Line Agents [59.626170560327274]
textbfClawForgeは、ステートコンフリクト下で実行可能なコマンドラインカテゴリのためのジェネレータベースのベンチマークフレームワークである。
私たちはこのフレームワークをClawForge-Bench(17のシナリオ、6の能力カテゴリ)としてインスタンス化します。
論文 参考訳(メタデータ) (2026-05-13T21:34:08Z) - WildClawBench: A Benchmark for Real-World, Long-Horizon Agent Evaluation [88.10947115397971]
この研究でWildClawBenchは、6つのテーマのカテゴリにまたがる60の人間によるバイリンガルなマルチモーダルタスクのネイティブランタイムベンチマークである。
各タスクは、約8分間のウォールクロック時間と20以上のツールコールで実行されます。
グラディングはハイブリッドであり、決定論的ルールベースのチェック、副作用の環境状態監査、意味的検証のためのLLM/VLM判定を組み合わせている。
論文 参考訳(メタデータ) (2026-05-11T17:49:43Z) - ProgramBench: Can Language Models Rebuild Programs From Scratch? [59.40748183470308]
ProgramBenchは、ソフトウェアエンジニアリングエージェントがソフトウェアをホリシックに開発する能力を測定する。
エンドツーエンドの動作テストはエージェント駆動ファジィによって生成される。
モデルは、人間が書いたコードと大きく異なるモノリシックでシングルファイルの実装を好む。
論文 参考訳(メタデータ) (2026-05-05T09:17:02Z) - SPARC: Scenario Planning and Reasoning for Automated C Unit Test Generation [1.0010193170880752]
本稿では,高レベルのプログラム意図とポインタ演算と手動メモリ管理の厳密な構文制約とのギャップを埋める,ニューロシンボリックなシナリオベースのフレームワークを提案する。
我々は、59の現実世界およびアルゴリズムの被験者で評価し、バニラプロンプト生成ベースラインを31.36%、分岐カバレッジ26.01%、突然変異スコア20.78%で上回り、シンボリック実行ツールKLEEに適合または超えている。
論文 参考訳(メタデータ) (2026-02-18T18:09:03Z) - CLEVER: A Curated Benchmark for Formally Verified Code Generation [53.5486188696892]
$rm Csmall LEVER$は、リーンにおけるエンドツーエンドのコード生成のための161の問題を、高品質でキュレートしたベンチマークである。
それぞれの問題は、(1)堅実な仕様と一致する仕様を生成するタスク、(2)この仕様を確実に満足するリーン実装を生成するタスクで構成されています。
論文 参考訳(メタデータ) (2025-05-20T05:15:47Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。