論文の概要: PLCBench: Can Autonomous LLM Agents Turn PLC Access into Sustained Physical Impact?
- arxiv url: http://arxiv.org/abs/2608.26882v1
- Date: Thu, 27 Aug 2026 09:40:11 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-28 16:30:58.333006
- Title: PLCBench: Can Autonomous LLM Agents Turn PLC Access into Sustained Physical Impact?
- Title(参考訳): PLCBench: 自律型LCMエージェントはPLCアクセスを持続的な物理的インパクトに変えることができるか?
- Authors: Yitian Zhou, Jingyu Zheng, Qiliang Jiang, Linkang Du, Haoming Liu, Lichao Wu, Shiyi Zhao, Mengxiang Liu, Ruilong Deng,
- Abstract要約: PLCBENCHは、サイバー・物理的能力とその境界を特徴付ける最初の実PLCハードウェア・イン・ザ・ループフレームワークである。
ベンダーとネイティブのインタラクション、商用のPLC実行、クローズドループのリダクションプロセスシミュレーション、独立した結果検証を組み合わせたものだ。
その結果、98エピソードは有効なネイティブ読み取りの前に停止するのに対し、62エピソードはプロセスリンクされた書き込みに到達するが、最終的な目的を維持できないことがわかった。
- 参考スコア(独自算出の注目度): 8.55906011630603
- License: http://creativecommons.org/publicdomain/zero/1.0/
- Abstract: Industrial control systems (ICSs) rely on programmable logic controllers (PLCs) to connect networked computation with physical control. Tool-using large language model (LLM) agents represent an emerging attack threat: can an autonomous agent convert a network-reachable PLC into sustained adverse physical impact? However, existing evaluations focus on digital tasks or individual stages of PLC testing. In ICSs, evaluations that stop at software exploitation, an accepted write, or tool access may therefore mischaracterize physical risk. We present PLCBENCH, to our knowledge, the first real-PLC hardware-in-the-loop (HIL) framework for characterizing this cyber-to-physical capability and its boundaries. It combines vendor-native interaction, commercial PLC execution, closed-loop reduced-order process simulation, and independent outcome verification. A deterministic evaluator applies fixed rules to runner, communication, PLC-object, and process records to assign six hidden diagnostic flags, distinguishing usable PLC interaction, process-linked manipulation, and sustained physical impact. We instantiate PLCBENCH on four commercial PLCs crossed with four closed-loop workloads. Across five LLM families and 240 real-PLC episodes, 75 episodes (31.3%) sustain their respective physical objectives. Stagewise results show that 98 episodes stop before a valid native read, whereas 62 reach a process-linked write but do not sustain the final objective. Notably, richer process observation is associated with an increase in conditional objective attainment after a process-linked write from 44.2% to 64.0%. These measurements localize failure in configured PLC-process deployments and identify intervention points for future defense evaluation. To support reproducibility, we release the safely disclosable PLCBENCH code and a software-only reproduction pipeline through the accompanying artifact.
- Abstract(参考訳): 産業制御システム(ICS)は、ネットワーク計算と物理制御を接続するために、プログラマブルロジックコントローラ(PLC)に依存している。
ツール利用大型言語モデル(LLM)エージェントは、新たな脅威となる。自律エージェントは、ネットワーク到達可能なPLCを持続的な物理的影響に変換することができるか?
しかし、既存の評価はデジタルタスクやPLCテストの個々の段階に焦点を当てている。
ICSでは、ソフトウェア利用や書き込み、ツールアクセスで停止する評価が物理的リスクを誤認する可能性がある。
我々はPLCBENCHについて、このサイバー・物理的能力とその境界を特徴づける最初の実PLCハードウェア・イン・ザ・ループ(HIL)フレームワークについて述べる。
ベンダーとネイティブのインタラクション、商用のPLC実行、クローズドループのリダクションプロセスシミュレーション、独立した結果検証を組み合わせたものだ。
決定論的評価器は、ランナー、通信、PLCオブジェクト、プロセスレコードに固定ルールを適用し、6つの隠れ診断フラグを割り当て、使用可能なPLCインタラクション、プロセスリンク操作、持続的な物理的影響を識別する。
PLCBENCHを4つのクローズドループワークロードと交差する4つの商用PLC上でインスタンス化する。
5つのLLMファミリーと240のリアルPLCエピソード、75のエピソード(31.3%)がそれぞれの物理的目的を維持している。
ステージワイズでは98エピソードが有効なネイティブ読み取りの前に停止するのに対し、62エピソードはプロセスリンクされた書き込みに到達するが最終的な目的を維持できない。
特に、よりリッチなプロセス観察は、プロセスリンクされた書き込みが44.2%から64.0%になった後の条件目標達成の増加に関連している。
これらの測定は、構成されたPLCプロセスの配置における障害をローカライズし、将来の防衛評価のための介入点を特定する。
再現性を実現するため, PLCBENCHコードとソフトウェアのみの再生パイプラインを, 付随するアーティファクトを通じてリリースする。
関連論文リスト
- LMSM: LLM Security Framework Inspired by Linux Security Modules [56.93644694627783]
大規模言語モデル(LLM)は階層化されたディフェンスでデプロイされることが多いが、悪意のあるプロンプトはそれらをバイパスすることができる。
我々は,Language Model Security Modules (LMSM) という,Linux Security Modules (LSM) の背後にある分離を LLM サービスに適応させるセキュリティフレームワークを提案する。
論文 参考訳(メタデータ) (2026-08-26T12:13:05Z) - PhyAgentOS: A Self-Evolving Operating System for Embodied Agents with Decoupled Cognitive Planning and Physical Execution [49.776611937968]
我々は、スケジューリング、検証、メモリ、ベンチマーク、安全性をシステムレベルのサービスとして提供するPhyAgentOSを紹介します。
セッション中心のセッションは、スケジューリング、互換性、監督された実行、エビデンス収集、受け入れの最小単位として、アクションではなくセッションを扱う。
SessionVerifierは、実行終了とセマンティックタスク完了を、成功、失敗、または再計画のエビデンスに基づいて判断する。
ベンチマークはデプロイメントセッションと検証パスを再利用するので、結果は実際の実行に遡る。
論文 参考訳(メタデータ) (2026-07-18T04:46:53Z) - Understanding and Evaluating Claw-like Agent Security Through a Computer-Systems Lens [65.53494487819053]
クローのようなAIエージェント(OpenClawなど)は、認証情報、ファイル、ツール、外部サービスへの永続的なアクセスを伴う、常にオンのプロセスである。
我々はClawのようなエージェントをエージェントコンピュータシステムとして扱い、そのゲートウェイランタイムがOSのような仲介の役割を担っている。
我々は、4つの攻撃面にわたる406の敵タスクのベンチマークであるSafeClawArenaを開発した。
論文 参考訳(メタデータ) (2026-06-29T18:00:45Z) - One Step Further: Understanding PLC Binaries Through Cross-Platform Reverse Engineering and Function-Level Semantic Analysis [7.990445011559295]
PLC-BinXはクロスプラットフォームのPLCバイナリ理解のためのBCAワークフローである。
10倍のプログラムレベルでの評価では、PLC-BinXはツールチェーン予測において100.00%の精度、リコール、F1を達成する。
その結果、PLC-BinXはクロスプラットフォームのPLCバイナリ理解に効果的かつ解釈可能なアプローチを提供することが示された。
論文 参考訳(メタデータ) (2026-05-17T11:19:47Z) - Stable Agentic Control: Tool-Mediated LLM Architecture for Autonomous Cyber Defense [0.0]
敵圧下における高い意思決定に関わるエージェントシステムは、既存のアプローチでは提供されない正式な保証が必要である。
LLMエージェントは決定論的ツールを使用し、ツール出力インタフェースで強制される有限アクションカタログから選択する。
論文 参考訳(メタデータ) (2026-05-04T18:02:59Z) - CaP-X: A Framework for Benchmarking and Improving Coding Agents for Robot Manipulation [48.85772216740915]
"Code-as-Policy" は、実行可能コードがデータ集約型のVision-Language-Actionメソッドを補完する方法について考察している。
ロボット操作におけるCode-as-PolicyエージェントのオープンアクセスフレームワークであるCaP-Xを提案する。
論文 参考訳(メタデータ) (2026-03-23T18:08:10Z) - Robotic Grasping and Placement Controlled by EEG-Based Hybrid Visual and Motor Imagery [64.82869118243723]
本稿では,脳波に基づく視覚・運動画像(VI/MI)とロボット制御を統合し,リアルタイム・意図駆動型把握・配置を実現するフレームワークを提案する。
このシステムは、BCI駆動のロボット工学の約束に感銘を受けて、オフラインで事前訓練されたデコーダをゼロショットで展開することによって、ニューラルネットワークを物理的制御でブリッジする。
論文 参考訳(メタデータ) (2026-03-03T17:41:42Z) - AutoPT: How Far Are We from the End2End Automated Web Penetration Testing? [54.65079443902714]
LLMによって駆動されるPSMの原理に基づく自動浸透試験エージェントであるAutoPTを紹介する。
以上の結果から, AutoPT は GPT-4o ミニモデル上でのベースラインフレームワーク ReAct よりも優れていた。
論文 参考訳(メタデータ) (2024-11-02T13:24:30Z) - One for All and All for One: GNN-based Control-Flow Attestation for
Embedded Devices [16.425360892610986]
Control-Flow (CFA) は、エンティティ(検証者)がリモートコンピュータシステム上でのコード実行の整合性を検証するためのセキュリティサービスである。
既存のCFAスキームは、証明者の内部状態へのアクセスを要求するなど、非現実的な仮定に悩まされる。
RAGEは、最小限の要件を持つ、新しくて軽量なCFAアプローチです。
論文 参考訳(メタデータ) (2024-03-12T10:00:06Z) - Code Integrity Attestation for PLCs using Black Box Neural Network
Predictions [6.328987417919762]
プライバシ保護ブラックボックスモデルに基づく実用的なコード整合性チェックソリューションを提案する。
モデルのブラックボックスの性質を活用することで、当社のソリューションは元のPLCコードのプライバシを維持することができる。
筆者らは, 現代の6段水処理プラント試験場において, PLC入力からアクチュエータ状態をほぼ100%精度で予測できることを発見した。
論文 参考訳(メタデータ) (2021-06-15T03:09:29Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。