論文の概要: Compile, Then Page: Executable SOP Programs and a Capability-Gated Runtime for Procedural LLM Agents
- arxiv url: http://arxiv.org/abs/2607.11346v2
- Date: Thu, 16 Jul 2026 06:58:36 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-17 14:53:42.206465
- Title: Compile, Then Page: Executable SOP Programs and a Capability-Gated Runtime for Procedural LLM Agents
- Title(参考訳): Compile, Then Page: Executable SOP Programs and a Capability-Gated Runtime for Procedural LLM Agents
- Abstract要約: エンタープライズエージェントは、長期的、条件付き、安全クリティカルな標準運用手順に従う必要がある。
6つのモデルにまたがる3つのSOPBench研究は、実行時ガイダンスから表現を分離する。
フルプログラムカーソルアブレーション(アクティブフレーム第一、完全プログラム保持)は、強いモデル拒絶ゲインの多くを回復する。
バンクでは3つの主要な武器が70.4から86.4から92.8に上昇し、100%の正当性を拒絶している。
- 参考スコア(独自算出の注目度): 28.708170100907612
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Enterprise agents must follow long-horizon, conditional, safety-critical standard operating procedures (SOPs). We compile machine-readable SOP constraints into executable pseudo-code and run them with a program-guided (PG) stack machine that pages the active frame while an LLM performs semantic execution. A three-arm SOPBench study across six models separates representation from runtime: compiled text never significantly hurts and gains up to 16.0 points where official prose underperforms. Runtime guidance is capability-gated. Two strong models independently show positive seven-domain PG contrasts (58:19 and 75:31 discordant pairs), whereas weak models are harmed. A full-program cursor ablation (active frame first, complete program retained) recovers much of the strong-model refusal gain; selective visibility adds a smaller improvement. Paired probe and audit measurements track this divide to spontaneous state discipline rather than reconstruction ability. On Bank the three primary arms rise from 70.4 to 86.4 to 92.8, with 100% refusal correctness. Practical guidance: compile first; enable active-frame paging only after a model-level discipline check.
- Abstract(参考訳): エンタープライズエージェントは、長期的、条件付き、安全クリティカルな標準運用手順(SOP)に従う必要がある。
我々は、機械可読SOP制約を実行可能な擬似コードにコンパイルし、プログラム誘導(PG)スタックマシンで実行し、LCMがセマンティック実行を行う間にアクティブフレームをページングする。
6つのモデルにわたる3本腕のSOPBenchによる研究は、実行時から表現を分離している。
実行時ガイダンスは機能限定である。
2つの強いモデルが独立に正の7ドメインPGコントラスト(58:19と75:31の不協和ペア)を示すのに対し、弱いモデルは害を受ける。
フルプログラムカーソルアブレーション(アクティブフレーム第一、完全プログラム保持)は、強いモデルの拒絶ゲインの多くを回復する。
ペアリングプローブと監査測定は、再建能力よりも自発的な状態規律への分割を追跡する。
バンクでは3つの主要な武器が70.4から86.4から92.8に上昇し、100%の正当性を拒絶している。
実際のガイダンス: まずコンパイルし、モデルレベルの規律チェックの後にのみアクティブフレームのページングを有効にする。
関連論文リスト
- LMSM: LLM Security Framework Inspired by Linux Security Modules [56.93644694627783]
大規模言語モデル(LLM)は階層化されたディフェンスでデプロイされることが多いが、悪意のあるプロンプトはそれらをバイパスすることができる。
我々は,Language Model Security Modules (LMSM) という,Linux Security Modules (LSM) の背後にある分離を LLM サービスに適応させるセキュリティフレームワークを提案する。
論文 参考訳(メタデータ) (2026-08-26T12:13:05Z) - ClawArena-Team: Benchmarking Subagent Orchestration and Dynamic Workflows in Language-Model Agents [61.184954205350984]
ClawArena-Teamは、41のマルチターン、マルチモーダル、マルチエージェントシナリオのベンチマークである。
全体的なスコア -- Subagent-Management Score (SMS) -- は、タスクの正しさを最小限のプライマリとモダリティのルーティング因子によって乗算する。
論文 参考訳(メタデータ) (2026-06-30T06:06:08Z) - Closed-Loop Control with Rule-Aligned Small Language Models and Multi-Agent Self-Correction [17.527470001317685]
本研究では,コンパクトな小言語モデル (SLM) を制御推論のために再訓練し,検証器誘導補正ループに組み込むことができるかを検討する。
ランダム化熱制御シミュレーション(それぞれ500段の30の実験)では、平均的なアクションアライメント精度が91.5%に達する。
シンボリック・リマッピングの下では95%のインレンジレートを維持しており、トークンレベルの合意が減ったにもかかわらず、堅牢な物理的規制を示している。
論文 参考訳(メタデータ) (2026-06-24T13:49:01Z) - ExecuGraph: A Multi-Agent, Execution-Grounded Framework for Reliable Backend Code Synthesis with Large Language Models [2.3004655342211078]
大規模言語モデルは、もっともらしいバックエンドコードを生成するが、シングルパスパラダイムは、正確性や実行時の信頼性を保証するものではない。
バックエンドコードの中心に実行ベースのバリデーションを置くマルチエージェントフレームワークであるExecuGraphを紹介します。
エージェントごとのアブレーション、再試行予算の掃除、エラークラス分類、およびテストソース監査が報告されている。
論文 参考訳(メタデータ) (2026-06-18T05:58:17Z) - Trace2Policy: From Expert Behavior Traces to Self-Evolving Decision Agents [5.689042186242701]
企業の専門家が暗黙的に適用する決定ルールは、反復的エラー分析によって体系的に回復し、改善することができる。
基本機構は textbfEISR である textbfTrace2Policy について述べる。
各ラウンドは検証セット上でルールを実行し、ルート原因によるエラーをMISSING、WRONG、CONFLICTタイプにクラスタし、ターゲットパッチを適用し、レグレッションゲートを通過するもののみをコミットする。
論文 参考訳(メタデータ) (2026-06-09T06:05:29Z) - ClawForge: Generating Executable Interactive Benchmarks for Command-Line Agents [59.626170560327274]
textbfClawForgeは、ステートコンフリクト下で実行可能なコマンドラインカテゴリのためのジェネレータベースのベンチマークフレームワークである。
私たちはこのフレームワークをClawForge-Bench(17のシナリオ、6の能力カテゴリ)としてインスタンス化します。
論文 参考訳(メタデータ) (2026-05-13T21:34:08Z) - CAX-Agent: A Lightweight Agent Harness for Reliable APDL Automation [7.355373109826612]
本稿ではMAPDL自動化のための軽量エージェントハーネスであるCAX-Agentのアーキテクチャについて述べる。
我々は50の標準構造ベンチマークで3つのリカバリ戦略(no_recovery, rule_only, model_only)を評価した。
Model_onlyは、最大完了率(0.9267)、タスクスコア(3.59/4)、総得点(9.16/10)、ゼロ介入率(0.84)、0.7733, 3.17/4, 7.03/10, 0.00)、no_recovery(0.6933, 2.74/4, 5.60/10, 0.00)を大きな効果サイズで達成する。
論文 参考訳(メタデータ) (2026-05-12T14:46:34Z) - SPARC: Scenario Planning and Reasoning for Automated C Unit Test Generation [1.0010193170880752]
本稿では,高レベルのプログラム意図とポインタ演算と手動メモリ管理の厳密な構文制約とのギャップを埋める,ニューロシンボリックなシナリオベースのフレームワークを提案する。
我々は、59の現実世界およびアルゴリズムの被験者で評価し、バニラプロンプト生成ベースラインを31.36%、分岐カバレッジ26.01%、突然変異スコア20.78%で上回り、シンボリック実行ツールKLEEに適合または超えている。
論文 参考訳(メタデータ) (2026-02-18T18:09:03Z) - Self-Abstraction from Grounded Experience for Plan-Guided Policy Refinement [61.35824395228412]
大規模言語モデル(LLM)ベースのエージェントは、ソフトウェア工学のタスクに取り組むためにますます使われています。
エージェントが自身のタスク実行から学習することを可能にするフレームワークであるSAGE(Self-Abstraction from Grounded Experience)を提案する。
論文 参考訳(メタデータ) (2025-11-08T08:49:38Z) - AegisLLM: Scaling Agentic Systems for Self-Reflective Defense in LLM Security [74.22452069013289]
AegisLLMは、敵の攻撃や情報漏洩に対する協調的なマルチエージェント防御である。
テスト時のエージェント推論システムのスケーリングは,モデルの有用性を損なうことなく,ロバスト性を大幅に向上させることを示す。
アンラーニングやジェイルブレイクを含む主要な脅威シナリオに対する総合的な評価は、AegisLLMの有効性を示している。
論文 参考訳(メタデータ) (2025-04-29T17:36:05Z) - SOPBench: Evaluating Language Agents at Following Standard Operating Procedures and Constraints [59.645885492637845]
SOPBenchは、各サービス固有のSOPコードプログラムを実行可能な関数の有向グラフに変換する評価パイプラインである。
提案手法では,各サービス固有のSOPコードプログラムを実行可能関数の有向グラフに変換し,自然言語SOP記述に基づいてこれらの関数を呼び出しなければならない。
我々は18の先行モデルを評価し、上位モデルでさえタスクが困難であることを示す。
論文 参考訳(メタデータ) (2025-03-11T17:53:02Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。