論文の概要: PlannerForge: LLM Agents for Scenario-Based Testing of Motion Planners in Autonomous Driving
- arxiv url: http://arxiv.org/abs/2609.08965v1
- Date: Tue, 08 Sep 2026 16:19:06 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-10 19:44:08.692146
- Title: PlannerForge: LLM Agents for Scenario-Based Testing of Motion Planners in Autonomous Driving
- Title(参考訳): PlannerForge: LLM Agents for Scenario-based Testing of Motion Planners in autonomous Driving
- Abstract要約: PlannerForgeは、自律運転システムのシナリオベースのテストのためのLLMエージェントフレームワークである。
シナリオベースのテストステージ(シナリオ生成からADSアセスメントまで)をすべて拡張し、さらに2つのLLM強化ステージ(ADS Enhancement)とADSベンチマーク(ADS Benchmarking)を追加する。
各タスク(生成、選択、修正、モジュールルーティング、プランナーテスト、拡張)のオフザシェルフ LLM を5つの条件下で評価する。
- 参考スコア(独自算出の注目度): 10.333141457557966
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Ensuring the safety of autonomous driving is a critical challenge. Scenario-based testing is a systematic process used to validate Autonomous Driving Systems (ADSs), but it remains a fragmented modular pipeline in which scenario generation, retrieval, modification, ADS execution, and results analysis are performed by separate tools with little interaction. Large Language Model (LLM) agents have shown promise across ADS sub-systems such as perception, planning, and control. However, no prior work covers the whole scenario-based testing pipeline for ADSs with a unified LLM-agent framework. We present PlannerForge, an LLM-agent framework that extends all scenario-based testing stages (from Scenario Generation to ADS Assessment) and adds two further LLM-enhanced stages: ADS Enhancement and ADS Benchmarking. We evaluate PlannerForge with 10 off-the-shelf LLMs across all tasks (Generation, Selection, Modification, Module Routing, Planner Testing, and Enhancement) under 5 prompt conditions. Best-per-task scores range from 0.88 to 1.00, and open-source 20-35B backends match commercial APIs on most tasks. Open-source models such as Qwen3.6:35B match commercial APIs on three of the five tasks. Chaining the modules end-to-end retains 83% / 78% of seed queries (commercial / open). It outperforms Scenario Factory 2.0 (Finkeldei et al., 2025) on natural-language generation (193 vs. 144 executable of 200) and realises 92-96% of requested city, road and vehicle attributes. It outperforms BM25 (Robertson and Zaragoza, 2009) at rank 1 selection (92.0% vs. 67.5%) and From-Words-to-Collisions (Gao et al., 2025) on physically valid edits (>=94% vs. 31%). At N=400, cost-tuning lifts planner success from 50.4% to 70.2% and cuts collisions from 19.0% to 8.4%, without domain-specific fine-tuning.
- Abstract(参考訳): 自動運転の安全性を確保することは重要な課題である。
シナリオベースのテストは、自律運転システム(ADS)の検証に使用される体系的なプロセスであるが、シナリオ生成、検索、修正、ADSの実行、結果分析が、ほとんど相互作用のない別々のツールによって実行される、断片化されたモジュールパイプラインのままである。
LLM(Large Language Model)エージェントは、認識、計画、制御といったADSサブシステムにまたがる約束を示す。
しかしながら、LDM-agentフレームワークを統一したADSのシナリオベースのテストパイプライン全体をカバーする以前の作業はない。
PlannerForgeはシナリオベースのテストステージを(シナリオ生成からADSアセスメントまで)拡張するLLMエージェントフレームワークで、さらに2つのLLM拡張ステージ、ADS拡張とADSベンチマークを追加します。
各タスク(生成、選択、修正、モジュールルーティング、プランナーテスト、拡張)のオフザシェルフ LLM を5つの条件下で評価する。
タスク毎のベストスコアは0.88から1.00の範囲で、オープンソースの20-35Bバックエンドは、ほとんどのタスクで商用APIにマッチする。
Qwen3.6:35Bのようなオープンソースモデルは、5つのタスクのうち3つの商用APIと一致している。
モジュールをエンドツーエンドに結合すると、シードクエリ(商用/オープン)の83%/78%が保持される。
シナリオファクトリー2.0(Finkeldei et al , 2025)を自然言語生成(193対144実行可能200)で上回り、要求される都市、道路、車両の属性の92-96%を達成している。
BM25 (Robertson and Zaragoza, 2009) を1位(92.0% vs. 67.5%)、From-Words-to-Collisions (Gao et al , 2025) で上回り(>94% vs. 31%)。
N=400では、コストチューニングはプランナーの成功を50.4%から70.2%に引き上げ、衝突を19.0%から8.4%に削減する。
関連論文リスト
- From Production Traffic to Post-Training: Building a Self-Hosted LLM That Covers the Corporate Request Mix [55.08143827481755]
200以上の内部アプリケーションから1つのモデルにトラフィックを集約します。
我々は、各軸ごとに別々のGRPOエキスパートを訓練し、2段階のSLERPを介してそれらをマージする。
このモデルは、プラットフォームトラフィックの50%、月1億6600万リクエストをサービスコストのごく一部で吸収する。
論文 参考訳(メタデータ) (2026-09-01T17:39:26Z) - HxAgent: Iterative Agent Planning for End-to-End Web Application Testing [9.769347685261687]
プロアクティブな修正戦略を備えた反復計画エージェントであるHxAgentを紹介する。
HxAgent 97.4% MiniWoB++のExact-Match精度。
OnlineMind2Webでは、WALTよりも4.6%改善されている。
論文 参考訳(メタデータ) (2026-08-16T02:40:37Z) - Mind the Gap: Can Frontier LLMs Pass a Standardized Office Proficiency Exam? [90.39633603556767]
コンピュータ自動化のための大規模言語モデル(LLM)エージェントは加速しているが、複雑なプロフェッショナルグレードの生産性ソフトウェアをナビゲートする能力はほとんどテストされていない。
この能力を定量化するために,中国のコンピュータランク試験(NCRE)に基づく評価を導入する。
我々は7つのフロンティア LLM をベンチマークし、スターク制限を観測した。
より強力なエージェントシステムであり、実行フィードバック、反復的修復、より広いオフィス自動化アクセスは68.8%に達するが、スコアの正当性チェックとして使われる95.5%のコミュニティ基準スコアを下回っている。
論文 参考訳(メタデータ) (2026-06-09T14:59:14Z) - SDOF: Taming the Alignment Tax in Multi-Agent Orchestration with State-Constrained Dispatch [0.0]
制約状態マシンとしてマルチエージェント実行を扱うフレームワークであるSDOFを提案する。
Beisen iTalentプラットフォームが支援する採用システムでは、専門家による185のシナリオが1671のライブAPIコールを起動する。
GSPO 対応 7B Intent Router は,この FSM 制約付き逆ルーティングベンチマークにおいてゼロショット GPT-4o よりも高いジョイント精度を実現する。
論文 参考訳(メタデータ) (2026-04-20T12:51:39Z) - Measuring the Permission Gate: A Stress-Test Evaluation of Claude Code's Auto Mode [9.116800340266066]
Claude Codeの自動モードは、AIコーディングエージェントに最初にデプロイされたパーミッションシステムである。
Anthropicは、生産トラフィックに対して0.4%の偽陽性率と17%の偽陰性率を報告している。
本研究では, 個々の行動レベルでの状態変化行動253件を, オラクル・グラウンドの真理に対して評価した。
論文 参考訳(メタデータ) (2026-04-04T17:56:30Z) - Multi-Agent LLM Committees for Autonomous Software Beta Testing [0.0]
このフレームワークは、モデルの多様性、ペルソナ駆動の振る舞いの変化、視覚的ユーザインターフェイスの理解を組み合わせたものだ。
視覚対応エージェントは、ナビゲーションとレポートによってユーザインターフェース要素を100%成功させることに成功した。
このフレームワークは、CI/CDパイプラインにおけるLLMベースのソフトウェアテストの再現可能な研究と実践的な展開を可能にする。
論文 参考訳(メタデータ) (2025-12-21T02:06:53Z) - Towards a Science of Scaling Agent Systems [79.64446272302287]
エージェント評価の定義を定式化し,エージェント量,コーディネーション構造,モデル,タスク特性の相互作用として,スケーリング法則を特徴付ける。
協調指標を用いて予測モデルを導出し,R2=0をクロスバリデーションし,未知のタスク領域の予測を可能にする。
ツールコーディネーショントレードオフ: 固定的な計算予算の下では, ツールヘビータスクはマルチエージェントのオーバーヘッドから不均衡に悩まされ, 2) 能力飽和: 調整が減少または負のリターンを, 単一エージェントのベースラインが45%を超えると達成できる。
論文 参考訳(メタデータ) (2025-12-09T06:52:21Z) - GLM-4.5: Agentic, Reasoning, and Coding (ARC) Foundation Models [194.64264251080454]
GLM-4.5はオープンソースのMixture-of-Experts(MoE)大言語モデルであり,総パラメータは355B,アクティベートパラメータは32Bである。
23Tトークンのマルチステージトレーニングと、エキスパートモデルのイテレーションと強化学習による総合的なポストトレーニングを通じて、GLM-4.5はエージェント、推論、コーディングタスクにわたって強力なパフォーマンスを実現している。
GLM-4.5(355Bパラメータ)とGLM-4.5-Air(106Bパラメータ)をそれぞれリリースし、推論とエージェントAIシステムの研究を進めた。
論文 参考訳(メタデータ) (2025-08-08T17:21:06Z) - SOPBench: Evaluating Language Agents at Following Standard Operating Procedures and Constraints [59.645885492637845]
SOPBenchは、各サービス固有のSOPコードプログラムを実行可能な関数の有向グラフに変換する評価パイプラインである。
提案手法では,各サービス固有のSOPコードプログラムを実行可能関数の有向グラフに変換し,自然言語SOP記述に基づいてこれらの関数を呼び出しなければならない。
我々は18の先行モデルを評価し、上位モデルでさえタスクが困難であることを示す。
論文 参考訳(メタデータ) (2025-03-11T17:53:02Z) - From Accidents to Insights: Leveraging Multimodal Data for Scenario-Driven ADS Testing [3.984220091774453]
本稿では,シナリオベースADSテストケース生成フレームワークであるTRACEを紹介する。
マルチモーダルデータを活用して、現実世界の事故報告から困難なシナリオを抽出することで、TRACEは少ないデータで多数の重要なテストケースを構築します。
ユーザからのフィードバックによると、TRACEはシナリオ再構築の精度が優れており、シナリオの77.5%が"ほぼ"あるいは"完全に"一貫性がある"と評価されている。
論文 参考訳(メタデータ) (2025-02-04T05:21:29Z) - How Well Can Modern LLMs Act as Agent Cores in Radiology Environments? [54.36730060680139]
RadA-BenchPlatは、放射線学環境での大規模言語モデル(LLM)のパフォーマンスをベンチマークする評価プラットフォームである。
また、エージェント駆動型タスク解決ツールの10のカテゴリを定義し、7つの主要なLCMを評価している。
論文 参考訳(メタデータ) (2024-12-12T18:20:16Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。