論文の概要: Translating Natural Language to Strategic Temporal Specifications via LLMs
- arxiv url: http://arxiv.org/abs/2606.30441v2
- Date: Thu, 02 Jul 2026 13:55:48 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 19:45:08.49485
- Title: Translating Natural Language to Strategic Temporal Specifications via LLMs
- Title(参考訳): LLMによる自然言語の戦略的時間的仕様への変換
- Authors: Marco Aruta, Francesco Improta, Vadim Malvone, Aniello Murano, Vladana Perlić,
- Abstract要約: 本稿では, 戦略的要件の自然言語記述を, ATL/ATL* の公式に翻訳する枠組みを提案する。
我々の最高の微調整システムは、統計学的に最強数ショットプロプライエタリベースラインの0.86と同等の、0.84のセマンティック精度に達する。
生成された仕様の実用性を評価するため、既存の戦略的論理モデルチェッカーにツールを組み込む。
- 参考スコア(独自算出の注目度): 4.863985119779627
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: A rigorous formalization of system requirements is a fundamental prerequisite for the verification of Multi-Agent Systems (MAS). However, writing correct formal specifications is well known as an error-prone, time-consuming, and expertise-intensive task. This difficulty is further accentuated in MAS, where requirements must capture strategic abilities and temporal objectives. At present, there is no established methodology for deriving MAS specifications from natural language. We present a framework for translating Natural Language descriptions of strategic requirements into well-formed ATL/ATL* formulas using Large Language Models (LLMs). Since no available dataset supports supervised learning for the NL-to-ATL/ATL* translation task, we create and curate a novel expert-validated dataset, employed for training and evaluating fine-tuned models. On a held-out test set, evaluated under the LLM judge that best agrees with expert annotations, in-domain fine-tuning of small open-weight models (3 - 7B parameters) matches strong few-shot proprietary API baselines. Our best fine-tuned system reaches 0.84 semantic accuracy, statistically on par with 0.86 for the strongest few-shot proprietary baseline, while keeping requirements on-premises. We further find that judge reliability is inverse to generator strength. The open-weight Llama-3.3-70B tracks human verdicts most closely, whereas the strongest proprietary models are the least reliable judges, over-rejecting faithful paraphrases of the reference. To assess the practical applicability of the generated specifications, we embed our tool to an existing strategic logics model checker, enabling non-expert users to specify strategic properties in natural language.
- Abstract(参考訳): システム要件の厳密な形式化は、マルチエージェントシステム(MAS)の検証の基本的な前提条件である。
しかし、正しい形式仕様を書くことは、エラーを起こしやすく、時間がかかり、専門的なタスクとしてよく知られています。
この困難さはMASにおいてさらに強調され、要求は戦略的能力と時間的目的を捉える必要がある。
現在,MAS仕様を自然言語から導出する方法は確立されていない。
本稿では,戦略的要件の自然言語記述を,Large Language Models (LLMs) を用いて,十分に整形されたATL/ATL*式に変換するためのフレームワークを提案する。
NL-to-ATL/ATL*翻訳タスクの教師あり学習をサポートするデータセットは存在しないため、我々は、微調整モデルのトレーニングと評価に使用される、新しいエキスパート検証データセットを作成し、キュレートする。
LLMの判断の下で評価されたテストセットでは、専門家のアノテーションに最もよく一致すると評価されているが、小さなオープンウェイトモデルのドメイン内微調整(3~7Bパラメータ)は、強力な数発のプロプライエタリなAPIベースラインと一致している。
我々の最高の微調整システムは、前提条件をオンプレミスに保ちながら、最強のプロプライエタリベースラインである0.86と統計的に比較して、0.84のセマンティック精度に達する。
さらに、裁判官の信頼性は発電機の強度に反することがわかった。
オープンウェイトなLlama-3.3-70Bは人間の評定を最もよく追跡するが、最強のプロプライエタリなモデルは最も信頼性の低い審査員であり、参照の忠実なパラフレーズを過剰に否定する。
生成した仕様の実用性を評価するため、既存の戦略的論理モデルチェッカーにツールを組み込んで、専門家でないユーザが自然言語の戦略的特性を指定できるようにする。
関連論文リスト
- LTLGuard: Formalizing LTL Specifications with Compact Language Models and Lightweight Symbolic Reasoning [2.365021420497964]
自然言語のあいまいさと可変性(NL)のため、非公式な要件を形式的な仕様に翻訳することは困難である
本研究では,資源効率の高いオープンウェイトモデルにより,非公式な要件から適切な時間論理(LTL)仕様を生成することに焦点を当てる。
現在Guardは、制約付き生成とフォーマルな一貫性チェックを組み合わせたモジュラーツールチェーンで、非公式な入力からコンフリクトフリー仕様を生成する。
論文 参考訳(メタデータ) (2026-03-05T22:34:45Z) - RL-Struct: A Lightweight Reinforcement Learning Framework for Reliable Structured Output in LLMs [0.08594140167290097]
大規模言語モデル(LLM)は、自然言語の生成と推論において顕著な能力を示した。
自動化されたソフトウェアエコシステムへの統合は、しばしば"構造ギャップ"によって妨げられます。
このギャップを埋めるための軽量で効率的な強化学習フレームワークを提案する。
論文 参考訳(メタデータ) (2025-11-29T04:47:14Z) - LETToT: Label-Free Evaluation of Large Language Models On Tourism Using Expert Tree-of-Thought [18.539462131974215]
我々はエキスパート由来の推論構造を利用するフレームワークであるExpert $textbfT$ree-$textbfo$f-$textbfT$hought (LETToT)を提案する。
その結果,4.99-14.15%の相対的品質向上率をベースラインに最適化したToTの有効性が示された。
論文 参考訳(メタデータ) (2025-08-15T07:37:12Z) - Transferable Modeling Strategies for Low-Resource LLM Tasks: A Prompt and Alignment-Based Approach [1.3286097954612326]
本稿では,低リソース言語シナリオにおける大規模言語モデルの伝達と適応能力の制限について論じる。
知識伝達モジュールとパラメータ効率のよい微調整戦略を組み合わせた統合フレームワークを提案する。
大規模言語モデルの一般的な機能を維持しながら、タスク固有の適応性を向上させる。
論文 参考訳(メタデータ) (2025-07-01T09:34:49Z) - Context is Key: A Benchmark for Forecasting with Essential Textual Information [87.3175915185287]
コンテキスト is Key" (CiK) は、数値データを多種多様なテキストコンテキストと組み合わせた予測ベンチマークである。
我々は,統計モデル,時系列基礎モデル,LLMに基づく予測モデルなど,さまざまなアプローチを評価する。
提案手法は,提案するベンチマークにおいて,他の試験手法よりも優れる簡易かつ効果的なLCMプロンプト法である。
論文 参考訳(メタデータ) (2024-10-24T17:56:08Z) - TriSum: Learning Summarization Ability from Large Language Models with Structured Rationale [66.01943465390548]
本稿では,大規模言語モデルのテキスト要約能力を,コンパクトで局所的なモデルに抽出するフレームワークであるTriSumを紹介する。
本手法は,様々なベンチマーク上での局所モデル性能を向上させる。
また、要約の合理性に関する洞察を提供することで、解釈可能性も向上する。
論文 参考訳(メタデータ) (2024-03-15T14:36:38Z) - Simultaneous Machine Translation with Large Language Models [51.470478122113356]
我々は,SimulMTタスクに大規模言語モデルを適用する可能性を検討する。
MUST-Cデータセットと異なる9言語でtextttLlama2-7b-chatモデルを用いて実験を行った。
その結果,LLM は BLEU と LAAL の指標で専用MT モデルよりも優れていた。
論文 参考訳(メタデータ) (2023-09-13T04:06:47Z) - Explaining the Deep Natural Language Processing by Mining Textual
Interpretable Features [3.819533618886143]
T-EBAnOは、深層自然言語モデルに適した、予測ローカルでクラスベースのモデル-言語的説明戦略である。
自動意思決定プロセスの背後にある理由について、客観的で、人間可読で、ドメイン固有の評価を提供する。
論文 参考訳(メタデータ) (2021-06-12T06:25:09Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。