論文の概要: AgentLTL: A Trace-Verification Framework for Measuring, Enforcing, and Training Procedural Compliance in Tool-Using LLM Agents
- arxiv url: http://arxiv.org/abs/2607.02599v1
- Date: Wed, 01 Jul 2026 10:47:20 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.345591
- Title: AgentLTL: A Trace-Verification Framework for Measuring, Enforcing, and Training Procedural Compliance in Tool-Using LLM Agents
- Title(参考訳): AgentLTL: ツール利用LDMエージェントにおける手続きコンプライアンスの測定・強化・訓練のためのトレース検証フレームワーク
- Abstract要約: AgentLTLは、プロシージャルールをエージェントトレースに表現する。
1つの仕様は2つの利用を駆動する。
同じ報酬で微調整すると +38 と +17.5 のポイントゲインが得られる。
- 参考スコア(独自算出の注目度): 4.049272375488184
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Tool-using LLM agents are usually evaluated by final-answer correctness or LLM judges. Neither captures how an answer was produced. In safety-critical settings, the procedure itself is part of correctness. In this paper, we introduce AgentLTL, a language derived from First-Order Linear Temporal Logic (FO-LTL) that expresses procedural rules over agent traces. It yields a deterministic, judge-free compliance score. In this framework, a single specification drives two usages. The first is harnessing: the constraints score completed traces, or gate tool calls by checking each prefix online, before execution. The second is finetuning: the score serves as a dense reward. On a benchmark spanning ordering, branching, iteration, and grounding, block-and-warn harnessing improves compliance on five of seven models. Finetuning with the same reward yields +38 and +17.5 percentage point gains in accuracy and compliance on held-out patterns, including unseen tool-name aliases. These findings are consistent with the model acquiring procedural structure rather than memorizing surface tool names and procedures.
- Abstract(参考訳): ツール使用 LLM エージェントは通常、最終回答正当性または LLM 判断によって評価される。
いずれにせよ、答えは得られていない。
安全クリティカルな設定では、プロシージャ自体が正確性の一部である。
本稿では,エージェントトレースに対する手続き規則を表現する一階線形時間論理(FO-LTL)から派生した言語であるAgentLTLを紹介する。
決定論的かつ無審査のコンプライアンススコアを得る。
このフレームワークでは、単一の仕様が2つの利用を駆動する。
ひとつは、実行前に各プレフィックスをオンラインでチェックすることで、制約が完了したトレースをスコアする、あるいはゲートツールコールだ。
2つ目は微調整で、スコアは密度の高い報酬として機能する。
順序付け、ブランチ、イテレーション、グラウンドにまたがるベンチマークでは、ブロック・アンド・ウォール・ハーネスが7つのモデルの5つのコンプライアンスを改善している。
同じ報酬を持つファインタニングでは、ツール名不明のエイリアスを含む保持パターンの精度とコンプライアンスが+38および+17.5パーセント向上する。
これらの結果は、表面ツール名や手順を記憶するよりも、手続き構造を取得するモデルと一致している。
関連論文リスト
- Verification-Aware Training for Speculative Decoding [57.84976863792784]
VAT(Verification-Aware Training)は、トレーニングステップ毎に検証をシミュレートし、その結果の受け入れパターンと拒否パターンを監督するプラグインフレームワークである。
VATはトレーニング対象のみを変更するため、ドラフトアーキテクチャやターゲットモデル、推論手順を変更することなく、既存のメソッドの上にレイヤー化することができる。
VATは平均受理期間を最大11.4%改善し、ウォールクロックのスピードアップを最大8.7%向上させ、数学、コード、チャットベンチマークで一貫した利益を得ている。
論文 参考訳(メタデータ) (2026-08-31T01:42:10Z) - BekchiAI: Measuring, Observing, and Controlling LLM Agents in One Click [0.0]
本稿では,エージェントスキル測定のためのベンチマークであるBekchiAIと,ライブエージェントの監視と制御のためのプラットフォームについて紹介する。
BekchiAI-Platformは、デプロイされたエージェントのための補完的なWebベースの可観測性とコントロールレイヤであり、完全なトークンとテレメトリとリモート実行終了を提供する。
論文 参考訳(メタデータ) (2026-08-27T09:30:08Z) - TTHE: Test-Time Harness Evolution [50.26245555541721]
既存のアプローチでは、デプロイ前、トレーニング前、あるいはテスト時に凍結される固定されたエージェントワークフローの開発データを最適化する。
我々は、エージェントがテスト入力で生成するラベルのない実行トレースのみを使用して、評価自体にハーネスを最適化できるかどうかを問う。
評価中、TTHEは候補ハーネスの人口を維持し、それらの実行トレースの理由をエージェントプロジェクタを通じてそれらを洗練する。
その後、審査員は実行元プロキシ信号から改善されたハーネスをコミットし、選択したプログラムは継続してその後の入力を統治する。
論文 参考訳(メタデータ) (2026-07-09T05:53:39Z) - LLM-as-a-Verifier: A General-Purpose Verification Framework [74.40111651545979]
本稿では,汎用検証フレームワーク LLM-as-a-Verifier を紹介する。
追加のトレーニングを必要とせずに、エージェントタスクに対してきめ細かいフィードバックを提供する。
いくつかのベンチマークで最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2026-07-06T17:59:35Z) - RigorBench: Benchmarking Engineering Process Discipline in Autonomous AI Coding Agents [0.0]
RigorBenchは、AIコーディングエージェントのプロセス規律を測定する最初のベンチマークである。
プランニングフィデリティ、検証カバレッジ、回復効率、吸収品質、原子遷移積分の5つの柱にまたがるハーネスを評価している。
その結果,構造化プロセスの規律はプロセス品質のスコアを平均41%向上させ,下流結果の正しさを17%向上させることがわかった。
論文 参考訳(メタデータ) (2026-06-21T21:41:34Z) - VASO: Formally Verifiable Self-Evolving Skills for Physical AI Agents [57.240036084348354]
本稿では,ロボットスキルコントラクトの検証誘導自己進化のためのフレームワークであるVASOを紹介する。
VASOは論理的に一貫性のないスキル契約を検証し、グローバルおよびローカルな時間的仕様に対してスキルによって誘発される計画を検証する。
Clearpath Jackal と PX4 のクアッドコプタータスクでは、VASO は100点未満の最適化サンプルを使用して97.2% の形式的な仕様準拠に達した。
論文 参考訳(メタデータ) (2026-06-03T20:02:35Z) - SEVerA: Verified Synthesis of Self-Evolving Agents [12.9624447364193]
自己進化型エージェントフレームワークは、安全性や正確性の正式な保証を提供しない。
エージェントコード生成を制約付き学習問題として定式化し、ハードな形式仕様とソフトな目的とを組み合わせてタスクユーティリティをキャプチャする。
探索はFGGMコールを含む候補パラメトリックプログラムを合成し、検証は全てのパラメータ値に対する厳しい制約に関して正当性を証明し、制約のない学習に還元する。
論文 参考訳(メタデータ) (2026-03-26T07:32:20Z) - RewardHackingAgents: Benchmarking Evaluation Integrity for LLM ML-Engineering Agents [0.9821874476902969]
LLMエージェントは、単一のスカラーテストメトリクスで成功を判断するエンドツーエンドのMLエンジニアリングタスクをますます実行します。
エージェントは、モデルを改善するのではなく、評価パイプラインを妥協することで、報告されたスコアを増やすことができる。
ワークスペースベースのベンチマークであるRewardHackingAgentsを導入する。
論文 参考訳(メタデータ) (2026-03-11T22:06:44Z) - ExecVerify: White-Box RL with Verifiable Stepwise Rewards for Code Execution Reasoning [9.137158235106941]
ExecVerifyは、実行トレースから得られた検証済みのホワイトボックス報酬を組み込むことで、テキストの模倣を越えている。
ExecVerifyでトレーニングされた7Bモデルは、コード推論ベンチマークで32Bモデルに匹敵するパフォーマンスを実現している。
論文 参考訳(メタデータ) (2026-03-11T18:49:45Z) - ET-Agent: Incentivizing Effective Tool-Integrated Reasoning Agent via Behavior Calibration [68.89572566071575]
ETAgentはエージェントのツール使用行動を調整するためのトレーニングフレームワークである。
過誤行動パターンを最適行動に段階的に校正するように設計されている。
論文 参考訳(メタデータ) (2026-01-11T11:05:26Z) - AgentPRM: Process Reward Models for LLM Agents via Step-Wise Promise and Progress [71.02263260394261]
大規模言語モデル(LLM)は、マルチターン意思決定タスクにおいて依然として課題に直面している。
プロセス報酬モデル(PRM)を構築し、各意思決定を評価し、エージェントの意思決定プロセスを導く。
AgentPRMは、シーケンシャルな決定と最終的な目標への貢献の間の相互依存の両方をキャプチャする。
論文 参考訳(メタデータ) (2025-11-11T14:57:54Z) - Get my drift? Catching LLM Task Drift with Activation Deltas [55.75645403965326]
タスクドリフトは攻撃者がデータを流出させたり、LLMの出力に影響を与えたりすることを可能にする。
そこで, 簡易線形分類器は, 分布外テストセット上で, ほぼ完全なLOC AUCでドリフトを検出することができることを示す。
このアプローチは、プロンプトインジェクション、ジェイルブレイク、悪意のある指示など、目に見えないタスクドメインに対して驚くほどうまく一般化する。
論文 参考訳(メタデータ) (2024-06-02T16:53:21Z) - Factcheck-Bench: Fine-Grained Evaluation Benchmark for Automatic Fact-checkers [121.53749383203792]
本稿では,大規模言語モデル (LLM) 生成応答の事実性に注釈を付けるための総合的なエンドツーエンドソリューションを提案する。
オープンドメインの文書レベルの事実性ベンチマークを,クレーム,文,文書の3段階の粒度で構築する。
予備実験によると、FacTool、FactScore、Perplexityは虚偽の主張を識別するのに苦労している。
論文 参考訳(メタデータ) (2023-11-15T14:41:57Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。