論文の概要: Learning Correct Behavior from Examples: Validating Sequential Execution in Autonomous Agents
- arxiv url: http://arxiv.org/abs/2605.03159v1
- Date: Mon, 04 May 2026 21:07:56 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-06 19:35:43.652404
- Title: Learning Correct Behavior from Examples: Validating Sequential Execution in Autonomous Agents
- Title(参考訳): 事例から正しい行動を学ぶ: 自律エージェントにおける逐次実行の検証
- Authors: Reshabh K Sharma, Gaurav Mittal, Yu Hu,
- Abstract要約: 従来のテストアプローチでは、手動仕様、正確なシーケンスマッチング、数千のトレーニング例が必要です。
本稿では,2~10個の実行トレースから,正しい動作を自動的に学習するアルゴリズムを提案する。
制御実験では,製品バグや誤動作の検出において高い精度を実現した。
- 参考スコア(独自算出の注目度): 6.9734639631942015
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: As autonomous agents become increasingly sophisticated, validating their sequential behavior presents a significant challenge. Traditional testing approaches require manual specification, exact sequence matching, or thousands of training examples. We present a novel algorithm that automatically learns correct behavior from just 2-10 passing execution traces and validates new executions against this learned model. Our approach combines dominator analysis from compiler theory with multimodal large language model-powered semantic understanding to identify essential states and handle non-deterministic behavior. The system constructs a generalized ground truth model using Prefix Tree Acceptors, merges traces through multi-tiered equivalence detection, and validates new executions via topological subsequence matching. In controlled experiments, our system achieved high accuracy in detecting product bugs and false successes using only 3 training traces. This approach provides explainable validation results with coverage metrics and works across diverse domains including UI testing, code generation, and robotic processes.
- Abstract(参考訳): 自律エージェントがますます高度化するにつれて、それらのシーケンシャルな振る舞いを検証することは大きな課題となる。
従来のテストアプローチでは、手動仕様、正確なシーケンスマッチング、数千のトレーニング例が必要です。
本稿では,2~10個の実行トレースから正しい動作を自動的に学習し,この学習モデルに対して新しい実行を検証するアルゴリズムを提案する。
提案手法は,コンパイラ理論のドミネータ解析とマルチモーダルな大言語モデルを用いた意味理解を組み合わせることで,本質的な状態を特定し,非決定論的動作を処理する。
このシステムは、プレフィックスツリーアクセプタを用いて一般化された基底真理モデルを構築し、多階層同値検出によりトレースをマージし、トポロジ的なサブシーケンスマッチングにより新しい実行を検証する。
制御実験では,3つのトレーニングトレースのみを用いて,製品バグや誤動作の検出に高い精度を達成した。
このアプローチは、カバレッジメトリクスによる説明可能な検証結果を提供し、UIテスト、コード生成、ロボットプロセスなど、さまざまな領域で機能する。
関連論文リスト
- The Unlearning Mirage: A Dynamic Framework for Evaluating LLM Unlearning [54.67958855362658]
複雑な構造化クエリを用いたアンラーニングテストを強調する動的フレームワークを提案する。
提案手法はまず,対象モデル(事前学習)から知識を抽出し,単純なクエリからマルチホップチェーンまで,対象プローブを構築する。
本フレームワークは,テストセットを手作業で構築することなく,非学習手法の実用的でスケーラブルな評価を可能にする。
論文 参考訳(メタデータ) (2026-03-11T19:51:33Z) - Scaling Agentic Verifier for Competitive Coding [66.11758166379092]
大規模言語モデル(LLM)は強力なコーディング能力を示しているが、1回の試行で競合するプログラミング問題を正しく解くのに苦戦している。
実行ベースの再ランク付けは、有望なテスト時間スケーリング戦略を提供するが、既存のメソッドは、難しいテストケースの生成または非効率的なランダム入力サンプリングによって制約される。
本稿では,プログラムの動作を積極的に推論し,高い差別性のあるテスト入力を検索するエージェント検証手法を提案する。
論文 参考訳(メタデータ) (2026-02-04T06:30:40Z) - Taming Imperfect Process Verifiers: A Sampling Perspective on Backtracking [54.43083499412643]
言語モデルの生成能力をプロセス検証器と組み合わせたテストタイムアルゴリズムは、新しい推論能力を引き出すための有望なレバーを提供する。
提案手法は, 理論的に根拠付きバックトラックを用いて, 検証誤差に対して, 確実な堅牢性を実現するための新しいプロセス誘導型テスト時間サンプリングアルゴリズムであるVGBを導入する。
論文 参考訳(メタデータ) (2025-10-03T16:21:14Z) - SPARE: Single-Pass Annotation with Reference-Guided Evaluation for Automatic Process Supervision and Reward Modelling [58.05959902776133]
私たちはSingle-Passを紹介します。
Reference-Guided Evaluation (SPARE)は、効率的なステップごとのアノテーションを可能にする新しい構造化フレームワークである。
数学的推論(GSM8K, MATH)、マルチホップ質問応答(MuSiQue-Ans)、空間推論(SpaRP)にまたがる4つの多様なデータセットにおけるSPAREの有効性を実証する。
ProcessBenchでは、SPAREがデータ効率のよいアウト・オブ・ディストリビューションの一般化を実証し、トレーニングサンプルの$sim$16%しか使用していない。
論文 参考訳(メタデータ) (2025-06-18T14:37:59Z) - Consistency-based Abductive Reasoning over Perceptual Errors of Multiple Pre-trained Models in Novel Environments [5.5855749614100825]
本稿では,複数の事前学習モデルを活用することで,このリコール低減を緩和できるという仮説を述べる。
我々は,一貫性に基づく推論問題として,様々なモデルからの矛盾する予測を特定し,管理することの課題を定式化する。
本研究は,複数の不完全なモデルから得られた知識を,難易度の高い新しいシナリオにおいて堅牢に統合するための効果的なメカニズムとして,一貫性に基づく誘拐の有効性を検証するものである。
論文 参考訳(メタデータ) (2025-05-25T23:17:47Z) - A Case Study on Model Checking and Runtime Verification for Awkernel [0.7199733380797578]
人間が手動で同時動作をレビューしたり、可能なすべての実行をカバーしたテストケースを書くことは難しい。
本稿では,スケジューラなどの並列ソフトウェアの開発手法を提案する。
論文 参考訳(メタデータ) (2025-03-12T11:27:45Z) - A Progressive Transformer for Unifying Binary Code Embedding and Knowledge Transfer [15.689556592544667]
本稿では,バイナリコード埋め込みのための新しいトランスフォーマーベースの手法であるProTSTを紹介する。
ProTSTは、独特の木のような構造に基づく階層的なトレーニングプロセスを採用している。
その結果, ProTSTは従来の2段階トレーニングに比べて14.8%改善した(F1, MRR, Recall@1)。
論文 参考訳(メタデータ) (2024-12-15T13:04:29Z) - Engineering the Neural Automatic Passenger Counter [0.0]
我々は、信頼性、性能、そして品質のカウントを向上させるために、機械学習の様々な側面を探求し、活用する。
アンサンブル量子化のようなアグリゲーション技術がバイアスを減少させる方法を示し、その結果の全体的拡散について考察する。
論文 参考訳(メタデータ) (2022-03-02T14:56:11Z) - A Novel Anomaly Detection Algorithm for Hybrid Production Systems based
on Deep Learning and Timed Automata [73.38551379469533]
DAD:DeepAnomalyDetectionは,ハイブリッド生産システムにおける自動モデル学習と異常検出のための新しいアプローチである。
深層学習とタイムドオートマトンを組み合わせて、観察から行動モデルを作成する。
このアルゴリズムは実システムからの2つのデータを含む少数のデータセットに適用され、有望な結果を示している。
論文 参考訳(メタデータ) (2020-10-29T08:27:43Z) - Document Ranking with a Pretrained Sequence-to-Sequence Model [56.44269917346376]
関連ラベルを「ターゲット語」として生成するためにシーケンス・ツー・シーケンス・モデルをどのように訓練するかを示す。
提案手法は,データポーラ方式におけるエンコーダのみのモデルよりも大幅に優れている。
論文 参考訳(メタデータ) (2020-03-14T22:29:50Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。