論文の概要: EDGE: Engine for Deterministic Graph Evaluation through Conversation Simulation from Graph Structured DSL Configuration
- arxiv url: http://arxiv.org/abs/2608.29971v1
- Date: Sun, 30 Aug 2026 18:56:53 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-01 18:31:31.136208
- Title: EDGE: Engine for Deterministic Graph Evaluation through Conversation Simulation from Graph Structured DSL Configuration
- Title(参考訳): EDGE: グラフ構造化DSL構成からの会話シミュレーションによる決定論的グラフ評価のためのエンジン
- Abstract要約: 本稿では,ドメイン固有言語を利用したプランナであるAgentGraphを基盤とした形式的評価手法を提案する。
我々は,対話経路を包括的に列挙するグラフアルゴリズムを活用し,エージェントの完全な行動空間をキャプチャする包括的評価セットを形成する。
信頼性を定量化するために、反応と軌道決定性、構造的付着、意味的整合性を測定する新しい指標を定義する。
- 参考スコア(独自算出の注目度): 0.518884791678612
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: As agentic systems evolve into complex multi agent orchestration workflows, there is a growing and critical need for systematic frameworks that measures an agent's behavioral consistency and determinism. In this paper, we introduce a formal evaluation methodology that is grounded in AgentGraph, a planner powered by a domain specific language that represents agent reasoning through a dynamically adjustable directed graph. We leverage this structural formalism and utilize graph traversal algorithms that exhaustively enumerate conversational paths, forming a comprehensive evaluation set that captures the agent's complete behavioral space. We then systematically replay these reproducible trajectories to compare observed outputs and state transitions against the intended DSL specification. To quantify reliability, we define novel metrics that measure response and trajectory determinism, structural adherence and semantic consistency across both exact replays and their linguistic variants. Our system's results demonstrate that agents configured using frameworks like AgentGraph and LangGraph with explicitly structured node transitions show superior determinism over agents that are not configured with controlled transitions.
- Abstract(参考訳): エージェントシステムが複雑なマルチエージェントオーケストレーションワークフローへと進化するにつれて、エージェントの振る舞いの一貫性と決定性を測定するための、体系的なフレームワークが増加し、批判的になる。
本稿では,動的に調整可能な有向グラフを通してエージェント推論を表現するドメイン固有言語を用いたプランナであるAgentGraphを基盤とした形式的評価手法を提案する。
我々は,この構造形式を利用して,対話経路を包括的に列挙するグラフトラバーサルアルゴリズムを用いて,エージェントの完全な行動空間をキャプチャする包括的評価セットを形成する。
次に、これらの再現可能な軌道を体系的に再生し、観測された出力と意図したDSL仕様に対する状態遷移を比較する。
信頼性を定量化するために、我々は、反応と軌道決定性、構造的付着性、そして正確なリプレイと言語的変種をまたいだ意味的一貫性を測定する新しい指標を定義した。
本システムの結果から,AgentGraphやLangGraphなどのフレームワークを明示的に構造化したノード遷移で構成したエージェントは,制御された遷移で構成されていないエージェントよりも優れた決定性を示すことがわかった。
関連論文リスト
- Inference-Time Graph Engineering for Multi-Agent LLM Workflows [51.56038180639833]
ReActNetは、クエリとロール特化エージェントのセットを一連の有向通信グラフにコンパイルする、トレーニング不要のフレームワークである。
ReActNetは、競争的推論コストを維持しつつ、固定トポロジと学習トポロジのベースラインを一貫して改善することを示す。
論文 参考訳(メタデータ) (2026-09-04T23:32:11Z) - Terminal Agents: A Survey of AI Agents in Command-Line Environments [102.48222742145474]
大規模言語モデルエージェントは、ターミナルを通してますます行動するが、既存の調査は、ソフトウェア工学、ツールの使用、コンピュータ利用の研究にまたがって端末による振る舞いを分散させている。
我々は,端末エージェントを,端末コマンドの実行,テキストフィードバック,ステートフルな環境相互作用を介し,進行を伴う動作を主とするシステムとみなす。
我々の合成は、実現された行動はモデル、インターフェース、ハーネス、ランタイム、環境によって共同で形成されていることを示している。
論文 参考訳(メタデータ) (2026-08-20T18:16:44Z) - Agentic Configuration Management (ACM): A Reference Configuration Model for Governed Agentic Systems [0.0]
Agentic Configuration Management (ACM)は、異種エージェントシステムのフレームワークに依存しないガバナンスおよび設定参照モデルである。
ACMは、型付きおよび独立にバージョン管理されたエージェント構成項目、不変リビジョンとベースライン、明示的な構成と実行時の分離、セマンティック・アシュアランス・セマンティクス、依存性を意識した影響伝達、実行時の前処理を組み合わせたものだ。
LangGraph、CrewAI、OpenAI Agents SDK用のアダプタを備えたPythonリファレンス実装を提供する。
論文 参考訳(メタデータ) (2026-08-11T17:28:39Z) - Formal Verification of Agentic Systems over Operational Data [59.98246281888422]
大規模言語モデル(LLM)によって駆動されるエージェントシステムは、永続的な運用データを扱う現実世界にますます展開されている。
既存のアプローチはそのようなシステムレベルの保証を提供していません。
本稿では, 1 つの LLM とツールオーケストレーションハーネスからなるエージェントシステムのリレーショナル操作データに対する検証について述べる。
論文 参考訳(メタデータ) (2026-08-04T13:01:30Z) - How to Interpret Agent Behavior [56.59836196946289]
本稿では,エージェントの動作を実行時に記述・解析するための分類法であるACT*ONOMYを紹介する。
共用語彙を提供することで、ACT*ONOMYは研究者、エージェントデザイナー、エンドユーザーがエージェントの振る舞いをより一貫して解釈するのに役立つ。
論文 参考訳(メタデータ) (2026-05-13T14:52:40Z) - When Only the Final Text Survives: Implicit Execution Tracing for Multi-Agent Attribution [10.973058523304042]
IET(Implicit Execution Tracing)は、メタデータに依存しないフレームワークで、生成したテキストから直接トークンレベルの属性を作成できる。
生成中、エージェント固有のキー付き信号がトークン分布に埋め込まれ、秘密鍵でのみ検出可能な自己記述実行トレースに変換される。
検出時にエージェントハンドオーバポイントを特定し、インタラクショングラフを再構築する。
論文 参考訳(メタデータ) (2026-03-18T07:34:51Z) - El Agente Gráfico: Structured Execution Graphs for Scientific Agents [7.47895130442454]
タイプセーフな実行環境内に,大規模言語モデル(LLM)による意思決定を組み込んだ単一エージェントフレームワークであるEl Agente Grficoを紹介する。
我々のアプローチの中心は、科学概念の構造化された抽象化と、型付きPythonオブジェクトとして計算状態を表すオブジェクトグラフマッパーである。
大学レベルの量子化学タスクのスイートにまたがって,自動ベンチマークフレームワークを開発することにより,システムの評価を行う。
論文 参考訳(メタデータ) (2026-02-19T23:47:05Z) - Multi-Agent Procedural Graph Extraction with Structural and Logical Refinement [66.51979814832332]
モデル式は、専用の構造的および論理的洗練を伴う多ラウンド推論プロセスとして手続きグラフ抽出を定式化する。
実験により、モデルが強いベースラインに対して構造的正当性と論理的整合性の両方において大幅に改善されることが示されている。
論文 参考訳(メタデータ) (2026-01-27T04:00:48Z) - AI Agent for Reverse-Engineering Legacy Finite-Difference Code and Translating to Devito [0.0]
本研究では,従来の有限差分実装のDevito環境への変換を容易にする統合AIフレームワークを開発する。
Retrieval-Augmented Generation (RAG)とオープンソースのLarge Language Modelsは、システムのハイブリッドLangGraphアーキテクチャにおいて、マルチステージ反復によって結合される。
論文 参考訳(メタデータ) (2026-01-26T11:31:00Z) - AgentRouter: A Knowledge-Graph-Guided LLM Router for Collaborative Multi-Agent Question Answering [51.07491603393163]
tAgentは知識グラフ誘導ルーティング問題としてマルチエージェントQAを定式化するフレームワークである。
エージェントアウトプットのソフトな監督と重み付けされた集約を活用することで、エージェントは多様なエージェントの相補的な強みを捉える、原則化された協調スキームを学ぶ。
論文 参考訳(メタデータ) (2025-10-06T23:20:49Z) - Learning to Model Graph Structural Information on MLPs via Graph Structure Self-Contrasting [50.181824673039436]
本稿では,グラフ構造情報をメッセージパッシングなしで学習するグラフ構造自己コントラスト(GSSC)フレームワークを提案する。
提案するフレームワークは,構造情報を事前知識として暗黙的にのみ組み込む,MLP(Multi-Layer Perceptrons)に基づいている。
これはまず、近傍の潜在的非形式的あるいはノイズの多いエッジを取り除くために構造的スペーシングを適用し、その後、スペーシングされた近傍で構造的自己コントラストを行い、ロバストなノード表現を学ぶ。
論文 参考訳(メタデータ) (2024-09-09T12:56:02Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。