論文の概要: FACET: Preserving Source Intent and Executable State in Terminal Task Synthesis
- arxiv url: http://arxiv.org/abs/2608.18580v1
- Date: Wed, 19 Aug 2026 06:19:20 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-20 20:13:55.303922
- Title: FACET: Preserving Source Intent and Executable State in Terminal Task Synthesis
- Title(参考訳): FACET:端末タスク合成におけるソースインテントと実行可能な状態を保存する
- Abstract要約: FACET(Fine-fine Agentic Construction of Executable Tasks)は、情報保存とクロスアーティファクトの整合性に対処するフレームワークである。
関連するエージェントスキルを一貫性のある情報豊富なシナリオに再構築し、実行環境を実現し、修復する。
複雑な端末タスクを高密度な実行可能チェックで生成し、これらのタスクから収集された軌道は、効果的なデータ効率の監視を提供する。
- 参考スコア(独自算出の注目度): 37.074035615771066
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Training terminal agents requires scalable executable supervision, yet synthesizing high-quality terminal tasks remains challenging. Each task couples an instruction, an initialized environment, a reference solution, and an executable verifier; if these artifacts are generated from inconsistent assumptions, the resulting task may be unsolvable or incorrectly evaluated. Meanwhile, multi-stage synthesis can discard the goals, dependencies, state transitions, and procedural constraints encoded in the original sources. We present FACET (Fine-grained Agentic Construction of Executable Tasks), a framework that addresses both information preservation and cross-artifact consistency. FACET reconstructs related agent skills into coherent, information-rich scenarios, then realizes and repairs the execution environment before generating the final task artifacts. The resulting container state serves as shared grounding for the instruction, solution, and verifier, while execution-based validation and targeted repair correct artifact-specific failures without unnecessarily regenerating valid components. FACET produces complex terminal tasks with dense executable checks, and successful trajectories collected from these tasks provide effective, data-efficient supervision. Fine-tuning models across multiple scales consistently improves performance on Terminal-Bench 2.1, while analyses of alternative generation schemes support the importance of environment-grounded construction for task validity and solution-verifier alignment. These results establish source-intent preservation and shared executable-state grounding as key principles for scalable terminal-task synthesis.
- Abstract(参考訳): 訓練端末エージェントは、スケーラブルな実行可能監視を必要とするが、高品質な端末タスクを合成することは依然として困難である。
各タスクは命令、初期化環境、参照ソリューション、実行可能検証器を結合し、これらのアーティファクトが矛盾した仮定から生成される場合、結果のタスクは解決不可能または正しく評価される。
一方、マルチステージ合成は、元のソースにエンコードされた目標、依存関係、状態遷移、手続き的制約を破棄することができる。
FACET(Fine-fine Agentic Construction of Executable Tasks)は,情報保存とクロスアーティファクトの整合性に対処するフレームワークである。
FACETは、関連するエージェントスキルを一貫性のある情報豊富なシナリオに再構築し、最終的なタスク成果物を生成する前に実行環境を実現し、修復する。
結果のコンテナ状態は、インストラクション、ソリューション、バリデーションの共有基盤として機能し、実行ベースのバリデーションとターゲットが有効なコンポーネントを不要に再生することなく、アーティファクト固有の障害を修正します。
FACETは、高密度な実行可能チェックを備えた複雑な端末タスクを生成し、これらのタスクから収集された軌道は、効果的なデータ効率の監視を提供する。
複数のスケールにまたがる微調整モデルは終端ベンチ2.1の性能を一貫して改善する一方、代替生成方式の解析はタスク妥当性と解検証アライメントのための環境構築の重要性を裏付ける。
これらの結果は、拡張性のある端末-タスク合成の鍵となる原理として、ソースインテントの保存と共有実行可能状態の接地を確立する。
関連論文リスト
- Embodied-BenchForge: A Closed-Loop Agentic Workflow for Embodied Benchmark Construction [18.03387691479464]
Embodied-BenchForgeは、ユーザが指定した評価意図を完全なベンチマークアーティファクトに変換するエージェントフレームワークである。
クローズドループベンチマーク合成として構築を定式化し、前方のアーティファクトと後方の検証と修復を統合する。
論文 参考訳(メタデータ) (2026-09-11T17:16:01Z) - Terminal Agents: A Survey of AI Agents in Command-Line Environments [102.48222742145474]
大規模言語モデルエージェントは、ターミナルを通してますます行動するが、既存の調査は、ソフトウェア工学、ツールの使用、コンピュータ利用の研究にまたがって端末による振る舞いを分散させている。
我々は,端末エージェントを,端末コマンドの実行,テキストフィードバック,ステートフルな環境相互作用を介し,進行を伴う動作を主とするシステムとみなす。
我々の合成は、実現された行動はモデル、インターフェース、ハーネス、ランタイム、環境によって共同で形成されていることを示している。
論文 参考訳(メタデータ) (2026-08-20T18:16:44Z) - Execution-First Synthetic Tool-Use Trace Generation for LLM Agents [10.291533584425252]
SyntheticAgentTraceQAは、ツールエージェントのためのスケーラブルな監視データを生成するための実行ファーストフレームワークである。
4つのツールエコシステムにまたがるフレームワークを評価し、結果のデータを微調整し、Qwenモデルの変種を評価する。
論文 参考訳(メタデータ) (2026-07-31T08:52:26Z) - Meta-Task: Turning Terminal Task Synthesis into a Terminal Task for Scalable Agent Training [13.580418686043815]
大規模な端末エージェントの訓練には、多様な検証可能な端末タスクと高品質な対話トラジェクトリが必要である。
既存のメソッドは、タスク生成と実際の実行の切り離しによって生じる信頼性の弱い2つの重要な制限に直面している。
本稿では,ターミナル・ベンチ形式タスク自体として端末タスク合成を再定義するMeta-Taskを提案する。
論文 参考訳(メタデータ) (2026-07-30T09:41:08Z) - PhyAgentOS: A Self-Evolving Operating System for Embodied Agents with Decoupled Cognitive Planning and Physical Execution [49.776611937968]
我々は、スケジューリング、検証、メモリ、ベンチマーク、安全性をシステムレベルのサービスとして提供するPhyAgentOSを紹介します。
セッション中心のセッションは、スケジューリング、互換性、監督された実行、エビデンス収集、受け入れの最小単位として、アクションではなくセッションを扱う。
SessionVerifierは、実行終了とセマンティックタスク完了を、成功、失敗、または再計画のエビデンスに基づいて判断する。
ベンチマークはデプロイメントセッションと検証パスを再利用するので、結果は実際の実行に遡る。
論文 参考訳(メタデータ) (2026-07-18T04:46:53Z) - CLOSER-Bench: Evaluating Budgeted Cross-Stage Design Closure for Hardware Agents [5.604484678527336]
CLOSER-Bench (CLOSER-Bench) は、予算付きクロスステージ設計クロージャのための制御された評価プロトコルである。
Spec-to-RTL、RTL-to-GDS、Spec-to-GDSタスクを組み合わせ、すべてのシミュレータ、合成、STA、プレース・アンド・ルートの呼び出しを記録する。
最終品質、任意の進捗状況、ツールコスト、ステージ間のリカバリを測定します。
論文 参考訳(メタデータ) (2026-07-18T04:28:47Z) - From Question Answering to Task Completion: A Survey on Agent System and Harness Design [67.8241530947325]
本研究はモデルハーネスレンズを用いてLCMをベースとしたエージェントについて検討する。
まず, LLMをベースとしたエージェントを基礎モデルと実行ハーネスとして, エージェントの機能的定義と実装の視点を明らかにする。
次に、モデル中心のスケーリングの限界を分析し、エージェントエンジニアリングの4つのパラダイムをトレースし、実行ハーネスを6つの結合ランタイム責任に分解する。
論文 参考訳(メタデータ) (2026-06-14T05:40:16Z) - Harness-Bench: Measuring Harness Effects across Models in Realistic Agent Workflows [18.6534256358905]
本稿では,リアルエージェントシステムにおける構成レベルのハーネス効果を評価するための診断ベンチマークであるHarness-Benchを紹介する。
ベンチマークには、実用的なエージェント使用パターンから構築された106のサンドボックス化されたオフラインタスクが含まれている。
5,194個の実行軌道にまたがって、完了、プロセス品質、効率、障害挙動のかなりの変化を観察する。
論文 参考訳(メタデータ) (2026-05-27T03:47:35Z) - Effective Strategies for Asynchronous Software Engineering Agents [52.76455094324273]
本稿では,集中型タスクデリゲート,非同期実行,独立したワークスペースという,3つのSWEプリミティブに根ざした構造化マルチエージェント協調パラダイムを導入する。
CAIDは,紙再生タスク(PaperBench)では26.7%,Pythonライブラリ開発タスクでは14.3%,単一エージェントベースラインでは26.7%の精度向上を実現している。
論文 参考訳(メタデータ) (2026-03-23T02:26:35Z) - FATE: Closed-Loop Feasibility-Aware Task Generation with Active Repair for Physically Grounded Robotic Curricula [8.106402582760406]
本稿では,タスク生成を反復的検証・修正プロセスとして再定義するクローズドループ自己修正フレームワークであるFATEを提案する。
FATEはジェネラリストの具体化エージェントを生成ループに直接埋め込んで、結果のカリキュラムの物理的根拠を積極的に保証する。
論文 参考訳(メタデータ) (2026-03-02T06:29:42Z) - ANCHOR: Branch-Point Data Generation for GUI Agents [52.22377425487]
デスクトップ環境向けのエンドツーエンドGUIエージェントは、大量の高品質なインタラクションデータを必要とする。
本稿では,拡張フレームワークであるAnchorについて紹介する。このフレームワークは,小規模で検証済みのシードデモから,スケーラブルなデスクトップ監視をブートストラップする。
OSWorldとWindowsAgentArenaの標準デスクトップベンチマークの実験では、拡張されたコーパスに微調整されたモデルが一貫した改善を実現している。
論文 参考訳(メタデータ) (2026-02-06T19:55:26Z) - Process-Level Trajectory Evaluation for Environment Configuration in Software Engineering Agents [71.85020581835042]
大規模言語モデルベースのエージェントは、ソフトウェアエンジニアリングの約束を示すが、環境構成はボトルネックのままである。
既存のベンチマークでは、エンドツーエンドのビルド/テストの成功のみを評価し、エージェントが成功または失敗する場所と理由を見極めている。
本研究では,環境設定計画中の細粒度エージェントのプロセスレベルの軌道評価を行うEnconda-benchを紹介する。
論文 参考訳(メタデータ) (2025-10-29T16:59:07Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。