論文の概要: Post-Training on Office Work Improves Software Engineering: A Behavioral Account of Cross-Domain Transfer
- arxiv url: http://arxiv.org/abs/2608.01604v1
- Date: Mon, 03 Aug 2026 02:22:02 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:25.299951
- Title: Post-Training on Office Work Improves Software Engineering: A Behavioral Account of Cross-Domain Transfer
- Title(参考訳): オフィスワークの後でソフトウェアエンジニアリングを改善する - クロスドメイン移行の行動的説明
- Abstract要約: 長い水平タスクでは、エージェントはネストされた作業と分岐された作業のコヒーレントな状態と目標を維持する必要がある。
この能力目標実行(GDE)とは,目標の選択,タスク関連状態の構築,高レベルな目標への忠実性の維持,環境に対する完成性の検証という,4つの行動の繰り返し適用である。
オフィスから引き出されたLHMTA(Long-Horizon Multi-Tool Agent)タスクでQwen3.5-122B-A10Bを訓練した後でテストした。このコレクションにはソフトウェア指向タスクは含まれなかったが、SWE-Bench Proでは5.8ポイント改善された。
- 参考スコア(独自算出の注目度): 1.0742728354283815
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Long-horizon tasks require agents to maintain coherent state and goals across nested and branching work. We call this capability goal-directed execution (GDE): the repeated application of four behaviors, namely selecting goals, constructing task-relevant state, maintaining fidelity to higher-level objectives, and verifying completion against the environment. We hypothesize that long-horizon post-training strengthens these behaviors across domains. We test this by post-training Qwen3.5-122B-A10B on 363 Long-Horizon Multi-Tool Agent (LHMTA) tasks drawn from office workflows. The collection contained no software-engineering tasks, yet the model's pass@1 improved by 5.8 points on SWE-Bench Pro. Matched trajectory analysis shows gains in all four GDE behaviors in both office workflows and software repositories. Aggregate SWE-Bench Pro statistics showed related changes in information gathering, implementation, and verification. Together, the results support a behavioral interpretation in which long-horizon post-training changed how the model organized and applied knowledge across tasks, with effects extending beyond the training domain.
- Abstract(参考訳): 長い水平タスクでは、エージェントはネストされた作業と分岐された作業のコヒーレントな状態と目標を維持する必要がある。
私たちはこの機能をゴール指向実行(GDE)と呼び、ゴールの選択、タスク関連状態の構築、より高いレベルの目標への忠実性の維持、環境に対する完了の検証という、4つの行動を繰り返し適用します。
我々は、長期の訓練後、これらの行動がドメイン間で強化されるという仮説を立てる。
オフィスワークフローから引き出された363のLHMTA(Long-Horizon Multi-Tool Agent)タスク上で,Qwen3.5-122B-A10Bの訓練後,これを検証した。
このコレクションにはソフトウェアエンジニアリングのタスクはなかったが、SWE-Bench Proではパス@1が5.8ポイント改善された。
一致した軌跡解析は、オフィスワークフローとソフトウェアリポジトリの両方で、4つのGDEの挙動がすべて向上していることを示している。
Aggregate SWE-Bench Pro 統計は,情報収集,実装,検証の関連性を示した。
結果として、長い水平ポストトレーニングが、モデルがどのようにしてタスク全体にわたる知識を組織化し、適用したかを変え、トレーニング領域を超えて効果を拡大するかという行動解釈が支持された。
関連論文リスト
- Cross-Benchmark Generalization in Long-Horizon Agents [1.0742728354283815]
我々は,27のカテゴリにわたる363の長距離モデルコンテキストプロトコル(MCP)タスク上で,オープンウェイト・ミックス・オブ・エキスパート・モデルを構築した。
トレーニングには外部ベンチマークタスクやグレーダが入らず、報酬、ハイパーパラメータのトレーニング、トレーニングされたチェックポイントの選択、停止を外部スコアが知らせなかった。
両方のソフトウェアベンチマークは、ソフトウェアエンジニアリングタスクを含まないトレーニングコレクションにもかかわらず改善されている。
論文 参考訳(メタデータ) (2026-07-31T18:05:36Z) - Connect the Dots: Training LLMs for Long-Lifecycle Agents with Cross-Domain Generalization Via Reinforcement Learning [82.3676770818744]
大型言語モデル(LLM)を"Connect the Dots"(CoD)に接続するためのフレームワークを提案する。
LLMベースのAIエージェントが環境にデプロイされると、環境を継続的に探索しながら、タスクの長いシーケンスを解決する。
本稿では,詳細な信用代入を伴うGRPOスタイルのRLアルゴリズムを含む,CoDフレームワークの概念実証実装を提案する。
論文 参考訳(メタデータ) (2026-06-18T09:38:45Z) - From Question Answering to Task Completion: A Survey on Agent System and Harness Design [67.8241530947325]
本研究はモデルハーネスレンズを用いてLCMをベースとしたエージェントについて検討する。
まず, LLMをベースとしたエージェントを基礎モデルと実行ハーネスとして, エージェントの機能的定義と実装の視点を明らかにする。
次に、モデル中心のスケーリングの限界を分析し、エージェントエンジニアリングの4つのパラダイムをトレースし、実行ハーネスを6つの結合ランタイム責任に分解する。
論文 参考訳(メタデータ) (2026-06-14T05:40:16Z) - When LLMs Team Up: A Coordinated Attack Framework for Automated Cyber Intrusions [27.62993988829038]
本稿では,侵入型タスク分析のための協調型マルチエージェントフレームワークであるCAESARを提案する。
CAESARはワークフローを5つの型付きロールに分解し、境界付きプロトコルを介してそれらを調整する。
予算とツールアクセスが一致した単一エージェントベースラインと比較して、CAESARはタスクの成功を改善し、パフォーマンスのばらつきを低減する。
論文 参考訳(メタデータ) (2026-05-09T07:47:42Z) - Claw-Eval-Live: A Live Agent Benchmark for Evolving Real-World Workflows [67.92316850084575]
ワークフローエージェントのライブベンチマークであるClaw-Eval-Liveを紹介する。
各リリースは、公開ワークフロー要求信号から構築される。
Claw-Eval-Liveは実行トレース、監査ログ、サービス状態、実行後のワークスペースアーティファクトを記録する。
論文 参考訳(メタデータ) (2026-04-30T17:23:19Z) - LongCLI-Bench: A Preliminary Benchmark and Study for Long-horizon Agentic Programming in Command-Line Interfaces [65.11019654023978]
LongCLI-Benchは、長期にわたる現実的なタスクにまたがるエージェント能力を評価するために設計されたベンチマークである。
私たちは、1000以上のコンピュータサイエンスの課題と現実世界のタスクから、20の高品質で長い水平タスクをキュレートしました。
実験によると、最先端のエージェントでさえLongCLI-Benchの20%未満のパスレートを達成する。
論文 参考訳(メタデータ) (2026-02-15T23:12:57Z) - CORPGEN: Simulating Corporate Environments with Autonomous Digital Employees in Multi-Horizon Task Environments [1.6153514666902042]
実際の組織的な作業には、インターリーブ、依存関係、優先順位付けを伴って、多くの並行した長期タスクを管理する必要があります。
マルチ水平タスク環境(MHTEs: Multi-Horizon Task Environments: MHTEs): 数十のインターリーブタスクでコヒーレントな実行を必要とする問題クラス。
負荷が25%から100%になるにつれて、ベースラインCUAが16.7%から8.7%に低下する4つの障害モードを特定します。
マルチ水平ゴールアライメントのための階層的計画を通じて,これらの障害に対処するアーキテクチャに依存しないフレームワークであるCorpGenを提案する。
論文 参考訳(メタデータ) (2026-02-15T16:54:34Z) - ANCHOR: Branch-Point Data Generation for GUI Agents [52.22377425487]
デスクトップ環境向けのエンドツーエンドGUIエージェントは、大量の高品質なインタラクションデータを必要とする。
本稿では,拡張フレームワークであるAnchorについて紹介する。このフレームワークは,小規模で検証済みのシードデモから,スケーラブルなデスクトップ監視をブートストラップする。
OSWorldとWindowsAgentArenaの標準デスクトップベンチマークの実験では、拡張されたコーパスに微調整されたモデルが一貫した改善を実現している。
論文 参考訳(メタデータ) (2026-02-06T19:55:26Z) - Unified Work Embeddings: Contrastive Learning of a Bidirectional Multi-task Ranker [3.4204762278595346]
ランキング問題として明示的に定式化された6つの作業関連タスクにまたがる最初の統合評価スイートであるWorkBenchを紹介した。
この洞察を用いて、実世界のデータからタスク固有の二部グラフを作成し、グラウンド化を通じて合成的にリッチ化する。
これは、多対多のInfoNCE目標でトレーニングデータ構造を利用するタスク非依存のバイエンコーダであるUnified Work Embeddings(UWE)につながります。
論文 参考訳(メタデータ) (2025-11-11T08:28:26Z) - Spatial Reasoning and Planning for Deep Embodied Agents [2.7195102129095003]
この論文は空間的推論と計画タスクのためのデータ駆動手法の開発を探求する。
学習効率、解釈可能性、新しいシナリオ間の伝達可能性の向上に重点を置いている。
論文 参考訳(メタデータ) (2024-09-28T23:05:56Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。