論文の概要: OneDayAgent: Towards a Long-Horizon Harness for Autonomous Agents
- arxiv url: http://arxiv.org/abs/2608.05013v1
- Date: Tue, 04 Aug 2026 17:55:41 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.985684
- Title: OneDayAgent: Towards a Long-Horizon Harness for Autonomous Agents
- Title(参考訳): OneDayAgent: 自律エージェントの長期的ハーネスを目指して
- Authors: Jingsheng Zheng, Xinyuan Fang, Jintian Zhang, Zhengke Gui, Huajun Chen, Ningyu Zhang,
- Abstract要約: 自律型エージェントのための長距離ハーネスであるOneDayAgentを紹介する。
OneDayAgentはオープンなリクエストをマネージドな実行プロセスに変換する。
我々は104のタスクでAgentIF-OneDay上でOneDayAgentを評価する。
- 参考スコア(独自算出の注目度): 52.15259607762389
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: LLM agents are increasingly applied to open-ended everyday requests that span work, study, and life. These tasks are long-horizon, cross-environment, and multimodal, forcing the agent to preserve goals and constraints across many steps while navigating heterogeneous tools and attachments. While prior work has addressed individual failure modes such as goals drift, states loss, and context overflow, whether a single harness can manage them jointly and remain effective across backends has received less study. We present OneDayAgent, a long-horizon harness for autonomous agents. OneDayAgent turns an open-ended request into a managed execution process that decomposes tasks into bounded subtasks, maintains execution memory under context pressure, and verifies and repairs the final deliverable. We evaluate OneDayAgent on AgentIF-OneDay across 104 tasks. With the GLM-5.2 backend, OneDayAgent sets a new state of the art with an overall score of 0.821. The same harness runs across five backend LLMs from three model families, indicating the harness generalizes across backends without tuning, even as different models induce distinct execution styles under the same workflow.
- Abstract(参考訳): LLMエージェントは、仕事、研究、生活にまたがるオープンエンドの日々の要求に対して、ますます適用される。
これらのタスクは、長い水平、横断環境、マルチモーダルであり、エージェントは異種ツールやアタッチメントをナビゲートしながら、多くのステップで目標と制約を守らざるを得ない。
これまでの作業では,目標のドリフトや状態損失,コンテキストオーバーフローといった,個々の障害モードに対処している。
自律型エージェントのための長距離ハーネスであるOneDayAgentを紹介する。
OneDayAgentはオープンなリクエストをマネージドな実行プロセスに変換し、タスクを境界のサブタスクに分解し、コンテキストプレッシャの下で実行メモリを維持し、最終納品の検証と修正を行う。
我々は104のタスクでAgentIF-OneDay上でOneDayAgentを評価する。
GLM-5.2のバックエンドで、OneDayAgentは新しい最先端を設定、総合スコアは0.821である。
同じハーネスは、3つのモデルファミリから5つのバックエンドLLMで動作し、異なるモデルが同じワークフローの下で異なる実行スタイルを誘導するとしても、ハーネスはチューニングせずにバックエンドをまたがって一般化することを示している。
関連論文リスト
- Role-Agent: Bootstrapping LLM Agents via Dual-Role Evolution [25.26084224278813]
Role-Agentは単一のLarge Language Model(LLM)を使用してエージェントと環境の両方として同時に機能する。
Role-Agentはパフォーマンスを継続的に改善し、強いベースラインよりも平均4%以上向上する。
論文 参考訳(メタデータ) (2026-06-09T14:28:07Z) - Agentic Aggregation for Parallel Scaling of Long-Horizon Agentic Tasks [33.36477179106684]
本研究では,エージェント探索やディープリサーチなどの長期エージェントタスクに対する並列テスト時間スケーリングについて検討する。
並列軌道を環境として扱うアグリゲーションエージェントであるAggAgentを提案する。
論文 参考訳(メタデータ) (2026-04-13T17:26:31Z) - DLLM Agent: See Farther, Run Faster [94.74432470237817]
拡散大言語モデル(DLLM)は、自己回帰(AR)デコーディングの代替として、魅力的な効率とモデリング特性を持つ。
我々は、DLLMとARのバックボーンを同一のエージェントワークフロー内でインスタンス化することで、制御された環境でこれを研究する。
DLLMエージェントはARエージェントよりも平均30%以上速く、場合によっては8倍のスピードアップを達成している。
論文 参考訳(メタデータ) (2026-02-07T09:01:18Z) - AgentIF-OneDay: A Task-level Instruction-Following Benchmark for General AI Agents in Daily Scenarios [49.90735676070039]
持続時間と複雑さが増大するタスクを効果的に処理するAIエージェントの能力は、成長を続けている。
エージェントタスクの多様性に十分対処することなく,タスクの難易度の向上を優先している。
本稿では,自然言語命令とAIエージェントを多種多様な日常タスクに活用できるかどうかを判定するエージェントIF-OneDayを提案する。
論文 参考訳(メタデータ) (2026-01-28T13:49:18Z) - XAgents: A Unified Framework for Multi-Agent Cooperation via IF-THEN Rules and Multipolar Task Processing Graph [14.273739638741139]
XAgentsはマルチポーラタスク処理グラフとIF-THENルールに基づいて構築された統合マルチエージェント協調フレームワークである。
XAgentsは、知識型および論理型問合せタスクの両方において、最先端のシングルエージェントおよびマルチエージェントアプローチを一貫して超越している。
論文 参考訳(メタデータ) (2025-09-12T08:40:58Z) - Loosely Synchronized Rule-Based Planning for Multi-Agent Path Finding with Asynchronous Actions [5.5233853454863615]
MAPF(Multi-Agent Path Finding)は、各開始地点から各目標地点まで、複数のエージェントの衝突のない経路を求める。
多くのMAPFアルゴリズムは数千のエージェントを処理できるが、エージェントの各アクションが時間単位を必要とするという仮定に依存している。
本稿では,新たなプランナを開発し,スケーラビリティのためのソリューション品質をトレードオフする。
論文 参考訳(メタデータ) (2024-12-16T11:36:24Z) - MALT: Improving Reasoning with Multi-Agent LLM Training [67.76186488361685]
MALT(Multi-Agent LLM Training)は、推論プロセスを生成、検証、改善ステップに分割する、新しいポストトレーニング戦略である。
MATH、GSM8K、CSQAでは、MALTは、それぞれ15.66%、7.42%、9.40%の相対的な改善で同じベースラインLLMを上回っている。
論文 参考訳(メタデータ) (2024-12-02T19:30:36Z) - HiAgent: Hierarchical Working Memory Management for Solving Long-Horizon Agent Tasks with Large Language Model [39.169389255970806]
HiAgentは、サブゴールをメモリチャンクとして活用して、LLM(Large Language Model)ベースのエージェントの動作メモリを階層的に管理するフレームワークである。
その結果,HiAgentは成功率を2倍に向上し,平均ステップ数を3.8倍に削減した。
論文 参考訳(メタデータ) (2024-08-18T17:59:49Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。