論文の概要: ReLiveGym: Evaluating Long-Lived Agents over Weeks of Replayed Reality
- arxiv url: http://arxiv.org/abs/2610.00710v1
- Date: Wed, 30 Sep 2026 20:59:33 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 01:19:23.765911
- Title: ReLiveGym: Evaluating Long-Lived Agents over Weeks of Replayed Reality
- Title(参考訳): ReLiveGym: Replayed Realityの数週間にわたる長生きエージェントの評価
- Abstract要約: 大きな言語モデル(LLM)エージェントは、永続的な監視や反復的なアクションのためにますますデプロイされる。
これらのエージェントは、何日か数週間も無人で動作し、適切なタイミングで動作し、時間とともに動的環境に適応することが期待されている。
ReLiveGymは、リアルタイムニュース、市場、ソーシャルメディアストリームを時系列的に再生した数週間間、エージェントがまばらに行動する長寿命タスクの診断評価環境である。
- 参考スコア(独自算出の注目度): 23.993308768008344
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: As large language model (LLM) agents become widely adopted, they are increasingly deployed for tasks that require persistent monitoring or recurring actions (e.g., market analysis). These agents are expected to operate unattended for days or weeks, act at the right timing, and adapt to the dynamic environment over time. These challenges are not fully captured in the existing long-horizon agent work, as they often consider a static environment that is not temporally changing. We introduce ReLiveGym, a diagnostic evaluation environment of long-lived tasks in which agents act sparsely over simulated weeks of chronologically replayed real-world news, market, and social-media streams. The tasks span diverse levels of time sensitivity, reasoning intensity, and recurrence. Across eight base language models, we investigate how model choice and harness design affect agent performance on such long-lived tasks. Our results show that how agents determine when to act arises as an important harness-design axis for long-lived tasks; and that the optimal design varies across tasks and sometimes model choices as well. We also evaluate how continuous learning from hindsight feedback affects performance and addresses failure modes observed in these long-lived tasks. These findings indicate model choice, action timing mechanism, and use of feedback as important considerations in the design of long-lived agents. Code: https://github.com/SaharaLabsAI/ReLiveGym
- Abstract(参考訳): 大規模言語モデル(LLM)エージェントが広く採用されるにつれて、永続的な監視や反復的なアクション(マーケット分析など)を必要とするタスクにデプロイされるケースが増えている。
これらのエージェントは、何日か数週間も無人で動作し、適切なタイミングで動作し、時間とともに動的環境に適応することが期待されている。
これらの課題は、時間的に変化しない静的環境を考えることが多いため、既存の長期エージェント作業において完全には捉えられていない。
ReLiveGymは、リアルタイムニュース、市場、ソーシャルメディアストリームを時系列的に再生した数週間間、エージェントがまばらに行動する長寿命タスクの診断評価環境である。
タスクは、時間感受性、推論強度、再発の様々なレベルにまたがる。
8つの基本言語モデルにわたって、モデル選択とハーネス設計が、そのような長時間のタスクにおいてエージェントのパフォーマンスにどのように影響するかを考察する。
以上の結果から, エージェントがいつ行動するかは, 長時間のタスクにおいて重要なハーネス設計軸として生じること, 最適設計はタスクによって異なること, 時にはモデル選択も異なることが示唆された。
また、後ろ向きのフィードバックからの継続的学習がパフォーマンスにどのように影響するかを評価し、これらの長時間のタスクで観察される障害モードに対処する。
これらの結果から,長期薬剤の設計において,モデル選択,行動タイミング機構,フィードバックの利用が重要な考慮事項であることが示唆された。
コード:https://github.com/SaharaLabsAI/ReLiveGym
関連論文リスト
- From Question Answering to Task Completion: A Survey on Agent System and Harness Design [67.8241530947325]
本研究はモデルハーネスレンズを用いてLCMをベースとしたエージェントについて検討する。
まず, LLMをベースとしたエージェントを基礎モデルと実行ハーネスとして, エージェントの機能的定義と実装の視点を明らかにする。
次に、モデル中心のスケーリングの限界を分析し、エージェントエンジニアリングの4つのパラダイムをトレースし、実行ハーネスを6つの結合ランタイム責任に分解する。
論文 参考訳(メタデータ) (2026-06-14T05:40:16Z) - AsyncTool: Evaluating the Asynchronous Function Calling Capability under Multi-Task Scenarios [33.202154532105396]
大言語モデル(LLM)ベースのエージェントは、複雑なタスクを解決するために外部ツールを使用することで、強力な能力を示している。
現実世界のアプリケーションでは、複数のタスクを同時に実行する必要があり、全体的な効率性は、ツールのレスポンスを待っている間にエージェントがアイドルタイムを使えるかどうかに依存する。
我々は,対話型マルチタスクツール使用環境におけるLLMベースのエージェントを遅延ツールフィードバックで評価するためのベンチマークであるAsyncToolを提案する。
論文 参考訳(メタデータ) (2026-05-27T05:36:35Z) - VitaBench 2.0: Evaluating Personalized and Proactive Agents in Long-Term User Interactions [63.13827503828231]
我々は、長期ユーザーインタラクションにおけるパーソナライズされたプロアクティブなエージェント動作を評価するためのベンチマークであるVitaBench 2.0を紹介する。
結果は、最先端のモデルでさえ、現実世界のパーソナライゼーションは非常に困難であることを示している。
論文 参考訳(メタデータ) (2026-05-26T15:07:38Z) - Your Agents Are Aging Too: Agent Lifespan Engineering for Deployed Systems [60.79651380135334]
長寿命のAIエージェントは、永続的な運用システムとしてますますデプロイされる。
エージェントはデプロイ後、いつまで信頼できるのか?
エージェントライフスパンエンジニアリングのための縦型信頼性ベンチマークであるAgingBenchを紹介する。
論文 参考訳(メタデータ) (2026-05-25T19:55:12Z) - From Task Solving to Robust Real-World Adaptation in LLM Agents [17.122224644097304]
大規模言語モデルは、拡張された地平線上での計画、呼び出し、アクションを行う特別なエージェントとして、ますます多くデプロイされている。
グリッド型ゲームにおけるエージェントLLMを、単純なゴールだが長距離実行でベンチマークする。
名目上のタスク解決と,デプロイメントのような堅牢性の間には,大きなギャップがあります。
論文 参考訳(メタデータ) (2026-02-02T20:10:40Z) - AgentLongBench: A Controllable Long Benchmark For Long-Contexts Agents via Environment Rollouts [78.33143446024485]
我々は、横方向思考パズルに基づく環境ロールアウトによるエージェントの評価を行うtextbfAgentLongBenchを紹介した。
このフレームワークは、知識集約的で知識のないシナリオにまたがる厳密な相互作用の軌跡を生成する。
論文 参考訳(メタデータ) (2026-01-28T16:05:44Z) - Episodic Memory for Learning Subjective-Timescale Models [1.933681537640272]
モデルに基づく学習では、エージェントのモデルは、環境の連続状態間の遷移に対して一般的に定義される。
対照的に、生物学的生物の知的行動は、文脈によって異なる時間スケールを計画する能力によって特徴づけられる。
エージェントの主観的時間尺度を定義するエピソード記憶のシーケンスに基づいて、遷移力学モデルを学ぶための新しいアプローチを考案する。
論文 参考訳(メタデータ) (2020-10-03T21:55:40Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。