論文の概要: VibeLifeBench: Can Your Life Agent Be Proactive and Persistent in a Living World?
- arxiv url: http://arxiv.org/abs/2608.10875v2
- Date: Sun, 16 Aug 2026 17:38:38 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-18 13:30:43.572852
- Title: VibeLifeBench: Can Your Life Agent Be Proactive and Persistent in a Living World?
- Title(参考訳): VibeLifeBench:あなたのライフエージェントは、生きた世界で積極的に持続できるか?
- Abstract要約: VibeLifeBenchは10の日常ドメインにわたる200のロングホライゾンタスクのベンチマークである。
各タスクは、22のモックサービスのシミュレートされた世界で、スクリプト化された複数週間のタイムラインである。
すべてのタスクは、エージェントが実際に残したもののみを読み取る、きめ細かい重み付きチェック、最後に残した状態、アクションのタイムライン、暗黙の制約を裏付けるかどうかによって評価される。
すべてのタスク、環境、評価フレームワークをオープンソースにします。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large language model (LLM) agents are increasingly deployed as personal assistants. Existing evaluations, however, mostly use short, self-contained requests in static environments. Everyday life assistance is different. A task runs for weeks rather than minutes. The world keeps changing while the agent is not being prompted. Many constraints are never stated outright. An agent that merely answers the request in front of it will fail at such a task. What is needed instead is an agent that stays proactive and consistent. It decides on its own when to act, when to ask, and when to stay silent. It notices changes that nobody announced. It keeps one plan coherent from the first day to the last. No current benchmark measures this. We introduce VibeLifeBench, a benchmark of 200 long-horizon tasks across ten everyday-life domains. Each task is a scripted multi-week timeline in a simulated world of 22 mock services. The world advances on its own clock, and many of its changes are silent, so only an agent that re-inspects the world discovers them. Every task is graded by fine-grained, weighted checks that read only what the agent actually left behind, covering the end state, the timeliness of its actions, and whether it upheld the implicit constraints. We evaluate seven frontier models. All of them score low, which shows how far current agents are from assisting with real life. We will open-source all tasks, environments, and the evaluation framework.
- Abstract(参考訳): 大規模言語モデル(LLM)エージェントは、パーソナルアシスタントとしてますます多くデプロイされている。
しかし、既存の評価では、ほとんどの場合、静的な環境で、短い自己完結型のリクエストを使用する。
毎日の生活支援は違う。
タスクは数分ではなく数週間実行されます。
エージェントが誘導されない間、世界は変わり続けます。
多くの制約は、完全には述べられません。
単にその前の要求に応答するエージェントは、そのようなタスクで失敗する。
代わりに必要なのは、プロアクティブで一貫したエージェントである。
行動のタイミング、質問のタイミング、沈黙の時間を決める。
誰も発表しなかった変化に気づく。
初日から最終までの1つの計画が整合している。
現在のベンチマークでは、これを測定していません。
VibeLifeBenchは10の日常ドメインにわたる200のロングホライゾンタスクのベンチマークである。
各タスクは、22のモックサービスのシミュレートされた世界で、スクリプト化された複数週間のタイムラインである。
世界は独自の時計で前進し、その変化の多くは沈黙しているので、世界を見直すエージェントだけがそれらを発見する。
すべてのタスクは、エージェントが実際に残したものだけを読み取る、きめ細かな重み付きチェック、最後に残した状態、アクションのタイムライン、暗黙の制約を裏付けるかどうかによってランク付けされる。
7つのフロンティアモデルを評価する。
いずれも低いスコアで、現在のエージェントが現実の生活を助けるのにどれだけ遠いかを示しています。
すべてのタスク、環境、評価フレームワークをオープンソースにします。
関連論文リスト
- WorldBench: Culturally Grounded Benchmark for Multilingual Agents [69.76002914143531]
既存のベンチマークでは、状態の保存、言語間のパフォーマンス、現実的な根拠のあるシナリオへのアプリケーションをテストすることはめったにない。
We present WorldBench: a comprehensive, multilingual benchmark, where agent can act in a sandbox via structured action。
WorldBenchは、7つの言語と8つの文化にまたがる1,600のタスクで構成され、人間のアノテータからのフィードバックによってフィルタリングされ洗練されている。
論文 参考訳(メタデータ) (2026-09-01T10:53:07Z) - OneDayAgent: Towards a Long-Horizon Harness for Autonomous Agents [52.15259607762389]
自律型エージェントのための長距離ハーネスであるOneDayAgentを紹介する。
OneDayAgentはオープンなリクエストをマネージドな実行プロセスに変換する。
我々は104のタスクでAgentIF-OneDay上でOneDayAgentを評価する。
論文 参考訳(メタデータ) (2026-08-04T17:55:41Z) - What Could the Agent See at 19:05? Generating Temporal Enterprise Scenarios from Real Research and Replaying Them to Evaluate Agents [0.0]
エンタープライズAIエージェントは、データを継続的に変更する多くのアプリにわたって動作します。
我々のシステムは2つのギャップを同時に埋める: 現実的な、ペルソナ駆動で、時間的に進化するエンタープライズ世界を現実の研究から生み出し、プラグ可能なエージェントを評価するために、任意の瞬間にその世界を再生する。
論文 参考訳(メタデータ) (2026-08-02T06:56:56Z) - Agentic Abstention: Do Agents Know When to Stop Instead of Act? [13.780119058961331]
LLMエージェントは、検索、ブラウジングインターフェース、端末ツールを使用して、複数のターンで動作することが期待されている。
エージェントが不確実性の下で行動するのをやめるべきかどうかを決定する問題であるエージェント・アポテンションを定義する。
本研究では,Webショッピング,端末環境,質問応答において,13のLLM-as-agentシステムと28,000以上のタスクで2つのエージェント・足場を評価する。
論文 参考訳(メタデータ) (2026-06-27T04:49:37Z) - SentinelBench: A Benchmark for Long-Running Monitoring Agents [20.69666656998877]
SentinelBenchは、時間進化モニタリングタスクのためのオープンソースのベンチマークである。
メール、カレンダー、ファイナンス、プロフェッショナルネットワーキング、エンターテイメントなど10の合成ウェブ環境に100のタスクがある。
タスク完了、反応時間、リソース使用量を計測し、応答性とコストのトレードオフを明らかにする。
論文 参考訳(メタデータ) (2026-06-03T18:32:00Z) - WildClawBench: A Benchmark for Real-World, Long-Horizon Agent Evaluation [88.10947115397971]
この研究でWildClawBenchは、6つのテーマのカテゴリにまたがる60の人間によるバイリンガルなマルチモーダルタスクのネイティブランタイムベンチマークである。
各タスクは、約8分間のウォールクロック時間と20以上のツールコールで実行されます。
グラディングはハイブリッドであり、決定論的ルールベースのチェック、副作用の環境状態監査、意味的検証のためのLLM/VLM判定を組み合わせている。
論文 参考訳(メタデータ) (2026-05-11T17:49:43Z) - ClawMark: A Living-World Benchmark for Multi-Turn, Multi-Day, Multimodal Coworker Agents [77.22389710754452]
マルチターンマルチデイタスクを中心に構築された同僚エージェントのベンチマークであるベンチを紹介する。
現在のリリースには、13のプロのシナリオにわたる100のタスクが含まれており、5つのステートフルなサンドボックスサービスに対して実行される。
最強のモデルは75.8の重み付きスコアに達するが、最も厳格なタスク成功率は20.0%に過ぎず、部分的な進歩が一般的であることを示している。
論文 参考訳(メタデータ) (2026-04-26T16:05:02Z) - ClawBench: Can AI Agents Complete Everyday Online Tasks? [50.958690494341106]
ClawBenchは153のシンプルなタスクの評価フレームワークで、人々が人生や仕事で定期的に達成する必要がある。
ClawBenchは本番Webサイトで動作し、実世界のWebインタラクションの完全な複雑さ、動的な性質、課題を保存する。
軽量なインターセプション層は、最終的なリクエストのみをキャプチャしてブロックし、現実世界の副作用なしに安全な評価を保証する。
論文 参考訳(メタデータ) (2026-04-09T17:57:13Z) - Terminal-Bench: Benchmarking Agents on Hard, Realistic Tasks in Command Line Interfaces [126.23612941699565]
Terminal-Bench 2.0は、現実世界の問題に触発されたコンピュータ端末環境における89のタスクからなるベンチマークである。
ベンチマークでは、フロンティアモデルとエージェントのスコアが65%未満であることが示されています。
将来的にはhttps://www.tbench.ai/で開発者や研究者を支援するために、データセットと評価ハーネスを公開しています。
論文 参考訳(メタデータ) (2026-01-17T01:29:30Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。