論文の概要: ContextWeave: A Real-World Workflow Benchmark
- arxiv url: http://arxiv.org/abs/2608.04830v1
- Date: Wed, 05 Aug 2026 13:31:18 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.940623
- Title: ContextWeave: A Real-World Workflow Benchmark
- Title(参考訳): ContextWeave: 現実世界のワークフローベンチマーク
- Authors: Bo Wang, Yuqian Yao, Enxi Wang, Luozhijie Jin, Yang Liu, Yiran Suo, Yuxuan Cai, Enyu Zhou, Yufei Gao, Honglin Guo, Tianyu Huai, Li Ji, Zhikai Lei, Bufan Li, Lizhi Lin, Jinxiu Liu, Jie Yang, Jiazheng Zhou, Maosen Zhou, Pengfang Qian, Shichun Liu, Guanshan Liu, Hao Zheng, Yunhao Yu, Hang Yan, Jihua Kang, Xinchi Chen, Xipeng Qiu,
- Abstract要約: ContextWeaveは、現実的なオフィスワークストリームにおいて、リコールされたエクスペリエンスがダウンストリームエージェントのパフォーマンスを改善するかどうかを評価する、時系列ベンチマークである。
関連性、連続性、可溶性、不適切なリコールに対する堅牢性の診断によって補完される、参加者固有の嗜好と品質と整合性を測定する。
分析の結果,実行可能で体験に富んだメモリはワークフロー継続をサポートし,コンパクトなサマリーよりも冗長な探索を効果的に行うことができることがわかった。
- 参考スコア(独自算出の注目度): 44.23367918659128
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Memory is essential as language agents move from isolated tasks to long-horizon, stateful workflows, yet existing evaluations often reduce it to retrieval or question answering. We introduce ContextWeave, a longitudinal benchmark that evaluates whether recalled experience improves downstream agent performance in realistic office-work streams. ContextWeave reconstructs privacy-preserved, multi-month workflows of 14 participants into 1,005 executable tasks, including 568 core evaluation tasks, with instructions, containerized environments, trajectories, and task-specific rubrics. It measures workspace quality and alignment with participant-specific preferences, complemented by diagnostics of relevance, continuity, solvability, and robustness to misleading recall. Across six memory components under a fixed model, the strongest configuration raises Workspace Score from 68.08 to 78.20 and Preference Score from 41.50 to 70.60. With a fixed memory component, recall improves both outcomes for all five tested base models, although gains vary substantially. Our analysis shows that actionable, experience-rich memory supports workflow continuation and reduces redundant exploration more effectively than compact summaries, while it can also be more susceptible to misleading recall. These findings motivate memory systems that optimize not only retrieval relevance but also reliable use during execution.
- Abstract(参考訳): 言語エージェントは孤立したタスクから長い水平なステートフルなワークフローに移行するが、既存の評価では検索や質問の回答に還元されることが多いため、メモリは不可欠である。
我々は、リコールされた体験が現実的なオフィスワークストリームにおける下流エージェントのパフォーマンスを改善するかどうかを評価する、縦断ベンチマークであるContextWeaveを紹介した。
ContextWeaveは、14人の参加者によるプライバシ保護された複数ヶ月のワークフローを、命令、コンテナ化された環境、トラジェクトリ、タスク固有のルージックを含む568コア評価タスクを含む1,005の実行可能なタスクに再構築する。
ワークスペースの品質と参加者固有の嗜好との整合を計測し、関連性、連続性、解決可能性、そして誤解を招くリコールに対する堅牢性の診断によって補完する。
固定モデル下の6つのメモリコンポーネントで、最強構成はワークスペーススコアを68.08から78.20に、推奨スコアを41.50から70.60に引き上げる。
メモリの固定化により、リコールは5つのテストベースモデルの両方の結果を改善するが、ゲインはかなり異なる。
我々の分析によると、実行可能で体験に富んだメモリはワークフロー継続をサポートし、コンパクトな要約よりも冗長な探索を効果的に削減するが、リコールを誤解させる可能性も高い。
これらの知見は、検索関連性だけでなく、実行中に信頼性の高い使用を最適化するメモリシステムを動機付けている。
関連論文リスト
- LongMemEval-V2: Evaluating Long-Term Agent Memory Toward Experienced Colleagues [80.29362825271768]
LongMemEval-V2は、メモリシステムが、カスタマイズされた環境で知識のある同僚になるために必要な経験を得るのに役立つかどうかを評価するためのベンチマークである。
LME-V2には、Webエージェントの5つのコアメモリ能力をカバーする451の質問が含まれている。
AgentRunbook-Rは生の状態観察,イベント,戦略ノートのための知識プールを備えた,効率的なRAGベースのメモリであり,AgentRunbook-Cはトラジェクトリをファイルとして格納し,コードエージェントを起動して,拡張サンドボックスに証拠を収集する。
論文 参考訳(メタデータ) (2026-05-12T17:59:34Z) - Workspace-Bench 1.0: Benchmarking AI Agents on Workspace Tasks with Large-Scale File Dependencies [29.138677906501865]
大規模なファイル依存を伴うワークスペース学習におけるAIエージェントの評価のためのベンチマークであるWorkspace-Benchを紹介する。
5つのワーカープロファイル、74のファイルタイプ、20,476のファイル(最大20GB)を持つ現実的なワークスペースを構築し、それぞれが7,399の合計ルーリックに対して評価された独自のファイル依存グラフを持つ388のタスクをキュレートする。
論文 参考訳(メタデータ) (2026-05-05T10:17:06Z) - Fine-Mem: Fine-Grained Feedback Alignment for Long-Horizon Memory Management [63.48041801851891]
Fine-Memは、きめ細かいフィードバックアライメントのために設計された統一されたフレームワークである。
MemalphaとMemoryAgentBenchの実験は、Fin-Memが強いベースラインを一貫して上回ることを示した。
論文 参考訳(メタデータ) (2026-01-13T11:06:17Z) - Mem2ActBench: A Benchmark for Evaluating Long-Term Memory Utilization in Task-Oriented Autonomous Agents [20.357475946040054]
textscMem2ActBenchは、エージェントがツールベースのアクションを実行するために長期的なメモリを積極的に活用できるかどうかを評価するベンチマークである。
リバースジェネレーション法は400のツール使用タスクを生成し、ヒトの評価は91.3%が強いメモリ依存であることを確認した。
論文 参考訳(メタデータ) (2026-01-13T06:22:32Z) - CIMemories: A Compositional Benchmark for Contextual Integrity of Persistent Memory in LLMs [62.116710797795314]
大規模言語モデル(LLM)は、パーソナライゼーションとタスクパフォーマンスを向上させるために、過去のインタラクションから永続的なメモリを使用することが多い。
タスクコンテキストに基づいて,LLMがメモリからの情報フローを適切に制御するかどうかを評価するベンチマークであるCIMemoriesを提案する。
論文 参考訳(メタデータ) (2025-11-18T21:51:23Z) - FindingDory: A Benchmark to Evaluate Memory in Embodied Agents [49.18498389833308]
本研究では,Habitatシミュレータに長距離エンボディタスクのための新しいベンチマークを導入する。
このベンチマークは、持続的なエンゲージメントとコンテキスト認識を必要とする60タスクにわたるメモリベースの機能を評価する。
論文 参考訳(メタデータ) (2025-06-18T17:06:28Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。