論文の概要: Persistent AI Agents in Academic Research: A Single-Investigator Implementation Case Study
- arxiv url: http://arxiv.org/abs/2605.26870v1
- Date: Tue, 26 May 2026 11:28:36 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-27 17:51:41.974149
- Title: Persistent AI Agents in Academic Research: A Single-Investigator Implementation Case Study
- Title(参考訳): 学術研究における永続的AIエージェント--単元調査者による事例研究
- Authors: Anas H. Alzahrani,
- Abstract要約: 分析の単位は、研究者、エージェント、メモリ層、ツール、リポジトリ、スケジュールされたジョブ、特殊なエージェントロール、ガバナンスルールといった、永続的なヒューマンエージェント環境であった。
2026年5月、厳格なトラジェクトリ・サブセットが627のモデル関連イベントと7395万のトークンをキャプチャし、そのうち82.9%がキャッシュ読み取りだった。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Background: Large language models are typically evaluated as models, benchmarks, or short conversational episodes. Less is known about what happens when an agent is embedded persistently in a real academic research environment with durable memory, local files, external tools, scheduled routines, delegated roles, and explicit safety protocols. Methods: A structured self-observed implementation case study was conducted from January 31 to May 25, 2026. The unit of analysis was the persistent human-agent environment: researcher, agent runtime, memory layer, tools, repositories, scheduled jobs, specialized agent roles, and governance rules. Outcomes were organized using PARE-M (Persistent Agentic Research Environment Measurement), a measurement framework covering architecture, utilization, artifact production, resource use, reproducibility, and governance. Results: Recoverable main-agent telemetry contained 75,671 de-duplicated records across 96 active days, with 8,059 user-role and 23,710 assistant-role messages. The workspace included 502 memory-related files, 17 configured agent directories, and 57 skill files. Active system time was 579.7 hours (30-minute capped-gap estimate). Memory-derived records identified 482 output-proxy events and 889 failure, verification, correction, or protocol-proxy events. A strict May 2026 trajectory subset captured 627 model-completed events and 73.95 million recorded tokens, of which 82.9% were cache reads. Conclusions: The workflow was cache-dominant, suggesting that persistent agentic environments may shift the economic unit from cost per token to cost per completed artifact. Future evaluations should use artifact-level denominators, reproducible parsing rules, correction taxonomies, and independent coding of governance events.
- Abstract(参考訳): 背景: 大きな言語モデルは一般的にモデル、ベンチマーク、短い会話のエピソードとして評価される。
エージェントが永続性のあるメモリ、ローカルファイル、外部ツール、スケジュールされたルーチン、委譲されたロール、明示的な安全プロトコルを備えた、実際の学術研究環境に永続的に埋め込まれたときに何が起こるかは、あまり知られていない。
方法:2026年1月31日から5月25日まで,構造化自己観察実施事例調査を行った。
分析の単位は、研究者、エージェントランタイム、メモリ層、ツール、リポジトリ、スケジュールされたジョブ、特殊なエージェントロール、ガバナンスルールである。
成果は PARE-M (Persistent Agentic Research Environment Measurement) を用いて整理された。
結果: 回収可能なメインエージェントテレメトリでは, 96日間で75,671件の非重複レコードが記録され, 8,059件のユーザロールと23,710件のアシスタントロールメッセージが記録された。
ワークスペースには502のメモリ関連ファイル、17の設定されたエージェントディレクトリ、57のスキルファイルが含まれていた。
稼働時間は579.7時間(30分のキャップ付きギャップ推定)である。
メモリ由来のレコードは482の出力プロキシイベントと889の障害、検証、修正、プロトコルプロキシイベントを識別した。
2026年5月、厳格なトラジェクトリ・サブセットが627のモデル完備イベントと7395万のトークンをキャプチャし、そのうち82.9%がキャッシュ読み取りだった。
結論: ワークフローはキャッシュが支配的であり、永続的なエージェント環境は、経済単位をトークン当たりのコストから完了したアーティファクト当たりのコストに移行する可能性があることを示唆している。
将来の評価では、アーティファクトレベルの分母、再現可能なパースルール、修正分類、ガバナンスイベントの独立的なコーディングが使用されるべきである。
関連論文リスト
- Workspace-Bench 1.0: Benchmarking AI Agents on Workspace Tasks with Large-Scale File Dependencies [29.138677906501865]
大規模なファイル依存を伴うワークスペース学習におけるAIエージェントの評価のためのベンチマークであるWorkspace-Benchを紹介する。
5つのワーカープロファイル、74のファイルタイプ、20,476のファイル(最大20GB)を持つ現実的なワークスペースを構築し、それぞれが7,399の合計ルーリックに対して評価された独自のファイル依存グラフを持つ388のタスクをキュレートする。
論文 参考訳(メタデータ) (2026-05-05T10:17:06Z) - Claw-Eval-Live: A Live Agent Benchmark for Evolving Real-World Workflows [67.92316850084575]
ワークフローエージェントのライブベンチマークであるClaw-Eval-Liveを紹介する。
各リリースは、公開ワークフロー要求信号から構築される。
Claw-Eval-Liveは実行トレース、監査ログ、サービス状態、実行後のワークスペースアーティファクトを記録する。
論文 参考訳(メタデータ) (2026-04-30T17:23:19Z) - The Last Human-Written Paper: Agent-Native Research Artifacts [106.47848184955576]
本稿では,物語紙を機械処理可能な研究パッケージに置き換えるプロトコルであるAgent-Native Research Artifact(ARA)を紹介する。
通常の開発において決定と終了をキャプチャするLive Research Manager、レガシPDFとリポジトリをARAに変換するARAコンパイラ、人間レビュアーが重要性、ノベルティ、味にフォーカスできるように客観的チェックを自動化するARAネイティブレビューシステムである。
論文 参考訳(メタデータ) (2026-04-27T16:23:09Z) - Exploring Robust Multi-Agent Workflows for Environmental Data Management [2.556033550563853]
EnviSmartは、環境研究のためのキャンパス全体のストレージインフラ上にデプロイされた生産データ管理システムである。
振舞い(ガバナンス制約)、ドメイン知識(検索可能なコンテキスト)、スキル(ツールを使用する手順)を永続的でインターロック可能なアーティファクトとして外部化する。
論文 参考訳(メタデータ) (2026-04-02T05:46:40Z) - ThinkGeo: Evaluating Tool-Augmented Agents for Remote Sensing Tasks [64.86209459039313]
ThinkGeoは、構造化ツールの使用とマルチステップ計画を通じて、リモートセンシングタスクにおけるツール拡張エージェントを評価するために設計されたエージェントベンチマークである。
我々はReActスタイルの対話ループを実装し,486 個の構造化エージェントタスク上でのオープンソース LLM とクローズドソース LLM の両方を1,773 個の専門家が検証した推論ステップで評価する。
分析の結果、ツールの精度とモデル間の計画整合性に顕著な相違が明らかになった。
論文 参考訳(メタデータ) (2025-05-29T17:59:38Z) - FieldWorkArena: Agentic AI Benchmark for Real Field Work Tasks [52.47895046206854]
FieldWorkArenaは、現実世界のフィールドワークをターゲットにしたエージェントAIのベンチマークである。
本稿では、エージェントAIが現実世界の作業環境ベンチマークのために持つべき新しいアクション空間を定義する。
論文 参考訳(メタデータ) (2025-05-26T08:21:46Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。