論文の概要: Springdrift: An Auditable Persistent Runtime for LLM Agents with Case-Based Memory, Normative Safety, and Ambient Self-Perception
- arxiv url: http://arxiv.org/abs/2604.04660v1
- Date: Mon, 06 Apr 2026 13:14:37 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-07 15:49:19.198069
- Title: Springdrift: An Auditable Persistent Runtime for LLM Agents with Case-Based Memory, Normative Safety, and Ambient Self-Perception
- Title(参考訳): Springdrift: ケースベース記憶, 規範的安全性, 環境的自己認識を備えたLLMエージェントのための聴取型永続化ランタイム
- Abstract要約: 本稿では、長期LLMエージェントの永続ランタイムであるSpringdriftを紹介する。
我々は,このカテゴリに人工リテーナという用語を導入する。
これは、システム設計とデプロイメントのケーススタディに関する技術的なレポートであり、ベンチマークによる評価ではない。
- 参考スコア(独自算出の注目度): 0.20305676256390928
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: We present Springdrift, a persistent runtime for long-lived LLM agents. The system integrates an auditable execution substrate (append-only memory, supervised processes, git-backed recovery), a case-based reasoning memory layer with hybrid retrieval (evaluated against a dense cosine baseline), a deterministic normative calculus for safety gating with auditable axiom trails, and continuous ambient self-perception via a structured self-state representation (the sensorium) injected each cycle without tool calls. These properties support behaviours difficult to achieve in session-bounded systems: cross-session task continuity, cross-channel context maintenance, end-to-end forensic reconstruction of decisions, and self-diagnostic behaviour. We report on a single-instance deployment over 23 days (19 operating days), during which the agent diagnosed its own infrastructure bugs, classified failure modes, identified an architectural vulnerability, and maintained context across email and web channels -- without explicit instruction. We introduce the term Artificial Retainer for this category: a non-human system with persistent memory, defined authority, domain-specific autonomy, and forensic accountability in an ongoing relationship with a specific principal -- distinguished from software assistants and autonomous agents, drawing on professional retainer relationships and the bounded autonomy of trained working animals. This is a technical report on a systems design and deployment case study, not a benchmark-driven evaluation. Evidence is from a single instance with a single operator, presented as illustration of what these architectural properties can support in practice. Implemented in approximately Gleam on Erlang/OTP. Code, artefacts, and redacted operational logs will be available at https://github.com/seamus-brady/springdrift upon publication.
- Abstract(参考訳): 本稿では、長期LLMエージェントの永続ランタイムであるSpringdriftを紹介する。
このシステムは、監査可能な実行基板(アペンドオンメモリ、教師付きプロセス、gitバックアップされたリカバリ)、ハイブリッド検索(密度の高いコサインベースラインに対して評価される)を備えたケースベースの推論メモリ層、監査可能な公理トレイルで安全にゲーティングするための決定論的規範計算、そしてツールコールなしで各サイクルに注入された構造化自己状態表現(セシウム)を介して連続的な環境自己認識を統合している。
これらの特性はセッションバウンドシステムでは達成し難い振る舞いをサポートする: セッション間タスク継続性、チャンネル間コンテキストの保守、決定のエンドツーエンドの法医学的再構築、自己診断的行動。
エージェントが自身のインフラストラクチャのバグを診断し、障害モードを分類し、アーキテクチャ上の脆弱性を特定し、EメールとWebチャネル間のコンテキストを明示的な命令なしで維持する、23日間(19の運用日)にわたる単一インスタンスのデプロイについて報告した。
永続的な記憶、定義された権限、ドメイン固有の自律性、および特定のプリンシパルとの継続的な関係における法医学的説明責任を持つ非人間的システムである。
これは、システム設計とデプロイメントのケーススタディに関する技術的なレポートであり、ベンチマークによる評価ではない。
エビデンス(Evidence)は、単一のオペレータを持つ単一のインスタンスから、これらのアーキテクチャプロパティが実際に何をサポートできるかの図示として提示される。
Erlang/OTPのGleamに実装されている。
コード、アーティファクト、再実行された運用ログは、公開時にhttps://github.com/seamus-brady/springdriftで入手できる。
関連論文リスト
- DuMateBench: Evaluating Autonomous Agents in Complex Real-World Workflows [69.12339622053588]
我々はDuMateBenchを紹介した。DuMateBenchは匿名化およびプライバシスクリーニングによるユーザセッションから再構築されたリアルセッションベンチマークである。
結果として得られたベンチマークは、8つの広いシナリオにまたがる200のタスクと、17のきめ細かい機能カテゴリで構成されている。
これらのタスクは、Isufficient、Unstable、Noisyの3種類の環境複雑性を注入した、分離されたDockerコンテナで実行します。
論文 参考訳(メタデータ) (2026-08-27T02:36:23Z) - Formal Verification of Agentic Systems over Operational Data [59.98246281888422]
大規模言語モデル(LLM)によって駆動されるエージェントシステムは、永続的な運用データを扱う現実世界にますます展開されている。
既存のアプローチはそのようなシステムレベルの保証を提供していません。
本稿では, 1 つの LLM とツールオーケストレーションハーネスからなるエージェントシステムのリレーショナル操作データに対する検証について述べる。
論文 参考訳(メタデータ) (2026-08-04T13:01:30Z) - ScrambleToolBench: Agents Search Exhaustively Even When Their Own Map Points to the Next Step [74.83535434786145]
ScrambleToolBenchは,行動推論の分離を目的とした対話型端末ベンチマークである。
このベンチマークでは、エージェントがテストとエラーのインタラクションを通じて、隠されたツールの振る舞いを明らかにする必要がある。
現状の言語モデルに対する我々の評価は、初期発見が成功しても頑健な適応にはならないことを示している。
論文 参考訳(メタデータ) (2026-08-03T15:07:46Z) - From Profiling to Synthesis: Benchmarking Implicit Behavioral Alignment in Personalized LLM Agents [56.187590188698955]
大規模言語モデルは、ますます有能な自律エージェントを可能にしてきたが、そのようなエージェントを実用的に有効にするためには、パーソナライズが不可欠である。
最近のベンチマークではエージェントのパーソナライゼーションの評価が始まっているが、それらは主に静的な選好スナップショット、固定されたインタラクションログ、あるいは事前に定義されたユーザプロファイルに対する質問応答に依存している。
縦断的相互作用履歴から構築した暗黙的行動アライメントのベンチマークであるIBA-Benchを紹介する。
IBA-Agentは、広範囲な検索と軌道レベルのアライメントを通じて競合する優先順位を調整するエージェントフレームワークである。
論文 参考訳(メタデータ) (2026-08-03T12:52:04Z) - PhyAgentOS: A Self-Evolving Operating System for Embodied Agents with Decoupled Cognitive Planning and Physical Execution [49.776611937968]
我々は、スケジューリング、検証、メモリ、ベンチマーク、安全性をシステムレベルのサービスとして提供するPhyAgentOSを紹介します。
セッション中心のセッションは、スケジューリング、互換性、監督された実行、エビデンス収集、受け入れの最小単位として、アクションではなくセッションを扱う。
SessionVerifierは、実行終了とセマンティックタスク完了を、成功、失敗、または再計画のエビデンスに基づいて判断する。
ベンチマークはデプロイメントセッションと検証パスを再利用するので、結果は実際の実行に遡る。
論文 参考訳(メタデータ) (2026-07-18T04:46:53Z) - Memory-Orchestrated Semantic System (MOSS): An Auditable Agentic Memory Architecture [0.0]
本稿では,MOSS(Memory-Orchestrated Semantic System)を提案する。
MOSSはモデルに依存しない、ストレージに依存しない、APIに依存しない、あらゆるリレーショナルエンジンで動作し、いかなるLLMプロバイダにも接続し、任意のインフラストラクチャ、ローカルまたはクラウドにデプロイする。
2024年10月までの1年間,個別の研究者の作業コーパスよりも連続的な生産が続けられた。
論文 参考訳(メタデータ) (2026-07-05T16:35:19Z) - Observability for Delegated Execution in Agentic AI Systems [0.6445605125467572]
本稿では,軽量ゲートウェイと共通情報モデルからなるエージェント対応可観測基板を提案する。
これにより、時間-ウィンドウの相関なしに、信頼性の高いクロスツールデリゲートスコープの再構築と直接法医学的なクエリが可能になる。
論文 参考訳(メタデータ) (2026-06-08T16:10:05Z) - An Organization-Scoped LLM Agent Runtime Architecture for Regulated Cybersecurity Operations [0.3013679260442808]
規制されたサイバーセキュリティは、組織レベルの範囲を強制するランタイム基板を欠いている。
最近の大規模言語モデル(LLM)エージェントシステムは、孤立したサイバーセキュリティタスクに対して強い結果を報告している。
本稿では,金融サイバーセキュリティのための組織スコープ型エージェントランタイムアーキテクチャを提案する。
論文 参考訳(メタデータ) (2026-05-28T21:51:38Z) - Monitoring Data-aware Temporal Properties (Extended Version) [56.386411908764494]
有限トレース上の任意のSMT理論に富む線形時間特性の予測モニタリングについて考察する。
この設定での予測モニタリングは非常に困難であり、監視状態はこれまでのトレースプレフィックスと可能な有限継続の両方に依存している。
本研究は,表現的フラグメントオフMTにおける特性モニタリングのための新しい基礎的枠組みの正しさを提示し,正式に証明するものである。
論文 参考訳(メタデータ) (2026-05-14T10:23:11Z) - Towards Security-Auditable LLM Agents: A Unified Graph Representation [22.355591892994642]
本稿ではエージェントセキュリティ監査のための統合構造表現であるエージェントBOMを提案する。
エージェントBOMは、クロスセッションメモリ中毒やツール誤用など、ステルス攻撃チェーンを再構築できることを示す。
Agent-BOMは複雑なエージェントエコシステムにおける根本原因分析とセキュリティ適応のための統一的で監査可能な基盤を提供する。
論文 参考訳(メタデータ) (2026-05-07T18:14:29Z) - Dynamic analysis enhances issue resolution [53.50448142467294]
DAIRA(Dynamic Analysis-enhanced Issue Resolution Agent)は、エージェントの推論サイクルに動的解析を組み込む自動修復フレームワークである。
テストトレース駆動の方法論によって駆動されるDAIRAは、軽量モニタを使用して重要なランタイムデータを抽出する。
Gemini 3 Flash Previewを使用すると、DAIRAは新たな最先端(SOTA)パフォーマンスを確立し、SWE-bench Verifiedデータセットで79.4%の解像度を達成する。
論文 参考訳(メタデータ) (2026-03-23T14:48:54Z) - Reasoning Provenance for Autonomous AI Agents: Structured Behavioral Analytics Beyond State Checkpoints and Execution Traces [0.0]
Agent Execution Record (AER) は構造化された推論プリミティブであり、すべてのステップで第一級クエリ可能なフィールドとしてインテント、観察、推論をキャプチャする。
AERが集団レベルの行動分析を可能にする方法を示す: 推論パターンマイニング、信頼度校正、クロスエージェント比較、モックリプレイによる反事実回帰テスト。
論文 参考訳(メタデータ) (2026-03-23T08:27:54Z) - A Trace-Based Assurance Framework for Agentic AI Orchestration: Contracts, Testing, and Governance [0.22940141855172028]
本稿では,Large Language Models (LLM) を用いたエージェントAIシステムの保証フレームワークを提案する。
実行は、明示的なステップとトレースコントラクトを備えたメッセージ・アクション・トレース(MAT)として実装される。
このフレームワークは、有界摂動に対する予算付き反例探索として定式化されたストレステストを含む。
論文 参考訳(メタデータ) (2026-03-18T10:23:48Z) - ReqToCode: Embedding Requirements Traceability as a Structural Property of the Codebase [0.0]
本稿では,トレース可能なシステム要素を直接システムに埋め込むことによって,トレースの劣化を防止する手法であるReqToCodeを紹介する。
アプローチ、アーキテクチャ原則、トレーサブルライフサイクルを説明し、要求定義、アーティファクト生成、コード統合、ビルド時の検証を対象とする一般的な例で説明します。
論文 参考訳(メタデータ) (2026-03-14T16:00:09Z) - Automated Self-Testing as a Quality Gate: Evidence-Driven Release Management for LLM Applications [51.56484100374058]
我々は,エビデンスに基づくリリース決定を伴う品質ゲートを導入する自動自己テストフレームワークを提案する。
内部展開型多エージェント対話型AIシステムの縦型ケーススタディにより,本フレームワークの評価を行った。
論文 参考訳(メタデータ) (2026-03-13T20:44:15Z) - Understanding by Reconstruction: Reversing the Software Development Process for LLM Pretraining [66.89012795621349]
大規模言語モデル(LLM)は、複雑なソフトウェア工学に必要な、深く、長期にわたる推論に苦しむことが多い。
本稿では,再構築による理解という,新しいパラダイムを提案する。
マルチエージェントシミュレーションを用いて潜在エージェント軌道を合成するフレームワークを提案する。
論文 参考訳(メタデータ) (2026-03-11T09:23:20Z) - AutoAgent: Evolving Cognition and Elastic Memory Orchestration for Adaptive Agents [26.380991138110925]
AutoAgentは、認知の進化、オンザフライでのコンテキスト決定、弾力性のあるメモリオーケストレーションに基づく、自己進化型のマルチエージェントフレームワークである。
各エージェントは、ツール、自己能力、同僚の専門知識、タスク知識に関する構造化されたプロンプトレベルの認知を維持する。
AutoAgentは、静的およびメモリ拡張ベースラインに対するタスク成功、ツール使用効率、共同ロバスト性を一貫して改善する。
論文 参考訳(メタデータ) (2026-03-10T14:23:49Z) - The Why Behind the Action: Unveiling Internal Drivers via Agentic Attribution [63.61358761489141]
LLM(Large Language Model)ベースのエージェントは、カスタマーサービス、Webナビゲーション、ソフトウェアエンジニアリングといった現実世界のアプリケーションで広く使われている。
本稿では,タスク結果に関係なく,エージェントの動作を駆動する内部要因を識別する,テキスト汎用エージェント属性のための新しいフレームワークを提案する。
標準ツールの使用やメモリ誘起バイアスのような微妙な信頼性リスクなど、さまざまなエージェントシナリオでフレームワークを検証する。
論文 参考訳(メタデータ) (2026-01-21T15:22:21Z) - A Benchmark for Procedural Memory Retrieval in Language Agents [0.023227405857540805]
現在のAIエージェントは、慣れ親しんだ設定で優れていますが、目に見えないProcで新しいタスクに直面したとき、急激に失敗します。
タスク実行から手続き的メモリ検索を分離する最初のベンチマークを示す。
埋め込み型手法は、慣れ親しんだ文脈で強く機能するが、新規な手法では著しく劣化する。
論文 参考訳(メタデータ) (2025-11-21T08:08:53Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。