論文の概要: The Cognitive Continuity Test: Verifying Governed State Transitions in Persistent AI Agents
- arxiv url: http://arxiv.org/abs/2610.00132v1
- Date: Wed, 09 Sep 2026 18:28:33 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-05 14:48:16.379481
- Title: The Cognitive Continuity Test: Verifying Governed State Transitions in Persistent AI Agents
- Title(参考訳): 認知的連続性テスト:永続AIエージェントにおける統治状態遷移の検証
- Abstract要約: 永続AIエージェントは、信念を修正し、メモリを集約し、実行基板を置き換える。
同様の後継州は異なる承認された移行条件を伴い得るが、正当な開発は州を実質的に変えることができる。
本稿では,CCT(Cognitive Continuity Test:認知継続性テスト)について紹介する。CCT(Cognitive Continuity Test:認知継続性テスト:認知継続性テスト:認知継続性テスト:Cognitive Continuity Test:認知継続性テスト:認知継続性テスト:認知継続性テスト:Cognitive Continuity Test:認知継続性テスト:CCT)。
- 参考スコア(独自算出の注目度): 2.124730017640531
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Persistent AI agents revise beliefs, consolidate memory, and replace execution substrates. Similar successor states can accompany differently authorized transition claims, while legitimate development can change state substantially. We introduce the Cognitive Continuity Test (CCT), a policy-relative contract for verifying submitted transitions using scoped authority, provenance, deterministic application, semantic predicates, and candidate-persistence receipts. CCT distinguishes verified admissibility, affirmative violation, and unresolved required evidence. Separation results concern transition claims rather than live runtime identity; soundness is conditional on the specified checker and evaluator assumptions. IdentityLineageBench provides 24 generated transition families. The reference post-resolution verifier matches all 576 canonical held-out labels; lexical state similarity and a lineage-only diagnostic baseline admit 60.0% and 80.0% of invalid fixtures. These comparisons establish synthetic conformance, not superiority to a policy-aware deployed system. Signed adversarial regressions cover fabricated interaction counts, unsupported belief changes, and mixed missing/contradictory evidence. SIT behavior and actual model migration remain unmeasured. An 18,000-execution valid-path study measures a 6.21 ms default median on resident inputs. We specify the additional activation and recovery obligations needed for deployment.
- Abstract(参考訳): 永続AIエージェントは、信念を修正し、メモリを集約し、実行基板を置き換える。
同様の後継州は異なる承認された移行条件を伴い得るが、正当な開発は州を実質的に変えることができる。
本稿では,CCT(Cognitive Continuity Test:認知継続性テスト)について紹介する。CCT(Cognitive Continuity Test:認知継続性テスト:認知継続性テスト:認知継続性テスト:Cognitive Continuity Test:認知継続性テスト:認知継続性テスト:認知継続性テスト:Cognitive Continuity Test:認知継続性テスト:CCT)。
CCTは、確認された許容性、肯定的な違反、未解決の必要な証拠を区別する。
分離結果は、ライブランタイムアイデンティティよりもトランジッションクレームに関係しており、音質は特定のチェッカーと評価器の仮定に条件づけられている。
IdentityLineageBenchは24の生成された遷移ファミリを提供する。
基準ポストレゾリューション検証器は、576の標準保持ラベルと一致し、語彙状態の類似性と系統のみの診断ベースラインは、60.0%と80.0%の無効なフィクスチャを許容する。
これらの比較は、ポリシーを意識したデプロイシステムに優越せず、合成適合性を確立する。
署名された敵対的回帰は、偽造された相互作用数、支持された信念の変化、そして欠落/矛盾の混在した証拠をカバーしている。
SITの挙動と実際のモデルマイグレーションは未測定のままである。
18,000回の有効なパスパス調査では、居住者の入力に対して6.21msのデフォルトの平均値が測定されている。
デプロイメントに必要な追加のアクティベーションとリカバリの義務を指定します。
関連論文リスト
- Testing and Verification of Quantum Compilers through Assurance Contracts and Evidence [0.25489046505746704]
この調査は、検証済みの変換、等価チェック、差分および変成テスト、プロパティベースのテスト、およびリビジョン間の保証の証拠を比較します。
記録されたカバレッジ更新とソースレベルの選択決定は、レビューを宣言されたスコープ内で監査可能にする。
論文 参考訳(メタデータ) (2026-09-24T01:24:49Z) - Complex Problem Solving in Large Language Models: A Statistical Control Survey and Diagnostic Framework [52.886947585847594]
大規模言語モデル(LLM)による複雑な問題解決は、しばしばより強い推論やより長い生成の問題としてフレーム化される。
しかし、早期のエラー増幅、迅速な脆さ、誤ったコミットメントを修正する失敗を説明するのは難しい。
本調査はCPSを潜在解状態上の逐次推定・決定問題と解釈する。
論文 参考訳(メタデータ) (2026-09-17T18:28:45Z) - Stored Is Not Supported: Typed Provenance and Assertion Guardrails for Persistent AI Agents [2.124730017640531]
永続AIエージェントは、リフレクション、検索、統合を通じて自伝的状態を構築する。
自伝的アサーション境界性に対する型付き前置詞とアサーションガードレールを指定する。
論文 参考訳(メタデータ) (2026-09-02T05:35:33Z) - Mechanizing Typed Regulatory Actions for Security Tokens: Semantics, Falsification, and Bounded EVM Evidence [9.32030540168344]
セキュリティ標準は、実行された法的効果や、それが持つ証拠やリバース義務を特定せずに、特権的なコントロールを公開します。
我々はIsabelle/HOLで、FREEZE、SEIZE、CONFISCATE、LIQUIDATE、RESTRICT、RECOVERの6つのERC-8319の参照実行セマンティクスを定式化する。
論文 参考訳(メタデータ) (2026-08-29T08:23:27Z) - AI Slop and Hallucinations in Vulnerability Assessment: A Survey on Reasoning Failures and Trustworthy Mitigation [48.55515767840701]
AIスロープ(AI slop)は、アーティファクト、幻覚的脆弱性、可視だが正しくないパッチ、セマンティックに再パッケージされたバグレポートである。
本稿では,実証的証拠を調査し,統一メカニズムを特定し,信頼に値するトリアージへの道筋をたどる。
論文 参考訳(メタデータ) (2026-08-26T11:48:38Z) - Testing and Evaluation of Agentic AI Systems In Military Command and Control [0.6273214774587439]
エージェントAIシステムは、厳格なテストと人間の監視に対する公的なコミットメントの下で、軍事指揮統制(C2)のために調達されている。
提案手法は,テスト項目を4つのクラスタに分類した8つの仮定を定式化したものである。
最初の3つの仮定クラスタに対して10の保証クレームを導出し、現在および新興メソッドがそれぞれに対処できるかどうかを評価する。
論文 参考訳(メタデータ) (2026-08-20T22:31:23Z) - Beyond Relevance: Bayesian Evidence Acquisition for Agentic Whole-Slide Image Reasoning [72.86819994769634]
全体スライド画像推論(WSI)では、診断問題に答える前に、エージェントが視覚的証拠を逐次取得する必要がある。
本稿では,WSI推論をベイズ証拠取得問題として再検討する,プラグイン・アンド・プレイのエージェント・フレームワークBEACONを提案する。
論文 参考訳(メタデータ) (2026-08-06T08:40:57Z) - From Trajectories to Evidence: Auditable Experimental Records for Industrial Research Agents [47.678562263387214]
研究エージェントは、産業レコメンデーション設定において、多段階の機械学習実験をますます実施している。
生成されたアーティファクトは、サポートされないか、不完全かもしれないし、実行されたラウンドは無効かもしれないし、あるいは廃止されるかもしれないし、後の修正は、以前の発見を曖昧にするかもしれない。
本稿では,連続的アーティファクトのバウンダリ検証と実行後のクレーム資格を結合するエビデンス・グラウンド・フレームワークを提案する。
論文 参考訳(メタデータ) (2026-08-05T13:37:38Z) - When AI Agents Commit: Cognitive Serializability Across Data, Evidence, Policy, and Authority [2.124730017640531]
自律的なエージェントは、データベースの読み込み、証拠の回収、政策、信条、委任された権威から突然変異を導き出す。
トランザクション処理は、提案が実行可能なコントラクトを満たすかどうかを決定する。
Cognitive Serializabilityは、不変の実行可能な定義、レジストリ由来の権限計画、シールされたガードファーストコミットトランザクション、封筒後エンベロープ、証人限定の権限を組み合わせたものだ。
論文 参考訳(メタデータ) (2026-07-28T19:36:23Z) - Consistent Evidence, Robust Recognition: Faithful Attribution Regularization under Geometric Transformations [42.90321348046055]
画像領域のサブモジュール探索に基づくアノテーションのない属性正規化フレームワークを提案する。
候補部分集合がモデル出力にどのように影響するかを測定することで、探索は、コンパクトでクラス識別的な証拠を探索由来の監督として抽出する。
ImageNet-100の実験結果から,VT-B/16の属性安定性,挿入性,削除性は0.28ポイントの精度低下で大幅に向上することがわかった。
論文 参考訳(メタデータ) (2026-07-26T20:41:38Z) - Affordance Agent Harness: Verification-Gated Skill Orchestration [45.231685718099264]
Affordance groundingは、オープンワールドのシーンでエージェントがどこでどのように対話すべきかを特定する必要がある。
本稿では,エビデンスストアとコストコントロールを備えたクローズドループランタイムであるAffordance Agent Harnessを提案する。
論文 参考訳(メタデータ) (2026-05-01T13:45:16Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。