論文の概要: Executable Code Knowledge: Code as a Native, Validation-Carrying Knowledge Representation for AI Coding Agents
- arxiv url: http://arxiv.org/abs/2608.16295v1
- Date: Mon, 17 Aug 2026 09:07:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-18 19:59:03.602324
- Title: Executable Code Knowledge: Code as a Native, Validation-Carrying Knowledge Representation for AI Coding Agents
- Title(参考訳): 実行可能なコード知識: AIコーディングエージェントのためのネイティブでバリデーションによる知識表現
- Abstract要約: 我々は、実行可能コード知識(ECK)を導入し、実行可能コード知識ユニット(ECKU)をソースバウンドオブジェクトとして定義する。
私たちのPythonプロトタイプは、コードローカルオーサリング、マニフェストエクスポート、エビデンス実行、正確な変更ラインの影響、フレッシュネスチェック、エージェント対応プロジェクションをサポートしています。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: AI coding agents need more than relevant snippets: they need business semantics, validation evidence, relations, and assurance that their context is current. Existing systems usually infer or externalize this knowledge through retrieval, summaries, graphs, rules, or reverse specifications. We investigate a complementary representation in which selected code units directly carry agent-usable knowledge. We introduce Executable Code Knowledge (ECK) and define an Executable Code Knowledge Unit (ECKU) as a source-bound object combining stable identity, semantics, executable behavior, contracts, evidence, relations, provenance, validation state, and a query interface. Our Python prototype supports code-local authoring, manifest export, evidence execution, exact changed-line impact, freshness checking, and agent-facing projections. Across three real Python repositories and 26 controlled patch tasks, direct ECK provides executable test coverage for 11/11 evidence-bearing tasks and exact selectors for 9/11; hiding declared evidence reduces exact recovery to 1/11 (paired exact McNemar p=0.0078). ECK-derived rules recover 11/11 exact selectors, showing that rules are effective delivery artifacts while ECK supplies source binding, validation state, impact, and freshness. Exact changed-line impact matches independently authored labels on all 26 patches (12 unit links; precision, recall, and F1 all 1.000). AST-bounded fingerprints classify 50 positive changes and 17 unrelated same-file controls correctly, whereas static rules snapshots detect none of the 50 stale cases. Model-backed patch-review and cross-layer studies measure projection fidelity rather than independent impact discovery. These results support a hybrid architecture: retrieval for coverage, ECK for source and evidence governance, and projections for delivery.
- Abstract(参考訳): AIコーディングエージェントには、ビジネス意味論、検証証拠、関係性、コンテキストが現在あることの保証など、関連するスニペット以上のものが必要です。
既存のシステムは、通常、検索、要約、グラフ、ルール、あるいは逆仕様を通じて、この知識を推論または外部化する。
選択したコードユニットが直接エージェント使用可能な知識を伝達する補完表現について検討する。
我々は、実行可能コード知識(ECK)を導入し、安定したアイデンティティ、セマンティクス、実行可能な振る舞い、契約、エビデンス、関係、証明、検証状態、クエリインターフェースを組み合わせたソースバウンドオブジェクトとして、実行可能コード知識ユニット(ECKU)を定義します。
私たちのPythonプロトタイプは、コードローカルオーサリング、マニフェストエクスポート、エビデンス実行、正確な変更ラインの影響、フレッシュネスチェック、エージェント対応プロジェクションをサポートしています。
3つの実際のPythonリポジトリと26のコントロールされたパッチタスクの中で、ダイレクトECKは11/11のエビデンスを含むタスクと9/11の正確なセレクタに対して実行可能なテストカバレッジを提供する。
ECK由来のルールは11/11正確なセレクタを復元し、ルールが効果的なデリバリアーティファクトであり、ECKはソースバインディング、バリデーション状態、影響、鮮度を提供する。
26のパッチ(12のユニットリンク、正確性、リコール、F1の全1.000)のラベルは独立に登録されている。
AST境界指紋は50のポジティブな変更と17の非関連な同ファイルコントロールを正しく分類する。
モデル支援パッチレビューとクロスレイヤー研究は、独立した衝撃発見よりも射影忠実度を測定する。
これらの結果は、カバレッジの検索、ソースおよびエビデンスガバナンスのECK、デリバリの予測といったハイブリッドアーキテクチャをサポートする。
関連論文リスト
- From Traceability to Justifiability: Accountability Structures in Agentic Software Engineering [0.0]
公開資料のみから、AIレコードがクレームを表現できるかどうか、宣言された場所を保持できるかどうかを測定する。
188個の二重グレード細胞で、デフォルトレコードが行動システムのコンテンツアイデンティティを出力するプラットフォームは見つからなかった。
計器は、パイプラインが発行した排気のみからの保証深度を計算し、宣言された深さと比較する。
論文 参考訳(メタデータ) (2026-08-21T16:45:00Z) - SpecPath: Testing Coding Agents Across Contract-Equivalent Specification Histories [13.437222222971272]
仕様パスの感度は、最終的な意味において等価な要求履歴が同一のエージェントシステムに振る舞いの異なるプログラムを作成させる障害モードである。
本稿では,契約に至るリビジョンパスのみを変更しつつ,リポジトリ,最終契約,検証,エージェントシステム,実行予算を保持する診断評価であるSpecPathを紹介する。
論文 参考訳(メタデータ) (2026-08-10T16:19:00Z) - PhyAgentOS: A Self-Evolving Operating System for Embodied Agents with Decoupled Cognitive Planning and Physical Execution [49.776611937968]
我々は、スケジューリング、検証、メモリ、ベンチマーク、安全性をシステムレベルのサービスとして提供するPhyAgentOSを紹介します。
セッション中心のセッションは、スケジューリング、互換性、監督された実行、エビデンス収集、受け入れの最小単位として、アクションではなくセッションを扱う。
SessionVerifierは、実行終了とセマンティックタスク完了を、成功、失敗、または再計画のエビデンスに基づいて判断する。
ベンチマークはデプロイメントセッションと検証パスを再利用するので、結果は実際の実行に遡る。
論文 参考訳(メタデータ) (2026-07-18T04:46:53Z) - Fantastic Adaptive Taxonomies and How to Use Them [100.20614173157708]
AdaMASTは、実行トレースをコンパクトでエビデンスに基づく障害分類に変換する。
コードには手書きのコードはなく、人間による注釈もない。
エージェント・システム・サーチでは、失敗候補の分類コード診断が自由形式より優れている。
論文 参考訳(メタデータ) (2026-07-17T17:41:16Z) - Tactile: Giving Computer-Using Agents Hands and Feet [9.655595397922488]
私たちはTactileというオープンソースのツールレイヤを紹介します。
Tactileは異種UIエビデンスに適応したオペレーティングシステムアクセシビリティセマンティクス、OCRテキスト、ビジュアルフォールバックリージョンを、アクショングラウンドのインターフェース状態に変換する。
エージェントは、利用可能な時にネイティブなセマンティックアクションを好むオブザーブ・グラウンド・アクト・バリデーション・ループを介して動作し、可視テキストが最良の証拠であるときにOCRのグラウンドド座標にフォールバックし、リプレイと失敗帰属の完全な証明を保持する。
論文 参考訳(メタデータ) (2026-07-16T00:35:25Z) - ContextNest: Verifiable Context Governance for Autonomous AI Agent [0.0]
我々は、管理されたAI消費可能な知識Vaultのためのオープン仕様と参照実装であるContextNestを提示する。
検索の下にあるガバナンス層を提供し、どのアーティファクトが承認され、現在、帰属可能で、整合性が検証されているかを判断する。
2つの制御実験による実験結果について報告する。
論文 参考訳(メタデータ) (2026-07-02T12:51:38Z) - Diagnosing Evidence Utilization in Long-Context and Retrieval-Augmented Language Models under Matched Evidence Conditions [0.0]
モデルはパラメトリックの先行情報から回答したり、存在する証拠を使わなかったり、関連するテキストを最終回答に変換することなく引用したりすることができる。
本稿では,エビデンス利用評価のための4条件診断プロトコルを提案する。
論文 参考訳(メタデータ) (2026-06-04T22:44:57Z) - From Attack Simulation to SIEM Rule: Deterministic Detection-as-Code Synthesis with Probe-Level Traceability [51.56484100374058]
セキュリティチームは、自身のシステムに対する攻撃をシミュレートして、監視が真の侵入者を捕まえるかどうかをチェックする。
人間はそのギャップを手でブリッジし、それぞれの発見を読み、対応するシグマルールを書きます。
ロックされたコーパスからプローブが引き出されると,この変換が部分的に自動化されることを示す。
論文 参考訳(メタデータ) (2026-06-03T14:26:25Z) - COLLEAGUE.SKILL: Automated AI Skill Generation via Expert Knowledge Distillation [58.84646485020439]
人為的なAIスキルを生成するための自動トレース・ツー・スキル蒸留システムを提案する。
COLLEAGUE.SKILLは、実践、メンタルモデル、意思決定のための能力トラックと、コミュニケーションスタイル、インタラクションルール、修正履歴のための有界な行動トラックの2つのトラックを持つバージョン付きのスキルパッケージを生成する。
論文 参考訳(メタデータ) (2026-05-29T12:59:08Z) - Beyond Code Reasoning: Specification-Anchored Auditing of Multi-Implementation Distributed Protocols [1.5229705287183657]
SPECAは、明示的で分類されたセキュリティプロパティを自然言語仕様から導き出し、実装間で再利用する監査フレームワークである。
RepoAuditのベンチマークでは、SPECAは100%リコール(F1=0.94)で88.9%の精度に達し、著者が検証した12のバグを地上の真実を超えて表面化している。
Sherlock Fusaka Audit Contest(10のターゲット、366の応募)では、SPECAが専門家が強化した15の脆弱性をすべて回復し、4つの修正確認バグが浮上した。
論文 参考訳(メタデータ) (2026-04-29T09:57:07Z) - Multi-Sourced, Multi-Agent Evidence Retrieval for Fact-Checking [47.47518672198846]
インターネット上に拡散する誤報は、社会と個人の両方に重大な脅威をもたらす。
これまでの方法は、トレーニングデータから学んだ意味的パターンと社会的コンテキスト的パターンに依存していた。
我々は、証拠のコアリソースとして認証されたオープンナレッジグラフを利用するWKGFCを提案する。
論文 参考訳(メタデータ) (2026-02-27T19:29:01Z) - Towards Copyright Protection for Knowledge Bases of Retrieval-augmented Language Models via Reasoning [58.57194301645823]
大規模言語モデル(LLM)は、現実のパーソナライズされたアプリケーションにますます統合されている。
RAGで使用される知識基盤の貴重かつしばしばプロプライエタリな性質は、敵による不正使用のリスクをもたらす。
これらの知識基盤を保護するための透かし技術として一般化できる既存の方法は、一般的に毒やバックドア攻撃を含む。
我々は、無害な」知識基盤の著作権保護の名称を提案する。
論文 参考訳(メタデータ) (2025-02-10T09:15:56Z) - Fact Checking Beyond Training Set [64.88575826304024]
本稿では,レトリバーリーダが,あるドメインのラベル付きデータに基づいてトレーニングし,別のドメインで使用する場合,性能劣化に悩まされることを示す。
本稿では,レトリバー成分を分散シフトに対して頑健にするための逆アルゴリズムを提案する。
次に、これらのデータセットから8つの事実チェックシナリオを構築し、モデルと強力なベースラインモデルのセットを比較します。
論文 参考訳(メタデータ) (2024-03-27T15:15:14Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。