論文の概要: Nidus: Externalized Reasoning for AI-Assisted Engineering
- arxiv url: http://arxiv.org/abs/2604.05080v1
- Date: Mon, 06 Apr 2026 18:32:09 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-08 17:42:09.440722
- Title: Nidus: Externalized Reasoning for AI-Assisted Engineering
- Title(参考訳): Nidus: AIアシストエンジニアリングのための外部推論
- Abstract要約: 我々は、AI支援ソフトウェアデリバリのVモデルを機械化するガバナンスランタイムであるNidusを紹介する。
LLMの3つの家族は、すべてのコミットに関する現在の義務に対して検証された証明義務の下で10万行のシステムを提供した。
Nidusは、エンジニアリング方法論を永続性の前にすべての突然変異で検証された決定可能なアーティファクトに外部化する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: We present Nidus, a governance runtime that mechanizes the V-model for AI-assisted software delivery. In the self-hosting deployment, three LLM families (Claude, Gemini, Codex) delivered a 100,000-line system under proof obligations verified against the current obligation set on every commit. The system governed its own construction. Engineering invariants - traced requirements, justified architecture, evidenced deliveries - cannot be reliably maintained as learned behavior; assurance requires enforcement by a mechanism external to the proposer. Nidus externalizes the engineering methodology into a decidable artifact verified on every mutation before persistence. Organizational standards compile into guidebooks - constraint libraries imported by governed projects and enforced by decidable evaluation. Four contributions: (1) recursive self-governance - the constraint surface constrains mutations to itself; (2) stigmergic coordination - friction from the surface routes agents without central control; (3) proximal spec reinforcement - the living artifact externalizes the engineering context that RL and long-chain reasoning try to internalize; the specification is the reward function, UNSAT verdicts shape behavior at inference time, no weight updates; (4) governance theater prevention - compliance evidence cannot be fabricated within the modeled mutation path. The constraint surface compounds: each obligation permanently eliminates a class of unengineered output. The artifact's development history is a formal development - every state satisfies all active obligations, and the obligation set grows monotonically.
- Abstract(参考訳): 我々は、AI支援ソフトウェアデリバリのVモデルを機械化するガバナンスランタイムであるNidusを紹介する。
セルフホストデプロイメントでは、3つのLLMファミリー(Claude, Gemini, Codex)が、すべてのコミットに関する現在の義務に対して検証された証明義務の下で10,000行のシステムを提供した。
システムは独自の建設を統制した。
エンジニアリング不変性 - トレースされた要件、正当化されたアーキテクチャ、証明された納品 - は、学習された振る舞いとして確実に維持できない。
Nidusは、エンジニアリング方法論を永続性の前にすべての突然変異で検証された決定可能なアーティファクトに外部化する。
組織標準はガイドブックにコンパイルされる - 管理されたプロジェクトによってインポートされ、決定可能な評価によって強制される制約ライブラリ。
4つのコントリビューション:(1)再帰的自己支配 - 制約面は突然変異をそれ自体に制約する (2) 安定的協調 - 中心制御のない表面経路エージェントからの摩擦 (3) 近位仕様強化 - 生きたアーティファクトはRLと長鎖推論が内部化しようとするエンジニアリングコンテキストを外部化する 仕様は報酬関数であり、UNSATは推論時の形状の挙動を予測し、重量の更新はない (4) ガバナンス・ストアの予防 - コンプライアンス・エビデンスをモデル化された突然変異経路内で作成することはできない。
制約表面の化合物: 各義務は永久に非工学的な出力のクラスを除去する。
全ての州が全ての積極的義務を満足しており、義務セットは単調に成長する。
関連論文リスト
- ModularRSI: Modular and Generalizable Recursive Harness Self-Improvement [46.36989489677189]
我々は、一般化可能なハーネス進化のための、ベンチマーク非結合、コントラストおよびモジュラーフレームワークを提案する。
ModularRSIは、同じタスクに対する成功と失敗の軌跡を対比し、繰り返し発生する行動障害を特定するために、タスク全体で証拠を集約する。
進化可能なハーネスを,エージェントループ,ツール使用,監視管理,コンテキスト管理,タスク補完検出という,5つの機能モジュールに分解する。
論文 参考訳(メタデータ) (2026-09-14T00:10:45Z) - Reality Is the Final Verifier: On Two Key Gaps in Agentic Software Engineering [78.51705689800838]
本稿では, 要求, モデル, 評価器の見直しに, 展開証拠を用いた保証・修正ループを提案する。
そこで我々は,人的判断,エージェント能力,計算能力に対する資源配分問題としてエージェント開発を保証した。
論文 参考訳(メタデータ) (2026-09-10T17:58:48Z) - Model-Based Agentic Software Engineering [6.7121681028919475]
コーディングエージェントは、プロジェクトの意図、システム構造、あるいは受け入れ証拠を明確化せずに、実装能力を高める。
モデルベースエージェントソフトウェア工学(MAGE)について紹介する。
MAGEは、コモディティインテリジェンスから信頼できる自律性を構築するためのフレームワークであり、理論である。
論文 参考訳(メタデータ) (2026-08-25T21:43:16Z) - Agent Gym: A Framework for Continuous Evaluation and Evolution of LLM Agents Through Human-in-the-Loop Feedback [0.0]
大きな言語モデル(LLM)エージェントは、基本的な緊張に直面します。エージェントの動作は、デプロイ時に凍結されますが、処理するビジネスルールとエッジケースは、進化し続けます。
既存のアプローチではエージェント構築とワンタイム評価を行うが、継続的デプロイ後の動作補正のための構造的メカニズムは提供しない。
我々はAgent Gymを紹介した。Agent Gymはモジュール型のドメインに依存しないフレームワークで、既存のLLMベースのエージェントを連続的な評価と進化のループでラップする。
論文 参考訳(メタデータ) (2026-08-16T07:27:26Z) - Specification-Driven Development as the Foundation of AI-Native Enterprise Software Engineering [0.0]
大規模言語モデル(LLM)とエージェントAIは、ソフトウェアエンジニアリングを手作業によるコーディングからインテント仕様、アーキテクチャ、ガバナンスへとシフトさせています。
バイブコーディング(vibe coding)と、観察された振る舞いを通じてAIアーティファクトを受け入れる直観駆動アプローチ(intuition-driven approach)と、構造化仕様を真理の信頼できる情報源として使用する仕様駆動開発(Specification-Driven Development, SDD)の2つのパラダイムが登場した。
この記事では、3つのコントリビューションを行います。まず最初に、生産性-信頼性パラドックス、限られたコンテキストからのアーキテクチャ侵食、セキュリティ露出、技術的負債といった、過度な会話生成の失敗モードを特定します。
第2に、正式な仕様ガバナンス参照モデル(SGRM)を導入する。
論文 参考訳(メタデータ) (2026-07-18T07:27:02Z) - VASO: Formally Verifiable Self-Evolving Skills for Physical AI Agents [57.240036084348354]
本稿では,ロボットスキルコントラクトの検証誘導自己進化のためのフレームワークであるVASOを紹介する。
VASOは論理的に一貫性のないスキル契約を検証し、グローバルおよびローカルな時間的仕様に対してスキルによって誘発される計画を検証する。
Clearpath Jackal と PX4 のクアッドコプタータスクでは、VASO は100点未満の最適化サンプルを使用して97.2% の形式的な仕様準拠に達した。
論文 参考訳(メタデータ) (2026-06-03T20:02:35Z) - Agentic Harness Engineering: Observability-Driven Automatic Evolution of Coding-Agent Harnesses [57.20181537213498]
Agentic Harness Engineering (AHE)は、ハーネスエンジニアリングを自動化するクローズドループである。
AHEは3つの一致した可観測性柱を通じて課題に対処する。
10 AHE lift pass@1 on Terminal-Bench 2 from 69.7% to 77.0%。
SWE-bench-verifiedでは、種子よりも12%少ないトークンで合計成功率を上回り、ターミナルベンチ2では+5.1から+10.1ppのクロスファミリーゲインを得る。
論文 参考訳(メタデータ) (2026-04-28T16:55:02Z) - Harness as an Asset: Enforcing Determinism via the Convergent AI Agent Framework (CAAF) [0.0]
大規模言語モデルは、安全クリティカルエンジニアリングにおける制御可能性のギャップを生み出します。
本稿では,エージェントをオープンループ生成からクローズループフェールセーフ決定性に移行するConvergent AI Agent Framework(CAAF)を紹介する。
CAAFの3つの柱は相補的な故障面に対処し、コモディティコストで制御可能性ギャップを閉じることはない。
論文 参考訳(メタデータ) (2026-04-18T15:15:09Z) - Agency and Architectural Limits: Why Optimization-Based Systems Cannot Be Norm-Responsive [0.0]
AIシステムは、標準によって管理されるという前提の下で、ハイステークな状況にますますデプロイされている。
本稿では,最適化システムに対して仮定が正式に無効であることを示す。
論文 参考訳(メタデータ) (2026-02-26T17:16:17Z) - Agile V: A Compliance-Ready Framework for AI-Augmented Engineering -- From Concept to Audit-Ready Delivery [0.0]
現在のAI支援エンジニアリングには、タスクレベルの検証と、マシンスピードデリバリ時の規制トレーサビリティを維持するための、組み込みメカニズムが欠如している。
アジャイルVは、独立した検証と監査成果物の生成を各タスクサイクルに組み込むことで、このギャップに対処します。
我々は, (H1) 監査可能なアーティファクトが開発副産物として出現し, (H2) 100%要件レベルの検証が独立したテスト生成で達成可能であり, (H3) 検証されたインクリメントは, サイクル毎に1桁のヒューマンインタラクションで提供できる,という3つの仮説を評価した。
論文 参考訳(メタデータ) (2026-02-24T08:41:05Z) - Trustworthy AI Posture (TAIP): A Framework for Continuous AI Assurance of Agentic Systems at Horizontal and Vertical scale [1.0896567381206714]
ポイント・イン・タイムの文書ベースの監査では、決定論的でない振る舞いには対応できない。
垂直的には、ガバナンスとコントロールの義務は、フレームワークが運用できるものよりも速く変化します。
リスクベースの規制は、現在進行中のコントロールの妥当性と効果を示す必要がある。
本稿では,信頼度を静的証明書ではなく,連続的に発生する信号として再設定する。
論文 参考訳(メタデータ) (2026-02-15T10:49:47Z) - Trustworthy Agentic AI Requires Deterministic Architectural Boundaries [2.378211191937908]
現在のエージェントAIアーキテクチャは、高度な科学領域のセキュリティと要求と根本的に相容れない。
3つのメカニズムを通じてセキュリティを強制するトリニティ・ディフェンス・アーキテクチャを導入する。
疑わしい証明と決定論的調停がなければ、Lethal Trifecta'(信頼できない入力、特権データアクセス、外部アクション能力)は、認証セキュリティをエクスプロイト発見の問題にします。
論文 参考訳(メタデータ) (2026-02-10T16:33:40Z) - Steering Externalities: Benign Activation Steering Unintentionally Increases Jailbreak Risk for Large Language Models [62.16655896700062]
活性化ステアリングは大規模言語モデル(LLM)の有用性を高める技術である
重要かつ過度に調査された安全リスクを無意識に導入することを示します。
実験によると、これらの介入は強制乗算器として機能し、ジェイルブレイクに新たな脆弱性を発生させ、標準ベンチマークで攻撃成功率を80%以上向上させる。
論文 参考訳(メタデータ) (2026-02-03T12:32:35Z) - From Completion to Editing: Unlocking Context-Aware Code Infilling via Search-and-Replace Instruction Tuning [81.97788535387286]
本稿では,エージェントによる検証・編集機構を統一された単一パス推論プロセスに内部化するフレームワークを提案する。
最小限のデータで、SRI-Coderは、ChatモデルがBaseモデルの完了性能を上回ることができる。
FIMスタイルのチューニングとは異なり、SRIは一般的なコーディング能力を保持し、標準のFIMに匹敵する推論遅延を維持する。
論文 参考訳(メタデータ) (2026-01-19T20:33:53Z) - Making LLMs Reliable When It Matters Most: A Five-Layer Architecture for High-Stakes Decisions [51.56484100374058]
現在の大規模言語モデル(LLM)は、実行前にアウトプットをチェックできるが、不確実な結果を伴う高い戦略決定には信頼性が低い検証可能な領域で優れている。
このギャップは、人間と人工知能(AI)システムの相互認知バイアスによって引き起こされ、そのセクターにおける評価と投資の持続可能性の保証を脅かす。
本報告では、7つのフロンティアグレードLDMと3つの市場向けベンチャーヴィグネットの時間的圧力下での系統的質的評価から生まれた枠組みについて述べる。
論文 参考訳(メタデータ) (2025-11-10T22:24:21Z) - Subject-Event Ontology Without Global Time: Foundations and Execution Semantics [51.56484100374058]
形式化は9つの公理(A1-A9)を含み、実行可能性の正しさを保証する:履歴の単調性(I1)、因果性の非巡回性(I2)、トレーサビリティ(I3)である。
フォーマル化は、分散システム、マイクロサービスアーキテクチャ、DLTプラットフォーム、およびマルチパースペクティビティシナリオ(異なる主題から事実を分解する)に適用できる。
モデルに基づくアプローチ(A9): スキーマによるイベント検証、アクター認可、グローバル時間なしで因果連鎖の自動構築(W3)。
論文 参考訳(メタデータ) (2025-10-20T19:26:44Z) - Beyond 'Aha!': Toward Systematic Meta-Abilities Alignment in Large Reasoning Models [86.88657425848547]
大型推論モデル(LRMs)はすでに長い連鎖推論のための潜在能力を持っている。
我々は、自動生成の自己検証タスクを使用して、モデルに推論、帰納、誘拐の3つのメタ能力を持たせることを明確にした。
我々の3つのステージ・パイプラインの個別アライメント、パラメータ空間のマージ、ドメイン固有の強化学習は、命令調整ベースラインと比較して10%以上のパフォーマンス向上を実現します。
論文 参考訳(メタデータ) (2025-05-15T17:58:33Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。