論文の概要: Introducing Consort: A Spec-First Agent Framework for Enforced, Test-Driven Development on Live Database Branches
- arxiv url: http://arxiv.org/abs/2609.09671v1
- Date: Wed, 09 Sep 2026 03:38:38 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-10 19:44:08.88836
- Title: Introducing Consort: A Spec-First Agent Framework for Enforced, Test-Driven Development on Live Database Branches
- Title(参考訳): Consort: ライブデータベースブランチ上での強化されたテスト駆動開発のためのSpec-First Agentフレームワーク
- Abstract要約: 第3に構築された仕様ファーストでテスト駆動のエージェントフレームワークであるConsortを紹介します。
テストとゲートをコードに強制することは、エージェント記述のコードを正直かつ検証しやすくする、と私たちは主張する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: When an agent writes code, the development framework becomes the control system for a non-deterministic worker. Spec-first, agent-driven frameworks have gained rapid traction since 2025; the installable ones, GitHub Spec Kit, obra/superpowers, BMAD, and GSD, and our own, all capture intent through a specification or durable planning artifacts. Since they agree on capturing intent up front, what separates them is how each enforces the engineering discipline that keeps agent-written code clean, correct, and maintainable. Every framework enforces that discipline somehow; they differ in how. We characterize three modes: enforcement by persuasion (prompt discipline the model may ignore), by front-loaded structure (strong specs, then a trusted build), and through controls the agent cannot edit (a deterministic orchestrator, human-approved gates, immutable tests, and a green result that must pass against a live, branched database). We introduce Consort, a spec-first, test-driven agent framework built on the third, enforcing that discipline through controls the agent runs inside but cannot bypass, in which a deterministic orchestrator drives separate role agents through a spec-first design lane and a test-driven build lane on a live database branch. We argue that enforcing the tests and gates in code keeps agent-written code honest and verifiable, while its specialized roles, like the human roles before them, are what make it maintainable, claims we frame as a pre-registered, testable hypothesis.
- Abstract(参考訳): エージェントがコードを書くと、開発フレームワークは非決定論的作業者の制御システムになります。
インストール可能なGitHub Spec Kit、obra/superpowers、BMAD、GSD、私たち独自のフレームワークは、仕様や永続的な計画アーティファクトを通じて意図を捉えています。
彼らはインテントを前もって取得することに合意しているので、それぞれが、エージェント記述されたコードをクリーンに、正しく、メンテナンス可能にするエンジニアリングの規律をどのように強制するかを区別する。
どのフレームワークも何らかの方法でその規律を強制します。
我々は3つのモードを特徴付けている: 説得による強制(モデルが無視する可能性のある訓練)、フロントロードされた構造(強い仕様、そして信頼できるビルド)、エージェントが編集できない制御(決定論的オーケストレータ、人間承認ゲート、不変テスト、および生の分岐データベースに渡さなければならないグリーン結果)である。
このフレームワークでは、決定論的オーケストレータが、仕様ファーストの設計レーンとテスト駆動のビルドレーンを通じて、独立したロールエージェントを駆動する。
テストとゲートをコードに強制することは、エージェントが書いたコードを誠実かつ検証し、その特別な役割は、以前の人間の役割のように、維持可能にするものである、と我々は主張する。
関連論文リスト
- Claude Code Complete User Handbook [0.0]
Claude Codeは、未検証アクセス、シェル実行、ブラウザ制御、スケジュールおよびクラウド実行を備えたループで動作する言語モデルである。
この本は、そのシステムを安全かつ生産的に運用するためのタスク指向の参照である。
論文 参考訳(メタデータ) (2026-08-27T07:32:14Z) - Five Primitives for Governing Autonomous AI Agents at Runtime [0.0]
自律的なAIエージェントの管理は問題であり、モデルアライメントの問題ではない、と私たちは主張する。
行動を起こす前に答えなければならない質問から5つのプリミティブを導き出す。
エージェントのアクションが実行前にポリシーに対して媒介される実装について述べる。
論文 参考訳(メタデータ) (2026-08-27T06:53:11Z) - Tencent WorkBuddy Bench: A Multi-Domain Coding-Agent Benchmark with Contamination-Resistant Task Construction [57.138342889101345]
Tencent WorkBuddy Benchは、コーディングエージェントのためのマルチドメイン評価スイートである。
本報告では, 設計手法, スコアリングプロトコル, クロスモデルリーダーボードについて述べる。
論文 参考訳(メタデータ) (2026-07-23T04:34:06Z) - A hardware-safety-gated system for LLM-written native ARTIQ control code on a trapped-ion platform [18.226528651110133]
大言語モデル(LLM)エージェントは、実験的な制御コードを書き、実行することができる。
チェックされていないコードは装置を損傷させる可能性があり、人間の承認/監督とエージェントの判断の間に正式な操作ごとの境界は存在しない。
本稿では,LLMエージェントを,そのような境界を保ちながらトラップイオン実験のループに配置する制御システムを提案する。
論文 参考訳(メタデータ) (2026-06-25T16:19:23Z) - ClayBuddy: A Framework, Evaluation, & Mitigation of Coding Agent Failures [1.0742675209112622]
障害モードは、不特定性、能力エラー、エージェントハーネスエラーの3つのメカニズムから派生したものとして研究する。
我々はClayBuddyを提案する。ClayBuddyはユーザの好みを形作るハーネスで、モデルのインセッションで修正してこれらのエラーを軽減できる。
論文 参考訳(メタデータ) (2026-06-13T18:29:53Z) - Agents All the Way Down; A Methodology for Building Custom AI Agents from Substrate to Production [1.0499611180329804]
片端から端まで構築する方法を定めているプラクティスは公開されていない。
この記事では、プラクティスを方法論としてAgens All the Way Downを書きます。
オープンソースのLAMBプラットフォームのカスタムエージェントであるAACから蒸留された。
論文 参考訳(メタデータ) (2026-06-10T09:44:54Z) - The Meta-Agent Challenge: Are Current Agents Capable of Autonomous Agent Development? [80.24951682268332]
本稿では,自律エージェント開発のためのフロンティアモデルのキャパシティをテストするための評価フレームワークであるMeta-Agent Challenge(MAC)を紹介する。
評価の整合性を確保するため、このフレームワークは報奨ハッキングに対する多層防御によって確保される。
メタエージェントは人間工学的な基本方針とほとんど一致せず、その一部はプロプライエタリなフロンティアモデルに支配されている。
論文 参考訳(メタデータ) (2026-06-03T04:58:17Z) - Code as Agent Harness [107.31925305395957]
新興のエージェントシステムでは、コードはもはや単なる目標出力ではない。
コードはエージェントの推論、行動、環境モデリング、実行ベースの検証のための運用上の基盤としてますます役立っている。
この調査は、実行可能、検証可能、ステートフルなAIエージェントシステムに向けた統一されたロードマップを提供する。
論文 参考訳(メタデータ) (2026-05-18T17:59:03Z) - How to Interpret Agent Behavior [56.59836196946289]
本稿では,エージェントの動作を実行時に記述・解析するための分類法であるACT*ONOMYを紹介する。
共用語彙を提供することで、ACT*ONOMYは研究者、エージェントデザイナー、エンドユーザーがエージェントの振る舞いをより一貫して解釈するのに役立つ。
論文 参考訳(メタデータ) (2026-05-13T14:52:40Z) - Reflection-Driven Control for Trustworthy Code Agents [6.312627213469401]
本稿では,汎用エージェントアーキテクチャにシームレスに統合可能なプラグイン可能な制御モジュールであるReflection-Driven Controlを紹介する。
反射駆動制御は、ポストホックパッチからエージェント自身の推論プロセスにおける明示的なステップに"自己回帰"を上昇させる。
我々は、リフレクション駆動制御が生成されたコードのセキュリティとポリシーのコンプライアンスを大幅に改善することを示します。
論文 参考訳(メタデータ) (2025-12-22T00:27:38Z) - DRIFT: Dynamic Rule-Based Defense with Injection Isolation for Securing LLM Agents [52.92354372596197]
大規模言語モデル(LLM)は、強力な推論と計画能力のため、エージェントシステムの中心となってきています。
この相互作用は、外部ソースからの悪意のある入力がエージェントの振る舞いを誤解させる可能性がある、インジェクション攻撃のリスクも引き起こす。
本稿では,信頼に値するエージェントシステムのための動的ルールベースの分離フレームワークを提案する。
論文 参考訳(メタデータ) (2025-06-13T05:01:09Z) - AgentKit: Structured LLM Reasoning with Dynamic Graphs [91.09525140733987]
多機能エージェントのための直感的なLCMプロンプトフレームワーク(AgentKit)を提案する。
AgentKitは、単純な自然言語プロンプトから複雑な"思考プロセス"を明示的に構築するための統一されたフレームワークを提供する。
論文 参考訳(メタデータ) (2024-04-17T15:40:45Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。