論文の概要: Rebuild Dossier: Mechanically-Enforced Specs for Agentic App Rebuilds, and What Model-Tier Failures Reveal
- arxiv url: http://arxiv.org/abs/2608.23616v1
- Date: Sat, 22 Aug 2026 01:26:56 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-26 14:09:34.408352
- Title: Rebuild Dossier: Mechanically-Enforced Specs for Agentic App Rebuilds, and What Model-Tier Failures Reveal
- Title(参考訳): Rebuild Dossier: エージェントアプリケーションのリビルドのための機械的に強化された仕様とモデル階層の失敗
- Abstract要約: restruct-dossierは、コードを記述する前にアプリケーションの実際のインターフェースをロックするオープンソースツールである。
自動チェックによるワンテスト・アズ・ア・タイムのビルドを強制する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: An AI agent's rebuild is only as good as the process that produced it. Prior work found that once a model is strong enough, a multi-agent rebuild pipeline loses to the simplest approach: giving the model the original code and one instruction (AgentModernize). We present rebuild-dossier, an open-source tool that locks an application's real interface - its exact inputs and outputs - before any code is written, then enforces one-test-at-a-time building through automated checks, not written instructions alone. Three results shape this evaluation, with differing amounts of evidence. First, in a small comparison, the compliant agent failed a held-back test while the rule-breaking agent passed everything - proof that a passing suite doesn't certify correctness when tests can be gamed. Second, we tested whether this beats simply giving the weaker model the source and one instruction: tied on a small app, but lost outright on a larger one where the automated check wasn't even running - pointing to the check mechanism, not interface-locking, which held up separately. Third, every claim here is checked at three levels - the agent's own report, an automated log, and the actual files produced - catching real errors, including a bug in our own logging code, that a single level would have missed. These risks reproduce on a different model and toolchain: a stronger model followed our process three times running, something the weaker model never managed. The tool is public, MIT licensed, and reproduces end to end against our own applications.
- Abstract(参考訳): AIエージェントの再構築は、それを生成したプロセスに匹敵するものです。
以前の作業では、モデルが十分に強力になると、マルチエージェントの再構築パイプラインは、モデルにオリジナルのコードと1つの命令(AgentModernize)を与えるという、最も単純なアプローチに負けることがわかった。
コードを記述する前にアプリケーションの実際のインターフェース – 正確なインプットとアウトプット – をロックするオープンソースツールであるrestruct-dossierを紹介します。
3つの結果は、異なる量の証拠でこの評価を形作っている。
まず、小さな比較では、準拠するエージェントがホールドバックテストに失敗し、ルール破りのエージェントがすべてをパスした。
第2に、これが単にソースと1つのインストラクションを弱いモデルに与えているかどうかをテストしました。小さなアプリに縛られているが、自動化されたチェックが実行されていなくても、個別に保持されるインターフェースロックではなく、チェックメカニズムを指し示して、より大きなアプリケーションで完全に失われました。
第3に、ここでのすべてのクレームは、エージェント自身のレポート、自動ログ、実際のファイル生成の3つのレベルでチェックされます。
これらのリスクは、異なるモデルとツールチェーンで再現されます。
このツールは公開されており、MITライセンスで、私たちのアプリケーションに対してエンド・ツー・エンドを再現する。
関連論文リスト
- Tencent WorkBuddy Bench: A Multi-Domain Coding-Agent Benchmark with Contamination-Resistant Task Construction [57.138342889101345]
Tencent WorkBuddy Benchは、コーディングエージェントのためのマルチドメイン評価スイートである。
本報告では, 設計手法, スコアリングプロトコル, クロスモデルリーダーボードについて述べる。
論文 参考訳(メタデータ) (2026-07-23T04:34:06Z) - Setup Complete, Now You Are Compromised: Weaponizing Setup Instructions Against AI Coding Agents [0.0]
コーディングエージェントは、ドキュメントを読み、そのリストにある依存関係をインストールすることで、名前やソース、既知の脆弱性を検証せずに、プロジェクトをセットアップする。
本報告では,通常のプロジェクト・セットアップ・ドキュメンテーションを通じて,パッケージインストール時サプライチェーン攻撃のシステマティック評価を行う。
エージェントは発泡性菌を確実に捕食するが、可塑性セパレータ・コンフュージョン(英語版)の名称が散りばめられ、ハーネスモデル・ペアリングに依存する頻度が高い。
論文 参考訳(メタデータ) (2026-07-16T15:47:19Z) - From Prompts to Contracts: Harness Engineering for Auditable Enterprise LLM Agents [0.24554686192257424]
製品化は、ソースバウンダリ、エンティティルーティング、回答コントラクト、再現可能なトレースの要件を追加します。
本稿では,このパターンをトレース可能な監査可能なLLMエージェントアーキテクチャに再構成するハーネスエンジニアリング手法を提案する。
韓国の5つの企業グループの公開データスライスでインスタンス化し、3つの研究課題を評価する。
論文 参考訳(メタデータ) (2026-07-09T01:08:33Z) - Can Code Specify a System Precisely Enough to Formally Verify It? [0.0]
本報告では,業務用レストラン・ポイント・オブ・セールシステムの支払ワークフローを実運用ソフトウェアで評価する。
コアプロトコルは、正確に定義された障害モデルの下で手作りのラインアクティベートされたモデルに対して正しい。
生産用サンドボックスの1つのプローブは、全リカバリはしごを到達不能にする応答形状のばらつきを露呈した。
論文 参考訳(メタデータ) (2026-07-06T13:39:00Z) - PairCoder++: Pair Programming as a Universal Paradigm for Verified Code-Driven Multimodal and Structured-Artifact Generation [51.92442051257354]
PairCoderは、実行のみではなく、完全な公式メトリックスイート上で、アーティファクトが検証可能なすべてのベンチマークを本質的に改善する。
TikZのコンパイルレートは、各モデルで10から30ポイント、シングルモデルの2.9から9.2倍である。
論文 参考訳(メタデータ) (2026-07-02T08:36:02Z) - ClayBuddy: A Framework, Evaluation, & Mitigation of Coding Agent Failures [1.0742675209112622]
障害モードは、不特定性、能力エラー、エージェントハーネスエラーの3つのメカニズムから派生したものとして研究する。
我々はClayBuddyを提案する。ClayBuddyはユーザの好みを形作るハーネスで、モデルのインセッションで修正してこれらのエラーを軽減できる。
論文 参考訳(メタデータ) (2026-06-13T18:29:53Z) - Where Do Deep-Research Agents Go Wrong? Span-Level Error Localization in Agent Trajectories [51.22051230894794]
最終回答に基づく評価は、エージェントが成功するかどうかを示すが、どの部分の軌道が答えを信頼できないかを示すものではない。
2つのエージェントフレームワーク、3つのバックボーンモデル、3つのベンチマークから2,790の実際のトラジェクトリを収集し、生ログをセマンティックスパンに変換し、エキスパートレビューを通じて有害なエラースパンを注釈付けします。
我々は,エージェントの主張を追跡するクレーム中心の監査フレームワークであるDRIFTを提案する。
論文 参考訳(メタデータ) (2026-06-01T10:50:26Z) - ClawForge: Generating Executable Interactive Benchmarks for Command-Line Agents [59.626170560327274]
textbfClawForgeは、ステートコンフリクト下で実行可能なコマンドラインカテゴリのためのジェネレータベースのベンチマークフレームワークである。
私たちはこのフレームワークをClawForge-Bench(17のシナリオ、6の能力カテゴリ)としてインスタンス化します。
論文 参考訳(メタデータ) (2026-05-13T21:34:08Z) - ProgramBench: Can Language Models Rebuild Programs From Scratch? [59.40748183470308]
ProgramBenchは、ソフトウェアエンジニアリングエージェントがソフトウェアをホリシックに開発する能力を測定する。
エンドツーエンドの動作テストはエージェント駆動ファジィによって生成される。
モデルは、人間が書いたコードと大きく異なるモノリシックでシングルファイルの実装を好む。
論文 参考訳(メタデータ) (2026-05-05T09:17:02Z) - RewardHackingAgents: Benchmarking Evaluation Integrity for LLM ML-Engineering Agents [0.9821874476902969]
LLMエージェントは、単一のスカラーテストメトリクスで成功を判断するエンドツーエンドのMLエンジニアリングタスクをますます実行します。
エージェントは、モデルを改善するのではなく、評価パイプラインを妥協することで、報告されたスコアを増やすことができる。
ワークスペースベースのベンチマークであるRewardHackingAgentsを導入する。
論文 参考訳(メタデータ) (2026-03-11T22:06:44Z) - Where LLM Agents Fail and How They can Learn From Failures [62.196870049524364]
大規模言語モデル(LLM)エージェントは、複雑なマルチステップタスクの解決において有望であることを示す。
単一ルート原因エラーがその後の決定を通じて伝播する、障害のカスケードに対する脆弱性を増幅する。
現在のシステムは、モジュール的で体系的な方法でエージェントエラーを包括的に理解できるフレームワークを欠いている。
AgentErrorTaxonomyは、メモリ、リフレクション、計画、アクション、システムレベルの操作にまたがる障害モードのモジュール分類である。
論文 参考訳(メタデータ) (2025-09-29T18:20:27Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。