Fugu-MT 論文翻訳(概要): Beyond Correctness: Enhancing Architectural Reasoning in Code LLMs via Scalable Labeling with Agentic Judgment

論文の概要: Beyond Correctness: Enhancing Architectural Reasoning in Code LLMs via Scalable Labeling with Agentic Judgment

arxiv url: http://arxiv.org/abs/2606.14948v1
Date: Fri, 12 Jun 2026 20:46:04 GMT
ステータス: 翻訳完了
システム内更新日: 2026-06-16 16:21:32.471321
Title: Beyond Correctness: Enhancing Architectural Reasoning in Code LLMs via Scalable Labeling with Agentic Judgment
Title（参考訳）: 正確性を超えて - エージェント判断によるスケーラブルなラベル付けによるコードLLMにおけるアーキテクチャ推論の強化
Authors: Kirill Vasilevski, Ximing Dong, Benjamin Rombaut, Ruochen Deng, Jiahuei Lin, Arthur Leung, Dayi Lin, Boyuan Chen, Shaowei Wang, Ahmed E. Hassan,
Abstract要約: 3360個のキュレートされたインスタンス上での微調整Qwen3-8B/14B/32Bは、SWEベンチ検証で最大27.2%の解決率を達成する。トレーニングされたモデルは、強い言語間の一般化と、アーキテクチャパッチの品質の一貫した改善を実現する。
参考スコア（独自算出の注目度）: 12.139708726797272
License: http://creativecommons.org/licenses/by-nc-nd/4.0/
Abstract: LLMs have substantially improved software engineering yet real-world development requires architectural understanding. Such understanding is prohibitively expensive to label manually and impossible to verify through tests alone. We propose an agentic judging pipeline using a strong LLM as a scalable proxy for expert architectural evaluation, comprising two judges: the Architecture Complexity Judge (ACJ), which estimates codebase-specific architectural understanding a task demands, and the Architecture Quality Judge (AQJ), which evaluates patch conformance to repository-specific architectural conventions via source-grounded rubrics. Fine-tuning Qwen3-8B/14B/32B on 3,360 curated instances achieves resolved rates of up to 27.2% on SWE-bench Verified - up to 540% over the base model and 256% over unfiltered fine-tuning. Meanwhile, the trained models achieve strong cross-language generalization and consistent improvements in architectural patch quality.
Abstract（参考訳）: LLMはソフトウェアエンジニアリングを大幅に改善しているが、実際の開発にはアーキテクチャの理解が必要である。このような理解は、手動でラベル付けすることは違法に高価であり、テストだけで検証することは不可能である。本稿では,強力なLCMを高度なアーキテクチャ評価のためのスケーラブルなプロキシとして,コードベース固有のアーキテクチャ理解をタスク要求として推定するアーキテクチャ複雑性判断器 (ACJ) と,ソースグラウンドドルーブリックによるリポジトリ固有のアーキテクチャ慣行へのパッチ適合性を評価するアーキテクチャ品質判断器 (AQJ) の2つの判断器を提案する。 3360のキュレートされたインスタンス上の微細チューニングQwen3-8B/14B/32Bは、SWE-bench Verifiedで最大27.2%の解決率を達成する。一方、トレーニングされたモデルは、強い言語間の一般化と、アーキテクチャパッチの品質の一貫した改善を実現している。

関連論文リスト

Bridging Requirements and Architecture: Multi-Agent Orchestration with External Knowledge and Hierarchical Memory [37.071260774880884]
我々は,4つの専門エージェントを編成し,アーキテクチャのブループリントを属性とする知識駆動型フレームワークであるMAAD(Multi-Agent Architecture Design)を提案する。我々はMAADがベースラインよりも完全でモジュラーでトレーサブルなアーキテクチャを生成することを示し、その専用評価エージェントは構造化された品質評価レポートを自律的に作成する。
論文参考訳（メタデータ） (2026-05-31T18:18:31Z)
LLM-based Automated Architecture View Generation: Where Are We Now? [0.0]
ソースコードからアーキテクチャビューを生成するLLMとエージェントアプローチの能力を評価する。ゼロショットのプロンプトはゼロショットのベースラインに比べて、クリアリティの失敗を9.2%削減する。カスタムエージェントアプローチは、汎用エージェントよりも一貫して優れています。
論文参考訳（メタデータ） (2026-03-22T11:41:37Z)
Architecture-Aware Multi-Design Generation for Repository-Level Feature Addition [53.50448142467294]
RAIMは、リポジトリレベルの機能追加のための、多設計およびアーキテクチャ対応のフレームワークである。複数の多様な実装設計を生成することで、線形パッチから切り離される。 NoCode-bench Verifiedデータセットの実験では、RAIMが新しい最先端のパフォーマンスを確立することが示されている。
論文参考訳（メタデータ） (2026-03-02T12:50:40Z)
ProjDevBench: Benchmarking AI Coding Agents on End-to-End Project Development [49.63491095660809]
ProjDevBenchはエンドツーエンドのベンチマークで、コーディングエージェントにプロジェクト要件を提供し、その結果のリポジトリを評価する。概念指向タスクと実世界のアプリケーションシナリオの両方をカバーし、8つのカテゴリにまたがる20のプログラミング問題をキュレートします。エージェントは基本的な機能を扱うが、複雑なシステム設計、時間最適化、リソース管理に苦労する。
論文参考訳（メタデータ） (2026-02-02T05:17:23Z)
Reliability by design: quantifying and eliminating fabrication risk in LLMs. From generative to consultative AI: a comparative analysis in the legal domain and lessons for high-stakes knowledge bases [0.0]
本稿では,幻覚を減らし,大規模言語モデルを高額な法的作業に信頼性を持たせる方法について検討する。 1)独立した生成モデル(創造的オラクル)、(2)基本的な検索強化システム(専門的アーキビスト)、(3)高度なエンドツーエンド最適化RAGシステム(厳密なアーキビスト)の3つのAIパラダイムを区別する。
論文参考訳（メタデータ） (2026-01-21T21:26:42Z)
QuArch: A Benchmark for Evaluating LLM Reasoning in Computer Architecture [36.842856470579726]
QuArchは、コンピュータアーキテクチャにおける大規模言語モデル(LLM)機能の開発と評価を容易にするために設計された最初のベンチマークである。評価の結果,フロンティアモデルはドメイン固有の知識を持っているが,高次思考を必要とするスキルに苦慮していることが明らかとなった。
論文参考訳（メタデータ） (2025-10-24T23:54:17Z)
ARLO: A Tailorable Approach for Transforming Natural Language Software Requirements into Architecture using LLMs [0.0]
自然言語(NL)で表現されるソフトウェア要件は、冗長性、曖昧性、一貫性に悩まされることが多い。本稿では,NL要求をアーキテクチャにマッピングするタスクを自動化するアプローチであるARLOを提案する。
論文参考訳（メタデータ） (2025-04-08T15:38:42Z)
RAGEval: Scenario Specific RAG Evaluation Dataset Generation Framework [66.93260816493553]
本稿では,様々なシナリオにまたがってRAGシステムを評価するためのフレームワークであるRAGvalを紹介する。事実の正確性に焦点をあてて,完全性,幻覚,不適切性の3つの新しい指標を提案する。実験結果から, RAGEvalは, 生成した試料の明瞭度, 安全性, 適合性, 豊かさにおいて, ゼロショット法とワンショット法より優れていた。
論文参考訳（メタデータ） (2024-08-02T13:35:11Z)

関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。

指定された論文の情報です。
本サイトの運営者は本サイト（すべての情報・翻訳含む）の品質を保証せず、本サイト（すべての情報・翻訳含む）を使用して発生したあらゆる結果について一切の責任を負いません。