論文の概要: GLM-5: from Vibe Coding to Agentic Engineering
- arxiv url: http://arxiv.org/abs/2602.15763v1
- Date: Tue, 17 Feb 2026 17:50:56 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-02-18 16:03:18.148432
- Title: GLM-5: from Vibe Coding to Agentic Engineering
- Title(参考訳): GLM-5:バイブ符号化からエージェント工学へ
- Abstract要約: GLM-5は,バイブ符号化のパラダイムをエージェント工学に移行するために設計された次世代基盤モデルである。
GLM-5は、前任者のエージェント、推論、コーディング(ARC)能力に基づいており、長いコンテキストの忠実さを維持しながら、トレーニングと推論のコストを大幅に削減するためにDSAを採用している。
- 参考スコア(独自算出の注目度): 223.24496672922785
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We present GLM-5, a next-generation foundation model designed to transition the paradigm of vibe coding to agentic engineering. Building upon the agentic, reasoning, and coding (ARC) capabilities of its predecessor, GLM-5 adopts DSA to significantly reduce training and inference costs while maintaining long-context fidelity. To advance model alignment and autonomy, we implement a new asynchronous reinforcement learning infrastructure that drastically improves post-training efficiency by decoupling generation from training. Furthermore, we propose novel asynchronous agent RL algorithms that further improve RL quality, enabling the model to learn from complex, long-horizon interactions more effectively. Through these innovations, GLM-5 achieves state-of-the-art performance on major open benchmarks. Most critically, GLM-5 demonstrates unprecedented capability in real-world coding tasks, surpassing previous baselines in handling end-to-end software engineering challenges. Code, models, and more information are available at https://github.com/zai-org/GLM-5.
- Abstract(参考訳): GLM-5は,バイブ符号化のパラダイムをエージェント工学に移行するために設計された次世代基盤モデルである。
GLM-5は、前任者のエージェント、推論、コーディング(ARC)能力に基づいており、長いコンテキストの忠実さを維持しながら、トレーニングと推論のコストを大幅に削減するためにDSAを採用している。
モデルアライメントと自律性を向上するために、トレーニングから生成を分離することで、トレーニング後の効率を大幅に改善する新しい非同期強化学習インフラを実装した。
さらに、RLの品質をさらに向上する新しい非同期エージェントRLアルゴリズムを提案する。
これらの革新を通じて、GLM-5は主要なオープンベンチマーク上で最先端のパフォーマンスを達成する。
最も重要なのは、GLM-5が現実世界のコーディングタスクにおいて前例のない能力を示し、エンド・ツー・エンドのソフトウェア工学の課題に対処する上で、以前のベースラインを超えていることだ。
コード、モデル、その他の情報はhttps://github.com/zai-org/GLM-5.comで入手できる。
関連論文リスト
- Improving LLM Code Generation via Requirement-Aware Curriculum Reinforcement Learning [9.407248347872931]
本稿では,大規模言語モデル(LLM)に基づくコード生成の強化を目的とした,要求対応のカリキュラム強化学習フレームワークを提案する。
本稿では,RECRLがすべての最先端ベースラインに対して平均1.23%-5.62%のPass@1改善を実現していることを示す。
論文 参考訳(メタデータ) (2026-05-01T06:10:03Z) - GLM-5V-Turbo: Toward a Native Foundation Model for Multimodal Agents [153.49229978057207]
GLM-5V-Turboは,マルチモーダルエージェントのネイティブ基盤モデルに向けたステップである。
本稿では、モデル設計、マルチモーダルトレーニング、強化学習、ツールチェーン拡張、エージェントフレームワークとの統合など、GLM-5V-Turboの主な改善点について要約する。
論文 参考訳(メタデータ) (2026-04-29T14:49:37Z) - Revisiting Quantum Code Generation: Where Should Domain Knowledge Live? [0.0]
本稿では,Qiskit-HumanEvalベンチマークを用いて,Qiskitコード生成のための特殊化戦略について検討する。
現代の汎用LLMはパラメータ特化ベースラインを一貫して上回っていることを示す。
論文 参考訳(メタデータ) (2026-03-23T16:46:39Z) - Self-Evolving Recommendation System: End-To-End Autonomous Model Optimization With LLM Agents [18.707716142982992]
複雑なモデル変更を自律的に生成し、訓練し、デプロイする自己進化システムを提案する。
私たちのエージェントは、機械学習エンジニア(MLE)として機能します。
このアプローチの有効性は、YouTubeで成功したいくつかのプロダクションローンチを通じて実証されている。
論文 参考訳(メタデータ) (2026-02-10T19:16:52Z) - Large Language Model (LLM)-enabled Reinforcement Learning for Wireless Network Optimization [79.27012080083603]
大型言語モデル(LLM)は、無線ネットワークにおける強化学習を強化するための有望なツールを提供する。
マルチエージェント強化学習フレームワークを強化するために,LLM支援状態表現と意味抽出を提案する。
論文 参考訳(メタデータ) (2026-01-15T01:42:39Z) - SimuAgent: An LLM-Based Simulink Modeling Assistant Enhanced with Reinforcement Learning [3.1436750864792375]
我々は,Simulinkに適したモデリングおよびシミュレーションエージェントであるSimuAgentを紹介する。
SimuAgentはXMLを簡潔な辞書スタイルのPython表現に置き換え、トークン数を劇的に削減する。
2段階で訓練された軽量な計画実行アーキテクチャは、エージェントに低レベルのツールスキルと高レベルの設計推論の両方を装備する。
論文 参考訳(メタデータ) (2026-01-08T18:10:35Z) - DeepV: A Model-Agnostic Retrieval-Augmented Framework for Verilog Code Generation with a High-Quality Knowledge Base [13.906575706979375]
本稿では,モデルに依存しないRAGフレームワークであるDeepVを紹介した。
我々のフレームワークは、最新の商用LLMであるOpenAIのGPT-5の恩恵を受けており、VerilogEvalベンチマークでは、ほぼ17%のパフォーマンスが向上している。
論文 参考訳(メタデータ) (2025-10-06T19:47:27Z) - Leveraging AI Agents for Autonomous Networks: A Reference Architecture and Empirical Studies [18.534083337294188]
この研究は、ジョゼフ・シファキス(Joseph Sifakis)のAN Agent参照アーキテクチャを機能認知システムに実装することで、アーキテクチャ理論と運用現実のギャップを埋める。
5G NR sub-6 GHz において,サブ10ms のリアルタイム制御を実演し,外ループリンク適応 (OLLA) アルゴリズムよりも6% 高いダウンリンクスループットを実現した。
これらの改善により、従来の自律的障壁を克服し、次世代の目標に向けて重要なL4エナリング能力を推し進めるアーキテクチャの生存性が確認される。
論文 参考訳(メタデータ) (2025-09-10T06:24:57Z) - VerlTool: Towards Holistic Agentic Reinforcement Learning with Tool Use [78.29315418819074]
VerlToolは、体系的な設計原則を通じて制限に対処する統一的でモジュール化されたフレームワークです。
我々のフレームワークはARLTをマルチターントラジェクトリとして定式化し、マルチモード観測トークン(テキスト/画像/ビデオ)を単一ターンRLVRパラダイムを超えて拡張する。
モジュール化されたプラグインアーキテクチャは、軽量Python定義のみを必要とする迅速なツール統合を可能にする。
論文 参考訳(メタデータ) (2025-09-01T01:45:18Z) - Omni-Thinker: Scaling Multi-Task RL in LLMs with Hybrid Reward and Task Scheduling [66.0871543682453]
我々はOmni-Thinkerについて紹介する。Omni-Thinkerは多種多様なタスクにわたって大きな言語モデルをスケールする統合強化学習フレームワークである。
我々のスケジューラは,BWTに基づいてタスクを順序付けし,マルチタスク性能を向上する。
論文 参考訳(メタデータ) (2025-07-20T01:50:16Z) - DARS: Dynamic Action Re-Sampling to Enhance Coding Agent Performance by Adaptive Tree Traversal [55.13854171147104]
大規模言語モデル(LLM)は、自然言語処理、データ分析、ソフトウェア開発など、さまざまな領域に革命をもたらした。
符号化エージェントのための新しい推論時間計算スケーリングアプローチである動的アクション再サンプリング(DARS)を提案する。
我々は、SWE-Bench Liteベンチマークに対する我々のアプローチを評価し、このスケーリング戦略がClude 3.5 Sonnet V2で55%のパス@kスコアを達成したことを実証した。
論文 参考訳(メタデータ) (2025-03-18T14:02:59Z) - Applying RLAIF for Code Generation with API-usage in Lightweight LLMs [15.366324461797582]
Reinforcement Learning from AI Feedback (RLAIF)は、さまざまな領域で大きな可能性を証明している。
本稿では,軽量 (1B パラメータ) LLM のコード生成能力を改善するための RLAIF フレームワークを提案する。
論文 参考訳(メタデータ) (2024-06-28T17:16:03Z) - DS-Agent: Automated Data Science by Empowering Large Language Models with Case-Based Reasoning [56.887047551101574]
大規模言語モデル(LLM)エージェントとケースベース推論(CBR)を利用した新しいフレームワークであるDS-Agentを提案する。
開発段階では、DS-AgentはCBRフレームワークに従い、自動イテレーションパイプラインを構築する。
デプロイメントの段階では、DS-Agentは、シンプルなCBRパラダイムで低リソースのデプロイメントステージを実装し、LCMの基本能力に対する需要を大幅に削減する。
論文 参考訳(メタデータ) (2024-02-27T12:26:07Z) - CodeRL: Mastering Code Generation through Pretrained Models and Deep
Reinforcement Learning [92.36705236706678]
CodeRLは、事前訓練されたLMと深層強化学習によるプログラム合成タスクのための新しいフレームワークである。
推論中、我々は重要なサンプリング戦略を持つ新しい生成手順を導入する。
モデルバックボーンについては,CodeT5のエンコーダデコーダアーキテクチャを拡張し,学習目標を拡張した。
論文 参考訳(メタデータ) (2022-07-05T02:42:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。