論文の概要: CogEvol: Towards Efficient and Reliable Learning Environment Generation
- arxiv url: http://arxiv.org/abs/2608.30968v2
- Date: Wed, 02 Sep 2026 05:30:12 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-03 15:35:44.746335
- Title: CogEvol: Towards Efficient and Reliable Learning Environment Generation
- Title(参考訳): CogEvol: 効率的で信頼性の高い学習環境の構築を目指して
- Authors: Shangqing Tu, Daniel Zhang-Li, Yucheng Wang, Shiyu Gan, Yanpeng Wang, Huiqiang Rong, Mofei Chen, Shen Yang, Yini Chen, Yinuo Duan, Binglin Liu, Ye He, Danqi Zheng, Zhanxin Hao, Yuxuan Wu, Mengting Tao, Yuqiu Liu, Jifan Yu, Juanzi Li, Bin Xu, Lei Hou, Huiqin Liu, Yu Zhang,
- Abstract要約: 本稿では,学習環境生成に特化して訓練されたモデル群であるCogEvolを紹介する。
CogEvolは、スライドを中央値17秒、対話ページを59秒で完了し、数分のマルチターンエージェントの足場を置き換える。
プロダクショングラウンドのデータパイプラインは、実際の障害を53,687個のSFTサンプルに変換する。
- 参考スコア(独自算出の注目度): 49.18054685846454
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We present CogEvol, a family of models trained specifically for Learning Environment Generation: turning a course brief into a finished learning artifact (structured-JSON slides or self-contained interactive HTML pages) in a single pass. Across 220k production requests, CogEvol completes a slide in a median of 17 seconds and an interactive page in 59, replacing minutes-long multi-turn agent scaffolding. Reliability is enforced rather than hoped for: a production-grounded data pipeline turns real failures into 53,687 verified SFT samples, and a hybrid rule-plus-VLM reward drives GRPO-based RL, hardened after we caught and fixed a reward-hacking episode that produced visually convincing but unplayable games. CogEvol-27B scores 83.7 on slide quality and 63.7 on a 500-case interactive-HTML benchmark with 26.9x fewer parameters than flagship coding models, and, in collaboration with the OpenMAIC team, serves their live production traffic. CogEvol-4B is released openly under the Apache 2.0 license at https://github.com/CogEvol/CogEvol-4B; external flagships are measured on the same suites under the identical harness. Scaffold editing cuts interactive-page generation cost by a further ~76%, and the full stack runs on domestic Ascend accelerators at application-level parity with A800 GPUs, lowering the unit cost of AI-native education at scale.
- Abstract(参考訳): コースを簡潔に学習成果物(構造化JSONスライドまたは自己完結型インタラクティブHTMLページ)に1パスで変換する。
220kのプロダクションリクエストに対して、CogEvolは中央値17秒でスライドを完了し、59秒で対話的なページを完了し、数分のマルチターンエージェントの足場を置き換える。
プロダクショングラウンドのデータパイプラインは、実際の障害を53,687個のSFTサンプルに変換します。また、GRPOベースのRLを使ったハイブリッドルール+VLM報酬ドライブは、私たちがキャッチして、視覚的に納得できるがプレイ不可能なゲームを生み出した報酬ハックのエピソードを修正しました。
CogEvol-27Bはスライド品質で83.7点、500ケースのインタラクティブHTMLベンチマークで63.7点を記録し、フラグシップのコーディングモデルより26.9倍少ないパラメータで、OpenMAICチームと共同でライブプロダクショントラフィックを提供している。
CogEvol-4BはApache 2.0ライセンスでhttps://github.com/CogEvol/CogEvol-4Bで公開されている。
Scaffold編集はインタラクティブページ生成コストを76%削減し、フルスタックはアプリケーションレベルのAscendアクセラレータ上でA800 GPUと同等に動作し、大規模にAIネイティブ教育の単位コストを下げる。
関連論文リスト
- EvoGenUI-Bench: Evaluating LLMs as Multi-Turn Generative UI Assistants [10.510136510866099]
大規模な言語モデルはインタラクティブなWebインターフェースを生成することができるが、ユーザ要求が進化するにつれて、信頼できる生成UIは実行可能なアーティファクトを維持する必要がある。
我々はEvoGenUI-Benchを紹介した。EvoGenUI-Benchは150の5ターンタスクと750のターンを3つのシナリオに分けたマルチターンインタフェースメンテナンスのベンチマークである。
生成されたアーティファクトをブラウザで実行し、スクリーンショット、ソースおよびDOMエビデンス、アクタートレース、実行時ログを使用して評価します。
論文 参考訳(メタデータ) (2026-08-29T17:54:02Z) - Dual-Node NVIDIA DGX Spark over Tailscale: A Remote-Access Testbed for Distributed LLM Training and Cyber-Threat-Intelligence Fine-Tuning [0.0]
本報告では,2つのNVIDIA DGX Sparkシステムを対象とした分散NanoChatプリトレーニングのコンセプト実証について述べる。
このクラスタは400レベルのAIコース(CS 426)とCBS 255のSecurity+ POGILアクティビティ用のクエリエンジンをサポートする。
論文 参考訳(メタデータ) (2026-08-07T13:41:57Z) - LocalNav: Distilling Frontier VLMs and Embodied RL for On-Device Object Goal Navigation [53.88286427894783]
視覚言語モデル(VLM)は、ロボット分野において、言語コンテキストによる環境認識を可能にする強力なツールとして登場した。
しかし、彼らの計算フットプリントは、通常、それらをクラウド実行に制限し、リソースに制約のあるロボットへのローカルなデプロイによる低レイテンシの推論を妨げる。
本稿では,大規模フロンティアモデルからの複雑な空間意味推論を,組み込みGPUデバイス上でエッジ実行を行うための軽量な4BパラメータローカルVLMに転送する蒸留戦略を提案する。
論文 参考訳(メタデータ) (2026-06-26T09:11:59Z) - ProCUA-SFT Technical Report [80.97543110323542]
コンピュータ使用エージェント(CUA)の訓練には、全デスクトップ環境で収集された大規模で多様な軌跡データが必要である。
93Kの合成軌道から抽出した3.1MステップレベルのSFTサンプルのデータセットであるProCUA-SFTについて述べる。
ProCUA-SFTの微調整UI-TARS 7Bは、OSWorldで45.0%、ベースモデルよりも18.7ポイント改善されている。
論文 参考訳(メタデータ) (2026-06-15T22:04:11Z) - HyDRA: Hybrid Dynamic Routing Architecture for Heterogeneous LLM Pools [2.0320563270126493]
我々は,クエリ毎の細粒度,多次元能力要件を予測するフレームワークHyDRAを提案する。
ショートフォールマッチングアルゴリズムは、予測された要求を満たす機能を持つ最も安価なモデルを選択する。
このフレームワークは、GitHub CopilotのVS Code Chat自動モードのすべてのユーザにデプロイされる。
論文 参考訳(メタデータ) (2026-05-16T18:19:30Z) - Orchard: An Open-Source Agentic Modeling Framework [124.68499958175111]
スケーラブルなエージェントモデリングのためのオープンソースのフレームワークOrchardを紹介します。
Orchard Envは、サンドボックスライフサイクル管理のための再利用可能なプリミティブを提供する軽量環境サービスである。
Orchard Envの上に、3つのエージェントモデリングレシピを構築します。
論文 参考訳(メタデータ) (2026-05-14T16:35:12Z) - WildClawBench: A Benchmark for Real-World, Long-Horizon Agent Evaluation [88.10947115397971]
この研究でWildClawBenchは、6つのテーマのカテゴリにまたがる60の人間によるバイリンガルなマルチモーダルタスクのネイティブランタイムベンチマークである。
各タスクは、約8分間のウォールクロック時間と20以上のツールコールで実行されます。
グラディングはハイブリッドであり、決定論的ルールベースのチェック、副作用の環境状態監査、意味的検証のためのLLM/VLM判定を組み合わせている。
論文 参考訳(メタデータ) (2026-05-11T17:49:43Z) - Learning to Present: Inverse Specification Rewards for Agentic Slide Generation [15.152850806890065]
本研究は,LLMエージェントがトピックの研究,コンテントの計画,ツール使用によるHTMLスライドのプロフェッショナルなプレゼンテーション生成を学習する,OpenEnv互換の強化学習環境を提案する。
本稿では, 構造検証, レンダリング品質評価, LLMに基づく美的評価, コンテンツ品質指標, および, 意図した目的をいかに忠実に生成するかを計測する逆仕様報酬を組み合わせた多成分報酬システムを提案する。
6つのモデルにまたがる48種類のビジネスブリーフの実験では、細調整された7Bモデルはクロードオプス4.6の品質の91.2%を達成し、ベースモデルよりも33.1%改善した。
論文 参考訳(メタデータ) (2026-03-17T17:45:53Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。