論文の概要: Nanbeige4.2-3B: Unlocking Agentic Capabilities in a Compact Model
- arxiv url: http://arxiv.org/abs/2607.22083v2
- Date: Mon, 27 Jul 2026 02:18:38 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 14:56:47.044523
- Title: Nanbeige4.2-3B: Unlocking Agentic Capabilities in a Compact Model
- Title(参考訳): Nanbeige4.2-3B:小型モデルにおけるエージェントのロック解除機能
- Authors: Nanbeige Lab, :, Chen Yang, Chengrui Huang, Fufeng Lan, Hanhui Chen, Hao Zhou, Huatong Song, Jiaqi Cao, Jiaying Zhu, Jinlin Niu, Kai Wang, Lisheng Huang, Qiliang Liang, Ran Le, Ruixiang Feng, Shuang Sun, Tao Gu, Tao Zhang, Tianyu Luo, Yang Song, Yun Xing, Yuntao Wen, Ziyao Xu, Zongchao Chen, Zongqiang Li,
- Abstract要約: Nanbeige4.2-3Bは、3B非埋め込みパラメータを持つコンパクトな一般エージェントモデルである。
コードエージェント、オフィスエージェント、複雑なツール使用タスク間で強力なパフォーマンスを提供する。
- 参考スコア(独自算出の注目度): 19.43885119288679
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We present Nanbeige4.2-3B, a compact general agentic model with 3B non-embedding parameters. It delivers strong performance across code-agent, office-agent, and complex tool-use tasks while maintaining highly competitive reasoning capabilities in mathematics, coding, and science. Nanbeige4.2-3B is pretrained from scratch on 28T tokens with a Looped Transformer that reuses the layer stack to increase capacity without adding parameters. For SFT data and trajectory construction, we expand the diversity of executable environments, task assets, and agentic scaffolds through real-world deployment and large-scale synthesis. Our RL pipeline applies mixed-mode RLHF over Think and Non-Think responses to improve overall model quality and reduce failure cases, length-controlled reasoning RL to balance accuracy and reasoning efficiency, and agentic RL with outcome and process rewards to stabilize long-horizon training. Extensive evaluations show that Nanbeige4.2-3B outperforms larger models, including Qwen3.5-9B and Gemma4-12B, across diverse agentic benchmarks while remaining competitive on reasoning and alignment tasks. Performance with OpenClaw further supports its use as a compact local personal assistant.
- Abstract(参考訳): 3B非埋め込みパラメータを持つコンパクトな汎用エージェントモデルであるNanbeige4.2-3Bを提案する。
プログラムエージェント、オフィスエージェント、複雑なツール使用タスクにまたがって強力なパフォーマンスを提供しながら、数学、コーディング、科学において非常に競争力のある推論能力を維持しています。
Nanbeige4.2-3Bは28TトークンのスクラッチからLooped Transformerで事前トレーニングされている。
SFTデータと軌道構築のために、実世界の展開と大規模合成を通じて実行可能な環境、タスクアセット、エージェントの足場を拡大する。
我々のRLパイプラインでは,総合モデル品質の向上と故障事例の削減,精度と推論効率のバランスをとるための長さ制御推論RL,結果とプロセスの報奨を考慮したエージェントRLを用いて,長期訓練の安定化を図る。
広範囲な評価の結果、Nanbeige4.2-3BはQwen3.5-9BやGemma4-12Bなど、様々なエージェントベンチマークにおいて、推論やアライメントタスクの競争力を維持しながら、より大きなモデルよりも優れていた。
OpenClawのパフォーマンスはさらに、コンパクトなローカルパーソナルアシスタントとしての使用をサポートする。
関連論文リスト
- Agent Explorative Policy Optimization for Multimodal Agentic Reasoning [97.64835302176056]
エージェント推論は2つの行動と構造的非対称性(思考と道具の使用)をインターリーブする。
GRPOのような標準的なRLレシピでは、ギャップはトレーニング中に2つの診断症状として現れる。
AXPO (Agent eXplorative Policy Optimization) を提案する。
論文 参考訳(メタデータ) (2026-05-27T17:36:39Z) - Controllable and Verifiable Tool-Use Data Synthesis for Agentic Reinforcement Learning [82.89535601592739]
マルチレベル検証を用いた自己進化型合成により,信頼性の高い基本ツール利用軌跡を生成する2段階パイプラインを提案する。
これらの拡張は、トラクタツール、間接的または曖昧なユーザクエリ、ノイズ、マルチフォーマット、あるいは誤ったツール出力を導入します。
本設計では,標準事例に対する参照マッチングによる報酬の自動計算と,エラー検出などの特別な動作に対する軽量な判断支援検証を実現する。
論文 参考訳(メタデータ) (2026-04-10T18:38:52Z) - PivotRL: High Accuracy Agentic Post-Training at Low Compute Cost [22.906887375657664]
長距離エージェントタスクのポストトレーニングは、計算効率と一般化の間に緊張関係がある。
本稿では,既存のSFTトラジェクトリで動作する新しいフレームワークであるPivotRLを紹介し,SFTの計算効率とE2E RLのOOD精度を組み合わせた。
PivotRLはNVIDIAのNemotron-3-Super-120B-A12Bで採用され、量産規模のエージェント・ポストトレーニングにおけるワークホースとして機能している。
論文 参考訳(メタデータ) (2026-03-22T19:59:48Z) - Nanbeige4.1-3B: A Small General Model that Reasons, Aligns, and Acts [16.810363861148513]
Nanbeige4.1-3Bはオープンソースの小型言語モデル(SLM)である。
3Bパラメータしか持たない強力なエージェント動作、コード生成、一般的な推論を同時に達成する。
以上の結果から,小型モデルでは,幅広い能力と強力な特殊化を同時に達成できることが示唆された。
論文 参考訳(メタデータ) (2026-02-13T13:10:46Z) - AgentCPM-Explore: Realizing Long-Horizon Deep Exploration for Edge-Scale Agents [75.67445299298949]
AgentCPM-Exploreは、知識密度と強力な探索能力を備えたコンパクトな4Bエージェントモデルである。
本稿では,パラメータ空間モデルの融合,報酬信号の復調,文脈情報の改良を特徴とする総合的なトレーニングフレームワークを提案する。
AgentCPM-Exploreは4つのベンチマークで8BクラスのSOTAモデルにマッチまたは超え、また5つのベンチマークでClaude-4.5-SonnetやDeepSeek-v3.2のような大規模モデルよりも優れている。
論文 参考訳(メタデータ) (2026-02-06T08:24:59Z) - SkyRL-Agent: Efficient RL Training for Multi-turn LLM Agent [63.15417992240217]
本稿では,SkyRL-Agentについて紹介する。
効率的な非同期ディスパッチ、軽量ツールの統合、柔軟なバックエンドの相互運用性を提供する。
我々は、Qwen3-32B (24.4% Pass@1)からトレーニングを受けたソフトウェアエンジニアリングエージェントであるSA-SWE-32Bを、純粋に強化学習で訓練する。
論文 参考訳(メタデータ) (2025-11-20T07:05:19Z) - Klear-AgentForge: Forging Agentic Intelligence through Posttraining Scaling [46.593200463657645]
我々は,Klear-Qwen3-AgentForgeという高性能エージェントモデルを学習するための,包括的で完全なオープンソースパイプラインを提案する。
合成データを用いた効率的な教師付き微調整(SFT)とマルチターン強化学習(RL)を併用し,多種多様なエージェントタスクの可能性を解き放つ。
論文 参考訳(メタデータ) (2025-11-08T09:47:27Z) - One Model to Critique Them All: Rewarding Agentic Tool-Use via Efficient Reasoning [54.580646706013965]
リワードモデル(RM)は、大きな言語モデルと人間の嗜好の整合において重要な役割を果たす。
一般的なツール使用シナリオに適した軽量な生成型RMのファミリーであるToolRMを紹介する。
これらのモデルを構築するために,ルールベースのスコアリングと多次元サンプリングを用いたペアワイズ選好データを構築するパイプラインを提案する。
論文 参考訳(メタデータ) (2025-10-30T06:08:27Z) - Agentic Reinforcement Learning for Real-World Code Repair [7.512134741776294]
実際のリポジトリで信頼性の高いコード修正エージェントをトレーニングするという課題に取り組みます。
修正後のビルド検証として成功した検証可能なパイプラインを開発しました。
大規模強化学習のためのスケーラブルな簡易パイプラインを導入した。
論文 参考訳(メタデータ) (2025-10-24T23:25:02Z) - Demystifying Reinforcement Learning in Agentic Reasoning [90.3737088727791]
エージェント推論における強化学習のデミスティフィケーションのための包括的かつ体系的な調査を行う。
i) 縫合された合成軌道を、実際のエンドツーエンドのツール・ツー・ユース・トラジェクトリに置き換えることで、より強力なSFTが得られる。
探索フレンドリーな技術は、高いクリップ、過剰な報酬形成、適切なポリシーエントロピーの維持といったエージェントRLにとって不可欠であり、訓練効率を向上させることができる。
論文 参考訳(メタデータ) (2025-10-13T17:57:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。