論文の概要: Palmyra x6 Technical Report: An Agentic, Tool-Use Model Post-Trained via Anchored Supervised Fine-Tuning
- arxiv url: http://arxiv.org/abs/2608.16620v2
- Date: Tue, 18 Aug 2026 15:12:20 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-19 13:45:33.023755
- Title: Palmyra x6 Technical Report: An Agentic, Tool-Use Model Post-Trained via Anchored Supervised Fine-Tuning
- Title(参考訳): Palmyra x6 Technical Report: Anchored Supervised Fine-Tuningによるエージェント・ツール・ユースモデル後トレーニング
- Authors: Peng Du, Kiran Kamble, Rakshith Vasudev, Zhizhuo Yang, Rohith Nadimpally, Arjun Krishna, Waseem Alshikh, Daniel M. Bikel,
- Abstract要約: Palmyra x6は、エンタープライズ指向のエージェントタスクでの使用に最適化された大きな言語モデルである。
このモデルは、Anchored Supervised Fine-Tuningを用いたMixture-of-Expertsベースモデルを、検証済みの合成ツール使用軌跡のコンパクトコーパスで訓練することで構築された。
- 参考スコア(独自算出の注目度): 6.98860441926245
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Palmyra x6 is a large language model optimized for use with enterprise-oriented agentic tasks. The model was built by post-training a Mixture-of-Experts base model with Anchored Supervised Fine-Tuning on a compact corpus of verified, synthetic tool-use trajectories, optimized with a Muon + Adam hybrid. The recipe is deliberately conservative and deliberately controlled: 626 trajectories, a single epoch, a low learning rate, and a KL anchor to the frozen base. The model shows substantial gains over the previous default model for Writer Agent, and compares favorably with several recent models on public benchmarks, scoring the highest on BFCL Core at $0.785$ and posts the highest six-benchmark mean of the cohort. Furthermore, the model has shown itself to be competitive or leading relative to comparators in our bias and safety evaluations.
- Abstract(参考訳): Palmyra x6は、エンタープライズ指向のエージェントタスクでの使用に最適化された大きな言語モデルである。
The model built by post-training a Mixture-of-Experts base model with Anchored Supervised Fine-Tuning on a compact corpus of a confirmed, synthetic tool-use trajectories, optimized with a Muon + Adam hybrid。
このレシピは、意図的に保守的かつ故意に制御されており、626の軌道、1つのエポック、低い学習率、凍結した塩基へのKLアンカーである。
このモデルは、Writer Agentの以前のデフォルトモデルよりも大幅に向上し、BFCL Coreで0.785ドルのスコアを獲得し、コホートの最高6ベンチマーク平均を投稿した、いくつかの公開ベンチマークモデルと好意的に比較している。
さらに、このモデルは、私たちのバイアスや安全性評価において、コンパレータに対して競争力があるか、あるいはリードしていることを示している。
関連論文リスト
- Dynamically Allocating Evaluation Effort for Model Ranking [60.00410111594536]
相関アームを用いたマルチアームバンディット構成において,マルチモデル人体評価をベストアーム識別問題として定式化する。
トップパフォーマンスモデル間の差別を改善することを示します。
これにより、評価はより速く、より安価で、より大規模な競争評価目標に適合する。
論文 参考訳(メタデータ) (2026-08-04T10:33:04Z) - URPO: A Unified Reward & Policy Optimization Framework for Large Language Models [10.511836918064724]
本稿では,1つのモデルと1つのトレーニングフェーズにおいて,命令フォロー(プレイヤ)と報酬モデリング(参照)を統一する新しいフレームワークを提案する。
提案手法は,全てのアライメントデータを含む選好ペア,検証可能な推論,オープンな命令を統一された生成形式に再キャストする。
Qwen2.5-7Bモデルの実験はURPOの優位性を示している。
論文 参考訳(メタデータ) (2025-07-23T13:52:27Z) - Weak-to-Strong Preference Optimization: Stealing Reward from Weak Aligned Model [28.569089876442682]
この研究は弱強一般化に触発され、弱いモデルによって生成されるラベルに強いLMを微調整することで、弱いスーパーバイザーを一貫して上回る。
Weak-to-Strong Preference Optimization (WSPO)を提案し、弱いモデルのアライメント前後の分布差を学習することにより、強力なモデルアライメントを実現する。
論文 参考訳(メタデータ) (2024-10-24T11:06:29Z) - Self-Taught Evaluators [77.92610887220594]
本稿では,人工的なトレーニングデータのみを用いて,人間のアノテーションを使わずに即興で証明することを目的としたアプローチを提案する。
我々の自己学習評価器は、RewardBench上で75.4から88.3までの強いLDMを改善することができる。
論文 参考訳(メタデータ) (2024-08-05T17:57:02Z) - Information-Theoretic Distillation for Reference-less Summarization [67.51150817011617]
本稿では,要約のための情報理論的目的に基づいて,強力な要約器を蒸留する新しい枠組みを提案する。
我々は,教師モデルとしてPythia-2.8Bから出発する。
我々は,ChatGPTと競合する5億8800万のパラメータしか持たないコンパクトだが強力な要約器に到達した。
論文 参考訳(メタデータ) (2024-03-20T17:42:08Z) - Comparing Foundation Models using Data Kernels [13.099029073152257]
基礎モデルの埋め込み空間幾何学を直接比較するための方法論を提案する。
提案手法はランダムグラフ理論に基づいており, 埋め込み類似性の有効な仮説検証を可能にする。
本稿では, 距離関数を付加したモデルの多様体が, 下流の指標と強く相関することを示す。
論文 参考訳(メタデータ) (2023-05-09T02:01:07Z) - CAMERO: Consistency Regularized Ensemble of Perturbed Language Models
with Weight Sharing [83.63107444454938]
本稿では,CAMEROと呼ばれる摂動モデルに基づく一貫性規則化アンサンブル学習手法を提案する。
具体的には、すべてのモデルで底層重みを共有し、異なるモデルの隠れ表現に異なる摂動を適用し、モデルの多様性を効果的に促進することができる。
大規模言語モデルを用いた実験により,CAMEROはアンサンブルモデルの一般化性能を大幅に向上することが示された。
論文 参考訳(メタデータ) (2022-04-13T19:54:51Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。