論文の概要: VectraYX-Nano: A 42M-Parameter Spanish Cybersecurity Language Model with Curriculum Learning and Native Tool Use
- arxiv url: http://arxiv.org/abs/2605.13989v1
- Date: Wed, 13 May 2026 18:03:07 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-15 21:45:34.444907
- Title: VectraYX-Nano: A 42M-Parameter Spanish Cybersecurity Language Model with Curriculum Learning and Native Tool Use
- Title(参考訳): VectraYX-Nano: カリキュラム学習とネイティブツール使用を備えた42Mのスペインのサイバーセキュリティ言語モデル
- Authors: Juan S. Santillana,
- Abstract要約: VectraYX-Nanoは、41.95Mパラメータのデコーダのみの言語モデルである。
我々は,会話型(42Mトークン,OpenSubtitles-ES,OASST1),サイバーセキュリティ(118Mトークン,Wikipedia-ES,CVEミラー,セキュリティブログ),攻撃型セキュリティツール(10Mトークン,ExploitDB,HackTricksなど)に分割した170万個のスペイン語コーパスを提示する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We present VectraYX-Nano, a 41.95M-parameter decoder-only language model trained from scratch in Spanish for cybersecurity, with a Latin-American focus and native tool invocation via the Model Context Protocol (MCP). Four contributions: (i) Corpus: VectraYX-Sec-ES, a 170M-token Spanish corpus from an eight-VM pipeline (~$25 USD) partitioned into conversational (42M tokens, OpenSubtitles-ES, OASST1), cybersecurity (118M tokens, NVD, Wikipedia-ES, CVE mirror, security blogs), and offensive-security tooling (10M tokens, ExploitDB, HackTricks, OWASP) phases. (ii) Architecture: 42M-parameter Transformer decoder with GQA, QK-Norm, RMSNorm, SwiGLU, RoPE, z-loss, and a 16,384-token byte-fallback BPE. (iii) Curriculum with replay: continual pre-training with a replay buffer yields monotonic loss descent (9.80->3.17->3.00->2.16); after SFT on OASST-ES, Alpaca-ES, CVE Q&A, and 6,327 tool-use traces, the model attains a conversational gate of 0.78+-0.05 (N=4 seeds). (iv) Two findings: a bootstrap-corpus ablation reveals a loss-vs-register inversion at nano scale; a LoRA study shows the B4 tool-selection floor of 0.000 is a corpus-density artifact, not a capacity gate -- a tool-dense corpus (2,801 examples) raises B4 to 0.145+-0.046 on Nano 42M and 0.445+-0.201 on a 260M mid-tier. The GGUF artifact is 81 MB (F16), runs at sub-second TTFT on commodity hardware under llama.cpp, and is to our knowledge the first Spanish-native cybersecurity LLM with end-to-end MCP integration. Corpus recipe, training scripts, GGUF weights, and B1-B5 benchmark are released.
- Abstract(参考訳): VectraYX-Nanoは、スペイン語でスクラッチからトレーニングされた41.95Mのデコーダのみの言語モデルで、ラテンアメリカに焦点を合わせ、MCP(Model Context Protocol)を通じてネイティブツールの呼び出しを行う。
4つの貢献
(i) コーパス: VectraYX-Sec-ES(約25USD) 8VMパイプライン(約25USD)からの170Mのスペインのコーパス(42Mトークン、OpenSubtitles-ES、OASST1)、サイバーセキュリティ(118Mトークン、NVD、Wikipedia-ES、CVEミラー、セキュリティブログ)、攻撃的セキュリティツール(10Mトークン、ExploitDB、HackTricks、OWASP)に分割された会話型(42Mトークン、OpenSubtitles-ES、OASST1)。
(II)アーキテクチャ:GQA,QK-Norm,RMSNorm,SwiGLU,RoPE,z-loss,および16,384バイトフォールバックBPEを用いた42Mパラメータトランスフォーマーデコーダ。
3 リプレイバッファによる連続事前学習により単調な損失降下(9.80->3.17->3.00->2.16)が得られ、OASST-ES、Alpaca-ES、CVE Q&A及び6,327個のツール使用トレースに対するSFT後、0.78+0.05(N=4シード)の会話ゲートが得られる。
四) ブートストラップ・コーパスアブレーションによりナノスケールでの損失-vs-レジストインバージョンが明らかにされ、LoRAによる研究では、B4ツール選択フロアが容量ゲートではなくコーパス密度アーティファクトであることが示され、ツールセンスコーパス(2,801例)はナノ42MでB4を0.145+-0.046、ナノ42Mで0.445+-0.201に上昇する。
GGUFのアーティファクトは81MB(F16)で、llama.cppの下のコモディティハードウェア上で、TTFTのサブ秒で動作する。
コーパスレシピ、トレーニングスクリプト、GGUFウェイト、B1-B5ベンチマークがリリースされた。
関連論文リスト
- ML Defender (aRGus NDR): An Open-Source Embedded ML NIDS for Botnet and Anomalous Traffic Detection in Resource-Constrained Organizations [0.0]
本稿では,C++20で構築された,150-200 USDのコモディティハードウェア上にデプロイ可能なオープンソースのネットワーク侵入検知システムを提案する。
ML Defenderは、eBPF/XDPパケットキャプチャ、ZeroMQトランスポート、Protocol Buffersシリアライゼーションの6成分パイプラインを実装している。
Ransomware Threat Winsポリシーは、ML推論を用いて両方のスコアの最大演算を選択し、偽陽性を抑える。
論文 参考訳(メタデータ) (2026-04-03T05:20:13Z) - Omnilingual SONAR: Cross-Lingual and Cross-Modal Sentence Embeddings Bridging Massively Multilingual Text and Speech [61.759910921200834]
言語間の文エンコーダは通常、数百の言語をカバーしている。
我々はOmniSONARを紹介した。OmniSONARは全言語、言語横断、言語横断の文埋め込みモデルである。
論文 参考訳(メタデータ) (2026-03-17T14:47:35Z) - PashtoCorp: A 1.25-Billion-Word Corpus, Evaluation Suite, and Reproducible Pipeline for Low-Resource Language Development [0.0]
パシュトコープ (PashtoCorp) は、パシュト語(英語版)の1.25ビリオン語コーパスである。
PashtoCorpは2.81億の文書にまたがる1.25Bワードで、OSCARのPashtoサブセットの40倍、かつての最大の専用Pashtoコーパスの83倍の大きさである。
論文 参考訳(メタデータ) (2026-03-17T10:36:18Z) - David vs. Goliath: A comparative study of different-sized LLMs for code generation in the domain of automotive scenario generation [1.6752458252726459]
大きな言語モデル(LLM)を持つNL-to-Scenic生成は、少ないデータ、限られたメトリクスに悩まされる。
NL2Scenicは146組のNL/Scenicペアを持つオープンデータセットとフレームワークであり、難易度の高い30ケースのテスト分割とサンプルレトリバーを紹介する。
4つのプロプライエタリ(GPT-4o, GPT-5, Claude-Sonnet-4, Gemini-2.5-pro)と9つのオープンソースコードモデル(Qwen2.5Coder 0.5B-32B; CodeLlama 7B/13B/34B)を評価した。
論文 参考訳(メタデータ) (2025-10-15T21:37:02Z) - ObjexMT: Objective Extraction and Metacognitive Calibration for LLM-as-a-Judge under Multi-Turn Jailbreaks [12.396822247035578]
目的抽出とメタ認知のためのベンチマークであるexMTを提案する。
マルチターン書き起こしが与えられた場合、モデルは1文ベース目標と自己報告された自信を出力しなければならない。
正確性は金の目標と類似性によって評価され、300の校正項目で1度閾値付けされる。
論文 参考訳(メタデータ) (2025-08-23T03:32:04Z) - Vuyko Mistral: Adapting LLMs for Low-Resource Dialectal Translation [0.0]
本稿では,ウクライナのフツル方言に大規模な言語モデルを適用するための最初の取り組みを紹介する。
我々は、9852語対標準ウクライナ語の文対と7320語の単語マッピングの辞書の並列コーパスを作成しました。
論文 参考訳(メタデータ) (2025-06-09T10:30:35Z) - Towards Robust Speech Representation Learning for Thousands of Languages [77.2890285555615]
自己教師付き学習(SSL)は、ラベル付きデータの必要性を減らすことで、音声技術をより多くの言語に拡張するのに役立つ。
我々は4057言語にまたがる100万時間以上のデータに基づいて訓練された、ユニバーサル音声のための言語横断言語であるXEUSを提案する。
論文 参考訳(メタデータ) (2024-06-30T21:40:26Z) - Nearest Neighbor Speculative Decoding for LLM Generation and Attribution [87.3259169631789]
Nearest Speculative Decoding (NEST)は、任意の長さの実世界のテキストスパンをLM世代に組み込むことができ、それらのソースへの属性を提供する。
NESTは、様々な知識集約タスクにおいて、基本LMの生成品質と帰属率を大幅に向上させる。
さらに、NESTは、Llama-2-Chat 70Bに適用した場合の推論時間において1.8倍のスピードアップを達成することにより、生成速度を大幅に改善する。
論文 参考訳(メタデータ) (2024-05-29T17:55:03Z) - Nonparametric Masked Language Modeling [113.71921977520864]
既存の言語モデル(LM)は、有限語彙上のソフトマックスでトークンを予測する。
NPMは,このソフトマックスを参照コーパス内の各フレーズの非パラメトリック分布に置き換える最初の非パラメトリックマスク付き言語モデルである。
NPMは、コントラスト目的と全コーパス検索に対するバッチ内近似で効率的に訓練することができる。
論文 参考訳(メタデータ) (2022-12-02T18:10:42Z) - Zemi: Learning Zero-Shot Semi-Parametric Language Models from Multiple
Tasks [77.90900650816046]
ゼロショットセミパラメトリック言語モデルである$textZemi$を紹介します。
私たちは、新しいセミパラメトリックマルチタスクによるトレーニングパラダイムで、textZemi$をトレーニングします。
具体的には、大規模タスクに依存しない未ラベルコーパスからの検索により、マルチタスクトレーニングとゼロショット評価を強化する。
論文 参考訳(メタデータ) (2022-10-01T04:08:50Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。