論文の概要: VectraYX-Vision-1B: A Sub-2B Spanish/LATAM Cybersecurity Vision-Language Model with Structured Visual Reasoning and Native Tool Use
- arxiv url: http://arxiv.org/abs/2608.08477v1
- Date: Sun, 09 Aug 2026 04:46:58 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:36.840317
- Title: VectraYX-Vision-1B: A Sub-2B Spanish/LATAM Cybersecurity Vision-Language Model with Structured Visual Reasoning and Native Tool Use
- Title(参考訳): VectraYX-Vision-1B:構造化ビジュアル推論とネイティブツールを用いたサブ-2Bスパニッシュ/LATAMサイバーセキュリティビジョンランゲージモデル
- Abstract要約: VectraYX-Vision-1Bはスペイン語/LATAM0:画像のためのサブ2B視覚言語モデルである。
スペイン語で回答し、ネイティブ|think|>トークンを通じて構造化推論を出力し、Model Protocol (|tool_call|>)を介してツールを起動し、ラマのLLaVA mmprojフォーマットにエクスポートして、空輸デプロイメントを行う。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We present VectraYX-Vision-1B, a sub-2B vision-language model (VLM) for Spanish/LATAM cybersecurity imagery, coupling a frozen SigLIP-so400m encoder to a 1.04B Spanish/LATAM security decoder via an MLP. To our knowledge, it is the first sub-2B VLM specialized for cyber UI (IDA, Ghidra, Wireshark, Nmap, Metasploit, Volatility) that answers in Spanish, emits structured reasoning via native <|think|> tokens, invokes tools via Model Context Protocol (<|tool_call|>), and exports to llama.cpp's LLaVA mmproj format for air-gapped deployment. We report a negative preliminary visual-grounding result: despite fully functional pipelines, the current vision SFT (400-1900 steps, ~16M tokens) yields near-zero B6 scores (0.08 tool-identification), ignoring image content. We specify remediation (longer SFT, >=60% replay, lower LR) and expose a checkpoint-loader bug (unstripped llm. prefix) masquerading as training collapse. Crucially, we introduce a 3-variant ablation matrix (V0: NoPE-every-4, V1: all-RoPE, V2: NoPE+learned 2D) to study if periodic no-positional-encoding (NoPE) layers help or hurt attention over the 729-token visual block. Code, configs, and weights are released to establish priority on this architectural question. We provide B1-B5 for the text backbone, text controls, preliminary B6/B7 scores, wall times, GGUF efficiency on CPU, and a corpus of 14,596 QA pairs across 10 domains. We open-source all models and trajectories: jsantillana/vectrayx-1b, jsantillana/vectrayx-vision-1b, and jsantillana/vectrayx-vision-1b-checks.
- Abstract(参考訳): 本稿では,SigLIP-so400mエンコーダをMLP経由で1.04Bのスパニッシュ/LATAMセキュリティデコーダに結合する,VectraYX-Vision-1Bについて述べる。
我々の知る限り、これは、スペイン語で答えるサイバーUI(IDA、Ghidra、Wireshark、Nmap、Metasploit、Volatility)に特化した最初のサブ2B VLMであり、ネイティブな<|think|>トークンを介して構造化された推論を出力し、Model Context Protocol (<|tool_call|>)を介してツールを呼び出し、ラマ.cppのLLaVA mmprojフォーマットに空気を積んだデプロイメントをエクスポートする。
完全な機能的パイプラインにもかかわらず、現在のビジョンSFT(400-1900ステップ、〜16Mトークン)は、ほぼゼロに近いB6スコア(0.08ツール識別)を出力し、画像の内容を無視します。
再治療(SFT, >=60%リプレイ, 下LR)を規定し, トレーニング崩壊時にチェックポイントローダのバグ(未感染のllm.プレフィックス)が出現する。
重要な点として,周期的非定位符号化 (NoPE) 層が 729 個の視覚ブロックに対する注意を喚起するのに役立つか,あるいは損なうかを調べるために, 3 種類のアブレーション行列 (V0: NoPE-every-4, V1: all-RoPE, V2: NoPE+learned 2D) を導入する。
コード、設定、重み付けがリリースされ、このアーキテクチャ上の問題に優先順位を付ける。
テキストバックボーン用のB1-B5、テキストコントロール、予備的なB6/B7スコア、壁時間、CPU上のGGUF効率、および10ドメインにわたる14,596QAペアのコーパスを提供する。
jsantillana/vectrayx-1b, jsantillana/vectrayx-vision-1b, jsantillana/vectrayx-vision-1b-checks。
関連論文リスト
- Bag of Dims: Training-Free Mechanistic Interpretability via Dimension-Level Sign Patterns [0.0]
我々は、すでにトレーニング不要でアーキテクチャ全般的な機能ベースを提供しているトランスフォーマー隠蔽状態の標準基底を示す。
このBag of Dimsフレームワークを、言語にまたがる7つのモデルで検証する。
論文 参考訳(メタデータ) (2026-06-10T19:34:31Z) - VectraYX-Nano: A 42M-Parameter Spanish Cybersecurity Language Model with Curriculum Learning and Native Tool Use [0.0]
VectraYX-Nanoは、41.95Mパラメータのデコーダのみの言語モデルで、スクラッチから訓練されたスペイン語でサイバーセキュリティを提供する。
クラウドコンピューティングの25ドルで8VMの分散パイプラインで組み立てられた170万のスペインのコーパスは、3つのカリキュラムフェーズ(会話42M、サイバーセキュリティ118M、攻撃ツール10M)に分けられる。
SFT (loss 1.74) の後、v2 ブートストラップ-アブレーション参照は 0.775 +/ の会話ゲートを得る。
論文 参考訳(メタデータ) (2026-05-13T18:03:07Z) - From Mirage to Grounding: Towards Reliable Multimodal Circuit-to-Verilog Code Generation [16.148817642071638]
回路図は、ハードウェアの視覚的なドメイン固有言語と見なすことができる。
このような図をレジスタ-トランスファーレベル(RTL)コードに変換することは、視覚-コード生成のための極めて信頼性の高いテストである。
回路図を空白の画像に置き換えると、Pass@kは変わらないかそれ以上になるのです。
論文 参考訳(メタデータ) (2026-04-30T15:01:27Z) - VScan: Rethinking Visual Token Reduction for Efficient Large Vision-Language Models [57.2662376527586]
VScanは2段階のビジュアルトークン削減フレームワークである。
1)グローバルスキャンとローカルスキャンを視覚的エンコーディング中にマージすることで,(2)言語モデルの中間層にプルーニングを導入する。
VScanはプリフィルの2.91$times$スピードアップとFLOPの10$times$ダウンを実現し、オリジナルのパフォーマンスの95.4%を維持した。
論文 参考訳(メタデータ) (2025-05-28T17:59:08Z) - Perception Encoder: The best visual embeddings are not at the output of the network [70.86738083862099]
本稿では、単純な視覚言語学習によって訓練された画像と映像の理解のための視覚エンコーダであるPerception (PE)を紹介する。
対照的な視覚言語学習だけでは、これらの下流タスクに強力な汎用的な埋め込みを実現できることが分かっています。
PEモデル群は,多種多様なタスクにおいて,クラス内で最高の結果が得られる。
論文 参考訳(メタデータ) (2025-04-17T17:59:57Z) - TULIP: Towards Unified Language-Image Pretraining [60.99500935831526]
既存のCLIPライクなモデルの代替として,オープンソースでドロップイン可能なTを導入する。
提案手法は, 生成データの拡張, 画像画像の強化, テキストコントラスト学習, 画像/テキスト再構成正規化を利用して, きめ細かい視覚的特徴を学習する。
当社のアプローチでは、ベンチマーク全体で既存の最先端(SOTA)モデルを上回っています。
論文 参考訳(メタデータ) (2025-03-19T17:58:57Z) - What If We Recaption Billions of Web Images with LLaMA-3? [46.20091244944309]
我々はLLaMA-3搭載のLLaVA-1.5を微調整し、DataComp-1Bデータセットから13億枚の画像を取得する。
この拡張データセットであるRecap-DataComp-1Bは、先進的な視覚言語モデルのトレーニングにおいて大きなメリットがあることを確認した。
論文 参考訳(メタデータ) (2024-06-12T17:59:07Z) - CogVLM: Visual Expert for Pretrained Language Models [56.69978233342978]
我々は,オープンソースのビジュアル言語基盤モデルであるCogVLMを紹介する。
CogVLMは、凍結した事前訓練された言語モデルとイメージエンコーダの間のギャップを、注意とFFN層でトレーニング可能なビジュアルエキスパートモジュールによって埋める。
CogVLM-17Bは、NoCaps、Flicker30kキャプション、RefCOCO、RefCOCOg、Visual7W、GQA、ScienceQA、VizWiz VQA、TDIUCを含む10の古典的なクロスモーダルベンチマークで最先端のパフォーマンスを達成した。
論文 参考訳(メタデータ) (2023-11-06T13:04:39Z) - BLIP: Bootstrapping Language-Image Pre-training for Unified
Vision-Language Understanding and Generation [86.4572981982407]
視覚言語理解と生成の両方に柔軟に伝達する新しい視覚言語フレームワークBLIPを提案する。
BLIPは、キャプタが合成キャプタを生成し、フィルタがノイズのあるキャプタを除去するキャプタをブートストラップすることで、ノイズの多いWebデータを効果的に活用する。
BLIPはまた、ゼロショット方式で直接ビデオ言語タスクに移行する際に、強力な一般化能力を示す。
論文 参考訳(メタデータ) (2022-01-28T12:49:48Z) - DeepLab2: A TensorFlow Library for Deep Labeling [118.95446843615049]
DeepLab2は、コンピュータビジョンにおける一般的な高密度ピクセル予測問題に対するディープラベリングのためのライブラリである。
DeepLab2には、トレーニング済みのチェックポイントとモデルトレーニングと評価コードを備えた、最近開発したDeepLabモデルのバリエーションがすべて含まれています。
DeepLab2の有効性を示すために、Axial-SWideRNetをネットワークバックボーンとして使用したPanoptic-DeepLabは、Cityscaspes検証セット上で68.0% PQまたは83.5% mIoUを達成した。
論文 参考訳(メタデータ) (2021-06-17T18:04:53Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。