論文の概要: The Wiola Architecture for Efficient Small Language Models
- arxiv url: http://arxiv.org/abs/2607.01394v1
- Date: Wed, 01 Jul 2026 18:52:56 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 19:45:08.559664
- Title: The Wiola Architecture for Efficient Small Language Models
- Title(参考訳): 効率的な小言語モデルのためのウィオラアーキテクチャ
- Authors: Aryuemaan Kumar Chowdhury, Afreen Shaik, Yaparla Bhargavi, Brahma Kumar,
- Abstract要約: 第一原理から構築された、完全にオリジナルなSLMアーキテクチャであるWiolaを紹介します。
本稿では,GPT-2,LLaMA-2,Mistralに対する導出,アーキテクチャブロック図,複雑性解析,系統的比較について述べる。
Wiolaは4つのサイズ(120M、360M、700M、1.5Bパラメータ)でリリースされており、Hugging Transformersエコシステムと完全に互換性がある。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: We present Wiola, a fully original Small Language Model (SLM) architecture built from first principles, sharing no structural lineage with any existing model family including GPT, LLaMA, Mistral, or Falcon. Wiola introduces five independently novel components: (i) Spiral Rotary Positional Encoding (SRPE), which embeds token positions on a three-dimensional helical manifold combining absolute, relative, and hierarchical positional signals; (ii) Gated Cross-Layer Attention (GCLA), providing each decoder layer with soft cross-attention access to compressed summaries of two preceding layers for inter-layer coherence; (iii) Adaptive Token Merging (ATM), which dynamically merges se mantically redundant adjacent tokens in middle network layers to reduce attention complexity without information loss; (iv) Dual Stream Feed-Forward (DSFF), replacing the conventional MLP with two parallel streams fused by a learned per-dimension gate; and (v) WiolaRMSNorm, a modified normalisation introducing a per-dimension learned offset vector that prevents representation collapse. We provide complete mathematical derivations, architectural block diagrams, complexity analyses, and systematic comparisons against GPT-2, LLaMA-2, and Mistral. Wiola is released in four sizes (120M, 360M, 700M, and 1.5B parameters) and is fully compatible with the HuggingFace Transformers ecosystem, with all 22 architectural unit tests passing.
- Abstract(参考訳): このアーキテクチャは、GPT、LLaMA、Mistral、Falconを含む既存のモデルファミリと構造的な血統を共有しない。
Wiolaは5つの独立した新しいコンポーネントを紹介している。
一 絶対的、相対的、階層的位置信号を組み合わせた三次元ヘリカル多様体にトークン位置を埋め込むスパイラル回転位置符号化(SRPE)
(ii)GCLA(Gated Cross-Layer Attention)は、各デコーダ層に対し、2つの先行層の圧縮要約にソフトなクロスアテンションアクセスを提供することにより、層間コヒーレンスを実現する。
3 中間ネットワーク層に相互に隣接したトークンを動的にマージし、情報損失を伴わずに注意の複雑さを低減させる適応トークンマージ(ATM)
(4)従来のMLPを学習した1次元ゲートで融合した2つの平行流に置き換えたDual Stream Feed-Forward(DSFF)
(v)ワイオラRMSNormは1次元の学習オフセットベクトルを導入し、表現の崩壊を防ぐ修正正規化である。
我々は、GPT-2、LLaMA-2、Mistralに対する完全な数学的導出、アーキテクチャブロック図、複雑性解析、体系的な比較を提供する。
Wiolaは4つのサイズ(120M、360M、700M、1.5Bパラメータ)でリリースされており、HuggingFace Transformersエコシステムと完全に互換性がある。
関連論文リスト
- MambaADv2: Evolving Duality-enhanced State Space Model for Unsupervised Anomaly Detection [108.36437360254605]
本稿では,マルチクラス非教師付き異常検出に適したフレームワークであるMambaADv2を提案する。
MambaADv2は、事前訓練されたエンコーダと、複数のスケールにわたるDuality-enhanced State Space (DSS)モジュールを備えたMambaインスパイアされたデコーダで構成される。
HSS(Hybrid State Space)ブロックの構造は、SSDベースのMambaラインに従って調整され、Mamba3スタイルの位置認識状態空間モデリングが組み込まれている。
論文 参考訳(メタデータ) (2026-06-22T10:14:06Z) - FiLM-Coordinated Dual-Branch Transformer for Global-Local Dependency Modeling in Language Modeling [4.131782714245991]
言語モデリングのためのFILMコーディネート二分岐変換器を提案する。
2つのブランチは同じ入力の異なる依存性ビューを表す。
小規模な言語モデリング設定の実験では、提案した構造が同一幅の単一ブランチベースラインを一貫して上回っていることが示されている。
論文 参考訳(メタデータ) (2026-06-19T03:48:49Z) - UniCVR: From Alignment to Reranking for Unified Zero-Shot Composed Visual Retrieval [87.12447641908143]
組込みゼロショット合成ビジュアル検索フレームワークUniCVRを提案する。
UniCVRは、タスク固有の人間アノテーションのない3つのタスクすべてに共同で対処する。
ステージIでは,約3.5Mサンプルのキュレートされたデータセットに対して,コントラスト学習によりMLLMを合成クエリ埋め込み器として訓練する。
ステージIIでは,少数の上位候補に対して適応的予算付サブセットスコアを付与するMLLM誘導二重レベル再ランク機構を導入する。
論文 参考訳(メタデータ) (2026-04-22T08:16:50Z) - Hierarchical Awareness Adapters with Hybrid Pyramid Feature Fusion for Dense Depth Prediction [9.96771578356719]
既存のアプローチは、深度マップを回帰するために、ますます複雑なネットワークアーキテクチャに依存している。
本論文では,Swin Transformerのバックボーン上に構築したマルチレベル条件付きランダムフィールド(CRF)モデルを提案する。
本稿では,Abs Relを0.088ドル(約7.4%)に,RMSEを0.316ドル(約5.4%)に削減し,ほぼ完全なしきい値精度を実現した。
論文 参考訳(メタデータ) (2026-04-03T07:59:26Z) - Search Multilayer Perceptron-Based Fusion for Efficient and Accurate Siamese Tracking [3.7727834708902868]
MLP(Multilayer Perception)ベースの融合モジュールは、最小構造オーバーヘッドでピクセルレベルの相互作用を可能にする。
異なるニューラルネットワークサーチ(DNAS)により、チャネル幅最適化と他のアーキテクチャ選択を分離する。
トラッカーは4つの汎用と3つの空中ベンチマークでトップパフォーマーにランクインする。
論文 参考訳(メタデータ) (2026-03-02T10:30:54Z) - TLC-Plan: A Two-Level Codebook Based Network for End-to-End Vector Floorplan Generation [19.063941053235567]
空間入力境界からベクトルを直接合成する階層的生成モデルであるTLC-Planを提案する。
TLC-Planは、グローバルレイアウトをセマンティックラベル付きルームバウンディングボックスとしてエンコードするために、2レベルVQ-VAEを使用している。
実験では、RPLANデータセット上での最先端のパフォーマンスと、LIデータセット上でのリード結果が示されている。
論文 参考訳(メタデータ) (2026-02-06T15:36:50Z) - LLaVA-UHD v3: Progressive Visual Compression for Efficient Native-Resolution Encoding in MLLMs [52.24096832965001]
提案するプログレッシブ・ビジュアル・圧縮(PVC)法を中心としたMLLMであるLLaVA-UHD v3を提案する。
PVC法は、視覚変換器(ViT)にシームレスに統合して、効率的なネイティブ解像度符号化を可能にする。
ViT-UHDをベースとしたLLaVA-UHD v3はQwen2-VLとの競合性能も達成し、TTFTを1.9倍削減した。
論文 参考訳(メタデータ) (2025-11-26T08:11:10Z) - UniPTMs: The First Unified Multi-type PTM Site Prediction Model via Master-Slave Architecture-Based Multi-Stage Fusion Strategy and Hierarchical Contrastive Loss [7.9318919792252585]
本研究は,マルチタイプPTM予測のための最初の統一フレームワークであるUniPTMを提案する。
UniPTMは最先端モデルの大幅な性能向上を示す。
モデル複雑性と性能のバランスをとるために、UniPTMs-miniという軽量版も開発しました。
論文 参考訳(メタデータ) (2025-06-05T13:02:43Z) - AMT: All-Pairs Multi-Field Transforms for Efficient Frame Interpolation [80.33846577924363]
ビデオフレームギスブのための新しいネットワークアーキテクチャであるAMT(All-Pairs Multi-Field Transforms)を提案する。
まず、すべての画素に対して双方向のボリュームを構築し、予測された両側フローを用いて相関関係を検索する。
第2に、入力フレーム上で逆向きのワープを行うために、一対の更新された粗い流れから細粒度の流れ場の複数のグループを導出する。
論文 参考訳(メタデータ) (2023-04-19T16:18:47Z) - Squeezeformer: An Efficient Transformer for Automatic Speech Recognition [99.349598600887]
Conformerは、そのハイブリッドアテンション・コンボリューションアーキテクチャに基づいて、様々な下流音声タスクの事実上のバックボーンモデルである。
Squeezeformerモデルを提案する。これは、同じトレーニングスキームの下で、最先端のASRモデルよりも一貫して優れている。
論文 参考訳(メタデータ) (2022-06-02T06:06:29Z) - Dual-constrained Deep Semi-Supervised Coupled Factorization Network with
Enriched Prior [80.5637175255349]
本稿では、DS2CF-Netと呼ばれる、拡張された事前制約付きDual-Constrained Deep Semi-Supervised Coupled Factorization Networkを提案する。
隠れた深い特徴を抽出するために、DS2CF-Netは、深い構造と幾何学的な構造に制約のあるニューラルネットワークとしてモデル化される。
我々のネットワークは、表現学習とクラスタリングのための最先端の性能を得ることができる。
論文 参考訳(メタデータ) (2020-09-08T13:10:21Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。