論文の概要: BiKAN: Restoring Collapsed Basis of Binary Kolmogorov--Arnold Networks
- arxiv url: http://arxiv.org/abs/2608.01490v1
- Date: Sun, 02 Aug 2026 20:49:59 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:25.257627
- Title: BiKAN: Restoring Collapsed Basis of Binary Kolmogorov--Arnold Networks
- Title(参考訳): BiKAN: バイナリなKolmogorov--Arnoldネットワークの崩壊を回復
- Authors: Kazi Ahmed Asif Fuad, Lizhong Chen,
- Abstract要約: Kolmogorov-Arnold Network(KAN)のバイナリ化は各レイヤで利用可能な関数空間を変更する。
提案するBiKANは,各2進数2のWalsh文字を加算することにより,この問題に対処する。
W1A1では、ビカンは99.48%、84.38%、Mは55.81%、401AR-10は72AR-100である。
- 参考スコア(独自算出の注目度): 6.860988566886594
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Binarizing a polynomial Kolmogorov--Arnold Network (KAN) not only changes parameter precision, but also alters the function space available to each layer. When activations are restricted to ${-1,+1}$, all even powers reduce to $1$ and all odd powers reduce to $x$, causing the elementwise polynomial basis to collapse to constant and first-order responses. We refer to this structural failure as Spatial Orthogonality Collapse. Our proposed BiKAN addresses this critical issue by augmenting each binary KAN layer with selected degree-2 Walsh characters. Fixed circular channel rolls generate pairwise parities, and learned binary projections mix them using the same XNOR--popcount operations as the remaining W1A1 paths. This restores explicit pairwise coordinates without learned routing or multiplier-based feature generation. Experiments on CIFAR-10 confirms that removing parity reduces accuracy by $1.23$ points over five paired seeds ($p=0.003$), the gain increases as width decreases, and accuracy improves monotonically as more parity planes are added. At an equal $\sim$11.9M-parameter budget, parity outperforms conventional widening by $3.09$ points ($p<10^{-4}$). At W1A1, BiKAN reaches $99.48\%$, $84.38\%$, and $55.81\%$ on MNIST, CIFAR-10, and CIFAR-100, respectively. Post-route Zynq-7020 FPGA results show that the repair remains hardware-efficient; the convolutional design cuts DSP usage from 164 to 72 and estimated compute-core latency from 401 to 54.8 ms, while the power-of-two-aware dense design achieves zero-DSP inference with a 0.03-point accuracy loss. The BiKAN implementation is available at https://github.com/OSU-STARLAB/BiKAN.
- Abstract(参考訳): 多項式コルモゴロフ-アルノルドネットワーク(KAN)の双対化はパラメータの精度を変化させるだけでなく、各層で利用可能な関数空間も変更する。
アクティベーションが${-1,+1}$に制限されると、すべての偶数は$$$に減少し、すべての奇数が$x$に減少し、要素的に多項式基底が定数かつ一階の応答に崩壊する。
この構造的失敗を空間直交衝突と呼ぶ。
提案するBiKANは,各2値のkan層にWalsh文字を選択して拡張することで,この問題に対処する。
固定円形チャネルロールはペアワイズパリティを生成し、学習されたバイナリプロジェクションは、残りのW1A1パスと同じXNOR-Popcount操作を使用してそれらを混合する。
これは、学習したルーティングや乗算器ベースの特徴生成なしで明示的なペアワイズ座標を復元する。
CIFAR-10の実験では、パリティ除去は5対の種子(p=0.003$)に対して1.23$ポイントの精度を低下させ、幅が減少するにつれて利得が増加し、パリティ平面が増すにつれて精度が単調に向上することを確認した。
対等な$\sim$11.9Mパラメーターの予算では、パリティは従来の3.09ドルポイント(p<10^{-4}$)よりも優れていた。
W1A1 では、ビカンは MNIST と CIFAR-10 と CIFAR-100 でそれぞれ$99.48\%、$84.38\%、$55.81\%に達する。
畳み込み設計はDSPの使用量を164から72に減らし、計算コアのレイテンシを401から54.8msに見積もった。
BiKANの実装はhttps://github.com/OSU-STARLAB/BiKANで公開されている。
関連論文リスト
- Covariance Last-Layer Ensembles: Function-Space Diversity for Efficient Uncertainty Quantification [0.8803840644459077]
Cov-LLEは、ウェイト・オルソノーマル性が不可能な関数空間の多様性を復元し、マッチした$K$は深いアンサンブルの多様性と校正の多くを回復する。
OCを最終層アンサンブルと見なすと、検出器を2軸の分類に整理する。
論文 参考訳(メタデータ) (2026-07-26T21:56:02Z) - Saturation Makes Quantization Error Additive: A Coverage Model with a Certificate [0.0]
混合精度量子化は、モデルのどの部分がより高い精度を維持するかを決定する必要がある。
本研究は, 層単位での定量化による損失を, 層ごとの感性や, 対方向の感性から再現可能であることを示す。
本稿では, 測定値の差分プロファイルである$f(S)=cbigl (1-prod_iin S (1-a_i)bigr)$を, その$L$適合ブレークレートから数パーセント以内まで再現する。
論文 参考訳(メタデータ) (2026-07-14T02:08:33Z) - Structural Kolmogorov-Arnold Convolutions: Learnable Function on the Values or the Filter Shape as Parameter-Efficient Alternative to Per-Edge Convolutional KANs [76.06235645266621]
Convolutional Kolmogorov--Arnold Networks (KAN) は、畳み込みカーネルの固定重みを学習可能な単変数関数に置き換える。
学習可能な関数は、各エッジよりも畳み込みのエンファン構造に置かれる方がよいと我々は主張する。
論文 参考訳(メタデータ) (2026-06-23T10:00:26Z) - Representation Without Reward: A JEPA Audit for LLM Fine-Tuning [1.2691047660244335]
JEPA(Joint-embedding predictive Architectures)は、モデルが観測された出力よりも遅延表現を予測できるように訓練された時に、より有用な抽象化を学ぶべきであることを提案している。
自己回帰型言語モデルの微調整には、この原理はより厳密な要件を必要とする。
我々は、Llama-3.2-1B-Instruct LoRA を用いて、自然言語からレジェックス生成におけるその要件を検証した。
論文 参考訳(メタデータ) (2026-05-14T20:27:32Z) - Block-Wise Differentiable Sinkhorn Attention: Tail-Refinement Gradients with a Gap-Aware Dustbin Bridge [0.0]
本稿では,TPUハードウェア上での長期的コンテキストバランスによる最適輸送注意度を,停止ベース,固定深部テールリファインメントサロゲートを用いて検討する。
本稿では, 局所的代理バイアスバウンド, 後部バイアス証明書, および, 厳密な正の能動ブロックに対する射影収縮証明書を提供する。
合成マスク問題では、最適化された置換基の正確なオートディフは10〜5ドル-10〜10ドルである。
論文 参考訳(メタデータ) (2026-04-28T19:01:11Z) - INC: An Indirect Neural Corrector for Auto-Regressive Hybrid PDE Solvers [61.84396402100827]
本稿では,学習した補正を支配方程式に統合する間接ニューラルコレクタ(mathrmINC$)を提案する。
$mathrmINC$は、$t-1 + L$の順番でエラー増幅を減らし、$t$はタイムステップ、$L$はリプシッツ定数である。
大規模なベンチマークで$mathrmINC$をテストし、1Dカオスシステムから3D乱流まで、多くの異なる解法、神経バックボーン、テストケースをカバーした。
論文 参考訳(メタデータ) (2025-11-16T20:14:28Z) - Scalable 3D Registration via Truncated Entry-wise Absolute Residuals [65.04922801371363]
3ドルの登録アプローチでは、1000万ドル(107ドル)以上のポイントペアを、99%以上のランダムなアウトレイアで処理することができる。
我々はこの手法をTEARと呼び、Trncated Entry-wise Absolute Residualsを演算するoutlier-robust損失を最小限にする。
論文 参考訳(メタデータ) (2024-04-01T04:43:39Z) - Improved techniques for deterministic l2 robustness [63.34032156196848]
畳み込みニューラルネットワーク(CNN)を$l_2$ノルムの下で厳密な1-Lipschitz制約で訓練することは、対向的堅牢性、解釈可能な勾配、安定した訓練に有用である。
我々は,最後の線形層を1重層に置き換えることで,1-Lipschitz CNNのロバスト性を証明する手法を提案する。
我々は,CIFAR-10およびCIFAR-100における標準および証明可能な堅牢な精度の最先端化を図る。
論文 参考訳(メタデータ) (2022-11-15T19:10:12Z) - Deep Learning Meets Projective Clustering [66.726500395069]
NLPネットワークを圧縮するための一般的なアプローチは、埋め込み層を行列 $AinmathbbRntimes d$ としてエンコードすることである。
計算幾何学から遠射的クラスタリングに着想を得て、この部分空間を$k$部分空間の集合で置き換えることを提案する。
論文 参考訳(メタデータ) (2020-10-08T22:47:48Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。