論文の概要: Transformer Heads Looking for Order
- arxiv url: http://arxiv.org/abs/2609.25588v1
- Date: Tue, 22 Sep 2026 02:33:33 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-23 18:04:04.183093
- Title: Transformer Heads Looking for Order
- Title(参考訳): 変圧器の頭部に秩序を求める
- Abstract要約: ビット列が順序付けられたかどうかをチェックする問題は1ヘッド1層変圧器では不可能であるが、2ヘッド1層変圧器では可能であることを示す。
- 参考スコア(独自算出の注目度): 38.19921735339675
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: In this note, we show that the problem of checking, whether a sequence of bits is ordered, is not doable by 1-head 1-layer transformers but is doable by a 2-head 1-layer transformer. Unlike similar previous results, our results assume the model where transformers have an output MLP.
- Abstract(参考訳): 本稿では,ビット列が順序づけられているかどうかをチェックする問題は,1ヘッド1層変圧器では可能ではないが,2ヘッド1層変圧器では可能であることを示す。
従来の結果と異なり,変換器が出力MPPを持つモデルを想定した。
関連論文リスト
- Parity, Sensitivity, and Transformers [47.03592484094856]
ソフトマックス,長さ非依存かつ有界な位置符号化,レイヤノルムを伴わず,因果マスキングを伴わずに動作可能なPARITY変換器を新たに構築する。
また、1つのレイヤと1つのヘッドだけでは実行できないことも示しています。
論文 参考訳(メタデータ) (2026-02-05T17:14:33Z) - Two Heads Are Better than One: Simulating Large Transformers with Small Ones [3.514389461266844]
長い入力シーケンスを持つ変換器は、短い入力シーケンスしか持たない変換器で効率的にシミュレートできることを示す。
次に、平均ケース入力、スライディングウインドウマスキング、アテンションシンクを含む様々な自然シナリオにおいて、最適数$O(N/M)$の小さな変圧器が十分であることを示す。
論文 参考訳(メタデータ) (2025-06-13T20:47:12Z) - Do Efficient Transformers Really Save Computation? [32.919672616480135]
我々は、効率的な変換器、特にスパース変換器と線形変換器の機能と限界に焦点を当てる。
以上の結果から,これらのモデルは一般のDPタスクを解くのに十分な表現力を持っているが,期待とは裏腹に,問題のサイズに合わせてスケールするモデルサイズが必要であることが示唆された。
我々は,これらのモデルが標準のTransformerよりも効率的であるようなDP問題のクラスを同定する。
論文 参考訳(メタデータ) (2024-02-21T17:00:56Z) - AlgoFormer: An Efficient Transformer Framework with Algorithmic Structures [80.28359222380733]
アルゴリズム機能を備えたトランスフォーマーを実現するために,AlgoFormerと呼ばれる新しいトランスフォーマーフレームワークを設計する。
特に、人間の設計した学習アルゴリズムの構造に触発されて、我々のトランスフォーマーフレームワークは、タスク前処理に責任を持つ事前変換器で構成されています。
いくつかの理論的および実証的な結果は、設計されたトランスフォーマーがアルゴリズム表現と学習を行う可能性があることを示すために提示される。
論文 参考訳(メタデータ) (2024-02-21T07:07:54Z) - On the Power of Saturated Transformers: A View from Circuit Complexity [87.20342701232869]
飽和変圧器はハードアテンション変圧器の限界を超越していることを示す。
硬度から飽和度へのジャンプは、変換器の有効回路深さを$O(log n)$の係数で増加させると解釈できる。
論文 参考訳(メタデータ) (2021-06-30T17:09:47Z) - Scalable Transformers for Neural Machine Translation [86.4530299266897]
トランスフォーマーは、そのキャパシティとシーケンス生成の並列トレーニングのため、ニューラルネットワーク翻訳(NMT)で広く採用されている。
本稿では,異なるスケールのサブトランスフォーマーを自然に含み,パラメータを共有できる,スケーラブルなトランスフォーマーを提案する。
スケーラブルトランスフォーマーのトレーニングの難しさに対処する3段階のトレーニングスキームが提案されている。
論文 参考訳(メタデータ) (2021-06-04T04:04:10Z) - Gaze Estimation using Transformer [14.26674946195107]
我々は、純粋変換器とハイブリッド変換器の2種類の視覚変換器について考察する。
私たちはまず、人気の高いViTに従い、画像から視線を推定するために純粋なトランスフォーマーを使用します。
一方、我々は畳み込み層を保存し、CNNとトランスフォーマーを統合する。
論文 参考訳(メタデータ) (2021-05-30T04:06:29Z) - Pay Attention to MLPs [84.54729425918164]
gMLP はキー言語やアプリケーションで Transformer と同等に動作可能であることを示す。
我々の比較では、gMLPが同じ精度を達成できるため、ビジョントランスフォーマーには自己注意が重要でないことが示されている。
一般的な実験では、gMLPはデータと計算量を増やして、Transformerと同様にスケール可能である。
論文 参考訳(メタデータ) (2021-05-17T17:55:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。