論文の概要: The Scaling Properties of Implicit Deductive Reasoning in Transformers
- arxiv url: http://arxiv.org/abs/2605.04330v1
- Date: Tue, 05 May 2026 22:35:46 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-07 18:41:07.562202
- Title: The Scaling Properties of Implicit Deductive Reasoning in Transformers
- Title(参考訳): 変圧器におけるインシシッド導電性推論のスケーリング特性
- Authors: Enrico Vompa, Tanel Tammet,
- Abstract要約: 深度有界変圧器におけるHhorn節上の暗示的帰納的推論のスケーリング特性について検討する。
両方向のプレフィックスマスクを持つ十分に深いモデルでは、暗黙の推論がグラフトポロジと問題幅にまたがる明示的なCoT性能にアプローチしていることが分かる。
- 参考スコア(独自算出の注目度): 0.42970700836450487
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We investigate the scaling properties of implicit deductive reasoning over Horn clauses in depth-bounded Transformers. By systematically decorrelating provability from spurious features and enforcing algorithmic alignment, we find that in sufficiently deep models with a bidirectional prefix mask, implicit reasoning approaches explicit CoT performance across graph topologies and problem widths, though CoT remains necessary for depth extrapolation.
- Abstract(参考訳): 深度有界変圧器におけるHhorn節上の暗示的帰納的推論のスケーリング特性について検討する。
突発的特徴からの証明可能性とアルゴリズムのアライメントを体系的に再現することにより、二方向のプレフィックスマスクを持つ十分に深いモデルでは、グラフトポロジと問題幅にまたがる明示的なCoT性能に暗黙的推論がアプローチすることが分かるが、CoTは深度外挿には依然として必要である。
関連論文リスト
- TensorLens: End-to-End Transformer Analysis via High-Order Attention Tensors [53.891337639229285]
高次アテンション・インタラクション接続を通して表現された入力依存線形演算子として変換器全体をキャプチャする新しい定式化である attentionLens を導入する。
本実験は,注目テンソルが,解釈可能性とモデル理解を目的としたツール開発のための強力な基盤となることを実証した。
論文 参考訳(メタデータ) (2026-01-25T19:21:25Z) - Drawback of Enforcing Equivariance and its Compensation via the Lens of Expressive Power [75.44625156899468]
等式および層ワイド等式ネットワークの表現性に対する等式制約の影響について検討する。
モデルのサイズが大きくなるにもかかわらず、結果として得られるアーキテクチャは、複雑さの低い仮説空間に対応できることを示した。
論文 参考訳(メタデータ) (2025-12-10T14:18:59Z) - Revisiting Zeroth-Order Optimization: Minimum-Variance Two-Point Estimators and Directionally Aligned Perturbations [57.179679246370114]
乱摂動の分布は, 摂動段差がゼロになる傾向にあるため, 推定子の分散を最小限に抑える。
以上の結果から, 一定の長さを維持するのではなく, 真の勾配に方向を合わせることが可能であることが示唆された。
論文 参考訳(メタデータ) (2025-10-22T19:06:39Z) - Bounds of Chain-of-Thought Robustness: Reasoning Steps, Embed Norms, and Beyond [64.88201012057822]
既存の研究では、CoT(Chain-of-Thought)の出力が入力摂動に大きく影響していることが示されている。
我々は,CoT出力の変動に対する入力摂動の影響を理論的に解析する。
論文 参考訳(メタデータ) (2025-09-25T15:04:31Z) - Transformers Are Universally Consistent [14.904264782690639]
ソフトマックスに基づく非線形アテンションを備えたトランスフォーマーは,最小二乗の回帰処理を行う場合,一様に整合性を示す。
我々は経験的誤差の上限を導出し、この条件下では$mathcalO(t-1/2d)$の証明可能な速度で減衰し、$t$は入力トークンの数を表し、$d$は埋め込み次元を表す。
論文 参考訳(メタデータ) (2025-05-30T12:39:26Z) - Regularization by Texts for Latent Diffusion Inverse Solvers [55.97917698941313]
本稿では,人間の視覚的あいまいさを知覚バイアスによって解決する能力に触発されて,テキストによる正規化(TReg)と呼ばれる新しい潜伏拡散逆解法を導入する。
実験の結果,TRegは逆問題におけるあいまいさを効果的に軽減し,精度と効率を両立させることがわかった。
論文 参考訳(メタデータ) (2023-11-27T09:40:14Z) - Representational Strengths and Limitations of Transformers [33.659870765923884]
我々は,注目層の表現力について,肯定的な結果と否定的な結果の両方を定めている。
トランスにおける大きな埋め込み次元の必要性と役割を示す。
また、注意層によって効率的に解ける自然変種も提示する。
論文 参考訳(メタデータ) (2023-06-05T14:05:04Z) - Semi-supervised Invertible DeepONets for Bayesian Inverse Problems [8.594140167290098]
DeepONetsは、学習オペレーターによってパラメトリックPDEを解決する強力なデータ駆動ツールを提供する。
本研究では,高次元ベイズ逆問題(Bayesian inverse problem)の文脈で物理インフォームド・ディープノネット(DeepONets)を用いる。
論文 参考訳(メタデータ) (2022-09-06T18:55:06Z) - Unraveling Attention via Convex Duality: Analysis and Interpretations of
Vision Transformers [52.468311268601056]
本稿では凸双対性のレンズを通して注意を解析する。
我々は、大域的最適性に対して解釈可能で解ける等価な有限次元凸問題を導出する。
自己認識ネットワークがトークンを暗黙的にクラスタリングする方法を示す。
論文 参考訳(メタデータ) (2022-05-17T04:01:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。