論文の概要: Four Ways to Grow a Classifier and Why One of Them Cannot Learn
- arxiv url: http://arxiv.org/abs/2610.00180v1
- Date: Wed, 16 Sep 2026 22:00:33 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-05 14:48:16.389867
- Title: Four Ways to Grow a Classifier and Why One of Them Cannot Learn
- Title(参考訳): 分類器を成長させる4つの方法と、その1つが学べない理由
- Abstract要約: 本稿では,木構造および構築モデルにおいて,各4つの成長決定が実際に何を買うのかを1つの固定プロトコルで測定する。
この診断は、柔らかい決定木を深くする最も自然な方法に関するもので、すべての葉を2人の子供が親のクラス分布を継承するゲートに変える。
これは全ての新しいゲートの勾配をゼロにし、1/2のゲートは2人の子供に同じ勾配を与えるので、追加のレベルは決して学習できないことを証明します。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Constructive classifiers add structure while they train: a level to a tree, a unit to a hidden layer, a split at a leaf. This paper asks what each of four such growth decisions actually buys, measured under one fixed protocol in tree-structured and constructive models, and gives an exact diagnosis and a fix for the one that buys nothing. The diagnosis concerns the most natural way to deepen a soft decision tree: turn every leaf into a gate whose two children inherit the parent's class distribution, so that the function is unchanged. I prove that this leaves the gradient of every new gate identically zero and, with the gate at 1/2, gives the two children identical gradients, so the added level can never learn. Unlike the symmetry that Net2Net breaks with noise or the saddle point that splitting steepest descent escapes with second-order information, first-order information here is not weak but absent. Over three seeds of five-fold cross-validation the construction loses 19.6 accuracy points on Iris, 19.1 on Wine and 55.6 on Digits against the same depth trained from scratch. The fix is a small random perturbation of the children, whose size barely matters. The practical rule is one line in a test: after adding parameters, assert that their gradient is nonzero. The other three decisions each buy one thing. Fitting a new hidden unit to the residual error before installing it buys a smaller network on every dataset, though not a more accurate one, and on Digits it costs accuracy significantly. Splitting the leaf with the largest expected error buys sparsity, reaching 0.885 with 3.7 splits where a complete depth-six tree uses 63, but loses 4.3 points on a harder problem. Requiring statistical significance before a node receives a more expressive split buys nothing: the tree gets larger and less accurate. Every number in the paper is inserted from the measurement script.
- Abstract(参考訳): 構成的分類器は、訓練中に構造を追加する:木へのレベル、隠された層へのユニット、葉の分割。
本稿では,木構造モデルと建設モデルモデルにおいて,これら4つの成長決定のそれぞれが実際に何を購入するのかを問うとともに,何も買わないものに対して正確な診断と修正を与える。
診断は、柔らかい決定木を深くする最も自然な方法に関するもので、すべての葉を2人の子供が親のクラス分布を継承するゲートに変えることで、その機能は変化しない。
これは全ての新しいゲートの勾配をゼロにし、1/2のゲートは2人の子供に同じ勾配を与えるので、追加のレベルは決して学習できないことを証明します。
Net2Netがノイズで破る対称性や、最も急降下を分割するサドルポイントが2次情報で逃れる対称性とは異なり、ここでの1次情報は弱くないが欠落している。
5倍のクロスバリデーションの3種以上の種子がアイリスで19.6点、ワインで19.1点、ディジットで55.6点、スクラッチで訓練された同じ深さで失われている。
修正は子供たちの小さな無作為な摂動であり、その大きさはほとんど重要ではない。
実際のルールはテストの1行で、パラメータを追加した後、その勾配はゼロではないと断言する。
他の3つの決定はそれぞれ1つのものを購入する。
新しい隠れたユニットをインストールする前に残エラーに合わせると、より正確なものではなく、データセットごとに小さなネットワークが購入され、Digitsでは精度が大幅に低下する。
葉を最大誤差で分割するとスパシティが購入され、3.7分割で0.885に到達し、完全な深度6木は63が使用されるが、難しい問題では4.3ポイントが失われる。
ノードがより表現力のある分割を受け取る前に統計的に重要なことを要求すると、何も買わない。
紙のすべての番号は測定スクリプトから挿入される。
関連論文リスト
- Does the VGGT Family Need All Its Layers? [55.81487806596663]
VGGT,3ドル,VGGT-$:3,018プルーニング構成における層冗長性について検討した。
取り外し可能な層が2つの冗長領域に集結しているのに対して、層間をまたがる削除は、常に破壊的である。
CKAは、間隔分解のためのより安価な表現ベースのプロキシを提供し、プルーニング品質とキャリブレーションコストのトレードオフを提供する。
論文 参考訳(メタデータ) (2026-09-29T06:52:07Z) - Adaptive Multi-Branching for Shallow Decision Tree Induction [1.7872360768760054]
Adaptive Pruning (MBNDT) を用いた多枝神経決定木
MBNDTは、異なるマルチウェイ分割が可能な、単一の軸整列木で訓練されたエンドツーエンドである。
奥行き制約のある単木ベースラインの中で、最高の平均ランクと平均平衡精度を達成する。
論文 参考訳(メタデータ) (2026-08-29T13:35:04Z) - Rethinking Dense Sequential Chains: Reasoning Language Models Can Extract Answers from Sparse, Order-Shuffling Chain-of-Thoughts [51.84894623128418]
現代の推論言語モデルは、すべてのトークンが寄与し、ステップを順番に消費しなければならないと暗黙的に仮定して、シーケンシャルな連鎖トレースを生成する。
我々は、モデル生成推論連鎖に適用した、系統的な介入パイプライン、除去、マスキング、シャッフル、ノイズ注入により、両方の仮定に挑戦する。
解答抽出は, スパース, 秩序不感, 構造的に堅牢な情報基板上で行う。
論文 参考訳(メタデータ) (2026-05-08T06:15:50Z) - Probabilistic Tree-of-thought Reasoning for Answering
Knowledge-intensive Complex Questions [93.40614719648386]
大規模言語モデル(LLM)は、知識集約的な複雑な質問にチェーン・オブ・シント(CoT)推論で答えることができる。
最近の研究は、CoT推論を強化するための外部知識の回収に向けられている。
確率的ツリー・オブ・シント推論(ProbTree)という新しいアプローチを提案する。
論文 参考訳(メタデータ) (2023-11-23T12:52:37Z) - NodeFormer: A Scalable Graph Structure Learning Transformer for Node
Classification [70.51126383984555]
本稿では,任意のノード間のノード信号を効率的に伝搬する全ペアメッセージパッシング方式を提案する。
効率的な計算は、カーナライズされたGumbel-Softmax演算子によって実現される。
グラフ上のノード分類を含む様々なタスクにおいて,本手法の有望な有効性を示す実験を行った。
論文 参考訳(メタデータ) (2023-06-14T09:21:15Z) - Improving the Validity of Decision Trees as Explanations [2.457872341625575]
葉ノード間の最大誤分類誤差を最小限に抑えるために,浅い木を訓練する。
浅い木の全体的な統計性能は最先端の手法に匹敵する。
論文 参考訳(メタデータ) (2023-06-11T21:14:29Z) - Active-LATHE: An Active Learning Algorithm for Boosting the Error
Exponent for Learning Homogeneous Ising Trees [75.93186954061943]
我々は、$rho$が少なくとも0.8$である場合に、エラー指数を少なくとも40%向上させるアルゴリズムを設計し、分析する。
我々の分析は、グラフの一部により多くのデータを割り当てるために、微小だが検出可能なサンプルの統計的変動を巧みに活用することに基づいている。
論文 参考訳(メタデータ) (2021-10-27T10:45:21Z) - Growing Deep Forests Efficiently with Soft Routing and Learned
Connectivity [79.83903179393164]
この論文は、いくつかの重要な側面で深い森林のアイデアをさらに拡張します。
我々は、ノードがハードバイナリ決定ではなく、確率的ルーティング決定、すなわちソフトルーティングを行う確率的ツリーを採用する。
MNISTデータセットの実験は、私たちの力のある深部森林が[1]、[3]よりも優れたまたは匹敵するパフォーマンスを達成できることを示しています。
論文 参考訳(メタデータ) (2020-12-29T18:05:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。