論文の概要: A Layered Simplex Architecture for Large Alphabets
- arxiv url: http://arxiv.org/abs/2608.19908v1
- Date: Thu, 20 Aug 2026 11:24:39 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-21 20:28:51.55414
- Title: A Layered Simplex Architecture for Large Alphabets
- Title(参考訳): 大型Alphabetのための階層型シンプルなアーキテクチャ
- Abstract要約: 4つの特筆すべき特性を持つ新しいベイズ推定器を導入・研究する。
まず、その構成は非常に単純で、多重独立な一様は確率的単純度座標から引き出され、再正規化される。
第二に、結果の混合を後悔して、ソースを知っているコードに対して支払う余分なコードの長さは、明示的で効率的な計算可能な表現を認めます。
- 参考スコア(独自算出の注目度): 4.435094091999926
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Probability estimation over large alphabets under log loss is a well-studied problem, with celebrated methods such as the Good-Turing estimator. We introduce and study a new Bayesian estimator with four notable properties. First, its construction is exceptionally simple: multiply independent uniform draws from the probability simplex coordinate-wise and renormalize. Depth is the only structural parameter, and averaging over depths eliminates the need to tune it. Second, the regret of the resulting mixture, the excess code length it pays relative to a code that knows the source, admits an explicit and efficiently computable expression. Third, despite its simplicity and lack of tuned constants, the estimator is competitive across a diverse set of synthetic and real-text benchmarks with substantially more specialized methods, including Good-Turing. Fourth, the tractability of its regret allows us to identify scaling laws in data, alphabet size, and depth. For Zipf targets with exponent above one, the regret has a simple reading as long as the sample reveals only a small fraction of the alphabet. It closely matches the description length of the set of discovered symbols, at one bit of code per bit of description, plus a further cost per symbol. The data exponent is therefore the rate at which new symbols are discovered.
- Abstract(参考訳): ログロス時の大きなアルファベットに対する確率推定は、グッドチューリング推定器のような有名な手法でよく研究されている問題である。
4つの特筆すべき特性を持つ新しいベイズ推定器を導入・研究する。
まず、その構成は非常に単純で、多重独立な一様は確率的単純度座標から引き出され、再正規化される。
深さが唯一の構造パラメータであり、深さを平均化すると、それを調整する必要がなくなる。
第二に、結果の混合を後悔して、ソースを知っているコードに対して支払う余分なコードの長さは、明示的で効率的な計算可能な表現を認めます。
第三に、その単純さとチューニングされた定数の欠如にもかかわらず、推定子はグッドチューリングを含むかなり専門的な手法で、様々な合成および実テキストのベンチマークに競合する。
第4に、その後悔のトラクタビリティにより、データ、アルファベットサイズ、深さのスケーリング法則を特定できます。
上述の指数を持つZipfターゲットの場合、サンプルがアルファベットのごく一部しか示さない限り、後悔は単純な読みである。
これは、発見されたシンボルのセットの記述長を、記述1ビットあたり1ビットのコードで密に一致させ、シンボル毎のコストをさらに高める。
したがって、データ指数は、新しいシンボルが発見される速度である。
関連論文リスト
- From Early Encoding to Late Suppression: Interpreting LLMs on Character Counting Tasks [49.57538588967748]
LLM(Large Language Model)は、複雑なベンチマークでは優れているにもかかわらず、単語中の文字数などの基本的な記号的タスクにおいて失敗を示す。
我々は、LLaMA、Qwen、Gemmaなど、現代のアーキテクチャにまたがる一貫した現象を発見した。
LLMにおけるシンボリック推論失敗は,表現不足やスケール不足によるものではなく,モデル計算グラフ内の構造的干渉によるものであることを示す。
論文 参考訳(メタデータ) (2026-04-01T11:40:12Z) - LRANet++: Low-Rank Approximation Network for Accurate and Efficient Text Spotting [118.93173826110815]
高精度検出のための低ランク近似に基づく新しいパラメータ化テキスト形状法を提案する。
異なるテキストの輪郭間の固有形状相関を利用して、形状表現の一貫性とコンパクト性を実現する。
我々は、LRANet++と呼ばれるエンドツーエンドテキストスポッティングフレームワークを構築するために、拡張検出モジュールを軽量な認識ブランチに統合する。
論文 参考訳(メタデータ) (2025-11-08T03:08:03Z) - Foundations of Top-$k$ Decoding For Language Models [19.73575905188064]
我々は、トップ$kの復号化を説明・一般化する理論的枠組みを開発する。
大規模な分岐に対して効率的に最適化する方法を示す。
論文 参考訳(メタデータ) (2025-05-25T23:46:34Z) - Fractured Chain-of-Thought Reasoning [61.647243580650446]
完全CoTと解のみのサンプリングを補間する統合推論時間戦略であるフラクチャードサンプリングを導入する。
フラクチャードサンプリングは、Pass@kとトークンの予算に対して、急激なログ線形スケーリングゲインをもたらすため、優れた精度とコストのトレードオフを一貫して達成できることを示す。
論文 参考訳(メタデータ) (2025-05-19T11:30:41Z) - Understanding In-context Learning of Addition via Activation Subspaces [73.8295576941241]
そこで本研究では,入力に整数$k$を追加するという真の予測規則を,数ショット学習タスクの構造化されたファミリについて検討する。
次に、次元の減少と分解を通じて、個々の頭部の詳細な分析を行う。
この結果から,前進パスを横断する局所化頭部の低次元部分空間の追跡が,言語モデルにおける微粒化計算構造に対する洞察を与えることを示す。
論文 参考訳(メタデータ) (2025-05-08T11:32:46Z) - Minimum Description Length and Generalization Guarantees for
Representation Learning [16.2444595840653]
本稿では,表現学習アルゴリズムの一般化誤差の上限を導出するフレームワークを提案する。
エンコーダの入力と表現の間の相互情報ではなく、我々の新しい境界は「マルチレター」相対エントロピーを含む。
著者たちの最もよく知る限り、確立された一般化境界は、情報ボトルネック型エンコーダと表現学習のための第一種である。
論文 参考訳(メタデータ) (2024-02-05T18:12:28Z) - Exploitation of Image Statistics with Sparse Coding in the Case of
Stereo Vision [0.0]
脳はスパース符号を用いて感覚流の統計的特性を利用すると推定されている。
私たちはステレオビジョンのモデルを使って仮説を検証した。
我々は、スパース符号化は後続の推論タスクに適した一般的な表現を生成することができると結論づける。
論文 参考訳(メタデータ) (2021-01-24T12:45:25Z) - K-Deep Simplex: Deep Manifold Learning via Local Dictionaries [8.137198664755598]
そこで我々は,K-Deep Simplexを提案する。K-Deep Simplexは,合成ランドマークからなる辞書と,単純度に支持された表現係数を学習する。
本稿では,最小化の交互化による最適化プログラムを解くとともに,アルゴリズムアンローリングを用いた効率よく解釈可能なオートエンコーダを設計する。
実験により,アルゴリズムは効率が高く,合成データセットや実データに対して競争力があることが示された。
論文 参考訳(メタデータ) (2020-12-03T18:13:26Z) - One-Bit Compressed Sensing via One-Shot Hard Thresholding [7.594050968868919]
1ビット圧縮センシングの問題は、いくつかのバイナリ測定からスパース信号を推定することである。
広範に使われている非制約の幅の概念から遠ざかる、斬新で簡潔な分析法を提案する。
論文 参考訳(メタデータ) (2020-07-07T17:28:03Z) - Composed Fine-Tuning: Freezing Pre-Trained Denoising Autoencoders for
Improved Generalization [93.95299500688286]
本稿では,出力の妥当性制約を考慮した構造化出力の予測問題に焦点をあてる。
本稿では,事前学習したデノイザを組み込んだ予測器を微調整するファインチューニングを提案する。
2層ReLUネットワークの場合、構成した微調整が予測器の複雑さを著しく低減することを示す。
論文 参考訳(メタデータ) (2020-06-29T17:14:35Z) - The Simulator: Understanding Adaptive Sampling in the
Moderate-Confidence Regime [52.38455827779212]
エミュレータと呼ばれる適応サンプリングを解析するための新しい手法を提案する。
適切なログファクタを組み込んだトップk問題の最初のインスタンスベースの下位境界を証明します。
我々の新しい分析は、後者の問題に対するこの種の最初のエミュレータであるベストアームとトップkの識別に、シンプルでほぼ最適であることを示した。
論文 参考訳(メタデータ) (2017-02-16T23:42:02Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。