論文の概要: Dynamic Large Concept Models: Latent Reasoning in an Adaptive Semantic Space
- arxiv url: http://arxiv.org/abs/2512.24617v2
- Date: Mon, 05 Jan 2026 05:44:29 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-01-06 14:31:43.748487
- Title: Dynamic Large Concept Models: Latent Reasoning in an Adaptive Semantic Space
- Title(参考訳): 動的大規模概念モデル:適応意味空間における潜在推論
- Abstract要約: 大規模言語モデル (LLM) は、高度に一様でない情報密度を示す言語にもかかわらず、全てのトークンに一様計算を適用する。
我々は,潜在表現から意味境界を学習し,トークンから推論がより効率的である圧縮概念空間へ移行する階層型言語モデリングフレームワークである$textbfDynamic Large Concept Models (DLCM)$を提案する。
- 参考スコア(独自算出の注目度): 56.37266873329401
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Large Language Models (LLMs) apply uniform computation to all tokens, despite language exhibiting highly non-uniform information density. This token-uniform regime wastes capacity on locally predictable spans while under-allocating computation to semantically critical transitions. We propose $\textbf{Dynamic Large Concept Models (DLCM)}$, a hierarchical language modeling framework that learns semantic boundaries from latent representations and shifts computation from tokens to a compressed concept space where reasoning is more efficient. DLCM discovers variable-length concepts end-to-end without relying on predefined linguistic units. Hierarchical compression fundamentally changes scaling behavior. We introduce the first $\textbf{compression-aware scaling law}$, which disentangles token-level capacity, concept-level reasoning capacity, and compression ratio, enabling principled compute allocation under fixed FLOPs. To stably train this heterogeneous architecture, we further develop a $\textbf{decoupled $μ$P parametrization}$ that supports zero-shot hyperparameter transfer across widths and compression regimes. At a practical setting ($R=4$, corresponding to an average of four tokens per concept), DLCM reallocates roughly one-third of inference compute into a higher-capacity reasoning backbone, achieving a $\textbf{+2.69$\%$ average improvement}$ across 12 zero-shot benchmarks under matched inference FLOPs.
- Abstract(参考訳): 大規模言語モデル (LLM) は、高度に一様でない情報密度を示す言語にもかかわらず、全てのトークンに一様計算を適用する。
このトークン・ユニフォーム・レシエーションは、局所的に予測可能なスパンの容量を無駄にし、計算を意味論的に重要な遷移にアンダーアロケートする。
これは階層型言語モデリングフレームワークで、潜在表現からセマンティックバウンダリを学習し、トークンから推論がより効率的である圧縮概念空間へ計算をシフトする。
DLCMは、事前定義された言語単位に頼ることなく、変数長の概念をエンドツーエンドで発見する。
階層圧縮は基本的にスケーリングの振る舞いを変える。
トークンレベルのキャパシティ,概念レベルの推論能力,圧縮比を両立させた最初の$\textbf{compression-aware scaling law}$を導入し,固定FLOP下での計算割り当てを原則とした。
この不均一なアーキテクチャを安定的にトレーニングするために、幅と圧縮機構をまたいだゼロショットハイパーパラメータ転送をサポートする$\textbf{decoupled $μ$P parametrization}$をさらに発展させる。
現実的な設定(R=4$、概念毎の平均4トークンに対応する)では、DLCMは推論計算のおよそ3分の1を高容量の推論バックボーンに再配置し、一致した推論FLOPの下で12のゼロショットベンチマークで$\textbf{+2.69$\%$平均改善を達成している。
関連論文リスト
- Omni2LoRA: Coherence-Preserving Parametric Memory for Efficient Omni Language Models [65.49950267695267]
我々はコヒーレンス保存コンテクスト蒸留によるパラメトリックメモリの効率的な圧縮フレームワークであるOmni2LoRAを紹介する。
本手法は,マルチモーダルメモリを固定予算で再利用可能なパラメータ状態に変換することにより,応答時間のマルチモーダルトーケン負荷をゼロにする。
論文 参考訳(メタデータ) (2026-08-10T07:49:10Z) - Variable-Width Transformers [57.07167443557886]
本稿では,$times$-shaped > former architectureを提案する。
我々の設計は、パラメータフリーの残留リサイズ機構を利用して、中間層を狭めながら、より広い早期層と後期層を維持している。
平均的な層幅を減らすことで、このアーキテクチャは全体のFLOPを少なくし、KVキャッシュメモリを小さくし、I/Oコストを削減できる。
論文 参考訳(メタデータ) (2026-06-16T17:59:03Z) - Subspace-Aware Sparse Autoencoders for Effective Mechanistic Interpretability [11.543771846135021]
スパースオートエンコーダ(SAE)は、大規模言語モデルにおける機械的解釈可能性に広く用いられている。
この仮定はモデル特徴の多次元構造と一致しないことを示す。
本稿では,単一ベクトルデコーダを学習したデコーダサブスペースに置き換えるSubspace-Aware Sparse Autoencoders (SASA)を紹介する。
論文 参考訳(メタデータ) (2026-06-04T16:08:25Z) - Imbuing Large Language Models with Bidirectional Logic for Robust Chain Repair [44.80087038178069]
本稿では,デコーダのみのトランスフォーマーをネイティブに組み込んだトレーニングフレームワークであるTeleological Reasoning Infilling (TRI)を紹介する。
推測では、TRIは二重システムループ内の外科的修復モジュールとして動作する。
3つのベンチマークの実験では、TRIは全てのタスクで最先端のパフォーマンスを達成し、プロブレム当たりのトークン支出を31.2%削減した。
論文 参考訳(メタデータ) (2026-06-03T15:58:48Z) - Representational Capacity: Geometric Limits on Feature Representation in Transformer Language Models [51.56484100374058]
モデルがサポートできるほぼ直交方向数を推定するためのフレームワークを開発する。
このメトリックを数十のオープンソースモデルに適用すると、高い$varepsilon$を持つモデルと、それを維持する$varepsilon$の低いモデルという2つのクラスが明らかになる。
論文 参考訳(メタデータ) (2026-06-01T18:28:56Z) - Learn from your own latents and not from tokens: A sample-complexity theory [53.5821824211418]
本研究では,関連するビューやマスキング領域の潜在表現を予測するために訓練されたネットワークについて検討する。
潜在予測は、対数的要因まで、多くのサンプルを$L$で表すことでこれを達成できることを示す。
これは、H-JEPAのような明示的な積み重ねがほとんど冗長であることを示している。
論文 参考訳(メタデータ) (2026-05-26T22:16:42Z) - Efficient Quantum Fully Homomorphic Encryption [10.250303062295801]
量子完全同型暗号(QFHE)は、セキュアなデリゲート量子計算を約束する。
本稿では,テキストの効率向上を実現する統一的なフレームワークを提案する。
このフレームワークはMAPからガーデンホースモデルによる効率的なガジェットへの直接マッピングを提供し、MBQCは同型評価のための決定論的制御フローを提供する。
論文 参考訳(メタデータ) (2026-04-26T01:48:28Z) - Probabilistic Language Tries: A Unified Framework for Compression, Decision Policies, and Execution Reuse [0.0]
列上の任意の生成確率モデルによって暗黙的に定義されたプレフィックス構造を明示する統一表現であるLanguage Try (PLTs)を導入する。
また,任意のデータセットをカバー多数とスパース残量ストアに分解するハイブリッド圧縮アーキテクチャを導入し,Kolmogorov型プログラム表現とレート歪み理論を接続する。
論文 参考訳(メタデータ) (2026-03-29T21:24:26Z) - ConceptMoE: Adaptive Token-to-Concept Compression for Implicit Compute Allocation [12.503747711792679]
ConceptMoEは意味的に類似したトークンを概念表現に動的にマージする。
学習可能なチャンクモジュールは、トークン間の類似度を測定して最適な境界を識別する。
ConceptMoE は言語および視覚言語タスクで標準 MoE を一貫して上回っている。
論文 参考訳(メタデータ) (2026-01-29T08:58:22Z) - Unified Scaling Laws for Compressed Representations [69.72517034565467]
各種圧縮表現上でのトレーニングにおいて,統合スケーリングフレームワークがモデル性能を正確に予測できるかどうかを検討する。
我々の主な発見は、単純な「容量」計量が存在するという理論と経験の両方を実証することである。
我々は、圧縮されたフォーマットの精度を直接比較し、スパース量子化されたフォーマットのトレーニングのためのより良いアルゴリズムを導出するために、定式化を拡張した。
論文 参考訳(メタデータ) (2025-06-02T16:52:51Z) - Bound by semanticity: universal laws governing the generalization-identification tradeoff [8.437463955457423]
有限分解能の類似性は、単なる玩具・模型の人工物ではなく、基本的な創発的な情報制約であることを示す。
これらの結果は、一般化識別トレードオフの正確な理論を提供し、意味論的解決がディープネットワークや脳の表現能力をどのように形成するかを明らかにする。
論文 参考訳(メタデータ) (2025-06-01T15:56:26Z) - Compression Hacking: A Supplementary Perspective on Informatics Properties of Language Models from Geometric Distortion [56.12939353271623]
幾何学的観点から、高度に圧縮されたLMのワード表現空間は、非常に異方性のある状態に縮退する傾向がある。
この同期性は基本的にLM表現におけるCompression Hacking''である。
幾何学的歪み解析を取り入れ, 自己評価パイプラインに統合することにより, 高精度な3つの圧縮指標を提案する。
論文 参考訳(メタデータ) (2025-05-23T12:11:03Z) - Saliency-driven Dynamic Token Pruning for Large Language Models [32.903622070917194]
塩分駆動型動的トケンプルーニング(SDTP)
軽量なサリエンシ駆動予測モジュールは、各トークンの重要度をその隠れ状態で推定するように設計されている。
ランキングに基づく最適化手法を提案し,評価スコアと予測重要スコアのランキングばらつきを最小化する。
論文 参考訳(メタデータ) (2025-04-06T15:15:07Z) - UniF$^2$ace: A Unified Fine-grained Face Understanding and Generation Model [62.66515621965686]
本稿では,2次元離散拡散(D3Diff)損失を伴う新しい理論枠組みを導入し,離散的なスコアマッチング拡散を伴うマスク付き生成モデルを統一する。
このD3Diffは、テキスト入力に沿った高忠実度顔の詳細を合成するモデルの能力を大幅に向上させる。
提案するUniF$2$aceD-1Mは,130Kの微細な画像キャプチャ対と100Mの視覚的質問応答対からなる大規模データセットである。
論文 参考訳(メタデータ) (2025-03-11T07:34:59Z) - Scaling Embedding Layers in Language Models [61.939921364422936]
$SCONE$は入力埋め込み層を拡張して言語モデルのパフォーマンスを向上させる新しいメソッドである。
SCONE$は、n-gramの頻繁なセットに埋め込みを導入しながら、元の語彙を保持します。
これらの埋め込みは、各入力トークンに対してコンテキスト化された表現を提供し、トレーニング中に別のモデルで学習する。
$SCONE$は、n-gram埋め込みの数を増やし、それらを学ぶために使用するモデルをスケーリングする、という2つの新しいスケーリング戦略を可能にします。
論文 参考訳(メタデータ) (2025-02-03T18:59:32Z) - Mixture-of-Depths: Dynamically allocating compute in transformer-based language models [8.774705201394916]
トランスフォーマーベースの言語モデルは、FLOPを入力シーケンスに均一に展開した。
変換器はシーケンス内の特定の位置にFLOPを動的に割り当てることが可能であることを示す。
論文 参考訳(メタデータ) (2024-04-02T19:28:11Z) - Densely Connected $G$-invariant Deep Neural Networks with Signed
Permutation Representations [6.200483285433661]
有限群$G$,$G$-不変ディープニューラルネットワーク(G$-DNN)アーキテクチャをReLUアクティベーション付きで導入・検討する。
G$-DNNのプリアクティベーションは、Emphsigned permutation representations (signed perm-reps) of $G$で変換できる。
文献からReLUのアクティベーション関数にアクセスできるものよりも、より許容可能な$G$-DNNアーキテクチャが存在することを示す。
論文 参考訳(メタデータ) (2023-03-08T14:35:03Z) - Unsupervised Semantic Segmentation by Distilling Feature Correspondences [94.73675308961944]
教師なしセマンティックセグメンテーション(unsupervised semantic segmentation)は、アノテーションなしで画像コーパス内の意味論的意味のあるカテゴリを発見し、ローカライズすることを目的としている。
STEGOは、教師なし特徴を高品質な個別のセマンティックラベルに蒸留する新しいフレームワークである。
STEGOは、CocoStuffとCityscapesの両課題において、先行技術よりも大幅に改善されている。
論文 参考訳(メタデータ) (2022-03-16T06:08:47Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。