論文の概要: A Hyperbolicity Atlas of Large Language Model Hidden States
- arxiv url: http://arxiv.org/abs/2609.07053v1
- Date: Mon, 07 Sep 2026 05:20:09 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-12 01:52:26.276511
- Title: A Hyperbolicity Atlas of Large Language Model Hidden States
- Title(参考訳): 隠れた大言語モデルの双曲性アトラス
- Abstract要約: 本論文は, 樹状度を距離ベースとしたGromov Hyperbolicity (GH) を現生LLMの急激な隠れ状態が示すか否かを, 初めての系統的研究である。
我々は、MATH500、HumanEval、WinoGrande、TruthfulQAの10個のオープンウェイトモデルから818,904個のサンプル層測定を行った。
最も鮮明なパターンは深さであり、スケールではない:中層は通常高相対性双曲性高原を形成するが、最終層は樹状になることが多い。
- 参考スコア(独自算出の注目度): 24.77523833201283
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: LLM hidden states are ordinary vectors, but the distances among those vectors may still show hierarchical structure. To our knowledge, this paper is the first systematic study of whether prompt-token hidden states in contemporary LLMs exhibit Gromov Hyperbolicity (GH), a distance-based measure of tree-likeness. Using 818,904 sample-layer measurements from ten open-weight models across MATH500, HumanEval, WinoGrande, and TruthfulQA, we build a GH map over four axes: parameter scale, layer depth, model family, and input domain. The clearest pattern is depth, not scale: middle layers usually form a high-relative-hyperbolicity plateau, while final layers often become substantially more tree-like. Scale effects are weak and non-monotonic, matched 7/8B model families differ strongly, and domains interact with model specialization. These findings make GH useful as a practical diagnostic: it shows where hierarchical distance structure appears, how specialization changes it, and which model-layer-domain comparisons deserve closer analysis.
- Abstract(参考訳): LLM隠れ状態は通常のベクトルであるが、それらのベクトル間の距離は依然として階層構造を示す。
本研究は,近年のLLMにおける急進的隠れ状態がGromov Hyperbolicity (GH) を示すか否かを,木間距離を指標とした最初の系統的研究である。
MATH500、HumanEval、WinoGrande、TruthfulQAの10個のオープンウェイトモデルから818,904個のサンプル層計測を行い、パラメータスケール、層深さ、モデルファミリー、入力領域の4つの軸にGHマップを構築した。
最も鮮明なパターンは深さであり、スケールではない:中層は通常高相対性双曲性高原を形成するが、最終層は樹状になることが多い。
スケール効果は弱く、非単調であり、マッチした7/8Bモデルファミリーは強く異なり、ドメインはモデル特殊化と相互作用する。
これらの結果はGHを実用診断として有用であり、階層的な距離構造がどこに現れるか、どのように特殊化が変化するか、どのモデル層とドメインの比較がより深く分析されるべきかを示す。
関連論文リスト
- When Does Bigger Help? A Controlled Study of LLM Scale for Ontology Learning [5.477826608330914]
我々は,Qwen3.5系およびQwen3.6系から高密度および混合スペクトルの13種類のモデルを評価する。
デンス27Bモデルはタームタイピングにおいて実質的に疎らなモデルよりも優れており、大きなMixture-of-Expertsモデルは分類発見において最強のオープンウェイトな結果が得られる。
論文 参考訳(メタデータ) (2026-08-31T17:30:05Z) - Learning Taxonomic Trees with Hierarchical Representation Regularization for Large Multimodal Models [47.868429337792314]
大規模なマルチモーダルモデル(LMM)は、しばしば分類学的な知識が欠如しており、階層的視覚認識(HVR)の一貫性が低い。
LMMにおける階層整合性を改善するシンプルなプラグアンドプレイ正規化器である階層表現正規化(HiR2$)を提案する。
HiR2$は、様々なLMMと微調整方法の分類構造を効果的にキャプチャする。
論文 参考訳(メタデータ) (2026-07-03T03:16:41Z) - Learning with Shallow Neural Networks on Cluster-Structured Features [13.080485957000464]
浅層ニューラルネットワーク上での勾配降下学習における空間的相関が学習の複雑さに与える影響について検討した。
階層的に勾配差が変化する変種の場合、サンプルの複雑さは隠れ変数の数とともにスケールすることを示す。
合成データと実データの両方で理論的知見を実証的に検証する。
論文 参考訳(メタデータ) (2026-05-14T15:02:24Z) - Sparse Semantic Dimension as a Generalization Certificate for LLMs [53.681678236115836]
Sparse Semantic Dimension (SSD)は,モデル層上で訓練されたSparse Autoencoder (SAE)のアクティブな特徴語彙から導かれる複雑性尺度である。
我々はGPT-2 Small と Gemma-2B でこの枠組みを検証し、実際のサンプルサイズで非空き証明書を提供することを実証した。
論文 参考訳(メタデータ) (2026-02-11T21:45:18Z) - Hierarchical Mamba Meets Hyperbolic Geometry: A New Paradigm for Structured Language Embeddings [1.4183971140167244]
階層型マンバ (HiM) を用いて階層型言語埋め込みを学習する。
HiMは効率的なMamba2と指数関数的な成長と双曲幾何学の曲線の性質を統合している。
両モデルが4つの存在論的データセットの階層的関係を効果的に捉えていることを示す。
論文 参考訳(メタデータ) (2025-05-25T04:45:06Z) - Emergent effects of scaling on the functional hierarchies within large language models [0.0]
小型モデルによる解析(Llama-3.2-3b; 28層)
アイテムレベルのセマンティクスは、最も早く強く表される(層2-7)、次に2-item関係(層8-12)、続いて4-item類似(層10-15)
深いレイヤは、意味のある抽象化なしで、コンテキストウィンドウの初期部分から情報を圧縮する。
論文 参考訳(メタデータ) (2025-01-13T14:27:39Z) - A Top-down Graph-based Tool for Modeling Classical Semantic Maps: A Crosslinguistic Case Study of Supplementary Adverbs [50.982315553104975]
セマンティックマップモデル(SMM)は、言語横断的なインスタンスや形式からネットワークのような概念空間を構築する。
ほとんどのSMMは、ボトムアップ手順を使用して、人間の専門家によって手動で構築される。
本稿では,概念空間とSMMをトップダウンで自動生成するグラフベースの新しいアルゴリズムを提案する。
論文 参考訳(メタデータ) (2024-12-02T12:06:41Z) - Exploring Concept Depth: How Large Language Models Acquire Knowledge and Concept at Different Layers? [57.04803703952721]
大規模言語モデル(LLM)は、幅広いタスクで顕著なパフォーマンスを示している。
しかし、これらのモデルが様々な複雑さのタスクを符号化するメカニズムは、いまだに理解されていない。
概念深さ」の概念を導入し、より複雑な概念が一般的により深い層で得られることを示唆する。
論文 参考訳(メタデータ) (2024-04-10T14:56:40Z) - Fantastic Semantics and Where to Find Them: Investigating Which Layers of Generative LLMs Reflect Lexical Semantics [50.982315553104975]
本稿では,Llama2という人気言語モデルに対する語彙意味論のボトムアップ進化について検討する。
実験の結果,下位層の表現は語彙的意味論を符号化しているが,上位層はより弱い意味帰納的帰納的帰納的帰納的帰納的帰納的帰納的帰属的帰属的帰属的帰属的存在であることがわかった。
これは、高層層がより良い語彙意味論を得るマスク言語モデリングのような差別的な目的を持つモデルとは対照的である。
論文 参考訳(メタデータ) (2024-03-03T13:14:47Z) - Optimizing contrastive learning for cortical folding pattern detection [0.0]
我々は,囲い領域の折りたたみパターンを検出するための自己教師型ディープラーニングモデルを構築した。
このような大規模なデータセット上の皮質骨格に対して、自己教師付きディープラーニングモデルが適用されたのは、これが初めてである。
論文 参考訳(メタデータ) (2024-01-31T17:59:57Z) - Interpretability at Scale: Identifying Causal Mechanisms in Alpaca [62.65877150123775]
本研究では、Boundless DASを用いて、命令に従う間、大規模言語モデルにおける解釈可能な因果構造を効率的に探索する。
私たちの発見は、成長し、最も広くデプロイされている言語モデルの内部構造を忠実に理解するための第一歩です。
論文 参考訳(メタデータ) (2023-05-15T17:15:40Z) - Sparse Graphical Memory for Robust Planning [93.39298821537197]
スパースメモリに状態と実現可能な遷移を格納する新しいデータ構造であるスパースグラフィカルメモリ(SGM)を導入する。
SGMは、ゴール条件付きRLに古典的状態集約基準を適用し、新しい双方向整合目標に従って状態を集約する。
本研究では, SGM が, 遠近法, スパース・リワード視覚ナビゲーションタスクにおいて, 最先端の工法を著しく上回っていることを示す。
論文 参考訳(メタデータ) (2020-03-13T17:59:32Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。