論文の概要: A geometric relation of the error introduced by sampling a language model's output distribution to its internal state
- arxiv url: http://arxiv.org/abs/2605.04899v1
- Date: Wed, 06 May 2026 13:28:16 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-07 18:41:07.838333
- Title: A geometric relation of the error introduced by sampling a language model's output distribution to its internal state
- Title(参考訳): 言語モデルの出力分布を内部状態にサンプリングした誤差の幾何学的関係
- Authors: Albert F. Modenbach,
- Abstract要約: GPTスタイルの言語モデルは、予測確率分布が複数のトークンに分散する生成点における単一トークンの変化に敏感である。
このことから,トークン空間の幾何学はモデルが内部的に問題を表現する方法を直接反映していることが示唆された。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: GPT-style language models are sensitive to single-token changes at generation points where the predicted probability distribution is spread across multiple tokens. Viewing this sensitivity as a geometric property, we derive an $\mathfrak{so}(n)$-valued 1-form that depends only on the geometry of the token embeddings. Despite this purely geometric origin, we show that its curvature is semantically meaningful: On chess reasoning tasks, the curvature couples to the world model of an off-the-shelf instruction-tuned model, with transformations clustering by board region and respecting piece importance. Our findings suggest that token space geometry directly reflects how models internally represent problems.
- Abstract(参考訳): GPTスタイルの言語モデルは、予測確率分布が複数のトークンに分散する生成点における単一トークンの変化に敏感である。
この感度を幾何学的性質と見なすと、トークン埋め込みの幾何学にのみ依存する$\mathfrak{so}(n)$-valued 1-形式が導かれる。
この純粋に幾何学的起源にもかかわらず、その曲率は意味論的に意味があることが示される: チェスの推論タスクでは、曲率は、ボード領域によってクラスタ化され、部品の重要性を尊重する、オフザシェルフの命令チューニングモデルの世界モデルに結合する。
このことから,トークン空間の幾何学はモデルが内部的に問題を表現する方法を直接反映していることが示唆された。
関連論文リスト
- Latent Semantic Manifolds in Large Language Models [0.0]
本研究では,大規模言語モデルに隠れた状態を潜在意味多様体上の点として解釈する数学的枠組みを開発する。
我々は2つの定理を証明し、任意の有限語彙に対する歪みに対する速度歪みの低い境界と、表現可能性ギャップに対する線形体積スケーリング法則を証明した。
本稿では,アーキテクチャ設計,モデル圧縮,復号化戦略,スケーリング法則について論じる。
論文 参考訳(メタデータ) (2026-03-17T13:05:56Z) - TokenBlowUp: Resolving Representational Singularities in LLM Token Spaces via Monoidal Transformations [0.9179857807576733]
最近の研究は、大規模言語モデルのトークン埋め込み空間に対する基礎多様体仮説に挑戦する説得力のある証拠を提供している。
我々はこの問題をスキーム理論の言語で定式化し、スキーム理論のブローアップを各特異点に適用することにより厳密な解法を提案する。
我々は、この新しい空間の幾何学的正則化を保証する公式な定理を証明し、元の病理が解決されたことを示す。
論文 参考訳(メタデータ) (2025-07-26T02:39:54Z) - Geometric Inductive Biases of Deep Networks: The Role of Data and Architecture [22.225213114532533]
簡単な$textitgeometric invariant (GIH)仮説について検討する。
ニューラルネットワークの入力空間曲率が$textitgeometric invariantのままであることがわかった。
論文 参考訳(メタデータ) (2024-10-15T19:46:09Z) - SpaceMesh: A Continuous Representation for Learning Manifold Surface Meshes [61.110517195874074]
本稿では,ニューラルネットワークの出力として,複雑な接続性を持つ多様体多角形メッシュを直接生成する手法を提案する。
私たちの重要なイノベーションは、各メッシュで連続的な遅延接続空間を定義することです。
アプリケーションでは、このアプローチは生成モデルから高品質な出力を得るだけでなく、メッシュ修復のような挑戦的な幾何処理タスクを直接学習することを可能にする。
論文 参考訳(メタデータ) (2024-09-30T17:59:03Z) - Relative Representations: Topological and Geometric Perspectives [50.85040046976025]
相対表現はゼロショットモデルの縫合に対する確立されたアプローチである。
相対変換において正規化手順を導入し、非等方的再スケーリングや置換に不変となる。
第二に、クラス内のクラスタリングを促進するトポロジカル正規化損失である、微調整された相対表現におけるトポロジカルデシフィケーションの展開を提案する。
論文 参考訳(メタデータ) (2024-09-17T08:09:22Z) - Disentangled Representation Learning with the Gromov-Monge Gap [65.73194652234848]
乱れのないデータから歪んだ表現を学習することは、機械学習における根本的な課題である。
本稿では,2次最適輸送に基づく非交叉表現学習手法を提案する。
提案手法の有効性を4つの標準ベンチマークで示す。
論文 参考訳(メタデータ) (2024-07-10T16:51:32Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。