論文の概要: The Digital Afterlife of Empires: Four Language Models Converge on the Same Imperial Cartography of Writing
- arxiv url: http://arxiv.org/abs/2606.28325v1
- Date: Thu, 30 Apr 2026 07:02:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-27 00:46:12.951993
- Title: The Digital Afterlife of Empires: Four Language Models Converge on the Same Imperial Cartography of Writing
- Title(参考訳): 帝国のデジタル余生:四言語モデル
- Authors: Hiroki Fukui,
- Abstract要約: 大規模な言語モデルは、過激な不平等を伴う世界の書記システムを処理する。
29のスクリプト(9.7%)は現代のデジタルインフラで完全にサポートされており、158のリビングスクリプトのうち60(38.0%)は完全なサポートを欠いている。
tokenizer の効率は、パラレルテキストで測定された45のスクリプトに対して 31.7 の係数で変化する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language models process the world's writing systems with radical inequality. We constructed the Digital Script Representation Index (DSRI), a seven-axis measure of digital support, and applied it to the 300 writing systems of the Global Script Database (Fukui, 2026). Only 29 scripts (9.7%) are fully supported by contemporary digital infrastructure; among 158 living scripts, 60 (38.0%) lack complete support. Tokenizer efficiency varies by a factor of 31.7 across 45 scripts measured with parallel text. A serial mediation model -- imperial intervention to speaker population to web corpus to tokenizer efficiency -- is consistent with full mediation, with the direct effect of empire indistinguishable from zero (beta = -0.22, p = 0.39) and structural equation model fit indices indistinguishable from saturation at n = 45; the bias-corrected bootstrap CI grazes zero, and we treat the mediation as suggestive rather than confirmatory. Across four independent LLM families (Claude, GPT-4o, Grok, DeepSeek; 12,000 API calls), base-rate-deviation error patterns converge at Spearman rho = 0.85-0.98 (all p < 0.002). 172 script-feature items are answered identically wrong by all four models; over-attribution outnumbers under-recognition 3.9:1, and "used for religion" alone concentrates 43.6% of convergent errors (enrichment 4.1x). With religion excluded as a sensitivity check, the cross-architecture convergence is preserved (mean rho = 0.87 on nine features) and the over-attribution asymmetry persists at 1.77:1 (n = 97, binomial p = 0.008), indicating multi-channeled rather than single-channeled bias. The findings are consistent with an interpretation in which the structural inequalities historical empires inflicted on script communities persist in contemporary language models through the shared training corpus rather than through any individual model's design choices.
- Abstract(参考訳): 大規模な言語モデルは、過激な不平等を伴う世界の書記システムを処理する。
我々は,デジタルサポートの7軸尺度であるDigital Script Representation Index (DSRI)を構築し,Global Script Database (Fukui, 2026)の300の書き込みシステムに適用した。
29のスクリプト(9.7%)は現代のデジタルインフラで完全にサポートされており、158のリビングスクリプトのうち60(38.0%)は完全なサポートを欠いている。
tokenizer の効率は、パラレルテキストで測定された45のスクリプトに対して 31.7 の係数で変化する。
逐次媒介モデル – 話者集団からWebコーパスへの帝国介入によるトークン化効率の低下 – は、ゼロ(beta = -0.22, p = 0.39)からの帝国の直接的影響と、n = 45の飽和から区別不能な指標に適合する構造方程式モデル、バイアス補正ブートストラップCIはゼロに収まる。
4つの独立したLCMファミリー(Claude, GPT-4o, Grok, DeepSeek; 12,000 APIコール)にまたがって、ベースレートの誤差パターンはSpearman rho = 0.85-0.98 (すべて p < 0.002) に収束する。
172のスクリプト・フィーチャー・アイテムは4つのモデルすべてで同一の誤りに答えられ、過剰な帰属は認識下にある3.9:1よりも多く、「宗教のために使用される」だけで43.6%の収束誤差(濃縮4.1x)に集中している。
宗教は感度チェックとして除外され、交差構造収束は保存され(平均して9つの特徴においてrho = 0.87)、過剰帰属非対称性は1.77:1(n = 97、二項p = 0.008)で持続する。
この発見は、個々のモデルの設計選択を通じてではなく、共有トレーニングコーパスを通じて現代言語モデルにおいて、スクリプトコミュニティに影響を及ぼす構造的不平等な歴史的帝国が持続する解釈と一致している。
関連論文リスト
- Automated Proving of Shannon-Type Entropy Inequalities via Fine-Tuned Language Models and Guided Tree Search [50.16356451328644]
シャノン型エントロピーの不等式を証明することは情報理論の基本的な課題である。
我々は,原子実証のステップを微調整した小規模大規模言語モデルがこのプロセスを自動化することができるか検討する。
GPT-5.5は0ショットプロンプトで1.7%のサンプルを解き、Psitipは33.3%のサンプルを解いた。
論文 参考訳(メタデータ) (2026-06-04T05:43:12Z) - Benchmarking Speech-to-Speech Translation Models [55.00303727199927]
音声音声翻訳(S2ST)は急速に進歩しているが、オフライン評価には統一されたプロトコルが欠けている。
8次元にわたる46のメトリクスを統合するベンチマークフレームワークを導入する。
FLEURSとCVSSから1,248のモデル言語構成でデプロイする。
論文 参考訳(メタデータ) (2026-06-02T07:01:33Z) - FormInv: A Measurement Protocol for Semantic Invariance in Mathematical Reasoning Benchmarks [0.0]
MathCheckのパラフレーズ品質検査では, 19群で4つの意味的不正確なパラフレーズが検出された。
GPT-4oは2位から4位へと降格し、クロード・ハイクとディープ・シークV3が上昇する。
論文 参考訳(メタデータ) (2026-05-27T18:59:18Z) - Evaluating Commercial AI Chatbots as News Intermediaries [85.32040752972836]
ベストシステムは、数時間前に報告されたイベントに関する質問に対して、90%以上の多重選択精度を達成する。
すべてのモデルはヒンディー語で最小の精度を達成する。
原因ではなく検索は エラーの70%以上を 引き起こします
論文 参考訳(メタデータ) (2026-05-21T17:42:07Z) - Amplifying, Not Learning: Fine-Tuned AI Text Detectors Amplify a Pretrained Direction [51.56484100374058]
テキスト検出器は、事前訓練された典型軸を増幅する。
タスク監督前の生エンコーダでは、3つのアーキテクチャでNYT-vs-HC3 AUROC 0.806/0.944/0.834を達成する。
RoBERTaベースでは、生のプロジェクションは微調整を超えるが、RoBERTaベースでは、フル微調整は、試験された流線型人口の双方で生よりも識別を小さくする。
論文 参考訳(メタデータ) (2026-05-20T19:08:38Z) - How Far Is Document Parsing from Solved? PureDocBench: A Source-TraceableBenchmark across Clean, Degraded, and Real-World Settings [56.70440596502351]
昨年は20以上のオープンドキュメントパースモデルが見られたが、ベンチマークはほぼOmniDocBenchにのみ依存している。
HTML/CSSのドキュメントイメージをレンダリングするベンチマークであるPureDocBenchは、10のドメイン、66ページ、1,475ページをカバーしています。
論文 参考訳(メタデータ) (2026-05-08T09:30:31Z) - A molecular clock for writing systems reveals the quantitative impact of imperial power on cultural evolution [0.0]
我々はGlobal Script Database (GSD) をコンパイルし、300の書き込みおよび表記システム、50のバイナリ構造文字、および5,400年にわたる系統的エッジをコンパイルした。
4つの方法を適用すると、スクリプトは検出可能な分子時計を示す。
30のスクリプト置換イベントを特定し,その破壊的影響をランク付けする。
論文 参考訳(メタデータ) (2026-04-13T03:54:01Z) - Benchmarking Multilingual Speech Models on Pashto: Zero-Shot ASR, Script Failure, and Cross-Domain Evaluation [0.0]
Pashtoは、約6000~8000万人が話すが、共有公開テストセット上での多言語自動音声認識(ASR)のベンチマークは公開されていない。
本稿では,公開Pashtoデータに対する最初の再現可能なマルチモデル評価を行い,ゼロショットASR,スクリプトレベルの故障,微調整モデルのクロスドメイン評価について報告する。
論文 参考訳(メタデータ) (2026-04-06T11:23:42Z) - BibTeX Citation Hallucinations in Scientific Publishing Agents: Evaluation and Mitigation [34.429649156970015]
以前の評価では、検索なしでベースモデルをテストしたが、これは現在の慣行を反映していない。
3つの検索可能なフロンティアモデルでは、9つのフィールドと6方向のエラー分類に基づいてBibエントリを生成する。
全体的な精度は83.6%だが、完全な正確さは50.9%に過ぎない。
論文 参考訳(メタデータ) (2026-04-03T16:30:58Z) - How Well Do LLMs Imitate Human Writing Style? [2.3754840025365183]
大規模言語モデル(LLM)は、流動的なテキストを生成することができるが、特定の人間の作者の独特のスタイルを再現する能力は、まだ不明である。
著者の検証とスタイルの模倣分析のための,高速かつトレーニング不要なフレームワークを提案する。
学術エッセイでは97.5%、クロスドメイン評価では94.5%の精度を達成している。
論文 参考訳(メタデータ) (2025-09-29T15:34:40Z) - Causal Understanding by LLMs: The Role of Uncertainty [43.87879175532034]
近年の論文では、LLMは因果関係分類においてほぼランダムな精度を達成している。
因果的事例への事前曝露が因果的理解を改善するか否かを検討する。
論文 参考訳(メタデータ) (2025-09-24T13:06:35Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。