論文の概要: Structural Pattern Mining in Inka Khipus: Unsupervised Clustering, Provenance Classification, and a Computational Validation of the Santa Valley Match
- arxiv url: http://arxiv.org/abs/2607.00185v1
- Date: Tue, 30 Jun 2026 21:06:38 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-02 19:56:07.640435
- Title: Structural Pattern Mining in Inka Khipus: Unsupervised Clustering, Provenance Classification, and a Computational Validation of the Santa Valley Match
- Title(参考訳): Inka Khipusにおける構造パターンマイニング--教師なしクラスタリング,プロヴァンス分類,およびサンタバレーマッチの計算的検証
- Authors: Maria Contreras,
- Abstract要約: 54,403コードと110,677ノットからなる619 khipus の公開データベースである Open Khipu Repository (OKR) に適用した機械学習パイプラインを提案する。
我々は,khipu当たり27個の構造的特徴を設計し, (i) UMAPおよびHDBSCANを介して教師なしクラスタリングを適用し, 3つの構造的異なるグループを復元した。
我々は、n-gramとしてエンコードされた結び目型のシーケンス順序を再現し、集約的な特徴以外の信号を追加しないという負の結果を報告した。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Khipus--knotted cord devices--were the primary recording medium of the Inka Empire (c. 1400-1532 CE), yet their system remains undeciphered. We present a reproducible machine-learning pipeline applied to the Open Khipu Repository (OKR), a public database of 619 khipus comprising 54,403 cords and 110,677 knots. We engineer 27 structural features per khipu and apply (i) unsupervised clustering via UMAP and HDBSCAN, recovering three structurally distinct groups (silhouette = 0.769); (ii) supervised provenance classification via gradient boosting, reaching F1 = 0.86 for the Inka Late Horizon imperial style; and (iii) SHAP-based interpretability, which identifies cord twist direction as the dominant structural discriminator of imperial khipus. We further report two findings of methodological interest. First, one cluster is dominated not by a geographic region but by nineteenth-century European museum collections, indicating that colonial acquisition and recording practices are structurally encoded in the corpus. Second, we provide an independent computational verification of the recto/verso (moiety) structure of the six Santa Valley khipus reported by Medrano and Urton (2018), reproducing both the aggregate attachment ratio and the identification of the single mixed specimen--using only the public OKR database, without physical access to the objects. We additionally report a negative result: knot-type sequence order, encoded as n-grams, adds no provenance signal beyond aggregate features. All code and data are openly available.
- Abstract(参考訳): インカ帝国(紀元前1400年-1532年頃)の主要な記録媒体である、キプス結びのコード装置は、まだ解読されていない。
54,403コードと110,677ノットからなる619 khipus の公開データベースである Open Khipu Repository (OKR) に適用した再現可能な機械学習パイプラインを提案する。
我々はキプ当たり27個の構造特徴を設計し応用する
i) UMAP と HDBSCAN による教師なしクラスタリングにより、構造的に異なる3つのグループ(silhouette = 0.769)を復元する。
(二)勾配押し上げによる前駆体分類の監督、印加後期水平様式のF1=0.86到達、及び
三 皇位継承者としてコードねじれ方向を識別するSHAPに基づく解釈可能性。
さらに、方法論的関心の2つの発見を報告する。
まず、一つのクラスタは地理的地域ではなく、19世紀のヨーロッパの博物館のコレクションによって支配されており、植民地の取得と記録の慣行がコーパスに構造的にエンコードされていることを示している。
第2に,Medrano と Urton (2018) が報告した6つのサンタ・バレー・クイプスのレクト/リゾ(モエティ)構造を独立に計算し,対象物への物理的アクセスを伴わずに,公共のOKRデータベースのみを用いた単一の混合標本のアタッチメント比と識別を再現する。
さらに、n-gramとしてエンコードされた結び目型シーケンス順序は、集合的特徴を超える前兆信号を追加しない。
すべてのコードとデータは公開されています。
関連論文リスト
- A Modelling and Evaluation Framework for EuroCrops-Driven Sentinel-2 Crop Segmentation [78.66324246922831]
本研究では,Sentinel-2イメージとEuroCropsパーセルレベルのアノテーションからセマンティックセグメンテーション対応農業データセットを生成するパイプラインを提案する。
このデータセットには、ヨーロッパ5カ国から67,337のパッチが含まれており、10種類の作物と背景の分類を減らしている。
The four-level U-Net with Group Normalization were training using 10 Sentinel-2 spectrum bands and a Composite loss with class-weighted cross-entropy and Dice loss。
論文 参考訳(メタデータ) (2026-05-30T11:20:29Z) - Learn from your own latents and not from tokens: A sample-complexity theory [53.5821824211418]
本研究では,関連するビューやマスキング領域の潜在表現を予測するために訓練されたネットワークについて検討する。
潜在予測は、対数的要因まで、多くのサンプルを$L$で表すことでこれを達成できることを示す。
これは、H-JEPAのような明示的な積み重ねがほとんど冗長であることを示している。
論文 参考訳(メタデータ) (2026-05-26T22:16:42Z) - Fine-Tuning Over Architectural Complexity: Broad-Coverage PII Detection on PIIBench with DeBERTa [0.0]
PII検出システムは、狭いソースまたはドメイン境界内で頻繁に訓練され、異種テキストにデプロイする場合のカバレッジを制限する。
我々は,10個のソースデータセットに82個の保持されたエンティティタイプにまたがる修正されたマルチソースPIIBenchのモデル微調整について検討した。
直接トークン分類の微調整,ソース条件付き階層モデル(SC+H),3段階のカリキュラム拡張(SC+H+Curr)の3つのアプローチを評価した。
論文 参考訳(メタデータ) (2026-05-25T13:12:42Z) - PrimeKG-CL: A Continual Graph Learning Benchmark on Evolving Biomedical Knowledge Graphs [19.859134741964805]
既存の連続グラフ学習は、ほとんど完全に合成ランダムな一般的なKGについて研究されている。
9つの信頼できるバイオメディカルデータベースから構築されたベンチマークを導入する。
我々は、4つのKGEデコーダ、LKGE、CK-hugging agent、CMKLの6つのCL戦略を評価した。
論文 参考訳(メタデータ) (2026-05-11T13:14:02Z) - GSAR: Typed Grounding for Hallucination Detection and Recovery in Multi-Agent LLMs [0.0]
クレームを4方向のタイポロジー(接地,非接地,矛盾,相補的)に分割する基盤性フレームワークを提案する。
GSARは、明示的な計算予算の下で、結合された回復を伴うエビデンス型スコアリングを結合した最初の基盤フレームワークである。
論文 参考訳(メタデータ) (2026-04-25T16:20:28Z) - How Non-Linguistic Is the Indus Sign System? A Synthetic-Baseline Scorecard [0.913755431537592]
本稿では,インダス・バレーの符号体系が音声言語を符号化するかどうかを検証するための多次元識別フレームワークを提案する。
このフレームワークをICIT/Yajnadevamのデジタル化から1,916の非重複の碑文に適用すると、Indus corpusはどちらのベースラインともきれいに一致しないことがわかった。
また、Sproat(2014)データセットを含む7つの実世界の非言語コーパスを比較し、証明された非言語系が完全なIndus統計プロファイルを再現していないことを発見した。
論文 参考訳(メタデータ) (2026-04-20T05:29:56Z) - ATLAS: Constitution-Conditioned Latent Geometry and Redistribution Across Language Models and Neural Perturbation Data [0.0]
構成条件付きポストトレーニングは、モデルが学習した表現幾何学の構造化摂動として分析することができる。
グラフ, モデル, 基板間の構成による隠れ状態構造をトレースする, 幾何学第一のプログラムATLASを紹介する。
論文 参考訳(メタデータ) (2026-04-19T23:26:02Z) - ECOSoundSet: a finely annotated dataset for the automated acoustic identification of Orthoptera and Cicadidae in North, Central and temperate Western Europe [51.82780272068934]
ECOSoundSet (European Cicadidae and Orthoptera Sound dataSet) は,北欧,中央ヨーロッパ,温帯西ヨーロッパに分布する200種,24種(亜種を含む場合,それぞれ217種,26種)から10,653種を収録したデータセットである。
このデータセットは、北ヨーロッパ、中央ヨーロッパ、温帯ヨーロッパにおけるオルソプターとシカダの音響分類のための深層学習アルゴリズムの訓練のために、既にオンラインで入手可能な記録に意味のある補完となる可能性がある。
論文 参考訳(メタデータ) (2025-04-29T13:53:33Z) - DynGFN: Towards Bayesian Inference of Gene Regulatory Networks with
GFlowNets [81.75973217676986]
遺伝子調節ネットワーク(GRN)は、遺伝子発現と細胞機能を制御する遺伝子とその産物間の相互作用を記述する。
既存の方法は、チャレンジ(1)、ダイナミックスから循環構造を識別すること、あるいはチャレンジ(2)、DAGよりも複雑なベイズ後部を学習することに焦点を当てるが、両方ではない。
本稿では、RNAベロシティ技術を用いて遺伝子発現の「速度」を推定できるという事実を活用し、両方の課題に対処するアプローチを開発する。
論文 参考訳(メタデータ) (2023-02-08T16:36:40Z) - Robustifying Algorithms of Learning Latent Trees with Vector Variables [92.18777020401484]
Recursive Grouping (RG) と Chow-Liu Recursive Grouping (CLRG) のサンプル複雑性について述べる。
RG,CLRG,Neighbor Joining (NJ) およびSpectral NJ (SNJ) をトラッピングした内積を用いて強化する。
我々は、潜在木の構造学習において、最初の既知のインスタンス依存の不合理性の結果を導出する。
論文 参考訳(メタデータ) (2021-06-02T01:37:52Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。