論文の概要: How Non-Linguistic Is the Indus Sign System? A Synthetic-Baseline Scorecard
- arxiv url: http://arxiv.org/abs/2604.17828v1
- Date: Mon, 20 Apr 2026 05:29:56 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-21 21:52:52.711465
- Title: How Non-Linguistic Is the Indus Sign System? A Synthetic-Baseline Scorecard
- Title(参考訳): インダス符号系は非言語的か? : 合成ベースラインスコアカード
- Abstract要約: 本稿では,インダス・バレーの符号体系が音声言語を符号化するかどうかを検証するための多次元識別フレームワークを提案する。
このフレームワークをICIT/Yajnadevamのデジタル化から1,916の非重複の碑文に適用すると、Indus corpusはどちらのベースラインともきれいに一致しないことがわかった。
また、Sproat(2014)データセットを含む7つの実世界の非言語コーパスを比較し、証明された非言語系が完全なIndus統計プロファイルを再現していないことを発見した。
- 参考スコア(独自算出の注目度): 0.913755431537592
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Whether the Indus Valley sign system (c. 2600-1900 BCE) encodes spoken language has been debated for decades. This paper introduces a multi-metric discrimination framework that tests the observed Indus corpus against two kinds of computer-generated non-linguistic baseline -- one mimicking a heraldic emblem system, the other an administrative coding system -- each calibrated with Zipfian frequency distributions, positional constraints, and bigram dependencies derived from six attested non-linguistic corpora. The scorecard evaluates four properties central to the Farmer-Sproat-Witzel (2004) critique: text brevity, repeated formulaic phrases, hapax legomenon rate, and positional rigidity. Applying this framework to 1,916 deduplicated inscriptions (584 unique signs, 11,110 tokens) from the ICIT/Yajnadevam digitization, we find that the Indus corpus does not match either baseline cleanly. Across the four metrics examined, the Indus corpus occupies an intermediate position relative to the two baseline families, matching neither cleanly. Neither a heraldic nor an administrative generator can reproduce all four properties at once. We also compare against seven real-world non-linguistic corpora including Sproat's (2014) datasets, finding that no attested non-linguistic system reproduces the full Indus statistical profile either. We replicate key prior results including a Zipf slope of -1.49 and conditional entropy of 3.23 bits. All code and data are publicly available.
- Abstract(参考訳): インダス・バレーの符号体系(紀元前2600-1900年頃)が音声言語を符号化するかどうかについては、何十年も議論されてきた。
本稿では,インダスコーパスを2種類のコンピュータ生成非言語的ベースライン – 紋章エンブレムシステムと行政コードシステム – に対してテストするマルチメトリック識別フレームワークを提案する。
スコアカードはFarmer-Sproat-Witzel (2004) 批判の中心となる4つの特性を評価する。
この枠組みをICIT/Yajnadevamのデジタル化から1,916の非重複な碑文(584のユニークな記号、11,110のトークン)に適用すると、Indus corpusはどちらのベースラインともきれいに一致しないことがわかった。
調査した4つの指標の中で、インダス・コーパスは2つの基準系に対して中間的な位置を占めており、きれいに一致しない。
紋章も管理ジェネレータも、一度に4つのプロパティ全てを再生することはできない。
また、Sproat(2014)データセットを含む7つの実世界の非言語コーパスを比較し、証明された非言語系が完全なIndus統計プロファイルを再現していないことを発見した。
Zipf勾配の-1.49、条件エントロピーの3.23ビットを含む主要な先行結果を再現する。
すべてのコードとデータは公開されています。
関連論文リスト
- Neyshekar: An Open Persian Read-Speech Corpus for Automatic Speech Recognition [0.0]
ネイシェカール (Neyshekar) は、公式言語と非公式言語の両方をカバーするために設計されたペルシア語読み上げコーパスである。
バージョン6では、190人のコントリビュータから合計99.02時間、34,541人の異なるプロンプトが提供されている。
論文 参考訳(メタデータ) (2026-09-13T14:30:43Z) - IndicQE-APE: A Benchmark for Quality Estimation and Automatic Post-Editing for Indic Languages [77.88427845181154]
我々はWMT 2020-2024の共有タスクの系統を、英語のリソースを拡張してインディクシーに集約する:9つの方向対に対して126,754ドルのインスタンス。
セグメントレベルのQEでは,LSMが6つ,COMETが3つ,APEでは3つのシステムをベンチマークした。
論文 参考訳(メタデータ) (2026-08-17T09:50:52Z) - On the Non-Specificity of Statistical Measures Used in Script Decipherment [0.0]
SIGILは、3000文字のコアコーパスが明示的な構成意味を持つ汎用的な生成エンブレムシステムである。
評価記録54の方法に先立って編纂された文献レジストリは、公開されたIndus結果とソース定義決定ルールの両方を再現できる場合に、正確なスコア付けを行う方法を認める。
SIGILはインダスコーパスと同じカテゴリーを、反復、方向非対称性、語彙分布テストを通じて、この方法で得られた全ての基準で受け取っている。
論文 参考訳(メタデータ) (2026-08-04T01:33:02Z) - Fantastic Adaptive Taxonomies and How to Use Them [100.20614173157708]
AdaMASTは、実行トレースをコンパクトでエビデンスに基づく障害分類に変換する。
コードには手書きのコードはなく、人間による注釈もない。
エージェント・システム・サーチでは、失敗候補の分類コード診断が自由形式より優れている。
論文 参考訳(メタデータ) (2026-07-17T17:41:16Z) - ITPEval: Benchmarking Formal Translation Across Interactive Theorem Provers [77.95933562142014]
ITPEvalは、4つの主要なIPP間で自動形式証明翻訳を評価するための最初のベンチマークである。
itpevalは、状態が分離されたウォームバックエンドを備えた、統合されたマルチITP認証インフラストラクチャです。
論文 参考訳(メタデータ) (2026-07-07T22:05:55Z) - Structural Pattern Mining in Inka Khipus: Unsupervised Clustering, Provenance Classification, and a Computational Validation of the Santa Valley Match [0.0]
54,403コードと110,677ノットからなる619 khipus の公開データベースである Open Khipu Repository (OKR) に適用した機械学習パイプラインを提案する。
我々は,khipu当たり27個の構造的特徴を設計し, (i) UMAPおよびHDBSCANを介して教師なしクラスタリングを適用し, 3つの構造的異なるグループを復元した。
我々は、n-gramとしてエンコードされた結び目型のシーケンス順序を再現し、集約的な特徴以外の信号を追加しないという負の結果を報告した。
論文 参考訳(メタデータ) (2026-06-30T21:06:38Z) - Invisible to humans, visible to machines: a preregistered audit of Unicode fidelity across four biomedical bibliographic APIs [0.0]
この監査は、広く使われている4つのパブリックAPI(E-utilities、Crossref、OpenAlex、Semantic Scholar)をPubMed Central (PMC) JATS XMLに対して共通の根拠として仮定する。
したがって、文字レベルの忠実度はAPIに依存し、文書化されていないため、トークン化に敏感な書誌学、コーパス構築、LCM支援書面の文字レベルの指標に直接影響する。
論文 参考訳(メタデータ) (2026-06-08T19:46:27Z) - Benchmarking Speech-to-Speech Translation Models [55.00303727199927]
音声音声翻訳(S2ST)は急速に進歩しているが、オフライン評価には統一されたプロトコルが欠けている。
8次元にわたる46のメトリクスを統合するベンチマークフレームワークを導入する。
FLEURSとCVSSから1,248のモデル言語構成でデプロイする。
論文 参考訳(メタデータ) (2026-06-02T07:01:33Z) - Not All Synthetic Data Is Yours to Learn From [68.13136636413601]
弱い自己学習は、事前訓練モデルにすでに存在する能力を増幅できることを示す。
我々はこれを、プロンプトフリーな無条件自己学習の最小設定で研究する。
論文 参考訳(メタデータ) (2026-05-29T10:34:11Z) - Synthetic Tabular Generators Fail to Preserve Behavioral Fraud Patterns: A Benchmark on Temporal, Velocity, and Multi-Account Signals [0.0]
本研究では,4つの行動不正パターン(P1-P4)の分類法を定式化し,事象間タイミング,バースト構造,マルチアカウントグラフモチーフ,速度ルールトリガ率について検討した。
我々は、IEEE-CIS Fraud DetectionとAmazon FraudデータセットでCTGAN、TVAE、GaussianCopula、TabularARGNをベンチマークした。
P1-P4フレームワークは、医療やネットワークセキュリティを含む、エンティティレベルのシーケンシャルデータを持つ任意のドメインに拡張する。
論文 参考訳(メタデータ) (2026-04-13T19:36:00Z) - Evidence of Layered Positional and Directional Constraints in the Voynich Manuscript: Implications for Cipher-Like Structure [0.0]
本稿では,Voynich Manuscript(VMS)の体系的解析について述べる。
VMSは、単純な位置や周波数に基づくメカニズムだけでは再現が難しい暗号のような構造的制約を示す。
論文 参考訳(メタデータ) (2026-03-26T14:01:19Z) - Reconstructing Trust Embeddings from Siamese Trust Scores: A Direct-Sum Approach with Fixed-Point Semantics [0.0]
本研究では,多くの分散セキュリティフレームワークが公開している1次元シームズ信頼スコアから高次元信頼埋め込みを再構築する逆問題について検討する。
合成ベンチマークのスイートは、ガウスノイズの存在下でも、回収された埋め込みはユークリッドとコサインの計測値によって測定されたデバイス間幾何学を保存することを確認している。
詳細な信頼スコアを公開することで、デバイスと評価モデルの両方に関する潜伏した行動情報が漏洩する可能性がある。
論文 参考訳(メタデータ) (2025-08-02T20:19:22Z) - The Medium Is Not the Message: Deconfounding Document Embeddings via Linear Concept Erasure [98.71456610527598]
埋め込みベースの類似度メトリクスは、テキストのソースや言語のような刺激的な属性に影響される可能性がある。
本稿では,エンコーダ表現から観測された共同創設者に関する情報を除去するデバイアスアルゴリズムにより,これらのバイアスを最小の計算コストで大幅に低減することを示す。
論文 参考訳(メタデータ) (2025-07-01T23:17:12Z) - ToxSyn-PT: A Large-Scale Synthetic Dataset for Hate Speech Detection in Portuguese [37.69303106863453]
ToxSyn-PTは、きめ細かいヘイトスピーチ分類を可能にする最初の大規模なポルトガルのコーパスである。
データセットには、マイノリティグループと毒性ラベルに等しく分散された53,274の合成文が含まれている。
論文 参考訳(メタデータ) (2025-06-11T23:59:29Z) - LipSim: A Provably Robust Perceptual Similarity Metric [56.03417732498859]
敵攻撃に対するViTベースの特徴抽出器のアンサンブルに基づく,最先端の知覚的類似度指標の脆弱性を示す。
次に、証明可能な保証とともに、LipSimと呼ばれる堅牢な知覚的類似度メトリックをトレーニングするためのフレームワークを提案する。
LipSimは、各データポイント周辺の保護された領域と、$ell$ ball内のすべての摂動の証明書を提供する。
論文 参考訳(メタデータ) (2023-10-27T16:59:51Z) - Detecting Handwritten Mathematical Terms with Sensor Based Data [71.84852429039881]
本稿では,手書きの数学的用語を自動分類する,スタビロによるUbiComp 2021チャレンジの解を提案する。
入力データセットには異なるライターのデータが含まれており、ラベル文字列は合計15の異なる文字から構成されている。
論文 参考訳(メタデータ) (2021-09-12T19:33:34Z) - A New Approach for Texture based Script Identification At Block Level
using Quad Tree Decomposition [38.20489458130109]
マルチスクリプトシナリオが一般的であるインドのような国では、事前にスクリプトを特定することが義務付けられます。
公式手書き文字11文字に対する方向エネルギーとエントロピー分布の抽出におけるガボルウェーブレットフィルタの重要性を示す。
論文 参考訳(メタデータ) (2020-09-16T02:50:03Z) - Sparse Concept Coded Tetrolet Transform for Unconstrained Odia Character
Recognition [0.0]
スパースの概念を符号化したテトロレットを用いて,制約なしの英数字に対する新しい画像表現手法を提案する。
提案するOCRシステムは,PCA,SparsePCA,Slantletなどのスパースベース技術よりも優れた性能を示す。
論文 参考訳(メタデータ) (2020-04-03T13:20:12Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。