論文の概要: Stoicheia: Character-Level Masked Diffusion for Ancient Greek Textual Restoration, Parsing, and Metrical Scansion
- arxiv url: http://arxiv.org/abs/2608.07249v1
- Date: Fri, 07 Aug 2026 14:07:43 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-10 16:21:25.525968
- Title: Stoicheia: Character-Level Masked Diffusion for Ancient Greek Textual Restoration, Parsing, and Metrical Scansion
- Title(参考訳): Stoicheia:古代ギリシアのテクスト修復・パーシング・メトリカルスキャンのための文字レベルマスケード拡散
- Authors: Eric Cullhed, Albin Thörn Cleland,
- Abstract要約: ストイチェア (Stoicheia) は古代ギリシアの文字レベルのマスク付き拡散エンコーダである。
オープンでリビジョンされた380万ワードのコーパスで事前トレーニングを行い、11個のチェックポイントをリリースする。
イサカ自身のテスト分割では、同じ凍結サンプルと厳密なスコアで、Stoicheiaは両方の従来の最先端システムと比較して文字エラーを減らす。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We introduce Stoicheia, a 405M-parameter character-level masked-diffusion encoder for Ancient Greek whose input factors into five aligned, independently maskable planes: letters, word and sentence boundaries, diacritics, capitalization, and punctuation. A single backbone can therefore restore lacunae, re-segment, accentuate, and punctuate unspaced text without task-specific retokenization. We pretrain it on an open, revision-pinned corpus of 380M words and release eleven checkpoints: ten rotated, decontaminated folds, guaranteeing that for any given literary passage at least one released model has never seen its text, and one with no exposure to documentary texts. Three experiments - reconstruction of damaged inscriptions and papyri, morphosyntactic tagging and dependency parsing, and macronization with metrical scansion - each carry a matched random-initialization control, isolating what character-level diffusion pretraining contributes: 5.6 CER points on inscription reconstruction, 12.9 LAS on parsing, and 6.0 points of balanced accuracy on macronization. On Ithaca's own test split, with identical frozen samples and strict scoring, Stoicheia reduces character error relative to both prior state-of-the-art systems, from 24.6 (Ithaca) and 23.5 (its 2025 Aeneas-framework successor) to 15.5, and raises top-1 accuracy from 63.0 and 64.0 to 74.5.
- Abstract(参考訳): 我々はStoicheiaを紹介した。Stoicheiaは古代ギリシアの文字レベル405Mのマスク拡散エンコーダで、文字、単語、文の境界、ダイアクリティカル、資本化、句読点の5つの面に入力する。
したがって、単一のバックボーンは、タスク固有の再トークン化なしで、ラグネー、再分割、アクセント、および不空間テキストを復元することができる。
我々は、オープンでリビジョンされた380万ワードのコーパスに事前トレーニングを行い、11個のチェックポイントをリリースする。
3つの実験 - 損傷した碑文とパピリの再構成、モルフォシンタクティックなタグ付けと依存性解析、および計量スキャンによるマクロ化 - それぞれ一致したランダム初期化制御を持ち、どの文字レベルの拡散事前学習が寄与するかを分離する: 碑文再構成の5.6 CER点、構文解析の12.9 LAS、マクロ化の6.0点。
イサカ自身のテストスプリットでは、同じ凍結サンプルと厳密なスコアで、Stoicheiaは従来の最先端システムと比較して文字エラーを24.6 (Ithaca) と23.5 (2025 Aeneas-framework の後継) から15.5 に減らし、トップ1の精度を63.0 と 64.0 から74.5 に引き上げた。
関連論文リスト
- Morphology Aware Reversible Semantic Tokenization and Hierarchical Word Composition for Tamil Language Models [0.0]
オープンソースのThamizhiMorphアナライザとジェネレータを拡張したタミル形態解析システムを提案する。
本稿では,Sarvam-1,AI4Bharat IndicBERTv2,BrahmicTokenizer-131Kに基づくフラットな形態素トークン化器,信号保存語合成器,およびトークン化器を比較した。
明示的なタミル形態は、固定された小モデル予算の下での翻訳を改善する一方、階層的な構成は、シーケンスの長さと推定推論コストを大幅に削減する。
論文 参考訳(メタデータ) (2026-08-02T11:07:53Z) - Beyond Similarity: Grounded Agentic Extraction and Expert-Adjudicated Evaluation of Intertextuality in Classical Chinese Histories [3.694051864521789]
我々は、大言語モデルが2つのテキスト単位をフルに読み込むエージェントタスクとして、きめ細かいテクスチャ間抽出をリキャストする。
3つのドメインの専門家がプールされたマルチモデル候補を2,533対のテキスト間ペアのベンチマークに設定し、Analects と Book of Han を徹底的に比較する手法を検証する。
論文 参考訳(メタデータ) (2026-07-30T02:34:23Z) - AI_LectureNote: A Retrospective Pilot Study of a Post-ASR Workflow for English-Script Rendering and Semantic Drift in Korean-English Medical Lectures [1.7028841264419619]
AI_LectureNoteは、韓国英語の医学講義のための可読性指向のポストASRワークフローである。
ラテン文字の医学用語を復元しながら、音声からテキストへの出力を研究用文字に書き換える。
論文 参考訳(メタデータ) (2026-07-19T13:02:07Z) - Context-Aware Distillation and Ablation for Text2DSL [78.29352305480285]
我々は、コンテクスト対応蒸留により、プロンプトのみの合成生成を置き換える。
教師の大きな言語モデルは、明示的に定義された構造化コンテキストの下で機能する。
これは、検証されたポルキットベンチコーパスを4,204対から10,073対にスケールする。
論文 参考訳(メタデータ) (2026-06-21T16:27:24Z) - Output Vector Editing for Memorization Mitigation in Large Language Models [68.30351930772788]
大規模な言語モデルは、トレーニングデータからシーケンスを記憶し、再現し、プライバシ、著作権、セキュリティリスクを生み出す。
既存のニューロンレベルの緩和方法は、ニューロンの活性化をゼロにすることで編集を等しくするが、活性化はニューロンが関与するかどうかのみを制御する。
記憶継続に責任を負うニューロンの小さな集合を探索する制約最適化編集である出力ベクトル編集を提案する。
論文 参考訳(メタデータ) (2026-06-17T07:29:18Z) - Benchmarking Speech-to-Speech Translation Models [55.00303727199927]
音声音声翻訳(S2ST)は急速に進歩しているが、オフライン評価には統一されたプロトコルが欠けている。
8次元にわたる46のメトリクスを統合するベンチマークフレームワークを導入する。
FLEURSとCVSSから1,248のモデル言語構成でデプロイする。
論文 参考訳(メタデータ) (2026-06-02T07:01:33Z) - The Digital Afterlife of Empires: Four Language Models Converge on the Same Imperial Cartography of Writing [0.0]
大規模な言語モデルは、過激な不平等を伴う世界の書記システムを処理する。
29のスクリプト(9.7%)は現代のデジタルインフラで完全にサポートされており、158のリビングスクリプトのうち60(38.0%)は完全なサポートを欠いている。
tokenizer の効率は、パラレルテキストで測定された45のスクリプトに対して 31.7 の係数で変化する。
論文 参考訳(メタデータ) (2026-04-30T07:02:45Z) - The Patrologia Graeca Corpus: OCR, Annotation, and Open Release of Noisy Nineteenth-Century Polytonic Greek Editions [0.0]
パトログア・グラエカ・コーパス(Patrologia Graeca Corpus)は、古代ギリシアの19世紀の版において、最初の大規模なオープンなOCRと言語資源である。
このコレクションは、複雑なバイリンガル(ギリシャ・ラテン語)のレイアウトで印刷されたPatrologia Graeca(PG)の残されている未デジタル化の巻をカバーしており、高度に劣化したポリトニック・ギリシャのタイポグラフィーが特徴である。
We achieve a character error rate (CER) of 1.05% and a word error rate (WER) of 4.69%。
その結果得られたコーパスには、約600万の補修と音声タグ付きトークンが含まれており、フルに整列している。
論文 参考訳(メタデータ) (2026-03-10T10:21:54Z) - Look-back Decoding for Open-Ended Text Generation [62.53302138266465]
本研究では,現在の復号化過程と過去の復号化過程の分布距離を追跡する改良された復号化アルゴリズムであるLook-backを提案する。
ルックバックは、潜在的反復句とトピックドリフトを自動的に予測し、障害モードを引き起こす可能性のあるトークンを削除することができる。
文書の継続とストーリー生成に関する復号実験を行い、Look-backがより流動的で一貫性のあるテキストを生成することを実証する。
論文 参考訳(メタデータ) (2023-05-22T20:42:37Z) - Paraphrasing evades detectors of AI-generated text, but retrieval is an
effective defense [56.077252790310176]
本稿では,パラフレーズ生成モデル(DIPPER)を提案する。
DIPPERを使って3つの大きな言語モデル(GPT3.5-davinci-003)で生成されたテキストを言い換えると、透かしを含むいくつかの検出器を回避できた。
我々は,言語モデルAPIプロバイダによって維持されなければならない,意味論的に類似した世代を検索するシンプルなディフェンスを導入する。
論文 参考訳(メタデータ) (2023-03-23T16:29:27Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。