論文の概要: Metric-Construction Coupling Inflates Measured Synthetic Dialect Recovery
- arxiv url: http://arxiv.org/abs/2610.00164v1
- Date: Mon, 14 Sep 2026 22:15:22 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-05 14:48:16.385866
- Title: Metric-Construction Coupling Inflates Measured Synthetic Dialect Recovery
- Title(参考訳): メートル-コンストラクション結合インフレーションによる合成辞書の回復の測定
- Abstract要約: 韓国語の方言コーパスは利用可能だが再配布はできないが、基礎となるデータからトレーニングと評価を再現することは不可能である。
本研究は, 合成データがどのように回復するか, 合成パイプラインから独立して回復を計測できるかを問うものである。
KoDialectBenchは5つのリージョンに1000のアイテムを3つの軸で提供し、識別子とスコアコードとしてリリースし、ユーザが自身のライセンスコピーからアイテムを再構築できるようにします。
- 参考スコア(独自算出の注目度): 2.8678936590409028
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Korean dialect corpora are available but not redistributable: weights may be released, while reproducing training and evaluation from the underlying data cannot be. We ask how much of that supervision synthetic data recovers, and whether that recovery can be measured independently of the synthesis pipeline. We contribute KoDialectBench, 1,000 items across five regions on three axes, released as identifier hashes and scoring code so users reconstruct the items from their own licensed copy. Recovery is strongly axis-dependent: our best synthetic arm reaches 91.2% of the real-data gain on region identification but 63.7% on comprehension. On generation the answer depends on the metric: the deployed marker lexicon reports 92.3% on dialectness and 119.3% on region match, the latter exceeding the real-data reference, whereas reference-based generation reaches 72.4%. We find the marker metrics' scoring inventory is entirely contained in the inventory our transformation rules can emit. We test the effect of construction access directly with an exact-form construction-disjoint arm that withholds 20% of marker types from the rules. At exactly matched training size (8,600 examples) it reduces dialectness recovery from 91.8% to 8.1% and region-match recovery from 101.9% to 25.6% on the held-out marker inventory, while the three pipeline-independent measurements do not fall at all. A complementary evaluator sweep defines metric-construction coverage (MCC) and finds measured dialectness recovery increasing monotonically as overlap rises from MCC=0 to MCC=1. Shared construction and evaluation inventories can therefore substantially inflate estimates of synthetic-data recovery.
- Abstract(参考訳): 韓国語の方言コーパスは利用可能だが、再配布はできない:重みは解放されるが、基礎となるデータからトレーニングと評価を再現することは不可能である。
本研究は, 合成データがどのように回復するか, 合成パイプラインから独立してその回復を計測できるかを問うものである。
KoDialectBenchは5つのリージョンに1000のアイテムを3つの軸で提供し、識別子ハッシュとスコアコードとしてリリースし、ユーザが自身のライセンスコピーからアイテムを再構築できるようにします。
我々の最高の合成アームは、領域識別において実際のデータゲインの91.2%に達するが、理解では63.7%に達する。
マーカーレキシコンは、方言の92.3%、地域一致の119.3%を報告し、後者は実際のデータ参照を上回り、参照ベースの生成は72.4%に達する。
私たちは、マーカーメトリクスの指標のインベントリが、変換ルールが発行できるインベントリに完全に含まれていることに気付きます。
ルールから20%のマーカーを保持できない正確な形状のアームで、建設アクセスの効果を直接検証する。
正確に一致したトレーニングサイズ(8,600例)では、弁証性回復は91.8%から8.1%に減少し、領域マッチング回復は101.9%から25.6%に低下するが、パイプラインに依存しない3つの測定値は全く低下しない。
その結果,MCC=0 からMCC=1 への重なりが増大するにつれて,測定された方言の回復が単調に増加することがわかった。
したがって、共有された構築と評価の在庫は、合成データ回復の見積もりを著しく向上させることができる。
関連論文リスト
- Physical Cross-Modal Masked Autoencoding for Seismic-to-Well Representation Learning [40.02756366176796]
地下のキャラクタリゼーションは、3次元の地震が間接的な測定と井戸のログでスパース・ボアホールの高分解能な1次元計測を行う、極端に密度の高いスパース問題である。
本研究では, 地震対ウェル表現学習のための物理接地型クロスモーダルマスク型オートエンコーダ (CM-MAE) を提案する。
このモデルは地震量とウェルログの深さパッチを共同でトークン化し、4軸回転位置埋め込みを用いて両モードを連続的な物理座標に埋め込み、クロスモーダルデコーダでマスクされたターゲットを再構成する。
論文 参考訳(メタデータ) (2026-09-28T19:56:08Z) - When the Knowledge Base Becomes the Gold Standard: Measuring Resource-Shared Evaluation Loops in Entity-Level Machine Translation [1.9638161652098338]
Seungjeongwon Ilgiはユネスコの世界記録であり、37.4%しか翻訳されていない。
我々は,韓国国立歴史研究所の専門的個人名アノテーションをインジェクションパイプラインから独立した金として利用している。
専門家による527の言及のうち、注入パイプラインの外にあるのは31.1%である。
論文 参考訳(メタデータ) (2026-08-12T09:33:59Z) - Partial Identification with Multiple Nonlinear Measurements of a Latent Regressor [0.0]
回帰器が潜伏しており,複数の雑音測定によってのみ観察される線形回帰について検討した。
単一の測定における回帰は、構造的係数よりもソース固有係数を復元する。
コンセンサス測定関数を線形にし,残曲率を勾配に対して拘束することにより,潜時スケールを補正する。
論文 参考訳(メタデータ) (2026-07-13T23:33:54Z) - From Geometric Recovery to Causal Validation: A Reproducible Audit of Sparse Autoencoder Features, from Superposition Geometry to Causal Inertness [0.0]
スパースオートエンコーダ(SAE)は、重畳された神経表現を解釈可能な特徴に分解する標準である。
これはデコーダ・ジオメトリーアライメントとエンコーダ・アクティベーションの2つの異なるクレームを示す。
本手法は,決定論的パイプラインを持つモデル非依存の楽器であるsae-causal-auditとしてパッケージ化する。
論文 参考訳(メタデータ) (2026-07-13T21:18:52Z) - Verifier-Guided Twelve-Tone Composition: A Generate-Verify-Repair Harness for Symbolic Music Generation [37.048771679940984]
本稿では,言語モデルの提案を表現的検証を伴う生成-検証-再生-トレースループでラップするニューロシンボリックハーネスを提案する。
完全なパイプラインは、全体の合法性を主張することなく、イベントローカルの一貫性を改善する。
論文 参考訳(メタデータ) (2026-07-13T09:52:09Z) - Industry Classification of GitHub Repositories Using the North American Industry Classification System (NAICS) [46.877501276559165]
GitHubは数億のパブリックリポジトリをホストしているが、リポジトリから標準化された業界セクターへのネイティブマッピングは公開していない。
NAICS-GHは、米国、欧州連合、オーストラリアをカバーするソースプールから作成した6,588のGitHubリポジトリの公開コーパスである。
ラベルは、BAAI/bge-large-en埋め込み、FAISS検索、GPT-4.1スコアを組み合わせた検索・検証パイプラインによって作成される。
論文 参考訳(メタデータ) (2026-07-07T17:06:32Z) - Conditional Co-Ablation: Recovering Self-Repair Backups in Transformer Circuits [47.668752416295185]
条件付き共アブレーションは、各単位のアブレーション効果が一次集合が取り除かれたときにどれだけ増大するかを問う。
GPT-2の小型IOI回路では、CoAxはバックアップヘッドのリカバリを0.33から0.91 ROC-AUCに引き上げる。
論文 参考訳(メタデータ) (2026-07-02T09:32:57Z) - What Demonstration Curation Metrics Do to Your Policy [0.0]
本研究は,欠陥のあるトレーニングエピソードを検出する実演キュレーション指標が,キュレートされたデータに基づいてトレーニングする下流行動閉鎖ポリシーを改善できるかどうかを考察する。
最大欠陥検出AUROC(0.804)の基準が最悪の治療方針(13.3%のタスク成功)を生んでいることが判明した。
論文 参考訳(メタデータ) (2026-06-08T22:40:49Z) - What Are We Actually Decoding? Source Attribution for Non-Invasive Brain-to-Language Retrieval [42.66754319854329]
我々は,刺激同期MEG-to-audio検索を監査フレームワークとして再放送した。
構造的ショートカット、ウィンドウレベルの刺激ロックされたエビデンス、ウィンドウ間のコンテキストアグリゲーションを使用します。
これらの結果は、脳から言語へのパフォーマンスは、単に報告されるのではなく、ソース属性であるべきだことを示唆している。
論文 参考訳(メタデータ) (2026-05-23T11:23:39Z) - From Black Box to Glass Box: Cross-Model ASR Disagreement to Prioto Review in Ambient AI Scribe Documentation [43.148402136307716]
異種ASRシステム間のクロスモデル不一致は、基準のない不確実性信号として機能する。
商用APIとオープンソースエンジンにまたがる8つのASRシステムを備えた,50の公開医療用オーディオクリップを転写した。
低アグリメント領域は内容の不一致に富み、高リスク質量のクインタイル全体では53.9%から73.9%に増加した。
論文 参考訳(メタデータ) (2026-03-02T13:02:13Z) - Secure and Explainable Fraud Detection in Finance via Hierarchical Multi-source Dataset Distillation [17.90471000973834]
訓練されたランダム森林は、透明で軸方向の規則領域に変換される。
合成トランザクションは、各領域内で一様にサンプリングすることによって生成される。
これにより、コンパクトで監査可能なサロゲートデータセットが生成される。
論文 参考訳(メタデータ) (2025-12-26T05:00:35Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。