論文の概要: Beyond the Stitching Assumption: A Unified Framework for Multimodal Synthetic Data Evaluation via Semantic Quantization
- arxiv url: http://arxiv.org/abs/2609.22149v1
- Date: Wed, 26 Aug 2026 05:45:59 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-28 05:09:55.733766
- Title: Beyond the Stitching Assumption: A Unified Framework for Multimodal Synthetic Data Evaluation via Semantic Quantization
- Title(参考訳): スティッチング推定を超えて:セマンティック量子化によるマルチモーダル合成データ評価のための統一フレームワーク
- Abstract要約: マルチモーダル合成データセットのための投影型評価器を提案する。
テキスト・ツー・アトリビュート・コントロールは、ペアリングを中断しながら両方の限界分布を保存する。
Amazon Reviews、Kiva Loans、およびIn Employment Scamデータセットの実験では、このコントロールの下では、モダリティ固有のスコアが高いままである。
- 参考スコア(独自算出の注目度): 12.161963465330627
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Multimodal synthetic datasets combine structured attributes with free text, but are often evaluated separately. Such metrics can remain high after tabular--text pairings are disrupted. We present a projection-based evaluator for tabular--text synthetic data. A fixed sentence encoder maps text to embeddings, \(k\)-means converts them to cluster states, and tabular variables are represented as categorical or quantile-binned states. Real and synthetic contingency tables are compared using Jensen--Shannon divergence (JSD), normalized mutual information (NMI), conditional JSD (cJSD), and joint-state entropy. We also report text-to-attribute (T2A) utility and a holdout-calibrated proximity flag rate (PFR) as a representation-level diagnostic. A text-permutation control preserves both marginal distributions while disrupting their pairing. Experiments on Amazon Reviews, Kiva Loans, and the Employment Scam Aegean Dataset show that modality-specific scores remain high under this control. The projection diagnostics detect disruption when real projected dependence exceeds a permutation baseline, but are less informative for weak or sparse projections. Some conditioned LLM baselines also exhibit stronger measured dependence than the corresponding real-data projections. These results support explicit cross-modal evaluation with permutation baselines and coverage reporting.
- Abstract(参考訳): マルチモーダル合成データセットは構造化属性と自由テキストを組み合わせるが、しばしば個別に評価される。
このようなメトリクスは、表形式のペアリングが中断された後も高いままである。
図形テキスト合成データのための投影型評価器を提案する。
固定文エンコーダはテキストを埋め込みにマッピングし、 \(k\)-平均はそれらをクラスタ状態に変換する。
Jensen-Shannon divergence (JSD), normalized mutual information (NMI), Conditional JSD (cJSD), joint-state entropy を用いて実データと合成データを比較した。
また,テキスト・ツー・アトリビュート・ユーティリティ (T2A) と近接フラグレート (PFR) を表現レベル診断として報告する。
テキスト置換制御は、ペアリングを中断しながら両方の限界分布を保存する。
Amazon Reviews, Kiva Loans, および Employment Scam Aegean Dataset の実験では、このコントロール下では、モダリティ固有のスコアが高いままである。
プロジェクション診断は、実際のプロジェクション依存が置換ベースラインを超えると破壊を検出するが、弱いプロジェクションやスパースプロジェクションでは情報に乏しい。
いくつかの条件付きLCMベースラインは、対応する実データ投影よりも強い測定依存性を示す。
これらの結果は、置換ベースラインとカバレッジレポートによる明示的なクロスモーダル評価をサポートする。
関連論文リスト
- ASK-NN: An Asymmetric Nearest-Neighbor Test that detects Distribution Drifts in Natural Language [8.729988313517252]
LLM出力における幻覚や人工テキストは、しばしばプロンプトと応答の隠れ状態分布の間の分布偏差として現れる。
k-nearest-neighbor グラフに基づく非対称な2サンプル試験 ASK-NN を考える。
論文 参考訳(メタデータ) (2026-07-17T04:06:22Z) - Rank-Aware Hyperbolic Alignment for Vision-Language Dataset Distillation [54.74045834035952]
視覚言語データセット蒸留(VLDD)は、大きな画像テキストのペア化されたデータセットを小さな合成ペアに圧縮する。
階層幾何学と明示的なアライメント・キャパシティ制御を組み合わせたランク認識型双曲アライメント(RAHA)を提案する。
RAHAは、競争力のあるクロスモーダル検索と、固定予算下での転送インジケータの改善を示す。
論文 参考訳(メタデータ) (2026-06-28T15:41:31Z) - DVD: A Robust Method for Detecting Variant Contamination in Large Language Model Evaluation [24.086354908256293]
textbfDVDは、温度サンプリングによって誘導される局所的な出力分布をモデル化する単一サンプル検出器である。
我々は,Omni-MATH と SuperGPQA の2つの領域にわたる変異汚染の最初のベンチマークを構築した。
textbfDVDは、パープレキシティベース、Min-$k$%++、編集距離(CDD)、埋め込み類似性ベースラインを一貫して上回る。
論文 参考訳(メタデータ) (2026-01-08T12:48:40Z) - Using Similarity to Evaluate Factual Consistency in Summaries [2.7595794227140056]
抽象要約器は流動的な要約を生成するが、生成したテキストの事実性は保証されない。
本稿では,ゼロショット事実性評価尺度であるSBERTScoreを提案する。
実験の結果,SBERTScoreでは,各手法の強度が異なることが示唆された。
論文 参考訳(メタデータ) (2024-09-23T15:02:38Z) - SUN: Exploring Intrinsic Uncertainties in Text-to-SQL Parsers [61.48159785138462]
本稿では,ニューラルネットワークに基づくアプローチ(SUN)における本質的な不確かさを探索することにより,テキストから依存への変換性能を向上させることを目的とする。
5つのベンチマークデータセットの大規模な実験により、我々の手法は競合より大幅に優れ、新しい最先端の結果が得られた。
論文 参考訳(メタデータ) (2022-09-14T06:27:51Z) - A Closer Look at Debiased Temporal Sentence Grounding in Videos:
Dataset, Metric, and Approach [53.727460222955266]
テンポラル・センテンス・グラウンディング・イン・ビデオ(TSGV)は、未編集のビデオに自然言語文を埋め込むことを目的としている。
最近の研究では、現在のベンチマークデータセットには明らかなモーメントアノテーションバイアスがあることが判明している。
偏りのあるデータセットによる膨らませ評価を緩和するため、基礎的リコールスコアを割引する新しい評価基準「dR@n,IoU@m」を導入する。
論文 参考訳(メタデータ) (2022-03-10T08:58:18Z) - Contextualized Semantic Distance between Highly Overlapped Texts [85.1541170468617]
テキスト編集や意味的類似性評価といった自然言語処理タスクにおいて、ペア化されたテキストに重複が頻繁に発生する。
本稿では,マスク・アンド・予測戦略を用いてこの問題に対処することを目的とする。
本稿では,最も長い単語列の単語を隣接する単語とみなし,その位置の分布を予測するためにマスク付き言語モデリング(MLM)を用いる。
セマンティックテキスト類似性の実験では、NDDは様々な意味的差異、特に高い重なり合うペアテキストに対してより敏感であることが示されている。
論文 参考訳(メタデータ) (2021-10-04T03:59:15Z) - Double Perturbation: On the Robustness of Robustness and Counterfactual
Bias Evaluation [109.06060143938052]
テストデータセットを超えたモデル弱点を明らかにするための"ダブル摂動"フレームワークを提案する。
この枠組みを,モデルの頑健さと英語における反事実バイアスの分析に使用される2つの摂動に基づくアプローチに応用する。
論文 参考訳(メタデータ) (2021-04-12T06:57:36Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。