論文の概要: CasualSynth: Generating Structurally Sound Synthetic Data
- arxiv url: http://arxiv.org/abs/2605.17528v1
- Date: Sun, 17 May 2026 16:21:01 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-19 17:57:48.12878
- Title: CasualSynth: Generating Structurally Sound Synthetic Data
- Title(参考訳): CasualSynth: 構造的音声合成データの生成
- Authors: Zehua Cheng, Wei Dai, Jiahao Sun, Thomas Lukasiewicz,
- Abstract要約: 大言語モデル(LLM)は、現実的な合成データを生成するが、その出力がターゲットドメインを管理する因果的メカニズムを尊重することを保証しない。
本稿では,意味的実現から因果構造の生成を分離するフレームワークCausal Synthを紹介し,因果的妥当性と言語学的にリッチな合成データを生成する。
- 参考スコア(独自算出の注目度): 44.80087038178069
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large Language Models (LLMs) generate realistic synthetic data but offer no guarantee that their outputs respect the causal mechanisms governing the target domain. We introduce CausalSynth, a framework that decouples causal structure generation from semantic realization, yielding synthetic data that is both causally valid and linguistically rich. The framework operates in three phases. First, a Structural Causal Model (SCM) - a tuple of structural equations defined over a directed acyclic graph (DAG) generates causal skeletons, i.e., variable assignments that satisfy the Global Markov Property of the governing DAG, via ancestral sampling. Second, an LLM acts as a constrained \emph{realizer}, a conditional translator that maps each skeleton to a high-dimensional observation such as a clinical note or a transaction log. Third, an Iterative Consistency Verification module detects structural violations through deterministic extraction and feeds targeted corrections back to the LLM, forming a closed-loop refinement process. We identify the Semantic Backdoor problem the systematic tendency of LLMs to override imposed causal facts with pre-training priors -- and prove that our iterative mechanism reduces the resulting selection bias relative to standard rejection sampling. On three causal benchmarks (ASIA, ALARM, and MIMIC-Struct), CausalSynth preserved conditional independencies with false-positive rates near the nominal $α=0.05$ level and achieved realizability rates above 96% with 70B-parameter LLM backbones. The framework additionally supports principled interventional and counterfactual generation through noise retention and graph mutilation.
- Abstract(参考訳): 大言語モデル(LLM)は、現実的な合成データを生成するが、その出力がターゲットドメインを管理する因果的メカニズムを尊重することを保証しない。
カウサルシンス(CausalSynth)は,意味的実現から因果構造の生成を分離し,因果的妥当性と言語学的に豊かな合成データを生成するフレームワークである。
フレームワークは3つのフェーズで動作します。
第一に、構造因果モデル (Structure Causal Model, SCM) - 有向非巡回グラフ (DAG) 上に定義された構造方程式のタプルは、因果骨格を生成する。
第二に、LSMは制約付き \emph{realizer} として機能し、それぞれの骨格を臨床ノートやトランザクションログのような高次元の観察にマッピングする条件翻訳装置である。
第3に、反復一貫性検証モジュールは、決定論的抽出によって構造上の違反を検出し、目標とする修正をLLMにフィードバックし、クローズドループ精製プロセスを形成する。
セマンティックバックドア問題(Semantic Backdoor problem)は、LLMの体系的な傾向として、事前学習された事前学習による因果事実をオーバーライドし、我々の反復的なメカニズムが標準拒絶サンプリングと比較して選択バイアスを減少させることを証明している。
3つの因果ベンチマーク(ASIA、ALARM、MIMIC-Struct)では、CausalSynthは、名目上の$α=0.05$レベルに近い偽陽性率の条件付き不一致を保存し、70BパラメーターLLMバックボーンで96%以上の実現率を達成した。
このフレームワークは、ノイズ保持とグラフの再利用を通じて、原則化された介入および反ファクト生成をサポートする。
関連論文リスト
- PRIM: Meta-Learned Bayesian Root Cause Analysis [6.537088094470879]
PRIM (Prior-fitted Root cause Identification with Meta-learning) は因果メタラーニング手法である。
PRIMは、ベースラインと異常周期の間のデータ生成機構の変化を暗黙的に識別する。
明示的な統計的テストなしで分布差を推測し、テスト時にモデルフィッティングなしで因果構造を暗黙的に学習する。
論文 参考訳(メタデータ) (2026-05-09T08:14:09Z) - OMG-Agent: Toward Robust Missing Modality Generation with Decoupled Coarse-to-Fine Agentic Workflows [9.617220633655716]
textbfunderlineOmni-textbfunderlineModality textbfunderlineGeneration Agent (textbfOMG-Agent)について述べる。
論文 参考訳(メタデータ) (2026-02-04T02:25:40Z) - VERGE: Formal Refinement and Guidance Engine for Verifiable LLM Reasoning [4.3414302048068745]
本稿では,大規模言語モデルとSMTソルバを組み合わせたニューロシンボリック・フレームワークを提案する。
本稿では,(1)形式的意味的等価性チェックによるマルチモデルコンセンサス,(2)適切な検証戦略に異なるクレーム型を指示するセマンティックルーティング,(3)最小補正サブセットによる正確な論理的エラーローカライゼーション,の3点を紹介する。
GPT-OSS-120Bモデルでは、VERGEはシングルパスアプローチと比較して、一連の推論ベンチマークにおいて平均18.7%の性能向上を示す。
論文 参考訳(メタデータ) (2026-01-27T20:59:11Z) - Improving LLM Reasoning with Homophily-aware Structural and Semantic Text-Attributed Graph Compression [55.51959317490934]
大規模言語モデル(LLM)は、テキスト分散グラフ(TAG)理解において有望な能力を示している。
グラフは本来、構造情報や意味情報を豊富に含むものであり、それらの有効利用はLLMの推論性能の潜在的な利益を解放する可能性があると論じる。
グラフホモフィリーの活用を目的としたフレームワーク LLMs (HS2C) のホモフィリー対応構造とセマンティック圧縮を提案する。
論文 参考訳(メタデータ) (2026-01-13T03:35:18Z) - Learning Causality for Longitudinal Data [1.2691047660244335]
この論文は、高次元の時間変化データにおける因果推論と因果表現学習の手法を開発する。
最初のコントリビューションは、個別処理効果(ITE)を推定するモデルであるCDVAE(Causal Dynamic Variational Autoencoder)の導入である。
第2のコントリビューションでは,Contrastive Predictive Coding (CPC) とInfoMaxによって強化された RNN に基づく長期的反事実回帰のための効率的なフレームワークを提案する。
第3のコントリビューションは、潜伏が観察された変数にどのように現れるかに対処することでCRLを前進させる。
論文 参考訳(メタデータ) (2025-12-04T16:51:49Z) - A Technical Exploration of Causal Inference with Hybrid LLM Synthetic Data [3.121656940390038]
大規模言語モデル(LLM)は、合成データを生成する柔軟な手段を提供する。
既存のアプローチでは、平均処理効果(ATE)のような主要な因果パラメータを保存できない場合が多い。
論文 参考訳(メタデータ) (2025-10-31T23:34:44Z) - Retrieval is Not Enough: Enhancing RAG Reasoning through Test-Time Critique and Optimization [58.390885294401066]
Retrieval-augmented Generation (RAG) は知識基底型大規模言語モデル(LLM)を実現するためのパラダイムとして広く採用されている。
RAGパイプラインは、モデル推論が得られた証拠と整合性を維持するのに失敗することが多く、事実上の矛盾や否定的な結論につながる。
批判駆動アライメント(CDA)に基づく新しい反復的枠組みであるAlignRAGを提案する。
AlignRAG-autoは、動的に洗練を終了し、批判的な反復回数を事前に指定する必要がなくなる自律的な変種である。
論文 参考訳(メタデータ) (2025-04-21T04:56:47Z) - Towards Robust and Adaptive Motion Forecasting: A Causal Representation
Perspective [72.55093886515824]
本稿では,3つの潜伏変数群からなる動的過程として,運動予測の因果的形式化を導入する。
我々は、因果グラフを近似するために、不変なメカニズムやスタイルの共創者の表現を分解するモジュラーアーキテクチャを考案する。
合成および実データを用いた実験結果から,提案した3つの成分は,学習した動き表現の頑健性と再利用性を大幅に向上することが示された。
論文 参考訳(メタデータ) (2021-11-29T18:59:09Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。