論文の概要: SimAuthor: Harnessing Foundation Models for Persistent Scientific Simulator Authoring
- arxiv url: http://arxiv.org/abs/2610.06257v1
- Date: Mon, 05 Oct 2026 12:52:16 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-09 17:24:04.43827
- Title: SimAuthor: Harnessing Foundation Models for Persistent Scientific Simulator Authoring
- Title(参考訳): SimAuthor: 永続的な科学シミュレータオーサリングのためのハーネスング基礎モデル
- Abstract要約: 基礎モデルは科学的なコードを生成することができるが、科学的なシミュレータ(観測可能な信号を生成するメカニズムに関する仮説を符号化する実行可能なプログラム)の執筆には反復的な改良が必要である。
実行可能シミュレータの保持と更新を行う永続的なオーサリングハーネスであるSimAuthorを紹介する。
心・呼吸オーディオ,光胸腺造影,心電図の6つの課題についてSimAuthorの評価を行った。
- 参考スコア(独自算出の注目度): 15.811636688600364
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Foundation models can generate scientific code, but authoring a scientific simulator (an executable program encoding hypotheses about how mechanisms generate observable signals) requires iterative refinement. Scientific adequacy rarely admits a unique implementation or exact test, so simulators must instead be judged against limited real observations. We study this setting as scientific simulator authoring under weak empirical feedback, where distributional comparisons between simulated and real signals guide revision, and the target is the simulator itself rather than only its generated samples. We introduce SimAuthor, a persistent authoring harness that retains and revises executable simulators, separates scalar search scores from structured discrepancy feedback, and accumulates reusable implementation mechanisms. We evaluate SimAuthor on six biomedical tasks spanning cardiac and respiratory audio, photoplethysmography (PPG), and electrocardiography (ECG). Under a fixed 100-attempt budget, SimAuthor outperforms PUCT score search on all six tasks, generally outperforms textual-strategy optimization, and achieves the highest endpoint score on five of six. The authored simulators also improve on unseen recordings, transfer to independent pretrained representations, and yield substantial out-of-distribution gains in downstream ECG classification. Finally, 111 of 138 audited revisions alter program structure and account for 86.1% of the signed score improvement. These results suggest that persistent revision can progressively convert foundation-model knowledge into better executable scientific simulators from limited empirical evidence.
- Abstract(参考訳): 基礎モデルは科学的なコードを生成することができるが、科学的なシミュレータ(観測可能な信号を生成するメカニズムに関する仮説を符号化する実行可能なプログラム)の執筆には反復的な改良が必要である。
科学的妥当性は、ユニークな実装や正確なテストはめったに認めないため、シミュレータは限られた実際の観測から判断されなければならない。
本研究は, シミュレーションと実信号の分布比較により, シミュレーション自体が生成したサンプルだけでなく, シミュレーション自体が対象となっている, 弱い経験的フィードバックの下で, 科学的シミュレータとして検討する。
我々はSimAuthorを紹介した。SimAuthorは、実行可能シミュレータの保持と修正を行い、スカラー検索スコアを構造化された不一致フィードバックから分離し、再利用可能な実装メカニズムを蓄積する。
心臓・呼吸オーディオ,光胸腺造影(PPG),心電図(ECG)の6つのバイオメディカルタスクについてSimAuthorの評価を行った。
固定100-attempt予算の下では、SimAuthorはPUCTスコアを6つのタスクすべてで上回り、一般的にテキスト-ストラテジー最適化を上回り、6つのうち5つで最高エンドポイントスコアを達成している。
著者らはまた、未確認記録を改善し、独立した事前訓練された表現に移行し、下流のECG分類においてかなりのアウト・オブ・ディストリビューションゲインを得る。
最後に、128点中111点がプログラム構造を変え、86.1%のスコア改善を達成した。
これらの結果は, 基礎モデル知識を限られた経験的証拠から, より有効な科学シミュレータに段階的に変換できることを示唆している。
関連論文リスト
- Limitations of Automated Simulatability: LLM Simulators Can Bypass Explanations [16.24449973143784]
Simulatability(シミュラビリティ)は、ユーザがタスクモデルのアウトプットを予測するのにいかに役立つかによって、その有用性を定量化する説明のための評価プロトコルである。
テストされたデータセット、説明ファミリ、シミュレータLLM間でのConSimの説明方法のランキングを再現し、拡張する。
シミュレーターは、説明に頼らずに、直接分類タスクを解くことで、高いシミュラビリティを得ることができることがわかった。
論文 参考訳(メタデータ) (2026-09-08T11:21:55Z) - Mind the Sim2Real Gap in User Simulation for Agentic Tasks [101.69142591891234]
ユーザシミュレーションにおけるSim2Realのギャップを形式化し、実際の人間に対して$$$-benchプロトコルを実行する最初の研究を示す。
LLMシミュレータは過度に協調的であり、スタイリスティックに均一であり、現実的なフラストレーションや曖昧さを欠いている。
これらの知見は, LLMベースのユーザシミュレータをエージェント開発サイクルで使用する際の人間による検証の重要性を強調した。
論文 参考訳(メタデータ) (2026-03-11T19:12:31Z) - Agentic Scientific Simulation: Execution-Grounded Model Construction and Reconstruction [0.0]
そこで本研究では,モデル構築をインタプリタ-アクト-バリデートループとして構成するエージェント科学シミュレーションについて検討する。
完全に微分可能なJuliaベースの貯水池シミュレータJutulDarcyをベースとした参照実装JutulGPTを提案する。
論文 参考訳(メタデータ) (2026-02-27T15:42:05Z) - G-Sim: Generative Simulations with Large Language Models and Gradient-Free Calibration [48.948187359727996]
G-Simは、厳密な経験的校正によるシミュレータ構築を自動化するハイブリッドフレームワークである。
信頼性のある因果的インフォームドシミュレータを生成し、データ効率を軽減し、堅牢なシステムレベルの介入を可能にする。
論文 参考訳(メタデータ) (2025-06-10T22:14:34Z) - YuLan-OneSim: Towards the Next Generation of Social Simulator with Large Language Models [50.35333054932747]
本稿では,YuLan-OneSimというソーシャルシミュレータを紹介する。
ユーザは、シミュレータとの自然言語インタラクションを通じて、シミュレーションシナリオを記述し、洗練することができます。
我々は、経済学、社会学、政治、心理学、組織、人口統計学、法律、コミュニケーションを含む8つの領域にまたがる50のデフォルトシミュレーションシナリオを実装した。
論文 参考訳(メタデータ) (2025-05-12T14:05:17Z) - Simulator Ensembles for Trustworthy Autonomous Driving Testing [2.2956072509238123]
MultiSimは、検索ベースのテストアプローチに基づくマルチシミュレートADASテストの新しいアプローチである。
平均して3.4倍以上のシミュレータに依存しない故障テストと高い故障率を識別する。
以上の結果から,探索における代理モデルの利用は,有効失敗数の平均を保ち,効率も向上することが示された。
論文 参考訳(メタデータ) (2025-03-11T22:34:14Z) - BeSimulator: A Large Language Model Powered Text-based Behavior Simulator [18.318419980796012]
本研究では,BeSimulatorをテキストベースの環境下での動作シミュレーションの試みとして提案する。
BeSimulatorはシナリオを一般化し、長距離複素シミュレーションを実現する。
本実験は, ベースラインに比べ, 挙動シミュレーションにおいて顕著な性能向上を示した。
論文 参考訳(メタデータ) (2024-09-24T08:37:04Z) - Investigating the Robustness of Counterfactual Learning to Rank Models: A Reproducibility Study [71.04084063541777]
ランク付けのためのカウンターファクトラーニングはIRコミュニティで広く注目を集めている。
モデルは、ユーザの振る舞いの仮定が正しく、確率推定が正確であるときに理論的に非バイアス化される。
それらの有効性は通常シミュレーションベースの実験を通じて実証的に評価されるが、これは広く利用可能な大規模で実際のクリックログが不足しているためである。
論文 参考訳(メタデータ) (2024-04-04T10:54:38Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。