論文の概要: Explore, Then Commit: Measurement-Efficient Scientific Law Discovery with Language Models
- arxiv url: http://arxiv.org/abs/2610.07620v1
- Date: Tue, 06 Oct 2026 02:11:39 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 02:58:29.753991
- Title: Explore, Then Commit: Measurement-Efficient Scientific Law Discovery with Language Models
- Title(参考訳): 言語モデルによる効果的な科学的法則の発見
- Abstract要約: 本研究では,大規模言語モデルが仮説を提案し,プログラム型プランナが測定値を収集し,新しいプロンプトが固定された観測結果から最終法則を合成する探索列コミットプロトコルを評価する。
576 NewtonBenchの試験で、GPT-4.1-miniと中分散GPT-4.1レプリケーションを用いて12の物理モジュール上の8つの構成を比較した。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Scientific law discovery requires selecting measurements and converting evidence into a governing equation. We evaluate an explore-then-commit protocol in which a large language model proposes hypotheses, a programmatic planner gathers measurements, and a fresh prompt synthesizes the final law from fixed observations. The protocol combines structured probes, automatic numerical diagnostics, restricted measurement batches, and optional interpreter access. Across 576 NewtonBench trials, we compare eight configurations on 12 physics modules using GPT-4.1-mini and a medium-difficulty GPT-4.1 replication. On medium tasks, interpreter-enabled planners use 8.6 versus 22.5 measurements per trial for GPT-4.1-mini and 8.9 versus 43.0 for GPT-4.1. Their mean magnitude-based root-mean-squared logarithmic error falls from 2.514 to 0.202 and from 0.626 to 0.149, respectively. An additional audit retains incomplete and invalid submissions in a coverage-sensitive analysis. Observed symbolic-accuracy gains are less consistent across modules, and random acquisition is competitive with disagreement scoring. Measurement savings occur in every module, but unequal batch constraints prevent attributing them solely to acquisition quality. These results support the complete protocol as a promising measurement-efficient configuration, while leaving its causal components and generalization beyond noiseless direct-equation tasks unresolved.
- Abstract(参考訳): 科学的法発見には、測定を選定し、証拠を支配方程式に変換する必要がある。
本研究では,大規模言語モデルが仮説を提案し,プログラム型プランナが測定値を収集し,新しいプロンプトが固定された観測結果から最終法則を合成する探索列コミットプロトコルを評価する。
このプロトコルは構造化プローブ、自動数値診断、制限された測定バッチ、オプションのインタプリタアクセスを組み合わせたものである。
576 NewtonBenchの試験で、GPT-4.1-miniと中分散GPT-4.1レプリケーションを用いて12の物理モジュール上の8つの構成を比較した。
中間処理では、インタプリタ対応プランナーは、GPT-4.1-miniの試験で8.6対22.5、GPT-4.1では8.9対43.0を使用する。
平均等級に基づく根平均二乗誤差は2.514から0.202に、それぞれ0.626から0.149に減少する。
追加監査は、カバレッジに敏感な分析において不完全かつ無効な提出を保持する。
観測された記号精度のゲインはモジュール間で一貫性が低く、ランダムな取得は不一致スコアと競合する。
測定の節約は各モジュールで発生しますが、不平等なバッチ制約は、それらが取得品質のみに起因することを防ぎます。
これらの結果は、完全なプロトコルを有望な測定効率の構成としてサポートし、因果成分と一般化は、ノイズレス直列タスク以外は未解決のままである。
関連論文リスト
- World Requirement Model: Learning Requirement-Change Consequences from Typed Artifact Graphs [31.60344882359958]
我々は、このエンジニアリングコンテキストを型付きアーティファクトグラフとしてエンコードし、共有アーティファクト識別子における結果を予測する世界要求モデル(WRM)を提案する。
WRMは、ハッシュテキスト多層パーセプトロンに対して0.724対0.623の衝撃平均精度(MAP)を得る。
WRMは、アーティファクトに適応した世界モデルの定式化、文脈的結果のスコアリングの比較証拠、および要求世界予測を評価するための明示的な条件に貢献している。
論文 参考訳(メタデータ) (2026-10-03T11:16:57Z) - On the Divergence of Accuracy and Mechanism Consistency in Time Series World Models [39.88832373182896]
時系列世界モデル(TSWM)は、観測された履歴と計画された行動と入力から制御システムの状態を予測する。
実際のシステムのように、どの設計選択が重要か、そして正確な予測が変更計画に反応するかどうかを問う。
我々はTSWMに、凍結した潜伏空間と精度のための出力側融合のレシピと、メカニズムの整合性のトレーニング目標を与える。
論文 参考訳(メタデータ) (2026-10-01T15:10:09Z) - Greedy Decoding Is Not Precision-Invariant: Cross-Precision Output Divergence in LLM Inference [13.137699166830322]
大規模言語モデルからのグレディ復号は、一般に決定論的として扱われる。
同一のモデル,プロンプト,デコードアルゴリズムは同一のハードウェア上で,BF16とFP16の異なる出力を生成する。
実験により,22層に蓄積したボディーエラーは,浮動小数点数と浮動小数点数とを区別しないことがわかった。
論文 参考訳(メタデータ) (2026-09-22T15:54:16Z) - The Deception Delta: Adversarial Evaluation of LLM-Based Smart Contract Bytecode Forensics [0.0]
大規模な言語モデルは、ブロックチェーンの法医学的な調査でますます使われている。
逆行性騙しは ドレインの検出を 20.0ポイント減らす
モデルは、隠されたドレインメカニズムを正しく記述するが、契約のフレーミングを受け入れ、それを良心として無視する。
論文 参考訳(メタデータ) (2026-09-12T18:45:24Z) - Marginal Fidelity Does Not Establish User Simulation in Demographic Synthetic Survey Panels: Response Contracts, Support Collapse and Conditioning Failure [51.736723807086385]
人口密着協定は、個別のシミュレーションの証拠ではなく、エスカレーション契約の証拠であり、シミュレーションされた回答者なしで得られる推定値である。
9つのアライメントされたモデルバッテリペアでは、非個人個体数のクエリの平均は6.27 MAE対12.39であり、9つの比較すべてで勝利する。
論文 参考訳(メタデータ) (2026-09-07T10:22:22Z) - Maximum Matching Accuracy: An Instance Segmentation Evaluation Metric Utilizing Globally Optimal Matching [39.3098730337656]
本研究では,予測された真理オブジェクトと地上の真理オブジェクトの1対1の大域的最適マッチングを求める閾値フリー連続計量を提案する。
MMAは既存の代替品よりも安定で、感度が高く、解釈しやすいスコアを生成する。
論文 参考訳(メタデータ) (2026-06-08T19:36:28Z) - Distributional Energy-Based Models for Uncertainty-Aware Structured LLM Reasoning [40.342912574072024]
大規模言語モデルは、旅行計画やコードソリューションのような構造化されたアウトプットを生成する。
個々の推論ステップは正しく見えるが、アウトプット全体が予算に違反したり、テストケースに失敗したり、あるいは以前の推論に矛盾することがある。
構造化LCM出力の検証のための決定論的解析制約付き学習品質スコアラを提案する。
論文 参考訳(メタデータ) (2026-05-15T17:08:27Z) - Authority Inversion in LLM-Mediated Ubiquitous Systems: When Models Trust Users Over Sensors [6.414826816896125]
センサ計測とユーザ主張の衝突が未検討のままである場合に,大規模言語モデルがどのように権威を暗黙的に割り当てるかを検討する。
数値センサデータが解答関連モデル方向への統合に失敗し、自然言語によるクレームが最終決定を支配できることがわかった。
提案するGeometric Authority (GAC) は,不適切なユーザ権限を抑えるための推論時間層レベルの介入である。
論文 参考訳(メタデータ) (2026-04-28T04:59:03Z) - Understanding NPM Malicious Package Detection: A Benchmark-Driven Empirical Analysis [10.599261033874884]
NPMエコシステムは、ソフトウェアサプライチェーン攻撃の主要なターゲットとなっている。
ベンチマークによるNPMマルウェア検出の実証分析を行う。
我々は、11の行動カテゴリと8の回避テクニックを付加した、6,420の悪意のある7,288の良性パッケージのデータセットを構築した。
論文 参考訳(メタデータ) (2026-03-29T07:04:31Z) - Machine Translation Meta Evaluation through Translation Accuracy
Challenge Sets [92.38654521870444]
ACESは146の言語ペアにまたがる対照的な課題セットです。
このデータセットは、メトリクスが68の翻訳精度の誤差を識別できるかどうかを調べることを目的としている。
我々は、WMT2022および2023のメトリクス共有タスクに提出された50のメトリクスに対して、ACESをベンチマークすることで、大規模な研究を行う。
論文 参考訳(メタデータ) (2024-01-29T17:17:42Z) - Fault-tolerant parity readout on a shuttling-based trapped-ion quantum
computer [64.47265213752996]
耐故障性ウェイト4パリティチェック測定方式を実験的に実証した。
フラグ条件パリティ測定の単発忠実度は93.2(2)%である。
このスキームは、安定化器量子誤り訂正プロトコルの幅広いクラスにおいて必須な構成要素である。
論文 参考訳(メタデータ) (2021-07-13T20:08:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。