論文の概要: Library Reachability in LSR-Synth: How Anti-Memorization Design Changes the Measurement of Symbolic Discovery
- arxiv url: http://arxiv.org/abs/2607.28684v1
- Date: Thu, 30 Jul 2026 02:36:26 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-03 14:29:40.369781
- Title: Library Reachability in LSR-Synth: How Anti-Memorization Design Changes the Measurement of Symbolic Discovery
- Title(参考訳): LSR合成におけるライブラリーの到達可能性:シンボリック発見の測定による反記憶設計の変化
- Authors: Zhan'ao Yao, Liang Yin, Zhihao Gao, Boxuan Zhang, Xiaoyu Wu, Linjing Li, Rongyan Wang, Tingwei Chen, Youwei Wang, Xiaolin Zhao, Jiahui Shi, Jianjun Liu,
- Abstract要約: LSR-Synthsは従来の演算子探索と言語モデルによって提供される科学的な先行性を区別できることを示す。
我々は、公文書化された証明を持つ固定語彙を用いて意味論のないベースラインを構築する。
現状のタスクの多くは、未確認表現の適合性や組換え性を評価するのに相応しいが、固定された検索空間を超えた事前のコントリビューションを特定するには、それ自身では不十分である、と結論付けている。
- 参考スコア(独自算出の注目度): 22.607520089601124
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Existing benchmarks for scientific equation discovery are largely composed of well-known equations available in the public domain, making it difficult to determine whether a model is discovering laws from data or merely recalling answers from its training corpus. LSR-Synth mitigates this problem by introducing novel synthetic terms into established scientific mechanisms and filtering the resulting tasks for novelty, solvability, and scientific plausibility. This paper examines a narrower measurement question: can these tasks further distinguish scientific priors supplied by language models from conventional operator search that does not access task semantics? We construct a semantics-free baseline using a fixed vocabulary with publicly documented provenance, and assess the role of candidate coverage through semantic blinding, library weakening, and matched operator-family knockouts. Under the current task snapshot, search budget, and scoring protocol, the fixed vocabulary already covers most tasks, while language-model-generated candidates rarely expand the set of solvable instances. Their marginal contribution becomes substantial only when vocabulary coverage is selectively disrupted. Strict out-of-distribution evaluation lowers the absolute success rates of all methods but does not alter this relationship. These findings neither invalidate LSR-Synth's controls against memorization of complete formulas nor imply that language-model priors are generally unhelpful. Rather, they support a more limited conclusion: most current tasks remain suitable for evaluating the fitting and recombination of previously unseen expressions, but are insufficient on their own to identify contributions from priors beyond a fixed search space.
- Abstract(参考訳): 既存の科学的方程式発見のベンチマークは、主にパブリックドメインで利用可能なよく知られた方程式で構成されており、モデルがデータから法則を発見しているか、あるいは単にトレーニングコーパスから答えをリコールしているかを判断することは困難である。
LSR-Synthは、新しい合成用語を確立された科学的メカニズムに導入し、新規性、可溶性、科学的妥当性のためのタスクをフィルタリングすることでこの問題を緩和する。
本稿では,これらのタスクが,言語モデルによって提供される科学的先入観と,タスク意味論にアクセスできない従来のオペレータ検索とをさらに区別することができるか,という,より狭い測定課題について検討する。
文書化された証明付き定型語彙を用いてセマンティックスフリーのベースラインを構築し、セマンティックブラインド、ライブラリの弱化、および演算子親子ノックアウトによる候補カバレッジの役割を評価する。
現在のタスクスナップショット、検索予算、スコアリングプロトコルでは、固定語彙がほとんどのタスクをカバーしているが、言語モデル生成候補が解決可能なインスタンスのセットを拡張することは滅多にない。
彼らの限界貢献は、語彙のカバレッジが選択的に破壊されるときにのみ、実質的になる。
厳密なアウト・オブ・ディストリビューション評価は、すべてのメソッドの絶対的な成功率を下げるが、この関係は変わらない。
これらの知見は, LSR-Synthの完全式記憶に対する制御を無効にしたり, 言語モデル先行が一般的には不完全であることを示唆するものではない。
むしろ、これらのタスクはより限定的な結論を支持しており、現在のタスクの多くは、以前は目に見えない表現の適合と再結合を評価するのに相応しいが、固定された検索空間を超えた事前からの貢献を特定するには、それ自体では不十分である。
関連論文リスト
- Weave of Formal Thought [51.56484100374058]
WoFT(Weave of Formal Thought)は、厳密な構文的検証と学習された構造的表現を結合したパラダイムである。
本稿では,非終端文法記号を直接生成にインターリーブするために,言語モデルを訓練する潜時可変微調整法を提案する。
Pythonでは、RWS目的のStarCoder2-3Bを微調整することで、テキストのみのSFTベースラインと比較して、トーケン毎のクロスエントロピーが14.3%削減される。
論文 参考訳(メタデータ) (2026-06-24T15:58:11Z) - Lost in Sampling: Assessing Lexical Reachability in LLMs via the Word Coverage Score (WCS) [3.71430272682278]
WCS(Word Coverage Score)は、標準的なサンプリングフィルタによって、文脈的に適切な人間の語彙が数学的に決定される範囲を定量化する指標である。
人為的なコーパスフラグメント上のオープンウェイトモデルを監査することにより、デコーダによってどの論理的語彙選択が到達不能であるかを識別する。
論文 参考訳(メタデータ) (2026-05-26T16:44:25Z) - Rationale-Augmented Retrieval with Constrained LLM Re-Ranking for Task Discovery [4.061135251278187]
GoEngageを利用するヘッドスタートプログラムは、新しいスタッフやローテーションスタッフがプラットフォームホームページで適切なタスクを見つけようとすると、重大な課題に直面します。
これらの困難は、ドメイン固有の用語、システム固有の命名法、およびタイポスや様々な単語順序を扱う際の語彙探索の固有の制限から生じる。
本稿では, 軽量な型付き語彙検索, 埋め込み型ベクトル類似性, 制約付き大言語モデル(LLM)を組み合わさった, 実用的なハイブリッド意味検索システムを提案する。
論文 参考訳(メタデータ) (2025-10-01T01:28:59Z) - MMLU-SR: A Benchmark for Stress-Testing Reasoning Capability of Large Language Models [8.7734602595507]
大規模言語モデル(LLM)の真の理解能力を測定するための新しいデータセットMMLU-SRを提案する。
我々は、キーワードをダミー語に置き換え、その定義に従って標準化されたテスト質問を修正した。
このような置換後のモデル性能は大幅に低下し,理解力の低下が示唆された。
論文 参考訳(メタデータ) (2024-06-15T05:35:47Z) - HyPoradise: An Open Baseline for Generative Speech Recognition with
Large Language Models [81.56455625624041]
ASRの誤り訂正に外部の大規模言語モデル(LLM)を利用する最初のオープンソースベンチマークを導入する。
提案したベンチマークには、334,000組以上のN-best仮説を含む新しいデータセットHyPoradise (HP)が含まれている。
合理的なプロンプトと生成能力を持つLLMは、N-bestリストに欠けているトークンを修正できる。
論文 参考訳(メタデータ) (2023-09-27T14:44:10Z) - Syntax and Semantics Meet in the "Middle": Probing the Syntax-Semantics
Interface of LMs Through Agentivity [68.8204255655161]
このような相互作用を探索するためのケーススタディとして,作用性のセマンティックな概念を提示する。
これは、LMが言語アノテーション、理論テスト、発見のためのより有用なツールとして役立つ可能性を示唆している。
論文 参考訳(メタデータ) (2023-05-29T16:24:01Z) - Conjunct Resolution in the Face of Verbal Omissions [51.220650412095665]
本稿では,テキスト上で直接動作する接続分解タスクを提案し,コーディネーション構造に欠けている要素を復元するために,分割・言い換えパラダイムを利用する。
クラウドソースアノテーションによる自然に発生する動詞の省略例を10万件以上を含む,大規模なデータセットをキュレートする。
我々は、このタスクのために様々な神経ベースラインをトレーニングし、最良の手法が適切なパフォーマンスを得る一方で、改善のための十分なスペースを残していることを示す。
論文 参考訳(メタデータ) (2023-05-26T08:44:02Z) - Improving Pre-trained Language Models with Syntactic Dependency
Prediction Task for Chinese Semantic Error Recognition [52.55136323341319]
既存の中国語のテキスト誤り検出は主にスペルと単純な文法的誤りに焦点を当てている。
中国の意味的誤りは、人間が容易に認識できないほど過小評価され、複雑である。
論文 参考訳(メタデータ) (2022-04-15T13:55:32Z) - End-to-End Open Vocabulary Keyword Search [13.90172596423425]
本稿では,キーワード検索に最適化されたモデルを提案する。
提案モデルでは, 正と負の試行比率が人工的に均衡するタスクにおいて, 同様のエンド・ツー・エンドモデルより優れる。
LVCSRをベースとしたキーワード検索システムでは,出力の再スコア付けに本システムを用いることで,大幅な改善が期待できる。
論文 参考訳(メタデータ) (2021-08-23T18:34:53Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。