論文の概要: Grounded verification of chemical and materials reasoning: detection is the bottleneck
- arxiv url: http://arxiv.org/abs/2607.17417v1
- Date: Sun, 19 Jul 2026 21:44:47 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-21 18:48:37.463012
- Title: Grounded verification of chemical and materials reasoning: detection is the bottleneck
- Title(参考訳): 化学的・物質的推論の基盤的検証--検出がボトルネックである
- Abstract要約: データベース基底検証は、毛布検索のカバレッジコストを伴わずに、エラーをキャッチし、修復することができる。
我々の結合検証器は、各チェック可能なクレームを抽出し、権威あるデータベースや物理と照合し、基準をゲート補正ループに入力する。
- 参考スコア(独自算出の注目度): 2.3982445219832678
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language models confabulate chemical objects (molecular formulas, space groups, formation energies) in fluent reasoning traces, concentrated on long-tail entities where confidence is least trustworthy. Deterministic, database-grounded verification can catch and repair such errors without the coverage cost of blanket retrieval; the binding constraint, we find, is detection, not repair. Our tiered verifier extracts each checkable claim, checks it against authoritative databases and physics, and feeds the reference into a gated correction loop. Across four models and 528 condition-pinned prompts, gated correction cuts committed-formula error from 22% to 4% at $3.2\times$ fewer retrievals than blanket augmentation, beating a conversational oracle. Repair succeeds wherever a flag fires (80--97%); the bottleneck is in-loop detection recall. Grounding improves the final answer only when the verifier's scope reaches the deliverable (83% to 90%), and the lift appears only where extractable long-tail error exists: absent on near-ceiling physical constants, large on isotope half-lives (11% to 0%).
- Abstract(参考訳): 大規模言語モデルは、信頼性が最小限に信頼できるロングテールエンティティに集中して、化学対象(分子式、空間群、生成エネルギー)を流動的な推論トレースで分割する。
決定論的でデータベースを基盤とした検証は、毛布検索のカバレッジコストを伴わずに、そのようなエラーをキャッチし、修復することができる。
我々の結合検証器は、各チェック可能なクレームを抽出し、権威あるデータベースや物理と照合し、基準をゲート補正ループに入力する。
4つのモデルと528の条件付きプロンプトの合計で、ゲート補正はコミットフォーミュラエラーを22%から4%に減らし、3.2\times$で毛布の増補よりも少ない検索を減らし、会話の託宣を破る。
フラグが発火する場所(80-97%)で修復は成功し、ボトルネックはループ内検出リコールである。
グラウンドリングは、検証対象のスコープが納入可能(83%から90%)に達した場合にのみ最終回答を改善し、リフトは抽出可能な長いテール誤差が存在する場合にのみ現れる。
関連論文リスト
- IdeaAMBIG: Benchmarking Implementation-Critical Gaps in Research-Idea Specifications [52.570108663867046]
研究のアイデアは、新しく、一貫性があり、科学的に妥当であるが、その提案された手法は、忠実な実装のために不十分に指定されている。
提案手法は,実装を対象とする研究手法仕様の体系化の可否を,有能な実装者やコーディングエージェントに十分な方法論的情報を提供して,前提条件を満たさずに目的とする手法を構築することができるかを検討する。
IdeaAMBIGは660のエビデンス基底インスタンスのベンチマークで、レポートとGitHubの問題から163の現実世界のギャップと、コーディフィケーション対応のリファレンスに注入される合成ギャップを497のコントロールで管理する。
論文 参考訳(メタデータ) (2026-09-09T17:59:04Z) - Metadata Reconstruction from Values Alone: Recovering Column Semantics in Undocumented Warehouses [0.0]
Rosettaはデータ自体から列と値の意味を検索する。
盲目のi2b2臨床倉庫では、ロゼッタは値だけで134の実際のICD-9符号の95.5%をデコードしている。
論文 参考訳(メタデータ) (2026-08-08T06:12:18Z) - Validation Evidence in LLM Repair Agents: How Much of What Passes Actually Tests the Bug? [1.6787220460106658]
BSG-VAは、各バリデーションコマンドをその正確な作業ツリー状態にキャプチャし、テストのみのパッチを抽出し、元のバギーコードでコマンドを再生する。
キャプチャされた結果とリプレイ結果は、ゴールドアラインのバグ識別からレグレッションのみ、誤解を招くまで、すべてのイベントにエビデンスの役割を割り当てます。
エージェントにB-replay結果を返すかどうかを3本腕で実験すると、このパターンが変わる。
論文 参考訳(メタデータ) (2026-07-30T22:32:14Z) - Looping Is Not Reliability: State-Bound Evidence and Typed Revision Contracts for Agentic Code Repair [36.56438114281786]
正しいパッチの発見と保持、検証、提出のギャップについて検討する。
我々はエビデンスバウンド型ループ契約を導出し、その機械的に強制可能なサブセットを参照実装でインスタンス化する。
論文 参考訳(メタデータ) (2026-07-27T16:05:23Z) - AgentDebugX: An Open-Source Toolkit for Failure Observability, Attribution, and Recovery in LLM Agents [83.37969790806069]
LLMエージェントのエラーは、エラーが表面化するステップが原因ではないことが多いため、デバッグが難しい。
Agent DebuggerXはオープンソースのフレームワークで、デバッグをDe Detect, Attribute, Recover, Rerunのクローズドループとして整理する。
コアとなるDeep Debuggerは、グローバルな軌跡理解を通じてマルチターン根本原因診断を行う。
論文 参考訳(メタデータ) (2026-07-21T06:21:13Z) - Structured Feedback Improves Repair in an LLM Agent Loop [2.8890052855500143]
LLMエージェントは、外部から候補を拒否した後で再試行されることが多いが、検証と次のモデル呼び出しの間のインターフェースは未特定のままである。
コード制御エージェントループであるVeriHarnessを導入し、モデルが候補を生成し、外部検証者が受け入れ、予算、トレースを制御する。
生の診断と、失敗位置、観測値、許容可能な代替品を識別するフィードバックを比較します。
論文 参考訳(メタデータ) (2026-07-15T06:14:45Z) - Supersede: Diagnosing and Training the Memory-Update Gap in LLM Agents [0.0]
大規模言語モデル(LLM)エージェントは、事実が変化する長い多セッションの相互作用で機能する。
正しく行動するためには、事実の現在の値を使用し、置き換えられた値を捨てる必要がある。
この測定結果をトレーニング信号に変換するオープンな強化学習環境であるSupersedeをリリースする。
論文 参考訳(メタデータ) (2026-06-25T18:50:32Z) - When Confidence Takes the Wrong Path: Diagnosing Retrieval-State Lock-In in RAG [0.0]
多くのブラックボックスの不確実性法は、まだサンプル回答間の合意を自信として読んでいる。
問題は、デプロイされたRAGで認識されるが、名前、測定可能なシグネチャ、および有病率境界が欠落している。
故障検索状態のロックインを命名し、3つのオブジェクトを1つの信頼スコアが混在して診断する。
論文 参考訳(メタデータ) (2026-06-22T00:08:00Z) - Think Again or Think Longer? Selective Verification for Budget-Aware Reasoning [15.231928045776293]
sevraは、凍結したソルバの初期応答を保存するか、アクティブな検証を実行するかを決定するサーブレイヤーコントローラである。
数学では、選択的検証は76.3%の精度で行われ、検証は常に75.5%である。
CommonsenseQAでは、常時オンの検証が問題になり、Self-Consistency@5では、実現したトークンコストの約5倍の精度が向上する。
論文 参考訳(メタデータ) (2026-06-18T05:25:43Z) - Evaluating Commercial AI Chatbots as News Intermediaries [85.32040752972836]
ベストシステムは、数時間前に報告されたイベントに関する質問に対して、90%以上の多重選択精度を達成する。
すべてのモデルはヒンディー語で最小の精度を達成する。
原因ではなく検索は エラーの70%以上を 引き起こします
論文 参考訳(メタデータ) (2026-05-21T17:42:07Z) - Grounded Continuation: A Linear-Time Runtime Verifier for LLM Conversations [15.537674351419234]
デプロイされたエージェントに対するコンテキスト操作攻撃は、このギャップを積極的に活用する。
明示的な依存性グラフを保持するランタイム検証器でそれをクローズします。
継続がサポートされるかどうかを確認することは、グラフウォークに還元され、リトラクションは同じグラフを通して、サポートを失う結論を正確に宣言する。
論文 参考訳(メタデータ) (2026-05-13T22:54:16Z) - HLE-Verified: A Systematic Verification and Structured Revision of Humanity's Last Exam [63.84155758655084]
HumanityのLast Exam (HLE)は、フロンティアの大規模言語モデルを評価するために広く使われているベンチマークである。
HLE-Verifiedは,透過的検証プロトコルときめ細かい誤り分類法を備えたHLEの検証および改訂版である。
我々は,HLEとHLE-Verifiedの7つの最先端言語モデルを評価し,平均7~10ポイントの絶対精度を観測した。
論文 参考訳(メタデータ) (2026-02-15T02:50:15Z) - High Accuracy, Less Talk (HALT): Reliable LLMs through Capability-Aligned Finetuning [84.52940628494879]
大規模言語モデル(LLM)は現在、すべてのプロンプトに応答する。
LLMは、知識や能力の欠如によって、誤った答えを生み出すことができる。
本稿では,その正確性に自信を持った場合にのみコンテンツを生成するためのLCMのポストトレーニングを提案する。
論文 参考訳(メタデータ) (2025-06-04T15:16:21Z) - Benchmarking Reasoning Robustness in Large Language Models [76.79744000300363]
新規データや不完全データでは,性能が著しく低下することがわかった。
これらの結果は、厳密な論理的推論に対するリコールへの依存を浮き彫りにした。
本稿では,情報不足によって引き起こされる幻覚を利用して推論ギャップを明らかにする,Math-RoBと呼ばれる新しいベンチマークを提案する。
論文 参考訳(メタデータ) (2025-03-06T15:36:06Z) - TACRED Revisited: A Thorough Evaluation of the TACRED Relation
Extraction Task [80.38130122127882]
TACREDはリレーショナル抽出(RE)において最も大きく、最も広く使われているクラウドソースデータセットの1つである
パフォーマンスの天井に到達したのか、改善の余地はあるのか?
ラベルエラーは絶対F1テストエラーの8%を占めており、例の50%以上を可逆化する必要がある。
論文 参考訳(メタデータ) (2020-04-30T15:07:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。