論文の概要: CARE: Controlling LLM-Generated Policies through Auditable Review of Evidence in Scientific Experimentation
- arxiv url: http://arxiv.org/abs/2606.14581v1
- Date: Fri, 12 Jun 2026 15:58:32 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-15 16:00:42.97266
- Title: CARE: Controlling LLM-Generated Policies through Auditable Review of Evidence in Scientific Experimentation
- Title(参考訳): CARE:科学実験における証拠の聴取によるLCM生成ポリシーの制御
- Authors: Guanyu Liu, Weiyi Kong, Zeyu Wang, Boer Zhang, Baiqing Li, Peiyu Zhang, Tianyu Shi,
- Abstract要約: CARE(Controlling LLM-Generated Policies through Auditable Review of Evidence in Scientific Experimentation)は、高スループット実験のための監査可能なコントローラである。
既存のLLMをデフォルトのアクションパスとして保持し、LSMを使用してチャレンジャーランキングポリシーを改訂する。
CAREは、Minerva/OlympusおよびChemLexベンチマークで評価された他のすべてのメソッドより優れている。
- 参考スコア(独自算出の注目度): 8.538448685634274
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Granting LLMs direct control over costly, irreversible scientific experiments leads to unsafe exploration and unstable performance, but discarding LLM creativity entirely sacrifices significant optimization potential. We introduce CARE (Controlling LLM-Generated Policies through Auditable Review of Evidence in Scientific Experimentation), an auditable controller for high-throughput experimentation (HTE) optimization that keeps a non-LLM incumbent optimizer as the default action path while using LLMs to revise challenger ranking policies. Before each outcome is revealed, a public-evidence intervention gate compares the challenger with the incumbent. It authorizes the challenger's selection only when the evidence available before selection supports the change, with the decision recorded in the audit log. CARE outperforms all other evaluated methods on Minerva/Olympus and ChemLex benchmarks, with final-best improving from 80.0 to 88.5 on Minerva/Olympus and from 83.9 to 92.1 on ChemLex, relative to the public incumbent. Our experiments indicate that LLM self-evolution is more reliable when it expands the proposal space under an auditable controller, rather than directly choosing experiments.
- Abstract(参考訳): 高価で不可逆的な科学実験に対するLSMの直接的な制御を許すことは、安全でない探索と不安定な性能をもたらすが、LSMの創造性を放棄することは、重要な最適化の可能性を完全に犠牲にする。
高スループット実験(HTE)最適化のための監査可能なコントローラであるCARE(Controlling LLM-Generated Policies through Auditable Review of Evidence in Scientific Experimentation)を導入する。
各結果が明らかになる前に、公開証拠介入ゲートは、挑戦者と現職者とを比較する。
参加者の選択は、選択前の証拠が変更をサポートする場合にのみ許可され、決定は監査ログに記録される。
CAREは、Minerva/OlympusおよびChemLexベンチマークの他の評価手法よりも優れており、Mererva/Olympusでは80.0から88.5に、ChemLexでは83.9から92.1に改善されている。
実験により, LLMの自己進化は, 実験を直接選択するのではなく, 監査可能な制御器の下で提案空間を拡張した場合の方が信頼性が高いことが示唆された。
関連論文リスト
- Evaluating LLM-Based Grant Proposal Review via Structured Perturbations [18.689211845609623]
我々は、6つの品質軸にまたがるLLM感度を探索する摂動型フレームワークを開発した。
我々は, 単一パスレビュー, セクション・バイ・セクション分析, 専門家パネルをエミュレートした「ペルソナのカウンシル」という3つのレビューアーキテクチャを比較した。
論文 参考訳(メタデータ) (2026-03-09T11:53:50Z) - References Improve LLM Alignment in Non-Verifiable Domains [118.26447686644808]
基準誘導型LCM評価器がソフトな「検証器」として機能することでギャップを埋められるか検討する。
基準誘導手法は,フロンティアモデルからの参照を用いて,低能力のLCMジャッジの精度を大幅に向上することを示す。
基準誘導自己改善は、基準出力に対する直接SFTと基準自由判断による自己改善の両方に対して明らかな利得が得られることを示す。
論文 参考訳(メタデータ) (2026-02-18T19:03:34Z) - InvBench: Can LLMs Accelerate Program Verification with Invariant Synthesis? [13.240989975977302]
不変合成におけるLCMの評価のための原理的フレームワークを提案する。
提案手法は,形式的な音質保証を備えた検証器に基づく決定手順を用いる。
我々は,従来の解法UAutomizerに対して,最先端のLLMと既存のLLMベースの検証器を7つ評価した。
論文 参考訳(メタデータ) (2025-09-25T21:47:02Z) - LLMs for Bayesian Optimization in Scientific Domains: Are We There Yet? [25.116042999105193]
大規模言語モデル (LLM) は実験設計のための汎用エージェントとして提案されている。
本仮説は, 遺伝的摂動および分子特性探索に応用したオープンソースとクローズドソースのLLMを用いて評価する。
LLMをベースとしたエージェントは、実験的なフィードバックに敏感ではなく、実結果をランダムに置換したラベルに置き換えることは、性能に影響を与えない。
論文 参考訳(メタデータ) (2025-09-24T15:50:17Z) - Differentially Private Steering for Large Language Model Alignment [55.30573701583768]
本稿では,大規模言語モデルとプライベートデータセットの整合性に関する最初の研究について述べる。
本研究は,プライバシ保証付きアクティベーションを編集するPSA(Private Steering for LLM Alignment)アルゴリズムを提案する。
以上の結果から,PSAはLPMアライメントのDP保証を実現し,性能の低下を最小限に抑えることができた。
論文 参考訳(メタデータ) (2025-01-30T17:58:36Z) - Auto-Arena: Automating LLM Evaluations with Agent Peer Battles and Committee Discussions [77.66677127535222]
Auto-ArenaはLLMエージェントを使用した評価プロセス全体を自動化した革新的なフレームワークである。
我々の実験では、Auto-Arenaは92.14%の相関関係を示し、以前の専門家が注釈付けしたベンチマークをすべて上回っている。
論文 参考訳(メタデータ) (2024-05-30T17:19:19Z) - SELF-[IN]CORRECT: LLMs Struggle with Discriminating Self-Generated Responses [49.148206387394936]
モデルでは、初期応答を生成するよりも、以前に生成した代替品間での識別性が確実に向上しないことが示される。
この発見は LLM が自身の判断によってのみ性能を向上させることができるという概念に挑戦する。
論文 参考訳(メタデータ) (2024-04-04T20:27:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。