論文の概要: TRACE: Transition-Aware Residual Control for Multi-Objective Materials Discovery
- arxiv url: http://arxiv.org/abs/2608.23631v1
- Date: Sun, 23 Aug 2026 13:20:35 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-26 14:09:34.431545
- Title: TRACE: Transition-Aware Residual Control for Multi-Objective Materials Discovery
- Title(参考訳): TRACE:多目的材料発見のための遷移認識残差制御
- Authors: Kang Zhou, Yujia Tong, Yong Tao, Jingling Yuan,
- Abstract要約: 既存のエージェントは評価された候補とそのスコアを格納するので、どの素材が成功したかはわかるが、どの編集が有用なプロパティ変更を引き起こしたかは分かっていない。
我々は、評価された編集をフィードバックの基本単位として扱う、トランジション対応残差制御フレームワークTRACEを提案する。
TRACEは、各ローカルリファインメントを、観測されたプロパティデルタによる親子移行として記録し、トランジションエビデンスを集約して再利用可能な編集効果を推定し、予測能力によって将来の編集をランク付けする。
- 参考スコア(独自算出の注目度): 12.756590731591286
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Multi-objective materials discovery with LLM agents is often limited not only by how many candidates can be proposed, but by how effectively each costly property evaluation informs the next search step. Existing agents mainly store evaluated candidates and their scores, so they know which materials succeeded but not which executable edits caused useful property changes. This makes local refinement difficult when objectives compete and an edit that improves one property may damage another. We propose TRACE, a transition-aware residual control framework that treats evaluated edits as the basic unit of feedback. TRACE records each local refinement as a parent-edit-child transition with observed property deltas, aggregates transition evidence to estimate reusable edit effects, and ranks future edits by their predicted ability to reduce the current candidate's remaining constraint violations while avoiding damage to already satisfied objectives. In a controlled same-backbone comparison, TRACE improves over LLEMA, the state-of-the-art LLM-agent baseline, raising macro-average hit rate from 18.13\% to 25.96\%.
- Abstract(参考訳): LLMエージェントによる多目的材料発見は、提案できる候補数だけでなく、コストのかかる各特性評価が次の探索ステップにどれほど効果的かによって制限されることが多い。
既存のエージェントは、評価された候補とそのスコアを主に記憶しているため、どの素材が成功したかは知っているが、どの編集が有用なプロパティ変更を引き起こしたかは分かっていない。
これにより、目的物が競合するときの局所的な洗練が難しくなり、あるプロパティを改善する編集が別のプロパティを傷つける可能性がある。
我々は、評価された編集をフィードバックの基本単位として扱う、トランジション対応残差制御フレームワークTRACEを提案する。
TRACEは、各ローカルリファインメントを、観測されたプロパティデルタによる親子移行として記録し、トランジションエビデンスを集約して再利用可能な編集効果を推定し、予測能力によって将来の編集をランク付けする。
コントロールされた同バックボーンの比較では、TRACEは最先端のLLMエージェントベースラインであるLLEMAよりも改善され、マクロ平均ヒット率は18.13\%から25.96\%に上昇する。
関連論文リスト
- Crayotter: Learning Long-Horizon Video Editing Agents via Group-Relative Preference Backpropagation [14.003463557395621]
Group-Relative Preference Backpropagationは、同じタスクのランクをゼロサムの利点に変換する。
本研究では,プロジェクト分離型,地平線階層化されたリアルな編集作業スイートを手作業で構築し,評価のトレーニングと制御を行う。
その結果、9B CrayotterモデルはAgenticVBench上のいくつかのプロプライエタリシステムを上回った。
論文 参考訳(メタデータ) (2026-08-03T10:41:25Z) - TAPO: Tool-Aware Policy Optimization via Credit Transfer for Multimodal Search Agents [54.08846865906602]
ツール強化マルチモーダルサーチエージェントにおいて,クレジットミス割り当てをGRPOの系統的障害モードとして特徴付ける。
本稿では,情報取得ツールのパラメータ決定性を利用したツール・アウェア・ポリシー・オプティマイズ(TAPO)を提案する。
論文 参考訳(メタデータ) (2026-06-04T07:15:43Z) - RECOVER: Robust Entity Correction via agentic Orchestration of hypothesis Variants for Evidence-based Recovery [8.750432529472802]
ツール使用エージェントとして機能するエージェント修正フレームワークであるRECOVERを紹介する。
複数の仮説をASRの証拠として利用し、関連するエンティティを検索し、制約の下で大言語モデル(LLM)の修正を適用する。
エンティティ・フレーズの単語誤り率(E-WER)を8~46%削減し、リコール率を最大22ポイント向上させる。
論文 参考訳(メタデータ) (2026-03-17T11:48:12Z) - Are We Evaluating the Edit Locality of LLM Model Editing Properly? [68.441768731381]
この目的のために既存の特異性評価プロトコルは不十分であることがわかった。
既存の特異度指標は特異度正規化器の強度と弱い相関関係にある。
また、現在のメトリクスには十分な感度が欠けており、異なるメソッドの特異性性能の区別に効果がないこともわかりました。
論文 参考訳(メタデータ) (2026-01-24T07:07:21Z) - Gaming the Judge: Unfaithful Chain-of-Thought Can Undermine Agent Evaluation [76.5533899503582]
大規模言語モデル(LLM)は、エージェントのパフォーマンスを評価するために、ますます裁判官として使われている。
このパラダイムは、エージェントのチェーン・オブ・シークレット(CoT)推論が内部の推論と環境状態の両方を忠実に反映していることを暗黙的に仮定している。
我々は、操作された推論だけで、様々なWebタスクにまたがる800の軌跡に対して、最先端のVLM審査員の偽陽性率を最大90%向上させることができることを実証した。
論文 参考訳(メタデータ) (2026-01-21T06:07:43Z) - DoVer: Intervention-Driven Auto Debugging for LLM Multi-Agent Systems [48.971606069204825]
DoVerは、大規模言語モデル(LLM)ベースのマルチエージェントシステムのための介入駆動デバッグフレームワークである。
ターゲットの介入を通じて、アクティブな検証によって仮説生成を増強する。
DoVerは失敗試験の18~28%を成功させ、最大16%のマイルストーンを達成し、失敗仮説の30~60%を検証または否定する。
論文 参考訳(メタデータ) (2025-12-07T09:23:48Z) - Prompt Optimization via Retrieved Reasoning Assets and Multi-Agent Analysis [5.935239028627343]
スコア・アウェア・プロンプト最適化のためのマルチエージェントフレームワークであるMA-SAPOを紹介する。
従来の手法と比較して、MA-SAPOは、体系的な編集を導く構造的推論と評価結果を明示的に結合する。
評価信号を解釈可能な推論連鎖に変換することで、MA-SAPOはより透明で、監査可能で、制御可能な、迅速な改善を生成する。
論文 参考訳(メタデータ) (2025-10-18T20:21:09Z) - Beyond the Final Answer: Evaluating the Reasoning Trajectories of Tool-Augmented Agents [22.781523439717223]
エージェントのパフォーマンスを適切に評価するには、最終回答を超え、問題解決の軌跡も評価する必要がある。
ツール拡張LDMエージェント性能の多次元評価のためのフレームワークであるTRACEを紹介する。
TRACEはこれらの複雑な挙動を,スケーラブルで費用対効果の高い方法で正確に評価する。
論文 参考訳(メタデータ) (2025-10-03T09:19:15Z) - Tracing and Reversing Rank-One Model Edits [5.260519479124422]
本研究は,Ran-One Model Editing (ROME) 手法に着目し,知識編集のトレーサビリティと可逆性について考察する。
ROMEは, 編集重量行列に特徴的な分布パターンを導入し, 編集重量の探索に有効な信号として機能することを示す。
本稿では,編集プロンプトにアクセスすることなく,修正重みから直接編集対象エンティティを推定し,95%以上の精度を実現する方法を提案する。
論文 参考訳(メタデータ) (2025-05-27T07:27:01Z) - Editing Large Language Models: Problems, Methods, and Opportunities [51.903537096207]
本稿では, LLMのモデル編集に関わる問題, 方法, 機会を深く探究する。
本稿では,モデル編集に関わるタスク定義と課題の概観と,現在処理中の最も進歩的な手法の詳細な実証分析について述べる。
本研究の目的は,各編集手法の有効性と実現可能性に関する貴重な知見を提供することであり,特定のタスクやコンテキストに対して,最も適切な方法の選択に関する情報決定を行う上で,コミュニティを支援することである。
論文 参考訳(メタデータ) (2023-05-22T16:00:00Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。