論文の概要: OptiLoop: Coordination-in-the-Loop Verification and Repair for LLM-Generated Optimization Agents
- arxiv url: http://arxiv.org/abs/2605.27630v1
- Date: Tue, 26 May 2026 19:49:41 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-28 17:38:55.48891
- Title: OptiLoop: Coordination-in-the-Loop Verification and Repair for LLM-Generated Optimization Agents
- Title(参考訳): OptiLoop: LLM生成最適化エージェントのコーディネーション・イン・ザ・ループ検証と修復
- Authors: Yujia Xu, Zhiheng Wang, Thi Dinh,
- Abstract要約: 分散された決定問題は、複数の当事者が共有された決定を調整する必要がある。
大規模言語モデル(LLM)は、ローカル最適化エージェントを生成することで参加障壁を低くする有望な方法を提供する。
LLM生成最適化エージェントのコーディネーション・イン・ザ・ループ検証と修復を提案する。
- 参考スコア(独自算出の注目度): 0.9543827270223156
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Many decentralized decision problems require multiple parties to coordinate on shared decisions while keeping objectives, constraints, and data private. Large language models (LLMs) offer a promising way to lower the barrier to participation by generating local optimization agents from natural-language specifications. In coordination settings, however, executability is not enough: a generated agent may compile, solve, and pass local checks while still being semantically wrong, for example by misrepresenting costs, mis-scoping constraints, or responding incorrectly to incentives. Such errors often surface only during coordination, as systematic behavioral failures rather than infeasibility. We propose coordination-in-the-loop verification and repair for LLM-generated optimization agents. We instantiate this idea with an Alternating Direction Method of Multipliers (ADMM)-style consensus protocol and introduce OptiLoop, a pipeline that generates local optimization agents from text, verifies them through short, bounded coordination runs against a fixed reference counterparty, extracts structured behavioral and static evidence, and applies evidence-driven repair. When failures are structural rather than implementational, OptiLoop escalates from localized code fixes to corrected-formulation repair, and it can additionally reuse episodic lessons from prior instances. On 40 held-out test scenarios, OptiLoop-Full improves objective match from 66.0% to 93.0% and social match from 68.5% to 89.0% relative to a strong local-validation baseline, while reducing mean objective gap from 15.3% to 3.5% and mean social gap from 7.6% to 2.0%. These results show that, for generated optimization agents deployed inside decentralized decision loops, correctness should be validated in the loop itself rather than through isolated execution alone.
- Abstract(参考訳): 多くの分散された決定問題は、目的、制約、データプライベートを維持しながら、共有された決定を調整する必要がある。
大規模言語モデル(LLM)は、自然言語仕様からローカル最適化エージェントを生成することで、参加障壁を低くする有望な手段を提供する。
生成されたエージェントは、セマンティックに間違っているままローカルチェックをコンパイルし、解決し、パスすることができる。
このようなエラーは、実現不可能ではなく、体系的な行動上の失敗として、調整中にのみ現れることが多い。
LLM生成最適化エージェントのコーディネーション・イン・ザ・ループ検証と修復を提案する。
テキストから局所最適化エージェントを生成するパイプラインであるOptiLoopを導入し、固定された参照に対して有界な調整を行い、構造化された行動的および静的な証拠を抽出し、エビデンス駆動の修復を行う。
エラーが実装ではなく構造的である場合、OptiLoopは、ローカライズされたコード修正から修正された形式修正へとエスカレーションされ、以前のインスタンスからのエピソードレッスンを再利用する。
40のテストシナリオでは、OptiLoop-Fullは、目標マッチを66.0%から93.0%に、ソーシャルマッチを68.5%から89.0%に改善し、平均目標ギャップを15.3%から3.5%に、ソーシャルギャップを7.6%から2.0%に減らした。
これらの結果は、分散化された決定ループ内にデプロイされた生成された最適化エージェントに対して、独立した実行のみを通してではなく、ループ自体で正当性を検証すべきであることを示している。
関連論文リスト
- LLM Based Web Accessibility Repair: An Empirical Study of Detection, Remediation, and Cost [1.068768727414769]
本稿では,アクセシビリティの自動検出と修復のための大規模言語モデルベースエージェント,特にKim K2.5について検討する。
LLMはルールベースのツールに匹敵するパフォーマンスを実現しており、F1は約0.65であり、F1の強い意味理解は0.83であるが、構文およびレイアウト関連の違反に対する信頼性は低い。
修復のために、LCMの生成した修正は99.7%以上のケースで構文的に有効であり、80.2%のインスタンスではアクセシビリティコンプライアンスを改善し、1ファイルあたりの違反を3.98から1.7に減らしている。
論文 参考訳(メタデータ) (2026-05-26T21:43:34Z) - AdaExplore: Failure-Driven Adaptation and Diversity-Preserving Search for Efficient Kernel Generation [59.964989458924585]
AdaExploreは、パフォーマンスクリティカルなカーネルコード生成のための蓄積された実行フィードバックによる自己改善を可能にするエージェントフレームワークである。
適応段階では、エージェントはタスクを合成し、繰り返し発生する障害を有効ルールの再利用可能なメモリに変換する。
探索段階では、候補核を木として整理し、小さな局所精製とより大きな構造再生を交互に行う。
論文 参考訳(メタデータ) (2026-04-17T18:25:03Z) - Adaptive Cost-Efficient Evaluation for Reliable Patent Claim Validation [35.13558856456741]
本研究では、予測エントロピーを用いて、高い不確実性のみを専門家 LLM にルーティングするハイブリッドフレームワークであるACE(Adaptive Cost- efficient Evaluation)を提案する。
ACEは94.95%で評価された手法の中で最高のF1を達成し、スタンドアロンのLCMデプロイメントと比較して運用コストを78%削減した。
論文 参考訳(メタデータ) (2026-04-05T22:25:36Z) - ODAR: Principled Adaptive Routing for LLM Reasoning via Active Inference [60.958331943869126]
ODAR-Expertは、原則化されたリソース割り当てによる精度と効率のトレードオフを最適化する適応的なルーティングフレームワークである。
我々は、MATHの98.2%の精度、HumanityのLast Examの54.8%を含む、強く一貫した利得を示している。
論文 参考訳(メタデータ) (2026-02-27T05:22:01Z) - ConstraintBench: Benchmarking LLM Constraint Reasoning on Direct Optimization [0.0]
ConstraintBenchは、直接制約付き最適化において、大きな言語モデルを評価するためのベンチマークである。
200のタスクで6つのフロンティアモデルを評価し、最適性ではなく実現可能性が主要なボトルネックであることを確認した。
解法基準の0.1%の範囲内で、結合実現可能性と最適性について30.5%を超えるモデルはない。
論文 参考訳(メタデータ) (2026-02-25T22:54:26Z) - ReLoop: Structured Modeling and Behavioral Verification for Reliable LLM-Based Optimization [6.572539312871392]
大規模言語モデル(LLM)は、自然言語を最適化コードに変換することができるが、サイレント障害は重大なリスクをもたらす。
2つの相補的な方向からサイレント障害に対処するReLoopを紹介します。
論文 参考訳(メタデータ) (2026-02-17T20:20:33Z) - Towards a Science of Scaling Agent Systems [79.64446272302287]
エージェント評価の定義を定式化し,エージェント量,コーディネーション構造,モデル,タスク特性の相互作用として,スケーリング法則を特徴付ける。
協調指標を用いて予測モデルを導出し,R2=0をクロスバリデーションし,未知のタスク領域の予測を可能にする。
ツールコーディネーショントレードオフ: 固定的な計算予算の下では, ツールヘビータスクはマルチエージェントのオーバーヘッドから不均衡に悩まされ, 2) 能力飽和: 調整が減少または負のリターンを, 単一エージェントのベースラインが45%を超えると達成できる。
論文 参考訳(メタデータ) (2025-12-09T06:52:21Z) - Structured Uncertainty guided Clarification for LLM Agents [126.26213027785813]
LLMエージェントは、ツールコール機能を備えた大きな言語モデルを拡張するが、曖昧なユーザ命令は、しばしば誤った呼び出しやタスクの失敗につながる。
本稿では,ツールコールパラメータに対する構造的不確かさの定式化,完全情報の期待値(EVPI)を目標としたPOMDPのモデル化,冗長性防止のためのアスペクトベースコストモデルを提案する。
我々のSAGE-Agentは、この構造化された不確実性を活用し、より優れた効率を達成するために、曖昧なタスクのカバレッジを7~39%増加させ、明確な質問を1.5~2.7$times$に減らした。
論文 参考訳(メタデータ) (2025-11-11T21:50:44Z) - Leveraging Robust Optimization for LLM Alignment under Distribution Shifts [51.74394601039711]
人間の値に整合した出力を生成するために、大規模言語モデルを操る上で、優先順位アライメント手法はますます重要になっている。
このようなシフトに拘わらず、好みのアライメントを改善する新しい分布対応最適化フレームワークを提案する。
論文 参考訳(メタデータ) (2025-04-08T09:14:38Z) - Correcting the Mythos of KL-Regularization: Direct Alignment without Overoptimization via Chi-Squared Preference Optimization [78.82586283794886]
$chi2$-Preference Optimization(chi$PO)は、オーバー最適化に対して確実に堅牢なオフラインアライメントアルゴリズムである。
$chi$POは、正規化による不確実性に直面して悲観主義の原理を実装している。
$chi$POの単純さと強力な保証により、オーバー最適化に対して確実に堅牢な、実用的で汎用的なオフラインアライメントアルゴリズムとなった。
論文 参考訳(メタデータ) (2024-07-18T11:08:40Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。