論文の概要: Code-to-Harness: Distilling Black-Box Optimizers from Self-Play
- arxiv url: http://arxiv.org/abs/2609.09468v2
- Date: Thu, 10 Sep 2026 23:56:08 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-15 07:38:31.456155
- Title: Code-to-Harness: Distilling Black-Box Optimizers from Self-Play
- Title(参考訳): Code-to-Harness: セルフプレイからブラックボックスオプティマイザを蒸留する
- Authors: Yi Wu, Zheng Ren, Zhiyu Hu, Haochen Wang, Daryl Chang, Li Wei, Ting Wang, Zhen Li, Pooja Gupta, Nitin Jindal, Lukasz Heldt,
- Abstract要約: 本稿では,エージェントが実行可能な実践を通じて数値検索戦略を学習し,その戦略をテキストとして転送できることを示す。
独立したエンドツーエンドレプリケーションは、異なるプログラムとテキストであるHarness Bを同じパフォーマンス層で生成する。
同じフレームワークは、YouTubeの報酬チューニングのベンチマークを封印した上で、最低の後悔点を達成している。
- 参考スコア(独自算出の注目度): 20.956336698211825
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Can an agent learn a numerical search strategy through executable practice and then transfer that strategy as text? We study low-budget black-box optimization, where unaided language models remain well below strong classical optimizers. During development, an agent repeatedly writes and evaluates optimizer programs. It then distills the resulting program and practice record once into a 197-word primary Harness A, which is frozen before evaluation. Harness A reduces Gemini Flash regret by 48\% in an independent $N=30$ study ($p<.001$), enters the GP-BO performance range on the practice family, and lowers mean regret on all three held-out BBOB landscapes. The same text improves every tested Gemini executor and transfers to Claude Sonnet, reducing regret by 43\% and 49\% ($p\leq.005$). An independent end-to-end replication produces Harness B, a different program and text at the same performance tier. The same framework also attains the lowest regret on a sealed YouTube reward-tuning production benchmark. Executable practice is thus a viable way to discover a search policy, and language a portable medium for deploying it.
- Abstract(参考訳): エージェントは実行可能な実践を通じて数値検索戦略を学習し、その戦略をテキストとして転送できるのか?
低予算のブラックボックス最適化について検討した。
開発中、エージェントは繰り返しオプティマイザプログラムを書き、評価する。
その後、得られたプログラムを蒸留し、評価前に凍結した197ワードの一次ハーネスAに記録する。
Harness Aは、独立した$N=30$研究(p<.001$)においてジェミニフラッシュの後悔を48\%減らし、練習家族のGP-BOパフォーマンス範囲に入り、ホールドアウトされた3つのBBOBランドスケープの平均後悔を低くする。
同じテキストは、テストされたジェミニの執行者をすべて改善し、クロード・ソネットに転送し、後悔を43\%と49\%(p\leq.005$)に減らした。
独立したエンドツーエンドレプリケーションは、異なるプログラムとテキストであるHarness Bを同じパフォーマンス層で生成する。
同じフレームワークは、YouTubeの報酬チューニングのベンチマークを封印した上で、最低の後悔点を達成している。
したがって、実行可能なプラクティスは、検索ポリシーを見つけるための実行可能な方法であり、それをデプロイするためのポータブルメディアを言語化する。
関連論文リスト
- Write, Execute, Refine: From Skill Followers to Skill Optimizers via Reinforcement Learning from Execution Feedback [52.78692582507693]
専門家による自然言語スキルは、ツール使用エージェントを改善することができるが、エージェントによるスキルは、スキルを使用しないよりも8-11ポイント悪い。
本研究では,中間的スキルから実行経験を訓練状態に整理する方法について検討する。
論文 参考訳(メタデータ) (2026-08-18T09:52:48Z) - RLPF: Reinforcement Learning from Performance Feedback for Code Generation [44.39557506834191]
評価基準としてのみ効率性を扱うのではなく、より高速な実装を好むようにコードエージェントを訓練する方法を研究する。
本稿では,パフォーマンスフィードバックからの強化学習である textbfRLPF を提案する。
PerfCodeBench の RLPF による微調整 Qwen3-32B は,修正および実行可能なソリューションを 11.1% から 54.6% に引き上げる。
論文 参考訳(メタデータ) (2026-07-29T11:39:55Z) - Remember, Don't Re-read: Stateful ReAct Agents for Token-Efficient Autonomous Experimentation [0.0]
本稿では,LangGraphを用いたステートフルなReActエージェントとして,自動検索パターンを再構成する。
ステートレスエージェントは全履歴を1イテレーションあたり$O(n)$コストで再読み取りし、ステートフルエージェントは固定サイズの会話ウィンドウ内で$O(1)$コストで動作します。
論文 参考訳(メタデータ) (2026-06-12T20:40:59Z) - Cross-Lingual Token Arbitrage: Optimizing Code Agent Context Windows via Local LLM Preprocessing [0.0]
生の人間の入力の2つの病理は、非英語のテキストに対するトークン化の非効率性と会話のプロンプトにおける構造的エントロピーの2つのオーバーヘッドを駆動している。
既存のアプローチは、すでに肥大しているコンテキストを圧縮したり、障害が発生した後に介入することで、リアクティブに動作します。
我々は、開発者とクラウドエージェントの間で動作する、飛行前のエッジサイドのプロンプトリライトを導入します。
論文 参考訳(メタデータ) (2026-06-02T13:17:45Z) - Prompt Optimization Is a Coin Flip: Diagnosing When It Helps in Compound AI Systems [9.989306175511238]
複合AIシステムにおける迅速な最適化は、コインフリップと統計的に区別できないことを示す。
18,000のグリッド評価と144の最適化を実行し、エンドツーエンドの最適化ツールの背後にある2つの仮定をテストする。
エージェントカップリングのための80ドルのANOVAプリテストと10分間のヘッドルームテストである。
論文 参考訳(メタデータ) (2026-04-16T03:23:46Z) - $\nabla$-Reasoner: LLM Reasoning via Test-Time Gradient Descent in Latent Space [71.23672814629448]
$nabla$-Reasonerは、トークンログに対する差別化可能な最適化をデコードループに統合する反復生成フレームワークである。
$nabla$-Reasonerは、挑戦的な数学的推論ベンチマークで20%以上の精度の向上を実現している。
論文 参考訳(メタデータ) (2026-03-05T08:42:54Z) - Runaway is Ashamed, But Helpful: On the Early-Exit Behavior of Large Language Model-based Agents in Embodied Environments [54.67512489842682]
大規模言語モデル(LLM)は、複雑な実施環境において、強力な計画と意思決定能力を示す。
LLMをベースとしたエージェントの早期退避行動を探究する第一歩を踏み出す。
論文 参考訳(メタデータ) (2025-05-23T08:23:36Z) - Toward Adversarial Training on Contextualized Language Representation [78.39805974043321]
本稿では, PLMエンコーダが出力する文脈化言語表現の観点から, 対人訓練(AT)について検討する。
そこで我々は, テキストコンテキスト適応型表現-逆訓練(CreAT)を提案し, 攻撃を明示的に最適化し, エンコーダの文脈化表現を逸脱させる。
CreATは幅広いタスクで一貫したパフォーマンス向上を実現しており、エンコーダ部分のみを下流タスクに保持する言語事前トレーニングに有効であることが証明されている。
論文 参考訳(メタデータ) (2023-05-08T08:56:51Z) - BBTv2: Pure Black-Box Optimization Can Be Comparable to Gradient Descent
for Few-Shot Learning [83.26610968655815]
Black-Box Tuningは、言語モデルの入力に先立って、連続的なプロンプトトークンを最適化するためのデリバティブフリーなアプローチである。
BBTv2は、言語モデルをグラデーションベースの最適化に匹敵する結果を得るために駆動する、純粋なブラックボックス最適化手法である。
論文 参考訳(メタデータ) (2022-05-23T11:10:19Z) - Deep Continuous Prompt for Contrastive Learning of Sentence Embeddings [8.70715711885114]
本稿では,言語モデル全体を凍結し,プレフィックスの深い連続的なプロンプトのみを最適化する新しい手法を提案する。
元の言語モデルの約0.1%のパラメータをチューニングするだけでなく、手作りのプロンプトを検索する面倒な計算を避ける。
提案したDCPCSEは最先端のSimCSEよりも大きなマージンで優れている。
論文 参考訳(メタデータ) (2022-03-14T06:07:44Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。