論文の概要: Why Solve It Twice? Hierarchical Accumulation of Skills for Transfer-Efficient ML Engineering
- arxiv url: http://arxiv.org/abs/2606.30911v2
- Date: Wed, 01 Jul 2026 17:04:50 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-02 15:15:53.073909
- Title: Why Solve It Twice? Hierarchical Accumulation of Skills for Transfer-Efficient ML Engineering
- Title(参考訳): なぜ解決するのか? 伝達効率の良いMLエンジニアリングのための階層的なスキルの蓄積
- Abstract要約: 本稿では,クロスコンペティション知識を3層にまとめる階層型マルチエージェントシステムであるHASTEを紹介する。
MLE-Bench Liteの完全なベンチマークでは、HASTEはクロード・ソネット4.6を用いて77.3%のメダルを獲得した。
これらの結果から,機械学習エージェントのモデル強度と計算予算に代えて,優れた知識組織を構築できる可能性が示唆された。
- 参考スコア(独自算出の注目度): 0.10923877073891443
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: ML engineering agents waste compute rediscovering known techniques because every competition is a cold start. We present HASTE, a hierarchical multi-agent system that organizes cross-competition knowledge into three scope tiers (global, domain, and competition-specific), each coupled to a matching agent level. An orchestrator coordinates domain specialists and promotes learning between tiers via LLM-driven abstraction. A controlled ablation provides evidence for scoped loading: holding a 159-skill inventory constant across 8 competitions, tiered loading achieves a 100% medal rate while flat loading reaches only 62.5%, the same medal rate as loading no skills, and consumes 2x the output tokens. On the full MLE-Bench Lite benchmark (22 Kaggle competitions), HASTE reaches a medal rate of 77.3% using Claude Sonnet 4.6 at 12h per competition; this is a single-seed campaign result, and multi-seed replication is the priority follow-up. In a cold-start run, the system begins with no accumulated skills. In warm-start runs, it reloads skills learned from earlier competitions, using only global and domain-level skills for transfer across competitions. Warm starts use 52% fewer refinement iterations, and the fraction of proposed changes kept by the agent rises from 42% at low inventory to 85% once 50+ skills are available. These results suggest that better knowledge organization can partly substitute for model strength and compute budget in ML-engineering agents.
- Abstract(参考訳): MLエンジニアリングエージェントは、すべての競争がコールドスタートであるため、既知のテクニックを再発見する計算を無駄にします。
本稿では,クロスコンペティション知識を3つの範囲(グローバル,ドメイン,コンペティション固有)にまとめる階層型マルチエージェントシステムであるHASTEについて述べる。
オーケストレータはドメインスペシャリストをコーディネートし、LLM駆動の抽象化を通じて層間の学習を促進する。
コントロールされたアブレーションは、8つの競技で159スキルの在庫を一定に保ち、タイドローディングは100%のメダル率を達成する一方、フラットローディングは62.5%にしか達せず、ローディングなしのメダルレートと同じで、出力トークンの2倍を消費する。
完全なMLE-Bench Liteベンチマーク(22のKaggleコンペティション)では、HASTEはClaude Sonnet 4.6を12時間に使用して77.3%のメダルを獲得した。
コールドスタートでは、システムは蓄積されたスキルで始まります。
ウォームスタートでは、以前のコンペから学んだスキルをリロードし、グローバルなスキルとドメインレベルのスキルのみを使用して、競技間での移行を行う。
ウォームはリファインメントのイテレーションを52%減らし、50以上のスキルが利用可能になると、低い在庫で42%から85%に上昇する。
これらの結果から,機械学習エージェントのモデル強度と計算予算に代えて,優れた知識組織を構築できる可能性が示唆された。
関連論文リスト
- Write, Execute, Refine: From Skill Followers to Skill Optimizers via Reinforcement Learning from Execution Feedback [52.78692582507693]
専門家による自然言語スキルは、ツール使用エージェントを改善することができるが、エージェントによるスキルは、スキルを使用しないよりも8-11ポイント悪い。
本研究では,中間的スキルから実行経験を訓練状態に整理する方法について検討する。
論文 参考訳(メタデータ) (2026-08-18T09:52:48Z) - Skill Blocks: How Should an Agent Load Its Skill? A Caching-Correct Comparison of Pre-load, On-Demand Tool-Loading, Progressive Disclosure, and Hybrid [0.0]
エージェントスキルは、要求ごとにフルに注入されることが多く、トークンコストが増加する。
コンテンツ保存のロード方法として,Full,Skill Block,Reference,Hybridの4つを比較した。
シングルターンタスクの生入力とマルチターンタスクのキャッシュ補正有効入力を用いてトークン使用量を測定する。
論文 参考訳(メタデータ) (2026-08-14T23:48:09Z) - Small Models Scout Bottleneck Order for Large-Model Data Control [25.285253224551706]
クローズドループコントローラであるLogFloorを導入し、各ラウンドを現在のボトルネックに向けて誘導する。
Qwen2.5-1.5Bの5つのbAbIスキルスライスで、LogFloorはトークンコストを平均56.2%削減した。
70M-to-12B転送では、70Mスカウトパスの3ラウンドのリプレイが8つのターゲットランのすべてのフロアに到達する。
論文 参考訳(メタデータ) (2026-08-14T23:24:34Z) - Toward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon Reasoning [72.09826781730662]
ロングホライゾン推論は、モデルが推論チェーン内の異なるスキルを切り替えることを要求する。
スキル・エントロピー(Skill Entropy)とは、あるスキルから別のスキルに切り替えることの難しさを測る尺度である。
本稿では,RLフレームワークであるSkill-Entropy RLを提案する。
論文 参考訳(メタデータ) (2026-08-05T17:57:16Z) - SciOrch: Learning to Orchestrate Expert LLMs for Solving Frontier Multimodal Scientific Reasoning Tasks [65.14594927081983]
SciOrchは、科学的な推論のためにフロンティアLSMを編成する軽量8Bモデルを訓練するフレームワークである。
SGI-ReasoningとScientificsの最初の試験にまたがる240回の試験セットでは、SciOrchの平均精度は56.66%に達した。
また、一般的なマルチエージェントメソッドのAPIコストの半分未満で、SGIとSFEの両方で最高の精度を実現する。
論文 参考訳(メタデータ) (2026-06-14T15:45:34Z) - Not All Skills Help: Measuring and Repairing Agent Knowledge [47.498075849595374]
ASSAYは、生成をキュレーションから分離するフレームワークである。
スキルごとの因果属性を小さな開発セットで計算する。
ライブラリをオフラインで再構築し、各テストタスクに対して負の効果でスキルを抑圧する。
論文 参考訳(メタデータ) (2026-06-13T16:37:38Z) - LatentSkill: From In-Context Textual Skills to In-Weight Latent Skills for LLM Agents [40.33528208274459]
テキストスキルをプラグアンドプレイのLoRAアダプタに変換するフレームワークであるLatentSkillを紹介する。
LatentSkillは、コンテキスト空間よりも重み空間にスキル知識を格納し、ステップ単位のスキルトークンを削除する。
ALFWorldとSearch-QAでは、LatentSkillは、かなり少ないプリフィルトークンを使用しながら、対応するインコンテキストスキルベースラインよりもパフォーマンスが高い。
論文 参考訳(メタデータ) (2026-06-04T12:26:09Z) - SkillOpt: Executive Strategy for Self-Evolving Agent Skills [39.94802218531371]
SkillOptはエージェントスキルのためのコントロール可能なテキストスペースである。
別々のモデルでは、スコアの付いたロールアウトを1つのスキルドキュメントのバウンダリされた追加/削除/リプレースに切り替える。
学習速度の予算、拒否編集バッファ、エポックワイド/メタアップデートは、スキルトレーニングを安定させる。
論文 参考訳(メタデータ) (2026-05-22T17:59:50Z) - Maestro: Reinforcement Learning to Orchestrate Hierarchical Model-Skill Ensembles [32.54156025863882]
強化学習駆動オーケストレーションフレームワークであるMaestroを紹介します。
Maestroは、階層的なモデルスキルレジストリ上でのシーケンシャルな意思決定プロセスとして、異質なマルチモーダルタスクを再構成する。
数学的推論,チャート理解,高分解能知覚,ドメイン固有分析を対象とする10の代表的なマルチモーダルベンチマークに対して,Maestroの評価を行った。
論文 参考訳(メタデータ) (2026-05-21T08:47:49Z) - LASeR: Learning to Adaptively Select Reward Models with Multi-Armed Bandits [73.26238057915583]
本稿では,マルチアームバンディット問題として報酬モデル選択を行うLASeRを提案する。
LASeRは反復トレーニングを促進し、3つのデータセットに対してLlama-3-8Bの平均精度を絶対的に向上することを示す。
また、RAeRはRMスコアアンサンブルベースラインよりも72.69%のAlpacaEval勝利率を達成していることを示す。
論文 参考訳(メタデータ) (2024-10-02T16:46:38Z) - Retrospective on the 2021 BASALT Competition on Learning from Human
Feedback [92.37243979045817]
競争の目的は、人間のフィードバック(LfHF)技術から学び、オープンワールドの課題を解決するエージェントへの研究を促進することであった。
LfHF技術の使用を義務付けるのではなく、ビデオゲームMinecraftで達成すべき自然言語の4つのタスクについて説明した。
チームは、様々な可能な人間のフィードバックタイプにまたがる多様なLfHFアルゴリズムを開発した。
論文 参考訳(メタデータ) (2022-04-14T17:24:54Z) - Multi-Agent Collaboration via Reward Attribution Decomposition [75.36911959491228]
本稿では,StarCraftのマルチエージェントチャレンジにおいて,最先端のパフォーマンスを実現するコラボレーション型Q-ラーニング(CollaQ)を提案する。
CollaQは様々なStarCraft属性マップで評価され、既存の最先端技術よりも優れていることを示す。
論文 参考訳(メタデータ) (2020-10-16T17:42:11Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。