論文の概要: ImproveAnyTask: An Autonomous Post-Training Harness for Iterative Model Self-Improvement
- arxiv url: http://arxiv.org/abs/2610.06347v1
- Date: Mon, 05 Oct 2026 13:48:39 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-09 09:03:12.453519
- Title: ImproveAnyTask: An Autonomous Post-Training Harness for Iterative Model Self-Improvement
- Title(参考訳): ImproveAnyTask: 反復モデルによる自己改善のための自律的なポストトレーニングのハーネス
- Abstract要約: 汎用的な大規模言語モデルを特定のタスクに適応させるには、かなりの努力が必要である。
ImproveAnyTaskは、限られた計算予算の下でタスクパフォーマンスを改善する自律的なポストトレーニングハーネスである。
メトリクスレベルとケースレベルの分析を組み合わせて焦点問題を特定し、調査支援された戦略を調査し、報告されたゲインと再現の難しさを比較します。
- 参考スコア(独自算出の注目度): 21.388204757039475
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Adapting general-purpose large language models to specific tasks requires substantial human effort in designing data and training strategies. Sustaining improvement is especially challenging because model updates change the error distribution, requiring strategies to be continually refined. We introduce ImproveAnyTask, an autonomous post-training harness that improves task performance under a limited compute budget. Drawing inspiration from gradient-based parameter optimization, the harness organizes adaptation into error attribution, update-direction selection, and executable model updates. It combines metric-level and case-level analysis to identify a focal problem, then investigates research-backed strategies and compares their reported gains and reproduction difficulty. The selected strategy is translated into training data and a training configuration, with small-scale execution checks preceding full post-training. Subsequent evaluation guides model selection and further adaptation, while validated strategies and scripts are retained for reuse. Across 11 tasks, ImproveAnyTask achieves mean gains of 18.29 and 11.97 percentage points on the Base and Instruct models, respectively, with a maximum gain of 41.96 points, under a 24-hour budget with resources equivalent to eight H20 GPUs.
- Abstract(参考訳): 汎用的な大規模言語モデルを特定のタスクに適用するには、データの設計とトレーニング戦略に相当な人的努力が必要である。
モデル更新がエラー分布を変えるため、戦略を継続的に改善する必要があるため、改善の持続は特に難しい。
ImproveAnyTaskは、限られた計算予算の下でタスクパフォーマンスを改善する自律的なポストトレーニングハーネスである。
勾配に基づくパラメータ最適化からインスピレーションを得たハーネスは、エラー属性、更新方向の選択、実行可能なモデル更新への適応を整理する。
メトリクスレベルとケースレベルの分析を組み合わせて焦点問題を特定し、調査支援された戦略を調査し、報告されたゲインと再現の難しさを比較します。
選択した戦略は、トレーニングデータとトレーニング設定に変換され、フルトレーニング前の小規模な実行チェックが実行される。
その後の評価はモデルの選択とさらなる適応をガイドし、検証された戦略とスクリプトは再利用のために保持される。
ImproveAnyTaskは11タスクにわたって、ベースモデルとインストラクトモデルの平均利得は18.29ポイント、インストラクトモデルの平均利得は11.97ポイント、最大利得は41.96ポイント、リソースは8H20 GPUに相当する24時間予算である。
関連論文リスト
- Pioneer Agent: Continual Improvement of Small Language Models in Production [6.452260317191361]
小さな言語モデルは、低コスト、高速な推論、特殊化の容易さのために、製品展開にとって魅力的なものだ。
特定のタスクに小さな言語モデルを適用するプロセスを自動化するクローズドループシステムであるPioneer Agentを提案する。
論文 参考訳(メタデータ) (2026-04-10T18:13:09Z) - PLAN-TUNING: Post-Training Language Models to Learn Step-by-Step Planning for Complex Problem Solving [66.42260489147617]
大規模言語モデルから合成タスク分解を蒸留するフレームワークであるPLAN-TUNINGを紹介する。
複雑な推論を改善するために、教師付きおよび強化学習の目的を通したプランチューン細管モデル。
本分析は,計画軌道が複雑な推論能力をいかに改善するかを示す。
論文 参考訳(メタデータ) (2025-07-10T07:30:44Z) - Improving Large Language Model Planning with Action Sequence Similarity [50.52049888490524]
本研究では,インコンテキスト学習(ICL)によるモデル計画能力の向上について検討する。
GRASE-DC は2段階のパイプラインで,まず高効率のAS例を再サンプリングし,選択した例をキュレートする。
実験の結果,GRASE-DCは様々な計画タスクにおいて大幅な性能向上を実現していることがわかった。
論文 参考訳(メタデータ) (2025-05-02T05:16:17Z) - Entropy-Based Adaptive Weighting for Self-Training [15.089334734753677]
自己学習のためのエントロピーに基づく適応重み付け(EAST)を提案する。
EASTは、自己学習中に不確実なデータを優先順位付けするために設計された適応的な重み付け戦略である。
我々はGSM8KおよびMATHベンチマークに対するアプローチを評価する。
論文 参考訳(メタデータ) (2025-03-31T10:04:35Z) - Model Predictive Task Sampling for Efficient and Robust Adaptation [57.414812940406996]
本稿では,タスク空間と適応リスク分布をブリッジするフレームワークであるモデル予測タスクサンプリング(MPTS)を紹介する。
MPTSは、エピソード最適化プロセスの特徴付けに生成モデルを使用し、後部推論によりタスク固有の適応リスクを予測する。
MPTSはゼロショット、少数ショット、教師付き微調整設定にシームレスに統合される。
論文 参考訳(メタデータ) (2025-01-19T13:14:53Z) - What Do Learning Dynamics Reveal About Generalization in LLM Reasoning? [83.83230167222852]
モデルの一般化動作は,事前記憶列車の精度と呼ばれるトレーニング指標によって効果的に特徴づけられることがわかった。
モデルの学習行動と一般化を結びつけることで、トレーニング戦略に目標とする改善を導くことができる。
論文 参考訳(メタデータ) (2024-11-12T09:52:40Z) - EsaCL: Efficient Continual Learning of Sparse Models [10.227171407348326]
連続的な学習設定の主な課題は、以前に学習したタスクを実行する方法を忘れずに、タスクのシーケンスを効率的に学習することである。
本研究では,モデルの予測力に悪影響を及ぼすことなく,冗長なパラメータを自動生成する,スパースモデル(EsaCL)の効率的な連続学習法を提案する。
論文 参考訳(メタデータ) (2024-01-11T04:59:44Z) - Active Instruction Tuning: Improving Cross-Task Generalization by
Training on Prompt Sensitive Tasks [101.40633115037983]
インストラクションチューニング(IT)は,大規模言語モデル(LLM)を命令付き多種多様なタスクで訓練することにより,印象的なゼロショット一般化を実現する。
ITモデルの性能と一般化性を改善するために、新しいタスクをどのように選択するかは、未解決の問題である。
本稿では,情報的タスクを識別する新しいフレームワークである即時不確実性に基づくアクティブな指導チューニングを提案し,選択したタスク上でモデルをアクティブにチューニングする。
論文 参考訳(メタデータ) (2023-11-01T04:40:05Z) - Model-based Adversarial Meta-Reinforcement Learning [38.28304764312512]
モデルに基づく対向メタ強化学習(AdMRL)を提案する。
AdMRLは、タスクファミリ内のすべてのタスク間の最悪の部分最適化ギャップを最小限にすることを目的としている。
本手法をいくつかの連続制御ベンチマークで評価し,全てのタスクに対して最悪の性能を示す。
論文 参考訳(メタデータ) (2020-06-16T02:21:49Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。