論文の概要: Harness Evolution as Learning: Approximation, Generalization, and Optimization Limits of Self-Improving Personal Agents
- arxiv url: http://arxiv.org/abs/2609.36892v1
- Date: Tue, 29 Sep 2026 07:21:50 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-30 21:28:47.276987
- Title: Harness Evolution as Learning: Approximation, Generalization, and Optimization Limits of Self-Improving Personal Agents
- Title(参考訳): 学習としてのハーネス進化 : 自己改善型パーソナルエージェントの近似・一般化・最適化限界
- Abstract要約: 本稿では, ハーネスアーキテクチャ, ハーネススケール, 自己進化アルゴリズムの3つの中心的課題について検討する。
実証的に、我々は好み指向のベンチマークを導入し、個人エージェントの能力と限界を特徴づける。
我々は、学習問題として進化を定式化し、近似、一般化、最適化誤差を通じてこれらの現象を説明する。
- 参考スコア(独自算出の注目度): 16.454467526752424
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: As the capabilities of large language models (LLMs) continue to advance, increasing attention is turning to how to translate their abilities into useful behavior. Personal agents bring this question into everyday settings, where models are expected to serve individual users and continually adapt to their preferences. With the underlying model held fixed, such adaptation relies on harness engineering: designing and evolving the surrounding layer that manages context, memory, tools, and execution. Despite rapid progress, the factors governing effective harness evolution remain insufficiently understood. To narrow this gap, we investigate three central questions concerning harness architecture, harness scale, and self-evolution algorithms through complementary empirical and theoretical analyses. Empirically, we introduce a preference-oriented benchmark and systematically characterize the capabilities and limitations of personal agents associated with these three dimensions. Theoretically, we formulate harness evolution as a learning problem and explain these phenomena through approximation, generalization, and optimization errors. Analyses of reachable policies, capacity under finite interaction evidence, and biased update dynamics provide theoretical accounts of the observed phenomena. Together, these results offer a unified perspective on the limits of personalization through harness evolution and inform future harness design.
- Abstract(参考訳): 大きな言語モデル(LLM)の能力が向上するにつれて、その能力を有用な振る舞いに変換する方法に注目が向けられている。
個人エージェントは、この質問を日々の設定に持ち込み、モデルが個々のユーザーに提供され、好みに継続的に適応することが期待されている。
基盤となるモデルが固定されているため、そのような適応は、コンテキスト、メモリ、ツール、実行を管理する周辺レイヤの設計と進化という、ハーネスエンジニアリングに依存している。
急速な進歩にもかかわらず、効果的なハーネス進化を左右する要因は未だ十分に理解されていない。
このギャップを狭めるために、相補的な経験的および理論的分析を通して、ハーネスアーキテクチャ、ハーネススケール、自己進化アルゴリズムに関する3つの中心的な疑問を考察する。
実験では,これら3次元に係わる個人エージェントの能力と限界を体系的に特徴付け,嗜好指向のベンチマークを導入する。
理論的には、進化を学習問題として定式化し、近似、一般化、最適化誤差を通じてこれらの現象を説明する。
到達可能なポリシー、有限相互作用の証拠に基づくキャパシティ、バイアスされた更新ダイナミクスの分析は、観測された現象の理論的な説明を提供する。
これらの結果は、ハーネスの進化を通じてパーソナライゼーションの限界について統一的な視点を与え、将来のハーネス設計に通知する。
関連論文リスト
- World Models for Embodied Intelligence: From Plausible to Controllable to Actionable [100.13060753774657]
世界モデルは、隠れた状態を維持し、結果を予測し、介入を比較し、実行が期待から外れたときに適応することによって、インテリジェンスにおける知覚と意思決定を結びつける。
これは、どの予測能力が振る舞いを改善するかという、中心的な疑問を提起する。
可塑性モデルは、タスク関連時間的・幾何学的・物理的構造を保存し、制御可能なモデルは、介入がどのように構造を変えるかを予測し、アクション可能なモデルは、予測を計画、行動、学習、評価、検証、回復、データ選択において測定可能な利得に変換する。
論文 参考訳(メタデータ) (2026-09-15T06:22:42Z) - Continual Learning in Transition [77.0733079568852]
古典的な連続学習は主に、モデルがパラメータ中心のメカニズムを通じて知識を更新および保持することに焦点を当てている。
新たなパラダイムは、従来のモデル適応の観点を超えて、CLのスコープを再構築しています。
連続学習の3次元的進化を考察する。
論文 参考訳(メタデータ) (2026-08-06T16:07:26Z) - A Survey of Self-Evolving Agents: On Path to Artificial Super Intelligence [87.08051686357206]
大きな言語モデル(LLM)は強力な能力を示しているが、基本的に静的である。
LLMはますますオープンでインタラクティブな環境にデプロイされているため、この静的な性質は重要なボトルネックとなっている。
この調査は、自己進化エージェントの体系的で包括的なレビューを初めて提供する。
論文 参考訳(メタデータ) (2025-07-28T17:59:05Z) - Emergent Abilities in Large Language Models: A Survey [9.50669909278749]
大規模言語モデル(LLM)は、人工知能への最も有望な研究の流れの1つとして、新しい技術革命を導いている。
これらのモデルのスケーリングは、以前は観測されていなかった様々な創発的能力と関連付けられている。
これらの能力は、高度な推論やコンテキスト内学習からコーディングや問題解決まで多岐にわたる。
トランスフォーメーションの可能性にもかかわらず、創発的能力は未理解のままであり、定義、性質、予測可能性、含意について誤解を招く。
論文 参考訳(メタデータ) (2025-02-28T01:20:01Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。