論文の概要: Training Skills Like Parameters via Self-Supervised Semantic Diffusion
- arxiv url: http://arxiv.org/abs/2607.27557v1
- Date: Thu, 30 Jul 2026 01:03:59 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-31 21:37:00.355757
- Title: Training Skills Like Parameters via Self-Supervised Semantic Diffusion
- Title(参考訳): 自己監督的セマンティック拡散によるパラメータのような訓練スキル
- Abstract要約: 大規模言語モデル(LLM)は、創造的なスクリーンライティングなど、高度に専門化されたオープンエンドドメインの専門家には不足することが多い。
本稿では,拡散モデルの破壊・再構成パラダイムに着想を得た,新規で教師なしの自己進化型エージェントフレームワークを提案する。
ショート・ドラマ・スクリーンライティングの課題について,我々の枠組みを評価した。
- 参考スコア(独自算出の注目度): 15.133304131514713
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: While Large Language Models (LLMs) demonstrate remarkable general instruction-following capabilities, they often fall short of human experts in highly specialized, open-ended domains such as creative screenwriting. Prior approaches typically adopt post-training, yet both supervised fine-tuning and reinforcement learning require weight access that closed-source frontier models do not offer, and demand heavy compute. Moreover, what is learned is tied to a single checkpoint and cannot be inspected by humans. Recent advancements in agentic continual learning instead attempt to bridge this gap by accumulating external textual skills. However, these methods heavily rely on costly human expert annotations or unreliable LLM-as-a-judge feedback for reflection. To overcome this bottleneck, we propose a novel, unsupervised self-evolving agent framework inspired by the corruption-and-reconstruction paradigm of diffusion models. Instead of relying on explicit external scoring, we leverage existing high-quality human artifacts to construct self-supervised signals. Training then follows the familiar loop of neural network training, forward, loss, and backward, with the loss coming from contrasting the agent's reconstruction against the human original. What is updated is not model weights but an external library of textual skills. We evaluate our framework on the challenging task of short drama screenwriting. Experimental results demonstrate that our method enables the agent to autonomously extract and internalize highly generalizable skills, significantly enhancing its domain-specific generation capabilities. Furthermore, this self-contrastive reflection paradigm offers a scalable pathway for agents to teach themselves the production of complex, high-quality human artifacts, without requiring external supervision.
- Abstract(参考訳): LLM(Large Language Models)は、目覚ましい一般的な命令追従能力を示すが、創造的なスクリーンライティングのような高度に専門化されたオープンエンドドメインの専門家には、しばしば不足する。
従来のアプローチではポストトレーニングが一般的だったが、教師付き微調整と強化学習の両方では、クローズドソースフロンティアモデルでは提供されないウェイトアクセスが必要であり、重い計算を必要とする。
さらに、学習内容は1つのチェックポイントに結び付けられており、人間による検査はできない。
エージェント的連続学習の最近の進歩は、その代わりに、外部のテキストスキルを蓄積することで、このギャップを埋めようとしている。
しかし、これらの手法は、リフレクションのための費用がかかる専門家アノテーションや信頼性の低いLCM-as-a-judgeフィードバックに大きく依存している。
このボトルネックを克服するために,拡散モデルの破壊・再構成パラダイムに着想を得た,新規で教師なしの自己進化型エージェントフレームワークを提案する。
明示的な外部スコアに頼るのではなく、既存の高品質な人的アーティファクトを活用して、自己組織化された信号を構築します。
トレーニングは、ニューラルネットワークのトレーニング、前方、喪失、後方への慣れ親しんだループに従い、エージェントの再構築と人間のオリジナルとの対比から損失が生じる。
更新されるのは、モデルウェイトではなく、テキストスキルの外部ライブラリです。
ショート・ドラマ・スクリーンライティングの課題について,我々の枠組みを評価した。
実験の結果,本手法によりエージェントは,高度に一般化可能なスキルを自律的に抽出し,内部化することが可能であり,ドメイン固有の生成能力を著しく向上させることができることがわかった。
さらに、この自己コントラストリフレクションパラダイムは、エージェントが外部の監督を必要とせず、複雑な高品質な人工物の生産を教えるためのスケーラブルな経路を提供する。
関連論文リスト
- Scaling Large Reasoning Models beyond Human Supervision: A Path toward Superintelligence [77.303673110294]
検証可能な報酬による強化学習は、数学やコードの推論を大幅に改善することができる。
しかし、人間の直接監督は、モデル生成体験のスケールと複雑さに追随することはできない。
本稿では,人間の指導が学習ループから徐々に遠ざかっていくにつれて,LRMがいかに改善していくかを検討する。
論文 参考訳(メタデータ) (2026-08-31T16:48:48Z) - Rethinking Self-Evolution: A Constrained Exploration-Exploitation Process for Mitigating Skill Overfitting [20.811638832981178]
大規模言語モデル(LLM)エージェントは、過去のインタラクションからの経験を蓄積し再利用する必要がある。
データ駆動のスキル最適化は、実際の環境から収集された限られた軌道に過度に適合する傾向がある。
リスクを緩和する3段階フレームワークであるSkillBoostを提案する。
論文 参考訳(メタデータ) (2026-07-29T09:05:40Z) - Asymmetric Actor-Critic for Multi-turn LLM Agents [50.245019205783855]
信頼性のある対話エージェントのための非対称アクター批判フレームワークを提案する。
強力なプロプライエタリなLLMがアクターとして機能し、小さなオープンソース批評家がランタイムの監視を提供する。
提案手法は,強力な単一エージェントベースラインよりも信頼性とタスク成功を著しく向上させることを示す。
論文 参考訳(メタデータ) (2026-03-31T22:56:21Z) - Self-Consolidation for Self-Evolving Agents [51.94826934403236]
大規模言語モデル(LLM)エージェントは静的システムとして機能し、生涯にわたる相互作用を通じて進化する能力に欠ける。
相補的進化機構を導入したLLMエージェントのための新しい自己進化フレームワークを提案する。
論文 参考訳(メタデータ) (2026-02-02T11:16:07Z) - PRISM: A Unified Framework for Post-Training LLMs Without Verifiable Rewards [16.15363954575401]
大規模言語モデルの訓練後の現在の技術は、費用のかかる人事監督や外部検証に頼っている。
PRISMは、プロセス・リワード・モデル(Process Reward Model, PRM)を用いて、モデルの内部信頼度とともに学習をガイドする統合トレーニングフレームワークである。
PRMと自己確実性を効果的に組み合わせることで,安定したトレーニングとテスト時間性能の両立が期待できることを示す。
論文 参考訳(メタデータ) (2026-01-08T08:09:29Z) - Deep Reinforcement Learning Agents are not even close to Human Intelligence [25.836584192349907]
深部強化学習(RL)エージェントは、様々なタスクにおいて印象的な結果を得るが、ゼロショット適応能力は欠如している。
我々は、アーケード学習環境のタスクバリエーションのセットであるHackAtariを紹介する。
人間とは対照的に、RLエージェントは、トレーニングタスクのより単純なバージョンに対して、体系的に大きなパフォーマンス低下を示します。
論文 参考訳(メタデータ) (2025-05-27T20:21:46Z) - The Superalignment of Superhuman Intelligence with Large Language Models [63.96120398355404]
我々は,この疑問に答えるために,学習の観点からスーパーアライメントの概念について議論する。
スーパーアライメントにおけるいくつかの重要な研究課題、すなわち、弱いから強い一般化、スケーラブルな監視、評価に焦点を当てる。
本稿では,学習者モデルの弱点を露呈しようとする敵対的クエリを生成する攻撃者,最小限の人間専門家とともに,批判モデルによって生成されたスケーラブルなフィードバックから学習することで自己を洗練させる学習者,与えられた質問応答対に対する批判や説明を生成する批判者,そして批判によって学習者を改善することを目的とした,3つのモジュールからなるスーパーアライメントの概念的枠組みを提案する。
論文 参考訳(メタデータ) (2024-12-15T10:34:06Z) - Exploration with Principles for Diverse AI Supervision [88.61687950039662]
次世代の予測を用いた大規模トランスフォーマーのトレーニングは、AIの画期的な進歩を生み出した。
この生成AIアプローチは印象的な結果をもたらしたが、人間の監督に大きく依存している。
この人間の監視への強い依存は、AIイノベーションの進歩に重大なハードルをもたらす。
本稿では,高品質なトレーニングデータを自律的に生成することを目的とした,探索型AI(EAI)という新しいパラダイムを提案する。
論文 参考訳(メタデータ) (2023-10-13T07:03:39Z) - Towards A Unified Agent with Foundation Models [18.558328028366816]
強化学習(RL)エージェントにそのような能力を組み込んで活用する方法を検討する。
我々は、言語を中核的推論ツールとして使用するフレームワークを設計し、エージェントが一連の基本的なRL課題にどのように取り組むことができるかを探る。
探索効率とオフラインデータセットからのデータの再利用能力において,ベースラインよりも大幅にパフォーマンスが向上したことを示す。
論文 参考訳(メタデータ) (2023-07-18T22:37:30Z) - Data-Driven Inverse Reinforcement Learning for Expert-Learner Zero-Sum
Games [30.720112378448285]
逆強化学習をエキスパート-ラーナーインタラクションとして定式化する。
学習者エージェントに対して、専門家や対象エージェントの最適性能意図が不明である。
我々は、専門家や学習者エージェントのダイナミクスの知識を必要としない、政治以外のIRLアルゴリズムを開発した。
論文 参考訳(メタデータ) (2023-01-05T10:35:08Z) - PEBBLE: Feedback-Efficient Interactive Reinforcement Learning via
Relabeling Experience and Unsupervised Pre-training [94.87393610927812]
我々は、フィードバックと非政治学習の両方の長所を生かした、非政治的、インタラクティブな強化学習アルゴリズムを提案する。
提案手法は,従来ヒト・イン・ザ・ループ法で検討されていたよりも複雑度の高いタスクを学習可能であることを実証する。
論文 参考訳(メタデータ) (2021-06-09T14:10:50Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。