論文の概要: Socialized Division and Collaboration: Rethinking Class-Incremental Learning under Optimization Conflicts
- arxiv url: http://arxiv.org/abs/2608.21044v1
- Date: Fri, 21 Aug 2026 12:40:04 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-24 14:49:32.536215
- Title: Socialized Division and Collaboration: Rethinking Class-Incremental Learning under Optimization Conflicts
- Title(参考訳): ソーシャル化部門とコラボレーション:最適化紛争下での授業増進学習の再考
- Authors: Xinjie Yao, Zhihe Fan, Yunqi Zhu, Jiaqi Zhou, Dengyu Zhao, Zhoupeng Guo, Yan Fan, Guosong Jiang, Pengfei Zhu,
- Abstract要約: クラスインクリメンタルラーニングは一般的に単一モデルパラダイムとしてインスタンス化され、統一されたモデルが非バウンドなセッションストリームに順次適応する。
このような忘れは、一パラメータ空間内での不均一な学習力学を強制する構造的制限を反映している、と我々は主張する。
社会連帯理論を取り入れた社会分科会(SDC)を継続学習の改革として提案する。
- 参考スコア(独自算出の注目度): 11.786509758587522
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Class-incremental learning is commonly instantiated as a single-model paradigm, where a unified model sequentially adapts to an unbounded stream of sessions. While effective under mild distributional shifts, this formulation becomes strained when successive sessions induce incompatible optimization directions, leading to destructive interference and catastrophic forgetting. We argue that such forgetting reflects a structural limitation of enforcing heterogeneous learning dynamics within a single parameter space. Motivated by social solidarity theory, we propose Socialized Division and Collaboration (SDC) as a reformulation of continual learning that decomposes session learning across specialized models in response to optimization conflicts, while enabling coordinated collaboration. To support this formulation with a principled allocation mechanism, we introduce an energy-based session-model compatibility criterion grounded in Helmholtz free energy, which guides adaptive session allocation and model evolution under conflicting objectives. This framework integrates session assignment, model evolution, and collaborative inference into a unified pipeline, offering an alternative to monolithic continual learning formulations and highlighting a broader design principle for learning under persistent optimization conflicts.
- Abstract(参考訳): クラスインクリメンタルラーニングは一般的に単一モデルパラダイムとしてインスタンス化され、統一されたモデルが非バウンドなセッションストリームに順次適応する。
緩やかな分布シフトの下では有効であるが、連続するセッションが不整合最適化の方向を誘導すると、この定式化は緊張し、破壊的な干渉と破滅的な忘れが生じる。
このような忘れは、一パラメータ空間内での不均一な学習力学を強制する構造的制限を反映している、と我々は主張する。
社会連帯理論によって動機づけられた社会分科会(SDC)は,協調型コラボレーションを実現しつつ,最適化競合に対応するため,専門モデル間でのセッション学習を分解する連続学習の改革として提案される。
この定式化を支援するために,ヘルムホルツ自由エネルギーに基づくエネルギーベースセッションモデル互換性基準を導入する。
このフレームワークはセッション割り当て、モデル進化、協調推論を統一パイプラインに統合し、モノリシックな継続的学習形式に代わるものを提供し、永続的な最適化競合の下で学習するためのより広範な設計原則を強調している。
関連論文リスト
- Revitalizing the Beginning: Avoiding Storage Dependency for Model Merging in Continual Learning [57.10440766103372]
Trajectory Regularized Merging (TRM) は、拡張されたトラジェクトリ部分空間内の最適化プロセスとしてマージフェーズを再構成するフレームワークである。
本フレームワークは,タスクアライメント,予測整合性,勾配応答性といった3つの相乗的目標を統合し,統合モデルの履歴安定性と再活性化最適化のダイナミクスを同時に保存する。
論文 参考訳(メタデータ) (2026-05-08T14:07:32Z) - SODE: Analyzing Social Dynamics in LLM Agents [17.885513252130373]
SODE(Social Dynamics Evaluation)は,AIエージェントを3つの進化的側面にわたって評価するフレームワークである。
SODEを適用すると、系統的な違いが明らかになる。
我々は「ロングホライズンフレーミング」がモデル推論における相互機能を解き放つことを実証した。
論文 参考訳(メタデータ) (2026-05-06T14:50:07Z) - Segment-Aligned Policy Optimization for Multi-Modal Reasoning [55.29606572822562]
本稿では、トークンや全シーケンスではなく、一貫性のある推論ステップをポリシー更新の基本単位として扱う新しい強化学習パラダイムを提案する。
代表的な推論ベンチマークの実験は、SAPOがトークンレベルおよびシーケンスレベルポリシー最適化手法を一貫して上回っていることを示している。
我々の研究は、強化学習の更新を推論の構造と整合させることの重要性を強調し、複雑な推論タスクにおけるより効率的でセマンティックに根ざした政策最適化の道を開く。
論文 参考訳(メタデータ) (2026-05-02T08:47:45Z) - Drift No More? Context Equilibria in Multi-Turn LLM Interactions [58.69551510148673]
コンテキストドリフト(Contexts drift)とは、ターン間のゴール一貫性のある振る舞いからモデルが出力する出力の段階的なばらつきである。
シングルターンエラーとは異なり、ドリフトは時間的に展開し、静的な評価指標では捉えにくい。
マルチターンドリフトは、避けられない崩壊というよりも、制御可能な平衡現象として理解できることを示す。
論文 参考訳(メタデータ) (2025-10-09T04:48:49Z) - Closing the Loop: Coordinating Inventory and Recommendation via Deep Reinforcement Learning on Multiple Timescales [6.5434300333872875]
本稿では,機能モジュール間の共同最適化に適した統合マルチエージェントRLフレームワークを提案する。
まず,これらの関数間の相互作用を捉えるための統合理論モデルを構築した。
次に、ポリシーコンポーネントを部門機能に応じて分解する、新しいマルチタイムマルチエージェントRLアーキテクチャを設計する。
論文 参考訳(メタデータ) (2025-10-05T16:28:06Z) - Step-Aware Policy Optimization for Reasoning in Diffusion Large Language Models [57.42778606399764]
拡散言語モデル(dLLM)は、テキスト生成に有望で非自己回帰的なパラダイムを提供する。
現在の強化学習アプローチは、しばしばスパースで結果に基づく報酬に頼っている。
これは推論の自然な構造との根本的なミスマッチに由来すると我々は主張する。
論文 参考訳(メタデータ) (2025-10-02T00:34:15Z) - On the Discrimination and Consistency for Exemplar-Free Class Incremental Learning [19.898602404329697]
Exemplar-free class incremental learning (EF-CIL) は非自明なタスクであり、新しいクラスでモデル能力を継続的に強化し、古いクラスの例を保存・再生することなく、学習した知識を維持しながら、新しいクラスでモデル能力を増強する必要がある。
CILのための新たな理論誘導フレームワークは、共有ネットワークのタスク固有モデルを訓練し、忘れるプレッシャーをタスクID予測にシフトさせる。
EF-CILでは、タスク間相互作用の欠如(例:例題のリプレイ)によりタスクID予測がより困難になる。
論文 参考訳(メタデータ) (2025-01-26T08:50:33Z) - Mitigating Distribution Shift in Model-based Offline RL via Shifts-aware Reward Learning [36.01269673940484]
本稿では,問題をモデルバイアスとポリシーシフトという2つの基本要素に分解する包括的分析を行う。
我々の理論的および実証的研究は、これらの要因がどのように価値推定と政策最適化を歪めているかを明らかにする。
我々は、バニラ報酬を改良し、価値学習を洗練させ、政策訓練を促進する統一確率的推論フレームワークを通じて、新しいシフトアウェア報酬を導出する。
論文 参考訳(メタデータ) (2024-08-23T04:25:09Z) - Control as Hybrid Inference [62.997667081978825]
本稿では、反復推論と償却推論のバランスを自然に仲介するCHIの実装について述べる。
連続的な制御ベンチマークでアルゴリズムのスケーラビリティを検証し、強力なモデルフリーおよびモデルベースラインを上回る性能を示す。
論文 参考訳(メタデータ) (2020-07-11T19:44:09Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。