論文の概要: AGORA: Incentivizing Group Emergence Capability in LLMs via Group Distillation
- arxiv url: http://arxiv.org/abs/2507.21166v1
- Date: Fri, 25 Jul 2025 13:05:01 GMT
- ステータス: 翻訳完了
- システム内更新日: 2025-07-30 17:08:55.016916
- Title: AGORA: Incentivizing Group Emergence Capability in LLMs via Group Distillation
- Title(参考訳): AGORA: グループ蒸留によるLDMのグループの創発能力向上
- Authors: Ren Zhuang, Ben Wang, Shuifa Sun,
- Abstract要約: 複雑な推論のための新しいスケーリング軸として構造化相互作用を提案する。
我々の自己進化フレームワークであるAGORAは、最先端のモノリシックシステムを超える推論性能を実現するための協調的なアンサンブルを可能にします。
- 参考スコア(独自算出の注目度): 3.521097198612099
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Progress in complex reasoning is constrained by the static nature of the current training datasets. We propose structured interaction as a new scaling axis, moving beyond the prevailing paradigm of increasing model parameters. Our self-evolving framework, AGORA, enables a collaborative ensemble to achieve reasoning performance exceeding state-of-the-art monolithic systems by up to 4.45 percentage points on challenging mathematical benchmarks. This gain stems from group emergent ability-the synthesis of collective capabilities unattainable by isolated models, validating interaction as a scalable driver of intelligence. Our results position the engineering of collaborative ecosystems as a vital frontier for capability emergence.
- Abstract(参考訳): 複雑な推論の進歩は、現在のトレーニングデータセットの静的性質によって制約される。
我々は、モデルパラメータの増加という一般的なパラダイムを超えて、新しいスケーリング軸として構造化された相互作用を提案する。
我々の自己進化フレームワークであるAGORAは、最先端のモノリシックシステムよりも高い推論性能を、挑戦的な数学的ベンチマークで最大4.45ポイント向上させることができる。
この利得は集団創発能力(集団能力の合成は孤立したモデルでは達成できない)に起因し、相互作用をスケーラブルなインテリジェンスのドライバとして検証する。
我々の結果は、協調生態系の工学を能力の出現の重要なフロンティアと位置づけている。
関連論文リスト
- Modeling Collaborative Problem Solving Dynamics from Group Discourse: A Text-Mining Approach with Synergy Degree Model [0.14705219137930792]
本研究では,グループ通信からCPSのシナジーを定量化するために,自動談話分析をSynergy Degree Model(SDM)と統合する計算フレームワークを提案する。
5週間のコネクティビストMOOC(cMOOC)活動において,12グループ52人の学習者からデータを収集した。
発見はコラボレーションのセンシティブな指標としてシナジー学位を確立し、AI-in-the-loopアプローチによるきめ細かいCPS分析のスケールアップの可能性を示す。
論文 参考訳(メタデータ) (2025-12-15T07:43:24Z) - Nex-N1: Agentic Models Trained via a Unified Ecosystem for Large-Scale Environment Construction [117.6380005194061]
本稿では,対話型環境の多様性と複雑さを体系的にスケールする手法を提案する。
本手法は,3次元に対処することで,このスケーリングを実現する。
Nex-N1は、インフラストラクチャによって確立された多様な複雑なインタラクティブ環境に基づいてトレーニングします。
論文 参考訳(メタデータ) (2025-12-04T16:57:02Z) - FreeAskWorld: An Interactive and Closed-Loop Simulator for Human-Centric Embodied AI [24.545163508739943]
FreeAskWorldは対話型シミュレーションフレームワークで、大規模言語モデルを統合して、ハイレベルな振る舞い計画とセマンティックな基礎的なインタラクションを実現する。
我々のフレームワークはスケーラブルでリアルなヒューマンエージェントシミュレーションをサポートし、多様な実施タスクに適したモジュラーデータ生成パイプラインを含んでいる。
再構成環境,6種類のタスクタイプ,16のコアオブジェクトカテゴリ,63,429の注釈付きサンプルフレーム,17時間以上のインタラクションデータからなる大規模ベンチマークデータセットであるFreeAskWorldを公開・公開する。
論文 参考訳(メタデータ) (2025-11-17T15:58:46Z) - Social World Model-Augmented Mechanism Design Policy Learning [58.739456918502704]
SWM-AP (Social World Model-Augmented Mechanism Design Policy Learning) を導入する。
SWM-APは,累積報酬とサンプル効率において,モデルベースおよびモデルフリーのRLベースラインよりも優れていた。
論文 参考訳(メタデータ) (2025-10-22T06:01:21Z) - Decentralized Dynamic Cooperation of Personalized Models for Federated Continual Learning [50.56947843548702]
フェデレーション型連続学習のための分散動的協調フレームワークを提案する。
顧客は、新しい知識の獲得と事前学習の維持のバランスをとるために、動的な協調学習連合を確立する。
また、協調的・動的平衡を達成するために、マージブロックアルゴリズムと動的協調的進化アルゴリズムを提案する。
論文 参考訳(メタデータ) (2025-09-28T06:53:23Z) - The Landscape of Agentic Reinforcement Learning for LLMs: A Survey [103.32591749156416]
エージェント強化学習(Agentic RL)の出現は、大規模言語モデル(LLM RL)に適用された従来の強化学習からパラダイムシフトを示している。
本研究では, LLM-RLの縮退した単段階マルコフ決定過程(MDPs)と, エージェントRLを定義する部分可観測マルコフ決定過程(POMDPs)とを対比することにより, この概念シフトを定式化する。
論文 参考訳(メタデータ) (2025-09-02T17:46:26Z) - STARec: An Efficient Agent Framework for Recommender Systems via Autonomous Deliberate Reasoning [54.28691219536054]
我々は、自律的な熟考的推論機能を備えたレコメンデータシステムを支援する、ゆっくり考えられた拡張エージェントフレームワークSTARecを紹介する。
我々は,先進的推論モデルと嗜好整合型報酬形成から構造化知識の蒸留を組み合わせた2段階のパラダイムであるアンカー強化訓練を開発する。
MovieLens 1MとAmazon CDsベンチマークの実験では、STARecは最先端のベースラインと比較して、大幅なパフォーマンス向上を実現している。
論文 参考訳(メタデータ) (2025-08-26T08:47:58Z) - Boosting Team Modeling through Tempo-Relational Representation Learning [9.427356802394437]
チームモデリングは、人工知能と社会科学の交差点における根本的な課題である。
i) 自動時間グラフ抽出器, (ii) テンポ関係エンコーダ, (iii) チーム構成予測のためのデコーダ, (iv) 相補的説明可能性モジュール。
論文 参考訳(メタデータ) (2025-07-17T17:22:41Z) - SE-Merging: A Self-Enhanced Approach for Dynamic Model Merging [60.83635006372403]
textttSE-Mergingは自己拡張型モデルマージフレームワークである。
textttSE-Mergingは、追加のトレーニングなしで動的モデルのマージを実現することを示す。
論文 参考訳(メタデータ) (2025-06-22T18:38:41Z) - Multi-Agent Collaboration via Evolving Orchestration [61.93162413517026]
大規模言語モデル(LLM)は、様々な下流タスクで顕著な成果を上げているが、そのモノリシックな性質は複雑な問題解決におけるスケーラビリティと効率を制限している。
LLMをベースとしたマルチエージェントコラボレーションのためのパウチスタイルのパラダイムを提案し、中央オーケストレータがタスク状態の進化に応じてエージェントを動的に指示する。
クローズドドメインおよびオープンドメインシナリオの実験により,この手法は計算コストを低減し,優れた性能が得られることが示された。
論文 参考訳(メタデータ) (2025-05-26T07:02:17Z) - Benchmarking LLMs' Swarm intelligence [50.544186914115045]
大規模言語モデル(LLM)は複雑な推論の可能性を秘めているが、マルチエージェントシステム(MAS)における創発的協調の能力はほとんど探索されていない。
分散エージェントとして機能するLDMのタスクを体系的に評価する新しいベンチマークであるSwarmBenchを紹介する。
本稿では,協調効率の指標を提案し,創発的グループダイナミクスを解析する。
論文 参考訳(メタデータ) (2025-05-07T12:32:01Z) - Deep hybrid models: infer and plan in a dynamic world [0.0]
3つの特徴に基づいて離散的かつ連続的な処理を利用する能動的推論手法を提案する。
モデルが異なる条件下で提示された課題に対処できることが示される。
論文 参考訳(メタデータ) (2024-02-01T15:15:25Z) - Discovering group dynamics in coordinated time series via hierarchical recurrent switching-state models [5.250223406627639]
システムレベルと個別レベルのダイナミクスを学習するために、教師なしの方法でトレーニングできる新しいスイッチング状態モデルを提案する。
我々は、遅延系レベルの離散状態マルコフ連鎖を用いて、遅延系レベルの連鎖にトップダウンの影響を与え、各観測時系列の放出を制御している。
論文 参考訳(メタデータ) (2024-01-26T16:06:01Z) - Multi-Agent Dynamic Relational Reasoning for Social Robot Navigation [50.01551945190676]
社会ロボットナビゲーションは、日常生活の様々な状況において有用であるが、安全な人間とロボットの相互作用と効率的な軌道計画が必要である。
本稿では, 動的に進化する関係構造を明示的に推論した系統的関係推論手法を提案する。
マルチエージェント軌道予測とソーシャルロボットナビゲーションの有効性を実証する。
論文 参考訳(メタデータ) (2024-01-22T18:58:22Z) - Unifying Self-Supervised Clustering and Energy-Based Models [9.3176264568834]
自己教師付き学習と生成モデルとの間には,原則的な関連性を確立する。
シンボル接地問題の単純かつ非自明なインスタンス化に対処するために,我々の解法をニューロシンボリックな枠組みに統合できることが示される。
論文 参考訳(メタデータ) (2023-12-30T04:46:16Z) - Efficient Model-based Multi-agent Reinforcement Learning via Optimistic
Equilibrium Computation [93.52573037053449]
H-MARL (Hallucinated Multi-Agent Reinforcement Learning) は,環境と数回交流した後の平衡政策を学習する。
自律運転シミュレーションベンチマークにおいて,本手法を実験的に実証した。
論文 参考訳(メタデータ) (2022-03-14T17:24:03Z) - GEM: Group Enhanced Model for Learning Dynamical Control Systems [78.56159072162103]
サンプルベースの学習が可能な効果的なダイナミクスモデルを構築します。
リー代数ベクトル空間上のダイナミクスの学習は、直接状態遷移モデルを学ぶよりも効果的であることを示す。
この研究は、ダイナミクスの学習とリー群の性質の関連性を明らかにし、新たな研究の方向への扉を開く。
論文 参考訳(メタデータ) (2021-04-07T01:08:18Z) - An active inference model of collective intelligence [0.0]
本稿では,局所的な個人レベルの相互作用と集団的知性の関係をシミュレートする最小エージェントモデルを提案する。
その結果, エージェントの局所的最適とグローバル的最適の整合性の相補的なメカニズムを提供することにより, 段階的認知遷移がシステム性能を向上させることが示された。
論文 参考訳(メタデータ) (2021-04-02T14:32:01Z) - The Role of Isomorphism Classes in Multi-Relational Datasets [6.419762264544509]
アイソモーフィックリークは,マルチリレーショナル推論の性能を過大評価することを示す。
モデル評価のためのアイソモーフィック・アウェア・シンセサイティング・ベンチマークを提案する。
また、同型類は単純な優先順位付けスキームによって利用することができることを示した。
論文 参考訳(メタデータ) (2020-09-30T12:15:24Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。