論文の概要: Athena-Brain Technical Report: An Efficient Robot Brain for General Intelligence and Embodied Interactio
- arxiv url: http://arxiv.org/abs/2607.18985v1
- Date: Tue, 21 Jul 2026 11:19:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-22 19:05:05.401852
- Title: Athena-Brain Technical Report: An Efficient Robot Brain for General Intelligence and Embodied Interactio
- Title(参考訳): Athena-Brain Technical Report: 汎用知能と身体干渉のための効率的なロボット脳
- Abstract要約: 大規模言語モデル(LLM)は、言語理解、推論、世界知識において顕著な能力を示した。
我々は、デバイス上のインテリジェンスのための脳として機能するように設計された8B LLMである textbfAthena-Brain-8B を提示する。
- 参考スコア(独自算出の注目度): 27.340367808523155
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language models (LLMs) have demonstrated remarkable capabilities in language understanding, reasoning, and world knowledge. As embodied agents become increasingly capable, there is a growing demand for compact models that can serve as an on-device brain, preserving the broad general intelligence of LLMs while enabling effective high-level interaction with embodied environments. Existing approaches, however, often prioritize either general-purpose intelligence or specialized embodied capabilities, making it challenging to satisfy both requirements within a single model. We present \textbf{Athena-Brain-8B}, an 8B LLM designed to serve as an on-device brain for embodied intelligence for embodied intelligence. Through a multi-stage post-training pipeline consisting of General Supervised Fine-Tuning, General Reinforcement Learning, Embodied Expert training, and Model Merge, Athena-Brain-8B maintains strong general capabilities while acquiring strong high-level embodied interaction capabilities and generating concise responses for efficient embodied interaction. Experimental results demonstrate the effectiveness of Athena across both general and embodied evaluations. Compared with the corresponding Qwen3-8B thinking model, Athena-Brain-8B achieves comparable performance on general language and reasoning benchmarks while generating substantially shorter responses. On in-domain embodied benchmarks, Athena-Brain-8B consistently outperforms models of similar scale and surpasses several substantially larger frontier models evaluated zero-shot, demonstrating that compact language models can effectively integrate strong general intelligence with embodied capabilities.
- Abstract(参考訳): 大規模言語モデル(LLM)は、言語理解、推論、世界知識において顕著な能力を示した。
エンボディエージェントの能力が向上するにつれて、デバイス上の脳として機能しうるコンパクトモデルへの需要が高まり、LLMの汎用的な知性を保ちつつ、エンボディされた環境との効果的なハイレベルな相互作用を可能にしている。
しかし、既存のアプローチはしばしば汎用インテリジェンスまたは特殊な具体的能力のどちらかを優先し、単一のモデル内で両方の要求を満たすことは困難である。
我々は、デバイス上のインテリジェンスを具現化したインテリジェンスのためのオンデバイス脳として機能するように設計された8B LLMである「textbf{Athena-Brain-8B}」を提示する。
General Supervised Fine-Tuning、General Reinforcement Learning、Embodied Expert Training、Model Mergeからなる多段階のポストトレーニングパイプラインを通じて、Athena-Brain-8Bは強力なハイレベルなエンボディドインタラクション能力を獲得し、効率的なエンボディドインタラクションのための簡潔な応答を生成するとともに、強力な汎用能力を維持している。
実験結果から,Athenaの全身的評価と身体的評価の両面での有効性が示された。
対応するQwen3-8Bの思考モデルと比較すると、Athena-Brain-8Bは一般言語と推論ベンチマークで同等のパフォーマンスを達成し、応答は極めて短い。
ドメイン内エンボディドベンチマークでは、Athena-Brain-8B は一貫して同様のスケールのモデルより優れており、ゼロショットの評価されたより大きなフロンティアモデルよりも優れており、コンパクト言語モデルがエンボディド機能と強力な汎用インテリジェンスを効果的に統合できることを実証している。
関連論文リスト
- Guava: An Effective and Universal Harness for Embodied Manipulation [74.34187069605844]
実装された操作能力を4Bオープンソースモデルに蒸留するエンドツーエンドのトレーニングパイプラインを開発した。
結果は、よく設計されたハーネスが、エンボディド操作のためのスケーラブルでモデルに依存しないインターフェースとして機能することを示唆している。
論文 参考訳(メタデータ) (2026-06-16T18:09:26Z) - ACE-Brain-0: Spatial Intelligence as a Shared Scaffold for Universal Embodiments [134.95780765985515]
本稿では,空間推論,自律運転,体操を統一する一般基礎脳であるACE-Brain-0を紹介する。
我々の重要な洞察は、空間的知性は様々な物理的具体化の普遍的な足場として機能するということである。
そこで我々は,まず共有空間基盤を確立し,次にドメイン特化専門家を育成し,最後にデータフリーモデルマージにより調和させるScaffold-specize-Reconcile(SSR)パラダイムを提案する。
論文 参考訳(メタデータ) (2026-03-03T17:53:45Z) - Architecting Large Action Models for Human-in-the-Loop Intelligent Robots [0.6999740786886536]
既成の基盤モデルを構成することで,優れた大規模行動モデルを構築することができることを示す。
マルチモーダルロボットを用いた実験により,大規模行動モデルインテリジェンスには大規模なエンドツーエンドトレーニングが不要であることが実証された。
論文 参考訳(メタデータ) (2025-12-12T14:58:27Z) - InteractiveOmni: A Unified Omni-modal Model for Audio-Visual Multi-turn Dialogue [35.99134148462425]
音声-視覚的マルチターンインタラクションのための,統一的でオープンソースのOmni-Modal大言語モデルであるInteractive Omniを紹介する。
これを実現するために、視覚エンコーダ、オーディオエンコーダ、大言語モデル、音声デコーダを統合モデルに統合し、タスクの理解と生成を行う。
我々は、Omni-modal理解のための事前学習を含む、堅牢なクロスモーダル機能を確保するためのマルチステージトレーニング戦略を設計する。
論文 参考訳(メタデータ) (2025-10-15T16:52:48Z) - RLVER: Reinforcement Learning with Verifiable Emotion Rewards for Empathetic Agents [67.46032287312339]
大規模言語モデル(LLM)は論理的およびアルゴリズム的推論において優れているが、彼らの感情的知性(EQ)は認知能力よりもはるかに遅れている。
シミュレーションユーザによる検証可能な感情報酬を活用する,最初のエンドツーエンド強化学習フレームワークであるRLVERを紹介する。
以上の結果から,RLVERは感情的知的で幅広い言語エージェントへの実践的な経路であることが示唆された。
論文 参考訳(メタデータ) (2025-07-03T18:33:18Z) - Agentic Episodic Control [16.94652073521156]
強化学習(RL)は、ゲームプレイから科学的発見、AIアライメントに至るまで、AIのブレークスルーを推進してきた。
近年の進歩は、豊かな世界知識と推論能力を持つ大規模言語モデルが、意味的状態モデリングとタスクに依存しない計画を可能にすることで、RLを補完する可能性があることを示唆している。
本稿では,RLを大規模言語モデルと統合して意思決定を促進する新しいアーキテクチャであるエージェント・エピソディクス・コントロール(AEC)を提案する。
論文 参考訳(メタデータ) (2025-06-02T08:57:37Z) - Detect, Explain, Escalate: Low-Carbon Dialogue Breakdown Management for LLM-Powered Agents [30.13634341221476]
大規模言語モデル(LLM)は、多くのアプリケーションを変えつつありますが、会話のブレークダウンへの感受性は、ユーザ信頼を損なう重要な課題です。
本稿では,低炭素運転を重視したLDMエージェントの対話分解を管理するためのフレームワーク「Detect, Explain, Escalate」を提案する。
論文 参考訳(メタデータ) (2025-04-26T07:51:05Z) - Dynamic-SUPERB Phase-2: A Collaboratively Expanding Benchmark for Measuring the Capabilities of Spoken Language Models with 180 Tasks [112.6716697906318]
命令ベースユニバーサル音声モデルの包括的評価のためのオープンベンチマークであるDynamic-SUPERB Phase-2を提案する。
第1世代をベースとして、この第2バージョンには125の新しいタスクが含まれており、ベンチマークを合計180タスクに拡張している。
評価結果から, モデルが良好に機能することのないことが示唆された。
論文 参考訳(メタデータ) (2024-11-08T06:33:22Z) - A Conversational Brain-Artificial Intelligence Interface [3.017482151674131]
脳知能インタフェース(BAI)を脳コンピュータインタフェース(BCI)の新しいクラスとして導入する。
BAIは人工知能の力を活用して、神経認知処理パイプラインの一部を置き換える。
本研究では,対話型BAIが言語を生成することなく,複雑なコミュニケーションを実現するための電話会話のシミュレーション実験を行った。
論文 参考訳(メタデータ) (2024-02-22T23:11:12Z) - Integration of cognitive tasks into artificial general intelligence test
for large models [54.72053150920186]
我々は、認知科学にインスパイアされた人工知能(AGI)テストの包括的な枠組みを提唱する。
認知科学に触発されたAGIテストは、結晶化インテリジェンス、流体インテリジェンス、社会インテリジェンス、エンボディドインテリジェンスを含む、すべてのインテリジェンスファセットを含んでいる。
論文 参考訳(メタデータ) (2024-02-04T15:50:42Z) - Enabling High-Level Machine Reasoning with Cognitive Neuro-Symbolic
Systems [67.01132165581667]
本稿では,認知アーキテクチャを外部のニューロシンボリックコンポーネントと統合することにより,AIシステムにおける高レベル推論を実現することを提案する。
本稿では,ACT-Rを中心としたハイブリッドフレームワークについて紹介し,最近の応用における生成モデルの役割について論じる。
論文 参考訳(メタデータ) (2023-11-13T21:20:17Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。