論文の概要: Atria Dawn: The Dawn of Agentic Superintelligence
- arxiv url: http://arxiv.org/abs/2609.15818v2
- Date: Thu, 17 Sep 2026 17:33:02 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-20 08:55:53.417991
- Title: Atria Dawn: The Dawn of Agentic Superintelligence
- Title(参考訳): Atria Dawn: エージェント超知能の夜明け
- Abstract要約: 本稿では,科学研究と工学のための基礎エージェント言語モデルであるAtria Dawn Previewを紹介する。
本稿では,人間-AI協力の事例研究として,このモデルの背後にある真の研究開発プロセスについて考察する。
- 参考スコア(独自算出の注目度): 237.73474618289063
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: As AI agents become participants in the development of their successors, they reshape both the production of intelligence and the role of human researchers. We introduce Atria Dawn Preview, a foundation agentic language model designed for scientific research and engineering workflows, with the goal of expanding the frontier of agent productivity in the real world. This model is trained via a Verifiable Experience Pipeline that connects tool-mediated interactions to executable environments and externally verified outcomes. Across 16 benchmarks spanning real-world research, engineering, and digital work, Atria Dawn Preview is competitive with frontier agents and achieves the highest reported score on five of them. Beyond standalone performance, we examine the real research-and-development process behind this model as a case study of human--AI collaboration, analyzing 769 task records from 56 participants together with agent logs. When asked to evaluate completed tasks under comparable conditions, participants rated about one-third of completed AI-assisted tasks as infeasible without AI. More strikingly, agents frequently propose methods and implement revisions, while humans retain most final decisions and guide exploration through judgment and feedback. These observations indicate a shift from task-level execution to project-level partnership, with human effort concentrating on what is worth pursuing and how evidence should guide research. Progress toward more autonomous AI research must therefore advance both the capacity for discovery and the capacity for meaningful human oversight, preserving accountable human authority over the risks and direction of continued development.
- Abstract(参考訳): AIエージェントが後継者の開発に参画するにつれて、彼らは知性の生成と人間の研究者の役割の両方を再構築する。
私たちはAtria Dawn Previewを紹介します。Atria Dawn Previewは、科学研究とエンジニアリングのワークフロー用に設計された基礎エージェント言語モデルで、エージェント生産性の最先端を現実世界に広げることを目的としています。
このモデルは、ツールによるインタラクションを実行可能な環境と外部で検証された結果に接続する、検証可能なエクスペリエンスパイプラインを通じてトレーニングされる。
現実世界の研究、エンジニアリング、デジタルワークにまたがる16のベンチマークで、Atria Dawn Previewはフロンティアエージェントと競合し、5つのうち最高のスコアを記録した。
スタンドアロンのパフォーマンス以外にも,エージェントログとともに56人の参加者から769件のタスクレコードを解析し,人間-AIコラボレーションのケーススタディとして,本モデルの背後にある真の研究開発プロセスについて検討する。
同等の条件下での完了タスクの評価を依頼された参加者は、完了したAI支援タスクの約3分の1をAIなしでは不可能であると評価した。
さらに印象的なことに、エージェントはしばしば方法の提案と修正の実施をし、一方で人間は最終決定の大半を保持し、判断とフィードバックを通じて探索を指導する。
これらの観察は、課題レベルの実行からプロジェクトレベルのパートナーシップへのシフトを示しており、人間の努力は、追求に値するもの、証拠がどのように研究を導くべきかに集中している。
したがって、より自律的なAI研究への進歩は、発見の能力と有意義な人間の監視能力の両方を前進させ、継続的な開発のリスクと方向性に対する説明責任のある人間の権威を維持する必要がある。
関連論文リスト
- When Does AI Augment Work? A Workflow-Level Framework for Human-Agent Collaboration [78.16115745870405]
職場における人工知能の価値を特徴付けることを目的としている。
現在の研究は、この価値を、現在の自動化能力とAIの公的な採用の観点から大きく測定している。
これを考慮するためには、今日の微粒化タスクを超えて分析の範囲を広げなければならない。
論文 参考訳(メタデータ) (2026-09-11T06:29:34Z) - Benchmarking AI Agents for Addressing Scientific Challenges Across Scales [118.2204632627895]
SciAgentArenaは、現実世界の科学研究シナリオでAIエージェントを評価するための体系的なベンチマークである。
ステップワイズ検証を備えた約200のタスクと、多様なAIエージェントを評価するためのインタラクティブでエージェントに依存しない環境で構成される。
タスク構造や評価基準が明確である場合, 現状のエージェントはデータ分析に効果的に貢献できることがわかった。
論文 参考訳(メタデータ) (2026-06-10T22:55:30Z) - Act As a Real Researcher: A Suite of Benchmarks Evaluating Frontier LLMs and Agentic Harnesses in Research Lifecycle [16.040691949938203]
AARR(Act as a Real Researcher)ベンチマークシリーズを提案する。
AARRは、エージェントが人間の研究者を特徴づけるプロフェッショナル主義、徹底性、ニュアンスな推論をエミュレートできるかどうかに焦点を当てている。
我々の研究結果は、研究者のようなAIを開発するには、さらなる研究行動の探索が必要であることを示唆している。
論文 参考訳(メタデータ) (2026-06-05T17:13:36Z) - SciMaster: Towards General-Purpose Scientific AI Agents, Part I. X-Master as Foundation: Can We Lead on Humanity's Last Exam? [51.112225746095746]
本稿では,人間研究者をエミュレートするツール強化推論エージェントであるX-Masterを紹介する。
XマスターズはHumanity's Last Examに32.1%のスコアで最新記録を樹立した。
論文 参考訳(メタデータ) (2025-07-07T17:50:52Z) - Collaborative Gym: A Framework for Enabling and Evaluating Human-Agent Collaboration [50.657070334404835]
Collaborative Gymは、エージェント、人間、タスク環境間の非同期で三分割的なインタラクションを可能にするフレームワークである。
シミュレーション条件と実環境条件の両方において,Co-Gymを3つの代表的なタスクでインスタンス化する。
その結果、協調作業員はタスクパフォーマンスにおいて、完全に自律的なエージェントよりも一貫して優れていたことが判明した。
論文 参考訳(メタデータ) (2024-12-20T09:21:15Z) - ML Research Benchmark [0.0]
MLRB(ML Research Benchmark)は,最近の機械学習カンファレンスのトラックから派生した7つの競合レベルタスクからなる。
本稿では,Claude-3 や GPT-4o などのフロンティアモデルを用いたエージェント足場を用いて,新しいベンチマークを提案し,評価する。
結果は、Claude-3.5 Sonnetエージェントがベンチマーク全体で最高のパフォーマンスを示し、機械学習モデルの設計と開発に優れていたことを示唆している。
論文 参考訳(メタデータ) (2024-10-29T21:38:42Z) - Human-AI Collaboration: The Effect of AI Delegation on Human Task
Performance and Task Satisfaction [0.0]
タスク性能とタスク満足度はAIデリゲートによって向上することを示す。
我々は、これらの改善の基盤となるメカニズムとして、人間による自己効力の増大を見いだした。
我々の発見は、AIモデルがより多くの管理責任を引き継ぐことが、人間とAIのコラボレーションの効果的な形態であることを示す最初の証拠を提供する。
論文 参考訳(メタデータ) (2023-03-16T11:02:46Z) - Watch-And-Help: A Challenge for Social Perception and Human-AI
Collaboration [116.28433607265573]
我々は、AIエージェントでソーシャルインテリジェンスをテストするための課題であるWatch-And-Help(WAH)を紹介する。
WAHでは、AIエージェントは、人間のようなエージェントが複雑な家庭用タスクを効率的に実行するのを助ける必要がある。
マルチエージェントの家庭環境であるVirtualHome-Socialを構築し、計画と学習ベースのベースラインを含むベンチマークを提供する。
論文 参考訳(メタデータ) (2020-10-19T21:48:31Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。