論文の概要: The Last Human-Written Paper: Agent-Native Research Artifacts
- arxiv url: http://arxiv.org/abs/2604.24658v1
- Date: Mon, 27 Apr 2026 16:23:09 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-28 17:12:08.157741
- Title: The Last Human-Written Paper: Agent-Native Research Artifacts
- Title(参考訳): 人文科学最後の論文 : エージェント・Native Research Artifacts (特集 エージェント・Native Research Artifacts)
- Abstract要約: 本稿では,物語紙を機械処理可能な研究パッケージに置き換えるプロトコルであるAra(Agent-Native Research Artifact)を紹介する。
通常の開発中に意思決定と終了をキャプチャするLive Research Manager,レガシPDFとリポジトリをArasに変換するAraコンパイラ,客観的チェックを自動化するAraネイティブレビューシステムという,3つのメカニズムがエコシステムをサポートする。
- 参考スコア(独自算出の注目度): 100.9880949338206
- License: http://creativecommons.org/publicdomain/zero/1.0/
- Abstract: Scientific publication compresses a branching, iterative research process into a linear narrative, discarding the majority of what was discovered along the way. This compilation imposes two structural costs: a Storytelling Tax, where failed experiments, rejected hypotheses, and the branching exploration process are discarded to fit a linear narrative; and an Engineering Tax, where the gap between reviewer-sufficient prose and agent-sufficient specification leaves critical implementation details unwritten. Tolerable for human readers, these costs become critical when AI agents must understand, reproduce, and extend published work. We introduce the Agent-Native Research Artifact (Ara), a protocol that replaces the narrative paper with a machine-executable research package structured around four layers: scientific logic, executable code with full specifications, an exploration graph that preserves the failures compilation discards, and evidence grounding every claim in raw outputs. Three mechanisms support the ecosystem: a Live Research Manager that captures decisions and dead ends during ordinary development; an Ara Compiler that translates legacy PDFs and repos into Aras; and an Ara-native review system that automates objective checks so human reviewers can focus on significance, novelty, and taste. On PaperBench and RE-Bench, Ara raises question-answering accuracy from 72.4% to 93.7% and reproduction success from 57.4% to 64.4%. On RE-Bench's five open-ended extension tasks, preserved failure traces in Ara accelerate progress, but can also constrain a capable agent from stepping outside the prior-run box depending on the agent's capabilities.
- Abstract(参考訳): 科学出版物は枝分かれした反復的な研究プロセスを線形な物語に圧縮し、途中で発見されたものの大半を捨てる。
このコンパイルは、2つの構造的コストを課している: 実験が失敗し、仮説が却下されたストーリーテリング税と、分岐探索プロセスが線形な物語に適合するように破棄されたエンジニアリング税。
人間の読者には耐えられるが、これらのコストはAIエージェントが公開作品を理解し、再現し、拡張する必要があるときに重要になる。
本稿では,Ara(Agent-Native Research Artifact)という,論文を機械処理可能な研究パッケージに置き換えるプロトコルを紹介した。
通常の開発中に意思決定と終了をキャプチャするLive Research Manager,レガシPDFとリポジトリをArasに変換するAraコンパイラ,客観的チェックを自動化するAraネイティブレビューシステムという,3つのメカニズムがエコシステムをサポートする。
PaperBenchとRe-Benchでは、質問応答精度を72.4%から93.7%に引き上げ、再現成功率を57.4%から64.4%に引き上げている。
RE-Benchの5つのオープンエンド拡張タスクでは、Araで保存された障害トレースが進行を加速するが、エージェントの能力に応じて、有能なエージェントが事前実行ボックスの外に足を踏み入れることを制限することもできる。
関連論文リスト
- OpenAI4S: Code as Action, Science as Sessions [57.428071188574]
我々は、emphCode as Action, Science as Sessionsという原則に基づいて構築されたオープンソースの科学研究エージェントOpenAI4Sを紹介する。
OpenAI4Sは、永続化コンピューティングランタイムとリサーチセッション管理オーケストレーションを組み合わせることで、構造化されたツールコールによって処理される。
再合成, 分子タンパク質結合体設計, タンパク質変異, 触媒スクリーニング, ミネラルスペクトロスコピーを含む36種類の研究シナリオにおけるOpenAI4Sの評価を行った。
論文 参考訳(メタデータ) (2026-09-14T06:16:59Z) - Who is the Agent to Blame? Localizing Faithfulness and Citation Mistakes in Agentic Deep Research [75.8770212601511]
ディープリサーチ(DR)システムは、Webから情報を検索して合成する複数のエージェントを編成することで、長い形式の引用レポートを生成する。
循環はこれらの報告の忠実さを評価するための主要なメカニズムであるが、現在のDRシステムでは引用のリコールが不十分である。
そこで本稿では,エージェントが各エラーをローカルにテストすることで,各エラーをピンポイントで検出する手法を提案する。
論文 参考訳(メタデータ) (2026-08-25T09:34:18Z) - Apodex Discovery: Reality Benchmarks and Environments for Evaluating and Building Discoverative Artificial Intelligence [86.61561123749011]
Apodex Discovery(アポデックスディスカバリー)は、重度解法を用いて発見的AIを構築し評価するためのフレームワークである。
まず16のセクターで511の業界を調査し、423の高価値現実問題を集め、最初のリリースで20を選定した。
第二に、共通の環境-タスク-エピソード抽象化は、データ、ツール、制約、フィードバック、軌跡記録、中間成果物と最終提出物の検証を提供する。
論文 参考訳(メタデータ) (2026-08-11T18:48:40Z) - Can AI agents conduct open-ended AI research? Early evidence from two case studies [16.75408134467252]
エージェントがオープンエンドAI研究を実行できるかどうかの証拠は薄い。
現在の評価では、オープンエンドの調査を除外する狭いタスクでテストエージェントをテストするか、あるいは盲目のピアレビューにAI生成論文を提出する。
我々は、AI R&D自動化に向けた進歩を測定するための第3の方法を紹介します。
論文 参考訳(メタデータ) (2026-07-29T17:57:19Z) - ReproRepo: Scaling Reproducibility Audits with GitHub Repository Issues [54.98461672730087]
ReproRepoは、人為的なGitHub問題を活用するスケーラブルな評価フレームワークで、現実的な再現ブロッカーを自然に監視する。
ReproRepoは、大規模なカンファレンスから1,149件の機械学習論文をインスタンス化し、4つのフロンティアモデルエージェント構成を評価します。
その結果, LLMエージェントは, コードを実行せずにも, 紙とリポジトリのペアから多くの実世界の問題を識別できることがわかった。
論文 参考訳(メタデータ) (2026-06-16T17:58:05Z) - ResearchLoop: An Evidence-Gated Control Plane for AI-Assisted Research [4.9833735627186435]
ResearchLoopはAI支援型計算研究のためのエビデンス付き制御プレーンである。
ResearchLoopは、リサーチ質問、タスク契約、エビデンスオブジェクト、クレーム台帳、クローズアウト、ペーパーバインディングを耐久性のあるプロジェクトステートとして扱う。
この技術レポートは、完全なプロトコル仕様、状態モデル、トランジションルール、クレーム・アドミッション・アルゴリズム、インサイト・コンポーティングメカニズムを提供する。
論文 参考訳(メタデータ) (2026-05-27T10:29:00Z) - AI for Auto-Research: Roadmap & User Guide [107.0834449839233]
研究ライフサイクル全体にわたってAIをエンドツーエンドに分析する。
我々は、信頼できる援助と信頼できない自律性の間に、鋭くステージに依存した境界を特定できる。
障害モードを排除するのではなく、より大きな自動化が不明瞭であることが示されています。
論文 参考訳(メタデータ) (2026-05-18T17:08:26Z) - ARIS: Autonomous Research via Adversarial Multi-Agent Collaboration [10.076972559007116]
ARIS(Auto-Research-in-sleep)は、自律的な研究のためのオープンソースの研究ハーネスである。
ARISは、クロスモデル対外コラボレーションを通じて機械学習の研究を調整する。
論文 参考訳(メタデータ) (2026-05-04T18:10:15Z) - PRBench: End-to-end Paper Reproduction in Physics Research [32.672534450424386]
PRBenchは、11のサブフィールドにまたがる30の専門家によるタスクのベンチマークである。
エージェントは、タスク命令と紙の内容のみを提供し、サンドボックス実行環境で動作させる。
PRBench上の符号化エージェントのセットを評価し,科学的推論と実行の重要な側面にわたってそれらの能力を分析する。
論文 参考訳(メタデータ) (2026-03-29T11:44:57Z) - AI-Supervisor: Autonomous AI Research Supervision via a Persistent Research World Model [1.14219428942199]
既存の自動研究システムは、ステートレスでリニアなパイプラインとして動作する。
マルチエージェントオーケストレーションフレームワークである textbfAI-Supervisor を提案する。
エージェントは、人間の関心によって駆動されるエンドツーエンドのAI研究の監督を提供する。
論文 参考訳(メタデータ) (2026-03-25T15:16:51Z) - NoveltyAgent: Autonomous Novelty Reporting Agent with Point-wise Novelty Analysis and Self-Validation [34.18769961207746]
包括的で忠実なノベルティレポートを生成するために設計されたマルチエージェントシステムであるNovetyAgentを紹介する。
写本を細かな検索と比較のために離散的な新規点に分解し、総合的な関連論文データベースを構築する。
実験の結果、NovetyAgentは最先端のパフォーマンスを達成し、GPT-5 DeepResearchを10.15%上回った。
論文 参考訳(メタデータ) (2026-03-21T17:19:11Z) - AgentIR: Reasoning-Aware Retrieval for Deep Research Agents [76.29382561831105]
ディープリサーチエージェントは、各検索の前に明示的な自然言語推論を生成する。
Reasoning-Aware Retrievalは、クエリと一緒にエージェントの推論トレースを埋め込む。
DR-Synthは、標準的なQAデータセットからDeep Researchレトリバーのトレーニングデータを生成する。
AgentIR-4Bは、オープンウェイトエージェントであるTongyi-DeepResearchで68%の精度を達成する。
論文 参考訳(メタデータ) (2026-03-04T18:47:26Z) - FlyAOC: Evaluating Agentic Ontology Curation of Drosophila Scientific Knowledge Bases [10.00386797940562]
本研究では,FlyBenchを用いて,エンドツーエンドのエージェントキュレーションにおけるAIエージェントの評価を行う。
遺伝子記号のみが与えられた場合、エージェントは構造化アノテーションを生成するために16,898のフルテキスト文書のコーパスを検索して読み込まなければならない。
このベンチマークには、FlyBaseから引き出された100の遺伝子にまたがる、専門家による7,397のアノテーションが含まれている。
論文 参考訳(メタデータ) (2026-02-09T20:12:38Z) - WebWeaver: Structuring Web-Scale Evidence with Dynamic Outlines for Open-Ended Deep Research [73.58638285105971]
本稿では,AIエージェントが膨大なWebスケール情報を洞察に富むレポートに合成しなければならない複雑な課題であるtextbfopen-ended Deep Research (OEDR) に取り組む。
人間の研究プロセスをエミュレートする新しいデュアルエージェントフレームワークである textbfWebWeaver を紹介する。
私たちのフレームワークは、DeepResearch Bench、DeepConsult、DeepResearchGymなど、主要なOEDRベンチマークにまたがる最先端の新たなベンチマークを確立しています。
論文 参考訳(メタデータ) (2025-09-16T17:57:21Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。