論文の概要: Artifact-centered Claim-aware Observability for Autonomous Scientific Agents
- arxiv url: http://arxiv.org/abs/2608.18312v1
- Date: Tue, 18 Aug 2026 20:47:24 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-20 20:13:55.207043
- Title: Artifact-centered Claim-aware Observability for Autonomous Scientific Agents
- Title(参考訳): 人工物中心のクレームを意識した自律型科学エージェントの観測可能性
- Abstract要約: 本研究では,個人,オペレータ,フィットネスレコード,系統,アーカイブ,ラン,ストリーム,ステアリングコマンドを中心に構成されたコンパクトな可観測性プロファイルを提案する。
プロファイルは、現在のテレメトリとプロファイランス標準を補完するセマンティックレイヤとして意図されている。
- 参考スコア(独自算出の注目度): 4.403170275941483
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Autonomous scientific agents now increasingly propose ideas, write code, run experiments, analyze results, and even draft papers. Observe and audit those agents are necessary but logging every model call is not enough, scientists also need to inspect the artifacts and claims that the systems produced and their relations. This is driven by the fact that failures in scientific agent systems are often distributed across several objects. A manuscript claim may cite the wrong evidence, a search process may select a degenerate candidate, a laboratory novelty claim may depend on an unstated rule, or a multi-agent plan may change without a visible trigger. Existing tracing, experiment tracking, and archival provenance tools are valuable, but their native objects do not make these scientific audit relations first-class. We argue that autonomous scientific systems should emit portable, claim-aware artifact lineage as a minimum audit layer. We propose a compact observability profile organized around individuals, operators, fitness records, lineage, archives, runs, streams, and steering commands. In this profile, scientific claims are ordinary individuals with explicit evidence bindings and verification records. The profile is intended as a semantic layer that complements current telemetry and provenance standards. Execution details can remain in OpenTelemetry. Final packages can export to PROV-O or RO-Crate standards.
- Abstract(参考訳): 自律的な科学エージェントは、アイデアを提案し、コードを書き、実験を実行し、結果を分析し、論文を起草する。
これらのエージェントを観察し、監査することは必要だが、すべてのモデルコールをロギングするだけでは十分ではない。
これは、科学的エージェントシステムの故障が、しばしば複数のオブジェクトに分散しているという事実によって引き起こされる。
原稿のクレームは、間違った証拠を引用し、捜索プロセスは、退行した候補を選択し、実験室の新規性クレームは、未定の規則に依存するか、または、可視的なトリガーなしで、マルチエージェントプランを変更することができる。
既存の追跡、実験追跡、考古学的証明ツールは価値があるが、それらのネイティブオブジェクトはこれらの科学的監査関係を第一級にしない。
自律的な科学システムは、最小監査層として、ポータブルでクレーム対応のアーティファクトを出力すべきである、と我々は主張する。
本研究では,個人,オペレータ,フィットネスレコード,系統,アーカイブ,ラン,ストリーム,ステアリングコマンドを中心に構成されたコンパクトな可観測性プロファイルを提案する。
このプロファイルでは、科学的主張は、明確な証拠拘束と検証記録を持つ普通の個人である。
プロファイルは、現在のテレメトリとプロファイランス標準を補完するセマンティックレイヤとして意図されている。
実行の詳細はOpenTelemetryに残すことができる。
最終パッケージは PROV-O または RO-Crate 標準にエクスポートできる。
関連論文リスト
- EarthVerse: Benchmarking Scientific Agents Across Dynamic Earth Systems and Natural Hazards [73.12811119273206]
我々は,包括的調査を通じて科学的エージェントを評価するベンチマークであるEarthVerseを紹介する。
エージェントは異種イベントパッケージを検査し、互換性のあるエビデンスを選択し、透過的な計算を実行し、ソース差を調整し、最終回答で証明を保存する。
システム全体では、平均回答ユニットの精度は84.65%であり、最も高いStrict@95は34.81%である。
論文 参考訳(メタデータ) (2026-08-24T17:29:16Z) - SciForge: An AI-Native, Multimodal Workbench for Scientific Discovery [48.99744520105086]
SciForgeはマルチモーダルな研究ネイティブAIワークベンチである。
検索、解析、モデルルーティング、ワークフローの実行、プロット、書き込み、プレゼンテーション生成がモジュラーエージェントアクセス可能なサービスとして実行される間、人間の判断のためにグラフィカルインターフェースを予約する。
論文 参考訳(メタデータ) (2026-07-17T15:13:03Z) - XScientist: A Git-Like Research Protocol for Long-Running Autonomous Scientific Discovery [1.1923076571060318]
XScientistは、自律的な研究システムのためのgitライクな研究プロトコルとオペレーティングシステムである。
アイデア生成、実験実行、原稿のドラフト、自己レビュー、修復、品質保証、デーモンスケジューリング、アーティファクトを、継続的に監視可能なパイプラインとしてオーケストレーションする。
Agent-Native Research Artifactプロトコルをエクスポートし、探索DAG、ノード毎のコードと出力、クレーム・ツー・エビデンス・アンカー、コンテンツハッシュ、証明、再実行フックを記録する。
論文 参考訳(メタデータ) (2026-07-14T03:20:11Z) - Rethinking Scientific Discovery in the Agentic Era [69.85050591628048]
SCIONは、Textbfの組織ネクサスとして機能するエージェント科学オペレーティングシステムである。
中心となるのは textbfResearch Execution Plan (REP) であり、これは高いレベルの科学的意図をステージ化された目的、依存関係、検証チェックポイント、ツール要件、期待される成果物、フォールバック条件にコンパイルする。
SCION 下での発見を textbfTarget- Conditioned Inverse Search として定式化し,有限実験予算下でのバッチ能動探索により隠れターゲット設定に拡張する。
論文 参考訳(メタデータ) (2026-07-04T13:09:33Z) - Position: Correct Answer, Wrong Mechanism -- When AI Scientists Defend General Claims Their Own Data Contradicts [0.0]
コーディングエージェントは信頼できるツールを証明しているが、オープンエンドのクレーム作成のための信頼性の低い科学的共著者である。
一段階の体制シフトチェックは、エージェントのクレームのみを必要とし、過度に一般化されたケースにフラグを付ける。
コンパニオン再計算は、正しいオブザーバブルがわかっている場合の残りのケースをフラグする。
論文 参考訳(メタデータ) (2026-06-22T11:14:07Z) - The Age of AI Agents Demands A New Scientific Paradigm To Sustain Trustworthy Science [0.0]
科学は、これまでピアレビューで行ったように、検証インフラストラクチャを進化させなければならない、と我々は主張する。
本稿では,可観測性検証,スケーラブルな結果,明確な帰属性を重視した適応型検証インフラの基準を提案する。
論文 参考訳(メタデータ) (2026-06-18T20:38:50Z) - Externalizing Research Synthesis and Validation in AI Scientists through a Research Harness [22.631467433443362]
Xcientistは、研究合成と実験的検証を検査可能な契約統治プロセスに外部化する研究ハーネスである。
Xcientistの文献は、証拠、アイデアステート、実装計画、アブレーション記録、修復痕跡を永続的な研究成果として整理している。
論文 参考訳(メタデータ) (2026-06-17T09:52:14Z) - The Last Human-Written Paper: Agent-Native Research Artifacts [106.47848184955576]
本稿では,物語紙を機械処理可能な研究パッケージに置き換えるプロトコルであるAgent-Native Research Artifact(ARA)を紹介する。
通常の開発において決定と終了をキャプチャするLive Research Manager、レガシPDFとリポジトリをARAに変換するARAコンパイラ、人間レビュアーが重要性、ノベルティ、味にフォーカスできるように客観的チェックを自動化するARAネイティブレビューシステムである。
論文 参考訳(メタデータ) (2026-04-27T16:23:09Z) - CiteAudit: You Cited It, But Did You Read It? A Benchmark for Verifying Scientific References in the LLM Era [51.63024682584688]
大規模言語モデル (LLM) は新たなリスクを導入している。
本稿では,科学文献における幻覚的引用のための総合的なベンチマークおよび検出フレームワークについて紹介する。
我々のフレームワークは、精度と解釈可能性の両方において、先行手法を著しく上回っている。
論文 参考訳(メタデータ) (2026-02-26T19:17:39Z) - Bohrium + SciMaster: Building the Infrastructure and Ecosystem for Agentic Science at Scale [82.20980951765891]
エージェントサイエンスのスケーリングにはインフラストラクチャ・アンド・エコシステムアプローチが必要である,と我々は主張する。
BohriumはAI4S資産のマネージドでトレース可能なハブとして機能し、多様な科学データ、ソフトウェア、計算、実験室のシステムをエージェント対応の能力に変換する。
SciMasterはこれらの機能を長い水平科学に編成し、科学エージェントを合成して実行することができる。
論文 参考訳(メタデータ) (2025-12-23T16:04:41Z) - RerrFact: Reduced Evidence Retrieval Representations for Scientific
Claim Verification [4.052777228128475]
本稿では,各予測サブタスクに対して連続的に二項分類を行うモジュラー手法を提案する。
我々は、まず非関連な有理を区別し、与えられた主張に対する支持または反証する有理を識別する2段階のスタンス予測を行う。
実験的に、我々のシステムRerrFactは微調整もシンプルな設計もせず、モデルパラメータのごく一部はリーダーボード上で競争的に公正である。
論文 参考訳(メタデータ) (2022-02-05T21:52:45Z) - Fact or Fiction: Verifying Scientific Claims [53.29101835904273]
本稿では,研究文献から,REFUTESやREFUTESが与えられた科学的主張であることを示す証拠を含む抄録を抽出する新たな課題である,科学的クレーム検証を紹介する。
SciFactは、1.4Kの専門家による科学的主張と、ラベルや合理性に注釈を付けたエビデンスを含む抽象概念を組み合わせたデータセットである。
このシステムは,CORD-19コーパスの証拠を同定することにより,新型コロナウイルス関連クレームを検証可能であることを示す。
論文 参考訳(メタデータ) (2020-04-30T17:22:57Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。