論文の概要: Scientific Agent Skills: A Library of Procedural Knowledge for Research Agents
- arxiv url: http://arxiv.org/abs/2609.00065v2
- Date: Wed, 02 Sep 2026 21:50:40 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-04 13:51:58.208545
- Title: Scientific Agent Skills: A Library of Procedural Knowledge for Research Agents
- Title(参考訳): 科学エージェントスキル:研究エージェントのための手続き的知識のライブラリー
- Abstract要約: 科学エージェントスキル(Scientific Agent Skills)は、16の領域で163の手順のオープンライブラリである。
各スキルは、バージョン管理されたヒューマン可読な命令ファイルを中心に構築されたディレクトリである。
ドキュメントコーパスの2つの特性を測る。163スキルの常駐記述は、20万のウィンドウの7.1%、ドキュメントワークフローの中央値は23.9%である。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: A language-model agent asked to analyse an experiment will usually return working code. Whether the analysis is defensible is a different question. A defensible analysis depends on procedural choices: which test the field accepts, which identifier namespace is authoritative, and which caveats must accompany a result. We present Scientific Agent Skills, an open library of 163 such procedures in 16 areas of practice, including genomics, cheminformatics, medical imaging, study design and scientific communication. Each skill is a directory built around a versioned, human-readable instruction file. An agent loads the file only when a task calls for it; the directory often also contains reference material and runnable scripts. We report no task-level evaluation and no host selection rate. We measure two properties of the documentation corpus: the always-resident descriptions of all 163 skills cost 7.1% of a 200,000-token window, and the median documented workflow fits within 23.9% of it, although 29 of 46 would overflow if every reference file were loaded. Openly licensed and available at https://github.com/K-Dense-AI/scientific-agent-skills.
- Abstract(参考訳): 実験の分析を依頼された言語モデルエージェントは、通常、動作するコードを返す。
分析が検証可能であるかどうかは別の問題である。
決定可能な分析は手続き的選択に依存し、どのフィールドが受け入れられるか、どの識別子の名前空間が権威的であるか、どの注意事項が結果に付随しなければならないか、などである。
我々は16の領域で163の手順のオープンライブラリーであるScientific Agent Skillsを公開し、その中にはゲノム学、化学情報学、医用画像、研究デザイン、科学コミュニケーションなどが含まれる。
各スキルは、バージョン管理されたヒューマン可読な命令ファイルを中心に構築されたディレクトリである。
エージェントはタスクがそれを呼び出すときだけファイルを読み込む。ディレクトリには参照材料や実行可能なスクリプトも含まれている。
タスクレベルの評価は行わず、ホストの選択も行わない。
ドキュメントコーパスの2つの特性を測定する: すべての163スキルの常駐記述は、20万トーケンウィンドウの7.1%、中央ドキュメントワークフローはその23.9%に収まるが、すべての参照ファイルがロードされた場合、46のうち29がオーバーフローする。
Openly License and available at https://github.com/K-Dense-AI/scientific-agent-skills.com
関連論文リスト
- Do Context Files Help Coding Agents? A Two-Agent Ablation Study on Real Repositories [0.0]
永続コンテキストファイル(AGENTS.md, CLAUDE.md)は、AIコーディングエージェントを誘導する標準的な慣行であるが、それらの効果の証拠は矛盾している。
我々は2つのフロンティアエージェント(Claude Code と Codex)間のコンテキスト注入戦略の制御されたアブレーションを示す。
論文 参考訳(メタデータ) (2026-07-28T11:07:53Z) - Authoring Agent Skills: A Software-Engineering Approach [1.3774017060585184]
Agent Skillsは、エージェントが要求に応じてロードする再利用可能な手続き的知識を備えた、大規模な言語モデルエージェントを拡張する新しい方法である。
AnthropicはAgens Skillsを導入し、いくつかのエージェントツールでサポートされているオープン仕様としてフォーマットを公開した。
このメモは、スキルはソフトウェアアーチファクトであり、その構築はソフトウェアエンジニアリングの原則に従うべきであると主張している。
論文 参考訳(メタデータ) (2026-07-27T19:43:41Z) - ToFu: A White-Box, Token-Efficient Agent Harness for Researchers [73.72929185946842]
ToFuは、ファイルを読み、ファイルを編集し、コマンドを実行し、開発ツールと統合する研究者のためのエージェントハーネスだ。
研究助手として、より優れたトークン効率、低コスト、多言語能力で実践的な研究を支援する。
研究対象として、ToFuはホワイトボックスのエージェントハーネスを提供しており、研究者はオーケストレーションロジック、ツール使用の振る舞い、デザインを検査、修正、評価することができる。
論文 参考訳(メタデータ) (2026-07-13T11:26:06Z) - Benchmarking AI Agents for Addressing Scientific Challenges Across Scales [118.2204632627895]
SciAgentArenaは、現実世界の科学研究シナリオでAIエージェントを評価するための体系的なベンチマークである。
ステップワイズ検証を備えた約200のタスクと、多様なAIエージェントを評価するためのインタラクティブでエージェントに依存しない環境で構成される。
タスク構造や評価基準が明確である場合, 現状のエージェントはデータ分析に効果的に貢献できることがわかった。
論文 参考訳(メタデータ) (2026-06-10T22:55:30Z) - How to Interpret Agent Behavior [56.59836196946289]
本稿では,エージェントの動作を実行時に記述・解析するための分類法であるACT*ONOMYを紹介する。
共用語彙を提供することで、ACT*ONOMYは研究者、エージェントデザイナー、エンドユーザーがエージェントの振る舞いをより一貫して解釈するのに役立つ。
論文 参考訳(メタデータ) (2026-05-13T14:52:40Z) - Can Coding Agents Reproduce Findings in Computational Materials Science? [49.254975563645786]
本稿では,大規模言語モデルの科学的主張を再現する能力を評価するためのベンチマークであるAutoMatを紹介する。
課題を専門とする専門家と緊密に連携することで、実際の材料科学論文からの一連の主張をキュレートし、コーディングエージェントがエンドツーエンドのワークフローを回復し実行できるかどうかを検証します。
結果、現在のLSMベースのエージェントはAutoMatの全体的な成功率を低くし、最も優れた設定は54.1%に過ぎなかった。
論文 参考訳(メタデータ) (2026-05-01T17:42:12Z) - PaperSearchQA: Learning to Search and Reason over Scientific Papers with RLVR [64.22412492998754]
我々は,1600万件のバイオメディカルペーパーを要約した検索コーパスを公開し,PaperSearchQAと呼ばれるファクトイックなQAデータセットを構築した。
我々は,この環境における検索エージェントを訓練し,非RL検索ベースラインを上回ります。
我々のデータ生成方法はスケーラブルで、他の科学領域にも容易に拡張できます。
論文 参考訳(メタデータ) (2026-01-26T06:46:16Z) - PaperArena: An Evaluation Benchmark for Tool-Augmented Agentic Reasoning on Scientific Literature [11.804526152911386]
本研究では,大規模言語モデル(LLM)に基づくエージェントの評価ベンチマークであるPaperArenaを提案する。
研究上の疑問から、エージェントは推論や適切なツールとのインタラクションを通じて、複数の論文にまたがる多様なフォーマットを統合する必要がある。
実験の結果、高度に確立されたエージェントを駆動する最も先進的なLCMでさえ、平均精度は38.78%に過ぎなかった。
論文 参考訳(メタデータ) (2025-10-13T02:10:39Z) - Agent-Testing Agent: A Meta-Agent for Automated Testing and Evaluation of Conversational AI Agents [2.3429263075112288]
本稿では,静的コード解析,デザイナの尋問,文献マイニング,ペルソナ駆動の対人テスト生成を組み合わせたメタエージェントであるAgent-Testing Agent(ATA)を提案する。
各対話はLLM-as-a-Judge (LAAJ)ルーブリックでスコアされ、その後の試験をエージェントの最も弱い能力に向けて操るために使用される。
論文 参考訳(メタデータ) (2025-08-24T15:02:13Z) - Agents: An Open-source Framework for Autonomous Language Agents [98.91085725608917]
我々は、言語エージェントを人工知能への有望な方向と見なしている。
Agentsはオープンソースライブラリで、これらの進歩を広く非専門的な聴衆に開放することを目的としています。
論文 参考訳(メタデータ) (2023-09-14T17:18:25Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。