論文の概要: Qiushi Engine on AstaBench E2E-Bench-Hard
- arxiv url: http://arxiv.org/abs/2609.08196v1
- Date: Tue, 08 Sep 2026 03:30:59 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-10 19:44:08.567727
- Title: Qiushi Engine on AstaBench E2E-Bench-Hard
- Title(参考訳): AstaBench E2E-Bench-Hard上のQiushiエンジン
- Abstract要約: レポートは、AstaBench E2E-Bench-Hardの40のテストタスクすべてでQiushi Engine v0.8を分析している。
このベンチマークでは、試験的な設計、コード実装、実際の実行、結果分析、レポート配信を通じて、自律的なエージェントが研究の質問を行う必要がある。
- 参考スコア(独自算出の注目度): 17.36807692618427
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: This report analyzes Qiushi Engine v0.8 across all 40 test tasks in AstaBench E2E-Bench-Hard, a benchmark that requires autonomous agents to carry a research question through experimental design, code implementation, actual execution, result analysis, and report delivery. Qiushi Engine is model-configurable; this evaluation selected DeepSeek deepseek-v4pro-preview as the model backend. The official AstaBench leaderboard records a score of 0.816 and an average benchmark cost of USD 15.209 per task, while the full-precision local recomputation is $81.59 \pm 1.87$. Four tasks satisfied every rubric item, yielding a full-task completion rate of 4/40 = 10% -- 7 percentage points above, and about 3.3 times, the approximately 3% best rate reported for AstaBench's official agents. Across 507 required rubric items, 416 were satisfied (82.1%). Official scoring archives and 40 Meta-Trace records show sustained production and verification of reports, code, and experimental artifacts; the principal gaps lie in repeated runs, external dependencies, specified metrics, and ablation studies. The report explains the benchmark, system workflow, aggregate results, representative cases, and limits of interpretation.
- Abstract(参考訳): 本報告では,AstaBench E2E-Bench-Hardの40のテストタスクすべてを対象に,Qiushi Engine v0.8を解析する。
この評価ではモデルバックエンドとしてDeepSeek Deepseek-v4pro-previewを選択した。
公式のAstaBenchリーダーボードは0.816点、平均ベンチマークコストは1タスクあたり15.209点であり、完全精度の局所再計算は81.59 \pm 1.87$である。
4つのタスクはすべてのルーブリックアイテムを満足させ、全タスク完了率は4/40 = 10% -- 7 % -- となり、アスタベンチの公式エージェントの報告した3%のベストレートが約3.3倍となった。
507点中416点(82.1%)が要求された。
公式のスコアリングアーカイブと40のMeta-Traceレコードは、レポート、コード、実験的なアーティファクトの生産と検証を継続している。
レポートでは、ベンチマーク、システムワークフロー、集計結果、代表例、解釈の制限について説明している。
関連論文リスト
- xDailyBench: Benchmarking LLMs on Professional Consultation for Real-Life Problems [57.62172039072062]
xDailyBenchは、個人生活、ホワイトカラーワーク、学習と研究、ドメイン横断アクティビティなど、51のシナリオにまたがる248の慎重にキュレートされたタスクのベンチマークである。
これらのタスクは、ユーザがAIで実際に完了した、あるいは真に達成することを意図した要求に基づいており、明示的な要件と暗黙的な要件の両方をカバーする、きめ細かいバイナリルーブリックで評価される。
最高のモデルではタスクレベルのスコアが75.6%に達し、すべてのモデルは明示的な要件よりも暗黙的にパフォーマンスが悪く、ギャップは9ポイント以下である。
論文 参考訳(メタデータ) (2026-09-07T17:30:58Z) - Harbor Adapters and Harbor-Index: Infrastructure and a Curated Meta-Dataset for Large-Scale Agentic Evaluation [133.5424034560943]
任意のエージェントを評価するために80以上のベンチマークを移植するベンチマークアダプタを開発した。
54のベンチマークで,機能レベルにまたがる8モデルの大規模評価を行う。
私たちは29のベンチマークにまたがる82の難易度、多様性、高品質なタスクをキュレートしたHarbor-Indexを紹介します。
論文 参考訳(メタデータ) (2026-09-03T16:26:20Z) - WorkSurface-Bench: Benchmarking Enterprise Agents on Multi-Surface Knowledge Routing [10.956110208321556]
我々は、この機能を表面ルーティングとして評価するためのベンチマークであるWorkSurface-Benchを紹介した。
これは、ペルソナスコープワークスペース-ベンチライトワークスペースから派生した1,151のアトミックタスクを含んでいる。
我々は、6つの制御されたエージェント設定で4つのモデルバックボーンを評価し、27,624個のプロトコルエラーフリーなトラジェクトリを得た。
論文 参考訳(メタデータ) (2026-07-28T14:19:59Z) - InvestPhilBench: A Multi-Layer Dynamic Benchmark for Evaluating Large Language Model Procedural Reasoning in Expert Investment Philosophy [0.9924185669370708]
InvestPhilBenchは8つの認知層にまたがる動的ベンチマークである。
v0.6リリースには118のプライマリソース認証投資原則カードが含まれている。
大規模な再現可能なスコア付けには、Benchmark Automated Scoring Pipelineを紹介します。
論文 参考訳(メタデータ) (2026-06-24T15:53:20Z) - Asuka-Bench: Benchmarking Code Agents on Underspecified User Intent and Multi-Round Refinement [45.813104201414326]
マルチラウンドリファインメントと不特定ユーザ意図を組み合わせたベンチマークであるAuka-Benchを提示する。
ベンチマークは、Webタスク50、評価基準784、予測結果2402からなる。
最強のモデルでさえ、3ラウンドの後にプロジェクトの52%しか完了していない。
論文 参考訳(メタデータ) (2026-06-04T09:24:30Z) - AlphaApollo: Orchestrating Foundation Models and Professional Tools into a Self-Evolving System for Deep Agentic Reasoning [110.57865233597762]
自己進化型エージェント推論システムであるAlphaApolloについて述べる。
基礎モデル(FM)における2つのボトルネックに対処することを目的としている。
AlphaApolloは、意図的に検証可能な推論を可能にするために、複数のモデルをプロのツールで編成する。
論文 参考訳(メタデータ) (2025-10-05T15:42:24Z) - T2R-bench: A Benchmark for Generating Article-Level Reports from Real World Industrial Tables [65.12524437711737]
本稿では,テーブル・ツー・レポーティングタスクを提案し,T2R-benchというバイリンガルベンチマークを構築した。
ベンチマークは457の産業用テーブルで構成されており、すべて現実世界のシナリオから導かれ、19の産業ドメインを含んでいる。
25台のLLMでの実験では、Deepseek-R1のような最先端のモデルでさえ62.71のスコアでしかパフォーマンスが得られないことがわかった。
論文 参考訳(メタデータ) (2025-08-27T11:55:40Z) - BizFinBench: A Business-Driven Real-World Financial Benchmark for Evaluating LLMs [7.9458352414205295]
大規模な言語モデルは一般的なタスクでは優れていますが、ロジック重大で精度の高い、財務、法律、医療といった重要な領域での信頼性の評価は依然として難しいままです。
BizFinBenchは、実世界の金融アプリケーションにおけるLSMの評価に特化して設計された最初のベンチマークである。
BizFinBenchは中国語で6,781の注釈付きクエリで構成されており、数値計算、推論、情報抽出、予測認識、知識に基づく質問応答の5つの次元にまたがっている。
論文 参考訳(メタデータ) (2025-05-26T03:23:02Z) - CLOVER: A Test Case Generation Benchmark with Coverage, Long-Context, and Verification [71.34070740261072]
本稿では,テストケースの生成と完成におけるモデルの能力を評価するためのベンチマークCLOVERを提案する。
ベンチマークはタスク間でのコード実行のためにコンテナ化されています。
論文 参考訳(メタデータ) (2025-02-12T21:42:56Z) - SummExecEdit: A Factual Consistency Benchmark in Summarization with Executable Edits [31.98028879922584]
SummExecEditという新しいパイプラインとベンチマークを導入し、実際のエラーを検知し、正確な説明を提供する能力についてモデルを評価する。
トップパフォーマンスモデルであるClaude3-Opusは、ベンチマークでわずか0.49のジョイント検出と説明スコアを達成している。
説明ミスの4つの主要なタイプを特定し、その45.4%は、要約の完全に無関係な部分に焦点を当てている。
論文 参考訳(メタデータ) (2024-12-17T23:26:44Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。