論文の概要: APEX-Accounting
- arxiv url: http://arxiv.org/abs/2607.27189v2
- Date: Thu, 30 Jul 2026 17:45:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-31 15:03:14.119721
- Title: APEX-Accounting
- Title(参考訳): APEX-Accounting
- Abstract要約: 我々は、マーサーがRampと共同で構築したベンチマークであるAPEX-Accountingを導入し、フロンティアモデルが会計士の実際の仕事をできるかどうかを評価する。
タスクには、口座の調整、経費の徴収、取引の投稿、レポートの作成が含まれる。
あらゆるタスクは会計と簿記の専門家によって作成され、解決された。
- 参考スコア(独自算出の注目度): 4.129208607223545
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We introduce APEX-Accounting, a benchmark built by Mercor in partnership with Ramp, to assess whether frontier models can do the real work of accountants. Tasks include reconciling accounts, accruing expenses, posting transactions, and producing reports. The private eval set comprises 160 tasks, split across 10 worlds. Each world contains an accounting system, as well as spreadsheets, PDFs, and other files. Every task was authored and solved by experts in accounting and bookkeeping, who also wrote grading rubrics. Across nine frontier models, Claude-Fable-5 (Max) leads with 56.4% Mean Criteria@3, ahead of Muse-Spark-1.1 (xHigh) at 52.6%. No model scores more than 2.6% Pass^8 (GPT-5.6-Sol (Max+Pro)) and the highest Pass@8 is 21.5% (Muse-Spark-1.1 (xHigh)). We experiment with increasing the token budget from $1 to $50 and observe an instance of Simpson's paradox: scores increase as the token budget increases but within a given budget-constrained harness, scores are lower on tasks where the model spends more tokens. As APEX-Accounting is a closed benchmark, leaderboard evals can be run for any frontier model on request.
- Abstract(参考訳): 我々は、マーサーがRampと提携して構築したベンチマークであるAPEX-Accountingを導入し、フロンティアモデルが会計士の実際の仕事をできるかどうかを評価する。
タスクには、口座の調整、経費の徴収、取引の投稿、レポートの作成が含まれる。
プライベートevalセットは160のタスクで構成され、10つの世界に分けられる。
各世界には会計システム、スプレッドシート、PDF、その他のファイルが含まれる。
あらゆるタスクは会計と簿記の専門家によって作成され、解決された。
9つのフロンティアモデルで、Claude-Fable-5 (Max)は56.4%のMean Criteria@3をリードし、Muse-Spark-1.1 (xHigh)を52.6%で上回った。
2.6%のPass^8 (GPT-5.6-Sol (Max+Pro))以上のスコアはなく、最も高いPass@8は21.5% (Muse-Spark-1.1 (xHigh))である。
我々はトークン予算を1ドルから50ドルに増やし、シンプソンのパラドックスの例を観察する実験を行った。トークン予算が増加するにつれてスコアは増加するが、与えられた予算制約のあるハーネス内では、モデルがより多くのトークンを使用するタスクにおいてスコアは低い。
APEX-Accountingはクローズドベンチマークであるため、任意のフロンティアモデルに対して、要求に応じてリーダボードのevalを実行することができる。
関連論文リスト
- Crypto Accounting Bench: Evaluating Frontier and Open-Weight Models on Crypto-Asset Accounting Tasks [8.224773321617048]
このベンチマークは、フロンティアとオープンウェイト言語モデルが、企業が暗号資産取引のために投稿した完全なジャーナルエントリを再構築できるかどうかを評価するものである。
CABには7つの匿名組織から引き出された118の評価タスクが含まれている。
プロプライエタリなフロンティアシステムとオープンウェイトリリースにまたがる12のモデルを,タスク毎に3つの独立した試行に対して評価し,4,248個のトラジェクトリを生成した。
論文 参考訳(メタデータ) (2026-09-13T21:59:07Z) - Zero-Shot Self-Orchestration with Ledger-Based Control for Improved LLM Coding Performance [2.8543100656957883]
共有作業空間に対する管理作業者の足場の影響について検討する。
監督のオプス5は1回のパスで91%の得点を記録した。
マネジャーの実行はトークンの請求書を3倍にしますが、より大きなモデルに移行するよりも、より安価で精度が得られます。
論文 参考訳(メタデータ) (2026-08-27T00:11:41Z) - TRACE-Bench: Decomposing and Diagnosing Multi-Reference Image Generation [74.69068352546073]
TRACE-Benchは、多様な芸術的スタイルと現実世界の主題にまたがるマルチ参照画像の評価ツールである。
631の定式テンプレートと、様々な芸術様式と現実世界の主題にまたがる約4,000の参照画像で構成されている。
その公式構造は、演算子整合性評価プロトコルを駆動し、可視性スコアリングと診断木解析を行う。
論文 参考訳(メタデータ) (2026-08-17T16:15:50Z) - The Harness Effect: How Orchestration Design Sets the Token Economics of Enterprise Agentic AI [8.387065289628376]
今日のエージェントAI開発はトークンの最大化で動作する。
単価の下落はパターンを覆しており、いずれにせよ総支出は増加する。
我々はトークンの最大化に対する決定的なレバーがハーネスであると主張している。
論文 参考訳(メタデータ) (2026-07-08T01:58:12Z) - IPO Finance Agent: Benchmark of LLM Financial Analysts Beyond Finance Agent v2, with Automated Rubric Generation, on the SpaceX (SPCX) IPO [0.0]
ファイナンスエージェント v2(Vals AI)が金融言語モデルを評価する基準ベンチマークとして登場した。
タスクドメインと検索アーキテクチャの2つの方向に沿ってファイナンスエージェントフレームワークを拡張したIPOファイナンスエージェントを紹介します。
最高の性能評価モデルであるZhipu GLM-5.2は79.8%の精度に達し、その結果得られたフロンティアで最もコスト効率のよいXiaomi MiMo-2.5 Proはクエリあたり0.05 USDでわずかに低い精度(77.2%)に達した。
論文 参考訳(メタデータ) (2026-06-22T08:42:19Z) - CFAgentBench: A Reproducible Environment and Benchmark for Autonomous Construction-Finance Agents [0.0]
CFAgentBenchは、自律的な建設ファイナンスエージェントのベンチマークである。
8つのドメインと77のファミリーにまたがる1014のマシングレード可能なタスク仕様を含んでいる。
最強のエージェントはpass1 = 0.67に達するが、pass5 = 0.38のみである。
論文 参考訳(メタデータ) (2026-06-20T11:34:52Z) - Knowledge Index of Noah's Ark [63.143852586221534]
KINAは,261分野にわたる899項目のベンチマークである。
ボーナス・オン・バートーナメントがFOSDを弱く支配していることを示す。
トップモデルであるGemini-3.1-Pro-Previewは53.17%、Claude-Opus-4.6は49.92%、GPT-5.4は48.55%に達した。
論文 参考訳(メタデータ) (2026-06-03T17:06:49Z) - Scaling Laws for Agent Harnesses via Effective Feedback Compute [53.68149869349268]
emphEffective Feedback Compute (EFC)は、情報的、有効、非冗長な場合にのみフィードバックを信用し、その後の決定のために保持するトレースレベルのスケーリング座標である。
EFCベースの座標は、生の計算ベースラインよりも失敗率を常に予測する。
論文 参考訳(メタデータ) (2026-05-28T09:45:47Z) - The Price Reversal Phenomenon: When Cheaper Reasoning Models End Up Costing More [76.93600828673503]
リストAPIの価格設定は、実際のコストに対する信頼性の低いプロキシである。
思考トークンのコストの削減は、ランキングの反転を70%削減します。
この結果から,コスト意識モデル選択と透過的な要求毎のコスト監視の必要性が示唆された。
論文 参考訳(メタデータ) (2026-03-25T06:07:39Z) - Do We Always Need Query-Level Workflows? Rethinking Agentic Workflow Generation for Multi-Agent Systems [72.3575737073235]
マルチエージェントシステム(MAS)は、複数のエージェントを協調することで複雑なタスクを解決する。
既存のアプローチはタスクレベルかクエリレベルで生成されるが、その相対的なコストと利点は未だ不明である。
クエリレベルのワークフロー生成は必ずしも必要ではない、なぜなら、トップKレベルのタスクレベルの小さなセットが、すでに同等あるいはそれ以上のクエリをカバーしているからだ。
論文 参考訳(メタデータ) (2026-01-16T10:05:51Z) - Towards a Science of Scaling Agent Systems [79.64446272302287]
エージェント評価の定義を定式化し,エージェント量,コーディネーション構造,モデル,タスク特性の相互作用として,スケーリング法則を特徴付ける。
協調指標を用いて予測モデルを導出し,R2=0をクロスバリデーションし,未知のタスク領域の予測を可能にする。
ツールコーディネーショントレードオフ: 固定的な計算予算の下では, ツールヘビータスクはマルチエージェントのオーバーヘッドから不均衡に悩まされ, 2) 能力飽和: 調整が減少または負のリターンを, 単一エージェントのベースラインが45%を超えると達成できる。
論文 参考訳(メタデータ) (2025-12-09T06:52:21Z) - OmniEAR: Benchmarking Agent Reasoning in Embodied Tasks [52.87238755666243]
OmniEARは,言語モデルが身体的相互作用やツールの使用,マルチエージェントの協調にどう影響するかを評価するためのフレームワークである。
我々は、家庭と工業領域にまたがる1500のシナリオにおける連続的な物理的特性と複雑な空間的関係をモデル化する。
我々の体系的な評価は、モデルが制約から推論しなければならない場合、厳しい性能劣化を示す。
論文 参考訳(メタデータ) (2025-08-07T17:54:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。