論文の概要: From BERT to Frontier Agents: Eight Years of Language-Model Progress, the Collapse of the Capability-Cost Curve, and the Rise of Task-Targeted Models
- arxiv url: http://arxiv.org/abs/2608.13675v1
- Date: Thu, 13 Aug 2026 18:16:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-17 20:14:29.184318
- Title: From BERT to Frontier Agents: Eight Years of Language-Model Progress, the Collapse of the Capability-Cost Curve, and the Rise of Task-Targeted Models
- Title(参考訳): BERTからフロンティアエージェントへ:言語モデルの発展の8年,能力-コスト曲線の崩壊,タスク目標モデルの台頭
- Abstract要約: 2018年10月から2026年7月まで、AIモデルはBERTのような単純なシステムから複雑な数学を解き、ソフトウェアを書く巨大なエージェントへと進化した。
実際のコーディング問題を解決する能力は、2024年後半から年6回改善された。
この期間、OpenAIの予算モデルであるGPT 5ポイント6のLunaは、フラグシップ機能にわずか1~6ドルのトークンでマッチし、旧バージョンをわずかに上回った。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Between October 2018 and July 2026 AI models progressed from simple systems like BERT to massive agents that solve complex math and write software. The ability to resolve real coding issues improved by nearly six times per year since late 2024. During this time costs dropped sharply with OpenAIs budget model GPT 5 point 6 Luna matching flagship capabilities for just one to six dollars per million tokens beating older versions at a fraction of the price. Top performance is now split across specialized models as Claude Opus 5 leads in frontend coding Claude Fable 5 excels at repository level coding and GPT 5 point 6 Sol dominates terminal tasks. In a grade school math test using the Qwen 2 point 5 model basic methods solved 58 of 100 problems while advanced sampling solved up to 79. A confidence ranking tool correctly identified 47 right answers in its top 50 choices proving highly useful for sorting tasks with all research materials made fully public.
- Abstract(参考訳): 2018年10月から2026年7月まで、AIモデルはBERTのような単純なシステムから複雑な数学を解き、ソフトウェアを書く巨大なエージェントへと進化した。
実際のコーディング問題を解決する能力は、2024年後半から年6回改善された。
この期間、OpenAIの予算モデルであるGPT 5ポイント6のLunaは、フラグシップ機能にわずか1~6ドルのトークンでマッチし、旧バージョンをわずかに上回った。
Claude Opus 5 がフロントエンドコーディングをリードする Claude Fable 5 がリポジトリレベルのコーディングに優れ、GPT 5 ポイント 6 が端末タスクを支配している。
Qwen 2 点 5 モデルを用いた小学校数学試験では,100 点中58 点を解き,高度なサンプリングでは79 点まで解いた。
信頼度ランキングツールは、すべての研究資料を公開してタスクをソートするのに非常に有用であることが証明されたトップ50の選択において、47の正しい回答を正しく特定した。
関連論文リスト
- COMPAS: Difficulty-Aware Joint Search for Optimizing Code Generation [16.33065582566179]
低コストモデル選択と共同プロンプトデコード検索により,グループ固有の品質・コスト面を学習する難易度認識手法であるCompASを導入する。
LiveCodeBenchの検索予算で、CompASはパス@1を最高のベースラインで45.9%から52.8%に改善し、コストは36.57ドルから4.92ドルに削減した。
論文 参考訳(メタデータ) (2026-08-05T01:28:43Z) - AcademiClaw: When Students Set Challenges for AI Agents [69.70303995121154]
AcademiClaw(アカデミクロー)は、大学生の実際の学術的切断から直接引き出された80の複雑な長い水平タスクのベンチマークである。
最高のモデルでさえ、55%のパスレートしか達成できないことを示す。
AcademiClawとそのオープンソースデータとコードが、OpenClawコミュニティにとって有用なリソースになることを願っています。
論文 参考訳(メタデータ) (2026-05-04T14:40:42Z) - Scaling Self-Play with Self-Guidance [62.13619253976748]
Self-Guided Self-Play (SGS)は、Conjecturerをジェネラシーから遠ざけるセルフプレイアルゴリズムである。
SGSは80ラウンド未満のセルフプレイで、最強のベースラインの解決率を上回っています。
論文 参考訳(メタデータ) (2026-04-22T05:50:23Z) - Failure-Aware Enhancements for Large Language Model (LLM) Code Generation: An Empirical Study on Decision Framework [0.26508608365976566]
GitHubの25のプロジェクトに関する実証調査では、プログレッシブプロンプトが平均96.9%のタスク完了を達成した。
自己批判はコードレビュー可能なロジックエラーで成功するが、外部サービス統合では完全に失敗する。
RAGは、より優れた効率で、すべての障害タイプで最高の完成を達成する。
論文 参考訳(メタデータ) (2026-02-02T23:08:03Z) - RubberDuckBench: A Benchmark for AI Coding Assistants [5.198865387380684]
RubberDuckBench: コードに関する質問のベンチマークと、回答を評価するための詳細なルーリックを紹介します。
これらの疑問に答える上で,我々は20のLLM(プロパティおよびオープンソース)を多種多様なセットで評価する。
Grok 4 (69.29%)、Claude Opus 4 (68.5%)、GPT-5 (67.8%) は総合的に最高の成績を上げているが、次の9つの最高のパフォーマンスモデルよりも2倍の優位性を示すことはない。
論文 参考訳(メタデータ) (2026-01-23T05:28:48Z) - Co-Evolving LLM Coder and Unit Tester via Reinforcement Learning [48.66688117533318]
本稿では,専用の報酬設計を備えた新しい強化学習フレームワークCUREを提案する。
CUREは、その相互作用の結果に基づいて、コーディングと単体テスト生成機能を共進化させる。
我々のモデルは,ベースモデルに基づく強化学習に有効な報奨モデルとして機能することを発見した。
論文 参考訳(メタデータ) (2025-06-03T17:58:42Z) - Error Typing for Smarter Rewards: Improving Process Reward Models with Error-Aware Hierarchical Supervision [20.09181711927194]
PathFinder-PRMは,新しい階層型,誤り認識型識別型PRMである。
PRMBenchでは、PathFinder-PRMが67.7の最先端PRMSコアを新たに達成し、3倍の少ないデータを使用しながら、以前の最高値(65.5)を上回った。
論文 参考訳(メタデータ) (2025-05-26T08:56:36Z) - Goedel-Prover: A Frontier Model for Open-Source Automated Theorem Proving [72.8626512877667]
我々は,2025年4月5日現在,数学問題の自動証明生成における最先端(最先端)性能を実現する,オープンソースの言語モデルであるGoedel-Proverを紹介した。
まず、自然言語の数学問題をNuminaデータセットからLean 4で等価な形式ステートメントに変換するためにLLMをトレーニングします。
次に,一連のプロデューサをトレーニングすることで,形式証明の大規模なデータセットを開発する。
最後に、Goedel-Pset-v1-solvedというデータセットを取得し、Goedel-Pset-v1から800K以上のステートメントの証明を含む。
論文 参考訳(メタデータ) (2025-02-11T15:27:35Z) - ACECODER: Acing Coder RL via Automated Test-Case Synthesis [36.740393665032954]
既存のコードデータから広範な(問い合わせ、テストケース)ペアを生成するパイプラインを設計します。
我々は,Bradley-Terry損失を伴う報酬モデルをトレーニングするために,サンプルプログラムのパスレートに基づいて選好ペアを構築した。
RLトレーニングは,80段階の最適化ステップにおいて,HumanEval+を25%以上,MBPP+を6%以上改善できることを示す。
論文 参考訳(メタデータ) (2025-02-03T18:46:04Z) - Navigating the Labyrinth: Evaluating LLMs' Ability to Reason About Search Problems [62.76627483915117]
大規模言語モデル(LLM)は、最近、数学と推論ベンチマークで印象的なパフォーマンスを達成した。
直感的なパズルにインスパイアされた11のユニークな検索問題を含む新しいベンチマークであるSearchBenchを紹介した。
ステップバイステップで言語のみの推論を用いることで、最も先進的なLLMでさえ、SearchBenchの解決に失敗することを示します。
論文 参考訳(メタデータ) (2024-06-18T00:44:58Z) - PRover: Proof Generation for Interpretable Reasoning over Rules [81.40404921232192]
本稿では,ルールベース上の二項質問に応答し,対応する証明を生成するトランスフォーマーモデルを提案する。
本モデルは,効率的な制約付き学習パラダイムを用いて,証明グラフに対応するノードやエッジを予測できることを学習する。
我々は、QAと証明生成のための有望な結果を示すために、合成、手書き、人文による規則ベースの実験を行う。
論文 参考訳(メタデータ) (2020-10-06T15:47:53Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。