論文の概要: OpenAI GPT-5 System Card
- arxiv url: http://arxiv.org/abs/2601.03267v1
- Date: Fri, 19 Dec 2025 07:05:38 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-01-11 18:48:17.583174
- Title: OpenAI GPT-5 System Card
- Title(参考訳): OpenAI GPT-5 System Card
- Abstract要約: GPT-5は、多くの質問に答えるスマートで高速なモデルを備えた統一システムである。
リアルタイムルータは、会話タイプ、複雑さ、ツールニーズ、明示的な意図に基づいて使用するモデルを決定する。
利用制限に達すると、各モデルのミニバージョンが残りのクエリを処理する。
- 参考スコア(独自算出の注目度): 247.27796140570612
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: This is the system card published alongside the OpenAI GPT-5 launch, August 2025. GPT-5 is a unified system with a smart and fast model that answers most questions, a deeper reasoning model for harder problems, and a real-time router that quickly decides which model to use based on conversation type, complexity, tool needs, and explicit intent (for example, if you say 'think hard about this' in the prompt). The router is continuously trained on real signals, including when users switch models, preference rates for responses, and measured correctness, improving over time. Once usage limits are reached, a mini version of each model handles remaining queries. This system card focuses primarily on gpt-5-thinking and gpt-5-main, while evaluations for other models are available in the appendix. The GPT-5 system not only outperforms previous models on benchmarks and answers questions more quickly, but -- more importantly -- is more useful for real-world queries. We've made significant advances in reducing hallucinations, improving instruction following, and minimizing sycophancy, and have leveled up GPT-5's performance in three of ChatGPT's most common uses: writing, coding, and health. All of the GPT-5 models additionally feature safe-completions, our latest approach to safety training to prevent disallowed content. Similarly to ChatGPT agent, we have decided to treat gpt-5-thinking as High capability in the Biological and Chemical domain under our Preparedness Framework, activating the associated safeguards. While we do not have definitive evidence that this model could meaningfully help a novice to create severe biological harm -- our defined threshold for High capability -- we have chosen to take a precautionary approach.
- Abstract(参考訳): これは2025年8月、OpenAI GPT-5と共に発売されたシステムカードである。
GPT-5は、ほとんどの質問に答えるスマートで高速なモデル、難しい問題に対する深い推論モデル、会話タイプ、複雑さ、ツールニーズ、明示的な意図に基づいて、どのモデルを使うべきかを素早く決定するリアルタイムルータを備えた統合システムである。
ルータは、ユーザーがモデルを切り替えた時、反応の優先度、測定された正確性、時間の経過とともに改善するなど、実際の信号で継続的に訓練される。
利用制限に達すると、各モデルのミニバージョンが残りのクエリを処理する。
このシステムカードは、主にgpt-5-thinkingとgpt-5-mainに焦点を当て、他のモデルの評価は付録で利用可能である。
GPT-5システムは、ベンチマークで以前のモデルを上回り、より早く質問に答えるだけでなく、より重要なのは、現実世界のクエリに役立ちます。
幻覚の低減、指導の改善、薬効の最小化に大きく貢献し、ChatGPTの最も一般的な用途である書込み、コーディング、健康の3つにおいて、GPT-5の性能を向上した。
GPT-5のモデルには、セーフコンプリート(セーフコンプリート)が備わっている。
ChatGPTエージェントと同様に、私たちは、gpt-5-thinkingを生物・化学領域の高機能化として、我々の準備フレームワークの下で扱い、関連する安全を活性化することを決定しました。
このモデルが初心者にとって深刻な生物学的害を生み出すのに有意義な助けになるという確証はないが、我々は予防的アプローチを選択した。
関連論文リスト
- GPT-Red: Automated Red Teaming via Self-Play at Scale [58.27696932324196]
我々は、フロンティアLSMに対する新規なプロンプトインジェクション攻撃を発見するために訓練された、自動化されたリピートエージェントであるtextbfGPT-Redを紹介する。
過去のモデルをGPT-5.5に確実に分解し、人間のレッドチームよりも攻撃に成功し、保留環境に一般化します。
論文 参考訳(メタデータ) (2026-07-28T16:03:39Z) - From GPT-3 to GPT-5: Mapping their capabilities, scope, limitations, and consequences [4.91737850660413]
GPT-3からGPT-3.5, GPT-4, GPT-4 Turbo, GPT-4o, GPT-4.1, GPT-5ファミリーまでのGPTファミリーの進展について述べる。
技術的フレーミング、ユーザインタラクション、モダリティ、デプロイメントアーキテクチャ、ガバナンスの観点から、家族がどのように進化したかを検討する。
論文 参考訳(メタデータ) (2026-04-11T19:31:18Z) - GLM-5: from Vibe Coding to Agentic Engineering [222.46864802629477]
GLM-5は,バイブ符号化のパラダイムをエージェント工学に移行するために設計された次世代基盤モデルである。
GLM-5は、前任者のエージェント、推論、コーディング(ARC)能力に基づいており、長いコンテキストの忠実さを維持しながら、トレーニングと推論のコストを大幅に削減するためにDSAを採用している。
論文 参考訳(メタデータ) (2026-02-17T17:50:56Z) - GPT-5 Model Corrected GPT-4V's Chart Reading Errors, Not Prompting [3.765281403026053]
本稿では,ゼロショット大言語モデル(LLM)がチャート読解タスクに与える影響を定量的に評価する。
エージェントGPT-5とマルチモーダルGPT-4Vの推測精度を比較するため, LLMに107の可視化質問に対する回答を求めた。
その結果,モデルアーキテクチャが推論精度を支配しているのに対し,プロンプト変種は小さな効果しか得られていないことがわかった。
論文 参考訳(メタデータ) (2025-10-08T09:09:29Z) - Performance of GPT-5 Frontier Models in Ophthalmology Question Answering [6.225411871775591]
GPT-5のような大規模言語モデル(LLM)は、医学的質問応答タスクのパフォーマンスを向上させる高度な推論機能を統合する。
O1高, O3高, GPT-4oとともに, OpenAI の GPT-5 シリーズの12 構成を評価した。
GPT-5-highは、O3-highより1.66倍、理性品質(1.11倍、O3-highより1.11倍)の両方で第1位である。
これらの結果は、GPT-5を高品質眼科データセット上でベンチマークし、推論が精度に与える影響を実証し、スケーラブルな評価のためのオートグラファーフレームワークを導入した。
論文 参考訳(メタデータ) (2025-08-13T17:17:17Z) - Capabilities of GPT-5 on Multimodal Medical Reasoning [4.403894457826502]
本研究は,GPT-5を医学的意思決定支援の汎用的マルチモーダル推論器として位置づける。
GPT-5, GPT-5-mini, GPT-5-nano, GPT-4o-2024-11-20を, MedQA, MedXpertQA (text and multimodal), MMLU医療サブセット, USMLE自己評価試験, VQA-RADの標準分割と比較した。
論文 参考訳(メタデータ) (2025-08-11T17:43:45Z) - Evaluating GPT-4 at Grading Handwritten Solutions in Math Exams [48.99818550820575]
我々は、最先端のマルチモーダルAIモデル、特にGPT-4oを利用して、大学レベルの数学試験に対する手書きの応答を自動的に評価する。
確率論試験における質問に対する実際の学生の反応を用いて, GPT-4oのスコアと, 様々なプロンプト技術を用いて, 人間の学級のスコアとの整合性を評価する。
論文 参考訳(メタデータ) (2024-11-07T22:51:47Z) - Show, Don't Tell: Evaluating Large Language Models Beyond Textual Understanding with ChildPlay [0.0]
本研究では,言語問題以外の問題に対する最先端の大規模言語モデルの一般化を評価するためのベンチマークを開発する。
Tic-Tac-Toe、Connect Four、Battleship、Shape Recognition Gameといった単純なゲームを使って、戦略的能力と空間的推論をテストする。
その結果,GPTモデルはいくつかのタスクに対して有意義な応答を提供するが,一般的には性能は良くないことがわかった。
論文 参考訳(メタデータ) (2024-07-12T14:17:26Z) - Is Self-Repair a Silver Bullet for Code Generation? [68.02601393906083]
大規模な言語モデルは、コード生成において顕著な適性を示しているが、それでも複雑なタスクを実行するのに苦労している。
自己修復(Self-repair) — モデルが自身のコードをデバッグし、修復する — は、最近、パフォーマンスを向上する一般的な方法になっている。
我々は,Code Llama, GPT-3.5, GPT-4によるHumanEvalとAPPSの自己修復能力について分析した。
論文 参考訳(メタデータ) (2023-06-16T15:13:17Z) - Reliability Check: An Analysis of GPT-3's Response to Sensitive Topics
and Prompt Wording [0.0]
GPT-3を混乱させるものは何か、モデルが特定のセンシティブなトピックにどう反応するか、そしてモデル応答にどのような影響があるのかを解析する。
GPT-3は明らかな陰謀やステレオタイプと正しく一致しないが、一般的な誤解や論争では誤りを犯す。
モデル応答はプロンプトや設定に不整合であり、GPT-3の信頼性の欠如を強調している。
論文 参考訳(メタデータ) (2023-06-09T19:07:31Z) - Sparks of Artificial General Intelligence: Early experiments with GPT-4 [66.1188263570629]
OpenAIが開発したGPT-4は、前例のない規模の計算とデータを使って訓練された。
我々は, GPT-4が数学, コーディング, ビジョン, 医学, 法学, 心理学などにまたがる, 新規で困難な課題を解くことを実証した。
我々は、GPT-4を人工知能(AGI)システムの早期(まだ未完成)版と見なすことができると信じている。
論文 参考訳(メタデータ) (2023-03-22T16:51:28Z) - Evaluating Psychological Safety of Large Language Models [72.88260608425949]
我々は,大規模言語モデル(LLM)の心理的安全性を評価するために,バイアスのないプロンプトを設計した。
短い暗黒トライアド(SD-3)とビッグファイブインベントリ(BFI)の2つのパーソナリティテストを用いて5種類のLDMを試験した。
毒性を減らすための安全基準を微調整したものの、InstructGPT, GPT-3.5, GPT-4は依然として暗い性格パターンを示した。
直接選好最適化を用いたBFIからの反応を微調整したLlama-2-chat-7Bは、モデルの心理的毒性を効果的に低減する。
論文 参考訳(メタデータ) (2022-12-20T18:45:07Z) - Semantic-aware Modular Capsule Routing for Visual Question Answering [55.03883681191765]
SuPER と呼ばれるセマンティック・アウェアな modUlar caPsulE フレームワークを提案する。
5つのベンチマークデータセットに対して提案した SUPER スキームの有効性と一般化能力を比較検討した。
論文 参考訳(メタデータ) (2022-07-21T10:48:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。