論文の概要: Capabilities of Claude Fable 5 on Biomedical Challenge Problems
- arxiv url: http://arxiv.org/abs/2607.10849v1
- Date: Sun, 12 Jul 2026 17:21:32 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-14 15:40:48.554336
- Title: Capabilities of Claude Fable 5 on Biomedical Challenge Problems
- Title(参考訳): バイオメディカルチャレンジ問題におけるクロードファイバ5の能力
- Abstract要約: 我々は8つのバイオメディカルベンチマークで、Arthropicの最も有能な公開モデルであるClaude Fable 5を評価した。
我々は2つのClaude前駆体とGPT-5をベースラインとして含みます。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Frontier language models are increasingly evaluated on biomedical benchmarks, but two problems undermine most published evaluations: legacy benchmarks are near-saturated, and open-ended responses are graded by other language models. We evaluate Claude Fable 5, Anthropic's most capable publicly available model, across eight biomedical benchmarks, four text and four multimodal, using deterministic scoring against fixed answer keys throughout. We include two Claude predecessors and GPT-5 as baselines. Refusal is tracked as a distinct outcome in every result table. That decision produces the paper's central finding. Fable 5 refuses between 8.0% and 99.4% of questions depending on the benchmark, a pattern absent in both predecessors and in GPT-5. Once refused items are excluded from the denominator, Fable 5's accuracy exceeds or meets every other model on every benchmark in this study. We identify two distinguishable refusal patterns: one concentrating in basic-science and mechanism content across MedQA and MedXpertQA MM, confirmed independently on two benchmarks using each benchmark's own category labels; and a separate disease-domain pattern on RareBench, where inborn metabolic disease presentations are refused near-universally while adult-onset autoimmune presentations are not. The primary constraint on Fable 5's biomedical usefulness is willingness to engage, not capability once it does.
- Abstract(参考訳): 最前線の言語モデルは、バイオメディカルなベンチマークでますます評価されるが、2つの問題は最も公表された評価を損なう:レガシーなベンチマークはほぼ飽和しており、オープンな応答は他の言語モデルによってグレードされる。
我々は,8つのバイオメディカルベンチマーク,4つのテキストと4つのマルチモーダルにまたがって,Anthropicの最も有能な公開モデルであるClaude Fable 5を評価する。
2つのClaude の前身と GPT-5 をベースラインとして含んでいます。
拒絶は、すべての結果表で明確な結果として追跡される。
その決定は新聞の中心的な発見を生み出している。
Fable 5はベンチマークによって8.0%から99.4%の質問を拒否している。
削除された項目が分母から除外されると、Fable 5の精度は、この研究のすべてのベンチマークで他のすべてのモデルを上回るか、満たされる。
我々は,MedQA と MedXpertQA MM の2つのベンチマークにおいて,各ベンチマークのカテゴリラベルを用いて独立に確認された基本科学とメカニズムの内容に集中するパターンと,成人発症自己免疫のプレゼンテーションがほぼ一様に拒否されるRareBench上の別の疾患ドメインパターンを同定した。
Fable 5のバイオメディカルな有用性に関する主要な制約は、一度使えるようになると機能ではなく、参加する意思である。
関連論文リスト
- NovGauge: A Fine-Grained Benchmark for Diagnosing LLMs' Capability in Paper Novelty Assessment [54.4265627247104]
大規模言語モデル(LLM)は、主要なAIカンファレンスでピアレビューでますます使用されている。
既存のベンチマークでは、ノベルティを1つの総合的なスコアとして評価している。
本報告では,詳細なノベルティアセスメント診断のための人手によるベンチマークであるNovGaugeについて述べる。
論文 参考訳(メタデータ) (2026-09-10T08:34:56Z) - Opaque Epistemic Mediation: How LLM Deployment Configurations Shape the Validation of Pseudo-Science [0.0]
商業的な大規模言語モデルは知識参照としてますます使われているが、競合する科学的主張に対する彼らのスタンスは安定でも透明でもない。
我々は,フランク・ソルターの生物社会学の枠組みからエスノナショナリストの擬似科学を4つのLLMファミリーで評価する方法を検証した。
グロクのFastバージョンは、他の全てのモデルより2倍から5倍高い70-75の信頼性スコアを常に割り当てた。
論文 参考訳(メタデータ) (2026-07-24T17:32:43Z) - Evaluating medical AI under missing information: same-provider judges and human raters change apparent safety [0.0]
ストレステストでは、HealthBench会話の最後の半分を削除し、4つのプロジェクタLDM-judgeパネルとブラインドされたクリニックアンコールで回答をグラデーションすることで、4つのモデルをテストした。
評価対象の2つの結果は堅牢である。第一に、判断選択は明らかに安全性を著しく変える。
第二に、LLMの審査員は盲目の50石のサブサンプルで臨床医よりも寛容である。
論文 参考訳(メタデータ) (2026-07-21T08:05:35Z) - MedHopQA: A Disease-Centered Multi-Hop Reasoning Benchmark and Evaluation Framework for LLM-Based Biomedical Question Answering [11.3883842897598]
MedHopQAは、1000の専門家による質問応答ペアからなる、疾患中心のマルチホップ推論ベンチマークである。
各質問はウィキペディアの異なる2つの記事にまたがる情報の合成を必要とし、回答はオープンエンドのフリーテキスト形式で提供される。
論文 参考訳(メタデータ) (2026-05-12T16:32:43Z) - BrainBench: Exposing the Commonsense Reasoning Gap in Large Language Models [4.264192013842096]
大きな言語モデル(LLM)は、標準ベンチマークで印象的なスコアを得るが、人間が数秒で正しく答えられるような質問を日常的に失敗する。
BrainBenchは、慎重に設計された20のカテゴリにまたがる100のブレインティーザー質問のベンチマークです。
論文 参考訳(メタデータ) (2026-03-16T02:50:43Z) - PanCanBench: A Comprehensive Benchmark for Evaluating Large Language Models in Pancreatic Oncology [48.732366302949515]
大規模言語モデル(LLM)は、標準化された検査において専門家レベルの性能を達成したが、複数の選択精度は現実の臨床的有用性や安全性を十分に反映していない。
我々は、未確認患者の質問に対して、専門家のルーブリックを作成するための、ループ内人間パイプラインを開発した。
LLM-as-a-judge フレームワークを用いて,22のプロプライエタリおよびオープンソース LLM の評価を行い,臨床完全性,事実精度,Web-search 統合について検討した。
論文 参考訳(メタデータ) (2026-03-02T00:50:39Z) - The Illusion of Readiness: Stress Testing Large Frontier Models on Multimodal Medical Benchmarks [63.892797968132506]
GPT-5のような大型フロンティアモデルは、医学ベンチマークでトップスコアを獲得した。
しかし、ストレステストは別の話をします。
これらのベンチマークは、今日のベンチマークが医学的理解よりもテストのトリックにどのように報いるかを公開しています。
論文 参考訳(メタデータ) (2025-09-22T17:48:05Z) - Towards Domain Specification of Embedding Models in Medicine [1.0713888959520208]
MTEB(Massive Text Embedding Benchmark)に基づく分類,クラスタリング,ペア分類,検索を対象とする51タスクの総合ベンチマークスイートを提案する。
以上の結果から,本手法はロバストな評価枠組みを確立し,各タスクにおける工芸品の代替品の状態を常に上回り,組込み性能が向上することを示した。
論文 参考訳(メタデータ) (2025-07-25T16:15:00Z) - Reasoning Models Are More Easily Gaslighted Than You Think [85.84943447589511]
我々はOpenAIのo4-mini、Claude-3.7-Sonnet、Gemini-2.5-Flashの3つの最先端推論モデルを評価する。
ガス灯消火プロンプトによる精度低下が認められた。
GaslightingBench-Rは、推論モデルの認識可能性を評価するために設計された新しい診断ベンチマークである。
論文 参考訳(メタデータ) (2025-06-11T12:52:25Z) - Uncertainty Estimation of Large Language Models in Medical Question Answering [60.72223137560633]
大規模言語モデル(LLM)は、医療における自然言語生成の約束を示すが、事実的に誤った情報を幻覚させるリスクがある。
医学的問合せデータセットのモデルサイズが異なる人気不確実性推定(UE)手法をベンチマークする。
以上の結果から,本領域における現在のアプローチは,医療応用におけるUEの課題を浮き彫りにしている。
論文 参考訳(メタデータ) (2024-07-11T16:51:33Z) - MT-Eval: A Multi-Turn Capabilities Evaluation Benchmark for Large
Language Models [70.92847554971065]
MT-Evalは,マルチターン対話能力を評価するための総合的なベンチマークである。
人間のLLM会話を解析することにより,インタラクションパターンを,再現,拡張,洗練,フォローアップの4つのタイプに分類する。
11個の有名なLCMを評価したところ、クローズドソースモデルは一般的にオープンソースモデルを上回るが、特定のタスクにおいて特定のオープンソースモデルの方がGPT-3.5-Turboを上回っていることがわかった。
論文 参考訳(メタデータ) (2024-01-30T04:50:28Z) - TACRED Revisited: A Thorough Evaluation of the TACRED Relation
Extraction Task [80.38130122127882]
TACREDはリレーショナル抽出(RE)において最も大きく、最も広く使われているクラウドソースデータセットの1つである
パフォーマンスの天井に到達したのか、改善の余地はあるのか?
ラベルエラーは絶対F1テストエラーの8%を占めており、例の50%以上を可逆化する必要がある。
論文 参考訳(メタデータ) (2020-04-30T15:07:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。