論文の概要: PetQA: Benchmarking Veterinary Knowledge and Clinical Reasoning
- arxiv url: http://arxiv.org/abs/2609.04598v1
- Date: Fri, 04 Sep 2026 00:54:04 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-07 18:15:23.871144
- Title: PetQA: Benchmarking Veterinary Knowledge and Clinical Reasoning
- Title(参考訳): PetQA: 獣医の知識と臨床推論のベンチマーク
- Authors: Taegyun Kim, Youngwook Ham, Jungwook Rhim, Ju-Hyun An, Sungkyu Park, Kunwoo Park,
- Abstract要約: 韓国の長文質問回答ベンチマークであるPetQAを導入し,獣医学的知識と臨床的推論を評価した。
PetQAには、10,076のテキストのみと、8,751のマルチモーダルQAペアが含まれている。
ROUGE, BERTScore, LLM-as-a-judge を用いて, 実感と有用性について3つの設定で評価した。
- 参考スコア(独自算出の注目度): 5.163698516785226
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: We introduce PetQA, a Korean long-form question-answering (QA) benchmark for evaluating veterinary knowledge and clinical reasoning in large language models (LLMs) and large vision-language models (LVLMs). PetQA contains 10,076 text-only and 8,751 multimodal QA pairs derived from real-world questions about dogs and cats, paired with answers from expert veterinarians. Its test split, PetQA-Bench, further includes annotations for question types and clinical conditions. We evaluate eighteen models using ROUGE, BERTScore, and LLM-as-a-judge metrics for factuality and helpfulness under three settings: zero-shot inference, retrieval-augmented generation (RAG), and supervised fine-tuning (SFT). The benchmarking results provide an overview of the strengths and limitations of current models in addressing veterinary clinical queries and highlight the need for more effective adaptation methods to develop clinically reliable AI systems for veterinary care. To facilitate broader use, we additionally provide translated versions of PetQA-Bench in five languages.
- Abstract(参考訳): 本稿では,大言語モデル (LLM) と大規模視覚言語モデル (LVLM) における獣医学的知識と臨床推論を評価するための,韓国の長文質問回答(QA)ベンチマークであるPetQAを紹介する。
PetQAには、10,076のテキストのみと、8,751のマルチモーダルQAペアが含まれている。
テスト分割であるPetQA-Benchには、質問タイプや臨床症状のアノテーションも含まれている。
我々は, ROUGE, BERTScore, LLM-as-a-judge を用いて, ゼロショット推論, 検索強化生成 (RAG) , 教師付き微調整 (SFT) の3つの設定において, 実効性と有用性を評価した。
ベンチマークの結果は、獣医学的クエリに対処する際の現在のモデルの強みと限界を概観し、獣医学的治療のための臨床信頼性の高いAIシステムを開発するための、より効果的な適応方法の必要性を強調している。
5言語でPetQA-Benchの翻訳版も提供する。
関連論文リスト
- Med-RewardBench: Benchmarking Reward Models and Judges for Medical Multimodal Large Language Models [57.73472878679636]
Med-RewardBenchは、医療報酬モデルと審査員を評価するために特別に設計された最初のベンチマークである。
Med-RewardBenchは、13の臓器系と8の臨床部門にまたがるマルチモーダルデータセットを特徴としている。
厳格な3段階のプロセスは、6つの臨床的に重要な次元にわたる高品質な評価データを保証する。
論文 参考訳(メタデータ) (2025-08-29T08:58:39Z) - MedQARo: A Large-Scale Benchmark for Medical Question Answering in Romanian [50.767415194856135]
ルーマニア初の大規模医療QAベンチマークであるMedQARoを紹介する。
がん患者に関連する102,646のQAペアからなる高品質で大規模なデータセットを構築した。
論文 参考訳(メタデータ) (2025-08-22T13:48:37Z) - Structured Outputs Enable General-Purpose LLMs to be Medical Experts [50.02627258858336]
大規模言語モデル(LLM)は、しばしばオープンエンドの医学的問題に苦しむ。
本稿では,構造化医療推論を利用した新しいアプローチを提案する。
我々の手法は85.8のファクチュアリティスコアを達成し、微調整されたモデルを上回る。
論文 参考訳(メタデータ) (2025-03-05T05:24:55Z) - Clinical QA 2.0: Multi-Task Learning for Answer Extraction and Categorization [2.380499804323775]
回答抽出と医療分類の両面でCQAモデルを共同で訓練するマルチタスク学習フレームワークを提案する。
回答の範囲の予測に加えて、我々のモデルは、診断、治療、症状、処置、実験報告の5つの標準化された医療カテゴリに分類する。
その結果、MTLは標準微調整に比べてF1スコアを2.2%改善し、解答分類の精度は90.7%向上した。
論文 参考訳(メタデータ) (2025-02-18T18:20:37Z) - Dog-IQA: Standard-guided Zero-shot MLLM for Mix-grained Image Quality Assessment [57.10083003305353]
我々は,マルチモーダル大規模言語モデル(MLLM)の例外的事前知識を利用する,標準誘導型ゼロショット混合IQA法であるDog-IQAを提案する。
Dog-IQAは、MLLMの行動パターンを利用し、主観的要因の影響を最小限に抑える特定の基準で客観的に得点する。
提案したDog-IQAは,トレーニングフリー手法と比較して最先端(SOTA)性能を実現し,クロスデータセットシナリオにおけるトレーニングベース手法と比較して競合性能が向上した。
論文 参考訳(メタデータ) (2024-10-03T14:14:21Z) - Large Language Models in the Clinic: A Comprehensive Benchmark [63.21278434331952]
診療所の大規模言語モデル(LLM)をよりよく理解するためのベンチマークであるClimateBenchを構築した。
まず、さまざまな臨床言語の生成、理解、推論タスクを含む11の既存のデータセットを収集します。
次に,現実の実践において複雑だが一般的である6つの新しいデータセットと臨床タスクを構築した。
ゼロショット設定と少数ショット設定の両方で、20個のLDMを広範囲に評価する。
論文 参考訳(メタデータ) (2024-04-25T15:51:06Z) - K-QA: A Real-World Medical Q&A Benchmark [12.636564634626422]
K-QA(K-QA)は、K Health上での実際の会話から発せられる1,212の患者質問を含むデータセットである。
我々は,K-QAのサブセットを自己完結文に分解するために,内科医のパネルを用いて回答し,手動で分解する。
我々は、いくつかの最先端モデルと、コンテキスト内学習と医学指向の拡張検索スキームの効果を評価した。
論文 参考訳(メタデータ) (2024-01-25T20:11:04Z) - Large Language Models Encode Clinical Knowledge [21.630872464930587]
大規模言語モデル(LLM)は、自然言語の理解と生成において印象的な能力を示している。
本稿では, 現実性, 正確性, 潜在的害, バイアスを含む複数の軸に沿ったモデル回答の人為的評価のための枠組みを提案する。
本研究は,モデル尺度とインストラクション・インシデント・チューニングにより,理解,知識の想起,医学的推論が向上することを示す。
論文 参考訳(メタデータ) (2022-12-26T14:28:24Z) - CliniQG4QA: Generating Diverse Questions for Domain Adaptation of
Clinical Question Answering [27.45623324582005]
臨床質問応答(英: Clinical Question answering, QA)は、臨床テキストに基づく医療専門家の質問に自動的に答えることを目的としている。
CliniQG4QAを提案する。これは質問生成(QG)を利用して、新しい臨床状況に基づいてQAペアを合成する。
QAモデルのトレーニングに不可欠な多様な質問を生成するために,Seq2seqベースの質問句予測(QPP)モジュールを導入する。
論文 参考訳(メタデータ) (2020-10-30T02:06:10Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。