論文の概要: Benchmarking Frontier Large Language Models Against Official Crash Database Coding Using Police Crash Narratives
- arxiv url: http://arxiv.org/abs/2607.29064v1
- Date: Fri, 31 Jul 2026 06:32:02 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-03 14:29:40.636301
- Title: Benchmarking Frontier Large Language Models Against Official Crash Database Coding Using Police Crash Narratives
- Title(参考訳): 警察クラッシュナラティブを用いた公式クラッシュデータベース符号化に対するフロンティア大言語モデルのベンチマーク
- Abstract要約: 警察のクラッシュ物語には、構造化されたクラッシュデータベースを補完する情報が含まれている。
大規模な言語モデルが公式のクラッシュコーディングをどの程度うまく再現しているかは、まだ不明である。
本研究は,6つのフロンティアLSMを,物語由来のクラッシュ特性コードとアーカンソー・デッドクラッシュデータベースの対応するフィールドを比較してベンチマークした。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Police crash narratives contain information that may supplement structured crash databases, but manual review is labor-intensive and it remains unclear how well large language models (LLMs) reproduce official crash coding. This study benchmarked six frontier LLMs by comparing narrative-derived crash attribute codes with corresponding fields in the Arkansas fatal-crash database. The analysis linked 5,587 fatal-crash narratives with 5,889 structured crash records from Arkansas (2015-2025), yielding 4,194 matched crashes. Six LLMs were evaluated using an identical zero-shot prompt to code crash manner, non-motorist relation, intersection type, work-zone relation, roadway surface condition, and light condition. Performance was evaluated using agreement, macro-averaged F1 score, Cohen's kappa, coverage, selective agreement, and comparisons with always-majority, always-Unknown, and keyword-rule baselines. Repeated-measures analyses and a generalized estimating equations model assessed differences among models and attributes. GPT-5.5 High achieved the highest agreement among the evaluated LLMs, but the always-majority baseline produced higher raw agreement and the keyword-rule baseline achieved macro-averaged F1 score and Cohen's kappa comparable to the best-performing LLM. Agreement was highest for non-motorist relation and crash manner and lowest for light condition, roadway surface condition, and work-zone relation. Differences across crash attributes exceeded differences across models. These results provide a benchmark for evaluating LLM-based crash coding and show that deployment should be evaluated on an attribute-specific basis using transparent baselines and human review.
- Abstract(参考訳): 警察のクラッシュの物語には、構造化されたクラッシュデータベースを補完する情報が含まれているが、手動によるレビューは労働集約的であり、大規模な言語モデル(LLM)が公式のクラッシュコーディングをどの程度うまく再現するかは定かではない。
本研究は,6つのフロンティアLSMを,物語由来のクラッシュ特性コードとアーカンソー・デッドクラッシュデータベースの対応するフィールドを比較してベンチマークした。
2015-2025年にアーカンソー州で記録された5,587件の死亡事故と5,889件の事故記録が関連付けられ、4,194件が一致した。
同一のゼロショットプロンプト,非運動量関係,交点型,ワークゾーン関係,道路表面条件,光条件を用いて6つのLCMを評価した。
評価は,コンセンサス,マクロ平均F1スコア,コーエンのカッパ,カバレッジ,選択的なコンセンサス,および常長,常無,キーワードルールのベースラインと比較した。
モデルと属性の相違を評価した反復測度解析と一般化された推定方程式モデル。
GPT-5.5 High は評価された LLM の中で最も高い一致を達成したが、常に大きなベースラインは高い生の一致を生み出し、キーワードルールベースラインはマクロ平均 F1 スコアを達成し、コーエンのカッパは最高の性能の LLM に匹敵する結果を得た。
また,非基線的関係および衝突様式が最も高く,光条件,道路表面条件,ワークゾーン関係が最も低かった。
衝突特性の違いは、モデル間の差異を上回った。
これらの結果はLCMベースのクラッシュコーディングを評価するためのベンチマークを提供し、透過的なベースラインとヒューマンレビューを使用して、属性固有のベースでデプロイメントを評価するべきであることを示す。
関連論文リスト
- Fine-Tuning Large Language Models to Classify Pull Request-Issue Alignments: Going Beyond Prompting [1.4465033892011254]
本研究では、細調整された大言語モデル(LLM)を活用することにより、自動PR課題アライメント分類を改善することを目的とする。
微調整のLLMは精度が6.15%、F1-microが14.69%、F1-macroが6.15%、リコールが6.15%向上した。
論文 参考訳(メタデータ) (2026-09-01T11:25:36Z) - Beyond Pass Rate: A Multilingual, Execution-Grounded Evaluation of Open Code LLMs [0.0]
ベストモデルの平均正しさは23.64%に達し、人間受け入れベースラインは57.2%である。
Qwen2.5-Coder-14B-Instructは、難しい問題と明確なプロブレムカバレッジで最強である。
Gemma-2-27B-ITは全言語でのリント通過率が最も高い。
論文 参考訳(メタデータ) (2026-06-07T21:10:30Z) - CauTion: Knowing When to Trust LLMs for Ensemble Causal Discovery [51.07538881798502]
大規模言語モデル(LLM)は、統計的推論を補完する将来的なドメイン知識の源を提供する。
我々は、LLMドメイン知識を統計的因果探索アルゴリズムのアンサンブルに確実に統合するフレームワークであるCauTionを提案する。
CauTionは、データ中心とLLM拡張ベースラインの両方を一貫して上回る。
論文 参考訳(メタデータ) (2026-06-02T13:07:43Z) - Comparing LLM and Fine-Tuned Model Performance on NVDRS Circumstance Extraction with Varying Prompt Complexity [8.474809035213118]
そこで本研究では,コード名のみのプロンプトよりも詳細なプロンプトが改良された場合の予測を手作業で行うアルゴリズムを開発した。
我々は,国立暴力死亡報告システムから25の複雑な状況下で,大規模言語モデル (LLM) を微調整したRoBERTaに対して評価した。
論文 参考訳(メタデータ) (2026-05-21T00:33:52Z) - Domain-Adapted Pre-trained Language Models for Implicit Information Extraction in Crash Narratives [6.91741018994547]
本研究では,コンパクトなオープンソース言語モデルが,クラッシュ物語からの推論集約的な抽出を支援するかどうかを考察する。
我々は,Low-Rank Adaption (LoRA) とBERTを用いて,タスク固有の知識をLLMに注入するための微調整手法を適用した。
さらなる分析により、微調整されたPLMはよりリッチな物語の詳細をキャプチャし、データセット内のいくつかの誤ラベル付きアノテーションを修正できることが明らかになった。
論文 参考訳(メタデータ) (2025-10-10T14:45:07Z) - Preference Leakage: A Contamination Problem in LLM-as-a-judge [69.96778498636071]
審査員としてのLLM(Large Language Models)とLLMに基づくデータ合成は、2つの基本的なLLM駆動型データアノテーション法として登場した。
本研究では, 合成データ生成器とLCMに基づく評価器の関連性に起因するLCM-as-a-judgeの汚染問題である選好リークを明らかにする。
論文 参考訳(メタデータ) (2025-02-03T17:13:03Z) - Fault Localization via Fine-tuning Large Language Models with Mutation Generated Stack Traces [3.3158239079459655]
本稿では,スタックトレース情報のみに基づいて障害をローカライズする新たな手法を提案する。
64,369件のクラッシュの微調整によって、コードベースの4100万件の突然変異により、66.9%の精度で、クラッシュの根本原因の位置を正確に予測できる。
論文 参考訳(メタデータ) (2025-01-29T21:40:32Z) - WikiContradict: A Benchmark for Evaluating LLMs on Real-World Knowledge Conflicts from Wikipedia [59.96425443250666]
Retrieval-augmented Generation (RAG) は,大規模言語モデル(LLM)の限界を緩和する,有望なソリューションとして登場した。
本研究では,ウィキペディアからの矛盾文に基づく質問に対するLLM生成回答の総合評価を行う。
我々は、単一のパスを持つRAGと2つの矛盾するパスを持つRAGを含む、様々なQAシナリオ下で、クローズドおよびオープンソース両方のLSMをベンチマークする。
論文 参考訳(メタデータ) (2024-06-19T20:13:42Z) - Learning Traffic Crashes as Language: Datasets, Benchmarks, and What-if Causal Analyses [76.59021017301127]
我々は,CrashEventという大規模トラフィッククラッシュ言語データセットを提案し,実世界のクラッシュレポート19,340を要約した。
さらに,クラッシュイベントの特徴学習を,新たなテキスト推論問題として定式化し,さらに様々な大規模言語モデル(LLM)を微調整して,詳細な事故結果を予測する。
実験の結果, LLMに基づくアプローチは事故の重大度を予測できるだけでなく, 事故の種類を分類し, 損害を予測できることがわかった。
論文 参考訳(メタデータ) (2024-06-16T03:10:16Z) - Fake Alignment: Are LLMs Really Aligned Well? [91.26543768665778]
本研究では,複数質問とオープンエンド質問の相違点について検討した。
ジェイルブレイク攻撃パターンの研究にインスパイアされた我々は、これが不一致の一般化によって引き起こされたと論じている。
論文 参考訳(メタデータ) (2023-11-10T08:01:23Z) - LLMs as Factual Reasoners: Insights from Existing Benchmarks and Beyond [135.8013388183257]
そこで我々は,SummEditsと呼ばれる10ドメインのベンチマークで不整合検出ベンチマークを作成し,実装する新しいプロトコルを提案する。
ほとんどのLLMはSummEditsで苦労しており、パフォーマンスはランダムに近い。
最も優れたモデルであるGPT-4は、推定された人間のパフォーマンスよりも8%低い。
論文 参考訳(メタデータ) (2023-05-23T21:50:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。