論文の概要: Using Fine-Tuned LLMs to Identify Indicators of Vulnerability in UK Police Incident Logs
- arxiv url: http://arxiv.org/abs/2607.18446v1
- Date: Mon, 20 Jul 2026 18:58:33 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-22 19:05:05.218506
- Title: Using Fine-Tuned LLMs to Identify Indicators of Vulnerability in UK Police Incident Logs
- Title(参考訳): 英国警察のインシデントログにおける微調整LDMを用いた脆弱性指標の同定
- Abstract要約: 英国警察のインシデント物語における4つの脆弱性指標の頻度を推定するために,LSMに基づく分類パイプラインを適用できるかどうかを検討する。
メンタルな健康指標は5件のインシデントのうち1件に存在し、他の指標の頻度は低い。
これらのバイアスを補正するには、かなりの人間の入力と統計的調整が必要であり、かなりの不確実性を残した。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Purpose: Understanding how much of routine policing involves vulnerable people could inform resourcing, training, and multi-agency response, yet administrative data provide limited insight. We explore whether an LLM-based classification pipeline, developed on open-source US police data, can be adapted to estimate the prevalence of four vulnerability indicators - mental ill health, substance misuse, alcohol dependence, and homelessness - in UK police incident narratives, and when outputs can be treated as defensible measurements. Methods: We analyse nearly 3,000 de-identified incident logs from a UK police force, using a multi-stage pipeline combining repeated model inference, label aggregation, structured human review, and statistical correction. The pipeline runs on a locally hosted open-weight LLM, reflecting the secure environments police must work in. Results: LLMs can produce meaningful, if imperfect, prevalence estimates at scale. Mental ill health indicators are present in approximately one in five incidents, with lower prevalence for other indicators. However, naive LLM deployment is unreliable: single-pass classifications are unstable, and aggregated outputs systematically over-assign indicators relative to human judgement. Correcting these biases required substantial human input and statistical adjustment, leaving considerable uncertainty. Conclusions: While LLMs can extract information from unstructured police data, their outputs cannot be treated as valid measurements without careful methodological support. At the population level, defensible estimates are achievable but resource-intensive; at the individual level, errors remain frequent and unpredictable, limiting suitability for operational decisions. This study highlights both the potential and the constraints of LLM-based measurement in applied settings.
- Abstract(参考訳): 目的: 脆弱性のある人々がどの程度の定期的な警察活動を行うかを理解することで、リソーシング、トレーニング、マルチ緊急対応を通知できるが、管理データは限られた洞察を提供する。
英国警察のインシデント物語において, LLMに基づく分類パイプラインが, 精神疾患, 薬物乱用, アルコール依存, ホームレスの4つの指標の有病率を推定し, アウトプットを防御可能な測定値として扱うことができるかを検討した。
方法: 本研究は, 繰り返しモデル推論, ラベル集約, 構造化人間レビュー, 統計的補正を併用した多段階パイプラインを用いて, 英国警察から約3,000件の未確認事件ログを分析した。
パイプラインはローカルにホストされたオープンウェイトLLMで動作し、警察が取り組まなければならない安全な環境を反映している。
結果: LLM は,不完全であっても,大規模に有意義な有病率推定値を生成することができる。
メンタルな健康指標は5件のインシデントのうち1件に存在し、他の指標の頻度は低い。
単一パスの分類は不安定であり、集約された出力は人間の判断に対して体系的にオーバーアサインインジケータである。
これらのバイアスを補正するには、かなりの人間の入力と統計的調整が必要であり、かなりの不確実性を残した。
結論: LLMは、構造化されていない警察データから情報を抽出できるが、そのアウトプットは、慎重な方法論的支援なしに有効な測定として扱うことはできない。
個人レベルでは、エラーは頻繁で予測不可能であり、運用上の決定には適さない。
本研究は, 適用環境におけるLLM測定の可能性と制約について述べる。
関連論文リスト
- PSEBench: A Controllable and Verifiable Benchmark for Evaluating LLMs in Patient Safety Event Triage [11.521711012101102]
患者安全イベントトリアージ(英: patient safety event triage)は、患者安全の専門家が通常手動で行うハイテイクタスクである。
ミネソタ州では29のReportable Adverse Health Eventsでこの方法をインスタンス化しています。
PSEBenchは、エージェント評価環境を備えた5,074ケースのベンチマークである。
論文 参考訳(メタデータ) (2026-06-03T21:41:39Z) - Towards Reliable Truth-Aligned Uncertainty Estimation in Large Language Models [54.51264434040939]
不確実性推定(UE)は、大規模言語モデル(LLM)の幻覚出力を検出することを目的とする。
ほとんどのUEメトリクスはモデル動作に由来するので、プロキシ障害としてこの現象を定式化します。
UE測定値の補正のためのポストホックキャリブレーション法であるTrath AnChoring (TAC)を提案する。
論文 参考訳(メタデータ) (2026-04-01T03:42:16Z) - When Stability Fails: Hidden Failure Modes Of LLMS in Data-Constrained Scientific Decision-Making [0.0]
大規模言語モデル(LLM)は、データ制約された科学的作業フローにおける意思決定支援ツールとして、ますます使われてきている。
LLM意思決定の4次元を明示的に分離する制御された行動評価フレームワークを提案する。
統計的基盤真理から分岐しながら, LLM がほぼ完全なラン・ツー・ラン安定性を示すことを示す。
論文 参考訳(メタデータ) (2026-03-16T19:17:09Z) - LLM Performance Predictors: Learning When to Escalate in Hybrid Human-AI Moderation Systems [5.7001352660257005]
本稿では,コンテンツモデレーションシステムにおける不確実性定量化の監視のためのフレームワークを提案する。
提案手法は,実世界のヒューマンAIにおいて,コストアウェアの選択的分類を可能にする。
この研究は、不確実性を認識し、スケーラブルで責任あるヒューマンAIモデレーションのための原則化されたフレームワークを確立する。
論文 参考訳(メタデータ) (2026-01-11T17:46:49Z) - Evaluating Metrics for Safety with LLM-as-Judges [1.93892819796757]
本稿では、多くの自然言語処理タスクから決定論的評価を得ることはできないが、重み付けされたメトリクスのバスケットを採用することで、評価におけるエラーのリスクを低減することができると主張している。
論文 参考訳(メタデータ) (2025-12-17T17:24:49Z) - Visualizing token importance for black-box language models [48.747801442240565]
我々は,ブラックボックスの大規模言語モデル(LLM)を監査して,本運用環境にデプロイした場合に確実に動作させるという課題を考察する。
本稿では,各入力トークンに対する言語モデルの出力の感度を評価するために,分布ベース感性分析(DBSA)を提案する。
論文 参考訳(メタデータ) (2025-12-12T14:01:43Z) - Metacognitive Myopia in Large Language Models [0.0]
大規模言語モデル(LLM)は、文化的に固有のステレオタイプ、クラウドの道徳的判断、あるいは多数派の肯定的な評価を強化する潜在的に有害なバイアスを示す。
認知・生態的枠組みとしてメタ認知ミオピアを提案する。
我々の理論的枠組みは, メタ認知, 監視, 制御の2つの要素が欠如していることが, メタ認知性ミオピアの5つの症状を引き起こすことを示唆している。
論文 参考訳(メタデータ) (2024-08-10T14:43:57Z) - Exploring Automatic Cryptographic API Misuse Detection in the Era of LLMs [60.32717556756674]
本稿では,暗号誤用の検出において,大規模言語モデルを評価するための体系的評価フレームワークを提案する。
11,940個のLCM生成レポートを詳細に分析したところ、LSMに固有の不安定性は、報告の半数以上が偽陽性になる可能性があることがわかった。
最適化されたアプローチは、従来の手法を超え、確立されたベンチマークでこれまで知られていなかった誤用を明らかにすることで、90%近い顕著な検出率を達成する。
論文 参考訳(メタデータ) (2024-07-23T15:31:26Z) - Unveiling the Misuse Potential of Base Large Language Models via In-Context Learning [61.2224355547598]
大規模言語モデル(LLM)のオープンソース化は、アプリケーション開発、イノベーション、科学的進歩を加速させる。
我々の調査は、この信念に対する重大な監視を露呈している。
我々の研究は、慎重に設計されたデモを配置することにより、ベースLSMが悪意のある命令を効果的に解釈し実行できることを実証する。
論文 参考訳(メタデータ) (2024-04-16T13:22:54Z) - Fact-Checking the Output of Large Language Models via Token-Level Uncertainty Quantification [116.77055746066375]
大型言語モデル(LLM)は幻覚、すなわちその出力に誤った主張を生じさせることで有名である。
本稿では,トークンレベルの不確実性定量化に基づくファクトチェックと幻覚検出パイプラインを提案する。
論文 参考訳(メタデータ) (2024-03-07T17:44:17Z) - Decomposing Uncertainty for Large Language Models through Input Clarification Ensembling [69.83976050879318]
大規模言語モデル(LLM)では、不確実性の原因を特定することが、信頼性、信頼性、解釈可能性を改善するための重要なステップである。
本稿では,LLMのための不確実性分解フレームワークについて述べる。
提案手法は,入力に対する一連の明確化を生成し,それらをLLMに入力し,対応する予測をアンサンブルする。
論文 参考訳(メタデータ) (2023-11-15T05:58:35Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。