論文の概要: From Policy Documents to Structured Survey Responses: Evaluating Large Language Models for Policy Monitoring
- arxiv url: http://arxiv.org/abs/2609.29370v1
- Date: Thu, 24 Sep 2026 10:49:37 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-25 21:10:09.846955
- Title: From Policy Documents to Structured Survey Responses: Evaluating Large Language Models for Policy Monitoring
- Title(参考訳): 政策文書から構造化された調査応答へ:政策監視のための大規模言語モデルの評価
- Abstract要約: 科学、技術、革新の政策は競争力には不可欠だが、その多様性と規模は、一貫して地図の作成と監視を困難にしている。
既存のアプローチは手作業による調査に大きく依存しています。
本稿では,ポリシーテキストから構造化されたサーベイ応答を生成するために,大規模言語モデル(LLM)を"AI回答者"として適用する。
- 参考スコア(独自算出の注目度): 0.4717289929277555
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Science, technology, and innovation policies are crucial for competitiveness, yet their diversity and scale make them difficult to map and monitor consistently. Existing approaches rely heavily on manual survey efforts, which are costly and challenging to scale across countries. Large language models (LLMs) enable new possibilities for extracting and structuring information from long and unstructured policy documents. This paper presents an application of LLMs as "AI respondents" for generating structured survey responses from policy texts. We develop a data extraction pipeline based on long-context in-context learning to map information from public web sources into predefined survey categories, including policy instruments, target groups, and thematic areas. The pipeline integrates a validation step using a secondary LLM to assess relevance and evidence, alongside comparisons with human-provided responses. Using a multi-country dataset, we evaluate the alignment between LLM-generated and human-generated outputs through overlap measures and cross-validation. Results show that LLMs achieve high agreement for structured indicators (84-95%), while differences remain in free-text fields, where models tend to provide more detailed procedural descriptions. These findings highlight the potential of hybrid human-AI workflows for policy monitoring, improving both efficiency and scalability while maintaining the need for human validation and contextual interpretation.
- Abstract(参考訳): 科学、技術、革新の政策は競争力には不可欠だが、その多様性と規模は、一貫して地図の作成と監視を困難にしている。
既存のアプローチは手作業による調査に大きく依存しています。
大規模言語モデル (LLM) は、長く構造化されていないポリシー文書から情報を抽出し、構造化するための新たな可能性を実現する。
本稿では、政策文書から構造化された調査回答を生成するための「AI回答者」としてのLLMの適用について述べる。
本研究では,長期コンテキストのインコンテキスト学習に基づくデータ抽出パイプラインを構築し,公開Webソースからの情報を政策指標,対象グループ,テーマ領域を含む事前定義された調査カテゴリにマップする。
パイプラインは、人間が提供する応答との比較とともに、セカンダリLSMを使用して妥当性とエビデンスを評価する検証ステップを統合する。
マルチカントリー・データセットを用いて、重なり合う測定とクロスバリデーションにより、LLM生成と人為的出力のアライメントを評価する。
その結果, LLM は構造化指標 (84-95%) に対して高い整合性を実現する一方で, モデルがより詳細な手続き記述を提供する傾向にある自由テキスト領域では相違が残ることがわかった。
これらの知見は、ポリシー監視のためのハイブリッドなヒューマンAIワークフローの可能性を強調し、人間の検証とコンテキスト解釈の必要性を維持しながら、効率とスケーラビリティの両方を改善した。
関連論文リスト
- Scaling Beyond Context: A Survey of Multimodal Retrieval-Augmented Generation for Document Understanding [61.36285696607487]
文書理解は、財務分析から科学的発見への応用に不可欠である。
現在のアプローチでは、OCRベースのパイプラインがLarge Language Models(LLM)やネイティブのMultimodal LLMs(MLLM)に制限されている。
Retrieval-Augmented Generation (RAG)は、外部データの基底モデルを支援するが、文書のマルチモーダルな性質は、テキスト、テーブル、チャート、レイアウトを組み合わせることで、より高度なパラダイムを必要とする。
論文 参考訳(メタデータ) (2025-10-17T02:33:16Z) - To Err Is Human; To Annotate, SILICON? Reducing Measurement Error in LLM Annotation [11.470318058523466]
大規模言語モデル(LLM)は、人間のアノテーションに代わる費用対効果の高いスケーラブルな代替を約束する。
LLMアノテーションから測定誤差を体系的に低減するSILICON手法を開発した。
この証拠は,各エラー源の削減が必要であり,SILICONは管理研究において厳密なアノテーションをサポートしていることを示唆している。
論文 参考訳(メタデータ) (2024-12-19T02:21:41Z) - The Synergy of LLMs & RL Unlocks Offline Learning of Generalizable Language-Conditioned Policies with Low-fidelity Data [50.544186914115045]
TEDUOは、シンボリック環境におけるオフライン言語条件のポリシー学習のための、新しいトレーニングパイプラインである。
まず、オフラインデータセットをよりリッチなアノテーションで拡張する自動化ツールとして、次に、一般化可能な命令フォローエージェントとして使用します。
論文 参考訳(メタデータ) (2024-12-09T18:43:56Z) - A Controlled Study on Long Context Extension and Generalization in LLMs [85.4758128256142]
広義のテキスト理解とテキスト内学習は、完全な文書コンテキストを利用する言語モデルを必要とする。
長期コンテキストモデルを直接訓練する際の実装上の課題のため、長期コンテキストを扱うためにモデルを拡張する多くの方法が提案されている。
我々は,一貫したベースモデルと拡張データを利用して,標準化された評価による拡張メソッドの制御プロトコルを実装した。
論文 参考訳(メタデータ) (2024-09-18T17:53:17Z) - Unleashing the Power of Data Tsunami: A Comprehensive Survey on Data Assessment and Selection for Instruction Tuning of Language Models [33.488331159912136]
インストラクションチューニングは、大きな言語モデル(LLM)と人間の嗜好の整合において重要な役割を果たす。
自然言語処理(NLP)とディープラーニングの分野において,データアセスメントと選択手法が提案されている。
本稿では,データアセスメントと選択に関する既存の文献を総合的にレビューし,特にLLMの命令チューニングについて述べる。
論文 参考訳(メタデータ) (2024-08-04T16:50:07Z) - Systematic Task Exploration with LLMs: A Study in Citation Text Generation [63.50597360948099]
大規模言語モデル(LLM)は、複雑な創造的自然言語生成(NLG)タスクの定義と実行において、前例のない柔軟性をもたらす。
本稿では,系統的な入力操作,参照データ,出力測定からなる3成分研究フレームワークを提案する。
我々はこのフレームワークを用いて引用テキスト生成を探索する。これは一般的なNLPタスクであり、タスク定義と評価基準に関するコンセンサスを欠いている。
論文 参考訳(メタデータ) (2024-07-04T16:41:08Z) - Bias and Fairness in Large Language Models: A Survey [73.87651986156006]
本稿では,大規模言語モデル(LLM)のバイアス評価と緩和手法に関する総合的な調査を行う。
まず、自然言語処理における社会的偏見と公平性の概念を統合し、形式化し、拡張する。
次に,3つの直感的な2つのバイアス評価法と1つの緩和法を提案し,文献を統一する。
論文 参考訳(メタデータ) (2023-09-02T00:32:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。