論文の概要: Large-Scale Qualitative Research with AI: Infrastructure, Management and Operation of the Socioscope Data Pipeline
- arxiv url: http://arxiv.org/abs/2608.29751v1
- Date: Sun, 30 Aug 2026 12:25:27 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-01 18:31:31.05658
- Title: Large-Scale Qualitative Research with AI: Infrastructure, Management and Operation of the Socioscope Data Pipeline
- Title(参考訳): AIを用いた大規模定性的研究:社会スコープデータパイプラインの基盤・管理・運用
- Abstract要約: 本稿では、AI拡張分析を実現するために、結果のデータがどのように構築され、管理されたかの技術的参照を提供する。
データパイプラインの終端について説明している: システムサンプリングフレーム; 食品システム内の各イニシアチブの関係をキャプチャするために使用されるトランザクショングリッド。
コスト、メトリクス、学んだ教訓、制限を報告し、他のチームがソシオスコープの方法論を再利用し、適応し、改善できるようにします。
- 参考スコア(独自算出の注目度): 0.26059379504241154
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: The Socioscope project is a pioneering effort in Large-Scale Qualitative Research (LSQR) collecting comparable, open-ended, multimedia field data on hundreds of cases and using AI to make the material analysable at scale. The domain studied is the food system. The entities documented are the organisations that act in it: farms, processors, distributors, retailers, restaurants; and, at meso level, the actors that shape their environment, such as municipalities, government programmes, banks, NGOs and universities. This paper provides the technical reference for how the resulting data Corpus was built and managed to enable AI-augmented analysis. It describes the data pipeline end to end: the systemic sampling frame; the transaction grid used to capture each initiative's relations within the food system; the social contract that rewards participating interviewees, aiming to sustain access; the operational chain from scouting to interviews, including their uploading, transcription, translation, quality control and curation; the provenance rules (originals are immutable, every transformation is logged); and the installation of equipment, personnel and processes, including ethics and GDPR compliance. In its first phase (2023-2026) the pipeline produced 686 documented cases from 31 countries: some 1,430 hours of recordings, about 450,000 speech turns, and 12.6 million words of transcript. We report costs, metrics, lessons learned and limitations, so that other teams can reuse, adapt, and improve the Socioscope methodology.
- Abstract(参考訳): Socioscopeプロジェクトは、大規模定性的研究(LSQR)における先駆的な取り組みであり、数百のケースで同等でオープンなマルチメディアフィールドデータを収集し、AIを使用して、大規模に分析できるようにする。
研究対象は食品システムである。
文書化された団体は、農場、プロセッサ、流通業者、小売業者、レストラン、そしてメソレベルでは、自治体、政府のプログラム、銀行、NGO、大学などの環境を形成するアクターである。
本稿では、AI強化分析を実現するために、得られたデータコーパスがどのように構築され、管理されたかの技術的参照を提供する。
システム的なサンプリングフレーム、食品システム内の各イニシアチブの関係を捉えるために使用されるトランザクショングリッド、アクセスを維持するために参加するインタビュアーに報酬を与えるソーシャルコントラクト、アップロード、転写、翻訳、品質管理、キュレーションを含む、スカウトからインタビューまでの運用チェーン、プロファイランスルール(オリジナルは不変であり、すべての変換はログアップされる)、倫理やGDPRコンプライアンスを含む機器、人事、プロセスのインストール。
第1フェーズ(2023年-2026年)では、約1,430時間の録音、約54万の発声、1260万語という31カ国から686件の文書化されたケースが作成された。
コスト、メトリクス、学んだ教訓、制限を報告し、他のチームがソシオスコープの方法論を再利用し、適応し、改善できるようにします。
関連論文リスト
- DianShi-RxnDB: A Large-Scale, Fine-Grained Organic Reaction Data Platform Built via a Fully Automated Pipeline for Researchers and AI Agents [77.19284650368924]
大規模できめ細かい有機反応データプラットフォームであるDianShi-RxnDBについて述べる。
完全に自動化された抽出と正規化パイプラインを通じて構築される。
このプラットフォームは、検索、フィルタリング、比較、およびソース検証レコードのためのWebリサーチワークベンチを提供する。
論文 参考訳(メタデータ) (2026-09-06T16:20:43Z) - Institutional Newspapers Pipeline: Deriving billions of high quality tokens from historical newspapers [4.958928833328447]
本報告では、プロセスの各ステップ、トレーニングした小さなモデル、評価結果、プロセスで収集したデータセットスケールの測定方法について述べる。
私たちはこの研究を、何千万もの新聞スキャンから高品質なデータをアンロックするための重要なステップと位置づけています。
論文 参考訳(メタデータ) (2026-08-19T14:41:12Z) - Deep Academic Survey: Stateful Agentic Closed-Loop Paradigm for Academic Survey Automation [60.151050016855834]
DASは出版指向の学術調査を作成するためのステートフルなエージェント・フレームワークである。
その鍵となる考え方は、再利用可能な紙分析とトピック固有の原稿構築を分離することである。
DASは4つの次元で最高点に達し、総合スコアは4.34であり、最強の競争相手は4.03である。
論文 参考訳(メタデータ) (2026-08-18T17:29:00Z) - Agentic Commerce World: An Auditable and Verifiable Environment for Vibe Commerce [83.90449137361595]
Vibeコマースは、自然言語で購入や販売の目標を表現し、AIエージェントにタスクを委譲することを可能にする。
本稿では,現在進行中の取引にまたがるエージェント評価環境であるAgenic Commerce World(ACWorld)を紹介する。
ACWorldは、共有トランザクション状態を更新する前にエージェントアクションを検証し、結果のインタラクションを記録し、エージェントの振る舞いを監査可能とし、再現性を評価する。
論文 参考訳(メタデータ) (2026-08-03T16:20:17Z) - Gym-Anything: Turn any Software into an Agent Environment [67.2443447990221]
Gym-Anythingは、あらゆるソフトウェアをインタラクティブなコンピュータ利用環境に変換するためのフレームワークである。
CUA-Worldは、医学、天文学、工学、エンタープライズシステムなど、領域にまたがる10万以上の長期的タスクのコレクションである。
論文 参考訳(メタデータ) (2026-04-07T17:38:15Z) - Context Engineering: A Practitioner Methodology for Structured Human-AI Collaboration [0.0]
本稿では、AIツールのプロンプトに付随する完全な情報ペイロードの組み立て、宣言、シークエンシングのための構造化手法であるContext Engineeringを紹介する。
4つのAIツール間で200のドキュメント化されたインタラクションに関する観察的研究では、不完全なコンテキストがイテレーションサイクルの72%に関連付けられている。
構造化コンテキストアセンブリは、タスク毎の平均イテレーションサイクルを3.8から2.0に削減し、ファーストパスの受け入れを32%から55%に改善した。
論文 参考訳(メタデータ) (2026-04-05T20:30:44Z) - OIDA-QA: A Multimodal Benchmark for Analyzing the Opioid Industry Documents Archive [50.468138755368805]
オピオイド危機は公衆衛生にとって重要な瞬間である。
UCSF-JHU Opioid Industry Documents Archive(OIDA)に公開されているデータと文書
本稿では,文書属性に応じて元のデータセットを整理することで,この問題に対処する。
論文 参考訳(メタデータ) (2025-11-13T03:27:32Z) - Reference-Aligned Retrieval-Augmented Question Answering over Heterogeneous Proprietary Documents [8.931959753296635]
本稿では,自動車業界を対象とした内部質問応答システムを提案する。
データパイプラインは、生のマルチモーダルドキュメントを構造化コーパスとQAペアに変換し、完全にオンプレミスのプライバシ保護アーキテクチャを提供する。
我々のシステムは、非RAGベースライン上での事実正しさ(+1.79, +1.94)、情報正しさ(+1.33, +1.16)、有用性(+1.08, +1.67)を改善する。
論文 参考訳(メタデータ) (2025-02-26T22:20:08Z) - IGGA: A Dataset of Industrial Guidelines and Policy Statements for Generative AIs [8.420666056013685]
本稿では,GAI(Generative AIs)とLLM(Large Language Models)を産業や職場で使用するための,160の産業ガイドラインと政策ステートメントのデータセットであるIGGAを紹介する。
データセットには104,565語が含まれており、要求工学に一般的に適用される自然言語処理タスクの貴重なリソースとして機能している。
論文 参考訳(メタデータ) (2025-01-01T21:31:47Z) - Bridging the Data Provenance Gap Across Text, Speech and Video [67.72097952282262]
我々は、人気テキスト、音声、ビデオデータセットのモダリティにまたがって、最大かつ第1級の経時的監査を行う。
私たちの手動分析では、1990年から2024年の間に、608言語、798のソース、659の組織、67の国で4000近い公開データセットをカバーしています。
マルチモーダル機械学習アプリケーションは、トレーニングセットのために、YouTubeのようなWebcrawled、synthetic、ソーシャルメディアプラットフォームに圧倒的に移行した。
論文 参考訳(メタデータ) (2024-12-19T01:30:19Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。