論文の概要: Rethinking Data Quality for AI-Driven Systems: Evidence from Practitioner Interviews
- arxiv url: http://arxiv.org/abs/2609.31191v1
- Date: Fri, 25 Sep 2026 12:22:26 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-28 18:27:51.37772
- Title: Rethinking Data Quality for AI-Driven Systems: Evidence from Practitioner Interviews
- Title(参考訳): AI駆動システムにおけるデータ品質の再考 - 実践者インタビューからの証拠
- Abstract要約: AI駆動のソフトウェア集約システムでは、データはモデル行動、評価、合法的な使用も形成する。
我々は9つの組織から16人の実践者を面接し、反射的テーマ分析を用いて書き起こしを分析し、参加者のアカウントから6つのテーマを開発した。
ライフサイクル・アシュアランス(ライフサイクル・アシュアランス:ライフサイクル・アシュアランス:ライフサイクル・アシュアランス:ライフサイクル・アシュアランス:ライフサイクル・アシュアランス:ライフサイクル・フレーミング:モデル・ベースの判断、エージェント・アクションにその影響が組み込まれている場合、データが特定のAIのクレームを裏付ける証拠を生み出すことに焦点を当てた概念的フレーミング。
- 参考スコア(独自算出の注目度): 4.241377338556251
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Data quality research has usually treated data as an input that is stored, processed, and validated. In AI-driven software-intensive systems, data also shapes model behavior, evaluation, and lawful use. Empirical evidence remains limited on how practitioners define, assess, and manage quality under these conditions. We interviewed 16 practitioners from nine organizations and analyzed the transcripts using reflexive thematic analysis and developed six themes from participants' accounts. In AI systems, traceability shifted from modular debugging to attributing model behavior, while using models as quality assessors introduced circularity. Agent context and memory became data objects, and synthetic and pseudo-labeled data made authenticity a quality concern. In foundation-model development, lawfulness became a gate for training data, while representativeness was judged through coverage of situations in which the system must behave safely. Prior ML research examines many of these problems separately. Our study provides a practitioner-grounded account of how they are encountered together as an engineering and organizational concern. We also interpret five recurring conditions as helping explain how the themes relate to reduced trust in data and AI outcomes. We synthesize these findings through lifecycle assurance: a conceptual framing focused on producing evidence that data can support a specific AI claim when its influence may be embedded in model behavior, model-based judgments, or agent actions.
- Abstract(参考訳): データ品質の研究は通常、データを格納、処理、検証する入力として扱います。
AI駆動のソフトウェア集約システムでは、データはモデル行動、評価、合法的な使用も形成する。
実践者がこれらの条件下で品質を定義し、評価し、管理する方法に関して、実証的な証拠は依然として限られている。
我々は9つの組織から16人の実践者を面接し、反射的テーマ分析を用いて書き起こしを分析し、参加者のアカウントから6つのテーマを開発した。
AIシステムでは、トレーサビリティはモジュラーデバッギングからモデルビヘイビアへと移行し、品質評価器としてモデルを使用して円形を導入した。
エージェントコンテキストとメモリはデータオブジェクトとなり、合成データと擬似ラベルデータによって、信頼性が品質上の懸念事項となった。
基礎モデル開発において、合法性はトレーニングデータのゲートとなり、代表性は、システムが安全に振る舞わなければならない状況のカバレッジによって判断された。
ML以前の研究では、これらの問題の多くを別々に調査している。
本研究は, 工学的, 組織的関心事として, どのように連携しているかを, 実践者の立場から考察する。
また、繰り返し発生する5つの条件を、そのテーマがデータとAI結果の信頼性の低下にどのように関係しているかを説明するのに役立つと解釈する。
ライフサイクル・アシュアランス(ライフサイクル・アシュアランス:ライフサイクル・アシュアランス:ライフサイクル・アシュアランス:ライフサイクル・アシュアランス:ライフサイクル・アシュアランス:ライフサイクル・フレーミング:モデル・ベースの判断、エージェント・アクションにその影響が組み込まれている場合、データが特定のAIクレームをサポートする証拠を生み出すことに焦点を当てた概念的フレーミング。
関連論文リスト
- Generative Responsible AI Data Evaluation Schema (GRAIDES) for AI Assurance in Local Government [0.0]
GRAIDES(Generative Responsible Data Evaluation)は、AI観測可能性の集中化を目的とした軽量なオープンソースデータモデルである。
コード、アーキテクチャ、統計的評価の実践的青写真は、生成系保証へのアプローチに関するガイダンスとして共有されている。
論文 参考訳(メタデータ) (2026-06-18T22:00:25Z) - An Investigation on How AI-Generated Responses Affect SoftwareEngineering Surveys [3.183470571353323]
本研究では,大規模言語モデル (LLM) がソフトウェア工学のサーベイでいかに誤用されているかを考察する。
我々は2025年にProlificプラットフォームを通じて行われた2回の調査からのデータを分析した。
ソフトウェア工学のサーベイにおいて、データの真正性は新たな妥当性の次元として認識される。
論文 参考訳(メタデータ) (2025-12-19T11:17:05Z) - What's the next frontier for Data-centric AI? Data Savvy Agents [71.76058707995398]
我々は、エージェントシステムの設計において、データに精通する能力が最優先すべきであると主張している。
本稿では,このビジョンを実現するための4つの重要な機能を提案する。プロアクティブデータ取得,ソフシフィケートデータ処理,インタラクティブテストデータ合成,連続的適応。
論文 参考訳(メタデータ) (2025-11-02T17:09:29Z) - Rethinking Data Protection in the (Generative) Artificial Intelligence Era [138.07763415496288]
現代の(生産的な)AIモデルやシステムに生じる多様な保護ニーズを捉える4段階の分類法を提案する。
当社のフレームワークは、データユーティリティとコントロールのトレードオフに関する構造化された理解を提供し、AIパイプライン全体にわたっています。
論文 参考訳(メタデータ) (2025-07-03T02:45:51Z) - Collect, Measure, Repeat: Reliability Factors for Responsible AI Data
Collection [8.12993269922936]
AIのデータ収集は責任ある方法で行うべきだと我々は主張する。
本稿では,データ収集をメトリクスの集合でガイドするResponsible AI(RAI)手法を提案する。
論文 参考訳(メタデータ) (2023-08-22T18:01:27Z) - FREIDA: A Framework for developing quantitative agent based models based on qualitative expert knowledge [0.0]
エージェントベースモデル(ABM)は、量的データが不足しているシステムや、量的データだけでは現実世界のシステムの複雑さを完全に捉えるのに不十分なシステムを扱うことが多い。
専門家の知識と質的な洞察は、これらのモデルの中で現実的な行動規則、相互作用、意思決定プロセスを構築するのに重要である。
本研究では, ABMの開発, 訓練, 評価を行うための混合メソドックスフレームワークであるFREIDAを提案する。
論文 参考訳(メタデータ) (2023-07-21T11:26:54Z) - Auditing and Generating Synthetic Data with Controllable Trust Trade-offs [54.262044436203965]
合成データセットとAIモデルを包括的に評価する総合監査フレームワークを導入する。
バイアスや差別の防止、ソースデータへの忠実性の確保、実用性、堅牢性、プライバシ保護などに焦点を当てている。
多様なユースケースにまたがる様々な生成モデルを監査することにより,フレームワークの有効性を実証する。
論文 参考訳(メタデータ) (2023-04-21T09:03:18Z) - Data-SUITE: Data-centric identification of in-distribution incongruous
examples [81.21462458089142]
Data-SUITEは、ID(In-distriion)データの不連続領域を特定するためのデータ中心のフレームワークである。
我々は,Data-SUITEの性能保証とカバレッジ保証を実証的に検証する。
論文 参考訳(メタデータ) (2022-02-17T18:58:31Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。