論文の概要: Human-AI-Powered Hypothesis Testing: Cost-Aware Selective AI Scoring and Sequential Human Escalation
- arxiv url: http://arxiv.org/abs/2609.28859v1
- Date: Thu, 24 Sep 2026 00:02:19 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-25 21:10:09.609792
- Title: Human-AI-Powered Hypothesis Testing: Cost-Aware Selective AI Scoring and Sequential Human Escalation
- Title(参考訳): 人間AIによる仮説テスト:コストを意識した選択型AIスコーリングとシークエンシャルヒューマンエスカレーション
- Abstract要約: 我々は、AI判断と選択的な人間の検証を併用して、最小限のコストで有効な仮説テストを実行する方法について研究する。
我々は、所定のテストエラーを達成するための最小コストをキャプチャする情報理論の下限を導出する。
我々は、選択的なAIスコアと適応的な人間のエスカレーションを組み合わせた、逐次的なコスト認識ポリシーを開発する。
- 参考スコア(独自算出の注目度): 0.7176906280023595
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large language models are increasingly used as inexpensive judges to evaluate outputs, label data, and assess whether a system meets a desired quality standard. Yet using AI judgments for formal statistical inference is fundamentally different from simply treating them as ground-truth labels: AI evaluations can be biased or noisy, and rigorous hypothesis testing requires explicit control of type-I and type-II errors. We study how to use AI judgments, together with selective human verification, to conduct a valid hypothesis test at minimum cost. We consider a population of items with hidden binary labels. After choosing a fixed pool of items, the decision maker can selectively query AI, send an item directly to a human, escalate an AI-scored item to a human after observing the AI report, or stop once sufficient evidence has accumulated. We derive an information-theoretic lower bound that captures the minimum cost of achieving prescribed testing errors and characterizes the value of AI information and human verification through a report-dependent information frontier. Motivated by this characterization, we develop SCALE, a sequential cost-aware policy that combines selective AI scoring with adaptive human escalation. SCALE is valid at finite sample sizes and matches the lower bound to first order as the target error probabilities vanish. We further extend the framework to an unknown AI-output model using paired AI-human pilot data. Numerically, SCALE approaches Human-only or AI-only testing when one source clearly dominates, while achieving its largest savings when inexpensive AI judgments and selective human verification are both valuable.
- Abstract(参考訳): 大規模言語モデルは、出力、ラベルデータの評価、システムが望ましい品質基準を満たすかどうかを評価するために、安価な判断器としてますます使われています。
しかし、正式な統計的推論にAIの判断を使うことは、単に基調ラベルとして扱うこととは根本的に異なる:AI評価はバイアスやノイズがあり、厳密な仮説テストではタイプIとタイプIIのエラーを明示的に制御する必要がある。
我々は、AI判断と選択的な人間の検証を併用して、最小限のコストで有効な仮説テストを実行する方法について研究する。
隠れたバイナリラベルを持つアイテムの集団について検討する。
決められたアイテムのプールを選択した後、意思決定者はAIを選択的にクエリし、直接人間にアイテムを送り、AIレポートを観察した後、AIでマークされたアイテムを人間にエスカレートしたり、十分な証拠が蓄積されたら停止することができる。
我々は、所定のテストエラーを達成するための最小コストを捕捉し、レポート依存の情報フロンティアを通じてAI情報の価値と人間の検証を特徴付ける情報理論の下限を導出する。
この特徴を活かしたSCALEは,選択型AIスコアと適応型人間のエスカレーションを組み合わせた逐次的コスト認識ポリシーである。
SCALEは有限サンプルサイズで有効であり、ターゲット誤差確率がなくなると、下位境界を1次に一致させる。
さらに、ペアAIと人間のパイロットデータを用いて、未知のAI出力モデルにフレームワークを拡張します。
数値的には、SCALEは、1つのソースが明確に支配されている場合、ヒューマンオンリーまたはAIオンリーのテストにアプローチする。
関連論文リスト
- Toward a Theory of Value in AI Alignment [8.20706299979115]
大規模言語モデルの普及は、有害なスピーチや幻覚から、不正な行動を実行するAIエージェントまで、害が増加している。
AIの安全性の分野では、これらの有害なインスタンスはアライメント問題として、あるいは人間の価値観と不一致しているモデルのフレーム化されることが多い。
AIの価値アライメントの分野は、人間の価値をどのように考えていますか?
我々は、AIにおける価値の暗黙的理論を明らかにするために94の値アライメント研究論文を注釈付けした。
論文 参考訳(メタデータ) (2026-08-10T23:57:02Z) - When Should Humans Step In? Optimal Human Dispatching in AI-Assisted Decisions [2.7755032786791003]
我々は,人間-AI協調のための一般的な意思決定理論の枠組みを提案する。
我々は、AIアセスメントを要因レベルの信号として扱い、人間の判断を、選択的に取得できるコストの高い情報として扱う。
当社のフレームワークをAI支援ピアレビューに適用する。
論文 参考訳(メタデータ) (2026-03-14T01:47:38Z) - Cascaded Language Models for Cost-effective Human-AI Decision-Making [52.81324217423194]
複数の専門分野にまたがってタスクを適応的に委譲するLLM決定フレームワークを提案する。
まず、deferral Policyは、ベースモデルの回答を受け入れるか、あるいは大きなモデルでそれを再生するかを決定する。
第2に、禁忌ポリシーは、カスケードモデル応答が十分に確実であるか、または人間の介入を必要とするかを判定する。
論文 参考訳(メタデータ) (2025-06-13T15:36:22Z) - Human aversion? Do AI Agents Judge Identity More Harshly Than Performance [0.06554326244334868]
我々は,大規模言語モデルに基づくAIエージェントがどのように人間の入力を評価し,統合するかを検討する。
AIシステムは人間のアドバイスを体系的に減らし、アルゴリズムの誤りよりも人間の誤りを厳しく罰する。
論文 参考訳(メタデータ) (2025-03-31T02:05:27Z) - On Benchmarking Human-Like Intelligence in Machines [77.55118048492021]
現在のAI評価パラダイムは、人間のような認知能力を評価するには不十分である、と我々は主張する。
人為的なラベルの欠如、人間の反応の多様性と不確実性の表現の不適切な表現、単純で生態学的に無意味なタスクへの依存。
論文 参考訳(メタデータ) (2025-02-27T20:21:36Z) - Almost AI, Almost Human: The Challenge of Detecting AI-Polished Writing [55.2480439325792]
本研究では、AI-Polished-Text Evaluationデータセットを用いて、12の最先端AIテキスト検出器を体系的に評価する。
我々の発見によると、検出器は、最小限に洗練されたテキストをAI生成としてフラグ付けし、AIの関与度を区別し、古いモデルや小さなモデルに対するバイアスを示す。
論文 参考訳(メタデータ) (2025-02-21T18:45:37Z) - Does AI help humans make better decisions? A statistical evaluation framework for experimental and observational studies [0.43981305860983716]
我々は、人間とAI、AIの3つの代替意思決定システムのパフォーマンスを比較する方法を示す。
リスクアセスメントの勧告は、現金保釈を課す裁判官の決定の分類精度を向上しないことがわかった。
論文 参考訳(メタデータ) (2024-03-18T01:04:52Z) - Can Machines Imitate Humans? Integrative Turing-like tests for Language and Vision Demonstrate a Narrowing Gap [56.611702960809644]
3つの言語タスクと3つの視覚タスクで人間を模倣するAIの能力をベンチマークする。
次に,人間1,916名,AI10名を対象に,72,191名のチューリング様試験を行った。
模倣能力は従来のAIパフォーマンス指標と最小限の相関を示した。
論文 参考訳(メタデータ) (2022-11-23T16:16:52Z) - Effect of Confidence and Explanation on Accuracy and Trust Calibration
in AI-Assisted Decision Making [53.62514158534574]
ケース固有のモデル情報を明らかにする特徴が、信頼度を調整し、人間とAIのジョイントパフォーマンスを向上させることができるかどうかを検討する。
信頼スコアは、AIモデルに対する人々の信頼を校正するのに役立ちますが、信頼の校正だけでは、AI支援による意思決定を改善するには不十分です。
論文 参考訳(メタデータ) (2020-01-07T15:33:48Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。