論文の概要: Epistemic Transfer in AI-Assisted Verification: A Framework and Evaluation Protocol
- arxiv url: http://arxiv.org/abs/2608.08882v1
- Date: Sun, 09 Aug 2026 19:42:14 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:36.984543
- Title: Epistemic Transfer in AI-Assisted Verification: A Framework and Evaluation Protocol
- Title(参考訳): AIを用いた検証における疫学的伝達:フレームワークと評価プロトコル
- Authors: Christoph Trattner,
- Abstract要約: エピステマティック・トランスファー(英: epistemic transfer)とは、AIによる事前の検証が、後の新規クレームに対する非支援のパフォーマンスに与える影響をいう。
これらのアイデアを,オンライン実験やフィールドスタディで使用可能な,実践的な評価プロトコルに変換する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: AI tools that help people judge online claims are usually evaluated while the tool is present. This paper asks a different question: after using such a tool, what can the user still do on their own? I call this epistemic transfer. It refers to the effect of prior AI-assisted verification on later unassisted performance on new claims. In this paper, I make three contributions. First, I distinguish epistemic transfer from nearby outcomes such as correction effects, trust, reliance, and human--AI team performance. Second, I introduce two simple quantities for studying it: the Epistemic Transfer Effect (ETE), which compares delayed unassisted performance across conditions, and Tool-Removal Cost (TRC), which measures the immediate drop in performance when the tool is taken away. Third, I turn these ideas into a practical evaluation protocol that can be used in online experiments or field studies. The protocol combines answer-first and evidence-first AI conditions with active-practice and no-practice controls, delayed tests on held-out claims, behavioral measures, and participant- and item-level analyses. Putting ETE and TRC together yields a diagnostic space that separates capability building, capability plus tool advantage, epistemic inertness or de-skilling, and verification on loan. The point is not that every AI tool must teach. The point is that when independent judgment matters, we should test not only whether a tool helps now, but also what it leaves behind.
- Abstract(参考訳): オンラインクレームの判断を支援するAIツールは、通常、ツールが存在する間に評価される。
このようなツールを使用した後も,ユーザ自身で何ができるのか?
私はこれをてんかんと呼ぶ。
これは、AI支援前の検証が、後の新規クレームに対する非支援のパフォーマンスに与える影響を指している。
本稿では3つのコントリビューションを行います。
まず, 矯正効果, 信頼度, 信頼度, 人間-AIチームのパフォーマンスなど, 近隣の成果とを区別する。
第2に, その研究に要する簡易な量として, 治療の遅れを比較検討するEtestemic Transfer Effect (ETE) と, ツールが取り去られた際の即時パフォーマンス低下を測定するProto-Demoval Cost (TRC) の2つを紹介した。
第3に、これらのアイデアを、オンライン実験やフィールドスタディで使用できる実践的な評価プロトコルに変換する。
このプロトコルは、回答ファーストとエビデンスファーストのAI条件を、アクティブな実践的および非実践的なコントロール、保留条件の遅延テスト、行動測定、参加者とアイテムレベルの分析と組み合わせる。
ETEとTRCを併用すると、能力構築、能力とツールの優位性、認識上の不正確さや非熟練化、ローンによる検証を分離する診断空間が得られる。
重要なのは、すべてのAIツールが教えなければならないわけではない。
重要なのは、独立した判断が重要である場合、ツールが現在役に立つかどうかをテストするだけでなく、残されたものをテストするべきだということです。
関連論文リスト
- MedCTA: A Benchmark for Clinical Tool Agents [47.47354499871572]
MedCTA(MedCTA)は,臨床医が有する段階的作業における医療ツールエージェントの評価のためのベンチマークである。
MedCTAは、実世界の107の臨床的タスクと、臨床者が検証した5つのデプロイツール以上の実行可能な軌道から構成される。
我々は18のオープンソースおよびクローズドソースマルチモーダルモデルをベンチマークし、フロンティアシステムでさえもマルチステップ臨床ツールの使用において脆弱であることを発見した。
論文 参考訳(メタデータ) (2026-06-10T06:26:52Z) - Framing, Judging, Steering: An Assessable Competency Model for Teach-ing Students to Reason With Generative AI [47.027290803102666]
生産的AI利用を3つの評価可能なスキルに分解する能力モデルであるCoRe-3(Co-Reasoning)を提案する。
理論上のスキルを基盤として、5つのテスト可能な提案を述べ、それらをCoReasoningLabでインスタンス化します。
人為的な合意と成果が次々に行われます。私たちは、計測器、データ、プロトコルをリリースします。
論文 参考訳(メタデータ) (2026-06-04T10:25:31Z) - Offloading Score: Measuring AI Reliance Through Counterfactual Workflows [70.84727355516559]
私たちは、AIツールにオフロードされた認知活動の分断を定量化する、信頼度尺度であるオフロードスコアを導入します。
本研究は,本質的な計量妥当性評価と制御されたユーザスタディにより,オフロードスコアの検証を行う。
オフロードスコアは、時間制約設定における依存度を著しく高めることを示す。
論文 参考訳(メタデータ) (2026-05-28T05:44:31Z) - MedAI: Evaluating TxAgent's Therapeutic Agentic Reasoning in the NeurIPS CURE-Bench Competition [6.191248426050678]
臨床医学における治療的意思決定には、信頼できるバイオメディカル知識に基づく堅牢で多段階の推論が必要である。
TxAgentによって実証されたエージェントAI手法は、反復的検索強化生成(RAG)を通じてこれらの課題に対処する。
本研究はCURE-Bench NeurIPS 2025 Challengeへの参加から得られた知見を提示する。
論文 参考訳(メタデータ) (2025-12-12T16:01:48Z) - Impatient Users Confuse AI Agents: High-fidelity Simulations of Human Traits for Testing Agents [58.00130492861884]
TraitBasisは、AIエージェントを体系的にストレステストするための軽量でモデルに依存しない方法である。
TraitBasisは、ステアブルなユーザ特性に対応するアクティベーション空間で方向を学習する。
We observed on average a 2%-30% performance degradation on $tau$-Trait across frontier model。
論文 参考訳(メタデータ) (2025-10-06T05:03:57Z) - Beyond Black-Box AI: Interpretable Hybrid Systems for Dementia Care [2.4339626079536925]
近年の大規模言語モデル(LLM)のブームは、人工知能(AI)システムが医療診断に役立つという期待を再燃させた。
ベンチマークスコアはめちゃくちゃですが、LCMアシスタントはまだベッドサイドで測定可能な改善を提供していません。
このスクーピングレビューは、臨床現場で実践的な貢献をするためにAIが制限されている領域を強調することを目的としている。
論文 参考訳(メタデータ) (2025-07-02T01:43:06Z) - AUTO: Adaptive Outlier Optimization for Test-Time OOD Detection [79.51071170042972]
Out-of-Distribution (OOD) 検出は、任意のトレーニングインディストリビューション(ID)クラスに該当しないテストサンプルを検出することを目的としている。
データ安全性とプライバシにより、さまざまなシナリオに対して、事前にタスク固有の外れ値の収集が不可能になる。
テスト中にラベルのないデータストリームから実際のOODデータを利用することができる。
論文 参考訳(メタデータ) (2023-03-22T02:28:54Z) - Machine Learning for Utility Prediction in Argument-Based Computational
Persuasion [17.214664783818677]
医療などの実際のアプリケーションでは、APSとユーザにとって、対話の結果が同じ、あるいは正反対になる可能性は低い。
ユーザからの情報を活用してユーティリティを予測する2つの機械学習手法を開発した。
本研究は,健康な食生活に関するシミュレーション環境と現実的なケーススタディにおいて,EAIとEDSを評価した。
論文 参考訳(メタデータ) (2021-12-09T14:28:54Z) - Dynamic Causal Effects Evaluation in A/B Testing with a Reinforcement
Learning Framework [68.96770035057716]
A/Bテスト(A/B Testing)は、新しい製品を製薬、技術、伝統産業の古い製品と比較するビジネス戦略である。
本稿では,オンライン実験においてA/Bテストを実施するための強化学習フレームワークを提案する。
論文 参考訳(メタデータ) (2020-02-05T10:25:02Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。