論文の概要: Judgement in the Age of Jev: From Evaluation Scarcity to Evaluation Abundance
- arxiv url: http://arxiv.org/abs/2610.01231v1
- Date: Thu, 01 Oct 2026 07:31:52 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 01:19:23.968011
- Title: Judgement in the Age of Jev: From Evaluation Scarcity to Evaluation Abundance
- Title(参考訳): Jev時代の判断:評価の空白から評価の空白まで
- Abstract要約: 生成的人工知能は、可塑性の象徴的アーティファクトを製造するコストを削減した。
本稿では,機械評価自体が日常的かつ大規模に展開できるほど安価になる可能性を検討する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: Generative artificial intelligence has reduced the cost of producing plausible symbolic artefacts, leading recent organisation scholarship to identify evaluation and discernment as constraints under conditions of production abundance. This perspective examines a further possibility: that machine evaluation itself becomes inexpensive enough to be deployed routinely and at scale. The investigation is prompted by Jev, TypeSafe AI's specialised model for typed probabilistic decisions. TypeSafe explicitly invokes William Stanley Jevons to argue that lower-cost machine intelligence can unlock previously uneconomic uses. Treating this as a technological provocation rather than an established empirical result, the article formulates a conditional Jevons hypothesis for machine evaluation: sufficiently large reductions in the total marginal cost of usable machine evaluation may increase its organisational consumption where latent demand is substantial and complementary costs do not dominate. The article integrates rebound economics with research on cheap prediction, production abundance, machine evaluation, decision allocation, authority, reliance and Executive Judgement to examine this possible scarcity transition. It distinguishes prediction, machine evaluation, organisational judgement and authorisation as functional activities whose costs need not fall together. Evaluations can share evidence, criteria and errors; scale mis-specified rubrics; operate on representations from which consequential qualifications have disappeared; and change practical decision rights through thresholds and exception routing. The resulting research problem is when cheap machine evaluation substitutes for human evaluative work, when it redistributes or creates demands for judgement, and how it affects the grounds available at consequential organisational commitment.
- Abstract(参考訳): 生成的人工知能は、可塑性の象徴的アーティファクトを製造するコストを削減し、近年の奨学金は、生産量の条件下での評価と識別を制約として識別する。
この観点では、マシン評価自体が日常的かつ大規模に展開できるほど安価になる可能性についても検討している。
この調査は、型付き確率決定のためのTypeSafe AIの特別モデルであるJevによって進められている。
TypeSafeはウィリアム・スタンリー・ジェヴォンズ(William Stanley Jevons)氏に、低コストのマシンインテリジェンスがかつての非経済的使用をアンロックできると主張している。
これを実証的な結果ではなく技術的挑発として扱うことで、機械評価のための条件付きジェボンズ仮説を定式化し、使用可能な機械評価の総限界コストを十分に削減することで、潜在需要が実質的で相補的コストが支配的でない組織消費を増大させることができる。
この論文は、リバウンド経済学と、安価な予測、生産量、機械評価、決定割り当て、権威、信頼、執行的判断に関する研究を統合して、この可能性の希少化について検討する。
予測、機械評価、組織的判断、承認を、コストが集まらない機能的な活動として区別する。
評価はエビデンス、基準、エラーを共有し、誤特定されたルーリックをスケールし、連続的な資格が消滅した表現を運用し、しきい値と例外のルーティングを通じて実用的な決定権を変更することができる。
結果として生じる研究課題は、安価な機械による評価が人間の評価作業に取って代わられる場合、それが再分配される場合、または判断の要求が生じる場合、そして、それがその後の組織的なコミットメントで利用可能な土台にどのように影響するかである。
関連論文リスト
- Authority-Preserving Evaluation of Medical Vision-Language Assistants [69.11739400975445]
提案品質と選択された行動品質は、異なる評価対象である。
我々は、両方のアクションを記録するフレームワークAuthEvalを紹介し、宣言された局所的基準の下で選択されたアクションをスコアし、実行可能であれば、同じルールで辞退した提案をスコアする。
論文 参考訳(メタデータ) (2026-09-14T19:17:23Z) - AI Evaluation Should Measure Verification Cost, Not Correctness Alone [1.3124513975412253]
私たちは、現在の評価指標が重大な障害モードを見落としていると論じています。
VCEは、出力自体のいかなる特性よりも、予算内での正確な識別の失敗によって、運用的に定義される。
論文 参考訳(メタデータ) (2026-08-09T13:44:26Z) - Beyond Rating: A Comprehensive Evaluation and Benchmark for AI Reviews [69.66583722746904]
私たちは、AIレビュアーを5次元にわたって評価する総合的な評価フレームワークであるBeyond Ratingを紹介します。
本稿では,専門家の不一致に対応するためのMax-Recall戦略を提案する。
提案したテキスト中心の指標は、特に弱みの議論のリコールであり、評価精度と強く相関している。
論文 参考訳(メタデータ) (2026-04-21T14:21:15Z) - The human-machine paradox: how collaboration creates or destroys value, and why augmentation is key to resolving it [0.0]
我々は、人間機械技術政策の真のボトムライン経済効果は、危険なほど誤解されていると論じる。
以上の結果から, 複雑なシナリオにおいては, 人的機械戦略が最も経済的に有効であるが, 真の拡張が達成された場合に限る。
論文 参考訳(メタデータ) (2025-09-17T15:03:39Z) - Automatic Reviewers Fail to Detect Faulty Reasoning in Research Papers: A New Counterfactual Evaluation Framework [55.078301794183496]
我々は、高品質なピアレビューを支えるコアレビュースキル、すなわち欠陥のある研究ロジックの検出に注力する。
これは、論文の結果、解釈、クレームの間の内部の一貫性を評価することを含む。
本稿では,このスキルを制御条件下で分離し,テストする,完全自動対物評価フレームワークを提案する。
論文 参考訳(メタデータ) (2025-08-29T08:48:00Z) - Cost-Optimal Active AI Model Evaluation [71.2069549142394]
生成AIシステムの開発には、継続的な評価、データ取得、アノテーションが必要である。
我々は、安価だがしばしば不正確で弱いレーダの使用を積極的にバランスさせる新しいコスト認識手法を開発した。
我々は、弱者と強者の間で所定のアノテーション予算を割り当てるためのコスト最適化政策のファミリーを導出する。
論文 参考訳(メタデータ) (2025-06-09T17:14:41Z) - An Identifiable Cost-Aware Causal Decision-Making Framework Using Counterfactual Reasoning [18.324601057882386]
そこで本研究では,最小コスト因果決定(MiCCD)フレームワークを提案する。
混合異常データの存在を識別する反ファクト的推論プロセスに重点を置いている。
MiCCDは、F1スコア、コスト効率、ランキング品質(nDCG@k値)など、従来の手法よりも優れています。
論文 参考訳(メタデータ) (2025-05-13T08:41:45Z) - Early-Exit and Instant Confidence Translation Quality Estimation [46.13074343863971]
本研究では,(1)スケールにおける品質推定のコスト削減,(2)品質推定のための安価な不確実性推定手法の開発,という2つの課題に対処する。
後者に対処するため,従来の手法の性能を若干のコストで一致させる不確実性を考慮した品質評価モデルであるInstant Confidence COMETを導入する。
我々はこれを、初期のモデル層ですでに品質スコアと関連する信頼度を計算できる品質評価モデルであるEarly-Exit COMETに拡張し、計算の早期実行と評価コストの削減を可能にします。
論文 参考訳(メタデータ) (2025-02-20T10:27:13Z) - No Bidding, No Regret: Pairwise-Feedback Mechanisms for Digital Goods
and Data Auctions [14.87136964827431]
本研究は, 一般的な繰り返しオークション設定に対処する新しいメカニズムを提案する。
メカニズムの新規性は、入札者から情報を引き出すためにペアワイズ比較を使用することにある。
ヒューマンファクターに焦点が当てられていることは、よりヒューマン・アウェアで効率的なメカニズム設計の発展に寄与する。
論文 参考訳(メタデータ) (2023-06-02T18:29:07Z) - Credal Valuation Networks for Machine Reasoning Under Uncertainty [0.6307485015636124]
本稿では,高レベル融合と不確実性を考慮した推論のためのグラフィカルシステムとして評価ネットワークを開発する。
干潟評価ネットワークの実践的実装について論じ,その実用性は小規模な実例で実証された。
論文 参考訳(メタデータ) (2022-08-04T04:33:16Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。