論文の概要: Measuring Intelligence Beyond Human Scale
- arxiv url: http://arxiv.org/abs/2607.07040v1
- Date: Wed, 08 Jul 2026 06:19:10 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-09 22:50:30.302953
- Title: Measuring Intelligence Beyond Human Scale
- Title(参考訳): 人間の規模を超えて知能を測定する
- Abstract要約: 人間の能力を超えたインテリジェンスを測定するには?
人間が作成したベンチマークは飽和しており、人間の能力より上、検査官はどのタスクが困難で検証可能であるかを知らないかもしれない。
モデルが他のシステムを分離する公開課題を発生させる相対的測定に基づく新しいパラダイムを提案する。
- 参考スコア(独自算出の注目度): 10.592096146800555
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: How can we measure intelligence beyond human capability? Human-authored benchmarks saturate, and above human capability, examiners may not know which tasks are both hard and verifiable. We argue that this difficulty is inherent to absolute-scale evaluation and propose a new paradigm based on relative measurement in which models generate public challenges that separate other systems. Aggregating these outcomes yields an adversarial psychometric rating system that can scale with the systems being measured. We describe practical protocols that reduce incentives for private-information attacks, support judge-free adjudication, and naturally scale with agent capabilities. We instantiate the framework across verifiable and open-ended, non-verifiable domains, illustrating how model-generated evaluation can continue to measure systems beyond the human frontier.
- Abstract(参考訳): 人間の能力を超えたインテリジェンスを測定するには?
人間が作成したベンチマークは飽和しており、人間の能力より上、検査官はどのタスクが困難で検証可能であるかを知らないかもしれない。
この難しさは絶対規模の評価に固有のものであり、モデルが他のシステムを分離する公開課題を生成する相対的な測定に基づく新しいパラダイムを提案する。
これらの結果の集約は、測定されるシステムとスケール可能な対向的な心理測定評価システムをもたらす。
本稿では,私的情報攻撃のインセンティブを減らし,判断自由判断をサポートし,エージェント能力で自然に規模を拡大する実践的プロトコルについて述べる。
検証可能で、未検証の領域にまたがってフレームワークをインスタンス化し、モデル生成評価が人間のフロンティアを超えてシステムを測定する方法を示します。
関連論文リスト
- Pitfalls in Evaluating Interpretability Agents [91.49742416116635]
我々は,実験を反復的に設計し,仮説を洗練するエージェントシステムを構築した。
我々の研究は、複雑な自動解釈可能性システムを評価する上での根本的な課題を実証している。
論文 参考訳(メタデータ) (2026-03-20T16:27:17Z) - From Accuracy to Readiness: Metrics and Benchmarks for Human-AI Decision-Making [0.5153774021264936]
実証的な証拠は、多くの失敗が誤った信頼から生じることを示している。
本稿では,チーム準備を主眼とした人間とAIの意思決定を評価するためのフレームワークを提案する。
論文 参考訳(メタデータ) (2026-03-19T13:35:29Z) - Measuring What AI Systems Might Do: Towards A Measurement Science in AI [19.687397197326817]
能力、妥当性、スキル、価値、能力は、常に相互に使用され、観測可能なパフォーマンスと混同されます。
我々は、能力と妥当性は、反事実関係によって特徴づけられるシステムの安定した特徴である配置特性であると主張する。
論文 参考訳(メタデータ) (2026-02-10T12:59:41Z) - Variance-Bounded Evaluation of Entity-Centric AI Systems Without Ground Truth: Theory and Measurement [0.0]
本稿では,エンティティ中心型AIシステムのための分散境界評価フレームワークであるVB-Scoreを紹介する。
VB-Scoreは制約緩和とモンテカルロサンプリングを通じて可算解釈を列挙する。
そして、システムの堅牢性を評価するために、システムアウトプットを解釈を越えて予測される成功によって評価し、分散によって罰する。
論文 参考訳(メタデータ) (2025-09-26T07:54:38Z) - Evaluating Generative AI Systems is a Social Science Measurement Challenge [78.35388859345056]
我々は,GenAIシステムの能力,影響,機会,リスクに関連する概念を測定するための枠組みを提案する。
このフレームワークは、背景概念、体系化された概念、測定器、インスタンスレベルの測定そのものの4つのレベルを区別する。
論文 参考訳(メタデータ) (2024-11-17T02:35:30Z) - Benchmarks as Microscopes: A Call for Model Metrology [76.64402390208576]
現代の言語モデル(LM)は、能力評価において新たな課題を提起する。
メトリクスに自信を持つためには、モデルミアロジの新たな規律が必要です。
論文 参考訳(メタデータ) (2024-07-22T17:52:12Z) - Evaluating General-Purpose AI with Psychometrics [43.85432514910491]
本稿では,大規模言語モデルなどの汎用AIシステムの包括的かつ正確な評価の必要性について論じる。
現在の評価手法は、主に特定のタスクのベンチマークに基づいており、これらの汎用AIシステムを適切に評価するには不十分である。
これらの課題に対処するため,タスク指向評価から構成指向評価への移行を提案する。
論文 参考訳(メタデータ) (2023-10-25T05:38:38Z) - Position: AI Evaluation Should Learn from How We Test Humans [65.36614996495983]
人間の評価のための20世紀起源の理論である心理測定は、今日のAI評価における課題に対する強力な解決策になり得る、と我々は主張する。
論文 参考訳(メタデータ) (2023-06-18T09:54:33Z) - Human Uncertainty in Concept-Based AI Systems [37.82747673914624]
概念に基づくAIシステムのコンテキストにおける人間の不確実性について検討する。
不確実な概念ラベルによるトレーニングは、概念ベースシステムにおける弱点を軽減するのに役立つ可能性がある。
論文 参考訳(メタデータ) (2023-03-22T19:17:57Z) - Empirical Estimates on Hand Manipulation are Recoverable: A Step Towards
Individualized and Explainable Robotic Support in Everyday Activities [80.37857025201036]
ロボットシステムの鍵となる課題は、他のエージェントの振る舞いを理解することである。
正しい推論の処理は、(衝突)因子が実験的に制御されない場合、特に困難である。
人に関する観察研究を行うために必要なツールをロボットに装備することを提案する。
論文 参考訳(メタデータ) (2022-01-27T22:15:56Z) - An Uncertainty-based Human-in-the-loop System for Industrial Tool Wear
Analysis [68.8204255655161]
人間のループシステムにおけるモンテカルロのドロップアウトに基づく不確実性対策により,システムの透明性と性能が向上することを示す。
シミュレーション研究により、不確実性に基づく「ループ内人間システム」は、様々なレベルの人間の関与に対する性能を高めることが示されている。
論文 参考訳(メタデータ) (2020-07-14T15:47:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。