論文の概要: Measuring Proof Burden in Public Bounty Listings: A RentAHuman Case Study
- arxiv url: http://arxiv.org/abs/2608.18547v1
- Date: Wed, 19 Aug 2026 05:08:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-20 20:13:55.284602
- Title: Measuring Proof Burden in Public Bounty Listings: A RentAHuman Case Study
- Title(参考訳): 公益法人リスティングにおけるビルデンの実態調査 : RentAHuman のケーススタディ
- Abstract要約: 人間を雇うためのAIエージェントの場所として公表された2026年の市場であるRentAHumanで、広告付き要求証明の負担を計測する。
我々は、労働者が提出したり経験したりするものではなく、リスティングが要求するものを研究する。
- 参考スコア(独自算出の注目度): 0.3384279376065155
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Online bounty markets let requesters advertise paid tasks. Workers may be asked not just to complete a task but to prove it, and proof can mean exposure: revealing identity or location, using a personal account, posting publicly, acting in the physical world, or repeated evidence at later checks, none disclosed by the posted price. We call these advertised requirements proof burden and measure them on RentAHuman, a 2026 market publicized as a place for AI agents to hire humans. We study what listings request, not what workers submit or experience. We manually audited a nonrandom May 31, 2026 snapshot: every listing our searches returned from RentAHuman and Human Pages, another such market (981 listings, all but one from RentAHuman). Two independent coders recorded 13 features (11 kinds of evidence, recurring monitoring, physical-world action) and our 0-5 Proof Burden Score; a blinded third resolved all disagreements. A planned content screen leaves 779 bounty/task listings as the primary population; 438 (56.2%) score 4 or 5, spanning 154 distinct feature combinations: a checklist, not a single score, tells workers what a listing entails. Platform metadata labels some requester accounts as agents or bots. Exploratory comparisons show physical-world action, location proof, or recurring monitoring in 75.0% of agent-or-bot-labeled versus 55.3% of human-labeled listings, though score-4-or-5 shares did not clearly differ. The labels are self-reported or platform-assigned, the agent-or-bot-labeled listings come from only 20 displayed names, and the comparison was chosen post hoc, after seeing the data: a hypothesis, not a confirmed difference. We contribute the 13-requirement vocabulary, the adjudicated manual audit, and this descriptive case study; the score is a secondary screening summary. The study offers no worker-validated measure or automated detector yet.
- Abstract(参考訳): オンラインの報奨金市場は、依頼者が有償タスクを宣伝することを可能にする。
労働者は、タスクを完了させるだけでなく、それを証明するために要求されることもある。そして証明は、個人や場所を明らかにすること、個人アカウントを使用すること、公開投稿すること、物理的な世界で行動すること、または後続のチェックで繰り返し証拠を提出すること、といった露出を意味する。
私たちはこれらの宣伝された要求証明の負担を、AIエージェントが人間を雇う場所として公表された2026年の市場であるRentAHumanで評価する。
我々は、労働者が提出したり経験したりするものではなく、リスティングが要求するものを研究する。
私たちは2026年5月31日、RentAHumanとHuman Pages(981件、RentAHumanの1件を除く)から検索が返ってくるたびに、非ランダムなスナップショットを手動で監査しました。
2人の独立したコーダーが13の特徴(11種類の証拠、繰り返し監視、物理世界の動き)と0-5 Proof Burden Scoreを記録しました。
計画されたコンテンツ画面は779の報奨金/タスクリストを主要な人口として残しており、438(56.2%)のスコアは4または5であり、チェックリストは1つのスコアではなく154の異なる特徴の組み合わせにまたがっている。
プラットフォームメタデータは、いくつかの要求アカウントをエージェントまたはボットとしてラベル付けする。
探索的な比較では、75.0%のエージェント・オア・ボット・ラベル付きリストと55.3%の人間ラベル付きリストの物理世界行動、位置証明、または繰り返し監視が示されるが、スコア4・オア・5のシェアは明確には変わっていない。
ラベルはセルフレポーティングまたはプラットフォームアサインされ、エージェントまたはボットラベル付きリストは表示された名前のわずか20から作成され、データを見た後、比較が選択された。
本研究は,13-requirement vocabulary,adjudicated manual audit,およびこの記述的ケーススタディであり,スコアは二次スクリーニングの要約である。
この研究はまだ、労働者公認の計測や自動検出は提供していない。
関連論文リスト
- Scan the Skill, Govern the Action: Composing Registry Verdicts with Runtime Consequence Control [0.0]
135の異なるパブリッシャーの705のスキルは、スキャナーとレジストリの判断率はクリーンである。
ある出版社が705の506を寄付しているので、その数を報告します。
第3に、53以上のクリアドスキルにより、クリーンな記録が得られず、エージェントは23人に1人まで到達し、ゲートは23人全員を止めた。
論文 参考訳(メタデータ) (2026-09-10T00:19:04Z) - No Free Checker: A Survey of Verifiers for Robot Policies [37.86049134524515]
ロボットポリシーの検証者は、候補者の行動を読み出し、それがいかにうまくいったかのスコアを返し、視覚言語アクションポリシーの評価とトレーニングの両方に使用する。
約150個の検証器を調査し、2つの特性について比較する。
我々は, 人的検証者, 規則に基づく形式的検証者, 学習および事前訓練された検証者, モデル固有の検証者など, 判断を提供する者によって, 検証者をグループ化する。
論文 参考訳(メタデータ) (2026-09-08T13:52:59Z) - VeriPhy: Agentic Physical Reasoning for World Model Evaluation and Refinement [57.86962208273888]
テキストのみのプランナが入力された物理義務にプロンプトをコンパイルする監査可能な物理検証システムを提案する。
それぞれのアクションは、ペイロードがタイプされた測定か、明示的にタグ付けされた学習状態である証明付きエビデンスレコードを返す。
我々は, 実発生障害を即時参照, 空間, 時間でローカライズする, 1500クリックの欠陥記録のコーパスにおいて, 評価をアンロックする。
論文 参考訳(メタデータ) (2026-09-02T20:36:45Z) - Does Rank Still Matter? Position Bias When AI Agents Shop on Our Behalf [1.578081936353233]
消費者は検索結果ページ全体を一度に取り込むことができるAIエージェントに検索を委譲している。
4つの大きな言語モデルと人間のフィールドデータを比較した。
エージェント検索では、検索結果ページに表示される属性は、その中の配置よりも重要である。
論文 参考訳(メタデータ) (2026-08-24T01:22:28Z) - Who Verifies the Benchmark? Decentralizing Trust in Large Language Model Evaluation [0.4440305753099883]
調査によると、裁判官はアイデンティティを意識した偏見を示し、その質よりもソースモデルに従って回答をスコアする可能性がある。
58の事実, 推論, 政治的, 嗜好に基づく質問に対して, 3つの主要なモデルから, 匿名および個人識別対応の回答を収集した。
フェーズ1では、各審査員はそのスコアの一方のハッシュと、候補者の身元が明らかになる前に秘密のソルトを記録する。
フェーズ2では、アイデンティティと生のスコアが開示され、オンチェーンで検証される。
論文 参考訳(メタデータ) (2026-08-07T20:56:21Z) - Collusion with Competitive Marginals: Price-Level Audits Are Blind by Construction [6.3803164500885705]
共謀に関する実証研究は、データの1つに疑問を投げかけている。
いずれにせよ、これは利益がある陰謀によって「ノー」と答えられることを示す。
未説明入札成分の連立分布にのみ結合する入札エージェントを考える。
単一のエージェントの価格や入札履歴は、コモノトニティまで全ての結合強度に対して、その偽陽性率に完全に等しい力を持つ。
論文 参考訳(メタデータ) (2026-07-29T01:39:13Z) - Who Gets Named: Citation Type Predicts Individual Naming by Grounded Language Models, and a Roster Instrument Captures 0.5% of It [0.0]
2026年7月24日に1つの2時間窓で2,400件の接地APIコールを発行した。
すべてのレスポンスは、個別のプロフェッショナルを指名するかどうかによってコード化されました。
モデルは25.8%の回答で個人を指名した。
論文 参考訳(メタデータ) (2026-07-26T23:37:34Z) - ScientistOne: Towards Human-Level Autonomous Research via Chain-of-Evidence [57.37494162084001]
チェーン・オブ・エビデンス(Chain-of-Evidence, CoE)は、すべてのクレームがエビデンス・ソースにトレース可能であることを要求する検証可能なフレームワークである。
CoE Auditはポストホック監査であり、スコア検証、仕様違反、参照検証、メソッドコードアライメントという4つの整合性チェックが全システムに均一に適用される。
論文 参考訳(メタデータ) (2026-05-25T21:30:27Z) - FIKA-Bench: From Fine-grained Recognition to Fine-Grained Knowledge Acquisition [54.31138496553705]
日常生活におけるきめ細かい認識は、しばしばクローズドブックの分類問題ではない。
既存のベンチマークは主に視覚的認識を評価しており、このアクティブな外部知識獲得能力は過小評価されている。
そこでは,システムが外部の証拠を探し,検証し,利用し,オープンエンドのきめ細かい認識質問に答えなければならない,きめ細かな知識獲得について検討する。
論文 参考訳(メタデータ) (2026-05-13T08:49:51Z) - Do Phone-Use Agents Respect Your Privacy? [97.81424230136075]
我々は,モバイルエージェントのプライバシ行動を評価するための検証可能なフレームワークであるMyPhoneBenchを紹介する。
プライバシを無視する電話を、最小限のプライバシ契約によって許可されたアクセス、最小限の開示、およびユーザ制御メモリとして運用する。
10のモバイルアプリと300のタスクで5つのフロンティアモデルにまたがって、タスクの成功、プライバシに準拠したタスク補完、保存された好みの後での利用が、それぞれ異なる機能であることに気付きました。
論文 参考訳(メタデータ) (2026-04-01T14:50:50Z) - What do people want to fact-check? [10.451649710564775]
事実を確認したいものがあれば、実際に何について尋ねられるのか、私たちは示しています。
オープンなAIファクトチェックシステムに、457人の参加者が提出したステートメントを分析します。
まず、ユーザーは幅広いトピックにまたがるが、デフォルトでは狭いエピステマティックなレパートリーになり、現在のオブザーバブルに関する単純な記述的クレームを圧倒的に提出する。
第2に、およそ4人に1人が、道徳的判断、投機的予測、主観的評価など、経験的に解決できない声明に関する。
第3に、FEVERベンチマークデータセットとの比較では、すべての5次元にわたる鋭い構造分岐が露呈し、標準評価コーパスが合成クレーム環境を符号化していることを示す。
論文 参考訳(メタデータ) (2026-02-11T15:14:54Z) - Holistic Agent Leaderboard: The Missing Infrastructure for AI Agent Evaluation [87.47155146067962]
数百のタスクで並列評価をオーケストレーションする,標準化された評価ハーネスを提供する。
モデル、足場、ベンチマークにまたがる3次元解析を行う。
私たちの分析では、ほとんどのランで精度を低下させる高い推論努力など、驚くべき洞察が示されています。
論文 参考訳(メタデータ) (2025-10-13T22:22:28Z) - Claim Check-Worthiness Detection as Positive Unlabelled Learning [53.24606510691877]
クレームチェックの信頼性検出はファクトチェックシステムにおいて重要な要素である。
これらの課題の根底にあるクレームチェックの信頼性検出における中心的な課題を照明する。
我々の最良の手法は、正の非競合学習の変種を用いて、これを自動的に修正する統一的なアプローチである。
論文 参考訳(メタデータ) (2020-03-05T16:06:07Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。