論文の概要: Human-in-the-Loop Nugget Annotation for Accountable LLM-as-a-Judge Evaluations
- arxiv url: http://arxiv.org/abs/2606.29033v1
- Date: Sat, 27 Jun 2026 18:04:34 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-30 18:07:15.76494
- Title: Human-in-the-Loop Nugget Annotation for Accountable LLM-as-a-Judge Evaluations
- Title(参考訳): LLM-as-a-Judge評価のためのHuman-in-the-Loop Nugget Annotation
- Abstract要約: 人間は情報(ナゲット)が何を意味するのかを識別する。
3段階のワークフロー、重要な設計決定、輸出されたナゲットバンクが自動化された審査員とどのように統合されるかを説明する。
- 参考スコア(独自算出の注目度): 6.370136771039005
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: Evaluating AI/Agentic system outputs reliably requires human judgment, but how one incorporates the human determines whether one gets a real quality signal or expensive theater. The common approaches either accidentally anchor human experts (leading to rubber-stamping) or leave them unsupported in high-variance labeling tasks. We present a prototype annotation tool that implements a different division of labor: humans identify what information matters (nuggets), while LLMs handle high-volume matching of nuggets to system outputs. This plays to each party's strengths while maintaining genuine human oversight. We describe the three-phase workflow, key design decisions, and how exported nugget banks integrate with automated judges.
- Abstract(参考訳): AI/AIシステムの出力を確実に評価するには、人間の判断が必要だが、どのように人間を組み込むかによって、本物の品質の信号か高価な劇場かが決定される。
一般的なアプローチは、誤って人間の専門家を(ゴム製スタンピングに導いた)固定するか、高分散ラベリングタスクでそれらをサポートしないかのどちらかです。
そこで本研究では,人間による情報(ナゲット)の特定と,システム出力に対するナゲットの高ボリュームマッチング処理を行うプロトタイプアノテーションツールを提案する。
これは、真の人間の監視を維持しながら、各党の強みに反する。
3段階のワークフロー、重要な設計決定、輸出されたナゲットバンクが自動化された審査員とどのように統合されるかを説明する。
関連論文リスト
- Gold Points Sniper: Self-guided Visual Reasoning in VLM for Fine-grained Action Understanding [30.463645590107035]
Gold Points Sniper (GPS)は、自己誘導型マルチモーダル推論機能を備えた軽量な視覚言語モデルを促進する新しいフレームワークである。
我々の研究は、ロボットが人間の行動を安全に解釈できるように、家庭内ロボティクスにおけるきめ細かい行動理解のための信頼性の高い基盤を確立する。
論文 参考訳(メタデータ) (2026-06-21T09:54:39Z) - Multi-Agent Evolve: LLM Self-Improve through Co-evolution [53.00458074754831]
強化学習(RL)は、大規模言語モデル(LLM)の推論能力を高める大きな可能性を証明している。
近年のSelf-Play RL法は,ゲームやGoのパラダイムの成功に触発されて,人間に注釈を付けることなくLSM推論能力を向上することを目指している。
数学,推論,一般知識Q&Aなど多種多様な課題の解決において,LLMが自己発展できるフレームワークであるMulti-Agent Evolve(MAE)を提案する。
論文 参考訳(メタデータ) (2025-10-27T17:58:02Z) - Human-MME: A Holistic Evaluation Benchmark for Human-Centric Multimodal Large Language Models [118.44328586173556]
MLLM(Multimodal Large Language Models)は視覚的理解タスクにおいて大きな進歩を見せている。
Human-MMEは、人間中心のシーン理解におけるMLLMのより総合的な評価を提供するために設計された、キュレートされたベンチマークである。
我々のベンチマークは、単一対象の理解を多対多の相互理解に拡張する。
論文 参考訳(メタデータ) (2025-09-30T12:20:57Z) - Modeling Human Responses to Multimodal AI Content [10.65875439980452]
MhAIMデータセットには154,552のオンラインポストが含まれている(うち111,153がAI生成)
私たちの人間による研究は、投稿にテキストとビジュアルの両方が含まれている場合、人々はAIコンテンツを特定するのがより優れていることを示している。
マルチモーダル情報に予測応答を組み込むことにより,ユーザの問い合わせに応答するエージェントシステムであるT-Lensを提案する。
論文 参考訳(メタデータ) (2025-08-14T15:55:19Z) - On the Effectiveness of LLM-as-a-judge for Code Generation and Summarization [54.965787768076254]
大規模言語モデルは、最近、Q&Aのような複雑な自然言語処理タスクの裁判官として活用されている。
コード生成とコード要約という2つのコード関連タスクに対するLLMs-as-a-judgeの有効性について検討した。
論文 参考訳(メタデータ) (2025-07-22T13:40:26Z) - Human aversion? Do AI Agents Judge Identity More Harshly Than Performance [0.06554326244334868]
我々は,大規模言語モデルに基づくAIエージェントがどのように人間の入力を評価し,統合するかを検討する。
AIシステムは人間のアドバイスを体系的に減らし、アルゴリズムの誤りよりも人間の誤りを厳しく罰する。
論文 参考訳(メタデータ) (2025-03-31T02:05:27Z) - Confidence-weighted integration of human and machine judgments for superior decision-making [1.4180680537405237]
大きな言語モデル(LLM)は、特定の予測タスクにおいて人間を上回ることができる。
1つの可能性として、人間はLSMよりも悪いパフォーマンスをしているにもかかわらず、チームで作業するときに価値を付加できる。
人間と機械のチームは、チームメンバーの自信が十分に調整されたときに、各チームメイトを追い越すことができます。
論文 参考訳(メタデータ) (2024-08-15T11:16:21Z) - CLOMO: Counterfactual Logical Modification with Large Language Models [109.60793869938534]
本稿では,新しいタスク,CLOMO(Counterfactual Logical Modification)と高品質な人間アノテーションベンチマークを紹介する。
このタスクでは、LLMは所定の論理的関係を維持するために、与えられた議論的テキストを順応的に変更しなければなりません。
LLMの自然言語出力を直接評価する革新的な評価指標である自己評価スコア(SES)を提案する。
論文 参考訳(メタデータ) (2023-11-29T08:29:54Z) - Designing Closed-Loop Models for Task Allocation [36.04165658325371]
我々は、ブートストラップモデルトレーニングと人間とタスクの類似性に関する弱い事前情報を利用する。
このような弱い事前の使用は、人間の意思決定者が誤りを犯したりバイアスを受けたりしても、タスク割り当て精度を向上させることができることを示す。
論文 参考訳(メタデータ) (2023-05-31T13:57:56Z) - Using Natural Language Explanations to Rescale Human Judgments [81.66697572357477]
大規模言語モデル(LLM)を用いて順序付けアノテーションと説明を再スケールする手法を提案する。
我々は、アノテータのLikert評価とそれに対応する説明をLLMに入力し、スコア付けルーリックに固定された数値スコアを生成する。
提案手法は,合意に影響を及ぼさずに生の判断を再スケールし,そのスコアを同一のスコア付けルーリックに接する人間の判断に近づける。
論文 参考訳(メタデータ) (2023-05-24T06:19:14Z) - Joint Inference of States, Robot Knowledge, and Human (False-)Beliefs [90.20235972293801]
本稿では,人間(時間的)・人間(時間的)・人間(時間的)・人間(時間的)・人間(時間的)・人間(時間的)・人間(時間的)・人間(時間的)・人間(時間的)・人間(時間的)・人間(時間的)・人間(時間的)の認知能力が,ロボットとの相互作用にどのように影響するかを理解するために,対象状態,ロボット知識,人間(時間的)の認知能力の表現にグラフィカルモデルを採用することを提案する。
推論アルゴリズムは、複数のビューにまたがる全てのロボットから個別のpgを融合し、単一のビューから発生したエラーを克服するより効果的な推論能力を得る。
論文 参考訳(メタデータ) (2020-04-25T23:02:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。