論文の概要: xDailyBench: Benchmarking LLMs on Professional Consultation for Real-Life Problems
- arxiv url: http://arxiv.org/abs/2609.07784v1
- Date: Mon, 07 Sep 2026 17:30:58 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-10 19:44:08.491994
- Title: xDailyBench: Benchmarking LLMs on Professional Consultation for Real-Life Problems
- Title(参考訳): xDailyBench: リアルタイム問題のためのプロフェッショナルコンサルテーションに関するLLMのベンチマーク
- Abstract要約: xDailyBenchは、個人生活、ホワイトカラーワーク、学習と研究、ドメイン横断アクティビティなど、51のシナリオにまたがる248の慎重にキュレートされたタスクのベンチマークである。
これらのタスクは、ユーザがAIで実際に完了した、あるいは真に達成することを意図した要求に基づいており、明示的な要件と暗黙的な要件の両方をカバーする、きめ細かいバイナリルーブリックで評価される。
最高のモデルではタスクレベルのスコアが75.6%に達し、すべてのモデルは明示的な要件よりも暗黙的にパフォーマンスが悪く、ギャップは9ポイント以下である。
- 参考スコア(独自算出の注目度): 57.62172039072062
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Large language models (LLMs) are increasingly used for everyday assistance, yet existing benchmarks only partially reflect the requests users naturally make in practice. Real-world requests are often open-ended, casually specified, and context-dependent, requiring models not only to follow explicit instructions but also to infer unstated needs from user background and situational context. We introduce xDailyBench, a benchmark of 248 carefully curated tasks spanning 51 scenarios across personal life, white-collar work, learning and research, and cross-domain activities. The tasks are grounded in requests that users have actually completed or genuinely intended to accomplish with AI, and are evaluated with fine-grained binary rubrics covering both explicit and implicit requirements. We evaluate 11 frontier models under standardized agentic settings. The best models achieve a task-level score of 75.6\%, while all models perform substantially worse on implicit than explicit requirements, with gaps no less than 9 percentage points. These results reveal implicit requirement inference as a persistent bottleneck for reliably satisfying real-world everyday user needs.
- Abstract(参考訳): 大きな言語モデル(LLM)は日々の補助にますます使われていますが、既存のベンチマークでは、ユーザが実際に行う要求を部分的に反映しています。
実世界の要求は、しばしばオープンエンド、カジュアルに指定され、コンテキスト依存であり、明示的な指示に従うだけでなく、ユーザのバックグラウンドや状況に応じたニーズを推測する必要がある。
xDailyBenchは、個人生活、ホワイトカラーワーク、学習と研究、ドメイン横断アクティビティなど、51のシナリオにまたがる248の慎重にキュレートされたタスクのベンチマークである。
これらのタスクは、ユーザがAIで実際に完了した、あるいは真に達成することを意図した要求に基づいており、明示的な要件と暗黙的な要件の両方をカバーする、きめ細かいバイナリルーブリックで評価される。
標準化されたエージェント設定の下で,11のフロンティアモデルを評価する。
最高のモデルではタスクレベルのスコアが75.6\%に達し、すべてのモデルでは明示的な要求よりも暗黙的にパフォーマンスが悪く、ギャップは9ポイント以下である。
これらの結果は,現実の日々のユーザニーズを確実に満たすために,暗黙の要求推論が永続的なボトルネックであることを示している。
関連論文リスト
- AppWorld-UL: Benchmarking Diverse Agent-User Interactions for Tool-Use [38.67550182213879]
AppWorld-ULは、多様なエージェント-ユーザインタラクションを必要とする516の課題のベンチマークである。
我々の評価によると、最先端のLLMであるClaude Opus 4.7は、AppWorld-ULでわずか48.6%の成功しか達成していない。
このことは、ベンチマークの難しさと、ユーザ・イン・ザ・ループ・ツール・エージェントの研究を前進させる可能性を示している。
論文 参考訳(メタデータ) (2026-07-10T16:55:04Z) - Automatically Evolving Prompt Guidelines for Task-Specific Optimization [12.329476612271442]
大規模な言語モデルでは、ユーザクエリは不特定であることが多い。
既存の緊急エンジニアリングガイドラインは、この問題を緩和することを目的としており、典型的には汎用的でタスクに依存しない。
最適化手法を用いてタスク固有のガイドラインを進化させる自動アプローチであるAGOPSを提案する。
論文 参考訳(メタデータ) (2026-05-07T15:50:42Z) - CCTU: A Benchmark for Tool Use under Complex Constraints [66.87622847854337]
複雑な制約下での大規模言語モデル(LLM)を評価するためのベンチマークであるCCTUを紹介する。
ベンチマークは、さまざまなツール使用シナリオに対して、慎重にキュレートされ、挑戦的なテストケースが200から成っている。
ステップレベルの検証を行い、コンプライアンスを強制する実行可能な制約検証モジュールを開発する。
論文 参考訳(メタデータ) (2026-03-16T14:05:13Z) - LiveAgentBench: Comprehensive Benchmarking of Agentic Systems Across 104 Real-World Challenges [34.17635007594549]
実ユーザ要求を反映した104のシナリオを備えた総合ベンチマークであるLiveAgentBenchを紹介します。
ソーシャルメディアや現実世界の製品に関する公開の質問から構築されている。
このリリースには374のタスクと125のバリデーション、249のテストが含まれている。
論文 参考訳(メタデータ) (2026-03-03T04:03:05Z) - GISA: A Benchmark for General Information-Seeking Assistant [102.30831921333755]
GISAは汎用情報検索アシスタントのベンチマークであり、373の人為的なクエリで構成されている。
深い推論と広範囲な情報集約を統合タスクに統合し、暗記に抵抗するために定期的に更新された回答を含むライブサブセットを含む。
主要なLCMと商用検索製品の実験では、最高のパフォーマンスモデルでさえ19.30%の正確なマッチスコアしか達成していないことが示されている。
論文 参考訳(メタデータ) (2026-02-09T11:44:15Z) - CL-bench: A Benchmark for Context Learning [152.2879060355882]
この能力は人間が自然に持っているが、ほとんど見過ごされている重要な能力である。
我々は,500のコンテキスト,1,899のタスク,31,607の検証からなる実世界のベンチマークであるCL-benchを紹介する。
CL-benchは、この基本的な能力でLMを構築するためのステップであり、よりインテリジェントで、現実のシナリオでのデプロイメントを前進させる。
論文 参考訳(メタデータ) (2026-02-03T14:37:47Z) - What Users Leave Unsaid: Under-Specified Queries Limit Vision-Language Models [10.883552856100684]
韓国のオンラインコミュニティから,実世界の653の視覚的質問のベンチマークであるHAERAE-Visionを紹介した。
最先端モデル (GPT-5, Gemini 2.5 Pro) でさえも、元のクエリでは50%以下であることがわかった。
論文 参考訳(メタデータ) (2026-01-07T02:33:03Z) - OmniEAR: Benchmarking Agent Reasoning in Embodied Tasks [52.87238755666243]
OmniEARは,言語モデルが身体的相互作用やツールの使用,マルチエージェントの協調にどう影響するかを評価するためのフレームワークである。
我々は、家庭と工業領域にまたがる1500のシナリオにおける連続的な物理的特性と複雑な空間的関係をモデル化する。
我々の体系的な評価は、モデルが制約から推論しなければならない場合、厳しい性能劣化を示す。
論文 参考訳(メタデータ) (2025-08-07T17:54:15Z) - The Ability of Large Language Models to Evaluate Constraint-satisfaction in Agent Responses to Open-ended Requests [0.6249768559720121]
我々は,新しいArithmetic Constraint-Satisfaction(ACS)ベンチマークデータセットを開発し,リリースする。
このデータセットは、対応する制約を持つ複雑なユーザリクエスト、エージェント応答、応答における各制約の満足度を示すヒューマンラベルで構成されている。
ほとんどのモデルにはまだ改善のための重要なヘッドルームがあることを示し、エラーは主に推論の問題に起因する。
論文 参考訳(メタデータ) (2024-09-22T09:27:42Z) - Can Long-Context Language Models Subsume Retrieval, RAG, SQL, and More? [54.667202878390526]
長文言語モデル(LCLM)は、従来、検索システムやデータベースといった外部ツールに依存していたタスクへのアプローチに革命をもたらす可能性がある。
実世界のタスクのベンチマークであるLOFTを導入し、文脈内検索と推論においてLCLMの性能を評価するために設計された数百万のトークンを出力する。
以上の結果からLCLMは,これらのタスクを明示的に訓練したことがないにも関わらず,最先端の検索システムやRAGシステムと競合する驚くべき能力を示した。
論文 参考訳(メタデータ) (2024-06-19T00:28:58Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。