論文の概要: CompanionBench: A Theory-Anchored, Real-World-Grounded Benchmark for AI Emotional Companionship
- arxiv url: http://arxiv.org/abs/2608.02046v2
- Date: Wed, 05 Aug 2026 09:18:25 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.136263
- Title: CompanionBench: A Theory-Anchored, Real-World-Grounded Benchmark for AI Emotional Companionship
- Title(参考訳): CompanionBench:AI感情のコンパニオンシップのための理論アンコレート、実世界のベンチマーク
- Authors: Yao Liu, Guangjia Chai, Yuming Huang, Jihao Huang, Lei Wang, Junchen Wan,
- Abstract要約: 既存のベンチマークでは、手書きのシナリオを使用し、シミュレーターを誘導する。
対話型バイリンガルベンチマークCompanionBenchを紹介する。
実際のデータにシナリオとトレーニングされたユーザーシミュレータの両方を基盤とした最初のコンパニオンベンチマークである。
- 参考スコア(独自算出の注目度): 7.643253506288442
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: LLM companions are deployed at scale in personally consequential settings, yet poorly evaluated. Existing benchmarks use hand-authored scenarios and prompted simulators, aggregate empathy into one score, and overlook judge biases such as same-family favoritism and scale drift. We introduce CompanionBench, an interactive bilingual benchmark. To our knowledge, it is the first companion benchmark to ground both its scenarios and a trained user simulator in de-identified real-world data. A hidden disclosure gate branches each persona's trajectory on the agent's own behavior, controlling the interaction state space without scripting dialogue. We operationalize ten capabilities derived from 25 theories across psychology and counseling, four of them not graded explicitly by prior work: holding ambiguity, selfobject responsiveness, positive resonance and calibrated challenge. Agents are assessed on two complementary axes: a subjective ten-capability rubric and a deterministic measure of whether deeper disclosure was earned. A cross-family panel dilutes same-family favoritism; an Item Response Theory model separates agent quality from judge severity. Theory fixes what to measure and how personas are structured; real data supply events, history, and profiles -- coverage from theory, authenticity from data. Rankings are reproducible in both languages (rho = 0.996 ZH / 0.953 EN). Evaluating 28 agents reveals capability-level differences obscured by aggregate scores. Emotion regulation and calibrated challenge remain common weaknesses; holding ambiguity discriminates most. Role-play agents rank near the bottom: immersion does not imply relational competence. Across agents, the dominant failure mode is substituting surface warmth for substantive relational support. We will release 500 Chinese-English parallel pairs and the evaluation code.
- Abstract(参考訳): LLMコンパニオンは、個人的な連続的な設定で大規模に展開されるが、評価は不十分である。
既存のベンチマークでは、手書きのシナリオを使用し、シミュレーターを刺激し、1つのスコアに共感を集約し、同じ家族の好意やスケールドリフトといった判断バイアスを見落としている。
対話型バイリンガルベンチマークCompanionBenchを紹介する。
我々の知る限り、このベンチマークはシナリオとトレーニングされたユーザーシミュレータの両方を非識別の実世界のデータにまとめる最初のベンチマークである。
隠された開示ゲートは、エージェント自身の行動に基づいて各ペルソナの軌道を分岐し、スクリプティング対話なしで相互作用状態空間を制御する。
心理学とカウンセリングにまたがる25の理論から導かれる10の能力を運用し、そのうち4つは、曖昧さ、自己対象の応答性、肯定的共鳴、校正的課題など、事前の作業によって明示的に評価されない。
エージェントは2つの相補的軸 – 主観的10能力ルーブリックと、より深い開示が得られたかどうかの決定論的尺度 – で評価される。
クロスファミリーパネルは、同じ家族の好意を希釈し、アイテム反応理論モデルは、エージェントの品質と判断の重大さを分離する。
理論は、何を測定するか、どのようにペルソナが構造化されるか、実際のデータ供給イベント、履歴、プロファイル -- 理論からのカバレッジ、データからの認証 -- を修正する。
ランク付けは両方の言語で再現可能である(rho = 0.996 ZH / 0.953 EN)。
28のエージェントを評価すると、アグリゲーションスコアによって明らかな能力レベルの違いが明らかになる。
感情の規制と校正課題は依然として一般的な弱点であり、あいまいさの保持は最も差別的である。
ロールプレイエージェントは下辺にランク付けされる: 没入はリレーショナル・コンピテンスを含まない。
エージェント全体にわたって、支配的な障害モードは、実体的リレーショナルサポートのための表面温暖を置換する。
500の中国語と英語の並列ペアと評価コードをリリースします。
関連論文リスト
- AgentBeats: Agentifying Agent Assessment for Openness, Standardization, and Reproducibility [104.46861849039357]
エージェントシステムはドメイン間で急速に進歩しているが、その評価は断片化されている。
根本的問題は、オープンでエージェントに依存しないアセスメントインタフェースがないことである。
我々は、審査員が評価を行い、すべての参加者が標準化されたプロトコルを介して対話するエージェントエージェントアセスメント(AAA)を提唱する。
論文 参考訳(メタデータ) (2026-06-11T17:23:54Z) - Taming Actor-Observer Asymmetry in Agents via Dialectical Alignment [59.536125286960186]
セルフリフレクションと相互監査を可能にするために、専門的な役割を割り当てるマルチエージェントフレームワークがますます採用されている。
アクター・オブザーバ非対称性(Actor-Observer Asymmetric)と呼ばれる認知バイアスを同時に誘発する。
ReTASは、対立する視点を客観的なコンセンサスに合成するためにエージェントを誘導する。
論文 参考訳(メタデータ) (2026-04-21T15:05:58Z) - Dual Optimal: Make Your LLM Peer-like with Dignity [35.58723842086038]
現在のアライメント言語モデルは、Evasive Servantと呼ばれる二重障害モードを示す。
我々は,抗梅毒と信頼性の両面からサーボネスに対処するDignified Peerフレームワークを提案する。
論文 参考訳(メタデータ) (2026-04-01T14:48:44Z) - Benchmarking at the Edge of Comprehension [38.43582342860192]
ベンチマークが実現不可能になった場合、AIの進歩を計測する能力が重要になります。
完全人間の理解が不可能な場合でも,モデルを比較するために設計された対戦型フレームワークであるCrytique-Resilient Benchmarkingを提案する。
標準的なベンチマークとは異なり、人間は有界検証として機能し、ローカライズされたクレームにフォーカスする。
論文 参考訳(メタデータ) (2026-02-15T20:51:29Z) - Two-Faced Social Agents: Context Collapse in Role-Conditioned Large Language Models [0.0]
GPT-5は完全な数学の文脈崩壊を示し、最適応答に対する特異な同一性を採用した。
クロード・ソネット4.5はSATアイテムに限定的ではあるが測定可能な役割特異的なバリエーションを保持していた。
全てのモデルは、異なる役割条件の感情的嗜好を示し、認知的制約が緩和されたときに社会影響の変動が再燃することを示した。
論文 参考訳(メタデータ) (2025-11-19T16:04:49Z) - Sentient Agent as a Judge: Evaluating Higher-Order Social Cognition in Large Language Models [75.85319609088354]
SAGE(Sentient Agent as a Judge)は、大規模言語モデルの評価フレームワークである。
SAGEは人間のような感情の変化や内的思考をシミュレートするSentient Agentをインスタンス化する。
SAGEは、真に共感的で社会的に適応的な言語エージェントへの進捗を追跡するための、原則付き、スケーラブルで解釈可能なツールを提供する。
論文 参考訳(メタデータ) (2025-05-01T19:06:10Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。