論文の概要: LivingArena: Do LLMs Know What Other LLMs Don't? Peer-Probing as Scalable Evaluation
- arxiv url: http://arxiv.org/abs/2607.24780v1
- Date: Fri, 19 Jun 2026 06:20:58 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-02 22:55:39.060971
- Title: LivingArena: Do LLMs Know What Other LLMs Don't? Peer-Probing as Scalable Evaluation
- Title(参考訳): LivingArena: LLMは、他のLLMが知らないことを知っていますか?
- Authors: Xingyu Chen, Rui Wang, Zhaopeng Tu, Liefeng Bo,
- Abstract要約: LivingArenaは自動汚染耐性評価フレームワークである。
モデルは質問を交互に提案し、相手が正しく答えられないアイテムを提示する。
質問者は、相手の知識境界を積極的に特定し、活用することが奨励される。
- 参考スコア(独自算出の注目度): 79.03892269184145
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Evaluating frontier LLMs is challenging: static benchmarks suffer from contamination and saturation -- leaving users unable to distinguish top models and developers blind to specific failure modes -- while human preference is subjective. In this paper, our question is: \emph{Do LLMs know what other LLMs don't? And can we leverage this dynamic for evaluation?} We present \textbf{LivingArena}, an automated, contamination-resistant evaluation framework. In this framework, models take turns proposing questions, aiming to pose items that opponents cannot answer correctly. Questioners are encouraged to actively identify and exploit opponents' knowledge boundaries, receiving rewards when the answerer fails, while the answerer is rewarded otherwise. To ensure questions contain objectively verifiable answers, a judge panel of strong models validates them, penalizing questioners if validation fails. Evaluating ten frontier LLMs, LivingArena yields a stable Elo leaderboard. Our behavioral analyses show that models identify and exploit their peers' cognitive boundaries: self-play and tournament logs indicate that they localize and double down on opponents' weak dimensions. Beyond static knowledge recall, peer probing measures factual rigor and the higher-order ability to probe an opponent's weaknesses, correlating only weakly with human preference and offering a scalable, low-cost approach to continuous evaluation.
- Abstract(参考訳): 静的ベンチマークは汚染と飽和に悩まされ、ユーザーはトップモデルと特定の障害モードに欠けている開発者を区別できない。
この論文では、我々の疑問は次のとおりである。 \emph{Do LLMsは、他のLLMが知らないことを知っていますか?
そして、このダイナミクスを評価に活用できるだろうか?
We present \textbf{LivingArena}, an automated, contamination-resistant evaluation framework。
このフレームワークでは、モデルは交互に質問を提案し、相手が正しく答えられないアイテムを提示することを目的としている。
質問者は、相手の知識境界を積極的に識別し、活用することを奨励され、解答者が失敗すると報奨を受け、解答者が報奨を受ける。
客観的に検証可能な回答を含む質問を確実にするために、強力なモデルの審査員パネルがそれらを検証し、検証が失敗した場合に質問者に罰を与える。
リビングアリーナは10台のフロンティアLSMを評価し、安定したエロのリーダーボードを得る。
我々の行動分析は、モデルが仲間の認知的境界を識別し、活用していることを示している: 自己プレイとトーナメントログは、相手の弱い次元をローカライズし、倍ダウンしていることを示している。
静的な知識リコールの他に、ピア探索は、現実の厳密さと、相手の弱点を調査する高次の能力を測定し、人間の好みにのみ関連し、継続的な評価に対するスケーラブルで低コストなアプローチを提供する。
関連論文リスト
- Turning Bias into Bugs: Bandit-Guided Style Manipulation Attacks on LLM Judges [65.92623263645139]
LLM審査員を誤解させるためにセマンティクスを保存する編集を学習するブラックボックスの敵対的フレームワークであるBITEを紹介する。
BITEは65%を超える攻撃成功率を獲得し、9ポイントのスケールでスコアを1-2ポイント上げる。
LLM-as-a-judgeパラダイムの根本的な弱点を明らかにし,ロバストでアタック・アウェアな評価を動機づけた。
論文 参考訳(メタデータ) (2026-05-24T05:24:09Z) - Benchmarking at the Edge of Comprehension [38.43582342860192]
ベンチマークが実現不可能になった場合、AIの進歩を計測する能力が重要になります。
完全人間の理解が不可能な場合でも,モデルを比較するために設計された対戦型フレームワークであるCrytique-Resilient Benchmarkingを提案する。
標準的なベンチマークとは異なり、人間は有界検証として機能し、ローカライズされたクレームにフォーカスする。
論文 参考訳(メタデータ) (2026-02-15T20:51:29Z) - Conversation for Non-verifiable Learning: Self-Evolving LLMs through Meta-Evaluation [56.84819098277464]
CoNLは、マルチエージェントのセルフプレイを通じて生成、評価、メタ評価を統合するフレームワークである。
CoNLは、安定したトレーニングを維持しながら、自己回帰ベースラインよりも一貫した改善を実現している。
論文 参考訳(メタデータ) (2026-01-29T09:41:14Z) - Can LLMs Evaluate What They Cannot Annotate? Revisiting LLM Reliability in Hate Speech Detection [5.731621080995591]
ヘイトスピーチはオンラインで広く普及し、個人やコミュニティを害し、大規模なモデレーションに欠かせない自動検出を可能にしている。
問題の一部は主観性にある: ある人が憎しみの言葉としてフラグを付けることは、別の人が良心と見なすかもしれない。
大規模言語モデル(LLM)は拡張性のあるアノテーションを約束するが、以前の研究では、人間の判断を完全に置き換えることはできないことが示されている。
論文 参考訳(メタデータ) (2025-12-10T14:00:48Z) - Beyond Prompt-Induced Lies: Investigating LLM Deception on Benign Prompts [79.1081247754018]
大規模言語モデル(LLM)は、推論、計画、意思決定のタスクに広くデプロイされている。
そこで我々は, 接触探索質問(CSQ)に基づく枠組みを提案し, 騙しの可能性を定量化する。
論文 参考訳(メタデータ) (2025-08-08T14:46:35Z) - WakenLLM: Evaluating Reasoning Potential and Stability in LLMs via Fine-Grained Benchmarking [34.350505059394536]
大規模言語モデル(LLM)は、推論タスクにおいて未知のラベルを頻繁に出力する。
我々は、モデル非能力に起因する未知の出力の一部を定量化するフレームワーク、WakenLLMを紹介した。
論文 参考訳(メタデータ) (2025-07-22T03:21:48Z) - Auto-Arena: Automating LLM Evaluations with Agent Peer Battles and Committee Discussions [77.66677127535222]
Auto-ArenaはLLMエージェントを使用した評価プロセス全体を自動化した革新的なフレームワークである。
我々の実験では、Auto-Arenaは92.14%の相関関係を示し、以前の専門家が注釈付けしたベンチマークをすべて上回っている。
論文 参考訳(メタデータ) (2024-05-30T17:19:19Z) - Examining LLMs' Uncertainty Expression Towards Questions Outside
Parametric Knowledge [35.067234242461545]
大規模言語モデル(LLM)は、適切な応答を生成するのに十分なパラメトリック知識が不足している状況において不確実性を表現する。
本研究の目的は,このような状況下でのLCMの行動の体系的調査であり,誠実さと役に立つことのトレードオフを強調することである。
論文 参考訳(メタデータ) (2023-11-16T10:02:40Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。