論文の概要: RaguTeam at SemEval-2026 Task 8: Meno and Friends in a Judge-Orchestrated LLM Ensemble for Faithful Multi-Turn Response Generation
- arxiv url: http://arxiv.org/abs/2605.04523v1
- Date: Wed, 06 May 2026 06:04:37 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-07 18:41:07.664572
- Title: RaguTeam at SemEval-2026 Task 8: Meno and Friends in a Judge-Orchestrated LLM Ensemble for Faithful Multi-Turn Response Generation
- Title(参考訳): RaguTeam at SemEval-2026 Task 8: Meno and Friends in a Judge-Orchestrated LLM Ensemble for Faithful Multi-Turn Response Generation (英語)
- Authors: Ivan Bondarenko, Roman Derunets, Oleg Sedukhin, Mikhail Komarov, Ivan Chernov, Mikhail Kulakov,
- Abstract要約: 本稿では,SemEval-2026 Task8: MTRAGEvalにおけるTaskBの当選システムについて述べる。
26チーム中1位にランクインし、条件付きハーモニック平均0.7827を達成しました。
また,MTRAGEvalを解析し,高いコスト・パフォーマンスのトレードオフを持つ7Bドメイン適応モデルであるMeno-Lite-0.1を導入する。
- 参考スコア(独自算出の注目度): 0.8209843760716958
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We present our winning system for Task~B (generation with reference passages) in SemEval-2026 Task~8: MTRAGEval. Our method is a heterogeneous ensemble of seven LLMs with two prompting variants, where a GPT-4o-mini judge selects the best candidate per instance. We ranked 1st out of 26 teams, achieving a conditioned harmonic mean of 0.7827 and outperforming the strongest baseline (gpt-oss-120b, 0.6390). Ablations show that diversity in model families, scales, and prompting strategies is essential, with the ensemble consistently beating any single model. We also introduce Meno-Lite-0.1, a 7B domain-adapted model with a strong cost--performance trade-off, and analyse MTRAGEval, highlighting annotation limitations and directions for improvement. Our code is publicly available: https://github.com/RaguTeam/ragu_mtrag_semeval
- Abstract(参考訳): 本稿では,SemEval-2026 Task~8: MTRAGEvalにおけるタスク〜B(参照パス付き世代)の入賞システムについて述べる。
提案手法は, GPT-4o-mini 判定器がインスタンスごとの最適候補を選択する場合, 7つのLLMの異種アンサンブルである。
26チーム中1位にランクインし、条件付きハーモニック平均0.7827を達成し、最強のベースライン(gpt-oss-120b, 0.6390)を上回りました。
アブレーションは、モデルファミリー、スケール、およびプロンプト戦略の多様性が不可欠であることを示している。
また,MTRAGEvalを解析し,アノテーションの制限と改善の方向性を強調した7Bドメイン適応モデルであるMeno-Lite-0.1を導入する。
私たちのコードは、https://github.com/RaguTeam/ragu_mtrag_semeval.comで公開されています。
関連論文リスト
- When Agents Disagree: The Selection Bottleneck in Multi-Agent LLM Pipelines [0.0]
マルチエージェントLLMパイプラインは、チームの多様性がアウトプット品質を改善するかどうかという矛盾した証拠を生み出します。
多様性が役に立つか傷つくかを判断する選択ボトルネックを特定することで解決法を提案する。
この結果から, セレクタの品質は, 単ラウンドジェネレータ選択パイプラインにおけるジェネレータの多様性よりも, より影響の高い設計レバーである可能性が示唆された。
論文 参考訳(メタデータ) (2026-03-20T00:50:53Z) - Judging What We Cannot Solve: A Consequence-Based Approach for Oracle-Free Evaluation of Research-Level Math [21.001217194182995]
本研究では,その価値を文脈内見本として検証し,関連する問題を解き明かすオラクルフリー評価器であるConsequence-Based Utilityを提案する。
提案手法は, 1 つの専門家による解と 9 つの LLM 生成解をそれぞれ組み合わせた,研究レベルの数学問題のオリジナルセットに基づいて評価する。
特に、Consequence-Based Utilityは、報酬モデル、生成的報酬モデル、LLM審査員のランキング品質を一貫して上回る。
論文 参考訳(メタデータ) (2026-02-06T01:10:28Z) - Assessing LLM Reliability on Temporally Recent Open-Domain Questions [15.456770184839726]
大規模言語モデル(LLM)は、オープンドメインの質問応答のためにますます多くデプロイされている。
我々は4つのオープンソース LLM が最近のReddit の質問 15,000 に対してどのように反応するかを調査した。
すべてのモデルは、8%のBLEU-1オーバーラップにもかかわらず、参照と99%以上のコサイン類似性を達成している。
論文 参考訳(メタデータ) (2026-01-17T21:33:27Z) - Multimodal RewardBench 2: Evaluating Omni Reward Models for Interleaved Text and Image [58.14192385042352]
マルチモーダル・リワードベンチ2(MMRB2)は,マルチモーダル理解と(インターリーブされた)生成に対する報酬モデルの最初のベンチマークである。
MMRB2はテキスト・ツー・イメージ、画像編集、インターリーブド・ジェネレーション、マルチモーダル推論の4つのタスクにまたがる。
21のソースタスクにわたる23のモデルとエージェントから、タスク毎に1000のエキスパートアノテートされた好みペアを提供する。
論文 参考訳(メタデータ) (2025-12-18T18:56:04Z) - Slm-mux: Orchestrating small language models for reasoning [52.461958665375896]
小型言語モデル(SLM)のオーケストレーションのための3段階的アプローチを提案する。
まず,複数のSLMを効果的にコーディネートするマルチモデルアーキテクチャであるSLM-MUXを紹介する。
SLM-MUXはわずか2つのSLMSでQwen 2.5 72BをGPQAとGSM8Kで上回り、MATHでのパフォーマンスに匹敵する。
論文 参考訳(メタデータ) (2025-10-06T17:49:58Z) - Beyond Majority Voting: LLM Aggregation by Leveraging Higher-Order Information [57.397381631496906]
最適重み(OW)と逆サプライシング人気度(ISP)という2つの新しいアグリゲーションアルゴリズムを開発した。
我々の理論的分析は、これらの手法が軽微な仮定の下での多数決の本質的な制限を確実に緩和することを示している。
我々は,我々のアルゴリズムを人工データセット,UltraFeedbackやMMLUなどのLLMファインチューニングベンチマーク,実世界の医療環境ARMMAN上で実証的に検証した。
論文 参考訳(メタデータ) (2025-10-01T22:21:50Z) - CLaC at DISRPT 2025: Hierarchical Adapters for Cross-Framework Multi-lingual Discourse Relation Classification [0.0509780930114934]
タスク3では、39のコーパスにまたがる17の談話関係ラベルが16の言語と6の談話フレームワークで統合されている。
まず、多言語BERTベースのモデルに2つの引数順序戦略とプログレッシブ・フリーズ比を併用してタスクをベンチマークする。
次に、ゼロショットおよび少数ショット設定でプロンプトベースの大規模言語モデルを評価し、新たに提案された統一ラベルに対してLLMがどう反応するかを理解する。
論文 参考訳(メタデータ) (2025-09-21T03:34:31Z) - Goedel-Prover-V2: Scaling Formal Theorem Proving with Scaffolded Data Synthesis and Self-Correction [95.91743732150233]
一連のオープンソースの言語モデルであるGoedel-Prover-V2は、自動定理の新たな最先端を証明した。
我々は、より複雑な定理をマスターするためにモデルを訓練することの困難さを増す合成タスクを生成する。
Goedel-Prover-V2-32Bは、標準モードのpass@32でMiniF2Fの88.1%、自己補正モードの90.4%を達成する。
論文 参考訳(メタデータ) (2025-08-05T16:28:22Z) - CTTS: Collective Test-Time Scaling [58.564620942591866]
テスト時スケーリング(TTS)は,大規模言語モデル(LLM)のパフォーマンス向上のための,有望かつトレーニング不要なアプローチとして登場した。
単体テストタイムスケーリング(STTS)パラダイムを克服するために、CTTS(Collective Test-Time Scaling)を導入します。
CTTS-MMは、マルチエージェントとマルチリワードのコラボレーションを運用する新しいフレームワークである。
論文 参考訳(メタデータ) (2025-08-05T11:19:08Z) - Large Language Models are Effective Text Rankers with Pairwise Ranking Prompting [65.00288634420812]
Pairwise Ranking Prompting (PRP)は、大規模言語モデル(LLM)の負担を大幅に軽減する手法である。
本研究は,中等級のオープンソースLCMを用いた標準ベンチマークにおいて,最先端のランク付け性能を達成した文献としては初めてである。
論文 参考訳(メタデータ) (2023-06-30T11:32:25Z) - HFL at SemEval-2022 Task 8: A Linguistics-inspired Regression Model with
Data Augmentation for Multilingual News Similarity [16.454545004093735]
本稿では,SemEval-2022 Task 8: Multilingual News Article similarityについて述べる。
我々は,いくつかのタスク固有の戦略で訓練された言語モデルを提案した。
Pearson's correlation Coefficient of 0.818 on the official evaluation set。
論文 参考訳(メタデータ) (2022-04-11T03:08:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。