CultureConverse: A Multilingual Multi-turn Simulation Harness for Culturally Grounded Assistance in East and Southeast Asia
Abstractの概要
CultureConverseは、東アジアおよび東南アジアを対象とした、文化的に根ざした対話型支援のための多言語シミュレーション・評価ハーネスです。単一ターンの多肢選択式問題による事実想起のテストではなく、ユーザーの部分的な開示情報からアシスタントが隠された文化的・タブーの制約を推論しなければならない、複数ターンの支援要請対話を評価します。本フレームワークは10の地域、58のサブグループ属性、7つのドメインをカバーし、互いに素な公開コンテキスト、非公開コンテキスト、オラクルコンテキストの各ビューを通じてシミュレーションとスコアリングを構造化します。公開されたCultureConverse-DSデータセットには、14,610件のベンチマーク評価エピソードと274,295件のオラクル誘導型トレーニング対話が含まれており、支援の質(有用性、誠実性、無害性)と対話のリアリズムに基づいてモデルを評価します。
新規性
本フレームワークは、文化的な評価を静的な事実想起から、段階的開示と隠された文化的制約に支配される動的な複数ターンのアシスタント対話へと移行させます。文化およびタブーの知識ベースに根ざした監査可能な多段階生成パイプラインを備え、東アジアおよび東南アジアにおける広範な地域および交差的なサブグループのカバレッジを統合しています。
成果
評価された18のモデル全体において、本ベンチマークは文化に根ざした支援を効果的に測定し、GPT-5 miniが最も高い平均3Hスコア(4.28)を達成し、GPT-5.4が最も高いクリーン率(91.0%)に達しました。地域が一致する42名のアノテーターによる人間検証では、自動評価器が人間の合意に対して90.1%の一致率と0.581のMAEを達成したことが示されました。27,860件の高品質なCultureConverse-DSエピソードで2つの8Bモデルをファインチューニングしたところ、ドメイン内支援が向上し、外部の文化的MCQや安全性分類ベンチマークにおいて緩やかなドメイン外転移の向上が得られました。
論文の注目点
- CultureConverseは、静的な事実想起ではなく、部分的な可観測性と段階的開示のもとでの複数ターン対話を通じて文化的に根ざした支援を評価します。
- 東アジアおよび東南アジアの10地域、58のサブグループ属性、7ドメインをカバーし、14,610件の評価エピソードと274,295件のオラクル誘導型トレーニング対話を公開しています。
- 実験により自動評価器と人間の合意との高い整合性が実証され、高品質なエピソードでのファインチューニングがドメイン内および外部の文化的ベンチマークの双方で緩やかな向上をもたらすことが示されました。