FuguReport

CultureConverse: A Multilingual Multi-turn Simulation Harness for Culturally Grounded Assistance in East and Southeast Asia

著者 Bryan Chen Zhengyu Tan, Weihua Zheng, Thong T. Doan, Bich Ngoc Doan, Jia Wang Peh, Xiaoyuan Yi, Jing Yao, Xing Xie, Nancy F. Chen, Zhengyuan Liu, JinYeong Bak, Wafi Shamdi, Soo Kai Chie, Liew Yu Siong, Aina Azyyati Binti Mohamad Rezal, Lew Yan Yan Vanessa, Huadan Wu, Dylan Raharja, Nadya Yuki Wangsajaya, Akane Fukushige, Kazushi Kato, Koji Inoue, Tatsuya Kawahara, Jaehyung Seo, Dongjun Kim, Seungyoon Lee, Zi Haur Pang, Rui Yang Tan, Charibeth Ko Cheng, Maria Regina Justina Estuar, Jann Railey Montalan, Pham Minh Duc, Roy Ka-Wei Lee
所属 Konkuk University / AI Singapore / A*STAR / Singapore University of Technology and Design / De La Salle University / Korea University / École Polytechnique Fédérale de Lausanne / China University of Petroleum / Microsoft / Upstage AI / Kyoto University / Ateneo de Manila University / Sungkyunkwan University / Nanyang Technological University / Universiti Brunei Darussalam
カテゴリ Method / Dialogue Systems / Multilingual culturally grounded assistant simulation, Evaluation / Benchmarking / Cultural dialogue benchmark construction, Application / Multilingual NLP / East and Southeast Asia assistance
ライセンス CC BY 4.0

Abstractの概要

CultureConverseは、東アジアおよび東南アジアを対象とした、文化的に根ざした対話型支援のための多言語シミュレーション・評価ハーネスです。単一ターンの多肢選択式問題による事実想起のテストではなく、ユーザーの部分的な開示情報からアシスタントが隠された文化的・タブーの制約を推論しなければならない、複数ターンの支援要請対話を評価します。本フレームワークは10の地域、58のサブグループ属性、7つのドメインをカバーし、互いに素な公開コンテキスト、非公開コンテキスト、オラクルコンテキストの各ビューを通じてシミュレーションとスコアリングを構造化します。公開されたCultureConverse-DSデータセットには、14,610件のベンチマーク評価エピソードと274,295件のオラクル誘導型トレーニング対話が含まれており、支援の質(有用性、誠実性、無害性)と対話のリアリズムに基づいてモデルを評価します。

新規性

本フレームワークは、文化的な評価を静的な事実想起から、段階的開示と隠された文化的制約に支配される動的な複数ターンのアシスタント対話へと移行させます。文化およびタブーの知識ベースに根ざした監査可能な多段階生成パイプラインを備え、東アジアおよび東南アジアにおける広範な地域および交差的なサブグループのカバレッジを統合しています。

成果

評価された18のモデル全体において、本ベンチマークは文化に根ざした支援を効果的に測定し、GPT-5 miniが最も高い平均3Hスコア(4.28)を達成し、GPT-5.4が最も高いクリーン率(91.0%)に達しました。地域が一致する42名のアノテーターによる人間検証では、自動評価器が人間の合意に対して90.1%の一致率と0.581のMAEを達成したことが示されました。27,860件の高品質なCultureConverse-DSエピソードで2つの8Bモデルをファインチューニングしたところ、ドメイン内支援が向上し、外部の文化的MCQや安全性分類ベンチマークにおいて緩やかなドメイン外転移の向上が得られました。

論文の注目点

  1. CultureConverseは、静的な事実想起ではなく、部分的な可観測性と段階的開示のもとでの複数ターン対話を通じて文化的に根ざした支援を評価します。
  2. 東アジアおよび東南アジアの10地域、58のサブグループ属性、7ドメインをカバーし、14,610件の評価エピソードと274,295件のオラクル誘導型トレーニング対話を公開しています。
  3. 実験により自動評価器と人間の合意との高い整合性が実証され、高品質なエピソードでのファインチューニングがドメイン内および外部の文化的ベンチマークの双方で緩やかな向上をもたらすことが示されました。

参考リンク

このページはGPT-5、Claude Opus 4、Gemini 3、Gemini 3.1 Flash Image 及びその上位バージョンなどの生成AIを用いて作成されています。内容の保証は一切できません。