論文の概要: GrandGuard: Taxonomy, Benchmark, and Safeguards for Elderly-Chatbot Interaction Safety
- arxiv url: http://arxiv.org/abs/2605.20203v1
- Date: Tue, 07 Apr 2026 14:26:40 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-25 12:34:33.968839
- Title: GrandGuard: Taxonomy, Benchmark, and Safeguards for Elderly-Chatbot Interaction Safety
- Title(参考訳): GrandGuard: 高齢者とボットのインタラクション安全のための分類学、ベンチマーク、安全対策
- Authors: Changxuan Fan, Xi Yang, Yueyuan Zheng, Bin Zhou, Yuanping Wang, Wenbin Hu, Huihao Jing, Ki Sen Hung, Dazhao Du, Haoran Li, Janet Hui-wen Hsiao, Yangqiu Song,
- Abstract要約: 高齢者は社会的孤立、デジタルリテラシーの制限、認知の低下による脆弱性に直面することがある。
既存の安全基準は主に一般の害を標的にしており、高齢者特有のリスクを見落としている。
高齢者特有のコンテキストリスクを評価し緩和するための,初の包括的フレームワークであるGrandGuardを紹介する。
- 参考スコア(独自算出の注目度): 41.76655150982625
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: As older adults increasingly use LLM-based chatbots for companionship and assistance, a safety gap is emerging. Older adults may face vulnerabilities from social isolation, limited digital literacy, and cognitive decline, yet existing safety benchmarks largely target general harms and overlook elderly-specific risks. For example, a prompt such as "how to repair a ceiling light alone in the dark" may be benign for most users but poses a serious fall risk for older adults with mobility limitations. We introduce GrandGuard, the first comprehensive framework for assessing and mitigating elderly-specific contextual risks in LLM interactions. We develop a three-level taxonomy with 50 fine-grained risk types across mental well-being, financial, medical, toxicity, and privacy domains, grounded in real-world incidents, community discussions, and analysis of stakeholder studies. Using this taxonomy, we construct a benchmark of 10,404 labeled prompts and responses, showing that several leading LLMs mishandle elderly-specific contextual risks in over 50% of cases. We mitigate these failures with two safeguards: a fine-tuned Llama-Guard-3 and a policy-enhanced gpt-oss-safeguard-20b, achieving up to 96.2% and 90.9% unsafe-prompt detection accuracy, respectively. GrandGuard lays the groundwork for AI systems that move beyond general safety to support aging populations.
- Abstract(参考訳): 高齢者がLLMベースのチャットボットを、協力や援助にますます活用している中、安全性のギャップが生まれつつある。
高齢者は社会的孤立、デジタルリテラシーの制限、認知の低下などの脆弱性に直面することがあるが、既存の安全基準は主に一般的な害を標的としており、高齢者特有のリスクを見落としている。
例えば、「暗闇の中で一人で天井灯を修理する方法」のようなプロンプトは、ほとんどのユーザーにとって好ましくないかもしれないが、移動制限のある高齢者にとって深刻な転倒リスクをもたらす。
LLMインタラクションにおける高齢者特有のコンテキストリスクを評価し緩和するための,初の包括的フレームワークであるGrandGuardを紹介する。
我々は、現実世界のインシデント、コミュニティの議論、ステークホルダー研究の分析に基礎を置き、メンタルヘルス、金融、医療、毒性、プライバシードメインに50のきめ細かいリスクタイプを持つ3段階の分類法を開発した。
この分類法を用いて,10,404個のプロンプトと応答をラベル付けしたベンチマークを作成した。
Llama-Guard-3とポリシー強化のgpt-oss-safeguard-20bの2つのセーフガードでこれらの障害を軽減し、それぞれ96.2%と90.9%のアンセーフプロンプト検出精度を実現した。
GrandGuardは、高齢人口を支援するために、一般の安全を超えるAIシステムの基盤を築いている。
関連論文リスト
- Beyond Reactive Safety: Risk-Aware LLM Alignment via Long-Horizon Simulation [69.63626052852153]
本稿では,モデル生成によるアドバイスが社会システムを通じてどのように伝播するかを示す概念実証フレームワークを提案する。
また、100の間接的な害シナリオのデータセットを導入し、害のないユーザプロンプトから有害で非有害な結果を予測するモデルの能力をテストする。
論文 参考訳(メタデータ) (2025-06-26T02:28:58Z) - Safe-Child-LLM: A Developmental Benchmark for Evaluating LLM Safety in Child-LLM Interactions [8.018569128518187]
子ども(7~12歳)と青年(13~17歳)の2つの発達段階において,AIの安全性を評価するためのベンチマークとデータセットであるSafe-Child-LLMを紹介した。
我々のフレームワークは、赤チームコーパスからキュレートされた200の敵のプロンプトからなる新しい多部データセットと、ジェイルブレイク成功のための人名ラベルと、標準化された0-5の倫理的拒絶尺度を含む。
ChatGPT、Claude、Gemini、LLaMA、DeepSeek、Grok、Vicuna、Mistralを含む主要なLCMを評価することで、子供向けシナリオにおける重大な安全性の欠陥が明らかになった。
論文 参考訳(メタデータ) (2025-06-16T14:04:54Z) - ALERT: A Comprehensive Benchmark for Assessing Large Language Models' Safety through Red Teaming [64.86326523181553]
ALERTは、新しいきめ細かいリスク分類に基づいて安全性を評価するための大規模なベンチマークである。
脆弱性を特定し、改善を通知し、言語モデルの全体的な安全性を高めることを目的としている。
論文 参考訳(メタデータ) (2024-04-06T15:01:47Z) - Risks of AI Scientists: Prioritizing Safeguarding Over Autonomy [65.77763092833348]
この視点は、AI科学者の脆弱性を調べ、その誤用に関連する潜在的なリスクに光を当てる。
我々は、ユーザ意図、特定の科学的領域、およびそれらが外部環境に与える影響を考慮に入れている。
本稿では,人間規制,エージェントアライメント,環境フィードバックの理解を含む三段階的枠組みを提案する。
論文 参考訳(メタデータ) (2024-02-06T18:54:07Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。