論文の概要: Kutti AI: A Voice-First, Offline-Capable Learning Companion with Real-Time Struggle Detection for Visually-Impaired Children
- arxiv url: http://arxiv.org/abs/2607.22377v1
- Date: Fri, 24 Jul 2026 15:03:41 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-27 20:58:57.159788
- Title: Kutti AI: A Voice-First, Offline-Capable Learning Companion with Real-Time Struggle Detection for Visually-Impaired Children
- Title(参考訳): Kutti AI:視覚障害者のためのリアルタイムストルグル検出機能を備えた音声ファーストのオフライン学習コンパニオン
- Abstract要約: Kutti AIは音声ファーストの学習コンパニオンで、音声が主で十分なインターフェースであるように設計されている。
アクセシビリティを優先するアーキテクチャ、インタラクションフロー、設計決定について説明する。
Kutti AIは、小さな、慎重にエンジニアリングされた音声ファーストシステムが、早期教育へのアクセシビリティと財政的障壁の両方を下げる方法について説明している。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Most educational technology for children is built around visual interfaces, which excludes the many children worldwide who live with visual impairment -- an estimated 1.4 million children are blind and many more have low vision. We present Kutti AI, a voice-first learning companion designed so that audio is the primary and sufficient interface: children learn curriculum concepts through spoken conversation, respond by speaking, and receive spoken feedback, with no reliance on visual elements. The system contributes three practical mechanisms for accessible, adaptive learning on commodity mobile hardware: (1) a multi-signal struggle-detection engine that combines response-latency analysis, wrong-attempt tracking, and keyword-based hesitation detection to decide, in real time, when to offer hints or simplify a question; (2) a multi-layered cross-language answer-matching pipeline that combines language-aware translation/transliteration, Levenshtein-based fuzzy matching, and text normalization so that children are not penalized for code-switching or pronunciation variation; and (3) an offline-first speech pipeline using an on-device automatic speech recognition (ASR) model, enabling use in low-connectivity settings common in underserved communities. We describe the architecture, the interaction flow, and the design decisions that prioritize accessibility, and we report qualitative observations from a hackathon prototype supporting English and Tamil. We discuss lessons learned and outline a path toward formal evaluation with target users. Kutti AI illustrates how a small, carefully-engineered voice-first system can lower both accessibility and financial barriers to early education.
- Abstract(参考訳): 子どもの教育技術のほとんどは視覚インターフェースを中心に構築されており、視覚障害を抱える世界中の多くの子どもを除外している。
子どもたちは、会話を通じてカリキュラムの概念を学び、会話によって反応し、音声フィードバックを受け取り、視覚要素に依存しない。
本システムは,コモディティ・モバイル・ハードウェア上でのアクセシブル・アダプティブ・ラーニングの実践的メカニズムとして,(1)応答遅延分析,誤触覚追跡,キーワードベースのヘッセイ検出をリアルタイムに組み合わせて,ヒントの提供や質問の簡略化を行うマルチシグナル闘争検出エンジン,(2)言語認識翻訳/翻訳,Levenshteinベースのファジィマッチング,およびテキスト正規化を組み合わせた多層的クロスランゲージ・マッチングパイプライン,(3)オンデバイス自動音声認識(ASR)モデルを用いたオフライン音声パイプライン,の3つを提供する。
本稿では、アクセシビリティを優先するアーキテクチャ、インタラクションフロー、設計決定について述べるとともに、英語とタミル語をサポートするハッカソンのプロトタイプからの質的な観察を報告する。
我々は、学習した教訓を議論し、ターゲットユーザによる形式的評価への道筋を概説する。
Kutti AIは、小さな、慎重にエンジニアリングされた音声ファーストシステムが、早期教育へのアクセシビリティと財政的障壁の両方を下げる方法について説明している。
関連論文リスト
- KidSpeak: A General Multi-purpose LLM for Kids' Speech Recognition and Screening [29.54910094759367]
KidSpeakは、子どもの発話パターンに合わせて、生成的および差別的なタスクを同時に行うことができる、スピーチ強化基礎モデルである。
本稿では,フレキシブル・アンド・オートマチック・スピーチ・アリグナー(FASA)を提案し,その手法を利用して高品質なデータセットを構築し,訓練と評価を行う。
本発明の新しいアライメントツールは、ノイズの多いデータから子どもの音声の質を著しく向上させ、人間のアノテーションと比較してデータ品質を13.6倍に向上させる。
論文 参考訳(メタデータ) (2025-12-01T00:19:37Z) - ELEGANCE: Efficient LLM Guidance for Audio-Visual Target Speech Extraction [88.41471266579333]
本稿では,大規模言語モデル(LLM)からの言語知識をAV-TSEモデルに組み込む新しいフレームワークであるELEGANCEを提案する。
2つのAV-TSEバックボーン上でのRoBERTa、Qwen3-0.6B、Qwen3-4Bによる総合的な実験は大幅に改善された。
論文 参考訳(メタデータ) (2025-11-09T08:50:11Z) - Towards Inclusive Communication: A Unified Framework for Generating Spoken Language from Sign, Lip, and Audio [52.859261069569165]
音声テキスト生成のための手話,唇の動き,音声の多様な組み合わせを扱える最初の統一フレームワークを提案する。
i)不均一な入力を効果的に処理できる統一されたモダリティ非依存アーキテクチャの設計、(ii)モダリティ間の過小評価された相乗効果の探索、特に手話理解における非手動的手がかりとしての唇運動の役割、(iii)個々のタスクに特化した最先端モデルと同等以上のパフォーマンスを達成すること、の3つの目的に焦点をあてる。
論文 参考訳(メタデータ) (2025-08-28T06:51:42Z) - Towards Developmentally Plausible Rewards: Communicative Success as a Learning Signal for Interactive Language Models [49.22720751953838]
本研究では,子どもの言語習得に触発された対話型環境で言語モデルを訓練する手法を提案する。
この設定では、話者は1ターンの対話でリスナーに何らかの情報を伝達しようと試み、コミュニケーションの成功が達成されれば報酬を受け取る。
論文 参考訳(メタデータ) (2025-05-09T11:48:36Z) - Developmental Predictive Coding Model for Early Infancy Mono and Bilingual Vocal Continual Learning [69.8008228833895]
本稿では,連続学習機構を備えた小型生成ニューラルネットワークを提案する。
我々のモデルは解釈可能性を重視し,オンライン学習の利点を実証する。
論文 参考訳(メタデータ) (2024-12-23T10:23:47Z) - CLIP-VAD: Exploiting Vision-Language Models for Voice Activity Detection [2.110168344647122]
音声活動検出(Voice Activity Detection, VAD)は、人が話しているかどうかを自動的に判断し、発話のタイミングを識別するプロセスである。
コントラスト言語-画像事前学習(CLIP)モデルを利用した新しい手法を提案する。
提案手法は,その単純さに拘わらず,広範囲なオーディオ視覚データセットの事前学習を必要とせず,複数のオーディオ視覚法より優れる。
論文 参考訳(メタデータ) (2024-10-18T14:43:34Z) - Language-Guided Audio-Visual Source Separation via Trimodal Consistency [64.0580750128049]
この課題の鍵となる課題は、発音対象の言語的記述と、その視覚的特徴と、音声波形の対応する成分とを関連付けることである。
2つの新たな損失関数を通して擬似目標管理を行うために、既成の視覚言語基盤モデルを適用する。
3つの音声・視覚的分離データセットに対する自己教師型アプローチの有効性を実証する。
論文 参考訳(メタデータ) (2023-03-28T22:45:40Z) - Bridging the Gap: Using Deep Acoustic Representations to Learn Grounded
Language from Percepts and Raw Speech [26.076534338576234]
自然言語と知覚を結びつける基底言語を理解することは、重要な研究分野である。
本研究は,2つの視覚的知覚と生音声入力に基づいて,基底言語習得の実現可能性を示す。
論文 参考訳(メタデータ) (2021-12-27T16:12:30Z) - Hierarchical Summarization for Longform Spoken Dialog [1.995792341399967]
音声対話の広汎性にもかかわらず、自動音声理解と品質情報抽出は依然として著しく貧弱である。
テキストを理解することに比べ、聴覚コミュニケーションは、話者の拡散、非公式な散文スタイル、構造の欠如など、多くの追加的な課題を生んでいる。
本稿では、2段階のASRとテキスト要約パイプラインを提案し、これらの音声認識課題を解決するためのセマンティックセグメンテーションとマージアルゴリズムを提案する。
論文 参考訳(メタデータ) (2021-08-21T23:31:31Z) - An Adversarial Learning based Multi-Step Spoken Language Understanding
System through Human-Computer Interaction [70.25183730482915]
対戦型学習に基づく多段階音声言語理解システムを提案する。
我々は,F1の観点で解析性能を少なくとも2.5%向上させることを実証した。
論文 参考訳(メタデータ) (2021-06-06T03:46:53Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。