論文の概要: Perceptual Gaps: ASCII Art and Overlapping Audio as CAPTCHA
- arxiv url: http://arxiv.org/abs/2604.03612v1
- Date: Sat, 04 Apr 2026 06:51:59 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-07 15:49:18.672225
- Title: Perceptual Gaps: ASCII Art and Overlapping Audio as CAPTCHA
- Title(参考訳): 知覚ギャップ:ASCIIアートとCAPTCHAとしての重複オーディオ
- Authors: Choon-Hou Rafael Chong,
- Abstract要約: 本稿では,視覚ベースのCAPTCHAと音声ベースのCAPTCHAという2つのCAPTCHAクラスを紹介する。
これらのCAPTCHAは、今日では非常に効果的であることが示唆されているが、人工知能の急速な進化に対処できるかどうかは不明だ。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: As multimodal large language models (LLMs) advance, traditional CAPTCHAs have become obsolete at distinguishing humans from bots. To address this shift, this paper aims to investigate the possibility of using tasks for which humans have evolved highly specialised neural processing. We introduce two CAPTCHA classes: a vision-based CAPTCHA, which renders alphanumeric strings as ASCII art, and an audio-based CAPTCHA, which is a question-answering task with overlapping or noise-corrupted audio context. We evaluate our vision-based CAPTCHA both as text and image input with multiple frontier LLMs (GPT 5.2, Gemini 3, etc.), and assess our audio-based CAPTCHAs by applying augmentations like background noise, Gaussian noise, and overlapping speech. We determined that none of the LLMs were able to solve a single ASCII-based CAPTCHA, with the best performing model only being able to infer at most one or two characters. Additionally, all models that supported audio performed only modestly better than random when solving audio CAPTCHAs. Our results suggest that these CAPTCHAs are exceptionally effective today, but it is unclear whether it can withstand the fast-evolving landscape of artificial intelligence. Subsequent research is needed to determine whether these tasks are temporary vulnerabilities or represent a more durable method of distinguishing humans from bots.
- Abstract(参考訳): マルチモーダルな大規模言語モデル(LLM)が進歩するにつれ、従来のCAPTCHAは人間とボットを区別するのに時代遅れになっている。
本研究の目的は,人間が高度に専門化されたニューラルプロセッシングを進化させたタスクの利用の可能性を検討することである。
本稿では,ASCIIアートとしてアルファ数値文字列を描画するCAPTCHAと,重なり合う,あるいはノイズが破損した音声コンテキストを問合せするCAPTCHAという2つのCAPTCHAクラスを紹介する。
我々は,複数のフロンティアLCM(GPT 5.2, Gemini 3など)を用いたテキスト入力と画像入力として視覚ベースのCAPTCHAを評価し,背景雑音,ガウス雑音,重畳音声などを適用して音声ベースのCAPTCHAを評価する。
ASCIIをベースとしたCAPTCHAを1文字でも1文字でも2文字でも推論できる最高の性能モデルでは,いずれのLLMも1文字のCAPTCHAを解くことができないと判断した。
さらに、オーディオをサポートするすべてのモデルは、オーディオCAPTCHAを解く際には、ランダムよりもわずかに良い結果しか得られなかった。
これらのCAPTCHAは、今日では非常に効果的であることが示唆されているが、人工知能の急速な進化に対処できるかどうかは不明だ。
その後の研究は、これらのタスクが一時的な脆弱性なのか、それとも人間とボットを区別するより永続的な方法なのかを判断するために必要となる。
関連論文リスト
- Robust CAPTCHA Using Audio Illusions in the Era of Large Language Models: from Evaluation to Advances [21.1525767544373]
我々は、評価フレームワーク、ACEval、新しいオーディオCAPTCHAアプローチであるIllusionAudioを提供する統合フレームワークであるAI-CAPTCHAを紹介する。
既存の手法のほとんどは、高度なLALMモデルとASRモデルによって高い成功率で解決できることを示し、重大なセキュリティ上の弱点を明らかにする。
これらの脆弱性に対処するために、人間の聴覚機構に根ざした知覚錯覚の手がかりを利用する新しい音響CAPTCHAアプローチIllusionAudioを設計した。
論文 参考訳(メタデータ) (2026-01-13T13:00:06Z) - CapSpeech: Enabling Downstream Applications in Style-Captioned Text-to-Speech [66.29338461991715]
CapTTS関連の一連のタスクのための新しいベンチマークであるCapSpeechを紹介する。
CapSpeechは、1000万以上の機械アノテーション付きオーディオキャプチャーペアと、約0.36万の人間アノテーション付きオーディオキャプチャーペアで構成されている。
CapSpeech上で自己回帰モデルと非自己回帰モデルの両方を用いて包括的実験を行う。
論文 参考訳(メタデータ) (2025-06-03T13:28:55Z) - IllusionCAPTCHA: A CAPTCHA based on Visual Illusion [14.043017273813227]
我々は、"Human-Easy but AI-Hard"パラダイムを用いた新しいセキュリティメカニズムであるIllusionCAPTCHAを提案する。
その結果,初回試験では86.95%の参加者がCAPTCHAに合格し,他のCAPTCHAシステムよりも優れていた。
論文 参考訳(メタデータ) (2025-02-08T06:03:03Z) - Breaking reCAPTCHAv2 [20.706469085872516]
画像分割と分類のための高度なYOLOモデルを用いて,キャプチャの解法における自動システムの有効性を評価する。
以上の結果から,reCAPTCHAv2のキャプチャを通過させるためには,人間とボットが解決しなければならない課題の数に有意な差はないことが示唆された。
論文 参考訳(メタデータ) (2024-09-13T13:47:12Z) - A Survey of Adversarial CAPTCHAs on its History, Classification and
Generation [69.36242543069123]
本稿では, 逆CAPTCHAの定義を拡張し, 逆CAPTCHAの分類法を提案する。
また, 敵CAPTCHAの防御に使用可能な防御方法も分析し, 敵CAPTCHAに対する潜在的な脅威を示す。
論文 参考訳(メタデータ) (2023-11-22T08:44:58Z) - Ada-TTA: Towards Adaptive High-Quality Text-to-Talking Avatar Synthesis [66.43223397997559]
入力テキストに対応する高品質な音声ポートレート映像を合成することを目的としている。
この課題は、デジタルヒューマン産業における幅広い応用の見通しを持っているが、まだ技術的には達成されていない。
本稿では,Ada-TTA(Adaptive Text-to-Talking Avatar)を提案する。
論文 参考訳(メタデータ) (2023-06-06T08:50:13Z) - Robust Text CAPTCHAs Using Adversarial Examples [129.29523847765952]
Robust Text CAPTCHA (RTC) という,ユーザフレンドリーなテキストベースのCAPTCHA生成法を提案する。
第1段階では、前景と背景はランダムにサンプルされたフォントと背景画像で構成される。
第2段階では、CAPTCHAの解法をより妨害するために、高転送可能な逆攻撃をテキストCAPTCHAに適用する。
論文 参考訳(メタデータ) (2021-01-07T11:03:07Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。