論文の概要: The Null Token Knows: Reducing Message-Free Hallucination in ASR and NMT
- arxiv url: http://arxiv.org/abs/2608.15940v2
- Date: Tue, 18 Aug 2026 14:07:35 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-19 13:45:32.958485
- Title: The Null Token Knows: Reducing Message-Free Hallucination in ASR and NMT
- Title(参考訳): Null Tokenが知る: ASRとNMTにおけるメッセージフリーの幻覚を減らす
- Abstract要約: encoder-decoderシステムは、リカバリ可能なメッセージがなくても、流動的なテキストを生成することができる。
ASRおよびNMTにおけるこの故障をモデルに予約されたヌルトークンを用いて検討する。
音声認識と翻訳モデル間でのネイティブなnull-tokenスコアとスカラーロジットシフトを監査する。
- 参考スコア(独自算出の注目度): 0.2624902795082451
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Modern encoder-decoder systems can produce fluent text even when their input contains no recoverable message. We study this failure in ASR and NMT through the models' reserved null tokens, asking whether the score for ending generation already carries a usable abstention signal. Across speech recognizers and translation models, we audit native null-token scores and scalar logit shifts. In Whisper, we additionally probe decoder states and compare supervised row edits with conventional external gates. The evaluated models often expose a useful abstention signal, but stock decoding does not reliably act on it. Raising the null-token score can sharply suppress fabrication, but aggressive intervention also deletes valid speech or shortens legitimate translations. These findings turn the null token into a diagnostic lens on hallucination and motivate evaluating abstention methods by both suppression and deletion costs, rather than by hallucination reduction alone.
- Abstract(参考訳): 現代のエンコーダ・デコーダシステムは、入力が回復可能なメッセージを含んでいない場合でも、流動的なテキストを生成することができる。
ASRおよびNMTにおけるこの故障をモデルに予約されたヌルトークンを用いて調査し、終端生成のスコアが既に使用可能な禁制信号を持っているかどうかを問う。
音声認識と翻訳モデル全体で、ネイティブなnull-tokenスコアとスカラーロジットシフトを監査する。
Whisperではデコーダの状態を探索し、従来の外部ゲートと比較する。
評価されたモデルは、しばしば有用な禁制信号を公開するが、ストックデコードはその上に確実に作用しない。
null-tokenスコアの上昇は、製造を著しく抑制するが、積極的な介入は有効なスピーチを削除したり、正しい翻訳を短縮する。
これらの結果から,Nullトークンは幻覚の診断レンズとなり,幻覚の減少のみによるものではなく,抑制と削除のコストによる禁忌法の評価を動機づけた。
関連論文リスト
- The Sound of Absence: Audio-Language Embedding Models Struggle with Negation [58.04745279785462]
埋め込みモデルは、否定された音のコンセプトを符号化できないことを示す。
データセットを2つの否定対応タスクに変換するフレームワークであるNegEval-Audioを紹介した。
論文 参考訳(メタデータ) (2026-07-14T02:55:00Z) - Reliable Neural-Codec Text-to-Speech by ASR Self-Verification and Distillation: Near-Zero Catastrophic Failures Across Models and Codecs [0.08599681538174887]
最良NSR自己検証は失敗をほぼゼロに導くことを示す。
モデルに自己検証された動作ロバスト性を蒸留することにより、予測時に修正を自由にする。
論文 参考訳(メタデータ) (2026-06-16T15:41:44Z) - Continuous Language Diffusion as a Decoder-Interface Problem [9.603960937964183]
連続拡散言語モデルはガウス崩壊文の埋め込みから流動的なテキストを生成することができる。
組込み言語フロー(ELF)を用いてこのパズルを学習し,デコーダベース機構を同定する。
本稿では,難読性,セマンティックリカバリ性,順序感度,デコーダの互換性,トラジェクトリ信頼性の診断プロトコルを提案する。
論文 参考訳(メタデータ) (2026-06-07T20:00:33Z) - Acoustic Cue Alignment in Audio Language Models for Speech Emotion Recognition [58.25449304752214]
生音声が既に利用可能である場合に、明示的な音響的手がかりが根拠となるかどうかを考察する。
標準化されたeGeMAPSパラ言語特徴集合から6つの解釈可能な音響概念トークンを導出する。
調整されたトークンは平均リコール(UAR)を改善するが、シャッフル、競合、破損したトークンはパフォーマンスを低下させる。
トークンのみの介入は、ALMに基づく感情計算において、オーディオグラウンドドキューの使用、堅牢性、解釈可能性を調べるための実用的な方法である、と我々は主張する。
論文 参考訳(メタデータ) (2026-06-05T14:26:06Z) - Token-Guard: Towards Token-Level Hallucination Control via Self-Checking Decoding [8.629393350514972]
Token-Guardは自己チェックデコードに基づくトークンレベルの幻覚制御手法である。
HALUデータセットの実験では、Token-Guardは幻覚を大幅に減らし、生成精度を向上させる。
論文 参考訳(メタデータ) (2026-01-29T16:48:47Z) - Dense Retrievers Can Fail on Simple Queries: Revealing The Granularity Dilemma of Embeddings [65.31723739561151]
埋め込みは、エンコードされたセマンティクス内のきめ細かいエンティティやイベントを認識できないかもしれない。
本稿では,新たな評価データセットであるCapRetrievalを導入し,文節は画像キャプションであり,クエリはエンティティやイベントの概念を多種多様な形式でターゲットとするフレーズである。
我々は提案したデータ生成戦略でエンコーダを微調整し、小さな0.1Bエンコーダで最先端の7Bモデルを上回る性能を実現した。
論文 参考訳(メタデータ) (2025-06-10T09:00:33Z) - HyPoradise: An Open Baseline for Generative Speech Recognition with
Large Language Models [81.56455625624041]
ASRの誤り訂正に外部の大規模言語モデル(LLM)を利用する最初のオープンソースベンチマークを導入する。
提案したベンチマークには、334,000組以上のN-best仮説を含む新しいデータセットHyPoradise (HP)が含まれている。
合理的なプロンプトと生成能力を持つLLMは、N-bestリストに欠けているトークンを修正できる。
論文 参考訳(メタデータ) (2023-09-27T14:44:10Z) - A Token-level Reference-free Hallucination Detection Benchmark for
Free-form Text Generation [50.55448707570669]
本稿ではトークンレベルの参照なし幻覚検出タスクとHaDesというアノテーション付きデータセットを提案する。
このデータセットを作成するために、まず英語のウィキペディアから抽出された大量のテキストセグメントを摂り込み、それからクラウドソースアノテーションで検証する。
論文 参考訳(メタデータ) (2021-04-18T04:09:48Z) - Detecting Hallucinated Content in Conditional Neural Sequence Generation [165.68948078624499]
出力シーケンスの各トークンが(入力に含まれていない)幻覚化されているかどうかを予測するタスクを提案する。
また、合成データに微調整された事前学習言語モデルを用いて幻覚を検出する方法についても紹介する。
論文 参考訳(メタデータ) (2020-11-05T00:18:53Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。