論文の概要: ProactiveLLM: Learning Active Interaction for Streaming Large Language Models
- arxiv url: http://arxiv.org/abs/2606.00523v1
- Date: Sat, 30 May 2026 04:31:29 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-02 21:34:28.510317
- Title: ProactiveLLM: Learning Active Interaction for Streaming Large Language Models
- Title(参考訳): ProactiveLLM: 大規模言語モデルのストリーミングのためのアクティブインタラクション学習
- Abstract要約: 本稿では,モデル内在状態を利用して対話決定を導くことにより,アクティブなインタラクションを実現するProactiveLLMを提案する。
ProactiveLLMは、動的かつアクティブなインタラクションのキャパシティを検証しながら、品質を維持しながら、インタラクションのレイテンシを著しく低減します。
- 参考スコア(独自算出の注目度): 19.8873622850537
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Standard Large Language Models (LLMs) follow a read-then-generate paradigm, causing unnecessary latency and computation. Streaming LLMs alleviate this issue by generating while receiving inputs, but still struggle to decide when to interact with the stream. Existing methods either hard-code interaction timing or rely on costly external alignment signals, such as timing labels, reasoning trajectories, or stronger teachers. In this paper, we propose ProactiveLLM, which achieves active interaction by leveraging the model's endogenous states to guide interaction decisions. The model first learns to perceive semantic sufficiency from partial inputs through two complementary training mechanisms: mask-based streaming modeling and synchronized privileged self-distillation (SPSD). The former applies monotonic random masking to the input during training, simulating progressively revealed streaming inputs and enabling the model to learn local semantic dependencies from partial-input views. The latter aligns the partial-context student view with a full-context teacher view generated by the same evolving model, allowing privileged full-context evidence to guide the student's understanding under incomplete observations. Together, these mechanisms induce endogenous sufficiency cues without requiring external teachers or annotations, providing a versatile foundation for the plug-and-play integration of diverse decision heads. Extensive evaluation across text and speech streaming tasks confirms that ProactiveLLM significantly reduces interaction latency while maintaining quality, validating its capacity for dynamic and active interaction. Code is publicly available at https://github.com/EIT-NLP/StreamingLLM/tree/main/ProactiveLLM.
- Abstract(参考訳): 標準大言語モデル (LLMs) は読み書き生成パラダイムに従っており、不要なレイテンシと計算を引き起こす。
ストリーム LLM は入力を受信しながら生成することでこの問題を軽減するが、ストリームといつ対話するかを決めるのに苦労する。
既存の方法は、ハードコードインタラクションのタイミングか、タイミングラベル、推論軌跡、より強力な教師のようなコストのかかる外部アライメント信号に依存する。
本稿では,モデル内在的状態を利用して対話決定を導くことにより,アクティブなインタラクションを実現するProactiveLLMを提案する。
このモデルは、まず、マスクベースのストリーミングモデリングと同期特権自己蒸留(SPSD)という2つの相補的な学習メカニズムを通じて、部分的な入力から意味の十分さを知覚することを学ぶ。
前者はトレーニング中の入力に単調なランダムマスキングを適用し、ストリーミング入力をシミュレートし、部分的なインプットビューから局所的なセマンティック依存関係を学習できるようにする。
後者は、部分的コンテキストの学生の視点と、同じ進化するモデルによって生成されたフルコンテキストの教師の視点とを一致させ、特権的なフルコンテキストのエビデンスにより、不完全な観察の下で学生の理解を導くことができる。
これらのメカニズムは、外部教師やアノテーションを必要とせず、内因性障害を誘発し、多様な意思決定者のプラグアンドプレイ統合のための汎用的な基盤を提供する。
テキストおよび音声ストリーミングタスク間での広範囲な評価により、ProactiveLLMは、品質を維持しながらインタラクションのレイテンシを著しく低減し、動的かつアクティブなインタラクションの能力を検証する。
コードはhttps://github.com/EIT-NLP/StreamingLLM/tree/main/ProactiveLLMで公開されている。
関連論文リスト
- StreamPI: Streaming Multimodal Temporal Modeling for Vision-Language-Action Models [84.17128030384099]
StreamPIはストリーミングマルチモーダル時間モデリングフレームワークである。
追加パラメータを導入することなく、単一フレームのVLAに時間的推論能力を持たせる。
メモリ依存および正確な認識シナリオにまたがる実ロボットタスクの実験とシミュレーションベンチマークのLIBEROは、StreamPIが様々なタスクでpi0.5より優れていることを示した。
論文 参考訳(メタデータ) (2026-08-26T17:33:19Z) - A Model Merging Approach for Continual MLLM Unlearning [22.83414107472909]
Merging for Continual Unlearning (MCU)は、複数のワンショットアンラーニングアダプタを、新しいアンラーニングリクエストを受信すると、動的に統一されたアダプタにマージするアプローチである。
MCUは、保持された知識と汎用マルチモーダルユーティリティの両方を保持しながら、優れた非学習効率を実現する。
論文 参考訳(メタデータ) (2026-08-05T07:37:23Z) - Overcoming State Inertia in Full-Duplex Spoken Language Models via Activation Steering [87.43777061308658]
フル音声言語モデル(FDSLM)における予測行動の解析
FDSLMは、モデル出力生成に整合した生成状態と、ユーザ入力に整合した知覚状態の2つの状態間の内部焦点を動的に変調する。
ユーザ中断中は、モデルが知覚状態に遷移する前に生成状態に対して過渡的に偏りを保ち、入力の開始を逃す。
論文 参考訳(メタデータ) (2026-06-09T19:08:07Z) - Visual-Noise Guided In-Context Distillation for Multimodal Large Language Model Unlearning [25.860185076316508]
MLLM(Multimodal Large Language Models)は、視覚言語タスクにおいて顕著な進歩を遂げている。
また、機密知識や制限された知識を記憶し、公開し、プライバシーやより広範な安全リスクへの懸念を喚起することもある。
MLLMアンラーニングのための蒸留フレームワークとして,視覚誘導型インコンテキスト蒸留(VGID)を提案する。
論文 参考訳(メタデータ) (2026-05-26T12:49:34Z) - Not All Modalities Are Equal: Instruction-Aware Gating for Multimodal Videos [70.78278988781882]
ビデオ,音声,深度マップ,その他のモダリティ入力間で命令認識融合を行う,UniMVUという統合マルチモーダルビデオ理解フレームワークを提案する。
解析の結果,ゲーティング機構は人間と解釈可能なモダリティの関連性に一致し,アブレーションは内部モダリティとモダリティレベルのゲーティングの寄与を示すことがわかった。
論文 参考訳(メタデータ) (2026-05-25T18:02:20Z) - MiniCPM-o 4.5: Towards Real-Time Full-Duplex Omni-Modal Interaction [76.4461698685681]
Mini-o 4.5は、人間レベルのリアルタイムストリーミングインタラクションに向けた最新の取り組みです。
Omni-CPMは、オムニモードの知覚と出力を共有時間軸に沿って整列する統合ストリーミングフレームワークである。
合計9Bパラメータで、Mini-o 4.5は視力計算能力においてGemini 2.5 Flashにアプローチし、最先端のオープンな計算性能を提供する。
論文 参考訳(メタデータ) (2026-04-30T04:05:43Z) - Self-Supervised Flow Matching for Scalable Multi-Modal Synthesis [34.5994686982342]
強い意味表現は拡散と流れモデルの収束と生成の質を向上させる。
既存のアプローチは、主に外部モデルに依存しており、個別のトレーニングが必要であり、不整合した目標を運用し、予期しないスケーリングの振る舞いを示す。
本稿では,自己制御型フローマッチングパラダイムであるSelf-Flowを紹介する。
論文 参考訳(メタデータ) (2026-03-06T17:41:49Z) - MLLMEraser: Achieving Test-Time Unlearning in Multimodal Large Language Models through Activation Steering [36.80441487363007]
MLLMEraserは、テスト時間アンラーニングのための入力対応、トレーニング不要のフレームワークである。
逆摂動型知識-リコール画像-テキストペアを対比してマルチモーダル消去方向を構築する。
LLaVA-1.5とQwen-2.5-VLの実験では、MLLMEraserは最先端MLLMの未学習ベースラインを一貫して上回っている。
論文 参考訳(メタデータ) (2025-10-05T14:20:17Z) - Explaining multimodal LLMs via intra-modal token interactions [55.27436637894534]
MLLM(Multimodal Large Language Models)は、様々な視覚言語タスクにおいて顕著な成功を収めているが、その内部決定機構は十分に理解されていない。
モーダル内相互作用を利用した解釈可能性の向上を提案する。
論文 参考訳(メタデータ) (2025-09-26T14:39:13Z) - Efficient Transfer Learning for Video-language Foundation Models [13.166348605993292]
テキスト表現と視覚表現のアライメントを高めるために,パラメータ効率のよいマルチモーダルパティッシャ・テンポラル・アダプタ (MSTA) を提案する。
我々は,ゼロショット転送,少数ショット学習,ベース・ツー・ノーベル一般化,完全テンポラル学習という4つの課題にまたがるアプローチの有効性を評価する。
論文 参考訳(メタデータ) (2024-11-18T01:25:58Z) - Prompt Highlighter: Interactive Control for Multi-Modal LLMs [50.830448437285355]
本研究では,マルチモーダル LLM (LLMs&VLMs) 推論における重要な側面として,明示的な制御可能なテキスト生成を目標とする。
本稿では,新しい推論手法であるPrompt Highlighterを導入し,ユーザが特定のプロンプトスパンをハイライトし,生成中のフォーカスをインタラクティブに制御できるようにする。
推論中、注意重みを通して強調されたトークンでモデルを導くことで、より望ましい出力が得られます。
論文 参考訳(メタデータ) (2023-12-07T13:53:29Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。