論文の概要: The Rise of Verbal Reinforcement Learning
- arxiv url: http://arxiv.org/abs/2609.01597v1
- Date: Tue, 01 Sep 2026 17:58:18 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.94227
- Title: The Rise of Verbal Reinforcement Learning
- Title(参考訳): 言語強化学習の台頭
- Authors: Kshitij Tayal, Arun Sharma, Genta Indra Winata, Anirban Das, Sambit Sahu,
- Abstract要約: このパラダイムをVerbal Reinforcement Learning (VRL)と呼び、その最初の統一的な説明を提供する。
一つの軸の周囲のフィールドを整理し、エージェントのライフサイクルに音声フィードバックが影響し、3つの柱が生成される。
この分類は、より有能で整合したエージェントを構築する上での課題と機会を定義しつつ、言語的強化がエージェント開発をいかに形作るかを示している。
- 参考スコア(独自算出の注目度): 15.047015671853321
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Natural language is emerging as a primary feedback channel for improving language agents, capable of conveying intent, preferences, and causal structure in forms interpretable by both humans and modern language models. We call this paradigm Verbal Reinforcement Learning (VRL) and offer the first unified account of it. We organize the field around a single axis, \textit{when} verbal feedback takes effect in an agent's lifecycle and \textit{what} it modifies, yielding three pillars: (1) \textbf{Language as Grounding Signal}, where language defines the task itself by specifying goals, states, and reward structures; (2) \textbf{Language as Deliberative Feedback}, where natural language guides reasoning at test time without the need to update model parameters; (3) \textbf{Language as Learning Signal}, where language-based feedback shapes model parameters through training. Within each pillar, we synthesize representative work, distinguish key subcategories of approaches, and outline the distinct role language plays in shaping agent behavior. Together, this taxonomy shows how verbal reinforcement is reshaping agent development, while also defining the challenges and opportunities for building more capable and aligned agents.
- Abstract(参考訳): 自然言語は、言語エージェントを改善するための主要なフィードバックチャネルとして現れており、人間と現代言語モデルの両方で解釈可能な形で、意図、嗜好、因果構造を伝達することができる。
このパラダイムをVerbal Reinforcement Learning (VRL)と呼び、その最初の統一的な説明を提供する。
1) 目標,状態,報酬構造を指定してタスク自体を定義する場合,(2) 目的,状態,報酬構造を指定する場合,(2) 目的,状態,報酬構造を指定する場合,(2) モデルパラメータを更新することなく,テスト時の推論を自然言語ガイドで行う場合,(3) 学習信号によって言語ベースのフィードバックがモデルパラメータを形作る場合である。
各柱において、代表的作業の合成、アプローチのキーサブカテゴリの識別、および、エージェントの形状形成における言語の役割について概説する。
同時に、この分類学は、より有能で整合したエージェントを構築する上での課題と機会を定義しながら、言語的強化がエージェント開発をいかに形作るかを示している。
関連論文リスト
- Beyond the Rosetta Stone: Unification Forces in Generalization Dynamics [56.145578792496714]
大規模言語モデル(LLM)は言語間知識伝達に苦慮している。
我々は,この現象の原因とダイナミクスを,合成多言語データセット上でスクラッチから小さなトランスフォーマーモデルを訓練することによって研究する。
論文 参考訳(メタデータ) (2025-08-14T18:44:13Z) - Enhancing Spoken Discourse Modeling in Language Models Using Gestural Cues [56.36041287155606]
本研究では,人間の動作系列と言語を用いたジェスチャーの協調モデリングにより,音声談話モデルの改善が期待できるかどうかを考察する。
ジェスチャーを言語モデルに統合するために,まずVQ-VAEを用いて3次元の人間の動作シーケンスを離散的なジェスチャートークンに符号化する。
その結果,ジェスチャを組み込むことで,3つのタスクのマーカー予測精度が向上した。
論文 参考訳(メタデータ) (2025-03-05T13:10:07Z) - Trustworthy Alignment of Retrieval-Augmented Large Language Models via Reinforcement Learning [84.94709351266557]
検索強化に関して,言語モデルの信頼性に焦点をあてる。
検索強化言語モデルには,文脈的知識とパラメトリック的知識の両方に応じて応答を供給できる本質的な能力があると考えられる。
言語モデルと人間の嗜好の整合性に着想を得て,検索強化言語モデルを外部証拠にのみ依存する状況に整合させるための第一歩を踏み出した。
論文 参考訳(メタデータ) (2024-10-22T09:25:21Z) - Learning Language Structures through Grounding [8.437466837766895]
言語構造を基礎として学習することを目的とした機械学習タスクのファミリーを考察する。
パートIでは,視覚的接地を通して構文解析を学習することを検討する。
第2部では文を対応する意味構造にマッピングする2つの実行対応手法を提案する。
パートIIIでは、他の言語のアノテーションから言語構造を学習する手法を提案する。
論文 参考訳(メタデータ) (2024-06-14T02:21:53Z) - The Interpreter Understands Your Meaning: End-to-end Spoken Language
Understanding Aided by Speech Translation [13.352795145385645]
音声翻訳(ST)は、エンドツーエンドの音声言語理解のために、音声モデルを事前訓練する良い方法である。
我々は,本モデルが単言語および多言語意図分類に基づくベースラインよりも高い性能を達成することを示す。
また、音声要約のための新しいベンチマークデータセットを作成し、低リソース/ゼロショットを英語からフランス語またはスペイン語に転送する。
論文 参考訳(メタデータ) (2023-05-16T17:53:03Z) - ABINet++: Autonomous, Bidirectional and Iterative Language Modeling for
Scene Text Spotting [121.11880210592497]
言語モデルの限られた能力は,1)暗黙的な言語モデリング,2)一方向の特徴表現,3)雑音入力を伴う言語モデルから生じる。
シーンテキストスポッティングのための自律的で双方向かつ反復的なABINet++を提案する。
論文 参考訳(メタデータ) (2022-11-19T03:50:33Z) - SLM: Learning a Discourse Language Representation with Sentence
Unshuffling [53.42814722621715]
談話言語表現を学習するための新しい事前学習目的である文レベル言語モデリングを導入する。
本モデルでは,この特徴により,従来のBERTの性能が大幅に向上することを示す。
論文 参考訳(メタデータ) (2020-10-30T13:33:41Z) - Cross-lingual Spoken Language Understanding with Regularized
Representation Alignment [71.53159402053392]
外部リソースを使わずに言語間で単語レベルの表現と文レベルの表現を整列する正規化手法を提案する。
言語間言語理解タスクの実験により、我々のモデルは、数ショットとゼロショットの両方のシナリオにおいて、最先端の手法よりも優れていることが示された。
論文 参考訳(メタデータ) (2020-09-30T08:56:53Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。