論文の概要: Exploring Collaboration between a language and a non-language agent
- arxiv url: http://arxiv.org/abs/2609.00474v2
- Date: Wed, 02 Sep 2026 04:33:39 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-03 15:35:44.74876
- Title: Exploring Collaboration between a language and a non-language agent
- Title(参考訳): 言語と非言語エージェントの協調を探る
- Authors: Harini S, Somesh Singh, Yaman K Singla, Rajiv Ratn Shah, David Doermann, Balaji Krishnamurthy,
- Abstract要約: textscLLAMIA-Benchは、行動模倣、状態評価、自然言語説明という3つの側面にまたがる6つのチェスタスクからなるスイートである。
単一の14Bモデル、textscLLAMIAは、潜在状態の内部化でトレーニングされ、タスクスペシャリストとフロンティアモデルにマッチまたは超過する。
- 参考スコア(独自算出の注目度): 30.585697407096532
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: LLMs are increasingly deployed as orchestrators that coordinate specialized subagents to solve complex tasks through natural language. However, in many important domains like game playing and robotics, the strongest available agents are not language models. Integrating non-language agents with LLMs would require \emph{verbalization}: compressing their rich continuous representations into sparse textual summaries at each interaction step. To study whether verbalization constitutes a bottleneck, we introduce \textsc{LLAMIA-Bench}, a suite of six diverse collaborative chess tasks spanning three facets: behavioral imitation, state assessment, and natural-language explanation. Each task instantiates a well-established chess problem that neither the LLM nor the chess engine can solve alone. To solve LLM collaboration with non-language agents, we introduce \emph{latent state internalization}, which projects the subagent's continuous representations directly into the LLM's token stream as learned state tokens, with dynamic re-encoding as actions advance the environment state. Comparing internalization to verbalized integration, our experiments reveal a consistent \emph{verbalization debt}: the performance gap widens throughout training and persists as the LLM scales from 4B to 14B parameters. A single 14B model, \textsc{LLAMIA}, trained with latent state internalization, matches or exceeds task specialists and frontier models including GPT-5.1 with tool access across all benchmark tasks, and generalizes out-of-distribution where task-specific finetunes collapse
- Abstract(参考訳): LLMは、自然言語によって複雑なタスクを解決するために、特別なサブエージェントを調整するオーケストレータとして、ますます多くデプロイされている。
しかし、ゲームプレイやロボティクスといった多くの重要な分野において、最強のエージェントは言語モデルではない。
LLMと非言語エージェントを統合するには、各々の相互作用ステップにおいて、豊かな連続表現をスパーステキストの要約に圧縮する「emph{verbalization}」が必要である。
言語化がボトルネックとなるかどうかを調べるために,行動模倣,状態評価,自然言語説明という,3つの側面にまたがる6つの多様な協調チェスタスクからなるスイートである「textsc{LLAMIA-Bench}」を紹介した。
各タスクは、LLMもチェスエンジンも単独では解けない、確立されたチェス問題をインスタンス化する。
非言語エージェントとのLLM協調を解決するために,学習された状態トークンとして,サブエージェントの連続表現を直接LLMのトークンストリームに投影し,動作が環境状態の進行に伴って動的に再符号化する「emph{latent state internalization」を導入する。
実験では,LLMが4Bから14Bのパラメータにスケールするにつれて,内部化と言語統合を比較することで,トレーニング全体を通じてパフォーマンスギャップが拡大し,持続する,一貫した‘emph{verbalization debt’が明らかとなった。
単一の 14B モデルである \textsc{LLAMIA} は、潜在状態の内部化を訓練し、すべてのベンチマークタスクにツールアクセス可能な GPT-5.1 を含むタスクスペシャリストとフロンティアモデルとを一致または超越し、タスク固有の微粒が崩壊するアウト・オブ・ディストリビューションを一般化する。
関連論文リスト
- WorldBench: Culturally Grounded Benchmark for Multilingual Agents [69.76002914143531]
既存のベンチマークでは、状態の保存、言語間のパフォーマンス、現実的な根拠のあるシナリオへのアプリケーションをテストすることはめったにない。
We present WorldBench: a comprehensive, multilingual benchmark, where agent can act in a sandbox via structured action。
WorldBenchは、7つの言語と8つの文化にまたがる1,600のタスクで構成され、人間のアノテータからのフィードバックによってフィルタリングされ洗練されている。
論文 参考訳(メタデータ) (2026-09-01T10:53:07Z) - PolyWorkBench: Benchmarking Multilingual Long-Horizon LLM Agents [72.96251271825038]
大規模言語モデル(LLM)エージェントは、計画、ツールの使用、外部環境との相互作用を必要とする長い水平タスクにおいて、強いパフォーマンスを示している。
ほとんどの既存のベンチマークでは、単一の言語内で実行プロセス全体が実行されるモノリンガルな設定を暗黙的に仮定している。
多言語長時間労働作業におけるエージェント評価のためのベンチマークであるPolyWorkBenchを紹介する。
論文 参考訳(メタデータ) (2026-07-07T08:50:09Z) - Is Text All You Need? Text as a Universal Information Bottleneck for Speech LLMs [33.559566576032964]
本稿では,LLMの入力埋め込み多様体内に存在する全ての音声表現を制約する言語間LLMブリッジであるConvex Gateを提案する。
C-Gateは、自動音声認識と感情認識にまたがって、強い関節演奏を実現する。
結果として,トークンの離散性よりも幾何が音声からLLMインターフェースの基本設計要素であることが示唆された。
論文 参考訳(メタデータ) (2026-06-08T11:38:40Z) - Bridging the Knowledge Void: Inference-time Acquisition of Unfamiliar Programming Languages for Coding Tasks [22.908904483320953]
コーディングタスクにおけるLarge Language Models (LLM) は、しばしばその広範な事前学習コーパスの反映である。
動作プリミティブのセットをLCMに装備する一般のIRAフレームワークであるIRAエージェントを提案する。
我々は,Cangjie 用の ILA エージェントをインスタンス化し,コード生成,翻訳,プログラム修復タスクのパフォーマンスを評価する。
論文 参考訳(メタデータ) (2026-01-16T09:06:47Z) - Investigating Large Language Models for Complex Word Identification in Multilingual and Multidomain Setups [1.8377902806196766]
複雑な単語識別(CWI)は語彙的単純化作業において必須のステップであり、最近はそれ自体がタスクとなっている。
大規模言語モデル(LLM)は最近、ゼロ/フェーショット設定で目に見えないタスクを解決できる汎用性と能力のために、自然言語処理コミュニティで人気を博した。
Llama 2, Llama 3, Vicuna v1.5などのオープンソースモデルや, CWI, LCP, MWE設定におけるChatGPT-3.5-turbo, GPT-4oなどのクローズソースなど, LLMの使用状況について検討した。
論文 参考訳(メタデータ) (2024-11-03T22:31:02Z) - From LLMs to Actions: Latent Codes as Bridges in Hierarchical Robot Control [58.72492647570062]
我々は,制限を克服する代替アーキテクチャとして,Learningable Latent Codes as Bridges (LCB)を導入した。
methodoutperforms baselines that leverage pure language as the interface layer on tasks that requires reasoning and multi-step behaviors。
論文 参考訳(メタデータ) (2024-05-08T04:14:06Z) - AutoTAMP: Autoregressive Task and Motion Planning with LLMs as Translators and Checkers [20.857692296678632]
人間とロボットの効果的なインタラクションには、ロボットは複雑な長期的タスクを理解し、計画し、実行する必要がある。
大規模言語モデルの最近の進歩は、自然言語をロボットのアクションシーケンスに変換することを約束している。
本研究では,複雑なタスク領域において,LLMをプランナとして用いる手法よりも優れていることを示す。
論文 参考訳(メタデータ) (2023-06-10T21:58:29Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。