論文の概要: InsightEmb: Learning Action-Intent Embeddings for Agentic Insight Retrieval
- arxiv url: http://arxiv.org/abs/2608.04761v1
- Date: Wed, 05 Aug 2026 12:28:00 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.919326
- Title: InsightEmb: Learning Action-Intent Embeddings for Agentic Insight Retrieval
- Title(参考訳): InsightEmb:エージェントインサイト検索のためのアクションインテント埋め込み学習
- Authors: Tsz Ting Chung, Jiangnan Li, Jie Zhou, Mo Yu,
- Abstract要約: 自己改善剤は、以前の軌道からの再利用可能な洞察を蓄積する。
転送可能なプログレッシブ指向の探索幾何学を学習する,コントラスト的な埋め込みフレームワークであるInsightEmbを提案する。
- 参考スコア(独自算出の注目度): 30.435270910452854
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Self-improving agents accumulate reusable insights from prior trajectories, making retrieval increasingly important for turning accumulated experience into actionable guidance. At each decision step, retrieving the right insight can help the agent progress toward its goal, a setting we refer to as agentic insight retrieval. However, existing retrieval methods primarily model semantic similarity, while overlooking whether a retrieved insight resolves the agent's current decision bottleneck. We propose InsightEmb, a contrastive embedding framework that learns transferable progress-oriented retrieval geometry using only mathematical reasoning data. InsightEmb jointly learns to align concrete situations with abstract heuristic rules and to cluster reasoning trajectories with similar progress structures. We evaluate InsightEmb on dynamic agent tasks and a static skill-retrieval benchmark. Without any environment-specific training, InsightEmb improves over all these evaluations, surpassing the performance of existing reasoning embedding models. These results suggest that the geometry of state-insight matching can transfer across domains, enabling effective training from publicly available reasoning data without expensive environment-specific supervision.
- Abstract(参考訳): 自己改善エージェントは、過去の軌道からの再利用可能な洞察を蓄積し、蓄積した経験を行動可能なガイダンスに変えるために、検索がますます重要になる。
各決定ステップにおいて、適切な洞察を取得することは、エージェントが目標に向かって進むのに役立つ。
しかし、既存の検索手法は主に意味的類似性をモデル化し、検索された洞察がエージェントの現在の決定ボトルネックを解消するかどうかを見落としている。
本稿では,数理的推論データのみを用いて,転送可能な進行方向の幾何を学習する,コントラッシブな埋め込みフレームワークInsightEmbを提案する。
InsightEmbは、具体的な状況と抽象的ヒューリスティックなルールの整合を共同で学び、類似した進行構造を持つクラスタ推論軌道を学習する。
動的エージェントタスクのInsightEmbと静的スキル検索ベンチマークを評価した。
環境固有のトレーニングがなければ、InsightEmbはこれらの評価をすべて改善し、既存の推論埋め込みモデルのパフォーマンスを上回っます。
これらの結果から,国家間マッチングのジオメトリはドメイン間での移動が可能であり,環境に配慮した高価な監督を伴わない公開推論データから効果的なトレーニングを可能にすることが示唆された。
関連論文リスト
- From Holistic Evaluation to Structured Criteria: Rubrics Across the Evolving LLM Landscape [79.30826980815927]
ルーブリックは、複雑な品質判断を構造化され、実行可能な標準に変換する明示的な基準セットです。
我々は,既存のルーリックデザインを体系的に整理し,その構築と最適化を検証し,評価と訓練をまたいだ役割を解析する。
論文 参考訳(メタデータ) (2026-06-07T13:34:55Z) - SEARL: Joint Optimization of Policy and Tool Graph Memory for Self-Evolving Agents [35.45207852488779]
本稿では,ツールメモリをベースとした自己進化型エージェントフレームワークSEARLを紹介する。
インタラクションエクスペリエンスを直接利用するアプローチとは異なり,本手法では,計画と実行を統合する構造化されたエクスペリエンスメモリを構築している。
我々は,知識推論と数学タスクの枠組みを評価し,より実践的で効率的な学習を実現する上での有効性を実証した。
論文 参考訳(メタデータ) (2026-04-09T04:38:47Z) - Learning to Retrieve from Agent Trajectories [72.8923565916533]
我々はエージェント間相互作用データから直接エージェント探索のための検索モデルを訓練すべきであると主張している。
エージェント・トラジェクトリからの学習を新たな訓練パラダイムとして導入し,マルチステップエージェントのインタラクションから指導を導出する。
本研究は,エージェント探索時代における検索の方向性を示すとともに,エージェントトラジェクトリを実用的でスケーラブルな監視源として強調するものである。
論文 参考訳(メタデータ) (2026-03-30T17:59:02Z) - RecThinker: An Agentic Framework for Tool-Augmented Reasoning in Recommendation [63.74915464611075]
RecThinkerはツール拡張推論を推奨するエージェントフレームワークである。
我々はRecThinker専用のツール群を開発し、モデルがユーザアイテム側および協調的な情報を取得することを可能にする。
論文 参考訳(メタデータ) (2026-03-10T16:07:17Z) - Scaling Environments for LLM Agents in the Era of Learning from Interaction: A Survey [30.673419015614233]
エージェントは環境と直接対話し、強化学習を通じて経験から学ぶべきだという意見が高まりつつある。
本稿では,この反復処理をGEFループとして定式化し,環境がエージェントに挑戦するためのタスクを生成し,タスク実行中のエージェントの動作に応答して観察を返却し,その後の学習のためのロールアウトに対する評価フィードバックを提供する。
このパラダイムの下では、環境は経験的データの必須生産元として機能し、より複雑な、現実主義、対話性へのスケールの必要性を強調している。
論文 参考訳(メタデータ) (2025-11-12T12:56:25Z) - Stochastic Encodings for Active Feature Acquisition [100.47043816019888]
Active Feature Acquisitionは、インスタンスワイドでシーケンシャルな意思決定問題である。
目的は、テストインスタンスごとに独立して、現在の観測に基づいて計測する機能を動的に選択することである。
一般的なアプローチは強化学習(Reinforcement Learning)であり、トレーニングの困難を経験する。
我々は、教師付きで訓練された潜在変数モデルを導入し、潜在空間における観測不能な実現の可能性の多くにまたがる特徴を推論することで獲得する。
論文 参考訳(メタデータ) (2025-08-03T23:48:46Z) - Learning Geometric Representations of Objects via Interaction [25.383613570119266]
エージェントとエージェントが相互作用する外部オブジェクトを含むシーンの観察から表現を学習する問題に対処する。
本稿では,任意の自然の非構造化観測からエージェントとオブジェクトの物理的空間における位置を抽出する表現学習フレームワークを提案する。
論文 参考訳(メタデータ) (2023-09-11T09:45:22Z) - Imitation from Observation With Bootstrapped Contrastive Learning [12.048166025000976]
IfO(IfO)は、マルコフ決定プロセスにおいて自律エージェントを訓練する学習パラダイムである。
本稿では,OfOアルゴリズムであるBootIfOLについて紹介する。
我々は,限られた数の実証軌道を用いて効果的な政策を訓練できることを示す,様々な制御タスクに対するアプローチを評価する。
論文 参考訳(メタデータ) (2023-02-13T17:32:17Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。