論文の概要: Agentic-imodels: Evolving agentic interpretability tools via autoresearch
- arxiv url: http://arxiv.org/abs/2605.03808v1
- Date: Tue, 05 May 2026 14:35:47 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-06 19:35:43.976519
- Title: Agentic-imodels: Evolving agentic interpretability tools via autoresearch
- Title(参考訳): エージェント・イモデル:自動検索によるエージェント・インタプリタビリティ・ツールの進化
- Authors: Chandan Singh, Yan Shuo Tan, Weijia Xu, Zelalem Gero, Weiwei Yang, Michel Galley, Jianfeng Gao,
- Abstract要約: Agentic-imodelsは、エージェントによって解釈されるように設計されたデータサイエンスツールを進化させるエージェント自動検索ループである。
この計量は、実装されたモデルの文字列表現が LLM によって "simulatable" であるかどうかを測定する。
進化したモデルによって予測性能とエージェント対面の解釈性が向上することが判明した。
- 参考スコア(独自算出の注目度): 35.865162623438025
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Agentic data science (ADS) systems are rapidly improving their capability to autonomously analyze, fit, and interpret data, potentially moving towards a future where agents conduct the vast majority of data-science work. However, current ADS systems use statistical tools designed to be interpretable by humans, rather than interpretable by agents. To address this, we introduce Agentic-imodels, an agentic autoresearch loop that evolves data-science tools designed to be interpretable by agents. Specifically, it develops a library of scikit-learn-compatible regressors for tabular data that are optimized for both predictive performance and a novel LLM-based interpretability metric. The metric measures a suite of LLM-graded tests that probe whether a fitted model's string representation is "simulatable" by an LLM, i.e. whether the LLM can answer questions about the model's behavior by reading its string output alone. We find that the evolved models jointly improve predictive performance and agent-facing interpretability, generalizing to new datasets and new interpretability tests. Furthermore, these evolved models improve downstream end-to-end ADS, increasing performance for Copilot CLI, Claude Code, and Codex on the BLADE benchmark by up to 73%
- Abstract(参考訳): エージェントデータサイエンス(ADS)システムは、データを自律的に分析し、適合し、解釈する能力を急速に改善している。
しかし、現在のADSシステムでは、エージェントによって解釈されるのではなく、人間によって解釈されるように設計された統計ツールを使用している。
これを解決するために,エージェントによって解釈可能なデータサイエンスツールを進化させるエージェント自動検索ループであるAgentic-imodelsを導入する。
具体的には、予測性能と新しいLCMベースの解釈可能性指標の両方に最適化された表型データのためのシンキトラーン互換の回帰器のライブラリを開発する。
この測定基準は、LLMの文字列表現がLLMによって「シミュラブル」であるかどうか、すなわち、LLMが文字列出力のみを読み取ることでモデルの振る舞いに関する質問に答えられるかどうかを調査するLLMグレードテストのスイートを測定する。
進化したモデルは予測性能とエージェント対面の解釈可能性を共同で改善し、新しいデータセットと新しい解釈可能性テストに一般化する。
さらに、これらの進化したモデルは、下流のエンドツーエンドADSを改善し、BLADEベンチマークでCopilot CLI、Claude Code、Codexのパフォーマンスを最大73%向上させた。
関連論文リスト
- ET-Agent: Incentivizing Effective Tool-Integrated Reasoning Agent via Behavior Calibration [68.89572566071575]
ETAgentはエージェントのツール使用行動を調整するためのトレーニングフレームワークである。
過誤行動パターンを最適行動に段階的に校正するように設計されている。
論文 参考訳(メタデータ) (2026-01-11T11:05:26Z) - Automating Data-Driven Modeling and Analysis for Engineering Applications using Large Language Model Agents [3.344730946122235]
本稿では,Large Language Model (LLM) エージェントを用いてデータ駆動モデリングと分析を自動化する革新的なパイプラインを提案する。
協調エージェントを特徴とするマルチエージェントシステムと、Reasoning and Acting(ReAct)パラダイムに基づく単一エージェントシステムである。
論文 参考訳(メタデータ) (2025-10-01T19:28:35Z) - Agents of Discovery [17.016402322416994]
大規模言語モデル(LLM)は、データ分析に基づく研究問題を共同で解決することができる。
本稿では,LHCオリンピックデータセットを用いた異常検出の課題について考察する。
最高のエージェント生成ソリューションは、人間の最先端の結果のパフォーマンスを反映している。
論文 参考訳(メタデータ) (2025-09-10T12:25:13Z) - IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis [60.32962597618861]
IDA-Benchは、多ラウンドの対話シナリオで大規模言語モデルを評価する新しいベンチマークである。
エージェント性能は、最終的な数値出力と人間由来のベースラインを比較して判断する。
最先端のコーディングエージェント(Claude-3.7-thinkingなど)でさえ50%のタスクを成功させ、シングルターンテストでは明らかでない制限を強調している。
論文 参考訳(メタデータ) (2025-05-23T09:37:52Z) - DatawiseAgent: A Notebook-Centric LLM Agent Framework for Adaptive and Robust Data Science Automation [10.390461679868197]
我々は、適応的で堅牢なデータサイエンス自動化のためのノートブック中心の大規模言語モデル(LLM)エージェントフレームワークであるDatawiseAgentを紹介する。
人間のデータサイエンティストが計算ノートブックでどのように機能するかに触発されたDatawiseAgentは、統一された相互作用表現とマルチステージアーキテクチャを導入した。
論文 参考訳(メタデータ) (2025-03-10T08:32:33Z) - MatPlotAgent: Method and Evaluation for LLM-Based Agentic Scientific Data Visualization [86.61052121715689]
MatPlotAgentは、科学的データ可視化タスクを自動化するために設計された、モデルに依存しないフレームワークである。
MatPlotBenchは、100人の検証されたテストケースからなる高品質なベンチマークである。
論文 参考訳(メタデータ) (2024-02-18T04:28:28Z) - Evaluating and Explaining Large Language Models for Code Using Syntactic
Structures [74.93762031957883]
本稿では,コード用大規模言語モデルに特有の説明可能性手法であるASTxplainerを紹介する。
その中核にあるASTxplainerは、トークン予測をASTノードに整合させる自動メソッドを提供する。
私たちは、最も人気のあるGitHubプロジェクトのキュレートデータセットを使用して、コード用の12の人気のあるLLMに対して、実証的な評価を行います。
論文 参考訳(メタデータ) (2023-08-07T18:50:57Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。