論文の概要: Can LLM Coding Agents Reason About Time Series?
- arxiv url: http://arxiv.org/abs/2606.16545v1
- Date: Mon, 15 Jun 2026 10:49:28 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-16 16:21:34.464039
- Title: Can LLM Coding Agents Reason About Time Series?
- Title(参考訳): LLM符号化エージェントは時系列について理にかなっているか?
- Abstract要約: コードアクセスを持つエージェントは、生データを処理するモデルを最大10%向上させることができることを示す。
最高のパフォーマンスエージェントでさえ、質問の約22~34%が正しく答えていない。
我々の分析によると、コーディングエージェントは適切な統計検査を選択できるが、重要なニュアンスを見逃すことがしばしばある。
- 参考スコア(独自算出の注目度): 0.19116784879310025
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large language models (LLMs) are increasingly being used for automated decision-making systems in finance, healthcare, or environmental monitoring. Time series data are ubiquitous in these fields, yet hard to process automatically. Can time series be analyzed by LLM agents? We examine three approaches: providing the agent with raw numerical data, using the LLM as a coding agent, or a combination of both. In the coding agent setup, the model iteratively queries the data using Python code. Using two time series understanding benchmarks, we show that agents with code access can outperform models processing raw data by up to 10%. However, even the best performing agent still answers about 22-34% of the questions incorrectly. To get insights into models' strategies and reasoning gaps, we analyze the model outputs with a strong LLM judge. Our analysis reveals that coding agents can select appropriate statistical tests, but often miss important nuances. Meanwhile, models with access to raw data can reach the right conclusions using back-of-the-envelope calculations.
- Abstract(参考訳): 大規模言語モデル(LLM)は、金融、医療、環境モニタリングにおける自動意思決定システムにますます使われている。
時系列データはこれらの分野でユビキタスであるが、自動処理は困難である。
LLMエージェントで時系列を解析できるか?
エージェントに生の数値データを提供したり、LLMを符号化エージェントとして使ったり、その両方を組み合わせたりする3つの方法を検討した。
コーディングエージェントの設定では、モデルはPythonコードを使用してデータを反復的にクエリします。
2つの時系列理解ベンチマークを用いて、コードアクセスを持つエージェントが、生データを処理するモデルを最大10%向上させることができることを示す。
しかし、最高のパフォーマンスエージェントでさえも、質問の約22~34%が正しく答えていない。
モデルの戦略と推論ギャップに関する洞察を得るため,強力なLCM判定器を用いてモデル出力を分析した。
我々の分析によると、コーディングエージェントは適切な統計検査を選択できるが、重要なニュアンスを見逃すことがしばしばある。
一方、生データにアクセス可能なモデルは、バック・オブ・ザ・エンベロープ計算を使用して正しい結論に達することができる。
関連論文リスト
- TraceLab: Characterizing Coding Agent Workloads for LLM Serving [16.402747744601612]
約4300のコーディングエージェントセッションのトレースをリリースし、約35万のLDMステップと43万のツールコールを含む。
我々の分析によると、コーディングエージェントのワークロードは、長い自律ループ、短いアウトプットを持つ長いコンテキスト、多種多様で複雑なツールコール、高いが不完全なプレフィックスキャッシュヒット率を特徴としている。
これらの結果は,低オーバーヘッドツールコール,付加長対応プリフィル,セマンティック対応ツールレイテンシ予測,人体接触ギャップ周辺のKV-cache管理の改善など,サービス提供を最適化する具体的な機会を示唆している。
論文 参考訳(メタデータ) (2026-06-29T16:59:05Z) - RelAgent: LLM Agents as Data Scientists for Relational Learning [16.494534572858125]
RelAgentはリレーショナルデータベースに基づく学習のための自律科学者である。
検索フェーズと推論フェーズの2つのフェーズで動作します。
機能は可読性があり、予測は結果のクエリ定義機能マップに依存する。
論文 参考訳(メタデータ) (2026-05-08T15:06:12Z) - Agentic-imodels: Evolving agentic interpretability tools via autoresearch [35.865162623438025]
Agentic-imodelsは、エージェントによって解釈されるように設計されたデータサイエンスツールを進化させるエージェント自動検索ループである。
この計量は、実装されたモデルの文字列表現が LLM によって "simulatable" であるかどうかを測定する。
進化したモデルによって予測性能とエージェント対面の解釈性が向上することが判明した。
論文 参考訳(メタデータ) (2026-05-05T14:35:47Z) - Graph-of-Agents: A Graph-based Framework for Multi-Agent LLM Collaboration [57.23877089929136]
Graph-of-Agents (GoA)はマルチエージェントLLM通信をモデリングするための新しいグラフベースのフレームワークである。
GoAは3つの選択されたエージェントしか使用せず、最近のマルチエージェントLCMベースラインよりも優れたパフォーマンスを実現している。
論文 参考訳(メタデータ) (2026-04-18T21:13:03Z) - Can LLM Annotations Replace User Clicks for Learning to Rank? [112.2254432364736]
大規模な教師付きデータは最新のランキングモデルのトレーニングには不可欠だが、高品質な人的アノテーションの取得にはコストがかかる。
クリックデータは低コストの代替手段として広く使われており、近年の大規模言語モデル(LLM)の発展に伴い、LLMベースの関連アノテーションも有望なアノテーションとして登場した。
公開データセットであるTianGong-STと、産業データセットであるBaidu-Clickの両方の実験は、クリック管理モデルが高周波クエリでより良いパフォーマンスを示すことを示している。
データスケジューリングと周波数対応多目的学習という2つのトレーニング戦略を検討し、両方の監視信号を統合する。
論文 参考訳(メタデータ) (2025-11-10T02:26:14Z) - SciML Agents: Write the Solver, Not the Solution [69.5021018644143]
敵の"ミスリーディング"問題の診断データセットと,1,000種類のODEタスクの大規模ベンチマークという,2つの新しいデータセットを紹介した。
オープンおよびクローズドソース LLM モデルについて, (i) 誘導型とガイド型, (ii) オフ・ザ・シェルフ対微調整型という2つの軸に沿って評価した。
予備的な結果は、慎重なプロンプトと微調整により、単純なODE問題を確実に解決できる特殊なLLMエージェントが得られることを示唆している。
論文 参考訳(メタデータ) (2025-09-12T02:53:57Z) - AIRepr: An Analyst-Inspector Framework for Evaluating Reproducibility of LLMs in Data Science [8.281093505963158]
大規模言語モデル(LLM)は、実行可能なコード生成を通じてデータ分析を自動化するために、ますます使われるようになっている。
本稿では,LLM生成データ分析の自動評価と改善のための分析・検査フレームワークであるAIReprについて述べる。
論文 参考訳(メタデータ) (2025-02-23T01:15:50Z) - Distill Visual Chart Reasoning Ability from LLMs to MLLMs [64.32993770646165]
マルチモーダル大言語モデル(MLLM)における複雑なチャートQ&Aタスクの解決には高度な視覚的推論能力が必要である
我々は,LLMからMLLMへの視覚的推論能力を蒸留するための費用効率,効率,スケーラブルなデータ合成手法であるCode-as-Intermediary Translation (CIT)を提案する。
ReachQAは、MLLMの認識と推論能力を高めるために、3kの推論集約チャートと20kのQ&Aペアを含むデータセットである。
論文 参考訳(メタデータ) (2024-10-24T14:50:42Z) - GraphTeam: Facilitating Large Language Model-based Graph Analysis via Multi-Agent Collaboration [31.07238612043854]
GraphTeamは3つのモジュールから5つのLLMベースのエージェントで構成されており、異なる特殊性を持つエージェントは複雑な問題に対処するために協力することができる。
6つのグラフ分析ベンチマークの実験は、GraphTeamが最先端のパフォーマンスを達成し、精度の点で最高のベースラインよりも平均25.85%改善していることを示している。
論文 参考訳(メタデータ) (2024-10-23T17:02:59Z) - AvaTaR: Optimizing LLM Agents for Tool Usage via Contrastive Reasoning [93.96463520716759]
大規模言語モデル(LLM)エージェントは、精度と幻覚を高めるために外部ツールと知識を活用する際、印象的な能力を示した。
本稿では、LLMエージェントを最適化して提供されたツールを効果的に活用し、与えられたタスクのパフォーマンスを向上させる新しい自動化フレームワークであるAvaTaRを紹介する。
論文 参考訳(メタデータ) (2024-06-17T04:20:02Z) - MatPlotAgent: Method and Evaluation for LLM-Based Agentic Scientific Data Visualization [86.61052121715689]
MatPlotAgentは、科学的データ可視化タスクを自動化するために設計された、モデルに依存しないフレームワークである。
MatPlotBenchは、100人の検証されたテストケースからなる高品質なベンチマークである。
論文 参考訳(メタデータ) (2024-02-18T04:28:28Z) - MLAgentBench: Evaluating Language Agents on Machine Learning Experimentation [96.71370747681078]
我々は,CIFAR-10におけるモデル性能の改善から,BabyLMのような最近の研究課題まで,13のタスクからなるMLAgentBenchを紹介した。
各タスクに対して、エージェントはファイルの読み書き、コードの実行、出力の検査などのアクションを実行することができる。
我々は、Claude v1.0、Claude v2.1、Claude v3 Opus、GPT-4、GPT-4-turbo、Gemini-Pro、Mixtralに基づいてベンチマークエージェントをベンチマークし、Claude v3 Opusエージェントが成功率の点で最高であることを示す。
論文 参考訳(メタデータ) (2023-10-05T04:06:12Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。