論文の概要: Confining Nondeterminism: AI-Driven Research Systems as DBMSs for Reliable, Non-Wasteful, Transparent, and Collaborative Research [Vision]
- arxiv url: http://arxiv.org/abs/2607.10508v1
- Date: Sat, 11 Jul 2026 23:46:01 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-14 15:40:48.446038
- Title: Confining Nondeterminism: AI-Driven Research Systems as DBMSs for Reliable, Non-Wasteful, Transparent, and Collaborative Research [Vision]
- Title(参考訳): 非決定論の解明--信頼性、不水性、透明、協調研究のためのDBMSとしてのAI駆動型研究システム [Vision]
- Abstract要約: 今日のエージェントループは、エージェントを含む内部状態がチェックできないエグゼキュータである、と私たちは主張する。
LLMの内部を見るのではなく、データベースからレッスンを受けます。
プロジェクトは決定論的でバージョン管理されたデータフローエンジン内にあり、LLMはユーザとともに、その計画だけを編集するコンパイラである。
- 参考スコア(独自算出の注目度): 6.1118660156378075
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: LLM agents that conduct research (proposing ideas, writing and running code, analyzing results) can already carry a study from research question to figures, yet cannot be fully trusted. The same question asked twice in a row returns different answers; the agent announces a number that no execution produced, and tool use does not prevent this, because nothing binds what the agent reports to what its tools returned; a small upstream change leaves downstream results silently stale, with no way to list which ones; and the agent re-runs preprocessing and rewrites code it has already produced. We argue these failures share one root: every step of today's agent loop is a stochastic LLM call whose internal state nobody, including the agent, can check. Rather than trying to see inside the LLM, we take a lesson from databases, which earn trust without being watched, because deterministic operators over well-defined state make their guarantees hold by construction. We propose organizing a research project the same way. The project lives in a deterministic, versioned dataflow engine (in effect, a query plan over materialized views), and the LLM, together with the user, is a stochastic compiler that may only edit that plan. The executor never calls the LLM; LLM output enters only as versioned code and data that the executor then runs, and any asserted result enters the record only with an execution behind it. Five design rules at this boundary turn familiar database machinery, from versioning and provenance to incremental maintenance and cost-based scheduling, into guarantees that make research reliable, non-wasteful, transparent, and collaborative. This report presents the diagnosis, the requirements, and the design; the guarantee walkthrough, a prototype, and the research agenda appear in the full version, in preparation. The LLM, we argue, should be the query compiler, never the executor.
- Abstract(参考訳): 研究を行うLLMエージェント(アイデアの提供、コードの作成と実行、結果の分析)は、すでに研究質問から数字まで研究を行なえるが、完全に信頼できない。
エージェントが生成しない数値を公表し、ツールの使用がこれを防ぐことはない、なぜならエージェントがツールが返したことを報告するものには何も結合しないからである。
今日のエージェントループのすべてのステップは、エージェントを含む内部状態がチェックできない確率的なLSMコールです。
LLMの内部を見るのではなく、よく定義された状態上の決定論的演算子が、構築によって保証されるので、見られていることなく信頼を得るデータベースからレッスンを受けます。
同様に研究プロジェクトを組織することを提案する。
プロジェクトは決定論的でバージョン管理されたデータフローエンジン(事実上、マテリアライズドビュー上のクエリプラン)に存在し、LLMはユーザとともに、その計画だけを編集する確率的なコンパイラである。
LLM出力は、エグゼキュータが実行したバージョン付きコードとデータとしてのみ入力され、アサートされた結果は、その背後に実行されただけでレコードに入る。
この境界における5つの設計ルールは、バージョニングや前例から漸進的なメンテナンスやコストベースのスケジューリングに至るまで、よく知られたデータベース機構を、研究を信頼し、不便で、透明で、協力的なものにする保証へと変えます。
本報告では, 診断, 要件, 設計について述べる。
LLMはクエリコンパイラであって,エグゼキュータではない,と私たちは主張しています。
関連論文リスト
- TTHE: Test-Time Harness Evolution [50.26245555541721]
既存のアプローチでは、デプロイ前、トレーニング前、あるいはテスト時に凍結される固定されたエージェントワークフローの開発データを最適化する。
我々は、エージェントがテスト入力で生成するラベルのない実行トレースのみを使用して、評価自体にハーネスを最適化できるかどうかを問う。
評価中、TTHEは候補ハーネスの人口を維持し、それらの実行トレースの理由をエージェントプロジェクタを通じてそれらを洗練する。
その後、審査員は実行元プロキシ信号から改善されたハーネスをコミットし、選択したプログラムは継続してその後の入力を統治する。
論文 参考訳(メタデータ) (2026-07-09T05:53:39Z) - When Agents Do Not Stop: Uncovering Infinite Agentic Loops in LLM Agents [7.986500985812644]
私たちはこの問題をInfinite Agentic Loops (IALs)と呼んでいる。
IALはエージェントロジック、フレームワークセマンティクス、実行時の観察、終了メカニズム間の相互作用から生まれる。
本研究では,実世界のLLMエージェントプロジェクトにおけるALF検出のための静的解析ツールであるIAL-Scanを提案する。
論文 参考訳(メタデータ) (2026-07-02T03:14:27Z) - LLM-as-Code: Agentic Programming for Agent Harness [20.350593038902904]
我々はトークンの爆発、制御フローの幻覚、信頼できない完成は実装上のバグではないと主張している。
より良いプロンプトやより強力なモデルは、LLMエージェントの信頼性を保証することはできない。
本稿では,プログラムがすべての制御フローを制御し,LLMがそれの一部であるエージェントプログラミングを提案する。
論文 参考訳(メタデータ) (2026-06-14T15:47:27Z) - Securing LLM Agents Need Intent-to-Execution Integrity [49.490963596514185]
我々は, LLMエージェントの確保には, エージェントの実行がユーザの意図を忠実に反映した場合に規定するエンドツーエンドの正当性を定義する必要があると主張している。
LLMエージェントはコンパイラと構造的に類似しており、セキュリティ違反はユーザ意図を保存しない誤った実行に対応する。
emphTool整合性、emph命令整合性、emphJudgment整合性、emphData整合性。
論文 参考訳(メタデータ) (2026-05-16T12:53:31Z) - From Agent Loops to Structured Graphs:A Scheduler-Theoretic Framework for LLM Agent Execution [1.8222732878503212]
LLMベースのエージェントを構築するための主要なパラダイムはエージェントループ(Agent Loop)である。
この観点では、エージェントループとグラフベースの実行エンジンを単一のセマンティック連続体に配置する。
暗黙の文脈から暗黙の静的DAGへ制御フローを上昇させるSGHを提案する。
論文 参考訳(メタデータ) (2026-04-13T12:16:45Z) - From Helpful to Trustworthy: LLM Agents for Pair Programming [0.0]
LLMベースのコーディングエージェントは、コード、テスト、ドキュメントの生成にますます使われています。
それでも、彼らのアウトプットは、開発者意図と正しく一致せず、進化するプロジェクトにおけるレビューの限られた証拠を提供することができる。
本研究では、意図を外部化し、反復検証に開発ツールを使用するマルチエージェントLLMペアプログラミングの体系的研究を提案する。
論文 参考訳(メタデータ) (2026-04-11T17:39:57Z) - RAVEL: Reasoning Agents for Validating and Evaluating LLM Text Synthesis [78.32151470154422]
テスト担当者が自律的に設計し、典型的な合成操作を実行できるようにするためのエージェントフレームワークであるRAVELを紹介する。
C3EBenchは、プロの人間の文章から1,258個のサンプルを抽出したベンチマークである。
SOTA LLMを演算子としてRAVELを増強することにより、そのようなエージェントテキスト合成はLLMの推論能力に支配されていることがわかった。
論文 参考訳(メタデータ) (2026-02-28T14:47:34Z) - On LLM-Assisted Generation of Smart Contracts from Business Processes [0.08192907805418582]
大規模言語モデル(LLM)は、ソフトウェアの生成方法の現実を変えました。
本稿では、ビジネスプロセス記述からスマートコントラクトコードを生成するためのLCMの使用について探索的研究を行う。
以上の結果から,LLMの性能はスマートコントラクト開発に必要な信頼性に劣ることがわかった。
論文 参考訳(メタデータ) (2025-07-30T20:39:45Z) - Get my drift? Catching LLM Task Drift with Activation Deltas [55.75645403965326]
タスクドリフトは攻撃者がデータを流出させたり、LLMの出力に影響を与えたりすることを可能にする。
そこで, 簡易線形分類器は, 分布外テストセット上で, ほぼ完全なLOC AUCでドリフトを検出することができることを示す。
このアプローチは、プロンプトインジェクション、ジェイルブレイク、悪意のある指示など、目に見えないタスクドメインに対して驚くほどうまく一般化する。
論文 参考訳(メタデータ) (2024-06-02T16:53:21Z) - ML-Bench: Evaluating Large Language Models and Agents for Machine Learning Tasks on Repository-Level Code [76.84199699772903]
ML-Benchは、既存のコードリポジトリを利用してタスクを実行する現実世界のプログラミングアプリケーションに根ざしたベンチマークである。
LLM(Large Language Model)とAIエージェントの両方を評価するために、事前に定義されたデプロイメント環境でLLMのテキスト-コード変換を評価するML-LLM-Benchと、Linuxサンドボックス環境でエンドツーエンドのタスク実行で自律エージェントをテストするML-Agent-Benchの2つの設定が採用されている。
論文 参考訳(メタデータ) (2023-11-16T12:03:21Z) - Assessing the Reliability of Large Language Model Knowledge [78.38870272050106]
大規模言語モデル(LLM)は、知識探索タスクにおける高い性能のため、知識ベースとして扱われてきた。
LLMが実際に正しい答えを連続的に生成する能力をどのように評価するか。
LLMの信頼性を直接測定するための新しい指標であるMOdel kNowledge relIabiliTy score (MONITOR)を提案する。
論文 参考訳(メタデータ) (2023-10-15T12:40:30Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。