論文の概要: The "I Don't Know" Filter: Enhancing Agentic Reliability in Function Calling
- arxiv url: http://arxiv.org/abs/2607.04034v1
- Date: Sat, 04 Jul 2026 21:27:40 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.802706
- Title: The "I Don't Know" Filter: Enhancing Agentic Reliability in Function Calling
- Title(参考訳): I Don't Know"フィルタ:関数呼び出しにおけるエージェント信頼性の向上
- Abstract要約: 本稿では,誤った関数呼び出しに関連する負の結果を考慮したエージェント評価指標を提案する。
また,言語モデルの不確実性を定量化し,潜在的に有害な関数呼び出しを除去できる軽量なトレーニング可能なフィルタを提案する。
- 参考スコア(独自算出の注目度): 4.639828178736218
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: The language models that underpin agents have seen a rapid rise in performance on function calling benchmarks. However, the metrics used in the training and evaluation of these models often encourage models to make positive claims even when the answer is uncertain, leading to hallucinations. Such hallucinations can be disastrous when language models are trusted to use function calls to make decisions in high stakes applications. To that end, we propose an agent evaluation metric that takes into account the negative outcomes associated with incorrect function calls. Further, to catch hallucinations before they can cause harm, we propose a lightweight trainable filter that can quantify a language model's uncertainty and remove potentially harmful function calls. By training that filter to detect and suppress uncertain function calls without modifying the underlying model, we demonstrate a practical path toward agents that know when to say "I don't know," a property we argue is essential to production reliability.
- Abstract(参考訳): エージェントを基盤とする言語モデルでは,関数呼び出しベンチマークのパフォーマンスが急速に向上している。
しかしながら、これらのモデルのトレーニングと評価に使用されるメトリクスは、答えが不確かでも肯定的な主張をモデルに促すことがしばしばあり、幻覚につながる。
このような幻覚は、言語モデルが高い利害関係のアプリケーションで決定を下すために関数呼び出しを使用することを信頼されている場合、破滅的なものになる可能性がある。
そこで本研究では,誤った関数呼び出しに関連する負の結果を考慮したエージェント評価指標を提案する。
さらに,害を引き起こす前に幻覚を捉えるために,言語モデルの不確実性を定量化し,潜在的に有害な関数呼び出しを除去できる軽量なトレーニング可能なフィルタを提案する。
基礎となるモデルを変更することなく、不確実な関数呼び出しを検出し、抑制するためにフィルタを訓練することにより、我々は、いつ「私は知らない」と言うかを知っているエージェントへの実践的な道を示す。
関連論文リスト
- Actionable Hallucination Detection: Translating Latent Uncertainty into Agentic Critique [1.1172382217477128]
AIエージェントとしてデプロイされるLarge Language Models (LLM)は、しばしばユーザ仕様のグラウンド障害を示す。
既存の検出方法は、幻覚をローカライズしないか、禁忌の推論遅延を発生しないため、実行可能でリアルタイムな修正を提供することができない。
フリーズベースLCM世代と並行して動作する軽量低ランクアダプタ(LoRA)であるLatent Criticを導入する。
論文 参考訳(メタデータ) (2026-08-11T03:26:16Z) - LLMs Should Express Uncertainty Explicitly [19.324830531710024]
モデルが最終回答の正当性スコアを口頭弁別するグローバルインターフェースと、推論中に明確な不確定なマーカーを出力するローカルインターフェースの2つの相補的インターフェースを比較した。
垂直化信頼度はキャリブレーションを大幅に改善し、過信エラーを低減し、アダプティブRAGコントローラとして最強となる。
推論時不確実性信号は、生成中に前もってサイレント障害を可視化し、回答のカバレッジを改善し、効果的なハイリコール検索トリガを提供する。
論文 参考訳(メタデータ) (2026-04-07T01:20:29Z) - Decomposed Prompting Does Not Fix Knowledge Gaps, But Helps Models Say "I Don't Know" [47.930782177987446]
大規模言語モデルは、クローズドブックの質問応答において知識限界を認識するのに苦労することが多く、自信ある幻覚へと繋がる。
我々は、モデルスケールの異なるDirect、Assistive、Incrementalの3つのタスク等価プロンプトとマルチホップQAベンチマークを評価した。
幻覚が一致している間に事実知識が安定しているため、クロスレジームは内部の不確実性の正確なシグナルを与える。
論文 参考訳(メタデータ) (2026-02-04T18:39:58Z) - Internal Representations as Indicators of Hallucinations in Agent Tool Selection [5.2107604548805915]
大規模言語モデル(LLM)は、ツール呼び出しとツールの使用において顕著な能力を示している。
LLMは、誤ったツールを選択し、不正なパラメータを提供し、"ツールバイパス"の振る舞いを示す幻覚に悩まされる。
LLMの内部表現を利用して,ツールコールの幻覚をリアルタイムに検出する,計算効率のよいフレームワークを提案する。
論文 参考訳(メタデータ) (2026-01-08T18:38:45Z) - Self-Consistency as a Free Lunch: Reducing Hallucinations in Vision-Language Models via Self-Reflection [71.8243083897721]
視覚言語モデルは、しばしば詳細を幻覚させ、既存のオブジェクトを生成するか、出力信頼性を損なう不正確な属性を生成する。
本稿では、長文応答と短文応答の自己整合性を利用して、学習のための選好ペアを生成する新しいフレームワークを提案する。
論文 参考訳(メタデータ) (2025-09-27T10:37:11Z) - Evaluating Language Model Reasoning about Confidential Information [95.64687778185703]
言語モデルが文脈的堅牢性を示すか、文脈依存型安全仕様に準拠する能力を示すかを検討する。
我々は,ユーザ要求がいつ承認されたか,言語モデルが正しく判断できるかどうかを測定するベンチマーク(PasswordEval)を開発した。
現在のオープンソースとクローズドソースのモデルでは、一見単純な作業に苦労しています。
論文 参考訳(メタデータ) (2025-08-27T15:39:46Z) - Counterfactual Probing for Hallucination Detection and Mitigation in Large Language Models [0.0]
本研究では,大規模言語モデルにおける幻覚の検出と緩和のための新しいアプローチである,対物探索を提案する。
提案手法は, 疑わしいが微妙な事実誤りを含む反事実文を動的に生成し, これらの摂動に対するモデルの感度を評価する。
論文 参考訳(メタデータ) (2025-08-03T17:29:48Z) - Rationales Are Not Silver Bullets: Measuring the Impact of Rationales on Model Performance and Reliability [70.4107059502882]
有理数拡張による学習言語モデルは、多くの既存の作品において有益であることが示されている。
モデル性能に対する合理的性の影響を徹底的に調査するため、包括的調査を行う。
論文 参考訳(メタデータ) (2025-05-30T02:39:37Z) - The Art of Saying No: Contextual Noncompliance in Language Models [123.383993700586]
本稿では,ユーザの要求に従わないモデルについて,コンテキスト非準拠の包括的分類を導入する。
我々の分類は、不完全、不完全、不完全、不決定、人為的要求を含む幅広いカテゴリーにまたがる。
言語モデルの非準拠性をテストするために,1000個の非準拠プロンプトの新たな評価スイートを開発するために,この分類法を用いる。
論文 参考訳(メタデータ) (2024-07-02T07:12:51Z) - Improving the Reliability of Large Language Models by Leveraging
Uncertainty-Aware In-Context Learning [76.98542249776257]
大規模言語モデルはしばしば「ハロシン化」の課題に直面している
本研究では,不確実性に応答してモデルが出力を拡張あるいは拒否することを可能にする,不確実性を考慮したコンテキスト内学習フレームワークを提案する。
論文 参考訳(メタデータ) (2023-10-07T12:06:53Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。