論文の概要: Making AI-Assisted Grant Evaluation Auditable without Exposing the Model
- arxiv url: http://arxiv.org/abs/2604.25200v1
- Date: Tue, 28 Apr 2026 04:10:04 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-29 16:49:17.710145
- Title: Making AI-Assisted Grant Evaluation Auditable without Exposing the Model
- Title(参考訳): モデルを公開せずにAI支援型グラント評価を監査可能にする
- Authors: Kemal Bicakci,
- Abstract要約: 本稿では,遠隔検定による要求の整合を支援するTEEアーキテクチャを提案する。
このアーキテクチャにより、外部検証者はどのモデル、ルーブリック、プロンプトテンプレート、入力表現が使われたかをチェックすることができる。
我々は、秘密のAI推論、証明可能なAI監査、ゼロ知識機械学習、アルゴリズムのアカウンタビリティ、AI支援ピアレビューに対する設計を位置付ける。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Public agencies are beginning to consider large language models (LLMs) as decision-support tools for grant evaluation. This creates a practical governance problem: the model and scoring rubric should not be exposed in a way that allows applicants to optimize against them, yet the evaluation process must remain auditable, contestable, and accountable. We propose a TEE-based architecture that helps reconcile these requirements through remote attestation. The architecture allows an external verifier to check which model, rubric, prompt template, and input representation were used, without exposing model weights, proprietary scoring logic, or intermediate reasoning to applicants or infrastructure operators. The main artifact is an attested evaluation bundle: a signed, timestamped record linking the original submission hash, the canonical input hash, the model-and-rubric measurement, and the evaluation output. The paper also considers a scenario-specific prompt injection risk: applicant-controlled documents may contain hidden or indirect instructions intended to influence the LLM evaluator. We therefore include a canonicalization and sanitization layer that normalizes document representations and records suspicious transformations before inference. We position the design relative to confidential AI inference, attestable AI audits, zero-knowledge machine learning, algorithmic accountability, and AI-assisted peer review. The resulting claim is deliberately narrow: remote attestation does not prove that an evaluation is fair or scientifically correct, but it can make part of the evaluation process externally verifiable.
- Abstract(参考訳): 公共機関は、大きな言語モデル(LLM)を承認評価のための意思決定支援ツールとして検討し始めている。
モデルとスコアリングのルーリックは、応募者がそれに対して最適化できる方法で公開されてはならないが、評価プロセスは監査可能で、競争可能で、説明可能である必要がある。
本稿では,遠隔検定による要求の整合を支援するTEEアーキテクチャを提案する。
このアーキテクチャでは、モデルウェイト、プロプライエタリなスコアリングロジック、または申請者やインフラストラクチャーオペレータへの中間推論を公開せずに、どのモデル、ルーリック、プロンプトテンプレート、入力表現が使用されたかをチェックすることができる。
主なアーティファクトは、原提出ハッシュをリンクする符号付きタイムスタンプ付きレコード、標準入力ハッシュ、モデル・アンド・ルブリック測定、評価出力である。
また、シナリオ特異的なインジェクションのリスクについても検討し、LLM評価に影響を及ぼすための隠蔽命令や間接命令を含む文書を提出する。
したがって、文書表現を正規化し、推論の前に不審な変換を記録する正準化・衛生化層を含む。
我々は、秘密のAI推論、証明可能なAI監査、ゼロ知識機械学習、アルゴリズムのアカウンタビリティ、AI支援ピアレビューに対する設計を位置付ける。
遠隔検定は、評価が公正であるか科学的に正しいことを証明しないが、外部で検証可能な評価プロセスの一部を構成することができる。
関連論文リスト
- AutoVerifier: An Agentic Automated Verification Framework Using Large Language Models [8.006071608749648]
AutoVerifierは、技術的クレームのエンドツーエンド検証を自動化するエージェントフレームワークである。
すべての技術的主張を形式の構造的クレームトリプルに分解する。
新興技術の妥当性と成熟度を確実に評価することができる。
論文 参考訳(メタデータ) (2026-04-03T01:11:43Z) - Explainability and Certification of AI-Generated Educational Assessments [0.0]
この章では、AI生成アセスメント項目の説明可能性と認定のための包括的なフレームワークを提案する。
保証、アライメント予測、レビューアアクション、倫理指標をキャプチャするために、構造化された認証メタデータスキーマが導入される。
500のAI生成コンピュータサイエンス問題に関する概念実証研究は、このフレームワークの実現可能性を示している。
論文 参考訳(メタデータ) (2026-03-18T11:33:58Z) - Preventing the Collapse of Peer Review Requires Verification-First AI [49.995126139461085]
我々は、真理結合、すなわち、過度に科学的真理をトラックする場所のスコアの厳密さを提案する。
プロキシ・ソブリン評価に向けた相転移を駆動する2つの力の形式化を行う。
論文 参考訳(メタデータ) (2026-01-23T17:17:32Z) - Gaming the Judge: Unfaithful Chain-of-Thought Can Undermine Agent Evaluation [76.5533899503582]
大規模言語モデル(LLM)は、エージェントのパフォーマンスを評価するために、ますます裁判官として使われている。
このパラダイムは、エージェントのチェーン・オブ・シークレット(CoT)推論が内部の推論と環境状態の両方を忠実に反映していることを暗黙的に仮定している。
我々は、操作された推論だけで、様々なWebタスクにまたがる800の軌跡に対して、最先端のVLM審査員の偽陽性率を最大90%向上させることができることを実証した。
論文 参考訳(メタデータ) (2026-01-21T06:07:43Z) - PaperAudit-Bench: Benchmarking Error Detection in Research Papers for Critical Automated Peer Review [54.141490756509306]
本稿では、エラーデータセットであるPaperAudit-Datasetと、自動レビューフレームワークであるPaperAudit-Reviewの2つのコンポーネントからなるPaperAudit-Benchを紹介する。
PaperAudit-Benchの実験では、モデルと検出深さの誤差検出可能性に大きなばらつきが示された。
本研究では,SFTおよびRLによる軽量LLM検出器のトレーニングをサポートし,計算コストの削減による効率的な誤り検出を実現する。
論文 参考訳(メタデータ) (2026-01-07T04:26:12Z) - ORCHID: Orchestrated Retrieval-Augmented Classification with Human-in-the-Loop Intelligent Decision-Making for High-Risk Property [6.643427585499247]
ORCHIDは、HRP分類のためのモジュール型エージェントシステムである。
検索強化世代(RAG)を人間の監視と組み合わせて、監査可能なポリシベースのアウトプットを生成する。
デモでは、単一項目の提出、接地された引用、中小企業のフィードバックキャプチャ、エクスポート可能な監査アーティファクトなどが紹介されている。
論文 参考訳(メタデータ) (2025-11-07T03:48:05Z) - "Show Me You Comply... Without Showing Me Anything": Zero-Knowledge Software Auditing for AI-Enabled Systems [2.2981698355892686]
本稿では,新しいMLOps検証フレームワークであるZKMLOpsを紹介する。
ZKP(Zero-Knowledge Proofs)暗号プロトコルを運用し、証明者が証明者に対して、文が真実であることを納得させることができる。
我々は、金融リスク監査における規制コンプライアンスの研究を通じて、この枠組みの実践性を評価する。
論文 参考訳(メタデータ) (2025-10-30T15:03:32Z) - Automatic Reviewers Fail to Detect Faulty Reasoning in Research Papers: A New Counterfactual Evaluation Framework [55.078301794183496]
我々は、高品質なピアレビューを支えるコアレビュースキル、すなわち欠陥のある研究ロジックの検出に注力する。
これは、論文の結果、解釈、クレームの間の内部の一貫性を評価することを含む。
本稿では,このスキルを制御条件下で分離し,テストする,完全自動対物評価フレームワークを提案する。
論文 参考訳(メタデータ) (2025-08-29T08:48:00Z) - Garbage In, Reasoning Out? Why Benchmark Scores are Unreliable and What to Do About It [1.6261897792391753]
我々は、SocialIQa、FauxPas-EAI、ToMiの3つの広く使われている推論ベンチマークの体系的な監査を行う。
ベンチマーク項目と評価手法の両方において,広範な欠陥を明らかにする。
論文 参考訳(メタデータ) (2025-06-30T13:57:28Z) - OpenFactCheck: Building, Benchmarking Customized Fact-Checking Systems and Evaluating the Factuality of Claims and LLMs [59.836774258359945]
OpenFactCheckは、カスタマイズされたファクトチェックシステムを構築するためのフレームワークである。
ユーザーは自動的にファクトチェッカーをカスタマイズし、文書やクレームの事実的正当性を検証できる。
CheckerEVALは、人間の注釈付きデータセットを使用して、自動ファクトチェッカーの検証結果の信頼性を高めるソリューションである。
論文 参考訳(メタデータ) (2024-05-09T07:15:19Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。