論文の概要: When Does an Interpretation Count as Established? The Formation, Evaluation, and Responsibility of Interpretation in Generative AI
- arxiv url: http://arxiv.org/abs/2609.04766v1
- Date: Fri, 04 Sep 2026 05:58:41 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-07 18:15:23.926267
- Title: When Does an Interpretation Count as Established? The Formation, Evaluation, and Responsibility of Interpretation in Generative AI
- Title(参考訳): 解釈数はいつ成立するのか? : 生成AIにおける解釈の形成・評価・責任
- Abstract要約: この論文は、社会技術プロセスの中でどのように解釈が認識されるのかを問うものである。
資料とバージョン、明確な役割、失敗、契約修正、責任に関する5つの公的な要件を提案している。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Generative AI research has increasingly evaluated factuality, citation, coverage, and report structure. Yet passing such local checks does not by itself show that a humanistic interpretation has been established. This paper asks how an interpretation comes to be recognized within sociotechnical processes. It introduces three connected concepts. Interpretive appearance names the gap between the finished form of an output and the publicly traceable process through which materials, counterevidence, and revisions constrained the judgment. The evaluation contract names the bounded materials, tasks, criteria, permitted inferences, and failure conditions within which a local judgment is valid. Standing substitution names the unwarranted conversion of a genuine local pass into a stronger claim that an interpretation, result, or research capability has been established, without commensurate new evidence or bridging arguments. The paper then examines responsibility for judgment: a text may acquire recognition while no public structure remains for stating reasons, answering objections, revising, downgrading, or withdrawing the conclusion. Humanistic scholarship provides a revealing test because new materials and conceptual distinctions can alter both the question and the criteria of evaluation. The paper therefore develops delayed closure as a practice of keeping recognized interpretations revisable and proposes five public requirements concerning materials and versions, evidential roles, failure, contract revision, and responsibility. The argument is conceptual and normative: it does not claim to offer a benchmark or to determine whether models possess understanding. It instead explains why local evaluation, finished textual form, and public recognition must not be treated as sufficient evidence that an interpretation has been formed.
- Abstract(参考訳): 生成的AI研究は、事実、引用、カバレッジ、レポート構造をますます評価している。
しかし、そのような局所的なチェックを渡すことは、人文主義的な解釈が確立されたことを示すものではない。
本稿では,社会技術プロセスにおいて解釈がどのように認識されるのかを問う。
3つの概念が結びついている。
解釈的外見は、アウトプットの完成形式と、材料、証拠、修正が判断を制約する公然と追跡可能なプロセスの間のギャップを名付ける。
評価契約は、局所判定が有効である有界材料、課題、基準、許容推論、故障条件を指定する。
スタンドング代替は、真のローカルパスを、新たな証拠やブリッジングの議論を伴わずに、解釈、結果、または研究能力が確立されたという強い主張に改定する。
テキストは、理由の説明、反対意見の回答、修正、下級化、結論の撤回のための公共構造は残っていないが、認識を得ることができる。
ヒューマニズムの奨学金は、新しい材料と概念的な区別が問題と評価の基準の両方を変える可能性があるため、明らかなテストを提供する。
そこで,本論文では,資料・バージョン,明らかな役割,失敗,契約の見直し,責任に関する5つの公的な要件について,認識された解釈を維持するための実践として,遅延クロージャを開発した。
この議論は概念的で規範的であり、ベンチマークを提供したり、モデルに理解があるかどうかを判断するものではない。
代わりに、なぜ局所的な評価、完成したテキスト形式、そして公共の認識が、解釈が形成された十分な証拠として扱われるべきではないのかを説明する。
関連論文リスト
- Autoformalizing Argumentative Material Inferences [26.35292656634472]
我々は、ガード補完として議論材料推論のための自己形式化を開発する。
GUARDは、証明された信条を大幅に改善する。
シンボル的ソフトな批判と明示的な仮定層がこれらの利益の大部分を担っていることを示す。
論文 参考訳(メタデータ) (2026-09-15T11:05:26Z) - What Reaches Expert Review? Representation, Structural Screening, and Candidate-Form Dependence in AI-Assisted Item Development [0.7834978654423369]
表現、構造的縮小、選択政策は 精神科医がどの項目や証拠を 受け取ったかを決定する
32,000件のビッグファイブ項目を関連づけた2つのインサイリコ調査を行い, 構造的評価と候補形式構築を通じて, セマンティックな表現から固定された情報源群を追従した。
論文 参考訳(メタデータ) (2026-08-24T18:57:13Z) - Human-AI Co-Interpretation for Responsible AI: A Hermeneutic Perspective [4.832750949021042]
経験的理解はトークン予測に基づくテキスト生成と区別される。
ハーメニューティックな理解は、学際的な歴史的言語学の伝統にある説明可能な人間の通訳に限られている。
経験的理解はトークン予測に基づくテキスト生成と区別される。
論文 参考訳(メタデータ) (2026-08-02T18:19:13Z) - When benchmark inferences do not compose: Projectibility in AI evaluation [0.0]
AIベンチマークの結果が1ステップで連続的なクレームに達することはめったにない。
評価者はそれをさらなるケースに一般化し、能力の証拠として解釈し、新しいタスクに外挿し、他のシステムやサイトへ輸送する。
保証リンクは保証チェーンを自動的に作らない。
論文 参考訳(メタデータ) (2026-07-28T18:07:04Z) - Definitional alignment before capability alignment: a Design-Science framework for adjudicating claims about AGI [0.0]
AGIは単一の共有かつ安定した参照がなく、競合するオペレーティングは同一システム上で異なる検証を返すことができる。
この記事では、設計とガバナンスの問題として、その過小評価を扱います。
論文 参考訳(メタデータ) (2026-06-10T22:04:56Z) - Beyond Probabilistic Similarity: Structural, Temporal, and Causal Limitations of Retrieval-Augmented Generation in the Legal Domain [0.0]
Retrieval-Augmented Generationは、法的AIにおける信頼性の欠如に対する標準的なアーキテクチャ上の応答となっている。
これらの失敗は、確率的検索と法知識の階層的、時間的、制度的構造との間のアーキテクチャ上のミスマッチの兆候であると主張する。
まず、古典的法理論から派生した三つの性質として法知識のオントロジ的コミットメントを明記する。
第2に, 機能的定義, 故障機構, 正準例, 検出基準による検索の3つの病態(メレオジカルブラインドネス, ダイアクロニックブラインドネス, 因果不透明度)を同定する。
論文 参考訳(メタデータ) (2026-06-08T16:46:53Z) - When AI reviews science: Can we trust the referee? [73.47745294608072]
私たちは、トレーニングとデータ検索、デスクレビュー、深いレビュー、反論、システムレベルといった、レビューライフサイクル全体のアタックをマップします。
評価スコアに高名度フレーミング, 断定力, 反抗薬効, 文脈中毒の因果効果を分離するために, 2つの高度なLCMベースの審判を用いた。
論文 参考訳(メタデータ) (2026-04-26T08:03:32Z) - FactReview: Evidence-Grounded Reviews with Literature Positioning and Execution-Based Claim Verification [57.196748998757954]
本稿では,クレーム抽出,文献位置決定,実行に基づくクレーム検証を組み合わせたエビデンスベースレビューシステムであるFactReviewを紹介する。
FactReviewは論文を提出すると、主要なクレームを特定し、その結果を報告し、論文の技術的な位置を明らかにするために近くの作業を取り出し、コードが利用可能であれば、リリースされたリポジトリを実行する。
その後、簡潔なレビューと、主要な請求を5つのラベルのうち1つに割り当てるエビデンスレポートを生成する。
論文 参考訳(メタデータ) (2026-04-05T11:45:22Z) - When Contextual Inference Fails: Cancelability in Interactive Instruction Following [51.2195840589474]
私たちは、コンテキスト意味構築のためのインタラクティブなベンチマークであるBuild What I Meanを紹介します。
BWIMでは、モデルは文脈推論を行うか、小さな通信コストで明確化を要求することによって曖昧さを解決しなければならない。
我々は,不確実性の下でのパートナーブラインド過度明確化や質問逆推定などの準最適戦略を観察する。
論文 参考訳(メタデータ) (2026-03-20T14:46:59Z) - Is the Top Still Spinning? Evaluating Subjectivity in Narrative Understanding [40.78154629252038]
曖昧なクレームにバイナリラベルを強制すると、評価の信頼性が低下する。
請求項のニュアンス評価を提供する方法として,LCM生成した要約の編集を紹介する。
我々は,ARMが主張の忠実性に関するアノテータ合意において,絶対的な21%の改善をもたらすことを示す。
論文 参考訳(メタデータ) (2025-04-01T19:08:24Z) - DnDScore: Decontextualization and Decomposition for Factuality Verification in Long-Form Text Generation [48.134780006638984]
分解と非文脈化は独立に研究されているが、完全なシステムにおける相互作用は研究されていない。
我々は、異なる分解、非文脈化、検証戦略の評価を行い、戦略の選択が結果の事実性スコアに重要であることを確認する。
DnDScoreは文脈情報の文脈におけるサブ文の検証を行う非コンテクスト化対応検証手法である。
論文 参考訳(メタデータ) (2024-12-17T18:54:01Z) - DELTA: Pre-train a Discriminative Encoder for Legal Case Retrieval via Structural Word Alignment [55.91429725404988]
判例検索のための識別モデルであるDELTAを紹介する。
我々は浅層デコーダを利用して情報ボトルネックを作り、表現能力の向上を目指しています。
本手法は, 判例検索において, 既存の最先端手法よりも優れている。
論文 参考訳(メタデータ) (2024-03-27T10:40:14Z) - On the Faithfulness Measurements for Model Interpretations [100.2730234575114]
ポストホックな解釈は、自然言語処理(NLP)モデルがどのように予測を行うかを明らかにすることを目的とする。
これらの問題に取り組むために,我々は,削除基準,解釈の感度,解釈の安定性という3つの基準から始める。
これらの忠実性概念のデシデラタムに動機づけられ、敵対的領域からのテクニックを採用する新しい解釈方法のクラスを導入する。
論文 参考訳(メタデータ) (2021-04-18T09:19:44Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。