論文の概要: Correct codes for the wrong reasons? validating LLMs as measurement instruments for theoretical constructs
- arxiv url: http://arxiv.org/abs/2606.28574v1
- Date: Fri, 26 Jun 2026 19:58:39 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-30 18:07:15.61293
- Title: Correct codes for the wrong reasons? validating LLMs as measurement instruments for theoretical constructs
- Title(参考訳): 誤った理由で正しい符号は?理論構成のための測定器としてのLCMの検証
- Abstract要約: 大きな言語モデル(LLM)は、人間のアノテーションとしてテキストで構造をコードする。
楽器は理論に精通し、構造理論の要求のどれにも満たさない相関を通じてコードに到達する。
ギャップを埋める方法として粒度校正を提案する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: When a large language model (LLM) codes a construct in text as a human annotator would, that agreement makes the LLM a reliable coder. Yet reliability leaves construct validity untouched. The instrument may be theory-naive, reaching the code through a correlate that meets none of the demands the construct's theory makes, and no current method tells that apart from genuine measurement. We propose grain calibration as a method that closes the gap. It decomposes a construct into clause-level components, tests each against the text with extractive evidence, and combines the results through an explicit, theory-derived rule. Because the rule is stated rather than lodged in one opaque pass, its structure is evidence about the process rather than the output. It shows which components settled a code, and, when the code is wrong, whether a component was missed or an adjacent construct mistaken for it. Validation shifts from scoring an instrument's outputs against an annotator to showing that the instrument runs on the construct its theory specifies.
- Abstract(参考訳): 大きな言語モデル(LLM)が人間のアノテータとしてテキストのコンストラクトをコードする場合、この合意によりLLMは信頼できるコーダとなる。
しかし、信頼性は信頼性を損なう。
楽器は理論に精通し、構造理論の要求のどれにも満たさない相関を通してコードに到達し、現在の方法では真の測定値とは別にそれを示さない。
ギャップを埋める方法として粒度校正を提案する。
構造を節レベルの構成要素に分解し、テキストに対してそれぞれを抽出的証拠でテストし、明示的な理論に基づくルールを通じて結果を結合する。
この規則は1つの不透明なパスでロッジされるのではなく、記述されているので、その構造は出力ではなくプロセスに関する証拠である。
どのコンポーネントがコードに落ち着いたかを示し、コードが間違っていた場合、コンポーネントが見逃されたか、隣のコンストラクトが間違っていたかを示す。
検証は、楽器の出力をアノテータに対して得点することから、楽器がその理論が規定する構成上を走ることを示すことにシフトする。
関連論文リスト
- The LLM Proposes, the Executive Disposes: A Self-Verifying Agent Instrument that Dissociates Commitment Drift from Binding Drift in Long-Horizon Agents [0.0]
本稿では,ポストホックではなく構造的検証を行うためのエージェント機器を提案する。
組織ごとの書き込みエラー、レンダリングサイズ、あるいは塩漬けのカナリアエチョフロアが破られた場合、実行はすべて無効になる。
長期のエージェントが苦しむたびに、クリーンでシングル変数の結果が報告される。
論文 参考訳(メタデータ) (2026-08-04T15:10:37Z) - Validity of LLMs as data annotators: AMALIA on authority [0.0]
校正された英語の楽器がAMALIA-9Bとヨーロッパのポルトガル語に転送されるかどうかを問う。
AMALIAはいまだに大規模にスクリーンとプリコードを行うことができるが、この構造を単独で行うのに十分な程度に測定することはできない。
論文 参考訳(メタデータ) (2026-07-09T17:34:25Z) - Pramana: A Protocol-Layer Treatment of Claim Verification in Autonomous Agent Networks [0.0]
確率的検証パターン(自己整合性投票、レビュアー LLM アンサンブル)は、人工物ではなく、判断を生成する。
Pramana は、ワイヤフォーマットの欠如を定義している。すべての連続エージェント出力は、タイプ付き ClaimAttestation でラップされ、4つの変種のうちの1つでラップされる。
プラマナは3つの対称性を再現したモデル(38,563個の到達可能な状態、0個の不変な違反)でTLCの下で徹底的に検証された。
論文 参考訳(メタデータ) (2026-05-19T17:00:33Z) - What Really Improves Mathematical Reasoning: Structured Reasoning Signals Beyond Pure Code [72.9921566968371]
ドメイン分離のきめ細かい10T-tokenコーパスにおける事前学習の制御実験により,コードが推論を改善するという主張を再考する。
コードはプログラミング能力を大幅に改善するが、一般的な推論エンハンサーとして機能しない。
コード-テキストと数学-テキストの混合のようなドメイン間構造的推論トレースがよりうまく説明されている。
論文 参考訳(メタデータ) (2026-05-19T12:37:01Z) - Task Abstention for Large Language Models in Code Generation [16.35286288670945]
大規模言語モデル(LLM)は、自動コード生成に革命をもたらした。
「一つはいわゆる幻覚である。」
本研究は,特定のコード生成タスクの実行を停止すべきか否かを判定し,幻覚を避けるためのタスク停止問題について検討する。
論文 参考訳(メタデータ) (2026-05-16T14:58:11Z) - ProofSketcher: Hybrid LLM + Lightweight Proof Checker for Reliable Math/Logic Reasoning [0.0]
大規模言語モデル(LLMs)は、数学的および論理的分野における説得的議論を生み出す可能性がある。
LeanとCoqは、構文的および意味的ステートメントがプログラム内のすべての構文的および意味的ステップをパスできるステートメントのみを受け入れることを保証することで、厳格な信頼性を持つ。
本稿では,LLMがコンパクトDSLの型付き証明スケッチを生成し,軽量な信頼できるカーネルがスケッチを明示的な証明義務に拡張するハイブリッドパイプラインを提案する。
論文 参考訳(メタデータ) (2026-04-07T19:33:54Z) - How Do Semantically Equivalent Code Transformations Impact Membership Inference on LLMs for Code? [56.42119949944239]
意味論的に等価なコード変換規則がMI検出の回避に有効かどうかを検討する。
各ルールで最悪の場合、モデルの精度はわずか1.5%低下する。
コードのための大規模言語モデルをトレーニングするためのライセンスコンプライアンスの実施において,我々の結果は重大な欠陥を露呈する。
論文 参考訳(メタデータ) (2025-12-17T14:12:54Z) - Do LLMs Trust the Code They Write? [1.0344061385065657]
本稿では,大規模言語モデル (LLM) がコード正確性を表すかどうかを考察する。
我々は,LLMの内部の正当性表現を,同一のプログラミングタスクに対して,正しい符号と誤り符号のペア間の隠れ状態とを対比することにより同定する。
抽出した正当性表現を利用することで,標準対数的ランキングと言語モデル信頼度を向上することを示す。
論文 参考訳(メタデータ) (2025-12-08T10:38:03Z) - Do Large Language Models Respect Contracts? Evaluating and Enforcing Contract-Adherence in Code Generation [11.445615378917578]
PACTは、プログラムアセスメントおよび契約順応評価フレームワークである。
契約違反に焦点を当てた包括的なテストスーツコーパスを提供する。
様々なプロンプト条件下でのコード生成の体系的解析を可能にする。
論文 参考訳(メタデータ) (2025-10-14T01:12:37Z) - Improving LLM Reasoning through Scaling Inference Computation with Collaborative Verification [52.095460362197336]
大規模言語モデル(LLM)は一貫性と正確な推論に苦しむ。
LLMは、主に正しいソリューションに基づいて訓練され、エラーを検出して学習する能力を減らす。
本稿では,CoT(Chain-of-Thought)とPoT(Program-of-Thought)を組み合わせた新しい協調手法を提案する。
論文 参考訳(メタデータ) (2024-10-05T05:21:48Z) - Uncovering LLM-Generated Code: A Zero-Shot Synthetic Code Detector via Code Rewriting [78.48355455324688]
原符号とLLM書き換え版との類似性に基づく新しいゼロショット合成符号検出器を提案する。
以上の結果から,既存のSOTA合成コンテンツ検出装置よりも顕著な改善が得られた。
論文 参考訳(メタデータ) (2024-05-25T08:57:28Z) - Can LLMs Reason with Rules? Logic Scaffolding for Stress-Testing and Improving LLMs [87.34281749422756]
大規模言語モデル(LLM)は、様々な推論タスクにおいて、印象的な人間的なパフォーマンスを実現している。
しかし、その根底にある推論規則の熟達性は、人間の能力に欠ける。
本稿では,推論ルールベースであるULogicを構築するための,推論ルール生成フレームワークを提案する。
論文 参考訳(メタデータ) (2024-02-18T03:38:51Z) - Code Prompting Elicits Conditional Reasoning Abilities in Text+Code LLMs [65.2379940117181]
自然言語の問題をコードに変換する一連のプロンプトであるコードプロンプトを導入します。
コードプロンプトは複数のLLMに対して高速に向上することがわかった。
GPT 3.5を解析した結果,入力問題のコードフォーマッティングが性能向上に不可欠であることが判明した。
論文 参考訳(メタデータ) (2024-01-18T15:32:24Z) - Neuro-Symbolic Integration Brings Causal and Reliable Reasoning Proofs [95.07757789781213]
LLMの複雑な推論には2行のアプローチが採用されている。
1行の作業は様々な推論構造を持つLLMを誘導し、構造出力は自然に中間推論ステップと見なすことができる。
他方の行では、LCMのない宣言的解法を用いて推論処理を行い、推論精度は向上するが、解法のブラックボックスの性質により解釈性に欠ける。
具体的には,Prologインタプリタが生成した中間検索ログにアクセスし,人間可読推論に解釈可能であることを示す。
論文 参考訳(メタデータ) (2023-11-16T11:26:21Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。