論文の概要: Optimization Is Not All You Need
- arxiv url: http://arxiv.org/abs/2607.11977v2
- Date: Wed, 15 Jul 2026 04:02:18 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-16 12:21:59.471033
- Title: Optimization Is Not All You Need
- Title(参考訳): 最適化は必要なものばかりではない
- Abstract要約: 2019年、OpenAIは機械生成テキストの検出を支援するために200万のGPT-2出力を非文法的にリリースした。
私たちはこれを、最適化文化の最新の表現として読みました: 信念は、技術よりも古い、事前定義された軸に沿った測定可能な改善は、価値の問題を排除している、という信念です。
最適化手順は、生成したテキストがどの程度不正であるかを測定することができる。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: In 2019, OpenAI released two million GPT-2 outputs-ungrammatical, half broken-to aid the detection of machine-generated text. The alignment that produced their more fluent successors is usually regarded as an engineering achievement; we read it instead as the newest expression of optimization culture: the conviction, older than the technology, that measurable improvement along predefined axes exhausts the question of value. Tracing that conviction through the stack-pretraining, decoding, preference tuning, benchmarking, interface-and back through its genealogy in the audit society, we arrive at the limit: an optimization procedure can measure how improbable a piece of generated text is; it cannot tell whether that unlikelihood is error or invention. A procedure that cannot make that distinction has nonetheless, within half a decade, assumed the authority to set the protocols of legitimate language. Held for centuries by academies and schoolrooms, grammars and examiners, this authority has been given over to loss functions, reward models, benchmarks, and system prompts: an apparatus that executes the office of judgment with no capacity for judging.
- Abstract(参考訳): 2019年、OpenAIは機械生成テキストの検出を支援するために200万のGPT-2出力を非文法的にリリースした。
より流動的な後継者を生み出したアライメントは、通常、エンジニアリングの成果と見なされ、代わりに最適化文化の最新の表現として読みます。
スタック事前学習、復号化、選好チューニング、ベンチマーク、インターフェースおよび監査社会の系譜を通して、その信念を追跡すれば、私たちは限界に到達します。最適化手順は、生成したテキストがどの程度不正であるかを計測することができます。
それにもかかわらず、その区別ができない手続きは、半年以内に正統な言語のプロトコルを設定する権限を負った。
アカデミーや学校の教室、文法、試験官によって何世紀にもわたって開発され、この権威は損失関数、報酬モデル、ベンチマーク、システムプロンプトに委ねられてきた。
関連論文リスト
- Last Translation Benchmark [189.61382047977074]
最後の翻訳ベンチマークは、主要な機械翻訳モデルを壊すサンプルの集合である。
それぞれの例には、具体的な障害ケースを記述した手作りの検証ルールが付属している。
最新バージョンは、2026年9月1日までに承認されたコントリビューションを含むTBv1である。
論文 参考訳(メタデータ) (2026-09-03T17:54:45Z) - CANONIC: Governance Is Compilation [0.0]
CANONIC: デジタルアーティファクトを大規模にエビデンス台帳にコンパイルする管理されたインテリジェンス。
CanONICは、コンテントがコーパスに入るかどうかを、コンパイラがプログラムが適切に構成されているかどうかを決定するように管理する。
信頼できないコンテンツと信頼できないコンテンツを確実に分離する散文読解ゲートは存在しない。
論文 参考訳(メタデータ) (2026-06-10T04:48:42Z) - Evaluating the Evaluator: Problems with SemEval-2020 Task 1 for Lexical Semantic Change Detection [1.1340133299604382]
語彙意味変化検出のための最も影響力のあるベンチマークであるSemEval-2020 Task 1を再検討する。
ベンチマークは、かなりのコーパスと前処理の問題に影響されていることを示す。
我々は、限定言語の範囲が限定された小さな目標セットは現実主義を減らし、統計的不確実性を増大させると主張している。
論文 参考訳(メタデータ) (2026-04-14T19:01:25Z) - Take Goodhart Seriously: Principled Limit on General-Purpose AI Optimization [0.0]
近似、推定、最適化の誤差は、意図した目的から体系的に逸脱することを保証すると論じる。
汎用AIシステムの最適化には原則的な制限が必要である。
論文 参考訳(メタデータ) (2025-10-03T09:25:12Z) - An LLM-as-Judge Metric for Bridging the Gap with Human Evaluation in SE Tasks [15.820416019287622]
SE-JuryはLLM-as-Ensemble-Judgeの最初の評価基準である。
さまざまなソフトウェアエンジニアリング(SE)ベンチマークでSE-Juryを評価します。
論文 参考訳(メタデータ) (2025-05-27T08:04:34Z) - Multilingual Contrastive Decoding via Language-Agnostic Layers Skipping [60.458273797431836]
対照的なレイヤ(DoLa)によるデコーディングは、大規模言語モデルの生成品質を改善するために設計されている。
このアプローチは英語以外のタスクではうまくいきません。
モデルの前方通過における言語遷移に関する従来の解釈可能性の研究から着想を得て,改良されたコントラスト復号アルゴリズムを提案する。
論文 参考訳(メタデータ) (2024-07-15T15:14:01Z) - Linguistic Calibration of Long-Form Generations [57.836339732160916]
言語モデル(LM)は、ユーザーに自信を持って幻覚を与えるとき、最適な下流決定をさせるかもしれない。
この問題は、LMが主張が正しい確率を口頭で伝えることで緩和できるが、既存のモデルでは、評価された信頼度のある長文を生成できない。
LMは、その世代がユーザがキャリブレーションされた確率予測を行えるようにすれば、言語的にキャリブレーションされる。
論文 参考訳(メタデータ) (2024-03-30T20:47:55Z) - BOOST: Harnessing Black-Box Control to Boost Commonsense in LMs'
Generation [60.77990074569754]
本稿では,凍結した事前学習言語モデルを,より汎用的な生成に向けて操る,計算効率のよいフレームワークを提案する。
具体的には、まず、文に常識的スコアを割り当てる参照なし評価器を構築する。
次に、スコアラをコモンセンス知識のオラクルとして使用し、NADOと呼ばれる制御可能な生成法を拡張して補助ヘッドを訓練する。
論文 参考訳(メタデータ) (2023-10-25T23:32:12Z) - INSTRUCTSCORE: Explainable Text Generation Evaluation with Finegrained
Feedback [80.57617091714448]
テキスト生成のための説明可能な評価指標であるInstructScoreを提案する。
LLaMAに基づいてテキスト評価基準を微調整し、生成されたテキストのスコアと人間の可読性診断レポートを生成する。
論文 参考訳(メタデータ) (2023-05-23T17:27:22Z) - On the Limitations of Reference-Free Evaluations of Generated Text [64.81682222169113]
基準のないメトリクスは本質的にバイアスがあり、生成したテキストを評価する能力に制限があることを示す。
機械翻訳や要約といったタスクの進捗を計測するために使用するべきではない、と我々は主張する。
論文 参考訳(メタデータ) (2022-10-22T22:12:06Z) - Rethink about the Word-level Quality Estimation for Machine Translation
from Human Judgement [57.72846454929923]
ベンチマークデータセットであるemphHJQEを作成し、専門家翻訳者が不適切な翻訳語を直接アノテートする。
本稿では,タグリファインメント戦略と木ベースのアノテーション戦略という2つのタグ補正戦略を提案し,TERベースの人工QEコーパスをemphHJQEに近づける。
その結果,提案したデータセットは人間の判断と一致しており,また,提案したタグ補正戦略の有効性も確認できた。
論文 参考訳(メタデータ) (2022-09-13T02:37:12Z) - Curious Case of Language Generation Evaluation Metrics: A Cautionary
Tale [52.663117551150954]
イメージキャプションや機械翻訳などのタスクを評価するデファクトメトリクスとして、いくつかの一般的な指標が残っている。
これは、使いやすさが原因でもあり、また、研究者がそれらを見て解釈する方法を知りたがっているためでもある。
本稿では,モデルの自動評価方法について,コミュニティにより慎重に検討するよう促す。
論文 参考訳(メタデータ) (2020-10-26T13:57:20Z) - Document-Level Definition Detection in Scholarly Documents: Existing
Models, Error Analyses, and Future Directions [40.64025648548128]
我々は,構文的特徴,トランスフォーマーエンコーダ,フィルタを利用した新たな定義検出システムHEDDExを開発し,標準文レベルのベンチマークで評価する。
HEDDEx は文レベルと文書レベルの両方のタスクにおいて、それぞれ 12.7 F1 点と 14.4 F1 点を上回っている。
論文 参考訳(メタデータ) (2020-10-11T01:16:10Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。