論文の概要: UNSPECIFIC: General Constraint Synthesis for Breaking Copy-and-Paste Shortcut in LLM Instruction Following
- arxiv url: http://arxiv.org/abs/2608.09154v1
- Date: Mon, 10 Aug 2026 06:01:31 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:37.100155
- Title: UNSPECIFIC: General Constraint Synthesis for Breaking Copy-and-Paste Shortcut in LLM Instruction Following
- Title(参考訳): UNSPECIFIC: LLM命令後のコピー・アンド・ペーストショートカットの一般制約合成
- Abstract要約: UNSPECIFICは、2つの類似した参照記事に共通する制約を合成してコピーパッシングを減らすフレームワークである。
我々は、ニュース、ストーリー、ブログドメインに基づいてUNSPECIFICベンチマークを構築し、LLMのコピー・ペースト動作を分析する。
- 参考スコア(独自算出の注目度): 25.631351524871636
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language models (LLMs) are increasingly expected to follow long lists of constraints in complex instructions, and synthesizing instructions from a reference document (i.e., back-translation) is a widely used method to measure/enhance LLMs' ability to follow complex instructions. However, this method introduces a critical loophole: the constraint synthesis model copies text from the reference as a very specific constraint and the evaluated LLM trivially satisfies the constraint by copying its text in the response. To address these issues, we propose UNSPECIFIC, a novel framework that synthesizes constraints common to two similar reference articles to reduce copy-pasting, selectively hardens only trivially satisfied constraints to balance difficulty and naturalness, and evaluates satisfaction on both the generated article and its summary to penalize superficial instruction following. Consequently, we built the UNSPECIFIC benchmark on news, story, and blog domains to analyze the copy-pasting behavior of LLMs. Our results show that our synthesized constraints are not only more challenging (e.g., the satisfaction rate of GPT-5 Mini drops from 90% to 78%) and natural (LLM win-rate gap improves by 30%) from a human perspective but also mitigate the copy-pasting. We also find that a large portion of constraints are satisfied superficially (i.e., not satisfied in the core narrative of the article). The code and datasets are released at https://github.com/JeetDSharma/UNSPECIFIC.
- Abstract(参考訳): 大規模言語モデル(LLM)は、複雑な命令における制約の長いリストに従うことがますます期待されており、参照文書(バックトランスレーション)からの命令を合成することは、複雑な命令に従うLLMの能力を測定するために広く使われている方法である。
しかし、本手法では、制約合成モデルが参照からのテキストを非常に具体的な制約としてコピーし、評価されたLCMは、そのテキストを応答にコピーすることで、制約を自明に満足する。
これらの課題に対処するため,2つの類似した参照記事に共通する制約を合成してコピーパッティングを減らし,難易度と自然度のバランスをとるために,自明な制約のみを選択的に硬化させるUNSPECIFICを提案する。
そこで我々は,ニュース,ストーリー,ブログドメインをベースとしたUNSPECIFICベンチマークを構築し,LLMのコピー・パッチングの挙動を解析した。
以上の結果から,GPT-5 Miniの満足度は90%から78%に低下し,自然(LLMウインレートギャップが30%向上した)が人間の視点でより困難であるだけでなく,コピーペーストを緩和することが明らかとなった。
また,制約の大部分は表面的に満たされている(記事の中核的な物語では満たされていない)。
コードとデータセットはhttps://github.com/JeetDSharma/UNSPECIFICで公開されている。
関連論文リスト
- From Early Encoding to Late Suppression: Interpreting LLMs on Character Counting Tasks [49.57538588967748]
LLM(Large Language Model)は、複雑なベンチマークでは優れているにもかかわらず、単語中の文字数などの基本的な記号的タスクにおいて失敗を示す。
我々は、LLaMA、Qwen、Gemmaなど、現代のアーキテクチャにまたがる一貫した現象を発見した。
LLMにおけるシンボリック推論失敗は,表現不足やスケール不足によるものではなく,モデル計算グラフ内の構造的干渉によるものであることを示す。
論文 参考訳(メタデータ) (2026-04-01T11:40:12Z) - RAVEL: Reasoning Agents for Validating and Evaluating LLM Text Synthesis [78.32151470154422]
テスト担当者が自律的に設計し、典型的な合成操作を実行できるようにするためのエージェントフレームワークであるRAVELを紹介する。
C3EBenchは、プロの人間の文章から1,258個のサンプルを抽出したベンチマークである。
SOTA LLMを演算子としてRAVELを増強することにより、そのようなエージェントテキスト合成はLLMの推論能力に支配されていることがわかった。
論文 参考訳(メタデータ) (2026-02-28T14:47:34Z) - Chain of Summaries: Summarization Through Iterative Questioning [0.0]
大きな言語モデル(LLM)は、ますます外部のWebコンテンツを使用するようになっている。
これらの内容の多くは、LLMに親しみやすいフォーマットとコンテキスト長の制限のため、LLMによって容易に消化できない。
本稿では,Webコンテンツの平文リポジトリとして機能する汎用情報量要約を生成する手法を提案する。
論文 参考訳(メタデータ) (2025-11-12T16:53:37Z) - Order Matters: Investigate the Position Bias in Multi-constraint Instruction Following [39.114513139453756]
複数の制約を持つ実世界の命令は、既存の大規模言語モデル(LLM)に重大な課題をもたらす。
我々は,CDDI(Difficulty Distribution Index)による制約の難易度分布を定量的に測定する。
難解な順序で制約を提示した場合, LLM はより高性能であることが判明した。
論文 参考訳(メタデータ) (2025-02-24T14:39:28Z) - Constraint Back-translation Improves Complex Instruction Following of Large Language Models [55.60192044049083]
大きな言語モデル(LLM)は、フォーマットや長さなどの複雑な制約のある命令に従うのに苦労しています。
従来の研究は、高度なLCMに複雑な命令を供給し、複雑な命令応答対を後処理する。
本稿では,新しいデータ生成手法である制約バックトランスレーションを提案する。
論文 参考訳(メタデータ) (2024-10-31T17:42:26Z) - Divide-Verify-Refine: Can LLMs Self-Align with Complex Instructions? [33.18076221854853]
複雑な命令を単一制約に分割し,適切なツールを作成するためのフレームワークを提案する。
次に、厳密なチェックとテキストガイダンスを提供するツールを使用して応答を検証する。
改良効率を最大化するために,改良レポジトリが改良を成功させる動的数発プロンプトを提案する。
論文 参考訳(メタデータ) (2024-10-16T04:01:55Z) - LLM Self-Correction with DeCRIM: Decompose, Critique, and Refine for Enhanced Following of Instructions with Multiple Constraints [86.59857711385833]
実世界のマルチ制約命令に従うLLMの能力を評価するために設計された最初のベンチマークであるRealInstructを紹介する。
オープンソースモデルとプロプライエタリモデルのパフォーマンスギャップを解決するため,Decompose, Critique and Refine(DeCRIM)自己補正パイプラインを提案する。
この結果から,DeCRIMはフィードバックが弱い場合でも,RealInstructでは7.3%,IFEvalでは8.0%,Mistralでは7.3%向上した。
論文 参考訳(メタデータ) (2024-10-09T01:25:10Z) - Unlocking Tokens as Data Points for Generalization Bounds on Larger Language Models [79.70436109672599]
LLaMA2-70Bほどの大きさの大規模言語モデルの非空一般化境界を導出する。
我々の研究は、実際にデプロイされ、高品質なテキストを生成するモデルに対する最初の非空き境界を達成する。
論文 参考訳(メタデータ) (2024-07-25T16:13:58Z) - Chain-of-Specificity: An Iteratively Refining Method for Eliciting
Knowledge from Large Language Models [27.615355663475984]
大きな言語モデル(LLM)は優れた生成能力を示し、貴重な情報を生成する。
既存のアプローチでは、入力命令を分解したり書き直したりすることでこの問題に対処しようとした。
本稿では,CoS(Chain-of-Specificity)という,シンプルで効果的な手法を提案する。
論文 参考訳(メタデータ) (2024-02-20T08:03:05Z) - FollowBench: A Multi-level Fine-grained Constraints Following Benchmark for Large Language Models [79.62191017182518]
FollowBenchは、大規模言語モデルのベンチマークに続くきめ細かい制約のベンチマークである。
本稿では,初期命令に段階的に1つの制約を付加するマルチレベル機構を提案する。
FollowBench上での13のLLMの評価により,LLMの弱さと今後の研究への道のりを示す。
論文 参考訳(メタデータ) (2023-10-31T12:32:38Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。