CAVEWOMAN: How Large Language Models Behave Under Linguistic Input and Output Compression
Abstractの概要
本論文は、入力プロンプトまたは出力応答の言語的圧縮下において大規模言語モデルを調査するための2チャネル評価プロトコル「CAVEWOMAN」を紹介します。このフレームワークは、双方向NLIと補完的な意味的指標を使用し、タスクの精度、アイテムごとの実際のコスト、そしてモデル自身の制約なしの参照出力との一致度という3つの軸で生成を評価します。著者らは、5つのベンチマークと5つの削減レベルに渡って8つのモデルをテストし、直接比較のために両方のチャネルに同じ削減ファミリーを適用しています。証拠から、プロンプトの圧縮と応答の圧縮は、コスト、精度、および意味的整合性に対して質的に異なる影響を与えることが示されています。
新規性
本論文の主な新規性は、言語的圧縮を2チャネルの問題として扱い、入力圧縮と出力圧縮を同一アイテム・同一削減レベルで評価した点にあります。また、実際のコストや精度に加えて、モデルの制約なしの出力に対する参照テキストとの一致度を追加することで、精度のみの評価では見落とされがちな乖離を明らかにしています。
成果
調査した価格設定の仮定において、出力圧縮はほとんどのAPIモデルとすべてのオープンウェイトモデル(4種)で実際のコストを削減しましたが、入力圧縮はモデルがより長い応答で補償し、さらに強い削減では精度が悪化したため、総コストを増加させる傾向がありました。L1出力圧縮の下では、多くの非推論モデルの出力が正解を維持しつつも、モデル自身の制約なしの参照出力を含意しなくなっており、6つの非推論モデル全体での「正解だが乖離している」割合は51.9%に達しました。圧縮に対する堅牢性はモデルによって大きく異なり、制約なしの精度やパラメータ数とは連動していませんでした。
論文の注目点
- 研究ではチャネル間に強い非対称性が見られ、出力圧縮は推論の実際のコストを下げることができる一方で、入力圧縮は補完的な出力の拡張によってしばしばコストを上昇させることが判明した。
- 精度だけでは圧縮の評価には不十分である。なぜなら、出力が正解のままであっても、モデル自身の制約なしの参照テキストとは意味的に乖離する可能性があるためである。
- モデルのランキングは圧縮の制約下で変化するため、システムは制約のない設定のみではなく、実際の展開時に想定される制約レベルで評価されるべきである。