A Systematic Study of Compression Ordering for Large Language Models
文章主要内容与创新点总结一、主要内容本文围绕大型语言模型(LLMs)的压缩优化展开系统性研究,聚焦知识蒸馏(KD)、结构化剪枝(P)和低比特量化(Q)三种主流压缩技术,以Qwen2.5-3B模型为实验对象,探究单技术应用效果及多技术组合的最优顺序。核心问题:现有研究多单独分析各压缩技术,但实际部署需组合技术以实现高压缩比与性能平衡,而技术组合顺序对最终效果的影响尚不明确,且量化等技术存在不可逆信息损失等特性,进一步增加了顺序选择的复杂性。实验设计:基线实验:评估三种技术单独应用的压缩比、困惑度、G-Eval得分等指标。组合实验:设计6种三技术组合序列(含直接序列如KD-P-Q、P-KD-Q和需反量化的序列如Q-P-KD、Q-KD-P等),以压缩比、指令遵循能力、语言理解能力为核心评估维度。关键发现:单技术中,量化的压缩效果最优(3.00×压缩比),剪枝会导致中度性能下降,知识蒸馏无压缩效果但能提升指令对齐能力。组合序列中,P-KD-Q(剪枝→知识蒸馏→量化)效果最佳,实现3.68×压缩比,同时保留较强的性能;而早期应用量化的序列(如Q-P-KD、Q-KD-P)因不可逆信息损失,导致性能严重退化。二、创新点系统