在实际项目中,到底什么时候优先选蒸馏,什么时候优先选微调?或者两者成本具体差多少? 为了满足大家的好奇之心,本文拆解一下落地选型的考量。
在真实的工业界,决策者通常只看三个硬指标:效果上限、硬件成本、迭代速度。按这三点拆解,本文给出一个直接的“决策流程图”,帮你对号入座。
1、你的“推理场景”在哪里?(硬件限制)
这是最硬性的门槛,直接把你卡死。
选微调:如果你部署在云端高性能A100/H100显卡上,且QPS(每秒查询数)不高,微调后的大模型跑得动。
选蒸馏:如果你要部署在边缘端(手机、车机、IoT设备),或者云端低成本T4显卡上,且需要承受高并发流量(如双十一客服),那必须蒸馏。不蒸馏,光电费就能吃掉你所有利润。
2、你的“任务难度”有多大?(天花板)
这决定了学生模型能不能接住这个活。
选微调:任务涉及复杂逻辑推理(数学证明、长链思考)、海量上下文检索或多轮复杂意图识别。这种高难度任务,小模型的“脑容量”根本装不下,强行蒸馏效果会崩塌(可能只有大模型的60%~70%)。此时必须保留大模型,只做微调来提升专项能力。
选蒸馏:任务是单一分类(情感正负向)、抽取(提取姓名、日期)、或短文本改写。这种“感知类”任务,小模型通过模仿大模型,完全能达到95%以上效果,蒸馏性价比极高。
3、你的“高质量标注数据”有多少?(资金预算)
这是算经济账的时候。
选微调:你手头有几千到上万条高质量的“问题-标准答案”对,且预算充足(能支付高昂的GPU算力费用和标注人力成本)。
选蒸馏:你手头只有大量无标注的原始文本(比如历史工单、网页日志),或者标注预算极其紧张。蒸馏允许你用“无标注数据+大模型自动打标”来训练小模型,成本直接砍掉一个数量级。
4、你的“迭代速度”要求有多快?(运维成本)
选微调:如果业务场景固定(如法律文书撰写),半年变一次,微调大模型虽然慢(可能跑几天),但可以接受。
选蒸馏:如果业务策略天天变(如电商大促敏感词、热点新闻分类),微调一次大模型要几千块且耗时一天,而蒸馏训练小模型可能只需1小时、几十块钱。为了快速试错,哪怕牺牲一点点精度,也绝对选蒸馏。
你可以跟着走一遍:
第1步:必须跑在手机或低端显卡上吗?
→ 是:直接选 蒸馏(没得选)。
→ 否:进入第2步。
第2步:任务需要复杂的数学/逻辑推理吗?
→ 是:选 微调(蒸馏搞不定)。
→ 否:进入第3步。
第3步:你有现成的几千条人工标注数据吗?
→ 是:选 微调(效果上限最高)。
→ 否:选 蒸馏(用无监督数据,快速启动)。
第4步(终极平衡):如果既要强推理能力,又要快,怎么办?
→ 工业界标准答案:先微调大模型,再用微调后的大模型做老师,蒸馏出一个专用小模型。这样既保证了下限,又控制了线上推理成本。
在实际的字节、阿里、腾讯等大厂,落地时极少二选一,而是采用组合拳:
离线/慢速任务(报表生成、周报总结):用 微调后的百亿级大模型,跑个几秒没关系,追求极致效果。
在线/实时任务(搜索排序、智能客服首句回复):用 蒸馏后的十亿级小模型,毫秒级返回,扛住绝大流量。
兜底/冷门任务:如果小模型置信度低,自动路由回大模型处理。这叫“拒绝式蒸馏”,是当前最稳妥的工程方案。
如果你现在正面临选型,我建议你先做一次“成本测算”:
微调一次70亿参数的模型(如Llama 3),在A100上约需 2~5天,花费 上千元;线上推理每秒处理100个请求,需要 4张A100。
蒸馏一个30亿参数的模型,训练仅需 6~8小时,花费 几十元;同样流量下,只需 1张T4显卡。
结论:如果你的业务不依赖“解数学题”和“长篇小说生成”,优先上蒸馏方案;如果你的核心卖点就是“智商”,那必须微调,蒸馏只能作为辅助加速器。