针对智能客服这个场景,首选“大模型微调做老师 + 小模型蒸馏做学生”的“师生联合”方案,且最终上线主力必须是蒸馏后的小模型。因为智能客服是典型的高并发、低成本敏感、但容错率相对较高的任务。下面我直接按“落地账本”和“技术选型”给你拆解清楚。
成本算不过来:智能客服是高频场景,每天几十万次提问。如果用微调后的百亿级大模型推理,光是GPU电费就可能超过人工客服团队的人力成本,完全失去降本增效的意义。
延迟不可接受:大模型推理动辄1-3秒,在用户等待时,每多0.5秒就会明显增加挂断率或差评率。
任务属性匹配:80%的智能客服问题(退换货流程、订单查询、活动规则、密码找回)属于“高重复性、低逻辑深度”的问答,小模型通过蒸馏完全能覆盖95%以上的效果。
你可以按这个三层结构来设计,既能保证效果,又能控制成本:
| 层级 | 模型选型 | 负责任务 | 部署比例 |
|---|---|---|---|
| 第一层(入口) | 蒸馏后的10亿级小模型(如Qwen2.5-7B蒸馏版) | 处理标准化高频问题:物流查询、退换货、活动规则、账户操作等。 | 90%流量 |
| 第二层(兜底) | 微调后的百亿级大模型(如Qwen2.5-72B) | 处理复杂多轮推理:用户情绪激动时的安抚话术生成、涉及多种优惠叠加的复杂计算、模糊意图的追问澄清。 | 9%流量(由小模型路由转接) |
| 第三层(人工) | 人工客服 | 处理大模型也搞不定的极端长尾、客诉升级问题。 | 1%流量 |
如果你现在手头有预算和团队,建议按这个顺序执行:
第一步:拉取历史工单数据(无需标注) 从你现有的客服系统里导出过去半年的用户提问和最终解决方案文本。注意,这里不需要人工打标签,只需要原始的“问-答”对,哪怕是粗糙的也没关系。
第二步:微调大模型(花3-5天,打造“金牌老师”) 用这些历史数据微调一个70B(百亿级)的大模型。这一步的投入是值得的,因为微调后的老师模型会模仿你公司内部的语气、政策术语和解决思路,比通用的GPT-4更懂你家的业务。
第三步:用老师模型生成“软标签”(蒸馏数据准备) 把几十万条无标注的用户提问扔给微调好的老师,让它生成回答的概率分布(不仅仅是最终文字)。这相当于把“金牌老师”的答题思路(暗知识)全部提取出来。
第四步:训练学生小模型(花1天,几十块钱) 用一个10亿或30亿的小模型(比如通义千问-7B、Llama-3.2-3B),去模仿老师在第三步生成的这些软标签。训练成本极低,一张T4显卡就能跑。
知识库检索(RAG)必须配上:蒸馏后的小模型最大的弱点是“记不住新政策”。你必须同时部署一个向量数据库(存放最新的产品手册),让回答时小模型先去检索政策,再生成回答。纯靠蒸馏记忆,换季促销时就等着挨骂。
设定“置信度阈值”:在小模型输出时,加一个置信度打分。如果打分低于0.7,自动透传给第二层的大模型处理。既保证了整体效果,又不会让罕见问题砸了口碑。
不要蒸馏“系统提示词(System Prompt)”:大模型里长长的、复杂的提示词是小模型消化不了的。蒸馏只针对用户问题映射到最终回答的映射关系,而不是蒸馏提示词本身。
如果暂时没有大模型微调的条件,更极简的方案是: 直接调用 OpenAI(或国内通义/文心)的 API 作为老师,在本地用开源的 Qwen2.5-7B 做学生,蒸馏出一个专用客服模型。老师按量计费(可能花几千块生成软标签),学生免费部署。这比你长期调用大模型API做推理,成本能降低 90% 以上。