这绝对不是危言耸听。在过去,我们做算法,核心竞争力是什么?是调参,是魔改网络结构,是设计各种复杂的特征工程。你加一个注意力机制,他搞一个双塔模型,大家在各种公开数据集上刷榜,提升零点几个百分点的 AUC 或者 F1 值,然后发 paper,拿年终奖。
大模型把这桌酒席直接掀了。
现在的基础模型架构高度同质化,Transformer 统治一切。你不需要去发明新的网络结构,OpenAI 和各大厂的顶级天才已经把天花板顶得足够高了。对于 99% 的公司来说,自己从头预训练一个基础模型纯粹是烧钱听响。
这就导致了一个极其尴尬的局面:传统的算法工程师突然发现自己没活干了。特征工程被大模型的表征能力降维打击,网络结构设计变成了搭积木。很多顶着算法工程师头衔的人,现在每天的工作就是写写 Prompt,调调大厂的 API,这叫什么算法工程师?这叫 API 调用师。
所以,如果你带着过去那种我只要懂数学推导、懂模型结构就能拿高薪的思维来转行,你会死得很惨。大模型时代,纯粹的算法壁垒正在急剧降低,真正的壁垒转移到了算力、数据和工程化能力上。
这就引出了大模型方向真正有价值、能让你安身立命的几个核心工种和应用场景。
不要去看那些满天飞的媒体报道,行业内真正招人、真正砸钱的岗位,其实就这么几个方向。
第一条路是去搞 AI Infra,也就是大模型基础设施。
这是我目前最看好,也是薪资最高、最缺人的方向。但讽刺的是,这个方向最需要的往往不是传统算法工程师,而是硬核的后端开发和系统架构师。
大模型的训练和推理,本质上是一个极其复杂的分布式系统工程。几千张显卡连在一起,怎么保证通信不拥堵?怎么做张量并行、流水线并行?怎么处理节点宕机?在推理端,怎么优化 KV Cache?怎么实现 PagedAttention 来提高吞吐量?
这些问题,懂深度学习理论的人解决不了,必须是精通 C++、CUDA、操作系统内核、高性能网络的人才能搞定。如果你有算法背景,同时你愿意沉下心去啃底层系统,去研究 Megatron-LM、vLLM 这些框架的源码,你在这个市场上的价值将是不可估量的。你会成为连接算法和底层的桥梁,这种复合型人才是目前各大厂都在疯抢的。
第二条路是做 Post-training,也就是模型后训练与对齐。
既然绝大多数公司搞不起预训练,那大家都在干嘛?在做微调。把开源的 Llama-3 或者 Qwen 拿过来,用自己的业务数据进行 SFT(监督微调),然后做 RLHF(基于人类反馈的强化学习)或者 DPO(直接偏好优化)。
这是目前算法工程师转型最平滑的一条路。你的算法背景在这里能派上用场,因为你需要理解模型的损失函数,需要知道怎么防止模型灾难性遗忘,需要设计合理的奖励模型。
但这里的坑在于,后训练的核心根本不是算法,而是数据。你很快就会发现,你 80% 的时间都在洗数据。怎么构造高质量的指令微调数据集?怎么保证数据的多样性和分布平衡?模型输出了一堆废话,你怎么通过数据去纠正它?在这个岗位上,谁对数据最敏感,谁能构建出最高效的数据飞轮,谁才是真正的大佬。如果你还抱着那种我只管跑模型,数据让外包去标的心态,你在这个方向是做不长的。
第三条路是深耕 RAG 与大模型应用架构。
这是目前落地场景最广、需求量最大的方向。几乎所有的传统企业、B 端业务,想用大模型,第一步都是做 RAG(检索增强生成)。把企业的私有知识库灌进去,让大模型基于这些知识来回答问题。
听起来很简单对吧?用 LangChain 跑个 Demo 只要十分钟。但如果你要在生产环境中把 RAG 做到 90% 以上的准确率,那简直是地狱难度。
文档怎么解析?复杂的 PDF 表格怎么提取?向量检索和关键词检索怎么做混合召回?召回回来的 chunk 怎么做重排?大模型幻觉怎么控制?这需要你具备极强的业务理解能力和工程拼装能力。在这个方向上,你需要把自己当成一个产品型工程师。你的目标不是让模型变得多聪明,而是通过各种工程手段、外挂工具,让一个智商只有 80 的开源模型,在特定业务场景下表现出 120 的智商。
第四条路是探索 AI Agent 智能体。
这是大模型的未来,也是目前最容易出爆款、但也最容易沦为玩具的方向。Agent 的核心是让大模型具备规划、使用工具和记忆的能力。
做 Agent 开发,你需要极强的逻辑抽象能力。你要设计一套工作流,让大模型在遇到复杂问题时,知道先去调用搜索引擎,再去查数据库,最后汇总生成报告。这其实非常考验你对软件工程的理解。很多算法工程师做 Agent 做不好,就是因为他们缺乏系统设计思维,写出来的代码一团糟,状态管理混乱不堪。
看清了上面的战场,我们来聊聊具体的转型路径。我见过太多人转型失败,他们最大的问题是陷入了论文陷阱。每天在 arXiv 上看最新的大模型论文,看懂了各种注意力机制的变体,然后呢?然后连个开源模型都跑不起来。
大模型是一门彻头彻尾的实验科学和工程学科。你必须把手弄脏。
第一步,立刻停止只看不练,去租一台 GPU,把开源模型跑起来。
不要在你的破笔记本上折腾了。去云平台上租一台 A100 或者 4090 的机器。你的第一个任务,不是去理解 Transformer 的源码,而是学会怎么把 Qwen 或者 Llama 的权重下载下来,怎么用 HuggingFace 的 transformers 库把模型加载到显存里,怎么写一段代码让它生成文本。
在这个过程中,你会遇到各种恶心的问题。CUDA 版本不匹配、显存 OOM、依赖包冲突。恭喜你,当你把这些环境问题都踩过一遍,你才算真正推开了大模型世界的大门。工程能力,是大模型时代的入场券。
第二步,亲手从零到一跑通一个微调流程。
找一个你感兴趣的垂直领域,比如医疗、法律或者哪怕是你自己过去写的日记。去收集几千条问答数据。然后,去学习使用 LLaMA-Factory 或者类似的微调框架。
尝试用 LoRA 技术对模型进行微调。观察 loss 的变化,测试微调前后的模型表现。你要去体会,为什么加了这批数据,模型变聪明了?为什么那批数据加进去,模型变成了复读机?这种对模型脾气秉性的直觉,是看多少篇论文都换不来的。当你能熟练地根据业务需求,通过微调把一个通用模型变成领域专家时,你就已经具备了在这个行业混饭吃的核心技能。
第三步,抛弃玩具框架,深入理解底层机制。
当你跑通了应用和微调,如果你想拿高薪,想成为不可替代的核心人员,你就必须往下走。
不要过度依赖 LangChain 这种高度封装的框架。它们在帮你快速实现功能的同时,也掩盖了所有的底层细节。尝试自己用纯 Python 写一个 RAG 系统,自己去调用 Embedding 模型,自己写向量相似度计算,自己构建 Prompt。
去研究 vLLM 的源码。了解什么是 Continuous Batching,为什么它能大幅提升推理吞吐量。去看看大模型在显存里到底是怎么分布的,权重占多少,KV Cache 占多少,激活值占多少。当你能在面试时,拿着笔在白板上清晰地画出大模型推理时的显存占用模型,并且能给出优化方案时,那些只会调 API 的竞争者在你面前将毫无还手之力。
第四步,完成思维方式的终极跃迁:从模型中心到数据中心。
这是最难的一步,也是决定你能走多远的关键。
传统的算法工程师有一种执念,总觉得模型结构是最高级的,洗数据是低级的、脏活累活。在大模型时代,你必须彻底抛弃这种傲慢。
大模型的本质是数据的压缩与泛化。你喂给它什么质量的数据,它就长成什么样子。在实际工作中,你可能会发现,花一个月时间去魔改对齐算法,带来的提升,还不如花一个星期时间把训练数据里的错别字和逻辑错误清理干净来得大。
你要学会成为一个数据工程师。你要懂得怎么用大模型去清洗大模型的数据,怎么构建自动化的数据评估 pipeline。当你开始为了几百条高质量的偏好数据而绞尽脑汁,当你能从海量日志中敏锐地嗅到可以用来提升模型能力的数据信号时,你就真正蜕变成了一个大模型时代的顶尖高手。
很多人问我,现在入局大模型晚不晚?红利期是不是已经过了?
我的看法是,那种靠着懂一点大模型概念就能忽悠投资人、忽悠老板拿高薪的泡沫期确实过去了。现在行业进入了深水区,大家都在看落地,看 ROI。
但这恰恰是真正有实力的技术人员的黄金时代。
大模型不是一个独立的行业,它是一种像电力一样的基础设施。未来的趋势不是所有人都去开发大模型,而是所有的软件、所有的业务流程,都会被大模型重写一遍。
所以,作为程序员,你转型大模型领域,最大的优势在于你懂业务,你懂软件工程。不要把你过去的经验全部抛弃。如果你以前是做电商后端的,那你就去研究怎么用大模型重构电商的搜索和推荐链路;如果你以前是做企业级 SaaS 的,那你就去搞企业内部的智能工作流。
把大模型当成你武器库里最强大的一件兵器,而不是你职业生涯的唯一。
转型是一场扒皮抽筋的痛苦过程。你会面临知识体系的全面重构,你会无数次在深夜面对跑不通的代码怀疑人生。但当你看到你自己微调的模型,或者你亲手搭建的 Agent,能够像一个真正的人类助手一样,优雅地解决一个复杂的业务问题时,那种创造智能的巨大成就感,是任何其他技术方向都无法比拟的。
评论专区
评论加载中...登录后即可发表评论