

上个月,DeepSeek悄然发布了更新版本DeepSeek-V3-0324,给大模型训练领域的研究者和开发者带来了新的惊喜。最新版本不仅显著提升了该模型在推理类任务上的表现,而且在数学和代码相关的评测中,更是以超越GPT-4.5的得分成绩让人刮目相看。那么,这一成果是如何实现的呢?
依据DeepSeek官方文档,DeepSeek-V3的这一更新借鉴了其早期DeepSeek-R1模型训练中的强化学习技术,且保持了相同的基础模型,只是对后训练方法进行了改进。这其中提及的“后训练”无疑是一个引人关注的概念。那么,后训练究竟是什么?它与“预训练”有什么区别呢?今天,我们就用最通俗的比喻来阐述大模型的三个不同训练阶段:预训练(Pre-training)、后训练(Post-training)和微调(Fine-tuning)。
预训练的过程就像是我们在中小学阶段的学习。这里,模型利用海量的通用数据集来建立基础的知识和技能,包括通用语言能力及世界常识。例如刚刚发布的Llama4模型就进行了为期很长的预训练,这个过程覆盖了200种语言。对于大模型而言,这个阶段的数据量巨大,训练成本高昂,周期长达数万GPU天。例如,Llama4Scout的预训练就涉及到了整整40万亿tokens的数据。就像我们小时候做的那些数学题和习题,都是为之后的学习打下基础。因此,预训练阶段的繁重成本和时间与我们青涩的学习岁月一一对应。
后训练则标志着从一个广泛的知识积累到专业能力的提升,由此可将其比作高考之后的大学生活。当我们进入大学,专业学习开始变得更加明确,后训练主要是为了让模型更好地适应特定任务或应用场景。在这一阶段,数据规模较小,通常是针对特定领域的数据,而训练所需的周期短很多。就像大学的课程内容往往聚焦于专业领域,使得知识掌握变得更加精细。
值得一提的是,后训练不是一次性完成的,往往需要根据具体需求持续深化,以类比我们完成本科后可能还需要继续攻读硕士或博士学位,以不断增强自己的专业技能。目前,在后训练环节中,越来越多的公司采用强化学习(Reinforcement Learning)的方法。这是在DeepSeek-V3更新通告中明确指出的。
强化学习的实质是通过不断反馈来优化模型的表现:①当模型表现良好时给予正反馈;②当表现欠佳时则给予负反馈。这种奖惩机制促使模型更有针对性地进行学习,进而提升表现。然而,过度追求奖励可能会让模型走入极端。因此,近年来兴起了一种新的强化学习方法,名为GRPO(引导式正则化策略优化),这种方式在传统的奖励机制上引入了额外的约束,确保模型与最初“更优秀的模型”之间不会相距太远。这样,模型可以更稳健地进步,既能获得高奖励,同时也不会偏离轨道。正因如此,GRPO已经成为当下大模型后训练中流行的强化学习工具,它可以安全、稳定地提升AI的表现,从而生成更符合人类期望的内容。
最后,我们来谈谈微调。严格说,把微调单独列出并不太科学,因为微调实际上也是后训练的一种形式。一般情况下,后训练多发生在模型提供商那里,也就是说,一旦模型完成预训练,开发团队会通过多次后训练对模型进行优化,以最终将其打造成可以交付市场的产品或服务。而微调,往往是在模型的实际使用者那里进行的,特别是在行业应用场景中,确实显得尤为关键。
为什么呢?因为即使经过长时间的预训练,大模型在实战中仍可能表现空白,面对具体问题时很难立即上手。想象一下,在职场上,我们在入职后仍需经过培训才能掌握特定工作技巧。微调正是这样一种岗前培训,它通常针对特定任务进行训练,尽管所需数据量相对较小,但却针对性极强。这种过程就如同老司机将其丰富的实操经验传授给新手,让新手掌握更贴合实际的技能。
经过预训练、后训练与微调的完整训练体系,最终一个大模型终于可以在真实环境中运作,进行有效的任务执行了。
综上所述,大模型的训练经历了三个阶段:预训练为基础知识的广泛积累、后训练则为专业领域的深入学习,而微调则是针对具体工作的实际操作学习。从目前国内的发展趋势来看,大规模的预训练公司正逐渐减少,而大多数需求则会转向后训练和微调,特别是在推理方面,这无疑意味着未来领域竞争将更为激烈。随着DeepSeek的突围,国内的大模型发展战役的第一阶段已经落下帷幕,而“裸泳者”也将在这场竞争中逐渐暴露出来。尽管前路漫漫,但大模型的进化与提升令人期待,也将推动整个智能科技行业的持续发展。返回搜狐,查看更多