AI其他

每天吃透一个 AI 知识点 —— 预训练、后训练与微调

转载:小红书 AI产品赵哥

前言 🔖


ChatGPT、文心一言、Midjourney 这些 AI,我们每天都在用。但你有没有想过,这些模型是怎么训练出来的?它们是怎么从一个什么都不懂的小白,变成某个领域的专家的?

很多人对训练大模型的印象是 “喂数据,等它变聪明”。这个描述太模糊了。实际上,训练一个牛掰大模型是一个复杂的系统工程,类似于培养一个人:

  1. 预训练(Pre‑training):基础教育阶段。让模型博览群书,成为知识渊博的通才。
  2. 后训练(Post‑training):专业深造阶段。让通才在特定领域强化训练,变成专才,比如数学或编程。
  3. 微调(Fine‑tuning):岗前培训阶段。让专才适配具体业务场景,能直接上岗解决问题。

今儿个,咱用培养一名 AI 医生为例,带你走完这三个阶段。好了,准备好了吗?咱发车了!!

  

第一阶段:预训练 (Pre‑training),基础教育 🔖


目标:培养一名 AI 医生

第一步不会直接让它学看 CT 片或做手术,而是先让它完成漫长的基础教育 —— 小学、中学、大学。

这个阶段的任务不是成为医生,而是成为一个有常识、懂逻辑、会阅读、能沟通的正常人。学语文、数学、物理、历史、地理…… 人类已知的知识都要涉猎。

大模型预训练就是这个基础教育阶段。核心目标是构建通用知识基座,让模型掌握语言规律、世界常识和基本逻辑推理能力 —— 而不是为了完成特定任务。

🔹预训练的技术特征:

1. 海量的数据规模:

  • 这个阶段的数据规模远超个人想象。单位不是 GB 或 TB,而是 Token(词元)。顶尖模型的预训练数据通常是数十万亿 Token 级别。比如 Llama 3 用了超过 15 万亿 Token 训练,相当于把整个互联网公开文本、人类历史书籍、GitHub 开源代码都让模型读很多遍。

2. 自监督学习:

  • 在如此海量的数据面前,人工去标注 “这个问题该这么答” 是不现实的。所以,预训练采用的是自监督学习(Self‑supervised Learning)方法。
  • 最经典的方法,就是完形填空。想象一下,你拿到一本书,随机地把其中 15% 的字涂黑,然后让你去猜这些被涂黑的字是什么。为了猜对,你必须理解上下文的语义、语法和逻辑。
  • 模型做的就是同样的事情。它拿到一句话:”今天天气真____,我们去公园散步吧。” 它需要预测出那个被 Mask 掉的词最有可能是 “好”。通过一次次地做这种完形填空练习,它就逐渐学会了语言的内在规律。
  • 另一种常见的方法是下文预测(Next Token Prediction)。给模型一句话的前半部分,比如 “AI 的尽头是”,让它去预测下一个词最有可能是什么。

3. 贵到离谱的训练成本:

  • 预训练是一个极其烧钱的过程。它需要动用成千上万的顶级 GPU(比如 NVIDIA 的 H100),不间断地计算数周甚至数月。
  • 一次完整的预训练,所消耗的计算资源,通常是数万个 GPU‑天(一块 GPU 跑一万天,或一万块 GPU 跑一天)。
  • 换算成金钱,单次训练的成本,从数百万美元到数千万美元不等。所以,全世界只有少数几家科技巨头玩得起预训练。

  

🔹预训练阶段的价值与局限

预训练完成后,我们的 “AI 准医生” 本科毕业了。他现在是个知识渊博的通才:

  • 能流利地阅读和生成各种文本。
  • 掌握了关于世界的基本常识(比如 “天空是蓝色的”、”巴黎是法国的首都”)。
  • 具备了初步的逻辑推理能力(比如 “如果 A 大于 B,B 大于 C,那么 A 大于 C”)。

但他还不是医生。如果你问他:”根据这张胸片判断是否有肺结节?” 他可能给出一个看似专业但毫无根据的回答 —— 满口医学术语,本质上还是胡说八道。因为没有经过专门医学训练,他什么都懂一点,但什么都不精。

预训练模型就像刚走出校园的毕业生,能聊天,但还不能解决具体专业的实际问题。

  

第二阶段:后训练 (Post‑training),专业深造🔖


通才毕业生要进入医学院攻读硕士和博士了。后训练阶段聚焦医学领域,进行高强度、有针对性的专业训练。目标是从什么都懂一点变成医学领域的专家。

大模型后训练就是这个阶段。厂商利用预训练打下的通用基础,通过更高级的训练技术,提升模型在数学推理、代码生成、逻辑分析等关键领域的能力。

  

🔹后训练的技术路径:强化学习

后训练的核心技术,是强化学习(Reinforcement Learning),特别是基于人类反馈的强化学习(RLHF,Reinforcement Learning from Human Feedback)。

这个过程,非常像训练一只聪明的宠物狗:

1. 有监督微调(SFT)——“来,握个手”

  • 在正式强化学习前,通常会有一个有监督微调(SFT)的步骤。
  • 我们会找一批专业的医学专家,写下几千到几万个高质量的 “医学问答对”。比如,问题是 “高血压的诊断标准是什么?”,答案是 “根据 XX 指南,收缩压 ≥ 140 mmHg 和 / 或 舒张压 ≥ 90 mmHg 可诊断为高血压。”
  • 我们用这些标准答案,先让模型模仿学习一遍。这就像告诉小狗,“这个动作叫握手,你应该这么做”。

2. 训练奖励模型(Reward Modeling)——“做得好!给你块肉干”

  • 接下来,是 RLHF 最关键的一步。我们让模型针对同一个医学问题,生成多个不同的回答。比如,有的回答准确专业,有的回答模棱两可,有的回答存在事实错误。
  • 然后,我们再请人类医学专家,来对这些回答进行排序。比如,“回答 A> 回答 C > 回答 B”。
  • 我们用海量的这种排序数据,去训练一个奖励模型(Reward Model)。这个奖励模型,就像一个内置的品味裁判,它学会了什么样的回答是好的(能得高分),什么样的回答是坏的(会被扣分)。

3.PPO 优化 ——“自己去练,直到握手又快又好”

  • 最后,我们让基础模型(经过 SFT 的模型)去和这个 “奖励模型” 进行对练。
  • 基础模型会随机生成一个回答,然后奖励模型会立刻给它打分。
  • 模型的目标,就是通过不断调整自己的回答策略,来最大化地从奖励模型那里获得高分。这个优化的过程,通常使用一种叫做 PPO 的算法。
  • 这就像小狗在不断地尝试,怎么才能用最标准、最快的姿势完成握手这个动作,从而获得最多的奖励。

  

🔹后训练阶段的价值与局限

经过了后训练,我们的 “AI 准医生” 现在已经是一位医学博士了。他不仅拥有通识知识,更在医学领域,构建起了强大的专业能力和价值对齐。

  • 专业能力提升:再问医学问题,他的回答会极其精准。RLHF 的奖惩机制让他学会什么是好回答 —— 诚实、无害、有帮助。不再轻易胡说八道;真不知道时,会说 “我不是专业医疗人员,请咨询医生”。
  • 价值对齐:通过 RLHF 的 “奖惩机制”,模型学会了什么是 “好的回答”。它知道了要诚实、无害、有帮助。它不再会轻易地胡说八道,当它真的不知道时,它更倾向于说 “我不是专业的医疗人员,请咨询医生”,而不是编造一个错误的诊断。这就是我们常说的,让模型变得 “对齐”。

但他还是个全科博士。虽然对整个医学领域有深入理解,却不是具体科室的主治医生。

  • 把他空降到心脏外科,让他解读心脏超声报告、为病人制定手术方案,他可能会不知所措。
  • 他不了解科室的具体工作流程,不熟悉使用的医疗设备型号,更不知道这个病人的过敏史和特殊病史。

后训练模型就像刚毕业的医学博士,理论知识顶尖,但缺乏具体场景下的实战经验。

  

第三阶段:微调 (Fine‑tuning),岗前培训 🔖


医学博士入职了,来到心脏外科。上岗前需要进行最后一步岗前培训。

科室主任会带着他,熟悉工作流程、学习使用科室特有的手术设备、阅读本科室积累的经典病例档案……

目标是让这位专才快速适配具体环境,从理论家变成能直接干活的专家员工。

大模型的微调,就相当于这个岗前培训阶段。

这个阶段,通常不再是模型厂商的工作了,而是由使用模型的企业或开发者自己来主导。它的核心目标,是解决模型从通用专业能力到特定场景落地的最后一公里问题。

  

微调的技术类型与数据要求

🔹技术类型:从全面翻修到局部精装

  • 全量微调(Full Fine‑tuning):对 AI 整个大脑进行再训练。用特定业务场景数据更新模型所有参数。效果最好,但计算成本最高,需要大量 GPU 资源。适用于数据量充足(数万条以上)、且业务场景与原始训练领域差异大的情况。
  • 参数高效微调(PEFT, Parameter‑Efficient Fine‑tuning):这是目前更为主流的方法,也更适合企业级应用。它就像是给 AI 的大脑加装一个外挂记忆芯片,而不是去修改原来的大脑结构。我们冻结住原始模型的绝大部分参数不动,只训练一小部分新增的、或者特定的参数层。
    • 最著名的 PEFT 方法之一是 LoRA (Low‑Rank Adaptation)。它通过在模型的某些层旁边,插入两个小小的、可训练的低秩矩阵,来学习特定任务的知识。微调时,我们只训练这两个小矩阵,而巨大的原始模型保持不变。
    • PEFT 的好处是巨大的:训练成本极低(可能只需要一块消费级显卡就能完成)、速度快、而且易于管理(每个任务只需要保存一个几十兆的 LoRA 文件,而不是一个几百 G 的完整模型)。

  

🔹数据要求:在精不在多

  • 微调所用的数据,不再追求海量,而是追求与业务场景高度相关的高质量数据。
  • 在我们的 “AI 医生” 案例中,这些数据就是:
    • 你们医院心脏外科过去 5 年积累的、匿名的、高质量的电子病历。
    • 资深医生的诊断报告和对应的影像学资料。
    • 科室内部的工作手册和诊疗规范。
  • 数据规模通常不需要很大,几千甚至几百条高质量的标注样本,就可能带来显著的效果提升。但这些数据的标注,往往需要该领域的顶级专家来完成,成本不菲。

  

🔹微调阶段的价值

经过了微调,AI 医生终于成了一名能直接上岗的心脏外科主治医生。

你现在再让他去解读病人张三的心脏超声报告,他的回答会是:

“根据张三先生的超声心动图,我观察到他的左心室射血分数 (LVEF) 为 45%,低于正常值。结合他有‘阿司匹林过敏’的病史,以及我们科室针对此类情况的‘A‑HF‑03’号标准诊疗路径,我建议的初步手术方案是…… 术后抗凝药物应选用氯吡格雷,而不是常规的阿司匹林。”

他的回答不仅专业,而且充满场景感。知道科室的黑话(诊疗路径编号),也考虑了病人的个性化情况。

微调是 AI 价值转化的最后一步。它让通用 AI 变成你企业、你团队、你个人的专属 AI。

  

三大阶段对比总结 🔖


让我们用一张表格,来清晰地回顾一下大模型训练的这三个阶段:

项目预训练(Pre‑training)后训练(Post‑training)微调(Fine‑tuning)
比喻通识基础教育(本科)专业领域深造(硕博)特定岗位岗前培训
核心目标构建通用知识基座,成为 “通才”提升关键专业能力,成为 “专才”适配具体业务场景,成为 “专家员工”
数据规模万亿(Trillion)Token 级百万(Million)Token 级万(Ten Thousand)级样本
数据特征海量、多样、无标注的公开数据聚焦特定领域的高质量标注数据高度贴合业务场景的私有数据
训练成本极高(数万 GPU 天)中等(数百 GPU 天)极低(数十 GPU 天,甚至单卡可完成)
实施主体模型厂商(巨头)模型厂商(巨头或垂类公司)行业用户 / 开发者
核心技术自监督学习(完形填空等)强化学习(RLHF)全量微调 / 参数高效微调(PEFT/LoRA)