作者:互联网 时间: 2026-08-24 09:41:57

想象一下,你把一个人关进图书馆,让他没日没夜地读书。没人给他出题、没人批改作业,他只是顺着文字往下看,自己猜下一个词应该是什么。
几年之后,他自然学会了语法、常识、逻辑,甚至能写出像模像样的文章。
大模型的预训练,本质上就是这件事。

关键点:不需要人工标注,模型从海量文本中自己学习规律。
为什么不需要标注?因为文本本身就是答案。让模型“猜下一个词”或者“填被遮住的词”,猜对了就是学到了,猜错了就调整参数。这种让数据自己当老师的训练方式,就叫自监督学习。
很多人把这三个阶段混在一起,其实它们分工非常清晰:

简单记:
我们平时用的 ChatGPT,是经历了“预训练 + 微调 + 人类反馈强化学习”之后才变成对话机器人的,不是一开始就会聊天的。
目前主流预训练方式有两种:

| 流派 | 代表作 | 核心玩法 | 擅长什么 |
|---|---|---|---|
| 自回归 | GPT 系列 | 预测下一个词 | 文本生成、对话、代码续写 |
| 掩码语言模型 | BERT 系列 | 预测被遮住的词 | 文本理解、分类、抽取 |
GPT 像写作文接龙,BERT 像做完形填空。今天我们见到的 ChatGPT、Claude、DeepSeek,走的都是 GPT 这条“接龙”路线。
别被万亿 token 吓到,原理其实非常朴素。

BERT 的方式更像学生时代老师出的完形填空题:

一句话:几乎一切能读的文字。


规模大致是什么概念?
所以预训练基本是大厂的牌桌,普通团队更多是在开源基座模型上做微调。
大模型领域有一个著名的发现,叫 Scaling Law(缩放定律):

Loss ≈ A / N^α + B / D^β + CN = 参数量D = 数据量α ≈ 0.076, β ≈ 0.095结论:模型扩大 10 倍 → 数据也要扩大约 10 倍→ 计算量扩大约 100 倍→ Loss 持续下降
通俗理解:只要你敢堆参数、堆数据、堆算力,模型能力就会稳定提升。这也是 OpenAI 当年敢于把 GPT-3 做到 1750 亿参数的理论底气。
这不是写几行 Python 就能跑通的事,而是一个完整系统工程:


所以预训练这件事,拼的不仅是算法,更是工程、资源和资金。
预训练结束后的模型,通常叫 Base Model(基座模型)。它已经很强,但还“不会聊天”。

它能续写、能翻译、能写代码,但你问它“你好”,它可能回你一段 Wikipedia 式的定义,而不是自然打招呼。要让它变得“会聊天”,还得靠后面的 SFT 微调 和 RLHF 人类对齐。


看到前面动辄几千张 GPU、几个月训练、几百万美元,很多人可能会想:这事跟我有关系吗?
答案是:有,而且门槛比你想象的低。
你确实很难从头预训练一个 GPT-4,但并不意味着你只能当旁观者。普通人参与大模型赛道,至少有三条路:
开源基座模型已经非常多:Llama、Qwen、Mistral、DeepSeek-MoE……这些模型已经完成过昂贵的预训练,你可以直接拿来做微调。
花上几天时间,你就能做出一个“懂自己业务”的专属模型。
预训练质量很大程度上取决于数据。而清洗数据、构建高质量语料、设计指令数据集,恰恰是普通人最能发力的环节。
未来“AI 训练师”“数据工程师”这类岗位只会越来越吃香。
对大多数人来说,最有价值的参与方式是:把大模型用到自己的工作流里。
写代码、做文案、处理表格、做知识库、自动化客服……真正拉开差距的,不是你会不会训练模型,而是你能不能把它用得比别人更好。
预训练是大厂的战场,但应用和微调是每个人的机会。你不需要从头造一辆跑车,学会驾驶、改装、保养,已经足够让你跑在前面。
一句话总结:
预训练,就是让模型在海量文本里做“完形填空”或“预测下一个词”的自监督学习。它学会了语言规律和世界知识,产出基座模型;基座模型再经过微调和人类对齐,才变成我们能对话的 ChatGPT、Claude、DeepSeek。