小硅是怎么"养大"的 - 三步养成记
大话 AI · 03 | 小硅是怎么"养大"的:三步养成记
前两篇我们认识了小硅、搞懂了它怎么"猜下一个词"(第 1 篇)和怎么"划重点"(第 2 篇)。可它这一身本事不是天生的。这一篇,看看它是怎么从一只"野生鹦鹉"被养大成人的——顺便你会明白:为什么不同的 AI,"性格"和"脾气"都不一样。
小硅的成长,跟养个孩子差不多,分三步走。

📚 第一步:读全网(预训练)——养出一个"书呆子"
第一步,是把海量的文本——差不多是能扒到的大半个互联网——一股脑喂给它,让它反复做一件事:盖住后面的字,让它猜。 猜错了就自我修正,猜对了就记住这个规律。
喂了多少?拿 GPT-4 这个级别来说,训练数据大约是十几万亿个 token(还记得第 1 篇讲的"词块"吧)。这是什么概念呢?一个正常人一天读八小时书,大概能读 5 万字;十几万亿 token 折合下来,相当于一个人不吃不喝读几万年的量。小硅就是用这种蛮力,把人类写过的大部分知识都"嚼"了一遍。
这一步最烧钱、最费时间(要成千上万张显卡跑好几个月,电费账单够买一栋楼),产出的是一个**"读了万卷书、但完全不懂人情世故"的野生模型**——像个闭关读了十年书、刚下山的宅男:肚子里全是货,但你问他话,他可能答非所问,甚至跟你对暗号似的继续"接龙",压根不知道自己该"回答问题"。

🎓 第二步:岗前培训(微调 / SFT)——教它"好好说话"
野生模型只会接龙,不会"回答问题"。你问它"中国的首都是哪",它可能接一句"中国的首都是北京市是中华人民共和国的政治中心……"像在念百科词条,根本不是在"回答你"。于是第二步,给它看大量**"好问题 → 好答案"的标准范例**:有人这么问,你就该这么答。看多了,它就学会了"哦,原来有人向我提问时,我要给出有用的回答,而不是继续瞎接龙"。
这一步就像新员工入职培训——你本来能力不差,但得有人告诉你"在这儿,活儿是这么干的"。专业名词叫 SFT(监督微调)。数据量不大(几万到几十万条高质量范例就够),但质量要求极高——一条垃圾范例,可能比一千条好范例的负面影响还大。所以各家公司在这一步,拼的不是量,是标注团队的水平和品味。
🎭 第三步:教它做人(对齐 / RLHF)——把它调得"讨人喜欢"
会回答了,但答得好不好、得不得体,还差一步。第三步,让真人给它的多个回答打分:这个回答有礼貌、有用,点赞;那个回答冷冰冰或者瞎出主意,踩。
但这里有个中间环节很精妙:人类不可能给每一轮对话都打分,太贵了。所以实际做法是——先用人类打的几万条分,训练出一个"品味官"(专业叫奖励模型)。这个品味官学会了"人类觉得什么样的回答更好"的品味之后,就由它来当考官,批量给小硅的回答打分。然后小硅不断调整自己,想方设法讨好这个品味官。
整个过程叫RLHF(基于人类反馈的强化学习),本质是师傅带徒弟,不停纠正:变得有礼貌、会拒绝危险或过分的要求、不乱说话。你用 AI 时它偶尔一本正经地拒绝你("作为一个 AI,我不能……"),就是这一步"教"出来的。
(2025 年后出现了 DPO 等更新更简单的对齐方法——不需要单独训一个品味官,直接让模型在"好答案"和"坏答案"的对比中学。但核心思路一样:让 AI 学会朝"人觉得好的方向"走。)
🤔 为什么每个 AI "性格"不一样?
现在你就懂了:不同公司拿不同的书喂(预训练数据不同)、用不同的范例培训、按不同的口味打分对齐,养出来的 AI 自然脾气秉性不同——有的活泼、有的严谨、有的特别爱"安全第一"动不动就拒绝你。这就是为什么你同一个问题丢给 ChatGPT 和 Claude 和通义千问,得到的回答风格明显不同——不是因为底层原理不一样,而是养法不同。
除了"性格"不同,AI 其实还有三种"体质"——取决于它在训练时练的是哪种本事:编码器体质(擅长"读懂"):看完一段话能精准判断情绪、分类、挑关键词——搜索引擎、垃圾邮件过滤背后用的就是这类(代表:BERT)。解码器体质(擅长"往下写"):给个开头就能一路接龙写下去——ChatGPT、Claude、通义千问都是这一类,也就是你天天聊天的那种。编码+解码体质(擅长"翻译/改写"):读懂输入、再吐出另一段——机器翻译、摘要背后常用这类。你平时用的聊天 AI 几乎全是"解码器体质"——所以它们天生擅长生成、不太擅长精确分类。知道这个,以后碰到"AI 明明聊天很溜但做判断题老出错"就不会觉得奇怪了:术业有专攻,体质不同嘛。
(两个冷知识:① "越狱",就是有人变着法儿绕过第三步立的规矩,骗它说不该说的话——本质是找到对齐的漏洞,像给一只被训好的导盲犬下暗语让它去咬人。② "对齐税"——有时候把它管教得太乖,反而会牺牲一点聪明劲儿和创造力,这是训练里要权衡的"安全 vs. 能力"跷跷板。用户骂它"太啰嗦""什么都不敢说",往往就是对齐税交多了。)
🎁 这一篇带走的
你手机里用的所有 AI 助手,都是"读全网 → 岗前培训 → 教做人"这三步养出来的。
理解这个,你就不会对 AI 有两种极端误解了:它既不是无所不知的神(它只是读得多),也不是冷冰冰的查询机器(它被专门"教"过怎么跟人打交道)。它更像一个博览群书、受过训练、但偶尔还是会犯轴的实习生——而且这个实习生的"性格",完全取决于它师傅怎么带的。
下次你觉得某个 AI"太啰嗦/太保守/太放飞",别觉得它"笨"——它只是被不同的师傅、按不同的口味调教出来的。换一家试试,可能风格刚好对你胃口。
下一篇预告:还记得开篇那只根本不存在的猫吗?小硅为啥会"一本正经地胡说八道"?这个毛病能治吗?——我们来聊聊"幻觉"。