上一篇聊了"越大越强"的Scaling Law。可2024年底出了件更炸裂的事:OpenAI的o1和DeepSeek的R1证明——不用把模型做得更大,只要让它"多想一会儿",就能强一大截。 相当于同一个学生,卷子一样,只是多给了他10分钟草稿时间
,成绩就从80飙到95。
🏫 以前那条路:训练时砸钱
咱们回忆一下上一篇讲的 Scaling Law——想让模型更强?三板斧:更多数据、更多参数、更多算力。这三样全是训练时花的钱。模型训完,能力就定死了;之后不管你怎么问,它的"脑子"不会临时变大。
大约 6 分钟