这些大语言模型的训练,可以概括为一个 **“大规模预训练 + 精细化后训练”** 的两阶段范式。简单来说,就是先让模型在海量数据中“博览群书”,再通过精细调教让它“学会对话”。
### 📚 第一阶段:预训练 (Pre-training) —— 打下知识地基
这是训练中最耗费算力和数据的阶段,目标是让模型学习语言的基本规律和世界知识。
* **训练数据**:数据规模极其庞大,通常达到**数万亿(T)Token级别**。例如,DeepSeek-V4的预训练数据就超过了**32T Token**。数据来源非常广泛,主要包括:
* **网络爬取数据**:如Common Crawl,是基础语料的主要来源。
* **高质量文本**:包括书籍、学术论文、百科(如维基百科)等。
* **代码数据**:来自GitHub等开源平台,用于提升模型的编程和逻辑推理能力。
* **长文档与专业领域数据**:如技术报告、数学内容等,用于增强特定能力。
* **合成数据**:由其他模型生成的数据,用于补充稀缺或敏感领域的训练样本。
* **授权数据**:与新闻机构等版权方达成的直接许可协议,如OpenAI与新闻集团(News Corp)的交易。
* **训练目标**:核心任务是**预测下一个Token**(即“词语接龙”),通过海量文本自学,掌握语法、知识和基础逻辑。这个过程通常需要在**数万块GPU**(如图形处理器)组成的超算集群上运行**数周至数月**。
### 🎯 第二阶段:后训练 (Post-training) —— 成为合格助手
预训练后的模型虽然知识渊博,但可能“口无遮拦”,后训练就是教会它如何“得体”地与人交流。以Kimi K3为例,其后训练通常包含以下步骤:
1. **监督微调 (SFT)**:使用大量高质量的**指令-回答对**数据,对模型进行有监督训练。这就像给模型上“规范特训”,让它学会理解并遵循指令。Kimi K3的SFT数据就覆盖了大量复杂的智能体任务。
2. **强化学习 (RL)**:在SFT的基础上,通过强化学习进一步激发模型的高阶推理和执行能力。Kimi K3在通用任务、通用智能体和编码智能体等多个领域大规模扩展了RL训练。
3. **对齐 (Alignment)**:这是让模型符合人类价值观和安全底线的关键步骤。主流方法包括**基于人类反馈的强化学习 (RLHF)** 和**直接偏好优化 (DPO)**。Kimi K3则采用了一种更先进的方法——**多教师在线策略蒸馏 (MOPD)**,将多个专业领域的教师模型的能力整合到单一模型中。
### 🖥️ 支撑这一切的算力基础设施
如此庞大的训练任务,依赖于专门构建的大规模计算集群。
* **GPU集群规模**:训练前沿模型需要成千上万块高性能GPU。例如,有报道称GPT-6的训练使用了**超过10万块NVIDIA H100 GPU**。国内厂商也在积极建设**万卡甚至十万卡级别**的智算集群,如京东云计划建设的十万卡集群,以及中科曙光发布的“曙光8000(登峰)”全国产十万卡AI超集群。
* **关键硬件**:除了GPU,高速互联网络也至关重要,它决定了数万块芯片能否高效协同工作。例如,阿里云的“灵骏真武M890”超节点,就通过自研芯片实现了**800GB/s**的卡间互联带宽,以支撑超2万亿参数大模型的训练。
### 💎 总结
所以,你之前提到的那些著名模型,无论是GPT、Gemini还是DeepSeek、Kimi,它们的“智慧”都源于这套相似的训练流程:**用海量、多样的数据(网页、代码、书籍、合成数据等)进行预训练打下基础,再通过监督微调、强化学习等技术进行精细的后训练,最终在由数万块GPU组成的强大算力集群上完成训练**。不同模型之间的差异,主要体现在数据配比、模型架构、后训练策略以及算力规模的具体选择上。

781

被折叠的 条评论
为什么被折叠?



