本文定位:一份面向零基础新人的、全面系统的国产主流大模型调研文档,方便快速学习上手。
信息截至:2026 年 9 月(模型迭代极快,具体参数与价格请以各厂商官方最新公告为准)。
覆盖厂商:阿里通义千问(Qwen)、深度求索(DeepSeek)、智谱(Z.ai / GLM)、月之暗面(Kimi)、腾讯混元(Hunyuan)、MiniMax,以及字节豆包、百度文心等其他主流玩家。
核心内容:基础概念扫盲 → 厂商与模型谱系全景 → 参数量级横向对比 → 部署硬件完全指南 → 选型与上手路线。

目录
- 第一章 零基础必读:看懂大模型的核心概念
- 第二章 2026 年国产大模型格局总览
- 第三章 六大主流厂商深度调研
- 第四章 其他值得关注的厂商(豆包/文心/讯飞等)
- 第五章 全景横向对比:参数量级 × 能力 × 价格
- 第六章 部署硬件完全指南(从 5 千元到 1300 万元)
- 第七章 选型指南:按场景、预算直接抄答案
- 第八章 新人快速上手路线图(实操版)
- 附录 A 术语速查表
- 附录 B 信息来源与时效性说明
第一章 零基础必读:看懂大模型的核心概念
如果你是第一次接触大模型,请务必先读完本章。后面所有章节的内容,都建立在这十几个概念之上。
1.1 什么是大语言模型(LLM)?
大语言模型(Large Language Model)是一种通过海量文本训练出来的 AI 程序。它的本质工作是预测下一个词(token)——听起来简单,但当模型规模足够大、训练数据足够多时,"预测下一个词"就涌现出了翻译、写作、写代码、数学推理、多轮对话等复杂能力。
我们平时说的 “Qwen3-32B”、“DeepSeek-V3”,指的就是一个个具体的模型(权重文件),就像一个个不同规格的"大脑"。把模型下载/部署到你的电脑或服务器上,才能让它为你干活。
1.2 参数量(B):模型的"脑容量"
- 参数(Parameters) 是模型内部可以被训练的数值权重,数量以 B(Billion,十亿) 为单位。
- 参数量粗略决定了模型的能力上限:参数越多,"记住"的知识和模式越多,能力通常越强——但显存/内存占用也越大、推理成本越高。
- 常见档位直观感受(以 2025-2026 年国产模型为参照):
- 0.5B~4B:手机/开发板可跑,做简单问答、摘要、分类;
- 7B~14B:一台游戏电脑可跑,日常对话、写作够用;
- 30B~72B:单张 24GB 显卡到多卡工作站,接近 GPT-4 级的体验;
- 100B~700B+(多为 MoE):数据中心级别,旗舰智能;
- 1T~3T(万亿级 MoE):顶级厂商的旗舰,如 Kimi K3(2.8T)、Qwen3.8(2.4T)、DeepSeek-V4-Pro(1.6T)。
1.3 Dense(稠密)vs MoE(混合专家):最重要的架构分水岭
这是当前理解大模型最关键的一个概念。
Dense(稠密)模型
每个 token 的计算都会经过全部参数。比如 Qwen3-32B,每生成一个 token 都要做 320 亿参数量的计算。特点是:结构简单、小尺寸下性价比好、部署门槛低。
MoE(Mixture-of-Experts,混合专家)模型
把模型拆成很多个"专家"子网络,每个 token 只路由到其中一小部分专家去计算。
- 总参数(Total Params):所有专家加起来的参数总量,决定"要多少显存把整个模型装下"——所有专家的权重都必须常驻显存;
- 激活参数(Active Params,记作 A):每个 token 实际参与计算的参数量,决定"算得快不快、推理成本高不高"。
一句话记住:总参数决定"要带多少书上车",激活参数决定"这一秒翻开多少本书"。
例如 DeepSeek-V3:总参数 671B,激活 37B——它的"知识容量"相当于 671B 的 Dense 模型,但计算量只相当于 37B 模型。所以 MoE = 大容量 + 低计算成本,代价是显存必须按总参数来配。
MoE 的表示法:Qwen3-235B-A22B 读作"总参数 235B、每 token 激活 22B"。
为什么国产大模型几乎清一色 MoE? 因为它把"能力"和"推理成本"解耦了:中国厂商普遍走"超大总参数 + 超小激活参数"路线(如 MiniMax M2:230B 总参/A10B 激活,不到 5% 激活率),用架构换性价比。
1.4 上下文窗口(Context Window)与 Token
- Token 是模型处理文本的最小单位,1 个中文汉字 ≈ 0.6~1 个 token,1 个英文单词 ≈ 1.3 个 token。
- 上下文窗口是模型一次能"记住"的最大 token 数,决定你能一次性塞给它多长的资料。
- 早期模型:4K~32K(约一本书的几页到几十页);
- 2025 年主流:128K~256K(约一本 30 万字的书);
- 2026 年旗舰:1M(百万 token)——整个代码库、几十本资料一次喂入。Kimi K3、DeepSeek-V4、Qwen3.8、MiniMax M3、GLM-5.2 均已达 1M 级。
- 注意"支持 1M"≠"你的硬件能开到 1M":超长上下文会消耗巨量显存(KV Cache),后文第六章详述。
1.5 思考模式(Thinking/推理模型)
2025 年以来,主流模型分化出两种工作模式,并逐渐合体为单模型双模式:
- 非思考模式(快思考):直接回答,适合简单问题,延迟低;
- 思考模式(慢思考/推理):先输出一段内部推理过程(思维链 CoT),再给答案,适合数学、代码、复杂逻辑。代表起点是 OpenAI o1 和 DeepSeek-R1(2025 年 1 月,以 RL 强化学习训练出推理能力,震动全球)。
现在的 Qwen3、GLM-4.5、DeepSeek-V3.1+ 等都支持在同一个模型内无缝切换两种模式。
1.6 多模态
- 理解型多模态(输入):能看图/视频/听音频,如 Kimi K3(原生视觉)、MiniMax M3(文本+图像+视频)、豆包 Seed 系列;
- 生成型多模态(输出):文生图(腾讯 HunyuanImage、字节即梦)、文生视频(混元视频、海螺 Hailuo、Seedance)、文生 3D(混元 3D)、语音(Speech、讯飞)。
- 原生多模态:从预训练第一刻就混合图文视频一起训(如 Kimi K3、MiniMax M3),而不是先训好文本再"外挂"视觉模块,效果和成本都更优。
1.7 量化(Quantization):省显存的核心手段
模型权重默认用 BF16/FP16(每参数 2 字节)存储。量化 = 用更少比特存权重,精度略降但显存大降:
| 精度 | 每参数字节数 | 显存(FP16 的) | 质量损失 | 使用场景 |
|---|---|---|---|---|
| FP32 | 4 字节 | 200% | 无 | 训练(已少用) |
| FP16 / BF16 | 2 字节 | 100%(基线) | 无 | 官方原生精度、微调 |
| FP8 | 1 字节 | 50% | 几乎无 | 2025-26 旗舰官方格式(H100/H200/昇腾950 原生支持) |
| INT8 / Q8 | 1 字节 | 50% | 极小 | 高精度需求本地部署 |
| INT4 / Q4(AWQ/GPTQ/GGUF) | 0.5 字节 | 25% | 小(保留 95~98% 质量) | 本地部署最主流 |
| Q2/Q3 | 0.25~0.375 字节 | ~12% | 明显 | 极限塞卡,不推荐 |
2026 年的新趋势:厂商从训练阶段就用量化感知训练(QAT)——Kimi K3 原生 MXFP4 权重、DeepSeek-V4-Pro 官方 FP4+FP8 混合权重、MiniMax M3 官方 MXFP8。低精度不再是"民间阉割",而是官方形态,这直接大幅降低了私有化部署门槛。
1.8 显存与 KV Cache:能不能跑起来,看显存
推理时显存占用 = 模型权重 + KV Cache + 激活值 + 框架预留,其中:
- 模型权重是固定大头:
显存(GB) ≈ 参数量(B) × 每参数字节数; - KV Cache 随上下文长度线性增长:70B 模型 4K 上下文约 2GB,128K 上下文可达 64GB(未压缩时)。这是"买显卡时最容易漏算的一项"。
第六章有完整的计算公式和速查表。
1.9 开源 / 开放权重 / 闭源,与许可证
- 闭源:只通过官方 API/APP 提供,拿不到权重,如豆包(Seed 2.0)、Qwen-Max、百度文心大部分;
- 开放权重(俗称开源):权重可从 Hugging Face / ModelScope 下载自行部署,但许可证条款各不相同:
- Apache 2.0 / MIT:最宽松,商用几乎无限制——Qwen3 全系、GLM-4.5/5.x(MIT)、ERNIE 4.5(Apache)、混元部分模型;
- 自定义许可证:如 Qwen3.8-2.4T(年收入超 5000 万美元的模型服务商需向阿里另获商用授权)、Kimi K3 License、MiniMax Model License——企业商用前务必读条款;
- Modified MIT(K2.5 等):基本宽松,带少量附加条件。
1.10 训练 vs 推理 vs 微调
- 预训练(Pre-training):从零训练,烧钱指数级(DeepSeek-V3 约 558 万美元,已经算极致省钱);
- 后训练(SFT + RL):在基座上教会模型对话/推理/工具调用;
- 推理(Inference):日常使用,本调研的重点;
- 微调(Fine-tuning):用自有数据定制模型。LoRA 微调只训练极小的附加矩阵,是个人/小团队唯一现实的方案;全参微调显存需求约等于训练,普通人玩不起。
第二章 2026 年国产大模型格局总览
2.1 玩家分层(截至 2026 年 9 月)
| 梯队 | 玩家 | 特点 |
|---|---|---|
| 第一梯队(超级巨头) | 字节豆包、阿里千问 Qwen、腾讯混元、百度文心 | 有钱、有场景、有流量入口,云生态强 |
| 第二梯队(明星独角兽) | DeepSeek、月之暗面 Kimi、智谱 GLM、MiniMax | 技术激进、开源先锋、全球话题中心 |
| 第三梯队(大厂系/垂直) | 讯飞星火、阶跃星辰 Step、昆仑万维天工、商汤日日新、百川 | 垂直行业纵深(教育/医疗/政企/视觉) |
| 第四梯队(学术/端侧) | 上海 AI Lab 书生 InternLM、面壁 MiniCPM、零一万物 Yi | 学术强、端侧小模型强 |
2.2 2026 年的五大技术趋势(理解了它们就看懂了所有发布会)
- 万亿参数 + 超低激活率:旗舰普遍 1.6T~2.8T 总参数,激活仅 21B~104B。"总参卷到 3T、激活压到 5%"是共同方向。
- 百万 token 上下文成为旗舰标配:Kimi K3、DeepSeek-V4、Qwen3.8、MiniMax M3 均达 1M;实现手段是各种稀疏/线性注意力(DeepSeek DSA、Kimi KDA、MiniMax MSA、Qwen Gated DeltaNet)。
- 原生多模态:Kimi K3、MiniMax M3 从预训练就混合图文视频;豆包 Seed 1.8/2.0 支持 GUI 操作和上千帧视频理解。
- Agent(智能体)成为能力指挥棒:所有旗舰都在卷"长程任务、连续工具调用、多智能体协作"(Kimi Agent Swarm 300 子代理、混元 Hy3 办公/金融 Agent、GLM-5.x 长程编码)。
- 低精度官方化:MXFP4/MXFP8/FP8 权重从训练期就设计(K3、V4、M3),配合国产芯片适配(DeepSeek-V4 适配华为昇腾 950PR),私有化部署成本从"一栋楼"降到"一辆豪车"。
2.3 一张表看懂六大厂商旗舰(2026 年 9 月)
| 厂商 | 当前旗舰 | 总参数 | 激活 | 上下文 | 开放权重 | 许可证 |
|---|---|---|---|---|---|---|
| 月之暗面 | Kimi K3(2026-07) | 2.8T | 104B | 1M | ✅(07-27 放出) | Kimi K3 License |
| 阿里 | Qwen3.8-2.4T-A95B(2026-08-12) | 2.4T | 95B | 262K(可扩~1M) | ✅ | 自定义(大厂需授权) |
| 深度求索 | DeepSeek-V4-Pro(2026-08 GA) | 1.6T | 49B | 1M | ✅ | 类 MIT/自定义 |
| 智谱 | GLM-5.3(2026-08-14) | ~744B | 40B | 200K~1M(5.2) | ✅ | MIT |
| MiniMax | MiniMax M3(2026-06) | ~428B | ~23B | 1M | ✅ | 开放权重 |
| 腾讯 | 混元 Hy3-preview(2026-04) | 295B | 21B | 256K | ✅(BF16/FP8) | 开放 |
可以看到:参数量从大到小差 10 倍,但"智能"差距远没有 10 倍——架构效率和训练质量比堆参数更重要,这也是 GLM(744B)和混元(295B)敢于主打"性价比部署"的底气。
第三章 六大主流厂商深度调研
每家厂商按统一结构展开:公司背景 → 发展时间线 → 模型谱系全景表 → 架构特点 → 开源与许可证 → API 参考价 → 优劣势与适用场景。
3.1 阿里 · 通义千问 Qwen 系列
公司背景
阿里通义实验室出品,国内开源生态最完整、尺寸矩阵最全的厂商(从 0.5B 到 2.4T 全覆盖),Hugging Face 累计下载量全球前列,Apache 2.0 开源传统好。依托阿里云百炼平台,企业接入友好。
发展时间线
| 时间 | 里程碑 |
|---|---|
| 2023-08 | Qwen-7B 首次开源 |
| 2024-06 | Qwen2 系列(0.5B~72B) |
| 2024-09 | Qwen2.5 系列(0.5B/1.5B/3B/7B/14B/32B/72B + Coder/Math/VL) |
| 2025-04 | Qwen3:六dense + 两MoE,思维/非思维双模式 |
| 2025-07 | Qwen3-2507 升级版 + Qwen3-Coder-480B-A35B(256K→1M) |
| 2026-02 | Qwen3.5:全新混合架构(状态空间 + MoE) |
| 2026-02 | Qwen3-Coder-Next(80B-A3B,DeltaNet 混合注意力) |
| 2026-04 | Qwen3.6-27B / 35B-A3B(Apache 2.0) |
| 2026-07/08 | Qwen3.8-Max(2.4T-A95B)云端上线,08-12 开放权重;08-14 补发 Apache 2.0 的 Qwen3.8-27B |
模型谱系全景(按参数量级,⭐=最具代表性)
开源 Dense(稠密)系列 —— 端侧到单卡服务器
| 模型 | 参数量 | 上下文 | 发布 | 特点与定位 |
|---|---|---|---|---|
| Qwen3-0.6B / 1.7B / 4B | 0.6~4B | 32K~128K | 2025-04 | 手机/边缘设备,4B 可对标 Qwen2.5-14B |
| Qwen3-8B / 14B / ⭐32B | 8~32B | 128K | 2025-04 | 本地部署甜点区;32B≈上代 72B 的能力 |
| Qwen2.5-72B | 72B | 128K | 2024-09 | 上代单机旗舰,仍有大量存量使用 |
| Qwen3.5-Small 系列 | 0.8B / 2B / 4B / 9B | — | 2026-03 | 3.5 代轻量,量化感知训练,主打端侧低延迟 |
| Qwen3.5-27B / Qwen3.6-27B | 27B | 长上下文 | 2026 | 201 语言覆盖;3.6 支持"思考保留" |
| Qwen3.8-27B | 27B | 长上下文 | 2026-08-14 | Apache 2.0,含图像输入与非思考模式 |
开源 MoE 系列 —— 数据中心级
| 模型 | 总参/激活 | 上下文 | 发布 | 特点 |
|---|---|---|---|---|
| ⭐Qwen3-30B-A3B | 30B / 3B | 128K | 2025-04 | 本地部署神器:激活仅 3B,消费级显卡可跑,性能超 QwQ-32B |
| Qwen3-235B-A22B | 235B / 22B | 128K→1M | 2025-04 | 上代开源旗舰 |
| Qwen3-Coder-480B-A35B | 480B / 35B | 256K→1M | 2025-07 | 仓库级代码生成 |
| Qwen3.5-35B-A3B | 35B / 3B | — | 2026-02 | 早期融合多模态 |
| Qwen3.5-122B-A10B | 122B / 10B | — | 2026-02 | 中高配 MoE |
| Qwen3-Coder-Next | 80B / 3B | 长上下文 | 2026-02 | DeltaNet+门控注意力,SWE-Bench Verified 70.6% |
| ⭐Qwen3.5-397B-A17B | 397B / 17B | — | 2026-02 | 3.5 代开源旗舰,混合状态空间架构 |
| Qwen3.8-2.4T-A95B | 2.4T / 95B | 262K(→~1M) | 2026-08-12 | 当代开源旗舰,官方 BF16 权重约 4.89TB |
闭源 API 系列:Qwen3-Max(>1T,2025)→ Qwen3.5-Plus → Qwen3.6-Plus → Qwen3.7-Max/Plus → Qwen3.8-Max(2.4T,2026-08)。商用走阿里云百炼,Turbo/Plus/Max 三档梯度定价。
架构特点
- Qwen3:标准 Transformer + 细粒度 MoE + 思考/非思考混合训练(四阶段后训练);36T token、119 种语言。
- Qwen3.5 起的重大转向:用 Gated DeltaNet(门控 Delta 状态空间网络)替代部分层的自注意力,实现序列线性复杂度 + 稀疏 MoE,是国产厂商中较早把"注意力混合架构"规模化的;多模态采用早期融合(Early Fusion)。
- Qwen3.8:512 个专家,每 token 激活 10 个路由专家 + 1 个共享专家;旗舰开源版省略了图像输入与非思考模式(闭源云端版才有)。
开源与许可证
- Qwen3/Qwen3.5/Qwen3.6/Qwen3.8-27B:Apache 2.0,商用宽松;
- Qwen3.8-2.4T-A95B:自定义许可证,年收入超 5000 万美元的模型服务商需获得阿里商用授权——个人和一般企业不受影响。
API 参考价(元/百万 token,输入侧,2026 年公开价,以官网为准)
- Qwen-Turbo ≈ 0.3;Qwen-Plus ≈ 0.8~4;Qwen-Max / 3.8-Max ≈ 20~100(旗舰档)。
优劣势速览
- ✅ 尺寸矩阵最全(0.6B~2.4T 一站配齐)、开源传统最好、阿里云生态、中英双语双强、Qwen3-30B-A3B 这类"激活小 MoE"是本地部署性价比之王;
- ❌ 旗舰 Max 价格偏高;版本迭代快、接口偶有变动;旗舰开源检查点仍为 BF16(暂无官方低精度版),自部署显存开销为各家最大。
适用场景
企业级应用与私有化全栈、开发者 API 集成、端侧部署(Qwen3.5-Small)、本地 MoE 部署(30B-A3B)、中英双语业务。
3.2 深度求索 · DeepSeek 系列
公司背景
2023 年由量化基金幻方科技创始人梁文峰创立,研究型实验室风格(团队约百余人),以"低成本 + 极致架构创新 + 彻底开源"著称。2025 年 1 月 R1 发布引发全球震动(被誉为"AI 界的斯普特尼克时刻",当日英伟达股价大跌)。V3 训练成本仅约 558 万美元,是 GPT-4 级性能的约 1/20 成本。2026 年在 OpenRouter 等平台调用量居开源模型前列。
发展时间线与全谱系
| 时间 | 模型 | 总参/激活 | 上下文 | 关键点 |
|---|---|---|---|---|
| 2024-01 | DeepSeek LLM 67B | 67B Dense | 4K | 对标 Llama2-70B |
| 2024-01 | DeepSeek-MoE | 145B / 22B | 4K | 国内首个开源 MoE |
| 2024-05 | DeepSeek-V2 | 236B / 21B | 128K | 首创 MLA + DeepSeekMoE,API 价格战(对标模型 1/70 价格) |
| 2024-09 | V2.5 / Coder-V2 | 236B / 21B(Coder Lite 16B-A2.4B) | 128K | 合并升级 |
| 2024-12 | DeepSeek-V3 | 671B / 37B | 128K | 无辅助损失负载均衡、MTP 多 token 预测、FP8 训练,对标 GPT-4o |
| 2025-01 | DeepSeek-R1 | 671B / 37B | 128K | 纯 RL 训出推理能力,MIT 开源;蒸馏全家桶:Qwen 1.5B/7B/14B/32B + Llama 8B/70B |
| 2025-03 | V3-0324 | 671B / 37B | 128K | V3 升级 |
| 2025-05 | R1-0528 | 685B / 37B | 128K | AIME 87.5%,对标 o3/Gemini-2.5-Pro |
| 2025-08 | V3.1 / Terminus | 685B / 37B | 128K | 思考/非思考统一 |
| 2025-09 | V3.2-Exp | 685B / 37B | 128K | DSA 稀疏注意力(长上下文成本大降);V3.2-Speciale 达 IMO/IOI 金牌级 |
| 2026-04 | DeepSeek-V4(预览) | Pro:1.6T/49B;Flash:284B/13B | 1M | CSA+HCA 混合压缩注意力、FP4+FP8 官方混合权重、适配华为昇腾 950PR |
| 2026-08 | V4 正式版(Flash-0731 / Pro-0813) | 同上 | 1M | GA 版本,SWE-bench Verified 约 80%+(早期口径 80.6%) |
其他专项模型:DeepSeek-VL2(视觉)、DeepSeek-OCR(2025-10,1B)、DeepSeekMath-V2(2025-11)、DSpark 推理加速框架(2026-06)、DeepSeek Harness Agent 平台(2026-08)。
架构特点(国产架构创新的"发动机")
- MLA(多头潜在注意力):V2 首创,KV Cache 压缩超 93%,后成为 Kimi 等各家事实标准;
- DeepSeekMoE 细粒度专家:Qwen、GLM 等均追随此设计;
- MTP(多 token 预测):一次算多个 token,推理加速;
- DSA(DeepSeek 稀疏注意力,V3.2):细粒度稀疏注意力,长上下文训练推理成本大降,是 V4 百万上下文的基石;
- V4 的"账房思维":官方直接发 FP4+FP8 混合权重(约 865GB),配合压缩注意力,让 1.6T 模型一台 8 卡 B200 服务器就能跑满 1M 上下文——把"开源旗舰私有化成本"从数千万元打到三百万元级。
开源与许可证
V3/R1 系 MIT;V4 描述为"开源"但商用前建议核对具体条款。R1 蒸馏小模型(基于 Qwen/Llama)同时继承上游许可。
API 参考价(2026 年,美元/百万 token)
- V4-Flash:输入 $0.14 / 输出 $0.28(缓存命中输入仅 $0.0028)——分类、抽取、日常编码的默认选择;
- V4-Pro:输入 $0.435 / 输出 $0.87(缓存命中 $0.003625);
- 网页版/App 对个人免费;并发限额 Flash 2500 / Pro 500;
- 旧接口 deepseek-chat / deepseek-reasoner 已于 2026-07 停用,需迁移新 model ID。
优劣势速览
- ✅ 全行业性价比地板("百万上下文 1 元起"宣传口径)、推理/代码第一梯队、彻底开源、中文母语级语感、官方应用免费;
- ❌ 多模态偏弱(V4 仍以文本/代码为主)、高峰期服务波动、无自有办公/流量入口、生态整合弱。
适用场景
预算敏感团队的首选底座、企业私有化部署、Agent/Agentic Coding、数学与竞赛编程、高吞吐 API 业务。
3.3 智谱 · GLM 系列
公司背景
2019 年从清华大学 KEG 实验室孵化(创始人唐杰、李娟祯;CEO 张鹏),2025 年中启用国际品牌 Z.ai。累计融资约 15 亿美元(阿里、腾讯、小米、美团等参投),估值约 300~400 亿元人民币,计划 2026 年港股 IPO。开源模型全球累计下载超 4000 万次,MIT 许可证 + "参数效率"是其招牌。
发展时间线与谱系
| 时间 | 模型 | 总参/激活 | 上下文 | 关键点 |
|---|---|---|---|---|
| 2022 | GLM-130B | 130B Dense | — | 国内最早开源的千亿模型 |
| 2023-03 | ChatGLM-6B | 6B | — | 国内本地部署启蒙模型 |
| 2024 | GLM-4 / GLM-4-9B | 9B 开源 | 128K | GLM-4-Flash API 永久免费 |
| 2025-07 | GLM-4.5 | 355B / 32B | 128K | MIT;12 项基准全球第 3;Agent/Coding 定位 |
| 2025-07 | GLM-4.5-Air | 106B / 12B | 128K | MIT;单张 H200 可跑 FP8 版 |
| 2025-09 | GLM-4.6 | 355B / 32B | 200K | 真实编码/Agent 大幅增强 |
| 2025-12 | GLM-4.7 | — | — | 旗舰文本模型(API 线) |
| 2026-02 | GLM-5 | 744B / — | 200K | DSA 机制,Agent 工程设计 |
| 2026-04 | GLM-5.1 | 744B / 40B | — | 国产算力适配、长程任务 |
| 2026 中 | GLM-5.2 | ~745B / 44B | 1M(无损) | 主打长程 Coding Agent;MIT |
| 2026-08-14 | GLM-5.3 | ~744B / 40B | 200K+ | FP8 权重约 756GB;vLLM 官方最低显存预算约 893GB(8×H200 单机可跑) |
产品矩阵:GLM(旗舰)/ Air(轻量)/ AirX(极速)/ Flash(免费)/ X(高性能);另有 CodeGeeX 编程助手、GLM-4V 视觉、CogView 文生图、清言 App。
架构与部署特点
- 核心理念:更高参数效率——GLM-4.5 用 DeepSeek-R1 一半、Kimi-K2 三分之一的参数达到可比性能,处于"性能/参数比"帕累托前沿;
- 官方给出极清晰的部署配方(在开源厂商中最友好),例如 GLM-4.5:
- BF16:H100×16 或 H200×8;FP8:H100×8 或 H200×4;
- 吃满 128K 上下文:BF16 H200×16 / FP8 H200×8;
- GLM-4.5-Air FP8:单张 H200 即可;微调:H20×16(LoRA)/ H20×128(SFT);
- GLM-5.x 延续"一台 8 卡 H200 服务器 = 完整旗舰"的最干净部署故事(GLM-5.3 FP8 约 756GB + 运行空间 ≈ 893GB < 8×H200 的 1128GB)。
API 参考价
- GLM-4-Flash:0 元(永久免费)——全网最有名的白嫖款;
- GLM-4.5:输入约 0.8 元/百万 token、输出约 2 元;Air/AirX 更低;旗舰 5.x 约 4~20 元档。
优劣势速览
- ✅ MIT 开源最干净(商用零顾虑)、参数效率与部署成本优势、长程编码 Agent 第一梯队、CodeGeeX/Agent 生态成熟、免费 Flash;
- ❌ 通用对话知名度低于豆包/DeepSeek、旗舰 API 不算便宜、多模态(尤其视频)布局弱。
适用场景
程序员与 AI 编程工具、企业私有化(许可证无风险)、内部知识库 + Agent 自动化、预算有限但想要旗舰能力的自部署团队。
3.4 月之暗面 · Kimi 系列
公司背景
2023 年 3 月由杨植麟创立,以长文本起家(Kimi Chat 2023 年 10 月支持 20 万字上下文,一战成名)。2025 年凭 K2 进入开源第一梯队,2026 年 7 月 K3 成为全球首个开放权重的 3T 级模型,是当前全球开源社区热度最高的中国厂商之一。
发展时间线与谱系
| 时间 | 模型 | 总参/激活 | 上下文 | 关键点 |
|---|---|---|---|---|
| 2023-10 | Kimi Chat | — | 20 万字 | 长文本起家 |
| 2025-01 | Kimi k1.5 | — | 128K | 多模态推理(长上下文 RL) |
| 2025-04 | Kimi-VL | 16B / 2.8B | 128K | 开源视觉语言 MoE |
| 2025-06 | Kimi-Dev | 72B | — | SWE-bench 开源 SOTA(代码专用) |
| 2025-07 | Kimi K2 | 1.04T / 32B | 128K→256K | 384 专家(8 路由+1 共享)、61 层;MuonClip 优化器;15.5T token;Modified MIT |
| 2025-09 | K2-Instruct-0905 | 1T / 32B | 256K | 编码/Agent 强化 |
| 2025-11 | K2 Thinking | 1T / 32B | 256K | 深度推理;200~300 次连续工具调用;SWE-bench Verified ~71% |
| 2026-01 | K2.5 | 1T / 32B | 256K | 原生多模态 + Agent Swarm(百级子代理);Modified MIT |
| 2026-04 | K2.6 | 1T / 32B | 262K | 长程编码;Swarm 可协调 300 子代理/4000 步 |
| 2026-07-16 | Kimi K3 | 2.8T / 104B | 1,048,576(1M) | 原生多模态(MoonViT-V2 视觉编码器);07-27 开放权重 |
Kimi K3 架构详解(2026 年开源标杆)
- 规模:2.8T 总参、每 token 激活 104B、93 层、896 个路由专家(每 token 选 16)+ 2 个共享专家;
- Kimi Delta Attention(KDA):约 69 层用线性复杂度的 KDA + 24 层门控 MLA 周期性插入——这是 1M 上下文能实际推理的关键;
- Attention Residuals(AttnRes):跨层选择性残差,增强长链推理一致性;
- Stable LatentMoE:归一化感知门控 + 负载均衡约束,超高稀疏 MoE 稳定训练;
- 原生 MXFP4 权重 / MXFP8 激活(量化感知训练),官方权重约 1.56TB;vLLM 官方最低显存预算约 1680GB;
- API 定价 $3 / $15 每百万 token(缓存命中输入 $0.30;Mooncake 架构下 coding 负载缓存命中率超 90%)。
优劣势速览
- ✅ 长文本天花板(1M 上下文 + 原生多模态)、开源尺度最激进(3T 级全球首例)、推理/代码/长文档分析顶级、Kimi App 搜索+长文整理口碑好;
- ❌ 2.8T 参数自部署需要顶级集群(8×B300 级别,约 380~450 万元起),普通企业玩不起;输出偶显冗长;旗舰 API 定价中上。
适用场景
长文档/学术/法律/代码库分析、要尝鲜顶级开源模型的技术团队、多模态长程 Agent。
3.5 腾讯 · 混元 Hunyuan 系列
公司背景
腾讯的全栈大模型体系:文本(混元 LLM)+ 图像(HunyuanImage)+ 视频(HunyuanVideo)+ 3D(Hunyuan3D)+ 翻译(Hy-MT)+ 世界模型。依托微信/QQ 入口、腾讯云和元宝/ima/WorkBuddy 应用矩阵。特点是多模态布局最全面、API 低价走量,但榜单声量和开源激进程度弱于独角兽。
发展时间线与谱系(文本线)
| 时间 | 模型 | 总参/激活 | 上下文 | 关键点 |
|---|---|---|---|---|
| 2023-09 | 混元 v1 | 100B+ Dense | — | 首代;曾开源 7B/4B/1.8B/0.5B 小模型 |
| 2024-11 | Hunyuan-Large | 389B / 52B | 256K(预训练)/128K | 当时最大开源 Transformer-MoE;GQA+CLA 压缩 KV ~95% |
| 2025-02 | Hunyuan-TurboS | 560B / 56B | — | Mamba2 + Attention + MoE 混合架构,16T token,快慢思考 |
| 2025-03 | Hunyuan-T1 | —(52B 激活级) | 256K | 深度推理(96.7% 后训练算力用于 RL) |
| 2025 年中 | Hunyuan-A13B | 80B / 13B | 256K | 开源混合推理(快/慢思考切换),hunyuan-standard-256K 升级线 |
| 2025-12 | 混元 2.0 | 406B / 32B | 256K | Think/Instruct 双版本;SWE-bench 53.0%,τ²-Bench 72.4 |
| 2026 | Hy-MT2 翻译 | 1.8B Dense + 30B-A3B | — | 33 语种 WMT25 SOTA,Apache 2.0 |
| 2026-04 | Hy3-preview(混元3.0) | 295B / 21B | 256K | "重建混元"第一步:编程/办公/金融建模/前端/游戏/Agent;官方建议 8 卡部署,同时开放 BF16 与 FP8(~300GB) |
多模态与专项开源(节选):HunyuanVideo(13B,2024-12)、HunyuanImage 3.0(80B MoE 自回归文生图,2025-09)、HunyuanOCR(1B,2025-11)、HunyuanVideo 1.5(8.3B,消费级显卡可跑,2025-11)、Hunyuan3D 2.x / 3D 世界模型 1.0/1.5、HY-Motion(2025 底开源)。
架构与部署特点
- 混元是国产厂商中**架构最"混搭"**的:TurboS 率先把 Mamba 状态空间引入旗舰;Large 用 CLA 跨层注意力压 KV;
- Hy3 是 2026 年"旗舰性价比"的代表:295B 总参不大、FP8 权重约 300GB,4×H200 即可完整部署(约 160~180 万元硬件),官方生产建议 8 卡——是六大厂旗舰中最便宜的自部署选择;
- API 定价在巨头中偏低:混元 Turbo 输入约 0.3~1 元/百万 token;Hy3-preview 在 OpenRouter 上 $0.066/$0.26。
优劣势速览
- ✅ 多模态全家桶(图/视频/3D/世界模型)最全、微信生态触达、腾讯云 + WorkBuddy 办公自动化、旗舰自部署成本最低、API 便宜;
- ❌ 公开榜单少拿第一、营销声量弱、开源力度不如 DeepSeek/Kimi/Qwen、应用入口分散(元宝/ima/WorkBuddy/API 多线)。
适用场景
办公白领与微信生态、政企腾讯云客户、多模态内容生产(视频/3D)、想要最低成本自部署旗舰 MoE 的企业。
3.6 MiniMax 系列
公司背景
2022 年成立(上海),以**“极致激活效率 + 超长上下文 + 多模态”**著称。C 端产品:海螺 AI(视频生成口碑极佳)、MiniMax Code、星野(语音/陪伴)。技术标签:闪电注意力(Lightning Attention)、CISPO 强化学习、"mini activations"哲学。
发展时间线与谱系
| 时间 | 模型 | 总参/激活 | 上下文 | 关键点 |
|---|---|---|---|---|
| 2025-01 | MiniMax-Text-01 / VL-01 | 456B / 45.9B | 1M 训练(可外推 4M) | 闪电注意力(每 7 层线性注意力 + 1 层 softmax)+ MoE;把 1M 上下文成本打下来 |
| 2025-06 | MiniMax-M1 | 456B / 45.9B | 1M | 全球首个开源大规模混合注意力推理模型;CISPO RL |
| 2025-10 | MiniMax-M2 | 229.9B / 9.8B | 192K(API 204.8K) | “mini activations”:激活不到 10B,速度/并发/成本优势巨大 |
| 2025-12 | M2.1 | 230B / 10B | ~200K | 多语言编码强化(Multi-SWE-Bench 49.4%) |
| 2026-02 | M2.5 | 230B / 10B | ~200K | SWE-bench Verified 80.2%;办公文档(Word/Excel/PPT)操作能力 |
| 2026-02 | M2.5-Lightning | 230B / 10B | ~200K | 100 token/s,宣传"$1/小时"连续运行 |
| 2026-03 | M2.7 | 230B / 10B | ~200K | 自进化 Agent(递归自我改进,需人工基础设施) |
| 2026-06 | MiniMax-M3 | ~428B / ~23B | 1M | MSA 稀疏注意力;原生多模态(文本+图像+视频);官方 MXFP8 权重约 444GB;SWE-Pro 56.2%、GDPval-AA 1495 ELO |
| 2026-07 | MiniMax H3 | — | — | 视频生成/多模态 |
| 2026-08 | Music 3.0 | — | — | 开放权重音乐生成 |
架构与部署特点
- 一脉相承的线性/稀疏注意力 + 超低激活率 MoE:Text-01/M1 的闪电注意力 → M3 的 MSA;
- M2 系(230B-A10B)的 BF16 权重约 460GB,量化后部署门槛与 GLM-4.5 相当;
- M3 是"旗舰仍能压进 4 张 H200"的典型:MXFP8 约 444GB < 4×H200 的 564GB(完整体验建议 8 卡)。
API 参考价(OpenRouter/官方,美元/百万 token,输入/输出)
- M2 ≈ $0.26/$1.02;M2.1/M2-her ≈ $0.30/$1.20;M3 有免费档,正式档按官方;
- 属于"旗舰能力的低价档",与 DeepSeek 同属第一性价比梯队。
优劣势速览
- ✅ 长上下文与推理效率的架构先锋、M2 激活小带来极低延迟与高并发、视频/语音/音乐多模态产品化最强、开放权重;
- ❌ 文本模型社区体量小于 DeepSeek/Qwen、国内 ToB 声量小、M3 上下文超 512K 有阶梯加价。
适用场景
视频/语音/音乐创作者(海螺)、高并发 Agent 平台(M2 系)、需要 1M 上下文 + 多模态且预算可控的团队(M3)。
第四章 其他值得关注的厂商
4.1 字节跳动 · 豆包 Doubao(闭源生态之王)
- 装机量/MAU 国内第一梯队(2026 年约 2.2 亿+ MAU),抖音/飞书/剪映全生态入口;
- 谱系:Doubao-1.5-Pro(2025,MoE 200B/激活 20B,7 活跃专家,宣称等效 7 倍激活参数的 Dense 性能)→ Seed-Thinking-v1.5 → Seed1.5-VL → Doubao 1.6-Vision → Seed-Code → Seed 1.8(2025-12,GUI/浏览器/手机操作,1280 帧视频)→ Seed 2.0(2026-02,Pro/Lite/Mini/Code,对标 GPT-5.2,原生 Agent);
- 附带即梦(图像)/Seedance(视频,全球登顶级)/COMET MoE 训练优化/UltraMem 稀疏架构等研究产出;
- 闭源为主(仅计划开源中小 Dense 模型),个人版免费额度大。适合:普通用户、内容创作者、字节生态业务。
4.2 百度 · 文心 ERNIE(开源转身的老牌)
- ERNIE 4.5(2025-06 开源,Apache 2.0):家族最大 424B/47B,另有 21B-A3B、0.3B 等多尺寸,多模态版 300B-A47B;
- 推理线 X1/X1.5 闭源;搜索 + 文库生态结合是强项。适合:百度生态、知识检索场景。
4.3 其他一览表
| 厂商 | 代表模型 | 参数量级 | 特点 | 适合 |
|---|---|---|---|---|
| 科大讯飞 | 星火 X1 / 4.0 | 未公开 | 语音识别/合成顶级,教育医疗司法方案深 | 行业 ToB/ToG |
| 阶跃星辰 | Step-3 / Step-3.5-Flash(196B-A11B) | 百 B 级 MoE | Agent/工具调用激进,部分开源 | Agent 前沿开发者 |
| 面壁智能 | MiniCPM 系列 | 0.5B~8B | 端侧小钢炮,离线可用 | 手机/PC 端侧、隐私场景 |
| 上海AI Lab | 书生 InternLM2.5/3 | 1.8B~107B | 全流程开源(数据/训练/评测) | 高校科研 |
| 零一万物 | Yi-Lightning 等 | 轻~中 | 轻量便宜,重心转向应用 | 端侧、轻量推理 |
| 百川智能 | Baichuan-M2 | 中量级 | 医疗垂直国内领先 | 医疗健康 |
| 昆仑万维 | 天工 Skywork | 中量级 | 开源追更快 | 研究/私有化兜底 |
| 商汤 | 日日新 SenseNova | — | 视觉/多模态安全合规强 | 政企安防 |
| Mistral(法,对照) | Small 4(119B-A6.5B)/ Large | 119B MoE | 256K;企业私有化友好(约 80~100 万元硬件) | 国外参照系 |
第五章 全景横向对比:参数量级 × 能力 × 价格
5.1 开源模型参数量级全景图(2026-09)
0.5B ──┬── Qwen3-0.6B / Qwen2.5-0.5B 【手机端侧】
└── MiniCPM 系(0.5~2B)、Hy-MT2-1.8B(翻译)
1~4B ──┬── Qwen3-1.7B / 4B、Qwen3.5-Small(2B/4B)
└── DeepSeek-R1-Distill-Qwen-1.5B 【入门开发板/纯CPU】
7~9B ──┬── Qwen3-8B、GLM-4-9B、Kimi-VL-A3B(16B总)
└── R1-Distill-Qwen-7B / Llama-8B 【一张 8~12GB 显卡】
13~16B ─┬── Qwen3-14B、DeepSeek-MoE-16B(A2.4B)、MiniCPM
└── Kimi-VL(16B-A2.8B) 【一张 16GB 显卡】
27~32B ┬── Qwen3-32B / Qwen3.6-27B / Qwen3.8-27B ⭐主流本地旗舰
└── QwQ-32B(推理) 【一张 24GB 显卡(Q4)】
30~35B MoE ─ Qwen3-30B-A3B ⭐、Qwen3.5-35B-A3B、Hy-MT2-30B-A3B
【激活3B,24GB卡可跑,速度极快】
72~80B ─┬── Qwen2.5-72B、Kimi-Dev-72B、R1-Distill-Llama-70B
└── Hunyuan-A13B(80B-A13B) 【双 24GB 卡 / 单 48GB】
100~130B MoE ─ GLM-4.5-Air(106B-A12B)⭐、Qwen3.5-122B-A10B
【1~2 张 H20/H200,企业入门】
200~300B MoE ─┬── DeepSeek-V2(236B-A21B)、Qwen3-235B-A22B
├── MiniMax-M2 系(230B-A10B)⭐
├── 腾讯 Hy3(295B-A21B)⭐
└── ERNIE 4.5(300B-A47B 多模态)【数据中心,8卡级】
350~560B MoE ─┬── GLM-4.5/4.6(355B-A32B)⭐
├── MiniMax-M1(456B-A45.9B)、Qwen3-Coder-480B-A35B
├── 混元 TurboS(560B-A56B)、混元2.0(406B-A32B)
└── MiniMax-M3(~428B-A23B)⭐ 【4~8 张 H200/H100】
700~750B MoE ─ GLM-5 / 5.1 / 5.2 / 5.3(744B-A40B)⭐、混元Large(389B-A52B,上代)
【8×H200 单机满血】
1T~1.1T MoE ─ Kimi K2 全家(1.04T-A32B)⭐ 【多机或 B300 集群】
1.6T MoE ──── DeepSeek-V4-Pro(1.6T-A49B)⭐ 【8×B200(1M上下文)】
2.4T MoE ──── Qwen3.8-2.4T-A95B 【24×B300(3台8卡机)】
2.8T MoE ──── Kimi K3(2.8T-A104B)⭐ 【8×B300 单机(2304GB)】
5.2 旗舰能力对比(2026-09,官方/公开口径)
| 维度 | Kimi K3 | Qwen3.8-Max | DeepSeek-V4-Pro | GLM-5.3 | MiniMax M3 | 混元 Hy3 |
|---|---|---|---|---|---|---|
| 总参/激活 | 2.8T/104B | 2.4T/95B | 1.6T/49B | 744B/40B | 428B/23B | 295B/21B |
| 上下文 | 1M | 262K(→1M) | 1M | 200K(5.2 为 1M) | 1M | 256K |
| 原生多模态 | ✅(文本+视觉) | ✅(云端版) | ❌(文本为主) | ❌(文本为主) | ✅(文+图+视频) | 部分 |
| 强项 | 长文档/推理/多模态 | 全能均衡 | 性价比/推理/Agent | 长程编码/Agent | 多模态/长上下文 | 办公/金融/性价比 |
| SWE-bench Verified(量级) | ~77-80% | 一流 | ~80%+ | 一流 | 56.2%(SWE-Pro 口径) | 53%(2.0 口径) |
| 官方权重精度 | MXFP4(1.56TB) | BF16(4.89TB) | FP4+FP8(865GB) | FP8(756GB) | MXFP8(444GB) | FP8(~300GB) |
| 满血自部署硬件 | 8×B300 | 3×(8×B300) | 8×H200(86K)/8×B200(1M) | 8×H200 | 4~8×H200 | 4~8×H200 |
| 满血硬件预算(整机) | ≈¥380-450万 | ≈¥1200-1300万 | ≈¥270-370万 | ≈¥270万 | ≈¥160-270万 | ≈¥160-270万 |
关键洞察:成本榜 ≠ 能力榜。 Qwen3.8 最贵是因为官方检查点仍是 BF16;DeepSeek 1.6T 只要一台 B200 服务器就能跑满 1M,是因为官方混合精度最激进。真正决定私有化门槛的是"厂商以什么精度开放",而不仅是模型多大。
5.3 API 价格梯队(元/百万 token,输入侧,2026-08 公开参考价)
| 档位 | 模型 | 参考价 |
|---|---|---|
| 🆓 免费 | GLM-4-Flash;DeepSeek 网页/App | 0 |
| 💰 ≈1 元级 | DeepSeek V4(宣传口径"百万上下文 1 元起")、混元 Turbo、Qwen-Turbo、豆包轻量 | 0.3~1 |
| 💰 1~4 元 | Qwen-Plus、豆包 Pro、文心 4.5 | 0.8~4 |
| 💰 4~20 元 | Kimi K2/K3 API、GLM-5、MiniMax 旗舰 | 4~20 |
| 💎 20~100 元 | Qwen-Max / Qwen3.8-Max、GLM-5.2/5.3 旗舰档、Doubao 旗舰 | 20~100 |
第六章 部署硬件完全指南(从 5 千元到 1300 万元)
本章是全文的"落地手册":先给公式,再给速查表,最后按预算给方案。
6.1 显存计算公式(必背)
推理(部署运行)
显存(GB) ≈ 参数量(B) × 每参数字节数 × 1.2(余量) + KV Cache
- 每参数字节数:FP16/BF16=2,FP8/INT8=1,INT4=0.5;
- 1.2 倍余量:框架、激活值、临时缓冲;
- KV Cache:随上下文线性增长,4K 上下文可忽略(+1~2GB),32K 开始显著,128K+ 可达数十 GB(可用 KV 量化压 50~75%)。
⚠️ MoE 模型按总参数计算显存(所有专家都要装进显存),激活参数只影响速度,不省显存!
微调(LoRA)
显存 ≈ 推理占用 + LoRA 训练开销(约再增加 30~50%)
7B LoRA 约需 16~20GB;14B 约 28~35GB;32B 约 70~80GB。全参微调约 = 每参数 16~20 字节(权重+梯度+优化器状态),70B 全参需 TB 级显存,普通人不考虑。
6.2 显存速查表:模型尺寸 × 量化 → 显卡
(含常规上下文余量,单请求场景;数据综合多来源实测口径)
| 模型尺寸 | INT4/Q4 | INT8/Q8 | FP16/BF16 | 代表模型 | 推荐硬件 |
|---|---|---|---|---|---|
| 1.5~4B | 1~3GB | 2~4GB | 4~8GB | Qwen3-4B | 任何 6GB+ 显卡/纯 CPU |
| 7~9B | 5~6GB | 8~10GB | 14~20GB | Qwen3-8B、GLM-4-9B | 8GB:Q4;12GB:Q8 |
| 13~14B | 8~10GB | 14~18GB | 28~35GB | Qwen3-14B | 16GB:Q4;24GB:Q8 |
| 27~32B | 20~26GB | 38~45GB | 70~80GB | Qwen3-32B | 24GB(4090/3090):Q4 勉强;48GB:舒适 |
| 70~72B | 40~48GB | 75~85GB | 145~160GB | Qwen2.5-72B | 48GB 单卡 / 双 24GB:Q4 |
| 30B MoE(A3B) | ~18GB(可再量化) | ~30GB | ~60GB | Qwen3-30B-A3B | 24GB 卡跑 Q4,速度极快(激活仅3B) |
| 106B MoE(A12B) | ~55GB | ~110GB | ~220GB | GLM-4.5-Air | 2×4090(48GB)Q4 / 1×H200 FP8 |
| 230B MoE(A10B) | ~120GB | ~240GB | ~460GB | MiniMax-M2 | 2×H200(282GB) |
| 355B MoE(A32B) | ~185GB | ~370GB | ~730GB | GLM-4.5/4.6 | 4×H200(BF16 8 卡;FP8 4 卡) |
| 671B MoE(A37B) | ~380GB | ~700GB | ~1400GB | DeepSeek-V3/R1 | 8×H100/8×H200(FP8) |
| 1T MoE(A32B) | ~560GB | ~1100GB | ~2100GB | Kimi K2 | 多机集群 / 8×B300(MXFP4 官方格式更省) |
6.3 显卡天梯图(2026 年国内可获得的现实选项)
消费级(NVIDIA)
| 显卡 | 显存 | 带宽 | 能跑什么(Q4 口径) | 参考价 |
|---|---|---|---|---|
| RTX 3060 12GB | 12GB | 360GB/s | 13B | ~¥1,500-2,500(二手) |
| RTX 4060 Ti 16GB | 16GB | 288GB/s | 13B Q8 | ~¥3,500 |
| RTX 3090/4090 24GB | 24GB | ~1TB/s | 32B Q4 / 30B-A3B(本地部署黄金卡) | 3090 二手 ~¥5-7千;4090 ~¥1.3-1.7万 |
| RTX 5090 32GB | 32GB | 1.79TB/s | 32B Q6~Q8 / 70B Q2 卸载 | ~¥1.7-2.3万 |
| 双 3090/4090(48GB) | 48GB | — | 70B Q4 | DIY 服务器 ~¥2-3万 |
| RTX Pro 6000 96GB | 96GB | — | 70B Q8 / 120B Q4 | ~¥7-10万 |
数据中心级(NVIDIA,国内合规可购情况)
| 显卡 | 显存 | 带宽 | FP16 算力 | 备注 |
|---|---|---|---|---|
| H20(96/141GB) | 96/141GB | 4.0TB/s | ~148 TFLOPS | 国内特供合规卡:砍算力保带宽,CUDA 生态零迁移;推理吞吐反而不错;8 卡整机约 ¥90-150万 |
| H100 | 80GB | 3.35TB/s | ~1979 TFLOPS | 对华禁售(存量流通) |
| H200 | 141GB | 4.8TB/s | 同 H100 | 禁售但存在存量/特殊渠道口径;8 卡整机公开报价约 $40 万(≈¥271万) |
| B200 | 180GB | 8TB/s | ~20P(FP4) | 禁售;8 卡整机 $54.5 万(≈¥370万) |
| B300 | 288GB | 8TB/s | 更高 | 8 卡整机 $56.5 万(≈¥383万);Kimi K3 满血单机的关键 |
国产算力(自主可控主线)
| 芯片 | 显存 | FP16 算力 | 互联 | 备注 |
|---|---|---|---|---|
| 昇腾 910B | 64GB HBM2e(部分批次/资料为 128GB) | ~317-414 TFLOPS | 392GB/s | 2025 年出货约 81 万颗,国产占近半;单卡约 ¥5 万;月租约 1~1.7 万/卡 |
| 昇腾 910C | 128GB HBM3e | ~800 TFLOPS(风冷标定 560T) | 灵衢 784GB/s | 双 910B die 封装;对标 H100 的 60~80%;Atlas 800/900 系列 |
| 昇腾 950PR | 112GB(自研 HBM) | FP8 1P | 2TB/s | 2026 年放量,已用于 DeepSeek-V4 推理 |
| 昇腾 950DT | 144GB | FP4 2P | 2.2TB/s | 训练版,2026Q4 |
| 平头哥真武 810E | 96GB | 对标 H20 级 | 700GB/s | 阿里云自用,万卡集群 |
| 其他 | 寒武纪/海光/沐曦/摩尔线程等 | — | — | 生态适配成本需评估 |
国产卡选择要点:
- 单卡算力:910C ≈ H100 的 60-80%,但 H100/B200 买不到;
- H20 能买但只有 H100 约 15% 算力,带宽(4.0TB/s)却高于 H100——大模型推理是带宽敏感型负载,所以 H20 做推理并不差;
- 昇腾生态是 CANN/MindSpore,不兼容 CUDA,迁移成本真实存在(算子适配数天到数周);但"能买到 + 持续交付 + 自主可控",是政企和长期项目的现实最优;
- 华为用**超节点(CloudMatrix 384 / Atlas 950:384~8192 卡全互联)**抹平单卡差距,系统级推理效率已可与 H100/H800 集群掰手腕。
6.4 六大旗舰"满血"部署账单(2026-08 口径,单份模型低并发,整机估算)
| 模型 | 官方权重 | 最低显存预算 | 方案 | 预算 |
|---|---|---|---|---|
| GLM-4.5-Air(FP8) | ~110GB | ~130GB | 1×H200 / 2×H100 | ~¥50-80万 |
| 腾讯 Hy3(FP8) | ~300GB | ~360GB | 4×H200(可跑)/ 8 卡(官方建议) | ¥160-270万 |
| MiniMax M3(MXFP8) | ~444GB | ~530GB | 4×H200(可跑)/ 8 卡(完整 1M) | ¥160-270万 |
| GLM-5.3(FP8) | ~756GB | ~893GB | 1 台 8×H200(1128GB) | ¥270万 |
| DeepSeek-V4-Pro(FP4+FP8) | ~865GB | ~1040GB | 8×H200(86K 上下文)/ 8×B200(满 1M) | ¥270-370万 |
| Kimi K3(MXFP4) | ~1.56TB | ~1680GB | 8×B300(2304GB)单机 | ¥380-450万 |
| Qwen3.8-2.4T(BF16) | ~4.89TB | ~5.9TB | 3 台 8×B300(24 卡) | ¥1200-1300万 |
| Mistral Small 4(对照) | — | — | 2×H200 | ¥80-100万 |
注意三个"反直觉":
- Qwen3.8(2.4T)比 Kimi K3(2.8T)参数小,部署却贵 4 倍——因为它官方只放了 BF16 权重,而 K3 原生 MXFP4。等官方低精度版出来成本会骤降;
- “支持 1M 上下文"≠"你的机器能开 1M”——8×H200 跑 DeepSeek-V4-Pro 官方配方上下文上限约 86K,满 1M 需要 8×B200;
- 这只是能加载运行的最低账,不含机房、电费、制冷、网络、运维;多用户高并发还需 PD 分离、多副本,成本数倍增加。
6.5 推理框架选择
| 框架 | 适用 | 特点 |
|---|---|---|
| Ollama | 个人/入门 | 一行命令跑模型(ollama run qwen3:30b-a3b),GGUF 量化,最简单 |
| LM Studio | 个人 | 图形界面,适合完全不想碰命令行 |
| llama.cpp | 个人/边缘 | GGUF 生态底层,CPU/GPU 混合,量化最全 |
| vLLM | 生产服务 | 事实标准,PagedAttention,吞吐高;各厂商官方配方多用它 |
| SGLang | 生产 | 高吞吐 + 投机解码(EAGLE),GLM/Qwen 官方推荐 |
| LMDeploy | 生产 | 国产(上海AI Lab),昇腾/国产卡适配好 |
| TensorRT-LLM | NVIDIA 生产 | 极致性能,工程门槛高 |
| MindIE | 昇腾 | 华为推理引擎,昇腾部署首选 |
| KTransformers | 稀缺硬件 | CPU+GPU 混合跑大 MoE(如单机跑 DeepSeek-671B) |
6.6 一条经验法则总结
显存决定你能不能跑,带宽决定你跑多快,激活参数决定你的 token 成本;量化(Q4)是本地部署的默认答案;MoE 的"总参数"才是你买显卡的依据。
第七章 选型指南:按场景、预算直接抄答案
7.1 按使用场景
| 你的需求 | 首选 | 备选 | 理由 |
|---|---|---|---|
| 零成本体验 AI | 豆包 App + GLM-4-Flash(API) | DeepSeek 官方网页 | 免费额度最大 / API 永久免费 |
| 综合性价比之王 | DeepSeek V4 | MiniMax M2 系 | 地板价 + 第一梯队推理 + 开源 |
| 长文档/论文/法律/代码库分析 | Kimi K3 | DeepSeek-V4(1M) | 1M 上下文 + 原生多模态 |
| 写代码/Agent/自动化 | GLM-5.x / DeepSeek-V4 / Qwen3.8 | Kimi K2 Thinking | 三选一都不会错;预算低选 DeepSeek,项目大选 GLM |
| 中文写作/办公 | 豆包 / 文心 / 混元+WorkBuddy | Qwen-Plus | 最懂中文办公场景 |
| 视频/语音/音乐创作 | MiniMax 海螺/H3 | 混元视频、Seedance | 多模态产品化最强 |
| 端侧/隐私/离线 | Qwen3.5-Small / MiniCPM | Qwen3-30B-A3B(工作站) | 数据不出设备 |
| 企业私有化(数据不出内网) | Qwen3 全尺寸矩阵 / GLM(MIT) | DeepSeek、混元 Hy3 | 许可证干净 + 尺寸全 |
7.2 按预算(自部署)
| 预算 | 能部署什么 | 方案 |
|---|---|---|
| ¥0(纯 CPU/老电脑) | 1.5B~7B Q4 | Ollama + llama.cpp,CPU 也能跑 7B(慢) |
| ¥5,000-10,000 | 13B Q4 / 30B-A3B Q4 | 二手 RTX 3090 24GB |
| ¥15,000-30,000 | 32B Q4~Q8 / 双卡 70B Q4 | RTX 4090/5090,或双 3090 |
| ¥50,000-100,000 | 70B Q4 完整 + 128K 上下文 | RTX Pro 6000 96GB / 2×A6000 |
| ¥80-150万 | GLM-4.5-Air/百B级 MoE 满血 | 1-2×H200 级服务器(或 8×昇腾910B) |
| ¥160-270万 | 混元 Hy3 / MiniMax M3 满血旗舰 | 4-8×H200 / 等效昇腾集群 |
| ¥270-450万 | GLM-5.3 / DeepSeek-V4-Pro / Kimi K3 满血 | 8×H200 ~ 8×B300 |
| ¥1200万+ | Qwen3.8-2.4T 满血 | 3×(8×B300) + 高速互联 |
7.3 API vs 自建:一条决策线
先 API,后小模型,最后才旗舰集群。
- 第一档(绝大多数人永远停在这里):调用量不稳定、团队小、模型更新快 → 用 API,随时换供应商,零运维;
- 第二档:数据不能出内网 → 先自部署 27B/32B/30B-A3B/70B/小型 MoE,写作/知识库/客服/分类未必需要千亿模型;把评测集做好比盲目追求满血重要;
- 第三档(同时满足才考虑买旗舰硬件):①合规/数据主权强约束 ②任务确实需要旗舰能力 ③调用量长期稳定且足够大 ④有推理优化与运维能力 ⑤能接受"半年后不再是最新旗舰"的折旧。
第八章 新人快速上手路线图(实操版)
第 1 步:建立认知(第 1 周)
- 读懂本文第一章的 12 个概念(尤其 Dense/MoE、量化、显存公式);
- 注册体验:豆包、Kimi、DeepSeek、通义、智谱清言 各聊 10 轮,感受差异。
第 2 步:跑起第一个本地模型(第 2 周)
一台普通电脑(8GB 显存或纯 CPU)即可:
# 安装 Ollama(官网一键安装)后:
ollama run qwen3:4b # 4B,入门
ollama run qwen3:8b # 8GB 显卡可跑
ollama run qwen3:30b-a3b # 24GB 显卡的甜点,激活仅 3B,速度飞快
浏览器打开 http://localhost:11434 即有 OpenAI 兼容 API,可接 Dify/Cherry Studio 等界面。
第 3 步:调第一次 API(第 3 周)
# 智谱 GLM-4-Flash(免费)示例
curl https://open.bigmodel.cn/api/paas/v4/chat/completions \
-H "Authorization: Bearer 你的APIKey" \
-H "Content-Type: application/json" \
-d '{"model":"glm-4-flash","messages":[{"role":"user","content":"介绍一下MoE"}]}'
每家 API 都是 OpenAI 兼容格式,换个 base_url 和 key 就能迁移——所以不要在代码里写死任何一家。
第 4 步:生产化部署(第 1-2 个月)
# vLLM 部署 Qwen3-30B-A3B(双卡示例)
pip install vllm
vllm serve Qwen/Qwen3-30B-A3B \
--tensor-parallel-size 2 \
--enable-reasoning --reasoning-parser deepseek_r1
学三件事:PagedAttention 原理(知道为什么吞吐高)、KV Cache 占用估算、量化格式(AWQ/GPTQ/GGUF)怎么选。
第 5 步:选定你的"主力组合"
参照第七章选型表,形成:日常 API(便宜档)+ 隐私本地模型 + 专项模型(视频/语音)的三层组合。
附录 A 术语速查表
| 术语 | 一句话解释 |
|---|---|
| LLM | 大语言模型 |
| B | Billion,十亿参数 |
| T | Trillion,万亿参数 |
| Dense / 稠密 | 全参数参与每 token 计算 |
| MoE / 混合专家 | 每 token 只路由到部分专家;总参数决定显存,激活参数决定算力 |
| A(如 A22B) | MoE 每 token 激活的参数量 |
| Token | 模型处理文本的最小单位;1 汉字≈0.6-1 token |
| 上下文窗口 | 一次对话能容纳的最大 token 数 |
| KV Cache | 推理时缓存的注意力状态,随上下文线性吃显存 |
| MLA | 多头潜在注意力(DeepSeek 首创,KV 压缩 93%+) |
| DSA/KDA/MSA | 各家稀疏/线性注意力变体,长上下文降本核心 |
| 思考模式/CoT | 先推理后作答的慢思考 |
| RL/RLVR | 强化学习/可验证奖励强化学习,推理能力训练法 |
| FP16/BF16 | 半精度,每参数 2 字节,官方原生格式 |
| FP8/INT8 | 每参数 1 字节,旗舰官方低精度格式 |
| INT4/Q4/AWQ/GPTQ/GGUF | 每参数 0.5 字节的量化格式,本地部署默认 |
| MXFP4/MXFP8 | 微缩浮点格式,K3/V4/M3 训练期即采用 |
| MTP | 多 token 预测,推理加速 |
| SWE-bench Verified | 真实软件工程修复基准,代码 Agent 金标准 |
| 开放权重 | 可下载权重自行部署;许可证条款需逐一核对 |
| Apache 2.0 / MIT | 最宽松的商用友好许可证 |
| PD 分离 | 预填充与解码分离部署,高并发架构 |
| 昇腾/CANN | 华为 AI 芯片及其软件栈(CUDA 之外的国产生态) |
| 超节点 | 数百卡全互联成一"台"机器(如 CloudMatrix 384) |
附录 B 信息来源与时效性说明
- 本文数据综合自:各厂商官方发布/模型卡/技术报告(Qwen 官方文档与博客、DeepSeek 官方 API 文档、智谱 bigmodel 开放平台、Hugging Face 模型卡、腾讯混元官网、MiniMax 官网)、Wikipedia/arXiv 综述、以及 2026 年 6-9 月的多篇第三方深度评测与产业分析(含服务器公开报价、昇腾产业口径等)。
- 大模型行业以"周"为单位变化:参数、上下文、价格、许可证都可能随时更新;旗舰发布后通常数周内就有权重、数月内有社区量化版。做采购/选型决策前,务必到官方渠道核对最新数字。
- 部分数字(如满血部署成本)为基于公开权重的整机估算,不含税费、机房与运维,不同渠道报价差异可达 ±30%。
- 文中"能力对比"均为公开基准/口径下的量级参考,榜单不等于你的业务效果,落地前请用自己的评测集实测。
350

被折叠的 条评论
为什么被折叠?



