国内主流厂商各参数量级大模型调研

本文定位:一份面向零基础新人的、全面系统的国产主流大模型调研文档,方便快速学习上手。
信息截至:2026 年 9 月(模型迭代极快,具体参数与价格请以各厂商官方最新公告为准)。
覆盖厂商:阿里通义千问(Qwen)、深度求索(DeepSeek)、智谱(Z.ai / GLM)、月之暗面(Kimi)、腾讯混元(Hunyuan)、MiniMax,以及字节豆包、百度文心等其他主流玩家。
核心内容:基础概念扫盲 → 厂商与模型谱系全景 → 参数量级横向对比 → 部署硬件完全指南 → 选型与上手路线。


在这里插入图片描述

目录


第一章 零基础必读:看懂大模型的核心概念

如果你是第一次接触大模型,请务必先读完本章。后面所有章节的内容,都建立在这十几个概念之上。

1.1 什么是大语言模型(LLM)?

大语言模型(Large Language Model)是一种通过海量文本训练出来的 AI 程序。它的本质工作是预测下一个词(token)——听起来简单,但当模型规模足够大、训练数据足够多时,"预测下一个词"就涌现出了翻译、写作、写代码、数学推理、多轮对话等复杂能力。

我们平时说的 “Qwen3-32B”、“DeepSeek-V3”,指的就是一个个具体的模型(权重文件),就像一个个不同规格的"大脑"。把模型下载/部署到你的电脑或服务器上,才能让它为你干活。

1.2 参数量(B):模型的"脑容量"

  • 参数(Parameters) 是模型内部可以被训练的数值权重,数量以 B(Billion,十亿) 为单位。
  • 参数量粗略决定了模型的能力上限:参数越多,"记住"的知识和模式越多,能力通常越强——但显存/内存占用也越大、推理成本越高
  • 常见档位直观感受(以 2025-2026 年国产模型为参照):
    • 0.5B~4B:手机/开发板可跑,做简单问答、摘要、分类;
    • 7B~14B:一台游戏电脑可跑,日常对话、写作够用;
    • 30B~72B:单张 24GB 显卡到多卡工作站,接近 GPT-4 级的体验;
    • 100B~700B+(多为 MoE):数据中心级别,旗舰智能;
    • 1T~3T(万亿级 MoE):顶级厂商的旗舰,如 Kimi K3(2.8T)、Qwen3.8(2.4T)、DeepSeek-V4-Pro(1.6T)。

1.3 Dense(稠密)vs MoE(混合专家):最重要的架构分水岭

这是当前理解大模型最关键的一个概念。

Dense(稠密)模型

每个 token 的计算都会经过全部参数。比如 Qwen3-32B,每生成一个 token 都要做 320 亿参数量的计算。特点是:结构简单、小尺寸下性价比好、部署门槛低。

MoE(Mixture-of-Experts,混合专家)模型

把模型拆成很多个"专家"子网络,每个 token 只路由到其中一小部分专家去计算。

  • 总参数(Total Params):所有专家加起来的参数总量,决定"要多少显存把整个模型装下"——所有专家的权重都必须常驻显存;
  • 激活参数(Active Params,记作 A):每个 token 实际参与计算的参数量,决定"算得快不快、推理成本高不高"。

一句话记住:总参数决定"要带多少书上车",激活参数决定"这一秒翻开多少本书"。

例如 DeepSeek-V3:总参数 671B,激活 37B——它的"知识容量"相当于 671B 的 Dense 模型,但计算量只相当于 37B 模型。所以 MoE = 大容量 + 低计算成本,代价是显存必须按总参数来配

MoE 的表示法:Qwen3-235B-A22B 读作"总参数 235B、每 token 激活 22B"。

为什么国产大模型几乎清一色 MoE? 因为它把"能力"和"推理成本"解耦了:中国厂商普遍走"超大总参数 + 超小激活参数"路线(如 MiniMax M2:230B 总参/A10B 激活,不到 5% 激活率),用架构换性价比。

1.4 上下文窗口(Context Window)与 Token

  • Token 是模型处理文本的最小单位,1 个中文汉字 ≈ 0.6~1 个 token,1 个英文单词 ≈ 1.3 个 token。
  • 上下文窗口是模型一次能"记住"的最大 token 数,决定你能一次性塞给它多长的资料。
    • 早期模型:4K~32K(约一本书的几页到几十页);
    • 2025 年主流:128K~256K(约一本 30 万字的书);
    • 2026 年旗舰:1M(百万 token)——整个代码库、几十本资料一次喂入。Kimi K3、DeepSeek-V4、Qwen3.8、MiniMax M3、GLM-5.2 均已达 1M 级。
  • 注意"支持 1M"≠"你的硬件能开到 1M":超长上下文会消耗巨量显存(KV Cache),后文第六章详述。

1.5 思考模式(Thinking/推理模型)

2025 年以来,主流模型分化出两种工作模式,并逐渐合体为单模型双模式:

  • 非思考模式(快思考):直接回答,适合简单问题,延迟低;
  • 思考模式(慢思考/推理):先输出一段内部推理过程(思维链 CoT),再给答案,适合数学、代码、复杂逻辑。代表起点是 OpenAI o1 和 DeepSeek-R1(2025 年 1 月,以 RL 强化学习训练出推理能力,震动全球)。

现在的 Qwen3、GLM-4.5、DeepSeek-V3.1+ 等都支持在同一个模型内无缝切换两种模式。

1.6 多模态

  • 理解型多模态(输入):能看图/视频/听音频,如 Kimi K3(原生视觉)、MiniMax M3(文本+图像+视频)、豆包 Seed 系列;
  • 生成型多模态(输出):文生图(腾讯 HunyuanImage、字节即梦)、文生视频(混元视频、海螺 Hailuo、Seedance)、文生 3D(混元 3D)、语音(Speech、讯飞)。
  • 原生多模态:从预训练第一刻就混合图文视频一起训(如 Kimi K3、MiniMax M3),而不是先训好文本再"外挂"视觉模块,效果和成本都更优。

1.7 量化(Quantization):省显存的核心手段

模型权重默认用 BF16/FP16(每参数 2 字节)存储。量化 = 用更少比特存权重,精度略降但显存大降:

精度每参数字节数显存(FP16 的)质量损失使用场景
FP324 字节200%训练(已少用)
FP16 / BF162 字节100%(基线)官方原生精度、微调
FP81 字节50%几乎无2025-26 旗舰官方格式(H100/H200/昇腾950 原生支持)
INT8 / Q81 字节50%极小高精度需求本地部署
INT4 / Q4(AWQ/GPTQ/GGUF)0.5 字节25%小(保留 95~98% 质量)本地部署最主流
Q2/Q30.25~0.375 字节~12%明显极限塞卡,不推荐

2026 年的新趋势:厂商从训练阶段就用量化感知训练(QAT)——Kimi K3 原生 MXFP4 权重、DeepSeek-V4-Pro 官方 FP4+FP8 混合权重、MiniMax M3 官方 MXFP8。低精度不再是"民间阉割",而是官方形态,这直接大幅降低了私有化部署门槛。

1.8 显存与 KV Cache:能不能跑起来,看显存

推理时显存占用 = 模型权重 + KV Cache + 激活值 + 框架预留,其中:

  • 模型权重是固定大头:显存(GB) ≈ 参数量(B) × 每参数字节数;
  • KV Cache 随上下文长度线性增长:70B 模型 4K 上下文约 2GB,128K 上下文可达 64GB(未压缩时)。这是"买显卡时最容易漏算的一项"。

第六章有完整的计算公式和速查表。

1.9 开源 / 开放权重 / 闭源,与许可证

  • 闭源:只通过官方 API/APP 提供,拿不到权重,如豆包(Seed 2.0)、Qwen-Max、百度文心大部分;
  • 开放权重(俗称开源):权重可从 Hugging Face / ModelScope 下载自行部署,但许可证条款各不相同:
    • Apache 2.0 / MIT:最宽松,商用几乎无限制——Qwen3 全系、GLM-4.5/5.x(MIT)、ERNIE 4.5(Apache)、混元部分模型;
    • 自定义许可证:如 Qwen3.8-2.4T(年收入超 5000 万美元的模型服务商需向阿里另获商用授权)、Kimi K3 License、MiniMax Model License——企业商用前务必读条款;
    • Modified MIT(K2.5 等):基本宽松,带少量附加条件。

1.10 训练 vs 推理 vs 微调

  • 预训练(Pre-training):从零训练,烧钱指数级(DeepSeek-V3 约 558 万美元,已经算极致省钱);
  • 后训练(SFT + RL):在基座上教会模型对话/推理/工具调用;
  • 推理(Inference):日常使用,本调研的重点;
  • 微调(Fine-tuning):用自有数据定制模型。LoRA 微调只训练极小的附加矩阵,是个人/小团队唯一现实的方案;全参微调显存需求约等于训练,普通人玩不起。

第二章 2026 年国产大模型格局总览

2.1 玩家分层(截至 2026 年 9 月)

梯队玩家特点
第一梯队(超级巨头)字节豆包、阿里千问 Qwen、腾讯混元、百度文心有钱、有场景、有流量入口,云生态强
第二梯队(明星独角兽)DeepSeek、月之暗面 Kimi、智谱 GLM、MiniMax技术激进、开源先锋、全球话题中心
第三梯队(大厂系/垂直)讯飞星火、阶跃星辰 Step、昆仑万维天工、商汤日日新、百川垂直行业纵深(教育/医疗/政企/视觉)
第四梯队(学术/端侧)上海 AI Lab 书生 InternLM、面壁 MiniCPM、零一万物 Yi学术强、端侧小模型强

2.2 2026 年的五大技术趋势(理解了它们就看懂了所有发布会)

  1. 万亿参数 + 超低激活率:旗舰普遍 1.6T~2.8T 总参数,激活仅 21B~104B。"总参卷到 3T、激活压到 5%"是共同方向。
  2. 百万 token 上下文成为旗舰标配:Kimi K3、DeepSeek-V4、Qwen3.8、MiniMax M3 均达 1M;实现手段是各种稀疏/线性注意力(DeepSeek DSA、Kimi KDA、MiniMax MSA、Qwen Gated DeltaNet)。
  3. 原生多模态:Kimi K3、MiniMax M3 从预训练就混合图文视频;豆包 Seed 1.8/2.0 支持 GUI 操作和上千帧视频理解。
  4. Agent(智能体)成为能力指挥棒:所有旗舰都在卷"长程任务、连续工具调用、多智能体协作"(Kimi Agent Swarm 300 子代理、混元 Hy3 办公/金融 Agent、GLM-5.x 长程编码)。
  5. 低精度官方化:MXFP4/MXFP8/FP8 权重从训练期就设计(K3、V4、M3),配合国产芯片适配(DeepSeek-V4 适配华为昇腾 950PR),私有化部署成本从"一栋楼"降到"一辆豪车"。

2.3 一张表看懂六大厂商旗舰(2026 年 9 月)

厂商当前旗舰总参数激活上下文开放权重许可证
月之暗面Kimi K3(2026-07)2.8T104B1M✅(07-27 放出)Kimi K3 License
阿里Qwen3.8-2.4T-A95B(2026-08-12)2.4T95B262K(可扩~1M)自定义(大厂需授权)
深度求索DeepSeek-V4-Pro(2026-08 GA)1.6T49B1M类 MIT/自定义
智谱GLM-5.3(2026-08-14)~744B40B200K~1M(5.2)MIT
MiniMaxMiniMax M3(2026-06)~428B~23B1M开放权重
腾讯混元 Hy3-preview(2026-04)295B21B256K✅(BF16/FP8)开放

可以看到:参数量从大到小差 10 倍,但"智能"差距远没有 10 倍——架构效率和训练质量比堆参数更重要,这也是 GLM(744B)和混元(295B)敢于主打"性价比部署"的底气。


第三章 六大主流厂商深度调研

每家厂商按统一结构展开:公司背景 → 发展时间线 → 模型谱系全景表 → 架构特点 → 开源与许可证 → API 参考价 → 优劣势与适用场景

3.1 阿里 · 通义千问 Qwen 系列

公司背景

阿里通义实验室出品,国内开源生态最完整、尺寸矩阵最全的厂商(从 0.5B 到 2.4T 全覆盖),Hugging Face 累计下载量全球前列,Apache 2.0 开源传统好。依托阿里云百炼平台,企业接入友好。

发展时间线

时间里程碑
2023-08Qwen-7B 首次开源
2024-06Qwen2 系列(0.5B~72B)
2024-09Qwen2.5 系列(0.5B/1.5B/3B/7B/14B/32B/72B + Coder/Math/VL)
2025-04Qwen3:六dense + 两MoE,思维/非思维双模式
2025-07Qwen3-2507 升级版 + Qwen3-Coder-480B-A35B(256K→1M)
2026-02Qwen3.5:全新混合架构(状态空间 + MoE)
2026-02Qwen3-Coder-Next(80B-A3B,DeltaNet 混合注意力)
2026-04Qwen3.6-27B / 35B-A3B(Apache 2.0)
2026-07/08Qwen3.8-Max(2.4T-A95B)云端上线,08-12 开放权重;08-14 补发 Apache 2.0 的 Qwen3.8-27B

模型谱系全景(按参数量级,⭐=最具代表性)

开源 Dense(稠密)系列 —— 端侧到单卡服务器

模型参数量上下文发布特点与定位
Qwen3-0.6B / 1.7B / 4B0.6~4B32K~128K2025-04手机/边缘设备,4B 可对标 Qwen2.5-14B
Qwen3-8B / 14B / ⭐32B8~32B128K2025-04本地部署甜点区;32B≈上代 72B 的能力
Qwen2.5-72B72B128K2024-09上代单机旗舰,仍有大量存量使用
Qwen3.5-Small 系列0.8B / 2B / 4B / 9B2026-033.5 代轻量,量化感知训练,主打端侧低延迟
Qwen3.5-27B / Qwen3.6-27B27B长上下文2026201 语言覆盖;3.6 支持"思考保留"
Qwen3.8-27B27B长上下文2026-08-14Apache 2.0,含图像输入与非思考模式

开源 MoE 系列 —— 数据中心级

模型总参/激活上下文发布特点
⭐Qwen3-30B-A3B30B / 3B128K2025-04本地部署神器:激活仅 3B,消费级显卡可跑,性能超 QwQ-32B
Qwen3-235B-A22B235B / 22B128K→1M2025-04上代开源旗舰
Qwen3-Coder-480B-A35B480B / 35B256K→1M2025-07仓库级代码生成
Qwen3.5-35B-A3B35B / 3B2026-02早期融合多模态
Qwen3.5-122B-A10B122B / 10B2026-02中高配 MoE
Qwen3-Coder-Next80B / 3B长上下文2026-02DeltaNet+门控注意力,SWE-Bench Verified 70.6%
⭐Qwen3.5-397B-A17B397B / 17B2026-023.5 代开源旗舰,混合状态空间架构
Qwen3.8-2.4T-A95B2.4T / 95B262K(→~1M)2026-08-12当代开源旗舰,官方 BF16 权重约 4.89TB

闭源 API 系列:Qwen3-Max(>1T,2025)→ Qwen3.5-Plus → Qwen3.6-Plus → Qwen3.7-Max/Plus → Qwen3.8-Max(2.4T,2026-08)。商用走阿里云百炼,Turbo/Plus/Max 三档梯度定价。

架构特点

  • Qwen3:标准 Transformer + 细粒度 MoE + 思考/非思考混合训练(四阶段后训练);36T token、119 种语言。
  • Qwen3.5 起的重大转向:用 Gated DeltaNet(门控 Delta 状态空间网络)替代部分层的自注意力,实现序列线性复杂度 + 稀疏 MoE,是国产厂商中较早把"注意力混合架构"规模化的;多模态采用早期融合(Early Fusion)。
  • Qwen3.8:512 个专家,每 token 激活 10 个路由专家 + 1 个共享专家;旗舰开源版省略了图像输入与非思考模式(闭源云端版才有)。

开源与许可证

  • Qwen3/Qwen3.5/Qwen3.6/Qwen3.8-27B:Apache 2.0,商用宽松;
  • Qwen3.8-2.4T-A95B:自定义许可证,年收入超 5000 万美元的模型服务商需获得阿里商用授权——个人和一般企业不受影响。

API 参考价(元/百万 token,输入侧,2026 年公开价,以官网为准)

  • Qwen-Turbo ≈ 0.3;Qwen-Plus ≈ 0.8~4;Qwen-Max / 3.8-Max ≈ 20~100(旗舰档)。

优劣势速览

  • ✅ 尺寸矩阵最全(0.6B~2.4T 一站配齐)、开源传统最好、阿里云生态、中英双语双强、Qwen3-30B-A3B 这类"激活小 MoE"是本地部署性价比之王;
  • ❌ 旗舰 Max 价格偏高;版本迭代快、接口偶有变动;旗舰开源检查点仍为 BF16(暂无官方低精度版),自部署显存开销为各家最大。

适用场景

企业级应用与私有化全栈、开发者 API 集成、端侧部署(Qwen3.5-Small)、本地 MoE 部署(30B-A3B)、中英双语业务。


3.2 深度求索 · DeepSeek 系列

公司背景

2023 年由量化基金幻方科技创始人梁文峰创立,研究型实验室风格(团队约百余人),以"低成本 + 极致架构创新 + 彻底开源"著称。2025 年 1 月 R1 发布引发全球震动(被誉为"AI 界的斯普特尼克时刻",当日英伟达股价大跌)。V3 训练成本仅约 558 万美元,是 GPT-4 级性能的约 1/20 成本。2026 年在 OpenRouter 等平台调用量居开源模型前列。

发展时间线与全谱系

时间模型总参/激活上下文关键点
2024-01DeepSeek LLM 67B67B Dense4K对标 Llama2-70B
2024-01DeepSeek-MoE145B / 22B4K国内首个开源 MoE
2024-05DeepSeek-V2236B / 21B128K首创 MLA + DeepSeekMoE,API 价格战(对标模型 1/70 价格)
2024-09V2.5 / Coder-V2236B / 21B(Coder Lite 16B-A2.4B)128K合并升级
2024-12DeepSeek-V3671B / 37B128K无辅助损失负载均衡、MTP 多 token 预测、FP8 训练,对标 GPT-4o
2025-01DeepSeek-R1671B / 37B128K纯 RL 训出推理能力,MIT 开源;蒸馏全家桶:Qwen 1.5B/7B/14B/32B + Llama 8B/70B
2025-03V3-0324671B / 37B128KV3 升级
2025-05R1-0528685B / 37B128KAIME 87.5%,对标 o3/Gemini-2.5-Pro
2025-08V3.1 / Terminus685B / 37B128K思考/非思考统一
2025-09V3.2-Exp685B / 37B128KDSA 稀疏注意力(长上下文成本大降);V3.2-Speciale 达 IMO/IOI 金牌级
2026-04DeepSeek-V4(预览)Pro:1.6T/49B;Flash:284B/13B1MCSA+HCA 混合压缩注意力、FP4+FP8 官方混合权重、适配华为昇腾 950PR
2026-08V4 正式版(Flash-0731 / Pro-0813)同上1MGA 版本,SWE-bench Verified 约 80%+(早期口径 80.6%)

其他专项模型:DeepSeek-VL2(视觉)、DeepSeek-OCR(2025-10,1B)、DeepSeekMath-V2(2025-11)、DSpark 推理加速框架(2026-06)、DeepSeek Harness Agent 平台(2026-08)。

架构特点(国产架构创新的"发动机")

  • MLA(多头潜在注意力):V2 首创,KV Cache 压缩超 93%,后成为 Kimi 等各家事实标准;
  • DeepSeekMoE 细粒度专家:Qwen、GLM 等均追随此设计;
  • MTP(多 token 预测):一次算多个 token,推理加速;
  • DSA(DeepSeek 稀疏注意力,V3.2):细粒度稀疏注意力,长上下文训练推理成本大降,是 V4 百万上下文的基石;
  • V4 的"账房思维":官方直接发 FP4+FP8 混合权重(约 865GB),配合压缩注意力,让 1.6T 模型一台 8 卡 B200 服务器就能跑满 1M 上下文——把"开源旗舰私有化成本"从数千万元打到三百万元级

开源与许可证

V3/R1 系 MIT;V4 描述为"开源"但商用前建议核对具体条款。R1 蒸馏小模型(基于 Qwen/Llama)同时继承上游许可。

API 参考价(2026 年,美元/百万 token)

  • V4-Flash:输入 $0.14 / 输出 $0.28(缓存命中输入仅 $0.0028)——分类、抽取、日常编码的默认选择;
  • V4-Pro:输入 $0.435 / 输出 $0.87(缓存命中 $0.003625);
  • 网页版/App 对个人免费;并发限额 Flash 2500 / Pro 500;
  • 旧接口 deepseek-chat / deepseek-reasoner 已于 2026-07 停用,需迁移新 model ID。

优劣势速览

  • ✅ 全行业性价比地板("百万上下文 1 元起"宣传口径)、推理/代码第一梯队、彻底开源、中文母语级语感、官方应用免费;
  • ❌ 多模态偏弱(V4 仍以文本/代码为主)、高峰期服务波动、无自有办公/流量入口、生态整合弱。

适用场景

预算敏感团队的首选底座、企业私有化部署、Agent/Agentic Coding、数学与竞赛编程、高吞吐 API 业务。


3.3 智谱 · GLM 系列

公司背景

2019 年从清华大学 KEG 实验室孵化(创始人唐杰、李娟祯;CEO 张鹏),2025 年中启用国际品牌 Z.ai。累计融资约 15 亿美元(阿里、腾讯、小米、美团等参投),估值约 300~400 亿元人民币,计划 2026 年港股 IPO。开源模型全球累计下载超 4000 万次,MIT 许可证 + "参数效率"是其招牌

发展时间线与谱系

时间模型总参/激活上下文关键点
2022GLM-130B130B Dense国内最早开源的千亿模型
2023-03ChatGLM-6B6B国内本地部署启蒙模型
2024GLM-4 / GLM-4-9B9B 开源128KGLM-4-Flash API 永久免费
2025-07GLM-4.5355B / 32B128KMIT;12 项基准全球第 3;Agent/Coding 定位
2025-07GLM-4.5-Air106B / 12B128KMIT;单张 H200 可跑 FP8 版
2025-09GLM-4.6355B / 32B200K真实编码/Agent 大幅增强
2025-12GLM-4.7旗舰文本模型(API 线)
2026-02GLM-5744B / —200KDSA 机制,Agent 工程设计
2026-04GLM-5.1744B / 40B国产算力适配、长程任务
2026 中GLM-5.2~745B / 44B1M(无损)主打长程 Coding Agent;MIT
2026-08-14GLM-5.3~744B / 40B200K+FP8 权重约 756GB;vLLM 官方最低显存预算约 893GB(8×H200 单机可跑)

产品矩阵:GLM(旗舰)/ Air(轻量)/ AirX(极速)/ Flash(免费)/ X(高性能);另有 CodeGeeX 编程助手、GLM-4V 视觉、CogView 文生图、清言 App。

架构与部署特点

  • 核心理念:更高参数效率——GLM-4.5 用 DeepSeek-R1 一半、Kimi-K2 三分之一的参数达到可比性能,处于"性能/参数比"帕累托前沿;
  • 官方给出极清晰的部署配方(在开源厂商中最友好),例如 GLM-4.5:
    • BF16:H100×16 或 H200×8;FP8:H100×8 或 H200×4;
    • 吃满 128K 上下文:BF16 H200×16 / FP8 H200×8;
    • GLM-4.5-Air FP8:单张 H200 即可;微调:H20×16(LoRA)/ H20×128(SFT);
  • GLM-5.x 延续"一台 8 卡 H200 服务器 = 完整旗舰"的最干净部署故事(GLM-5.3 FP8 约 756GB + 运行空间 ≈ 893GB < 8×H200 的 1128GB)。

API 参考价

  • GLM-4-Flash:0 元(永久免费)——全网最有名的白嫖款;
  • GLM-4.5:输入约 0.8 元/百万 token、输出约 2 元;Air/AirX 更低;旗舰 5.x 约 4~20 元档。

优劣势速览

  • ✅ MIT 开源最干净(商用零顾虑)、参数效率与部署成本优势、长程编码 Agent 第一梯队、CodeGeeX/Agent 生态成熟、免费 Flash;
  • ❌ 通用对话知名度低于豆包/DeepSeek、旗舰 API 不算便宜、多模态(尤其视频)布局弱。

适用场景

程序员与 AI 编程工具、企业私有化(许可证无风险)、内部知识库 + Agent 自动化、预算有限但想要旗舰能力的自部署团队。


3.4 月之暗面 · Kimi 系列

公司背景

2023 年 3 月由杨植麟创立,以长文本起家(Kimi Chat 2023 年 10 月支持 20 万字上下文,一战成名)。2025 年凭 K2 进入开源第一梯队,2026 年 7 月 K3 成为全球首个开放权重的 3T 级模型,是当前全球开源社区热度最高的中国厂商之一。

发展时间线与谱系

时间模型总参/激活上下文关键点
2023-10Kimi Chat20 万字长文本起家
2025-01Kimi k1.5128K多模态推理(长上下文 RL)
2025-04Kimi-VL16B / 2.8B128K开源视觉语言 MoE
2025-06Kimi-Dev72BSWE-bench 开源 SOTA(代码专用)
2025-07Kimi K21.04T / 32B128K→256K384 专家(8 路由+1 共享)、61 层;MuonClip 优化器;15.5T token;Modified MIT
2025-09K2-Instruct-09051T / 32B256K编码/Agent 强化
2025-11K2 Thinking1T / 32B256K深度推理;200~300 次连续工具调用;SWE-bench Verified ~71%
2026-01K2.51T / 32B256K原生多模态 + Agent Swarm(百级子代理);Modified MIT
2026-04K2.61T / 32B262K长程编码;Swarm 可协调 300 子代理/4000 步
2026-07-16Kimi K32.8T / 104B1,048,576(1M)原生多模态(MoonViT-V2 视觉编码器);07-27 开放权重

Kimi K3 架构详解(2026 年开源标杆)

  • 规模:2.8T 总参、每 token 激活 104B、93 层、896 个路由专家(每 token 选 16)+ 2 个共享专家;
  • Kimi Delta Attention(KDA):约 69 层用线性复杂度的 KDA + 24 层门控 MLA 周期性插入——这是 1M 上下文能实际推理的关键;
  • Attention Residuals(AttnRes):跨层选择性残差,增强长链推理一致性;
  • Stable LatentMoE:归一化感知门控 + 负载均衡约束,超高稀疏 MoE 稳定训练;
  • 原生 MXFP4 权重 / MXFP8 激活(量化感知训练),官方权重约 1.56TB;vLLM 官方最低显存预算约 1680GB;
  • API 定价 $3 / $15 每百万 token(缓存命中输入 $0.30;Mooncake 架构下 coding 负载缓存命中率超 90%)。

优劣势速览

  • ✅ 长文本天花板(1M 上下文 + 原生多模态)、开源尺度最激进(3T 级全球首例)、推理/代码/长文档分析顶级、Kimi App 搜索+长文整理口碑好;
  • ❌ 2.8T 参数自部署需要顶级集群(8×B300 级别,约 380~450 万元起),普通企业玩不起;输出偶显冗长;旗舰 API 定价中上。

适用场景

长文档/学术/法律/代码库分析、要尝鲜顶级开源模型的技术团队、多模态长程 Agent。


3.5 腾讯 · 混元 Hunyuan 系列

公司背景

腾讯的全栈大模型体系:文本(混元 LLM)+ 图像(HunyuanImage)+ 视频(HunyuanVideo)+ 3D(Hunyuan3D)+ 翻译(Hy-MT)+ 世界模型。依托微信/QQ 入口、腾讯云和元宝/ima/WorkBuddy 应用矩阵。特点是多模态布局最全面、API 低价走量,但榜单声量和开源激进程度弱于独角兽。

发展时间线与谱系(文本线)

时间模型总参/激活上下文关键点
2023-09混元 v1100B+ Dense首代;曾开源 7B/4B/1.8B/0.5B 小模型
2024-11Hunyuan-Large389B / 52B256K(预训练)/128K当时最大开源 Transformer-MoE;GQA+CLA 压缩 KV ~95%
2025-02Hunyuan-TurboS560B / 56BMamba2 + Attention + MoE 混合架构,16T token,快慢思考
2025-03Hunyuan-T1—(52B 激活级)256K深度推理(96.7% 后训练算力用于 RL)
2025 年中Hunyuan-A13B80B / 13B256K开源混合推理(快/慢思考切换),hunyuan-standard-256K 升级线
2025-12混元 2.0406B / 32B256KThink/Instruct 双版本;SWE-bench 53.0%,τ²-Bench 72.4
2026Hy-MT2 翻译1.8B Dense + 30B-A3B33 语种 WMT25 SOTA,Apache 2.0
2026-04Hy3-preview(混元3.0)295B / 21B256K"重建混元"第一步:编程/办公/金融建模/前端/游戏/Agent;官方建议 8 卡部署,同时开放 BF16 与 FP8(~300GB)

多模态与专项开源(节选):HunyuanVideo(13B,2024-12)、HunyuanImage 3.0(80B MoE 自回归文生图,2025-09)、HunyuanOCR(1B,2025-11)、HunyuanVideo 1.5(8.3B,消费级显卡可跑,2025-11)、Hunyuan3D 2.x / 3D 世界模型 1.0/1.5、HY-Motion(2025 底开源)。

架构与部署特点

  • 混元是国产厂商中**架构最"混搭"**的:TurboS 率先把 Mamba 状态空间引入旗舰;Large 用 CLA 跨层注意力压 KV;
  • Hy3 是 2026 年"旗舰性价比"的代表:295B 总参不大、FP8 权重约 300GB,4×H200 即可完整部署(约 160~180 万元硬件),官方生产建议 8 卡——是六大厂旗舰中最便宜的自部署选择;
  • API 定价在巨头中偏低:混元 Turbo 输入约 0.3~1 元/百万 token;Hy3-preview 在 OpenRouter 上 $0.066/$0.26。

优劣势速览

  • ✅ 多模态全家桶(图/视频/3D/世界模型)最全、微信生态触达、腾讯云 + WorkBuddy 办公自动化、旗舰自部署成本最低、API 便宜;
  • ❌ 公开榜单少拿第一、营销声量弱、开源力度不如 DeepSeek/Kimi/Qwen、应用入口分散(元宝/ima/WorkBuddy/API 多线)。

适用场景

办公白领与微信生态、政企腾讯云客户、多模态内容生产(视频/3D)、想要最低成本自部署旗舰 MoE 的企业。


3.6 MiniMax 系列

公司背景

2022 年成立(上海),以**“极致激活效率 + 超长上下文 + 多模态”**著称。C 端产品:海螺 AI(视频生成口碑极佳)、MiniMax Code、星野(语音/陪伴)。技术标签:闪电注意力(Lightning Attention)、CISPO 强化学习、"mini activations"哲学。

发展时间线与谱系

时间模型总参/激活上下文关键点
2025-01MiniMax-Text-01 / VL-01456B / 45.9B1M 训练(可外推 4M)闪电注意力(每 7 层线性注意力 + 1 层 softmax)+ MoE;把 1M 上下文成本打下来
2025-06MiniMax-M1456B / 45.9B1M全球首个开源大规模混合注意力推理模型;CISPO RL
2025-10MiniMax-M2229.9B / 9.8B192K(API 204.8K)“mini activations”:激活不到 10B,速度/并发/成本优势巨大
2025-12M2.1230B / 10B~200K多语言编码强化(Multi-SWE-Bench 49.4%)
2026-02M2.5230B / 10B~200KSWE-bench Verified 80.2%;办公文档(Word/Excel/PPT)操作能力
2026-02M2.5-Lightning230B / 10B~200K100 token/s,宣传"$1/小时"连续运行
2026-03M2.7230B / 10B~200K自进化 Agent(递归自我改进,需人工基础设施)
2026-06MiniMax-M3~428B / ~23B1MMSA 稀疏注意力;原生多模态(文本+图像+视频);官方 MXFP8 权重约 444GB;SWE-Pro 56.2%、GDPval-AA 1495 ELO
2026-07MiniMax H3视频生成/多模态
2026-08Music 3.0开放权重音乐生成

架构与部署特点

  • 一脉相承的线性/稀疏注意力 + 超低激活率 MoE:Text-01/M1 的闪电注意力 → M3 的 MSA;
  • M2 系(230B-A10B)的 BF16 权重约 460GB,量化后部署门槛与 GLM-4.5 相当;
  • M3 是"旗舰仍能压进 4 张 H200"的典型:MXFP8 约 444GB < 4×H200 的 564GB(完整体验建议 8 卡)。

API 参考价(OpenRouter/官方,美元/百万 token,输入/输出)

  • M2 ≈ $0.26/$1.02;M2.1/M2-her ≈ $0.30/$1.20;M3 有免费档,正式档按官方;
  • 属于"旗舰能力的低价档",与 DeepSeek 同属第一性价比梯队。

优劣势速览

  • ✅ 长上下文与推理效率的架构先锋、M2 激活小带来极低延迟与高并发、视频/语音/音乐多模态产品化最强、开放权重;
  • ❌ 文本模型社区体量小于 DeepSeek/Qwen、国内 ToB 声量小、M3 上下文超 512K 有阶梯加价。

适用场景

视频/语音/音乐创作者(海螺)、高并发 Agent 平台(M2 系)、需要 1M 上下文 + 多模态且预算可控的团队(M3)。


第四章 其他值得关注的厂商

4.1 字节跳动 · 豆包 Doubao(闭源生态之王)

  • 装机量/MAU 国内第一梯队(2026 年约 2.2 亿+ MAU),抖音/飞书/剪映全生态入口;
  • 谱系:Doubao-1.5-Pro(2025,MoE 200B/激活 20B,7 活跃专家,宣称等效 7 倍激活参数的 Dense 性能)→ Seed-Thinking-v1.5 → Seed1.5-VL → Doubao 1.6-Vision → Seed-Code → Seed 1.8(2025-12,GUI/浏览器/手机操作,1280 帧视频)→ Seed 2.0(2026-02,Pro/Lite/Mini/Code,对标 GPT-5.2,原生 Agent);
  • 附带即梦(图像)/Seedance(视频,全球登顶级)/COMET MoE 训练优化/UltraMem 稀疏架构等研究产出;
  • 闭源为主(仅计划开源中小 Dense 模型),个人版免费额度大。适合:普通用户、内容创作者、字节生态业务。

4.2 百度 · 文心 ERNIE(开源转身的老牌)

  • ERNIE 4.5(2025-06 开源,Apache 2.0):家族最大 424B/47B,另有 21B-A3B、0.3B 等多尺寸,多模态版 300B-A47B;
  • 推理线 X1/X1.5 闭源;搜索 + 文库生态结合是强项。适合:百度生态、知识检索场景。

4.3 其他一览表

厂商代表模型参数量级特点适合
科大讯飞星火 X1 / 4.0未公开语音识别/合成顶级,教育医疗司法方案深行业 ToB/ToG
阶跃星辰Step-3 / Step-3.5-Flash(196B-A11B)百 B 级 MoEAgent/工具调用激进,部分开源Agent 前沿开发者
面壁智能MiniCPM 系列0.5B~8B端侧小钢炮,离线可用手机/PC 端侧、隐私场景
上海AI Lab书生 InternLM2.5/31.8B~107B全流程开源(数据/训练/评测)高校科研
零一万物Yi-Lightning 等轻~中轻量便宜,重心转向应用端侧、轻量推理
百川智能Baichuan-M2中量级医疗垂直国内领先医疗健康
昆仑万维天工 Skywork中量级开源追更快研究/私有化兜底
商汤日日新 SenseNova视觉/多模态安全合规强政企安防
Mistral(法,对照)Small 4(119B-A6.5B)/ Large119B MoE256K;企业私有化友好(约 80~100 万元硬件)国外参照系

第五章 全景横向对比:参数量级 × 能力 × 价格

5.1 开源模型参数量级全景图(2026-09)

 0.5B ──┬── Qwen3-0.6B / Qwen2.5-0.5B        【手机端侧】
        └── MiniCPM 系(0.5~2B)、Hy-MT2-1.8B(翻译)
 1~4B ──┬── Qwen3-1.7B / 4B、Qwen3.5-Small(2B/4B)
        └── DeepSeek-R1-Distill-Qwen-1.5B    【入门开发板/纯CPU】
 7~9B ──┬── Qwen3-8B、GLM-4-9B、Kimi-VL-A3B(16B总)
        └── R1-Distill-Qwen-7B / Llama-8B    【一张 8~12GB 显卡】
13~16B ─┬── Qwen3-14B、DeepSeek-MoE-16B(A2.4B)、MiniCPM
        └── Kimi-VL(16B-A2.8B)              【一张 16GB 显卡】
 27~32B ┬── Qwen3-32B / Qwen3.6-27B / Qwen3.8-27B ⭐主流本地旗舰
        └── QwQ-32B(推理)                    【一张 24GB 显卡(Q4)】
30~35B MoE ─ Qwen3-30B-A3B ⭐、Qwen3.5-35B-A3B、Hy-MT2-30B-A3B
                                          【激活3B,24GB卡可跑,速度极快】
 72~80B ─┬── Qwen2.5-72B、Kimi-Dev-72B、R1-Distill-Llama-70B
        └── Hunyuan-A13B(80B-A13B)         【双 24GB 卡 / 单 48GB】
100~130B MoE ─ GLM-4.5-Air(106B-A12B)⭐、Qwen3.5-122B-A10B
                                          【1~2 张 H20/H200,企业入门】
200~300B MoE ─┬── DeepSeek-V2(236B-A21B)、Qwen3-235B-A22B
              ├── MiniMax-M2 系(230B-A10B)⭐
              ├── 腾讯 Hy3(295B-A21B)⭐
              └── ERNIE 4.5(300B-A47B 多模态)【数据中心,8卡级】
350~560B MoE ─┬── GLM-4.5/4.6(355B-A32B)⭐
              ├── MiniMax-M1(456B-A45.9B)、Qwen3-Coder-480B-A35B
              ├── 混元 TurboS(560B-A56B)、混元2.0(406B-A32B)
              └── MiniMax-M3(~428B-A23B)⭐    【4~8 张 H200/H100】
700~750B MoE ─ GLM-5 / 5.1 / 5.2 / 5.3(744B-A40B)⭐、混元Large(389B-A52B,上代)
                                              【8×H200 单机满血】
1T~1.1T MoE ─ Kimi K2 全家(1.04T-A32B)⭐     【多机或 B300 集群】
1.6T MoE ──── DeepSeek-V4-Pro(1.6T-A49B)⭐    【8×B200(1M上下文)】
2.4T MoE ──── Qwen3.8-2.4T-A95B               【24×B300(3台8卡机)】
2.8T MoE ──── Kimi K3(2.8T-A104B)⭐           【8×B300 单机(2304GB)】

5.2 旗舰能力对比(2026-09,官方/公开口径)

维度Kimi K3Qwen3.8-MaxDeepSeek-V4-ProGLM-5.3MiniMax M3混元 Hy3
总参/激活2.8T/104B2.4T/95B1.6T/49B744B/40B428B/23B295B/21B
上下文1M262K(→1M)1M200K(5.2 为 1M)1M256K
原生多模态✅(文本+视觉)✅(云端版)❌(文本为主)❌(文本为主)✅(文+图+视频)部分
强项长文档/推理/多模态全能均衡性价比/推理/Agent长程编码/Agent多模态/长上下文办公/金融/性价比
SWE-bench Verified(量级)~77-80%一流~80%+一流56.2%(SWE-Pro 口径)53%(2.0 口径)
官方权重精度MXFP4(1.56TB)BF16(4.89TB)FP4+FP8(865GB)FP8(756GB)MXFP8(444GB)FP8(~300GB)
满血自部署硬件8×B3003×(8×B300)8×H200(86K)/8×B200(1M)8×H2004~8×H2004~8×H200
满血硬件预算(整机)≈¥380-450万≈¥1200-1300万≈¥270-370万≈¥270万≈¥160-270万≈¥160-270万

关键洞察:成本榜 ≠ 能力榜。 Qwen3.8 最贵是因为官方检查点仍是 BF16;DeepSeek 1.6T 只要一台 B200 服务器就能跑满 1M,是因为官方混合精度最激进。真正决定私有化门槛的是"厂商以什么精度开放",而不仅是模型多大。

5.3 API 价格梯队(元/百万 token,输入侧,2026-08 公开参考价)

档位模型参考价
🆓 免费GLM-4-Flash;DeepSeek 网页/App0
💰 ≈1 元级DeepSeek V4(宣传口径"百万上下文 1 元起")、混元 Turbo、Qwen-Turbo、豆包轻量0.3~1
💰 1~4 元Qwen-Plus、豆包 Pro、文心 4.50.8~4
💰 4~20 元Kimi K2/K3 API、GLM-5、MiniMax 旗舰4~20
💎 20~100 元Qwen-Max / Qwen3.8-Max、GLM-5.2/5.3 旗舰档、Doubao 旗舰20~100

第六章 部署硬件完全指南(从 5 千元到 1300 万元)

本章是全文的"落地手册":先给公式,再给速查表,最后按预算给方案。

6.1 显存计算公式(必背)

推理(部署运行)

显存(GB) ≈ 参数量(B) × 每参数字节数 × 1.2(余量) + KV Cache
  • 每参数字节数:FP16/BF16=2,FP8/INT8=1,INT4=0.5;
  • 1.2 倍余量:框架、激活值、临时缓冲;
  • KV Cache:随上下文线性增长,4K 上下文可忽略(+1~2GB),32K 开始显著,128K+ 可达数十 GB(可用 KV 量化压 50~75%)。

⚠️ MoE 模型按总参数计算显存(所有专家都要装进显存),激活参数只影响速度,不省显存!

微调(LoRA)

显存 ≈ 推理占用 + LoRA 训练开销(约再增加 30~50%)

7B LoRA 约需 16~20GB;14B 约 28~35GB;32B 约 70~80GB。全参微调约 = 每参数 16~20 字节(权重+梯度+优化器状态),70B 全参需 TB 级显存,普通人不考虑。

6.2 显存速查表:模型尺寸 × 量化 → 显卡

(含常规上下文余量,单请求场景;数据综合多来源实测口径)

模型尺寸INT4/Q4INT8/Q8FP16/BF16代表模型推荐硬件
1.5~4B1~3GB2~4GB4~8GBQwen3-4B任何 6GB+ 显卡/纯 CPU
7~9B5~6GB8~10GB14~20GBQwen3-8B、GLM-4-9B8GB:Q4;12GB:Q8
13~14B8~10GB14~18GB28~35GBQwen3-14B16GB:Q4;24GB:Q8
27~32B20~26GB38~45GB70~80GBQwen3-32B24GB(4090/3090):Q4 勉强;48GB:舒适
70~72B40~48GB75~85GB145~160GBQwen2.5-72B48GB 单卡 / 双 24GB:Q4
30B MoE(A3B)~18GB(可再量化)~30GB~60GBQwen3-30B-A3B24GB 卡跑 Q4,速度极快(激活仅3B)
106B MoE(A12B)~55GB~110GB~220GBGLM-4.5-Air2×4090(48GB)Q4 / 1×H200 FP8
230B MoE(A10B)~120GB~240GB~460GBMiniMax-M22×H200(282GB)
355B MoE(A32B)~185GB~370GB~730GBGLM-4.5/4.64×H200(BF16 8 卡;FP8 4 卡)
671B MoE(A37B)~380GB~700GB~1400GBDeepSeek-V3/R18×H100/8×H200(FP8)
1T MoE(A32B)~560GB~1100GB~2100GBKimi K2多机集群 / 8×B300(MXFP4 官方格式更省)

6.3 显卡天梯图(2026 年国内可获得的现实选项)

消费级(NVIDIA)

显卡显存带宽能跑什么(Q4 口径)参考价
RTX 3060 12GB12GB360GB/s13B~¥1,500-2,500(二手)
RTX 4060 Ti 16GB16GB288GB/s13B Q8~¥3,500
RTX 3090/4090 24GB24GB~1TB/s32B Q4 / 30B-A3B(本地部署黄金卡)3090 二手 ~¥5-7千;4090 ~¥1.3-1.7万
RTX 5090 32GB32GB1.79TB/s32B Q6~Q8 / 70B Q2 卸载~¥1.7-2.3万
双 3090/4090(48GB)48GB70B Q4DIY 服务器 ~¥2-3万
RTX Pro 6000 96GB96GB70B Q8 / 120B Q4~¥7-10万

数据中心级(NVIDIA,国内合规可购情况)

显卡显存带宽FP16 算力备注
H20(96/141GB)96/141GB4.0TB/s~148 TFLOPS国内特供合规卡:砍算力保带宽,CUDA 生态零迁移;推理吞吐反而不错;8 卡整机约 ¥90-150万
H10080GB3.35TB/s~1979 TFLOPS对华禁售(存量流通)
H200141GB4.8TB/s同 H100禁售但存在存量/特殊渠道口径;8 卡整机公开报价约 $40 万(≈¥271万)
B200180GB8TB/s~20P(FP4)禁售;8 卡整机 $54.5 万(≈¥370万)
B300288GB8TB/s更高8 卡整机 $56.5 万(≈¥383万);Kimi K3 满血单机的关键

国产算力(自主可控主线)

芯片显存FP16 算力互联备注
昇腾 910B64GB HBM2e(部分批次/资料为 128GB)~317-414 TFLOPS392GB/s2025 年出货约 81 万颗,国产占近半;单卡约 ¥5 万;月租约 1~1.7 万/卡
昇腾 910C128GB HBM3e~800 TFLOPS(风冷标定 560T)灵衢 784GB/s双 910B die 封装;对标 H100 的 60~80%;Atlas 800/900 系列
昇腾 950PR112GB(自研 HBM)FP8 1P2TB/s2026 年放量,已用于 DeepSeek-V4 推理
昇腾 950DT144GBFP4 2P2.2TB/s训练版,2026Q4
平头哥真武 810E96GB对标 H20 级700GB/s阿里云自用,万卡集群
其他寒武纪/海光/沐曦/摩尔线程等生态适配成本需评估

国产卡选择要点:

  • 单卡算力:910C ≈ H100 的 60-80%,但 H100/B200 买不到;
  • H20 能买但只有 H100 约 15% 算力,带宽(4.0TB/s)却高于 H100——大模型推理是带宽敏感型负载,所以 H20 做推理并不差;
  • 昇腾生态是 CANN/MindSpore,不兼容 CUDA,迁移成本真实存在(算子适配数天到数周);但"能买到 + 持续交付 + 自主可控",是政企和长期项目的现实最优;
  • 华为用**超节点(CloudMatrix 384 / Atlas 950:384~8192 卡全互联)**抹平单卡差距,系统级推理效率已可与 H100/H800 集群掰手腕。

6.4 六大旗舰"满血"部署账单(2026-08 口径,单份模型低并发,整机估算)

模型官方权重最低显存预算方案预算
GLM-4.5-Air(FP8)~110GB~130GB1×H200 / 2×H100~¥50-80万
腾讯 Hy3(FP8)~300GB~360GB4×H200(可跑)/ 8 卡(官方建议)¥160-270万
MiniMax M3(MXFP8)~444GB~530GB4×H200(可跑)/ 8 卡(完整 1M)¥160-270万
GLM-5.3(FP8)~756GB~893GB1 台 8×H200(1128GB)¥270万
DeepSeek-V4-Pro(FP4+FP8)~865GB~1040GB8×H200(86K 上下文)/ 8×B200(满 1M)¥270-370万
Kimi K3(MXFP4)~1.56TB~1680GB8×B300(2304GB)单机¥380-450万
Qwen3.8-2.4T(BF16)~4.89TB~5.9TB3 台 8×B300(24 卡)¥1200-1300万
Mistral Small 4(对照)2×H200¥80-100万

注意三个"反直觉":

  1. Qwen3.8(2.4T)比 Kimi K3(2.8T)参数小,部署却贵 4 倍——因为它官方只放了 BF16 权重,而 K3 原生 MXFP4。等官方低精度版出来成本会骤降;
  2. “支持 1M 上下文"≠"你的机器能开 1M”——8×H200 跑 DeepSeek-V4-Pro 官方配方上下文上限约 86K,满 1M 需要 8×B200;
  3. 这只是能加载运行的最低账,不含机房、电费、制冷、网络、运维;多用户高并发还需 PD 分离、多副本,成本数倍增加。

6.5 推理框架选择

框架适用特点
Ollama个人/入门一行命令跑模型(ollama run qwen3:30b-a3b),GGUF 量化,最简单
LM Studio个人图形界面,适合完全不想碰命令行
llama.cpp个人/边缘GGUF 生态底层,CPU/GPU 混合,量化最全
vLLM生产服务事实标准,PagedAttention,吞吐高;各厂商官方配方多用它
SGLang生产高吞吐 + 投机解码(EAGLE),GLM/Qwen 官方推荐
LMDeploy生产国产(上海AI Lab),昇腾/国产卡适配好
TensorRT-LLMNVIDIA 生产极致性能,工程门槛高
MindIE昇腾华为推理引擎,昇腾部署首选
KTransformers稀缺硬件CPU+GPU 混合跑大 MoE(如单机跑 DeepSeek-671B)

6.6 一条经验法则总结

显存决定你能不能跑,带宽决定你跑多快,激活参数决定你的 token 成本;量化(Q4)是本地部署的默认答案;MoE 的"总参数"才是你买显卡的依据。


第七章 选型指南:按场景、预算直接抄答案

7.1 按使用场景

你的需求首选备选理由
零成本体验 AI豆包 App + GLM-4-Flash(API)DeepSeek 官方网页免费额度最大 / API 永久免费
综合性价比之王DeepSeek V4MiniMax M2 系地板价 + 第一梯队推理 + 开源
长文档/论文/法律/代码库分析Kimi K3DeepSeek-V4(1M)1M 上下文 + 原生多模态
写代码/Agent/自动化GLM-5.x / DeepSeek-V4 / Qwen3.8Kimi K2 Thinking三选一都不会错;预算低选 DeepSeek,项目大选 GLM
中文写作/办公豆包 / 文心 / 混元+WorkBuddyQwen-Plus最懂中文办公场景
视频/语音/音乐创作MiniMax 海螺/H3混元视频、Seedance多模态产品化最强
端侧/隐私/离线Qwen3.5-Small / MiniCPMQwen3-30B-A3B(工作站)数据不出设备
企业私有化(数据不出内网)Qwen3 全尺寸矩阵 / GLM(MIT)DeepSeek、混元 Hy3许可证干净 + 尺寸全

7.2 按预算(自部署)

预算能部署什么方案
¥0(纯 CPU/老电脑)1.5B~7B Q4Ollama + llama.cpp,CPU 也能跑 7B(慢)
¥5,000-10,00013B Q4 / 30B-A3B Q4二手 RTX 3090 24GB
¥15,000-30,00032B Q4~Q8 / 双卡 70B Q4RTX 4090/5090,或双 3090
¥50,000-100,00070B Q4 完整 + 128K 上下文RTX Pro 6000 96GB / 2×A6000
¥80-150万GLM-4.5-Air/百B级 MoE 满血1-2×H200 级服务器(或 8×昇腾910B)
¥160-270万混元 Hy3 / MiniMax M3 满血旗舰4-8×H200 / 等效昇腾集群
¥270-450万GLM-5.3 / DeepSeek-V4-Pro / Kimi K3 满血8×H200 ~ 8×B300
¥1200万+Qwen3.8-2.4T 满血3×(8×B300) + 高速互联

7.3 API vs 自建:一条决策线

先 API,后小模型,最后才旗舰集群。

  1. 第一档(绝大多数人永远停在这里):调用量不稳定、团队小、模型更新快 → 用 API,随时换供应商,零运维;
  2. 第二档:数据不能出内网 → 先自部署 27B/32B/30B-A3B/70B/小型 MoE,写作/知识库/客服/分类未必需要千亿模型;把评测集做好比盲目追求满血重要;
  3. 第三档(同时满足才考虑买旗舰硬件):①合规/数据主权强约束 ②任务确实需要旗舰能力 ③调用量长期稳定且足够大 ④有推理优化与运维能力 ⑤能接受"半年后不再是最新旗舰"的折旧。

第八章 新人快速上手路线图(实操版)

第 1 步:建立认知(第 1 周)

  • 读懂本文第一章的 12 个概念(尤其 Dense/MoE、量化、显存公式);
  • 注册体验:豆包、Kimi、DeepSeek、通义、智谱清言 各聊 10 轮,感受差异。

第 2 步:跑起第一个本地模型(第 2 周)

一台普通电脑(8GB 显存或纯 CPU)即可:

# 安装 Ollama(官网一键安装)后:
ollama run qwen3:4b          # 4B,入门
ollama run qwen3:8b          # 8GB 显卡可跑
ollama run qwen3:30b-a3b     # 24GB 显卡的甜点,激活仅 3B,速度飞快

浏览器打开 http://localhost:11434 即有 OpenAI 兼容 API,可接 Dify/Cherry Studio 等界面。

第 3 步:调第一次 API(第 3 周)

# 智谱 GLM-4-Flash(免费)示例
curl https://open.bigmodel.cn/api/paas/v4/chat/completions \
  -H "Authorization: Bearer 你的APIKey" \
  -H "Content-Type: application/json" \
  -d '{"model":"glm-4-flash","messages":[{"role":"user","content":"介绍一下MoE"}]}'

每家 API 都是 OpenAI 兼容格式,换个 base_url 和 key 就能迁移——所以不要在代码里写死任何一家

第 4 步:生产化部署(第 1-2 个月)

# vLLM 部署 Qwen3-30B-A3B(双卡示例)
pip install vllm
vllm serve Qwen/Qwen3-30B-A3B \
  --tensor-parallel-size 2 \
  --enable-reasoning --reasoning-parser deepseek_r1

学三件事:PagedAttention 原理(知道为什么吞吐高)、KV Cache 占用估算、量化格式(AWQ/GPTQ/GGUF)怎么选。

第 5 步:选定你的"主力组合"

参照第七章选型表,形成:日常 API(便宜档)+ 隐私本地模型 + 专项模型(视频/语音)的三层组合。


附录 A 术语速查表

术语一句话解释
LLM大语言模型
BBillion,十亿参数
TTrillion,万亿参数
Dense / 稠密全参数参与每 token 计算
MoE / 混合专家每 token 只路由到部分专家;总参数决定显存,激活参数决定算力
A(如 A22B)MoE 每 token 激活的参数量
Token模型处理文本的最小单位;1 汉字≈0.6-1 token
上下文窗口一次对话能容纳的最大 token 数
KV Cache推理时缓存的注意力状态,随上下文线性吃显存
MLA多头潜在注意力(DeepSeek 首创,KV 压缩 93%+)
DSA/KDA/MSA各家稀疏/线性注意力变体,长上下文降本核心
思考模式/CoT先推理后作答的慢思考
RL/RLVR强化学习/可验证奖励强化学习,推理能力训练法
FP16/BF16半精度,每参数 2 字节,官方原生格式
FP8/INT8每参数 1 字节,旗舰官方低精度格式
INT4/Q4/AWQ/GPTQ/GGUF每参数 0.5 字节的量化格式,本地部署默认
MXFP4/MXFP8微缩浮点格式,K3/V4/M3 训练期即采用
MTP多 token 预测,推理加速
SWE-bench Verified真实软件工程修复基准,代码 Agent 金标准
开放权重可下载权重自行部署;许可证条款需逐一核对
Apache 2.0 / MIT最宽松的商用友好许可证
PD 分离预填充与解码分离部署,高并发架构
昇腾/CANN华为 AI 芯片及其软件栈(CUDA 之外的国产生态)
超节点数百卡全互联成一"台"机器(如 CloudMatrix 384)

附录 B 信息来源与时效性说明

  • 本文数据综合自:各厂商官方发布/模型卡/技术报告(Qwen 官方文档与博客、DeepSeek 官方 API 文档、智谱 bigmodel 开放平台、Hugging Face 模型卡、腾讯混元官网、MiniMax 官网)、Wikipedia/arXiv 综述、以及 2026 年 6-9 月的多篇第三方深度评测与产业分析(含服务器公开报价、昇腾产业口径等)。
  • 大模型行业以"周"为单位变化:参数、上下文、价格、许可证都可能随时更新;旗舰发布后通常数周内就有权重、数月内有社区量化版。做采购/选型决策前,务必到官方渠道核对最新数字
  • 部分数字(如满血部署成本)为基于公开权重的整机估算,不含税费、机房与运维,不同渠道报价差异可达 ±30%。
  • 文中"能力对比"均为公开基准/口径下的量级参考,榜单不等于你的业务效果,落地前请用自己的评测集实测
内容概要:本文详细介绍了一个基于Python的校园招聘平台的设计与实现,旨在通过信息化手段提升校园招聘的效率与精准度。平台采用Python主流框架(如Django/Flask)构建,涵盖用户权限管理、招聘与简历数据建模、智能匹配推荐、日志监控与统计分析等核心模块。系统支持学生、企业、就业部门等多角色协同,通过结构化数据模型和业务流程控制,实现了岗位发布、简历投递、状态流转、权限校验等功能,并结合TF-IDF与余弦相似度算法实现简历与岗位的智能匹配。代码示例展示了用户角色模型、企业岗位模型、简历分表设计、投递状态机、权限装饰器及推荐服务等关键实现,体现了系统的可扩展性与安全性设计。; 适合人群:具备Python Web开发基础,熟悉Django或Flask框架,有一定数据库设计和前后端交互经验的开发者,尤其是从事教育信息化、招聘系统开发或校园服务平台建设的研发人员;也适合计算机相关专业高年级本科生或研究生作为毕业设计参考。; 使用场景及目标:① 构建高校内部统一的校园招聘管理系统,替代传统低效的线下招聘模式;② 实现学生与企业岗位的智能匹配与个性化推荐,提升人岗匹配效率;③ 为企业和高校就业部门提供数据驱动的招聘分析与决策支持;④ 学习多角色权限控制、状态机设计、ORM建模、缓存与异步任务等实际开发技巧。; 阅读建议:此资源以实际项目为导向,不仅提供完整模型设计与代码片段,还深入剖析了系统架构与业务逻辑。建议读者结合代码示例搭建本地开发环境,动手实践模型定义、API接口开发与推荐算法集成,并重点关注权限控制、数据安全与性能优化等关键设计,以全面提升全栈开发与系统设计能力。
评论
成就一亿技术人!
拼手气红包6.0元
还能输入1000个字符
 
 条评论被折叠 查看
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包

打赏作者

Together_CZ

你的鼓励将是我创作的最大动力

¥1 ¥2 ¥4 ¥6 ¥10 ¥20
扫码支付:¥1
获取中
扫码支付

您的余额不足,请更换扫码支付或充值

打赏作者

实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值