147AI
码龄1年
求更新 关注
提问 私信
  • 博客:143,239
    143,239
    总访问量
  • 197
    原创
  • 15
    粉丝
  • 1
    关注
IP属地以运营商信息为准,境内显示到省(区、市),境外显示到国家(地区)
IP 属地:广东省
加入CSDN时间: 2025-07-17

个人简介:147AI|提供全球主流大模型 API 聚合服务 让 AI 开发更稳定、更简单、更可控

博客简介:

AI147AI的博客

查看详细资料
个人成就
  • 获得2,560次点赞
  • 内容获得3次评论
  • 获得1,634次收藏
  • 代码片获得272次分享
  • 博客总排名10,480名
  • 原力等级
    原力等级
    6
    原力分
    1,950
    本月获得
    108
创作历程
  • 197篇
    2026年
成就勋章
TA的专栏
  • 实战经验
    8篇
  • 蒸馏
    15篇
  • 接入147指北
    7篇
创作活动更多

AtomGit「码动四季·开源同行」秋季征稿活动

秋季征稿主题:开源成果经验分享 成果不止一种形态,我们为你准备了六大赛道,总有一款适合你: 开源项目成果复盘 把项目一年/一季的成长摊开来看:里程碑复盘、Star 与用户增长复盘、版本迭代复盘、从 0 到 1 的发布复盘。 🖊️ 示范选题: ●开源项目从 0 到 1000 Star,我做对了什么 ●开源一周年,我交出的成绩单 这类文章不只是一次经验分享,也是一张项目名片。欢迎将项目托管到 AtomGit 并申请成为 G-Star 项目,通过后可获得平台流量推荐、项目宣传等权益。(G-Star:AtomGit 最具影响力开源项目) ![在这里插入图片描述](https://i-blog.csdnimg.cn/direct/1f90c61528ad410d8d66f9d0e3707a5a.png) 咨询 G-Star 项目申请 2️⃣ 技术经验体系化沉淀 踩坑合集、最佳实践总结、工具链实战、CI/CD 流水线搭建、代码重构与架构演进。 🖊️ 示范选题: ●提了 50 个 PR 后,我总结的开源协作避坑清单 ●一次重大重构复盘:把单体拆成可维护的模块 3️⃣ AI 赋能开源的实战成果 AI 编程助手实战测评、基于开源模型的微调与应用开发、AI 辅助研发提效流水线。 🖊️ 示范选题: ●我用 AI 编程助手把提 PR 效率翻了 3 倍 ●基于开源大模型搭了个 XX 工具(附完整教程) 4️⃣ 开源共建笔记|文档、社区与布道 开源文档写作与翻译、issue 互助经验、组织 meetup、用开源项目做教学与分享。 🖊️ 示范选题: ●一个优秀开源项目,文档应该怎么写 ●我用开源项目做了个线上 Workshop ![在这里插入图片描述](https://i-blog.csdnimg.cn/direct/23e83ceebc594c379f7fc6aa8dcfa40c.png) 扫码加入码动四季投稿交流群,和更多伙伴一起交流技术!

16人参与 去参加
  • 最近
  • 文章
  • 专栏
  • 资源
  • 帖子
  • 问答
  • 视频
  • 最近

  • 文章

  • 专栏

  • 资源

  • 帖子

  • 问答

  • 视频

搜索 取消

Benchmark保留率高,就代表模型真的好用吗?从DeepSeek-R1蒸馏模型看公开测评与业务选型的差距

本文分析了蒸馏模型在公开基准测试中的“保留率”概念,指出其易被误读——同一模型在不同任务上得分比例差异显著(如MATH-500达96.9%,LiveCodeBench仅86.8%),且受评测协议、提示词、采样策略影响。基于DeepSeek官方数据,32B蒸馏模型在多项测试中表现接近教师模型,但高分不等于业务可用。生产环境需关注格式合规、事实约束、稳定性等公开榜单未覆盖的维度。建议企业以基准测试筛选候选,再通过分层试测、正式评估与灰度监控构建多维验证体系,避免仅凭“保留率”做决策。
原创
博文更新于 14 小时前 ·
518 阅读 ·
2 点赞 ·
0 评论 ·
2 收藏

如何定位蒸馏模型的高回退任务,从日志到评测集的排查方法

线上教师调用突增时,勿盲目回退样本重蒸馏。需建立任务与尝试双层记录,明确每次调用的上下文与错误分类,区分服务、结构、质量等故障类型,导向精准修复。每日生成高回退任务表,按类型、提示版本等维度分析成本与趋势。日志抽样须经业务校验,构建可复用评测集。通过对照实验定位问题层级:路由、提示或模型。统一接入助力多模型对比,但质量判定仍需内部闭环。核心是让每条回退都有明确动作,避免无效训练。
原创
博文更新于 前天 18:07 ·
175 阅读 ·
1 点赞 ·
0 评论 ·
3 收藏

蒸馏模型回退率突然升高,先查容量、路由还是任务分布

蒸馏模型上线后回退率上升,不宜盲目补数据重训。应先复算回退率指标,确保分母准确;再通过任务分桶定位问题集中点,区分容量不足、路由过严或任务分布变化等根源。结合回归测试与固定样本对比,验证模型表现;调整路由阈值需离线回放验证,避免误判。最终以业务结果为导向,确保诊断与优化精准高效。
原创
博文更新于 前天 18:04 ·
130 阅读 ·
2 点赞 ·
0 评论 ·
2 收藏

学生模型和教师模型怎样做路由,阈值应该看哪些指标

模型路由阈值需综合任务质量、严重错误、成本与延迟,不能只按输入长度或单一评分。先明确目标:保教师质量还是省成本,再按风险分层评测。阈值应依开发集统计学生承担率、教师升级率、错误率等切片数据,并设严重错误上限。路由与接入解耦,配置版本化,线上灰度后持续校准,避免平均准确率掩盖高风险误判。
原创
博文更新于 2026.09.08 ·
204 阅读 ·
0 点赞 ·
0 评论 ·
4 收藏

蒸馏模型上线后怎样设置教师回退,避免失败请求反复烧钱

教师回退需基于错误分类与状态机控制,分清重试、升级、终止场景;用数据库记录尝试次数与原因,避免重复调用和高成本。成本需对比全量教师及人工方案,质量按严重性分层。上线前演练结构错误、超时、教师失败,实现全程可追溯,回退方能安全可控。
原创
博文更新于 2026.09.08 ·
184 阅读 ·
5 点赞 ·
0 评论 ·
4 收藏

学生模型单价更低,为什么完整任务成本可能更高

蒸馏后的学生模型单价更低,但项目总成本未必下降。原因在于完整任务链路中的格式解析、失败重试、人工复核等环节,低价会被更多调用和返工侵蚀。建议按“单个合格任务成本”替代Token口径核算,警惕输出变长、失败重试、质量返工、基础设施四类损耗。通过模型路由和教师回退控制质量风险,并经离线对照、小流量试运行两阶段验证后,才能判断蒸馏是否真正降低成本。
原创
博文更新于 2026.09.07 ·
325 阅读 ·
6 点赞 ·
0 评论 ·
5 收藏

蒸馏数据生成到底花了多少钱,从API调用算到合格样本

文本模型蒸馏的成本不能只看接口调用费,需区分请求数、可解析数、验收数。应建立任务、尝试和运行台账,记录每次重试与拒收原因,以“单位合格样本成本”衡量。放量前做小批分层试验,比较教师时看最终合格率;批处理中设暂停阈值,保留可追溯记录,才能算清并控制真实数据成本。
原创
博文更新于 2026.09.07 ·
654 阅读 ·
5 点赞 ·
0 评论 ·
5 收藏

知识更新频繁时,为什么先做RAG再决定是否蒸馏

当知识频繁变化时,先让RAG在推理时提供最新材料,验证检索与生成流程;稳定行为才考虑蒸馏。按“知识”与“规则”分别标记更新时机,RAG负责事实,模型负责固定处理方式。分两层评测检索命中与回答一致性,并记录版本和时延。蒸馏候选需调用量大、输入输出边界清晰,且保留RAG以保证可追溯。迁移顺序:先建小型知识源,冻结问题验证,再收集审核后的教师输出训练学生,最后对比效果。此顺序让失败可定位,避免把训练当作实时更新工具。
原创
博文更新于 2026.09.04 ·
224 阅读 ·
6 点赞 ·
0 评论 ·
7 收藏

蒸馏项目什么时候该停,怎样切换到RAG、微调或模型路由

蒸馏不达标时,先按失败样本分类:知识缺漏用RAG,格式错误用微调,难度差异用路由,仅任务稳定且成本受限时才继续蒸馏。停止前设定最低分、错误上限、资源和轮数条件,并区分开发集与测试集。保留日志和失败样本,小实验验证方向后再扩投入,避免盲调。
原创
博文更新于 2026.09.04 ·
311 阅读 ·
7 点赞 ·
0 评论 ·
8 收藏

蒸馏模型量化上线前,先查精度退化和算子兼容

量化模型上线不能只看离线指标。需按任务切片复测精度,在目标框架验证算子兼容,校准数据覆盖长尾分布,并先蒸馏后量化。上线前后要演练回退,锁定预处理与后处理,按请求类型灰度监控。将“模型变小”拆成可验证的精度、速度、回退结果,条件不足时保留未量化版本。
原创
博文更新于 2026.09.03 ·
184 阅读 ·
5 点赞 ·
0 评论 ·
6 收藏

蒸馏后再量化会掉多少精度,怎样设计一组对照实验

蒸馏模型量化评估需严谨对照:固定数据、环境,比较原模型、蒸馏模型与量化模型;分开记录质量、延迟、内存及失败样本。校准数据不参与测试,一次只改一个变量,结论需注明适用范围与波动,避免数据泄漏与误判。
原创
博文更新于 2026.09.03 ·
202 阅读 ·
4 点赞 ·
0 评论 ·
4 收藏

给蒸馏模型做表达扰动测试,怎样设计一套可复现的回归集

<think>我们根据内容生成≤150字摘要。内容主要讲表达扰动测试设计,强调分类、记录、判定、回归、停止条件。摘要求精炼,覆盖核心。</think>学生模型固定测试集后,应进行表达扰动测试而非堆题。扰动分保持语义与改变条件两类,需记录样本身份与来源,判定结构化字段而非字符串。回归运行需分原始、扰动、条件三组并切片报告,记录服务条件,设定停止条件。完整交付样本来路、规则、预期与评分版本,确保可复现。
原创
博文更新于 2026.09.02 ·
221 阅读 ·
8 点赞 ·
0 评论 ·
6 收藏

蒸馏测试集高分,换种问法却失效,怎样检查近似重复和模板泄漏

蒸馏模型测试高分常源于训练/测试集近似重复或共享模板,而非真实泛化。排查应先按来源分组去重,再通过表达扰动检验学生是否依赖熟悉模板。用可复现脚本生成语义不变改写并追踪版本;原测试集转为回归集,另建独立样本用于最终评测,区分模板记忆与能力缺失。
原创
博文更新于 2026.09.02 ·
373 阅读 ·
4 点赞 ·
0 评论 ·
6 收藏

训练损失下降但任务指标不涨,怎样联合排查蒸馏训练

蒸馏训练中总损失下降但任务指标停滞时,应先区分测量对象差异,分拆软/硬损失与任务指标日志,关注聚合方式和类别不均衡;验证集需按真实任务切片,通过失败样本和变量小实验定位原因,并统一离线评测与线上服务口径。
原创
博文更新于 2026.09.01 ·
157 阅读 ·
5 点赞 ·
0 评论 ·
4 收藏

蒸馏温度和损失权重怎么调,先看哪些证据

知识蒸馏调参常同时改温度与权重,但难以归因。温度改变教师分布平滑度,权重决定学生信任教师还是硬标签。应先确认教师输出、标签质量和学生基线,每次只改一项并固定其他变量。注意实现细节与实际作用位置,按类别切片观察损失。目标切片改善且无回归才保留,否则回到数据与评测。
原创
博文更新于 2026.09.01 ·
168 阅读 ·
5 点赞 ·
0 评论 ·
3 收藏

教师和学生输出怎么对照,才能找到蒸馏问题

教师学生对比不能简单归因“学生太小”,需先统一运行条件、记录模型版本与后处理,再按任务拆解指标逐项判定。用差异矩阵定位教师错、学生错的不同象限,结合数据批次检查。返工前选定代表样本,固定变量并回归旧场景,同时保存评分中间结果,避免错误尺子主导结论
原创
博文更新于 2026.08.31 ·
215 阅读 ·
8 点赞 ·
0 评论 ·
4 收藏

蒸馏模型效果不好,怎样建立一套失败样本诊断流程

蒸馏模型评测不理想时,不应盲目调参。应先保存失败样本及教师、学生、参考答案等四路输出,按格式、事实等分类错误,再切片统计定位问题,最后单因素返工并回归。PyTorch、Google Cloud等资料佐证,诊断不能只凭总分。
原创
博文更新于 2026.08.31 ·
311 阅读 ·
7 点赞 ·
0 评论 ·
4 收藏

评测分数不理想,什么时候值得补蒸馏数据

看到学生模型分数不理想,团队很容易提出“再生成一批数据”。补数据有时有效,有时只会增加教师调用、清洗和训练成本。是否值得补,取决于错误是否集中、缺口能否被数据覆盖、教师回答是否可靠,以及补完后有没有重新评测的路径。
原创
博文更新于 2026.08.28 ·
180 阅读 ·
5 点赞 ·
0 评论 ·
6 收藏

蒸馏试点没达标先查哪一环,数据、教师还是学生模型

学生模型容量和任务范围需要匹配。一个小模型同时处理摘要、抽取、开放问答和多语言请求,任何一类表现不好都不奇怪。把错误按任务切片,观察缩小范围后是否改善。若核心任务稳定、边缘任务持续失败,可以先收窄上线范围,再评估是否需要更换学生模型。训练实验尽量一次只改一个主要变量。教师、数据、学习率、训练轮数和量化同时变化,结果即使提高也难以解释。保留没有改善的实验,下一轮就不会重复同样的组合。报告还要写清检查点选择依据,不能只保留最好分数而丢掉过程。
原创
博文更新于 2026.08.28 ·
333 阅读 ·
10 点赞 ·
0 评论 ·
5 收藏

蒸馏模型部署交付如何验收,启动成功以后还要测什么

学生模型在演示环境里返回一段正确答案,只能证明某个版本在某次请求中运行过。企业验收部署交付,还要确认模型制品、服务接口、目标硬件、监控信号和回退步骤能够连成一条完整路径。任何一段只能由原开发人员临场处理,接管风险都会留给后续运维团队。部署验收适合从一份可执行的运行手册开始。接收方按手册从空环境启动服务,运行固定请求,观察资源和错误,再主动触发一次回退。过程产生的命令、配置、日志与测试结果都应保存。这比在会议室里浏览部署架构图更容易发现缺口。
原创
博文更新于 2026.08.27 ·
157 阅读 ·
6 点赞 ·
0 评论 ·
4 收藏
加载更多