现在AI 落地倾向:大家都指望用更大、更贵的模型,但都会忽略自己系统工程上的粗糙。
很多开发者写个极其简单的 Prompt,扔给大模型,
大模型凭借自己恐怖的“阅读理解能力”和“容错能力”,会给出一个看起来还不错的结果。
但这其实是**“虚假的繁荣”**。一旦你把底层的模型换成 7B 小模型,那层遮羞布就会被瞬间撕掉。你会看到:
- 格式崩溃:明明要求输出 JSON,它非给你输出一段带着 ````json` 的 Markdown。
- 逻辑断裂:把文档开头的“公司愿景”强行抽成了一个系统业务模块。
- 注意力涣散:文档太长,读到后面就忘了前面 Prompt 里的格式约束。
- 死循环:卡在错误的 JSON 结构里,系统无限重试直到超时。
这不禁让人反思:
** AI 应用,到底是建立在坚实的工程轨道上,还是仅仅建立在 OpenAI 算力暴力的沙滩上?**
我们坦诚,7B 在本地跑确实有点慢。有时候生成一个复杂的业务骨架需要等两三分钟。
但这看似难熬的几分钟,带来的工程考验却是极其宝贵的:
它相当于提早帮你抓出了那些隐藏在云端 API 极速响应背后的“上线事故”。
当模型算力吃紧、上下文注意力稀释时暴露出的格式断裂和幻觉,
正是你在生产环境中遭遇并发高峰、长文本输入时必定会踩的坑。

7B 模型:最严苛的“压力测试环境”
在 VibeSpec 的研发过程中,我刻意选择了在本地运行 7B 模型来打磨核心管线。
当然 API是很贵是一个选择因素 ,主因是:
7B 就像是一个极其严苛的压力测试环境,它逼着你必须去建立与 大模型“交互工程(Interaction Engineering)”。
只有当模型“不太聪明”、“容易走神”时,你才会真正去思考如何用工程手段兜底。
我们在 7B 的鞭策下,沉淀出了以下几项核心治理手段:

1. 输入极度纯净:物理清洗(Text Normalization)
大模型不怕冗余,但小模型怕。在 VibeSpec 中,我们引入了 `pre_format_source’。它是一个“没有认知”的物理清洗器,
- 负责干掉 Word 导出的星号垃圾、收敛多余空白、
- 将各种乱七八糟的“第一部分”、“(一)”统一转化为稳定的 Markdown Heading 和 List
- 把烂泥洗成干净的砖块,是防止小模型在解析大纲时陷入混乱的第一步。
2. 约束极其精准:领域词汇与推论打标
Prompt 只是写“请提取系统模块”,小模型很可能会输出“系统管理”、“流程处理”这种废话。下面就需要我们把 Prompt 约束做到了极其精准的程度:
- 【领域词汇对齐】:强制模型提取 Entities(实体)、Status(状态)和 Events(事件),并以此命名模块。这会激活了模型在预训练时学过的 “领域驱动设计(DDD)” 神经元。
- 【推论打标】:强制模型在自行脑补闭环节点时,打上 (推论) 或 LLM 推导补全 的标签。
防幻觉不是靠机遇,而是靠建立打标机制。- 【动名词组合】:作业操作节点的命名必须是 [动作] + [实体](如 “提交申请”),
彻底消灭不知所云的 “步骤一”。
3. 容错极度强硬:不给废话留空间
在传统的重试机制中,如果模型输出了带有解释性文字的 JSON,系统可能会带着几十 K 的上下文去走一遍漫长的 Repair。
在 7B 的打磨下,我们学会了**“早bug早重做(Fast-Fail)机制”**。
一旦发现输出的顶层 Key 明显是业务章节名(比如"流程说明"),
系统不再去做无谓的括号补齐,而是:
直接判定CONTRACT_INVALID,切断长上下文,用最严厉的几句话(fast_contract_retry)把模型stop,再重做一次推理交出modules骨架。
4. 降级绝对平滑:MINI-PLAN 熔断机制
我们承认模型会犯错,但我们设计AI 系统绝不能卡死。
当 7B 模型在某个模块的生成上反复失败、开始输出废话(NON_JSON_TEXT)时,
VibeSpec 会触发熔断降级(Circuit Breaker)——启用 MINI-PLAN。
此时系统主动降低要求,把每个作业组的节点上限砍到 2 个。
这相当于告诉模型:“**算了,别想那么复杂,给我最核心的节点就行。
**”宁可输出精简版,也绝不让整个流程崩溃。

结语:工程底子管住项目下限,大模型决定了输出上限
当你的 AI 项目(工程底子)能够在 7B 的运行环境下,依然稳当地(但可能会有慢的等待后) 输出包含“实体、事件、推论标记”的高质量 JSON 骨架时,
这说明你的AI 项目系统已经具备了**“模型无关(Model-Agnostic)的强健壮性”**。
这个时候,如果你把大模型换回高参数模型时,那产出的质量将是降维打击级别的。
因为你的工程底子已经把下限给兜住,大模型的智力只会去无限拔高你的上限。
不要让强模型掩盖了工程底子的脆弱。在 7B 下打磨过的 Prompt 与交互轨道,才是 AI 应用走向工业级的真正护城河(可交付)。


1万+

被折叠的 条评论
为什么被折叠?



