

6月9日,Anthropic正式将Claude Fable 5推向公众,它是Mythos模型的「安全版」,但在发布时被塞进了极其激进的安全分类器。官方称一旦检测到网络安全、生物、化学、蒸馏相关请求,就自动路由到Opus 4.8处理,还声称95%以上session不受影响,性能几乎不变。

然而,真实情况糟糕透顶。资深免疫学家、生物黑客Derya Unutmaz试着跟Fable 5说「cancer」(癌症),直接被标记成生物安全风险;想用记忆功能,被告知是生物安全风险,只能切incognito模式(无记忆)才能勉强对话,甚至连「hello」都说不了。此外,高等数学中的Selmer群、同构等纯数学概念,也被Fable 5判定为潜在网络安全风险,直接阻挡或降级。

Fable 5和Mythos 5共享底层模型,区别只在于safeguards有没有打开。目前,Mythos 5只给Glasswing项目的信任伙伴用,普通人只能用被阉割的Fable 5。Anthropic用一套分类器,单方面决定谁是「安全用户」,谁是「潜在风险」,什么知识可以全功率输出,什么知识必须降级、阻挡、路由,这是治理问题。

Anthropic的安全策略正在形成恶性循环,分类器越激进,误伤越多;误伤越多,科研人员越愤怒;愤怒越多,Anthropic越觉得自己「有必要加强安全」。当AI成为科研基础设施时,Anthropic用技术手段决定知识的「安全」与「危险」,把人类认知边界往回缩,这是文明层面的自我设限。编辑观点:Claude Fable 5的安全策略虽初衷是好的,但过度限制已阻碍科研发展,Anthropic需平衡安全与开放,否则将影响AI生态及人类进步。

37

被折叠的 条评论
为什么被折叠?



