突发:DeepSeek-V4-Pro-0813还真是发错了模型啊😅
昨天社区在检查 DeepSeek 上传到 Hugging Face 的 V4-Pro-0813 时发现,一个非常反常的问题:
开源版本的模型架构,居然完整对上了之前的 V4 Flash,而不是 V4-Pro- preview。
具体是:
hidden_size:4096
43 层
256 个 routed experts
64 attention heads
这些参数和 V4-Flash 基本一致。
而正常的 V4 Pro 应该是:
hidden_size:7168
61 层
384 个 routed experts
128 attention heads
更蹊跷的是,问题被社区发现之后,Hugging face上的V4-Pro-0813 仓库一度被下架。
随后在北京时间的今天0点左右 DeepSeek 又重新上传了模型,把 config 改回了 Pro 的架构。
事情到这里,本来还能解释成一句:开源的时候复制错 config.json 了。
但后续有人继续检查 Hugging Face 的 commit history,发现重新上传之后,不只是 config 发生变化,部分 safetensors 权重文件的 SHA256 hash 和文件大小也变了。
也就是说,DeepSeek 很可能不只是改了一个配置文件,而是重新处理、导出甚至量化了一部分 checkpoint。
这也让昨天 V4 Pro 0813 发布后出现的各种异常表现,变得更加值得重新审视。
一个 1.6T 级别旗舰模型发布,最后可能栽在了一个错误的deployment上🤣。
模型炼得出来,发布没发明白。
世界真的是一个大草台班子啊😉
点击图片查看原图
点击图片查看原图