今天聊一个有趣的话题,权重开源是真开源还是假开源,我站在一个软件从业者的角度,结论是:“权重开源是假开源,但权重开源也不错了,而英伟达推动开源虚伪的一逼,建议犬决黄仁勋!”。下面稍微展开说一说
1、如何理解权重开源
权重文件,本质上是不可逆的二进制文件,存储的是神经网络训练完成后得到的大量数值参数,而根据这些权重文件,配合模型结构代码+推理引擎,就可以运行大模型,实现非大模型官方的推理服务。比如微软和OpenAI签署的协议,就可以简单化理解为,OpenAI给微软发放自己的权重文件,微软把文件部署在Azure集群上,对外提供推理服务。
再通俗一些,就类似Windows下面你下载的exe文件,MacOS下面你下载的dmg文件,或者Linux下面,你从仓库里下载的deb、rpm等等,没错,就是这个意思,很多人会问了,这不扯嘛,我在软件网站不是随便下载exe文件吗,怎么就成开源了。
哈哈,那我就举一个更通俗的例子,比如腾讯,他的王者荣耀游戏,研发完成后,会编译成一个又一个二进制的可执行文件(我们就假设是一堆exe执行程序),正常情况下,这是放在自己的服务器上运行的,不对外,你显然也下载不到啊。开放权重,就好比腾讯把网站王者荣耀全套运行程序放在官网提供下载,你自己去买一台服务器,就能运行服务,并且在客户端上修改服务器地址后,就能加载你自己服务器上的游戏角色,那么顺其自然的,你就成了网管,还能自己调人物数据。
但是,这种终究是假开源,因为如何生成二进制文件,对这个过程的开放,才是真开源。
2、什么是真开源?
还是腾讯这个例子,王者荣耀游戏研发时的所有代码文件的开放,才能算是真开源,只有开放了全部源代码,你才能最大程度的随意修改游戏内容,比如换贴图、改逻辑、增场景等等。
而开放权重,只是给了你运行他程序的权利(当然了,这也很重要),并没有赋予你修改程序、自由扩展的权利,从开源精神的角度看,只开放权重显然是假开源,真正的开源需要做到:
-可以使用对方的研发成果
-可以研究对方的原发过程
-可以修改对方的原始代码
-可以重新编译或者重建
-可以自行分发原始版本
-可以分发修改后的版本
而大模型厂家如果做真开源,那就得做到:
1)模型架构开源
这里面包括完整的网络结构、配置文件、Tokenizer、位置编码方式、MoE路由设计、上下文长度以及其他关键技术细节(甚至是设计文档、评审过程等等)
2)训练时全套代码
包括预训练、微调、强化学习、数据加载、分布式训练、混合精度、容错和检查点保存等各式各样的训练时代码,当然也最好包括全部的设计文档、架构图、数据库建模原始文件等等
3)数据信息
哈哈,这个就微妙了,因为大部分数据都是来路不明甚至违法犯罪,这里开源就要求原始数据全部直接打包公开,也许有几百T甚至几百P(强烈要求字节开源他的训练数据信息,他肯定下载了全世界的A片)
假如无法开放数据信息,其实是无法完全复制训练过程的,但即使数据没有,也应该开放或告知:
-使用了哪些数据源
-各类数据所占比例
-数据是怎样清洗的
-如何去重
-如何过滤低质量内容
-如何处理版权和个人信息
-是否使用了合成数据
-是否使用其他模型生成或者筛选数据
以上东西都涉及相关处理代码,相关代码和工程文件都应该开放
4)模型权重开源
包括最终权重文件,最好还能提供关键训练阶段的检查点、优化器状态和继续训练所需要的模型状态等等。
5)完整训练配方
包括超参数、学习率、批次大小、训练阶段、数据配比、上下文长度变化、损失函数、优化器以及训练算力配置等,这些其实和设计文档类似,都是架构师脑子里的东西落地的细节。
6)后训练过程
包括监督微调、偏好学习、强化学习、拒绝采样、奖励模型、安全对齐和人工标注规则等等。
7)评测体系
包括内部的评测体系(评测代码、测试集、评分标准和未经筛选的结果等),也包括对外的应对和调优相关的内容。
所以你看,其实没开源,因为上面的东西啥都没有,当你理解了这些之后,你就会觉得A社的人,阴阳怪气黄仁勋没毛病啊。
3、英伟达为什么虚伪?
所以,黄仁勋谈AI开源,确实也是道德绑架,别人几百亿的设备、几亿几十亿的数据和标注,所产出的东西,为啥说开源就开源,凭啥?投资人同意了吗,投资人都没发话,你英伟达发什么话!
而英伟达之所以推动权重开源,我相信除了黄仁勋确实境界比较高(渴望推动人类生产力的进步)之外,更多的还是考虑英伟达的商业帝国
权重开源了,参与者变多,GPU的消耗一定增加
从训练的角度,权重并不是终点,而是成为了越来越多的训练的起点,SFT、LoRA、持续预训练、蒸馏、上下文训练、多模态扩展、知识库补充等等。
从推理的角度,权重更是千行百业生产力起步的开始,有了开放权重,人类推理的进步可以说会提速100倍以上。
所以你看,谁是赢家,那么现阶段显然是英伟达,甚至我认为黄仁勋虽然对其他ASIC推理十分恐慌,但他依然看到了权重是训练的开始这一条发展规律,从而能更加确保CUDA和英伟达GPU的训练霸主地位。
那么说到CUDA,这就是最虚伪的地方了,你倒是开源啊!!!围绕英伟达生态,以下这些东西,可以说毛线的源代码都没有
-CUDA
-驱动
-编译器
-数学库
-通信库
-推理优化工具
-性能分析工具
-固件
-硬件特性接口
-开发者生态
而我作为华强北从业者,甚至固件的二进制(别提源代码了)都要通过AIC从英伟达服务器上偷哈哈哈,然后尼玛4090后还偷不到了(因为怕被偷,英伟达加了很多强签名和痕迹溯源)
然后替英伟达说话的人,会提到英伟达确实开放了Linux GPU内核模块的源代码,但我要戳穿这个虚伪的是,这些内核模块仍然需要与对应版本的GSP固件和用户态驱动组件配合使用,并且,最恶心的是,这个开源仓库是英伟达内部代码库加工后的快照而已,每个驱动版本只有一次代码提交,根本看不到内部修改逻辑和过程,外部的大规模重构贡献,也是绕到内部合并提交再发布。
这种是什么,就是最恶心、最叽叽歪歪、最不相信开发者、最下作的开源方式,这就是英伟达商业风格的缩影
所以,你们说犬决黄仁勋过不过分!
-----
最后总结一下:除了黄仁勋是王八蛋之外,我认为权重的开源,本质上是推动全社会的推理生产力的进步,那么,为了不侮辱开源这两个词,完全可以换一个说法:“权重开源,这叫人工智能大模型时代的已经形成的一种约定俗成的商业模式和手法,并且所有从业者,在投资回报和人类生产力进步两者之间,逐渐找到了一种微妙的平衡,小心翼翼的推动着产出文件的开放。”
点击图片查看原图
点击图片查看原图
点击图片查看原图