AI半导体终局推演2026(III)
AI半导体基建期为什么比互联网基建期更长?
Coding场景之后的下一个模型ARR营收增长点在哪里?
AI基建会不会过度建设?Capex是不是泡沫?经济账能算的过来吗?
开源模型和闭源的格局如何?对闭源模型的冲击会如何演进?
本文尝试推演这几个问题背后的逻辑
—--------------------------------
为什么AI的基建期比互联网基建期要长?
互联网革命时期的硬件/基建收入增长,只有一个渗透维度的指数型增长,就是用户量
因为每个人都是订阅制,50块钱一个月的网费,没办法再升了。属于平价服务,看十倍网页也不会付十倍的钱,平价服务是没有第二个维度的指数增长的,饱和了就饱和了
移动互联网的基建,也就是端侧设备智能手机,是同样的逻辑,端侧设备很难做到ASP售价很高,因为摊薄成本需要大规模生产,而要做到大规模,ASP就一定不能高,也很难涨价。所以注定了端侧设备在渗透率达到一定程度之后,很难再继续指数增长,因为上限只有一个维度决定。
这也是为什么,互联网革命的硬件需求拐点大概在渗透率到了sigmoid中点之后减缓,2000年3月互联网泡沫破灭的时候,美国互联网渗透率大概在50%左右。科技革命增速最快的时候就是采用率10%迈向50%的阶段。
—--------
而AI硬件需求来源于token的指数型增长,这一轮AI之所以对硬件需求大,本质上是因为上限是由两个维度决定的:用户数量/渗透率的指数增长,和每个人的用量的指数增长
这两个维度的指数增长相乘,都能转换成统一的度量衡:token,把基建上限提高了太多太多了
我们这个时代,两个维度各自走到哪里了?
第一个维度用户渗透率,几个月前已经达到50%,也就是sigmoid导数要拐点了
第二个维度,也就是人均token用量,2026年仍然在早期。全美企业内部的AI spending中位数,现在是每人每月12美元。远期来看,这个数字有希望至少达到白领工资的10%,也就是每个月1000美元左右,中间还有接近两个数量级。
现在的增长,主要是第二个维度的渗透率,也就是每个人token平均用量的指数级增长,两个sigmoid曲线接力上了
这应该是历史上罕见的,两个维度sigmoid曲线接力带来的算力/基建需求,也带来了半导体的超级周期
但一切的指数增长,都是上限达到之前的幻象,这一轮AI基建也不例外,只不过幻象时间要长的多,因为多了一个维度的指数型增长接力
—--------------------------------
另外一个AI的基建期比互联网需求高的原因,在去年写的半导体年终总结里提过:提到这两个渗透维度的指数成长,都能转换成统一的度量衡:token。跟互联网时代不同的是,互联网时代,每次请求的网络和算力成本,边际成本极低,scaling的效果极好,软件复制分发的边际成本几乎为零,且几乎不消耗额外的硬件资源。
而token时代因为高额的推理成本,用户访问消耗的边际成本比互联网要高一个数量级。商业模型从“流量 × 转化率”部分转向“每 token 毛利”了,所以AI时期基建的需求比互联网时代要高的多
—--------------------------------
第一个渗透率维度扩散太快,已经到拐点,所以现在大家在讨论AI的前景的时候,已经不那么注重渗透率的讨论,而更多的是讨论在各行各业中,人均的token使用量会如何增长。
-----
Coding agent场景ARR迅速上升证明价值之后,6-7月开始增速放缓,市场开始担忧,coding agent在程序员群体内广泛渗透之后,什么场景能够接力token/ARR增长 ?是不是AI for science?还是RSI?
我认为仍然是Coding,广义的coding,而且还有很大空间
Coding是这个世界数字化的不可阻挡的趋势,万物皆可coding,而且不一定是显式的coding。实际上太多任务在后台被默默转化成了Coding,最后在记录功能的时候,仍然会被看作是Coding。
目前广义Coding任务占所有的ARR收入比例大概是60%到70%之间。如果只算程序员的狭义Coding的话可能只有40%左右,另有20~30%可能是其他行业的任务转化而来的Coding agent执行结构。
比如最常见的文件的编辑Excel和PowerPoint,最后都是通过后台开linux sandbox用Coding的方式去完成的。财务、CRM 操作、法律文档整理也一样,区别只在于所调用的工具和 verifier 不同,都被转换成了可观察->可执行->验证的coding闭环任务。
半导体的架构探索会转换成SystemC model simulation问题,生物制药的分子结构解析和仿真中的很多环节也可以用coding完成,投行研报里的模型建模也能转换为coding问题。
狭义的程序员coding任务只是第一个跑通了高频运行 观察/分析->执行->验证循环的大类任务,这也是coding为什么消耗了比chat高一个数量级的token。以后有太多的任务都是同一个逻辑下的承接者,甚至包括deep research这样的开放性任务。 形式上,下一个比较切实际的增长来源就是Co-work/computer use
接力程序员Coding的,并不是另一个孤立的大场景。当前增长最快的,正是“非程序员使用Coding基础设施完成非Coding产品任务” ,Coding仍然是默认执行内核,但不一定是用户眼中的产品分类
截至2026年6月,OpenAI企业客户中,Codex已经占Codex与ChatGPT合计输出token的64%。Codex周活用户自2月以来法律部门增长108倍,销售和招聘增长41倍,市场营销增长26倍,工程部门反而只增长5倍
从Anthropic的营收垂直占比来看,狭义的程序员/软件公司coding占比只有40%,金融服务/保险超过 20%,法律,制药/生命科学,消费/零售电商,占比都非常的可观,都有10%量级。
Software eating the world的逻辑,在coding的门槛被LLM降低一百倍之后,甚至强化成了coding eating the world,或者说,coding是agent最熟悉的方式,agent正在利用coding开始向所有知识工作去扩散使用率
而Agent Coding已经过了可行性和方向摸索阶段,剩下的主要是长时运行/跨系统/自主性/可靠性等工程问题 ,没有什么重大挑战了。
剩下的事情只是用户适应场景和改变习惯的问题,渗透率/利用率的主要瓶颈是,大家的学习曲线没有那么快,用户需要时间迁移agent/coding工作流;企业workflow高度长尾、数据分散、内部工具整合不足,也缺少自上而下的KPI推动。模型能力、组织推动和tool integration共同决定adoption速度。
另外一个瓶颈逻辑Amdahl’s law(结果取决于不能加速的环节),token只能解决其中一部分环节的加速,比如说像药物临床部分是无法加速的,如果其中一半环节无法加速,那么token就算把剩下的环节加速一千倍,整体加速也只有2倍。因此更现实的路径是并行探索更多方向,把瓶颈从决策转移到验证。
Anthropic 6~7月的营收放缓主要原因有三个:一个是算力不够,另一个是防蒸馏整治了不少账号,还有openai的codex 5.6抢占份额。并非广义agent coding需求触顶。
从广义agent coding角度看,我目前看不到大模型/agent需求的硬上限。目前仍然处于用的越多,提升效率越多的阶段,边际正收益仍然很大,主要瓶颈在于营收/利润能支撑多少budget,意愿和场景都没有问题。
--------------------------------------------
从最重要的需求端来推演,token增长率前景是没什么问题的。
那么从基建出资方来推演,capex的上限在哪里,能不能持续?有没有泡沫?举债+FCF变负,账能不能算的过来?
从基建出资方来说,和互联网区别最大的地方在于,互联网时代的基建出资方和受益方并不一致。而在 AI 时代,这两者出现了重合。基建出资方最大的Anthropic和OpenAI也同时是这一次AI革命的最大受益方。
所以算账先从Openai和Anthropic角度来算是最直接的
1.unit economy是算的过来的
截至六月底,Anthropic大概用2GW的有效算力创造了62B的ARR。如果1GW的数据中心建设成本按50B来计算,平摊到六年,每年的成本大概是10B。那么,其实Anthropic的推理算力收入~30B/GW除以年化的算力成本大概是三倍。推理的ROIC也有差不多60%
如果只算推理,那么unit economy就更好了,1GW的算力收入是接近50B的
2. 在维持这个unit economy标准的前提下,只要ARR增速和算力增速同步,Anthropic + Openai的数据中心算力GW规划是能算的过来的
O+A 两家在七月的时候大概6~7GW,Anthropic 65B,Openai 45B
O+A 两家今年年底上线加起来大概11GW,只需要ARR半年再增长60%左右即可保持ARR和上线算力的同步增长(要知道2026上半年A 7倍,O 2倍多),也就是下半年每个月增长10%即可
到2027年底,两家规划的总算力全加起来大概20~24GW,其实只需要这一年的token ARR同步增长1~1.5倍,这个算力账起码在unit economy上是算的过来的,算力跟ARR的增速同步,目前的可见度支撑2027E的capex没有大问题
没有能见度的2028只能靠猜:2028E ARR一年增长80%的话,能justify O+A 总共45GW 算力规划。2029 + 2030年两年ARR继续增长100%(CAGR仅仅40%),O + A到2030年年底总共100GW算力规划是完全合理的
至少O和A这样明确找到了结构性需求增长的赛道的ROIC是算的过来的,2027甚至2028的算力规划暂时没有泡沫
举债和FCF变负去做AI基建,是不是赌博?是的
但这样的赌博在ROIC如此好而且大概率能持续的生意面前是有合理性的,踏空错过的风险是显著大于fomo泡沫的风险。即使融资成本升到8%甚至更高,起码2027~2028,算力回报仍是可以justify借债风险的。
—------------------------
O和A的算力账是算的过来的,那么其他部分的算力呢?回报能算的过来吗?
这部分定量很难,只能大概定性的算,因为其实有很多算力是不产生直接收入,只算作研发成本。比如Meta明年规划新增5GW给MSL训模型和搜广推(搜索/广告/推荐),google的gemini 训练 + 搜广推,都不直接产生收入,但这些仍然是战略上的合理算力需求。
有一个很容易被忽略的事情:全行业来说,目前很大一部分的AI/ML算力,不是卖token的,仍然是传统的搜索/广告/推荐,最典型的比如Meta,Google大部分的算力就是如此
所以在看2027~2028年的天文数字一样的算力的时候,传统workload是一个容易被忽略的重要部分。产业链硅谷公司里,和市场的感觉是截然相反的:公司内部的算力缺的一塌糊涂,但市场还是在质疑算力账看不到收入,质疑oversupply
但把这么多不产生直接收入但仍然重要的R&D,以及传统AI/ML的大量增长算力算进来,算不过来的那部分算力是很有限的
况且O + A的算力集中度也是越来越高的:2027年全年新增算力GW,因为电力瓶颈,美国能通电大概只有20~25GW,这其中O +A可能会占10GW,也许会占到新增的接近一半。在2025年,这个比例低一些,O+A 大概只占新增算力的25%,很大一部分的算力GW不是LLM。随着时间推移,O + A的算力GW占比越来越大,也就是说总体算力账能算的过来的部分也越来越大
另外一个容易被忽略的逻辑是,因为coding agent的爆发,软件行业/ML行业的迭代速度突然加快,整个世界数字化进程的加快,带来的传统硬件基建需求也在加速
以CPU为例子
token = 决策/智能
CPU = 执行/验证
数字世界万物皆coding,随着决策能力爆发,对执行/验证的需求会是同步的数量级的增长
而且传统ML行业的迭代速度加快,也会是CPU类似的逻辑,ML的效果变好场景变多,也会带来更多GPU/ASIC硬件的需求
—------------------------
AI基建会不会产生泡沫?会,而且最后一定会overbuild
Inference现在实在是太赚钱了,所以overbuild是必然会发生的结局,因为大家都想抢inference这一块的市场,每一家都在军备竞赛,无法承受失去市场份额无法跟随潮流高速增长的痛苦,没有哪一家会退缩
闭源模型推理的毛利率可以轻松达到70%~85%(甚至是在CSP抽成之后),token factory host开源模型卖token的毛利率也有60%以上(DeepSeek甚至80%以上),GPU最近不停涨价,1GW租金都在往20B走,光卖GPU集群短约都有60%以上毛利。
这个AI基建市场太赚钱诱惑力太大,只要有渠道有技术的,全都涌入这个市场做neocloud,而因为build规划和落地普遍有一两年的时间差,所以overbuild一定会发生,只不过是时间问题
时间问题的意思是,以目前的需求和算力规划,至少两年看不到overbuild,任何模型上的阶跃式进步(比如reasoning -> agent),或者应用范式上的创新,带来AI spending维持增速,都会一直把这个overbuild的时间线往后续命
什么时候这个续命跟不上基建的速度了,overbuild就会慢慢开始浮现
但这其实是更利好于头部模型厂和应用层的,因为overbuild会导致数据中心毛利下滑,更多的推理利润都流入了头部的两家
SpaceX虽然现在规模还小,但在这个卷新建算力的市场里,执行力最强,成本最低,竞争力可能是最强的,也是野心和规划最大的,以后也必然是overbuild的最重要贡献者之一。
—-----------------------------------
开源模型的兴起,对闭源模型营收ARR会有影响吗?目前的格局是什么样的?
开源模型和闭源模型的差距会减小吗
开源模型的势头能不能持续,和开源模型的能力也有关系,我的观点是开源模型和闭源模型的差距会维持在6个月(Mythos 2月就出来了,被监管了),蒸馏主要是降本
模型进步的三个壁垒:算力scale,数据scale,自迭代
Openai和anthropic今年加起来花了一百多亿美元买数据,但国内现在也是要花几十亿美元买数据了,数据scale这个壁垒差距有缩小,但仍然是有的
算力方面,海外建数据中心 + 各个国家转口,GPU的禁令很大程度都被绕开了,等国产卡产能上来,算力壁垒也会继续缩小,目前算力数量级上的差距仍然维持
目前下一代模型的进步很大程度要依赖前一代模型的迭代(自迭代RSI),上一代模型越强,下一代就越强,差距要减小不容易
—-----------------------
至于闭源模型对开源模型ARR肯定是有影响的,但影响可能会比市场预期要小,起码一年之内冲击并不大,这里尝试一下大致定量分析
至于openrouter和Vercel上的开源模型token占比,从28%增长到62%,只能反应小微型企业/多模型用户在用中转站里的形势变化,其实绝大部分闭源token是无法显示的,这个抽样并不能完全作数
截至7月底的ARR,Anthropic大概是72~75B,Openai大概是45B
截至7月,全球所有开源收入加起来是10B左右,只算北美只有4B最多5B。按ARR收入来算,北美开源模型token factory + AWS bedrock开源 + Azure开源 ARR只有~4B,闭源120B,比例大概是3%
最大的x因素就是aws bedrock和azure,目前Q2来看,bedrock大概占aws AI的55%比例,~14B ARR,其中anthropic模型占80%左右,aws bedrock和azure开源模型加起来大概在1.5~2B ARR
中国开源3.5B分解一下,大概是智普$1B, 阿里1.2B,Deepseek 500m,kimi 300m,minimax 200m,美国分解一下,fireworks 1B,together 1.2B(开源推理只有0.5B),baseten 0.5B,加上其他地区的,加起来勉强10B
北美的token factory开源模型推理,26年上半年大概只增长了3倍(比如fireworks从10T+/300M ARR增长到40T/1B ARR),总体来说,和闭源模型的推理市场增速比较并没有显著优势
至于企业自己部署私有开源模型自己用,这条路从成本角度来说是行不通的(数据安全是另外的考虑),开源模型要是优化的不太好,成本甚至比闭源还高,不如交给token factory
美国开源的算力扩张,速度还是受限于算力,所以上不去,扩张速度和闭源比并没有优势。fireworks,baseten,together,融资都是1B规模的,按现在租算力价格,一年20B/GW,一年只能租不到0.5GW,算力增速其实不比闭源更快。要扩张只能让客户到azure/aws自带算力再来
中国的开源扩张速度倒是更快,但是同样token factory受限于算力,远远满足不了中国自己的需求,暂时无法大规模出海卖给美国。中国的token factory大大小小的差不多30家,已经卷成红海了,都是严重缺算力,谁有卡谁就能有收入
中国token出海另外一个风险是信任和政策风险问题,美国企业自己可能不敢用,中国也有可能不愿意自己模型被免费用拿不到收益,不过以后随着openrouter和vercel的中转站继续发展,即便有token无法出海的禁令,token出海也是拦不住的,毕竟开源token卖给美国的利润太高了
美国开源模型token工厂的问题在于,算力暂时有限,融资规模暂时也有限,扩张速度无法满足需求。就算是政策开放了中国开源token出海,短期算力也不够无法出去,这也是为什么Nvidia非常努力的扶持开源,甚至亲自下场加速这个进程(今天收购了hugging face)
—-----------
另外,闭源模型的防守策略也是很有力的,比如5.6 luna降价80%,价格就很有竞争力了
我们可以对比历史,这和移动互联网时代,高通对联发科使用多年的防守策略是完全一样的:
Sol相当于Snapdragon 8系:旗舰维持技术与品牌上限,数量和比例并不那么大
Luna相当于Snapdragon 4系:主动填满低价区间,不给低成本竞争者留利润池,大部分走量来自于此
和token分不同的tier一样,其实联发科的芯片是远远超出手机“够用”的范畴的,别说日常使用了,就算是打游戏的高负载场景,联发科十年前都和高通差的并不远了
所以token也是一样,value tier不会摧毁flagship tier的需求
高通和联发科的攻防战持续了15年,高通靠着这样的策略仍然维护了自己的市场占有率,高端芯片毛利率保持的也不错,仍然是安卓阵营旗舰机第一选择
所以从历史来看,开源对闭源的冲击有影响,不会影响历史进程
—-------------------
另外一个和开源相关的问题就是,tokenmaxxing潮流的结束,对ARR的增速会有影响吗?
我认为tokenmaxxing只是短期的公司为了内部推广的目的,目前部分美国硅谷大厂确实对员工日常使用有限制额度,但这个额度非常高,大概是一个月10k~20k美元,95%以上的员工实际上根本用不完,而且中位数实际上很低,仍然有很多增长空间,目前对token的使用仍然处于边际正收益仍然很大的阶段
—--------------------------------
总的来说
AI基建的前景之所以扑朔迷离,泡沫之争比互联网基建时代更激烈,主要是因为算力支出的可见度是确定的,而需求的可见度不高所以有巨大的不确定性,而中间还隔了一层收入和支出的时间错配带来的金融风险,这个基建金融风险还随着各方“加注”的不断加大,上升到了甚至能影响国债发行的程度
但我还是认为,即便是以保守的没有任何新范式的base case来算,起码到2027~2028的基建是没有泡沫的
算力就是智能,智能就是巨大的收入。
AI token需求两个指数增长维度的迅速接力节奏是历史上绝无仅有的,万物数字化广义coding的需求才刚走完第一段,开源对利润分配的冲击是必然会发生,但不会影响整个进程大局
产业链角度和市场宏观角度,看到的风险和景气度感受是相反的,但两边的感受到的剧变同样剧烈:近处的人看见的是不够,远处的人看见的是太多
算力变成了判断/认知token,需求如何推演,天花板如何计算,没有任何历史参照,我们真正在争论的,从来不是这个数字对不对,而是该用什么时间单位去看待它
而这一点本身,恰恰说明了它有多大:只有真正的相变,才会让所有旧的历史参照同时失效
支出的可见度制造了今天的恐惧,而需求的不可见度,恰恰隐藏着这个时代最大的机会,看不清路径,并不一定意味着看错了方向
每一条S型指数曲线终会走到尽头
但文明发展从来没有停在任何一条曲线的尽头
—--------------------------------------
开源对半导体的影响如何?
半导体Capex内战谁会是赢家?如果内存存储吃掉了太多利润,会发生什么?
本篇已经太长,这两个话题就顺延到下一篇
点击图片查看原图
点击图片查看原图
点击图片查看原图
点击图片查看原图