AI 同时满足了一个中间商市场繁荣的所有条件:技术变化足够快,信息差足够大,资本足够多,故事足够性感。如果把大模型训练、推理、应用整条产业链拆开来看,有些价值上百亿美金的机会是3年之前甚至完全不存在的。最典型的就是推理工程。
三年前这个词几乎没人提,今天它已经是独立学科:核心问题是把训好的权重,变成又快、又稳、又便宜的生产级API。几个关键概念,看完就知道为什么中间商能吃这么大:
- Prefill vs Decode 分离
输入很长时,先算一遍整个prompt(prefill),再一个个生成token(decode)。两者算力特征完全不同,现在直接拆到不同GPU上跑,效率暴增。
- Cache-aware Routing + KV Cache复用
用户发来20万token的请求,系统先问:这段内容我之前算过吗?有现成KV Cache就直接跳过重复计算。缓存命中率决定成本和延迟。
- Speculative Decoding(投机解码)
用一个小模型先猜大模型接下来要说什么,猜对了就直接用,猜错了再纠正。小模型便宜,而且整体速度可提升2-3倍。
- 量化(Quantization)
把模型从FP16压到FP4/FP8,很多人以为精度必掉。但实际中不同层的误差会相互抵消,有时吞吐量涨20%,基准分数几乎不变。
- Day-0支持新模型
开源模型一发布,中间商要在几小时内完成量化、投机头训练、内核适配、多机并行……否则就错过热度。这本身就是一门高壁垒手艺。
这些优化叠加起来,能把同一个模型从30-40 tokens/s 推到300-400 tokens/s,最高近10倍。中间层吃的,就是这从能跑到跑得极致的巨大价差。
技术变化越快,信息差越大,中间商越香。推理工程只是这条链上最早长出百亿公司的典型例子,后面还会有更多此类初创公司出现。