研究了一下过去几年芯片和算力的供给情况。目前,市场上大约有 2000 万张 H100 等效卡的算力。按 Token 计算,年消耗量已经达到几十万亿亿 Token,相比去年增长了接近一个数量级。
过去三年,AI 芯片的算力供给每年大约增长 3 倍。但考虑到卡的数量增加、单卡性能提升,以及推理效率不断优化,实际能够对外提供的 Token 算力,年增长幅度可能接近 10 倍。
从 Chat 到 Coding,再到 Agent,每次产品形态升级,都会带来一轮新的需求增长。早期的 Chat,一次推理可能只需要几千 Token;到了 Coding,用户通过 Agent 完成一项任务,一次可能消耗几十万到几百万 Token;而 Agent 需要处理更长的上下文、调用工具,并进行多轮推理和验证,复杂任务的消耗可能达到千万甚至上亿 Token。
按照这个趋势,未来 Token 的需求大概率仍会保持指数级增长。那市场上会不会出现 Token 供不应求的情况?答案是会,而且现在其实已经长期处于紧平衡状态。需求突然上升时,市场通常会通过价格和延迟来调节:高价模型先涨价,低价模型则出现排队,同时也会有更多算力从训练逐步转向推理。
Token 的供给可以从四个层面来看:
1)电力和数据中心。这是最慢的一层。一个大型数据中心从电力指标、选址建设到最终投产,通常需要两三年。
2)芯片供给。Nvidia、Google、AMD 等厂商都在持续扩大产能,同时新一代芯片的性能也在不断提升。
3)模型和推理效率。同样一张卡,通过量化、缓存、推测解码等技术,可以生成更多 Token,单位算力的产出还会继续提高。
4)算力分配。目前仍有大量算力用于训练、RL 和各种实验。随着推理需求继续增长,部分存量算力会逐步从训练转向对外提供 Token。
从这个角度看,未来的 Token 可能会越来越像今天的电力和带宽。算力供给每增加一轮,很快就会有新的应用把这部分增量消耗掉。Chat 吃掉了第一波,Coding 吃掉了第二波,接下来 Agent 还会继续消耗新增的算力。