Futurum Group首席执行官Daniel Newman在X平台发文指出,目前AI代理(Agents)的AI使用频率已是人类用户的5倍,且这一比例正加速向10倍乃至更高水平攀升。

该观点援引了Andreessen Horowitz(a16z)基于OpenRouter数据发布的图表。数据显示,截至8月,AI代理的Token使用量高达7.3万亿次,而人类用户仅为1.4万亿次。在代理使用量首次超越人类后的六个月里,这一差距进一步扩大。自今年2月出现交叉点以来,代理的使用量一度达到人类的14倍,同期人类使用量增长2.8倍。

缓存主导:重读而非新生成

尽管用量激增,但这些代理大多只是在“重读”已处理过的内容。a16z指出,超过85%的代理Token源自缓存提示词(cached prompts)。OpenRouter作为领先的AI模型网关和路由平台,其洞察主管Peter Walker通过包含工具调用率、回合数等因子的7信号加权复合评分,将API密钥划分为代理型、混合型或人类型。数据显示,混合类别在同一时期增长了4.7倍。

值得注意的是,这些数据衡量的是Token数量而非实际花费金额。虽然缓存Token的处理成本远低于从头生成,但仍需占用大量内存。模型将上下文存储在KV缓存中,目前其增长速度已超出GPU高带宽内存(HBM)的承载能力。

硬件瓶颈:内存短缺迫在眉睫

一家使用租赁Nvidia H200芯片测试DeepSeek的呼叫中心咨询公司日志也印证了这一模式。其在9月份记录Claude Code的代理使用情况时发现,“所有输入中有96%是在重读旧的对话内容”。这表明,虽然Token数量可能夸大了账单规模,但由内存需求带来的硬件成本压力却是真实存在的。

目前,内存资源已十分稀缺。美光科技(Micron)预计,受AI数据中心优先获取HBM影响,2027年和2028年的RAM及存储短缺状况将进一步加剧,客户支付的价格也将高于今年。若Newman关于代理使用比例将升至10倍、20倍甚至30倍的预测成真,普通PC买家未来将面临与海量AI代理激烈竞争内存资源的局面。

此外,麦肯锡《2026年AI现状》调查显示,40%的大型组织受访者表示正在扩展AI代理应用,这一比例高于一年前的27%,侧面印证了代理使用规模的持续扩张。