
清华大学研究人员发表论文,介绍了一种名为“Cache-to-Cache”(简称C2C)的技术,允许独立的人工智能模型在不生成任何文本的情况下直接交换信息。该成果已被ICLR 2026会议接收,相关代码已向开发者开源。
跳过文本生成,直连模型缓存
C2C旨在解决多个语言模型在共享管道协作时的效率瓶颈。传统模式下,一个模型需将思考过程转化为书面文本,另一模型读取后才能继续。这一过程不仅消耗计算时间,还会丢失原始思维中的细节。
每个AI模型都保留着对已处理内容的“工作记忆”,即技术上的“缓存”(cache)。C2C通过小型辅助程序“Fuser”,将一个模型的缓存直接传递并重塑为第二个模型可用的格式,从而完全跳过文本生成环节。由于不同模型的内部存储结构差异巨大,直接转储可能导致接收方混乱,因此C2C内置智能过滤器,决定哪些数据值得立即吸收,同时保护部分层级不受干扰以维持独立推理。
研究显示,该机制使AI模型在协作任务中的运行速度提升了100%至150%,最快可达传统文本交互方式的2.5倍。在准确率方面,协同工作的模型比完全独立运行时最高提升14.2%;与仍通过文本通信的旧模式相比,准确率提高了3.1%至5.4%。
局限性与待验证项
目前,该方法仅适用于开放权重模型,因其需要直接访问模型的内部缓存和层级结构。大多数面向公众的商业AI工具隐藏了这些内部细节,除非开发者私下集成,否则日常应用无法利用此捷径。目前尚不清楚是否有公司内部已在采用类似方案。
研究团队认为,强制机器通过文本语言通信拖慢了处理速度,因为这迫使机器模仿人类的线性表达。鉴于该系统由同一团队构建并测试,其性能提升的实际效果仍有待外部独立测试的进一步验证。