
微小的基础设施故障可能导致数千个互联GPU停滞,在漫长的重启过程中,巨额算力成本随之蒸发。为解决这一运营难题,Clockwork近日宣布完成3100万美元新融资,旨在推出先进的弹性软件,在硬件崩溃前捕获并处理训练异常。
AI训练中的高昂故障代价
扩展AI系统成本高昂且复杂。在成千上万个互联芯片上训练超大规模模型时,同步至关重要。单台服务器冻结即可导致整个分布式工作负载停摆。
传统修复方式依赖重新加载检查点(checkpoint),这种笨拙的流程迫使企业放弃数小时的有效计算成果。Meta曾报告,在Llama 3模型训练期间,约每三小时就会遭遇一次意外崩溃。在竞争激烈的科技环境中,让昂贵的硅芯片在重启期间空转已不可持续。
构建AI容错安全网
Clockwork的策略并非防止硬件故障,而是通过软件层屏蔽损害。其核心工具TorchPass和LinkPass在硬件与工作负载间充当智能缓冲层:若网络链路中断,LinkPass立即重路由流量;若GPU故障,TorchPass将任务平滑迁移至健康芯片。此外,该公司还推出了行业首创功能,支持在不修改代码的情况下对运行中的任务进行多节点快照。
巨头验证与资本加持
该技术已在实战中得到验证。LinkedIn在其系统中部署该容错层后,每月避免了数万小时的GPU时间浪费,将原本可能引发运营危机的中断转化为常规维护。Together AI和WhiteFiber等云服务商也采用了这项技术,以确保持续可靠的计算能力供给。
本轮融资由Premji Invest和Wing Venture Capital联合领投,Clockwork总融资额已达7300万美元。随着模型规模指数级增长,硬件故障概率趋近必然。Clockwork将利用新资金重写基础设施弹性规则,确保昂贵芯片持续产出有效工作,而非陷入重启循环,为下一代AI发展提供关键生存机制。