10万芯片上,模型自己优化自己:吞吐3倍


Z.ai 公布了一项内部实验:让 GLM-5.3 驱动的 Infra Agent 去设计、调试并优化 GLM-5.3-Flash 的生产推理基础设施。这套基础设施覆盖 100,000+ 中国芯片 。 结果出现在不到两周内——吞吐量达到初始基线的 3 倍 。硬件效率和单 token 成本,据称与主流 Nvidia GPU 相当。 模型改自己的跑道 这件事的特殊之处在于对象。Infra Agent 优化的不是别人的系统,而是运行它自己这一代模型推理的那套基础设施。Z.ai 团队把这种模式称为"递归自我改进"——模型改进运行自身的基础设施。 换句话说,被优化的对象和优化的工具,来自同一个模型家族。GLM-5.3 负责决策,GLM-5.3-Flash 是被服务的推理目标。 两周与10万颗芯片 两个数字值得单独看。一个是时间:不到两周。另一个是规模:100,000+ 中国芯片。在这套国产硬件组合上,团队给出的对标对象是主流 Nvidia GPU,比较维度是硬件效率和单 token 成本。 Z.ai 没有披露具体的芯片型号、Agent 的决策过程,也没有给出成本对比的原始数据。目前公开的只有结论本身。 特别

about image