10万张国产卡撑起智谱新模型线上流量 港股大涨11%
创始人
2026-08-28 09:00:49
0

8月26日,智谱上线并开源GLM-5.3-Flash (320B-A18B),这是GLM-5系列的首个原生多模态模型。GLM-5.3-Flash定价为1/10的GLM-5.3,限时折扣内为1/20的GLM-5.3。 为收集广大用户的广泛、专业反馈,智谱在正式发布前,以匿名模型Ox-Alpha(中文社区称作牛来)在OpenCode和OpenRouter上进行了大规模测试。这些请求流量全部由10万张国产芯片承载。 GLM-5.3-Flash在各项基准测试和实际使用中,全面超越参数量高出一倍的GLM-5.2,定价却仅为后者的1/10。这得益于其全新模型架构。GLM-5.3-Flash的架构专为极低成本而设计,总参数量与GLM-4.5相当(355B vs. 320B),但激活参数量(32B → 18B)与层数(92 → 45)几乎减半。结合智谱最新的30T Token多模态预训练语料,GLM-5.3-Flash能够以更少的计算资源实现更强的性能。 GLM-5.3-Flash同时进行了多项架构升级,是首个采用稀疏注意力与线性注意力混合架构的开源前沿模型,在保持精准长上下文能力的同时,大幅降低长上下文服务成本;并采用流形约束超连接(Manifold-Constrained Hyper-Connections,mHC)提升模型Scaling能力。具体技术细节见Blog:https://z.ai/blog/glm-5.3-flash。 极致低成本架构 为降低模型长上下文场景下的注意力成本,智谱采用线性注意力与稀疏注意力相结合的混合架构。其中,线性注意力通过递归机制捕获局部依赖关系,稀疏注意力则借助轻量级索引器召回全局上下文。智谱引入IndexPool为进一步降低1M上下文下索引器的时延与内存开销,通过加权池化将索引器的4个缓存向量压缩为1个。 代码循环中的视觉反馈 GLM-5.3-Flash是GLM-5系列的首个原生多模态模型。视觉编码(Visual Coding)并不只是处理图像,它拓展编程所能触及的边界。对于前端开发、游戏开发、3D仿真等任务而言,最终产物包括用户能够感知的界面、交互或虚拟世界,视觉能力被原生集成进模型中,使其能够自主判断何时需要“观察”,并利用视觉反馈来指导下一步行动。 智谱针对视觉编码开发了数据合成流水线,重点聚焦于模型的自我视觉判断与测试时改进。最终生成的轨迹要求模型与环境交互、检视自身输出,并进行迭代式改进。在前端Coding方面,智谱还探索基于环境反馈的强化学习,并通过基于真实用户流程的Agent验证,进一步强化GUI判断能力。这将验证的范畴从功能正确性延伸至渲染效果与交互体验层面。 令人意外的是,Coding为模型提供了一种表达并检验其世界知识的代理。在Blender中构建一个连贯的场景,需要将几何、材质、光照与空间等知识转化为一个在不同视角下都保持一致的3D结构。在没有任何外部素材的情况下,GLM-5.3-Flash自主运行16个小时搭建了一套约400平方米的专业主厨自宅与测试厨房。 在ZCode中,Browser Use Agent(BUA)与Computer Use Agent(CUA)进一步拓展多模态能力,使模型能够在代码、浏览器与图形界面之间协同工作,同时观察并验证自身的输出结果——许多问题只有在渲染、交互或试玩过程中才会暴露出来。以下是在ZCode中使用GLM-5.3-Flash实测合集:从图像到可运行工程,从两小时电影到8分钟成片,以及可直接交付的白领专业文档。 超越Coding的工作伙伴 GLM-5.3-Flash在专业工作中的表现相较同级别模型显著提升。针对PPTX、PDF、DOCX和XLSX等Office与文档类任务,新增的视觉理解能力使模型能够检查并优化自身输出,并具备更强的审美判断。模型还可以将自己的输出结果与视觉上下文以及预期的结果进行对比,从而实现更有效的自我验证和优化——包括更准确的呈现质量评估以及审美判断。 智谱专门针对金融、法律等专业工作进行优化。在金融方面,GLM-5.3-Flash可以覆盖从基于来源的金融研究、报告生成到金融建模与分析的完整流程,在整个过程中提供可追溯的参考依据。在法律方面可以审查合同中的费用、账户与责任条款,并按律师惯例批注留痕。它也能起草律师函、合同与诉讼文书,格式与版式符合实务规范,生成即可交付。 跑在国产芯片上 过去一周,智谱首次在大规模流量中尝试用大国产芯片集群提供服务,这些芯片通过自研高带宽互联网络连接。 为克服单张芯片算力与内存容量相对有限的问题,智谱在SGLang基础上构建了专用的推理引擎。值得一提的是,整个构建工作由GLM-5.3驱动的infra agent 大大加速,它协助工程师开发与优化算子、诊断性能瓶颈、改进部署服务栈,形成了“模型优化系统,系统承载模型”的正向循环。 这些芯片主要瓶颈在于内存容量与带宽,尤其是支持长达1M上下文长度很有挑战。这要求智谱针对底层架构进行激进的内存优化,包括以算力换带宽、以通信换显存等定制优化。智谱的技术栈结合了用于线性注意力和LM head的节点内张量并行、ReplaySSM、W8A8量化、INT8/FP8/BF16混合缓存量化,以及Layer Split等技术。 在集群层面,智谱采用生产级Encode–Prefill–Decode(EPD)分离式架构,将多模态编码、prompt预填充和逐token解码拆分为可独立调度、独立扩缩容的工作池,从而在国产加速芯片上实现了高效、可靠的服务。 与同一硬件上的初始基线相比,端到端服务性能提升了3倍,硬件效率和单token成本已达到与主流GPU相当的水平。这证明国产芯片完全可以在大规模场景下高效、经济地支撑前沿模型的推理需求。 现在,GLM-5.3-Flash正式面向全球开源,已接入ZCode等编码平台,并纳入GLM Coding Plan(每天限量发放10,000张体验卡),同步开放API调用。(cis)

8月26日,智谱上线并开源GLM-5.3-Flash (320B-A18B),这是GLM-5系列的首个原生多模态模型。GLM-5.3-Flash定价为1/10的GLM-5.3,限时折扣内为1/20的GLM-5.3。

为收集广大用户的广泛、专业反馈,智谱在正式发布前,以匿名模型Ox-Alpha(中文社区称作牛来)在OpenCode和OpenRouter上进行了大规模测试。这些请求流量全部由10万张国产芯片承载。

GLM-5.3-Flash在各项基准测试和实际使用中,全面超越参数量高出一倍的GLM-5.2,定价却仅为后者的1/10。这得益于其全新模型架构。GLM-5.3-Flash的架构专为极低成本而设计,总参数量与GLM-4.5相当(355B vs. 320B),但激活参数量(32B → 18B)与层数(92 → 45)几乎减半。结合智谱最新的30T Token多模态预训练语料,GLM-5.3-Flash能够以更少的计算资源实现更强的性能。

GLM-5.3-Flash同时进行了多项架构升级,是首个采用稀疏注意力与线性注意力混合架构的开源前沿模型,在保持精准长上下文能力的同时,大幅降低长上下文服务成本;并采用流形约束超连接(Manifold-Constrained Hyper-Connections,mHC)提升模型Scaling能力。具体技术细节见Blog:https://z.ai/blog/glm-5.3-flash。

极致低成本架构

为降低模型长上下文场景下的注意力成本,智谱采用线性注意力与稀疏注意力相结合的混合架构。其中,线性注意力通过递归机制捕获局部依赖关系,稀疏注意力则借助轻量级索引器召回全局上下文。智谱引入IndexPool为进一步降低1M上下文下索引器的时延与内存开销,通过加权池化将索引器的4个缓存向量压缩为1个。

代码循环中的视觉反馈

GLM-5.3-Flash是GLM-5系列的首个原生多模态模型。视觉编码(Visual Coding)并不只是处理图像,它拓展编程所能触及的边界。对于前端开发、游戏开发、3D仿真等任务而言,最终产物包括用户能够感知的界面、交互或虚拟世界,视觉能力被原生集成进模型中,使其能够自主判断何时需要“观察”,并利用视觉反馈来指导下一步行动。

智谱针对视觉编码开发了数据合成流水线,重点聚焦于模型的自我视觉判断与测试时改进。最终生成的轨迹要求模型与环境交互、检视自身输出,并进行迭代式改进。在前端Coding方面,智谱还探索基于环境反馈的强化学习,并通过基于真实用户流程的Agent验证,进一步强化GUI判断能力。这将验证的范畴从功能正确性延伸至渲染效果与交互体验层面。

令人意外的是,Coding为模型提供了一种表达并检验其世界知识的代理。在Blender中构建一个连贯的场景,需要将几何、材质、光照与空间等知识转化为一个在不同视角下都保持一致的3D结构。在没有任何外部素材的情况下,GLM-5.3-Flash自主运行16个小时搭建了一套约400平方米的专业主厨自宅与测试厨房。

在ZCode中,Browser Use Agent(BUA)与Computer Use Agent(CUA)进一步拓展多模态能力,使模型能够在代码、浏览器与图形界面之间协同工作,同时观察并验证自身的输出结果——许多问题只有在渲染、交互或试玩过程中才会暴露出来。以下是在ZCode中使用GLM-5.3-Flash实测合集:从图像到可运行工程,从两小时电影到8分钟成片,以及可直接交付的白领专业文档。

超越Coding的工作伙伴

GLM-5.3-Flash在专业工作中的表现相较同级别模型显著提升。针对PPTX、PDF、DOCX和XLSX等Office与文档类任务,新增的视觉理解能力使模型能够检查并优化自身输出,并具备更强的审美判断。模型还可以将自己的输出结果与视觉上下文以及预期的结果进行对比,从而实现更有效的自我验证和优化——包括更准确的呈现质量评估以及审美判断。

智谱专门针对金融、法律等专业工作进行优化。在金融方面,GLM-5.3-Flash可以覆盖从基于来源的金融研究、报告生成到金融建模与分析的完整流程,在整个过程中提供可追溯的参考依据。在法律方面可以审查合同中的费用、账户与责任条款,并按律师惯例批注留痕。它也能起草律师函、合同与诉讼文书,格式与版式符合实务规范,生成即可交付。

跑在国产芯片上

过去一周,智谱首次在大规模流量中尝试用大国产芯片集群提供服务,这些芯片通过自研高带宽互联网络连接。

为克服单张芯片算力与内存容量相对有限的问题,智谱在SGLang基础上构建了专用的推理引擎。值得一提的是,整个构建工作由GLM-5.3驱动的infra agent 大大加速,它协助工程师开发与优化算子、诊断性能瓶颈、改进部署服务栈,形成了“模型优化系统,系统承载模型”的正向循环。

这些芯片主要瓶颈在于内存容量与带宽,尤其是支持长达1M上下文长度很有挑战。这要求智谱针对底层架构进行激进的内存优化,包括以算力换带宽、以通信换显存等定制优化。智谱的技术栈结合了用于线性注意力和LM head的节点内张量并行、ReplaySSM、W8A8量化、INT8/FP8/BF16混合缓存量化,以及Layer Split等技术。

在集群层面,智谱采用生产级Encode–Prefill–Decode(EPD)分离式架构,将多模态编码、prompt预填充和逐token解码拆分为可独立调度、独立扩缩容的工作池,从而在国产加速芯片上实现了高效、可靠的服务。

与同一硬件上的初始基线相比,端到端服务性能提升了3倍,硬件效率和单token成本已达到与主流GPU相当的水平。这证明国产芯片完全可以在大规模场景下高效、经济地支撑前沿模型的推理需求。

现在,GLM-5.3-Flash正式面向全球开源,已接入ZCode等编码平台,并纳入GLM Coding Plan(每天限量发放10,000张体验卡),同步开放API调用。(cis)

相关内容

热门资讯

严阵以待!宁德海事防台风Ⅰ级响... 注意安全 台风来袭,闻令而动、向险而行! 今年第十八号台风“沙德尔”逐渐逼近,闽浙沿海海上风雨形势...
原创 2... 现代人的安全感,全靠满格电量和坚固耐造给的!到了2026年,千元机市场早已脱胎换骨。今天就给大家盘点...
360筑牢算力底座,让AI赋能... 津云新闻讯:8月27日,“AI上天津”网络精品共创邀请赛在北京启动。会上,360集团纳米大片总经理吴...
马斯克、黄仁勋、奥特曼将齐聚G... 美国科技界重量级人物将齐聚北卡罗来纳州,推动G20成员国就一套以“轻监管”为核心的人工智能治理框架达...
10万张国产卡撑起智谱新模型线... 8月26日,智谱上线并开源GLM-5.3-Flash (320B-A18B),这是GLM-5系列的首...
哪里有广东工业检测用恒温恒湿试... 可靠性试验设备行业发展背景 随着国内制造业向高端化、品质化方向升级,新能源、电子电器、汽车制造、科研...
南国书香节港澳台馆展现多元文化... 广州8月27日电 (记者 蔡敏婕)“我们要让阅读变成一件有意思的事,成为大家生活里自主的选择。”香港...
浙江 | AI赋能制造业数字化... 近日,省经信厅印发《浙江省人工智能赋能制造业数字化转型实施方案(2026-2030年)》。 《实施...
科学家找到生菜美味又营养的基因... 近日,中国农业科学院都市农业研究所联合国内外科研单位,发现了改良生菜体内的营养和风味物质的基因密码。...
【前沿科技】我国首套,成功建成... 记者从中国中化获悉, 8月24日,中化国际乙烯-马来酸酐共聚物(EMA)项目装置实现全线贯通,首批合...