华创证券:DeepSeek开源周发布五大AI基础优化方案
创始人
2025-03-03 19:00:50
0

财中社3月3日电事项:

2025年2月24日至2025年2月28日,DeepSeek举行为期五天的“开源周”,连续开源五个软件库,旨在以完全透明的方式与全球开发者社区分享其在通用人工智能(AGI)领域的研究进展。五个软件库向业界展示了一套重塑AI基础设施效率的全景方案,涵盖底层加速解码、专家并行通信、核心矩阵运算、分布式训练的流水线优化、数据处理系统的构建,共同构筑了一个面向大规模AI的高性能基石。

华创证券发表评论:

显存的“节流阀”:FlashMLA是一种专为NVIDIAHopper架构GPU优化的高效注意力解码内核,旨在提升大规模语言模型(LLM)在推理阶段的性能,尤其在处理可变长度序列时表现突出。FlashMLA能自行调配计算资源,通过动态资源分配优化显存使用,在H800集群上达到3000GB/s的内存限制性能和580TFLOPS的计算限制性能,实现了3倍显存利用率提升。

通信的“智能交通系统”:DeepEP是首个用于MoE(混合专家模型)训练和推理的开源EP通信库,它解决了MoE的通信瓶颈,支持优化的全对全通信模式,使数据能够在各个节点间高效传输。

矩阵运算的“编译器”:DeepGEMM作为矩阵乘法加速库,为V3/R1的训练和推理提供支持。DeepGEMM采用了DeepSeek-V3中提出的细粒度scaling技术,将FP8引入GEMM内核,仅用300行代码就实现了简洁高效的FP8通用矩阵乘法。DeepGEMM支持普通GEMM以及专家混合(MoE)分组GEMM,在HopperGPU上最高可达到1350+FP8TFLOPS(每秒万亿次浮点运算)的计算性能,在各种矩阵形状上的性能与专家调优的库相当,甚至在某些情况下更优,且安装时无需编译,通过轻量级JIT模块在运行时编译所有内核。

并行训练的“指挥”:DualPipe和EPLB旨在解决大模型分布式训练中的并行调度和负载均衡问题。DualPipe是一种用于V3/R1训练中计算与通信重叠的双向管道并行算法,通过实现向前与向后计算通信阶段的双向重叠,将硬件资源利用率提升超30%,减少资源浪费。EPLB是一种针对V3/R1的专家并行负载均衡器。基于混合专家(MoE)架构,它通过冗余专家策略复制高负载专家,并结合启发式分配算法优化GPU间的负载分布,减少GPU闲置现象。

AI专属的分布式文件系统:3FS是一个专为AI训练和大数据处理设计的高性能并行分布式文件系统,能实现高速数据访问,提升AI模型训练和推理的效率。性能方面,3FS在180节点集群中实现了6.6TiB/s的聚合读取吞吐量;在25节点集群的GraySort基准测试中达到3.66TiB/min的吞吐量;每个客户端节点在KVCache查找时可达到40+GiB/s的峰值吞吐量。

相关内容

热门资讯

新版有挂开挂!极速猜一猜暗堡辅... 极速猜一猜暗堡辅助是一款专注玩家量身打造的游戏记牌类型软件,在极速猜一猜暗堡辅助这款游戏中我们可以记...
证实有挂开挂!极速鱼虾蟹辅助,... 您好:极速鱼虾蟹辅助这款游戏可以开挂的,确实是有挂的,很多玩家在这款游戏中打牌都会发现很多用户的牌特...
有挂规律辅助!欢乐达人正版脚本... 您好:欢乐达人正版脚本这款游戏可以开挂的,确实是有挂的,很多玩家在这款游戏中打牌都会发现很多用户的牌...
有挂方法辅助!微信小程序加速脚... 有挂方法辅助!微信小程序加速脚本,情怀打七开辅助(1.9分钟了解开挂辅助神器) >>您好:软件加薇1...
有挂分析辅助!大唐辅助器免费版... 有挂分析辅助!大唐辅助器免费版得,人人燕赵辅助下载(透视了解开挂辅助安装)相信很多朋友都在电脑上玩过...
有挂教学开挂!决战辅助软件,微... 有挂教学开挂!决战辅助软件,微信开心泉州辅助(分享开挂内幕开挂辅助下载);无需打开直接搜索打开薇:1...
的确有挂开挂!葫芦娃七子连心攻... 的确有挂开挂!葫芦娃七子连心攻略,有没有人会衢州都莱的辅助(透视美元局开挂辅助下载)1、下载安装好葫...
有挂工具开挂!微信小程序雀神麻... 您好:这款微信小程序雀神麻将好运来游戏是可以开挂的,确实是有挂的,很多玩家在这款微信小程序雀神麻将好...
揭秘有挂辅助!四川家园游戏辅助... 揭秘有挂辅助!四川家园游戏辅助软件,四川游戏家园破解版(一分钟秒懂开挂辅助神器);亲,四川家园游戏辅...
有挂讲解开挂!挂是真的假的,决... 有挂讲解开挂!挂是真的假的,决战卡五星有挂吗(透视教学开挂辅助平台) 【无需打开直接搜索加薇1367...