智快网
快讯 行业 产业 汽车 科技 AI+ 热点

摩尔线程助力DeepSeek,开源DeepEP与DualPipe提升AI训练效率

2025-02-28来源:ITBEAR编辑:瑞雪

在DeepSeek开源周的精彩延续中,摩尔线程于近日宣布了一项重大进展——成功集成并开源了针对DeepSeek通信库DeepEP与并行算法DualPipe的支持。这一成果标志着摩尔线程在推动大模型训练与推理效率方面迈出了坚实的一步,相关开源代码仓库MT-DeepEP与MT-DualPipe也随之亮相。

DeepEP,这一专为混合专家(MoE)模型设计的开源通信库,通过优化通信信道的使用,显著提升了大模型训练的效率,特别是在集群训练中展现出卓越性能。摩尔线程凭借MUSA Compute Capability 3.1全功能GPU的强大实力,成功适配了DeepEP,并引入了一系列创新特性,包括高效优化的All-to-All通信机制、MTLink + GPU节点内通信支持、高吞吐量与低延迟计算核心的灵活切换、原生FP8数据分发能力,以及GPU资源的灵活调度,实现了计算与通信的高效协同。

另一方面,DualPipe作为DeepSeek-V3的核心算法,通过实现前向与后向计算阶段计算与通信的完全重叠,有效减少了“流水线气泡”,即设备空闲等待时间,从而进一步提升了训练效率。摩尔线程依托其深度学习框架Torch-MUSA(已开源)及MUSA软件栈的全面兼容性,成功实现了对DualPipe算法的支持。目前,MT-DualPipe已无缝接入摩尔线程的MT-Megatron与MT-TransformerEngine框架(后者即将开源),能够完整复现DeepSeek V3的训练流程。

值得注意的是,MT-DualPipe与MT-Megatron的结合,不仅实现了DeepSeek V3模型中MLP-FFN与DW-DG的分离,进一步降低了气泡占比,还优化了通信效率。同时,MT-DualPipe与MT-TransformerEngine及MT-DeepEP的协同工作,借助MT-DeepEP的异步通信引擎,实现了更高效的通信掩盖,有效降低了对计算资源的损耗。这一系列创新技术的融合,无疑为摩尔线程在大模型训练与推理领域的发展注入了强劲动力。

对于有志于探索大模型训练与推理技术的开发者而言,摩尔线程的开源成果无疑提供了一套强大的工具集。Torch-MUSA开源地址的公布,更是为开发者们打开了一扇通往高效深度学习实践的大门。

华为Mate X7或本月登场 首发20GB超大内存 配色丰富性能强劲
11月份的机圈将会是华为的主场,不仅新一代的直板旗舰华为Mate80系列会震撼亮相,还会有迭代的大折叠屏手机华为Mate X7发布。@定焦数码爆料,华为Mate X7将会首发定制20GB超大内存,这是华为史…

2025-11-15

安谋科技发布“周易”X3 NPU IP,端侧AI性能飙升助力多领域落地
智东西11月14日消息,昨日,安谋科技正式发布了专为端侧大模型而生的最新一代NPUIP——“周易”X3,其能够与Arm架构CPU、GPU协同,组成基于Arm生态的异构算力解决方案。 新的“周易”X3 NP…

2025-11-14

Steam Frame登场 Valve停产Index VR头显 开启VR新征程
用户可通过无线适配器,将 PC 或 Steam Machine 上的平面屏(flatscreen)及 VR 游戏串流至 SteamFrame;与此同时,Steam Frame 本身也是一款独立设备,搭载高通…

2025-11-14

华为Mate70 Air深度体验:打破常规,超大屏“Air”的另类演绎
可以确定,华为Mate70 Air的影像没有因为“Air”的定义做妥协,在同价位机型中是能打的,硬件配置方面也是这个思路。这也符合华为Mate70 Air的技术路径,虽然重量不可避免地来到208g,但是保…

2025-11-14

欧加9K级大电池定版试产,一加骁龙8系直屏新机测试,中端机竞争升级
IT之家 11 月 14 日消息,博主 @数码闲聊站 今天在微博透露,欧加的 9K 级别大电池现已定版试产。 博主表示,这块电池采用单块4.51V 单电芯设计,额定容量 32.59Wh,额定电池 8760m…

2025-11-14

联发科天玑8系芯片屠榜安卓次旗舰性能榜 性能能效双优成市场新宠
以榜单第一的真我Neo7 SE为例,通过与MTK联发科技的深度联合调校,该机在同价位段中展现出极为出色的游戏性能,搭配真我GT性能引擎,通过芯片级调校,实现了持久稳定的高帧率表现,同时能耗最高可降低7%,帧…

2025-11-14

四名MIT辍学00后,两年打造AI编程神器,估值冲300亿成资本新宠
两年前,在完成种子轮融资后,创始人曾写了这样的期待—— Cursor的诞生,推动了「氛围编程」(vibe coding)在全球兴起。 他还在创纪录的时间内,完成了一份手写编程测试,给早期Facebook投资…

2025-11-14

iPhone 17系列发售不到俩月,中国市场激活量破1000W,双十一销量也亮眼
11月14日,数码博主“数码闲聊站”发文透露iPhone17系列于本周完成中国市场激活1000W+。 iPhone17系列9月19日正式发售,如今距发售不到两个月。 该博主此前曾透露,截至11月2日,iPh…

2025-11-14

荣耀500 Pro配置亮点全揭秘:骁龙8至尊版+2亿主摄+8000mAh长续航
【CNMO科技消息】11月14日,有数码博主曝光了荣耀500Pro的核心参数。CNMO注意到,新机将搭载骁龙8至尊版移动平台,电池容量达到8000mAh,主打2亿像素大底主摄。 除了上述核心亮点外,荣耀50…

2025-11-14

苹果iPhone 17系列发售不到俩月 中国市场激活量或破千万
苹果 iPhone 17 系列于今年 9 月 19 日正式发售,如今还不到两个月。 该博主曾透露,截至 11 月 2 日,苹果 iPhone17 系列国内激活销量超 825 万。具体数据如下: iPho…

2025-11-14