2026-09-27 00:26:10
LongCat-2.0,昇腾将MoE专家计算与Dense层计算拆分为独立计算流,片立
7月6日消息,功华
Prefill阶段融合流水线并行与序列并行双重策略,为首Decode阶段采用128卡超大规模专家并行EP部署。开美
业内人士表示,昇腾有效支撑大规模分布式推理。片立总参数量达1.6万亿,功华原生支持100万Token超长上下文。为首Prefill阶段采用FlashComm算法降低Vector算力消耗。开美LongCat-2.0基于昇腾Atlas A2 192卡集群部署,昇腾将模型划分为8个独立计算Stage,片立为AI算力国产替代提供了可复用的功华技术范本。最终实现TPOT时延仅20ms。为首Decode阶段利用A2超大L2 Cache优势实现模型权重异步预取,开美Prefill阶段采用64张昇腾A2协同调度,
算法层面,标志着国产芯片已具备承载万亿参数大模型推理任务的能力,华为CANN(昇腾AI异构计算架构)团队首次公开披露了美团万亿参数大模型LongCat-2.0在昇腾A2芯片上的完整部署方案。此次华为首次公开昇腾A2完整部署方案与技术细节,
LongCat-2.0是美团继1月发布LongCat-Flash-2601后又一次重磅开源。单机16卡。最大限度利用芯片带宽与算力。
CANN推理团队针对LongCat-2.0的MoE超稀疏专家架构与百万级长序列进行了系统级优化。
此次公开的部署细节显示,该模型是业界首个完全基于国产算力完成训练与推理全流程的万亿参数模型。测试版本在OpenRouter总调用量已跻身全球前三。
Decode阶段根据序列长度差异化切分,
计算流调度上实现计算与通信双流并行,短请求采用DP128+EP128方案,压缩MoE通信耗时10倍。超长序列采用DP16CP8+EP128方案,
昇腾A2单卡内置高速网卡可提供200Gbps传输带宽,加速矩阵运算。
奔驰CLA辅助驾驶频繁故障 高速偶发自动急刹或无法刹车!车主索要数据被拒
2026-09-26 23:53
2026-09-26 23:41
首破13600MT/s大关!DDR5超频世界纪录刷新:CL68下达成
2026-09-26 23:39
宝马新款X5前脸造型引热议 网友戏称撞脸猪:一旦接受设定无法直视
2026-09-26 23:34
2026-09-26 23:30
2026-09-26 23:24
2026-09-26 22:54
马斯克紧急限流特斯拉员工AI开支:每周使用费封顶200美元 xAI测试版除外
2026-09-26 22:45
荣耀WIN游戏本 H9三角洲行动职业赛事联名款即将登场,搭载 RTX 5070显卡
2026-09-26 22:40
2026-09-26 22:29
2026-09-26 22:23
2026-09-26 22:13
神力科莎 EVO 0.8版本更新:包含三款新车、全新基亚拉米赛道
2026-09-26 22:13
格瓦迪奥尔:克罗地亚是一种情感和精神,我们坚持信念到最后一刻
2026-09-26 22:10
2026-09-26 22:09
双剑齐发!一加Ace 7重启Pro版:拿下全新骁龙8系首发权
2026-09-26 21:50