寒序科技近期发布了uHBM与uLPU推理计算架构,希望将大规模模型推理的方向从“提高数据传输速度”转变为“减少数据移动”。首代uHBM架构具有24TB/s的片内权重读取带宽,而uLPU则设定了在4B多模态主干解码过程中超过2000 Tokens/s的性能目标。目前,这些工程产品已进入流片前的测试阶段,相关指标正在等待完整的硅片和系统验证。

大模型推理中的一个重要成本是权重的传输。虽然FP4权重仅占4bit,单次传输对性能影响微乎其微,但在解码阶段,每生成一个Token,需要从数十亿个权重中频繁读取数据,导致大规模模型与Token数量的增加下存储和计算之间的压力加大。传统方法是加宽这条数据传输道路,而寒序科技则提出了一种新的思路:减少数据移动的需求。该公司将模型权重常驻于持久性MRAM阵列中,并在同一计算内存芯片内完成矩阵-向量运算,只有较小的激活向量在系统中传递。

寒序称这一创新为“重新定义HBM”,高带宽的传输不再局限于存储器与GPU接口之间,而是深入到权重所处的芯片内部。以uHBM为基础的uLPU则使得整个推理芯片围绕驻留的权重状况组织计算。因此,uHBM的核心是让权重留在原地,而uLPU则围绕权重进行运算。 球友会

uHBM的主要设计在于高带宽,满足了片内权重读取与计算。其设计的 In-Die Read Bandwidth达到24TB/s,从而使权重的高效读取和计算得以实现。同时,uHBM提供多种接口方案,如UCIe、LPDDR5X、GDDR7等,以便与GPU、NPU等设备协同工作。

在uLPU的设计中,uHBM的权重驻留与NPU协同,使得NPU负责Prefill、Attention及动态控制等任务,而高带宽敏感的FFN和GEMV等运算则在uHBM内进行。云端uLPU将uHBM和其他模块组合,以扩展更大的系统。

寒序科技的目标是保证高带宽存取路径上的权重保持不变,同时让更动态的任务交由合适的计算单元执行。针对用户较易理解的性能指标,寒序设定了uLPU在4B多模态主干模型的解码阶段达到2000 Tokens/s的目标。 球友会

此次发布不仅关注单一芯片的性能,还扩展到整个系统架构,从uHBM到uLPU再到模块化和机柜设计。其底层逻辑始终如一,即权重长期驻留,外部则进行更小的激活信号和结果传递。当产品设计从芯片延展到机柜时,面临的挑战也从单一带宽问题扩展到了供电、散热、信号完整性等多方面。

总的来说,寒序科技不仅重新定义了HBM架构,也创新了LPU的设计理念,为未来的AI推理系统铺平了道路。