摩尔线程发布《MTT S5000 Prefill-as-a-Service技能白皮书》,给了一个算力分层方案 发布时间:2026-08-24 来历:转载 责任编纂:Lily 【导读】摩尔线程近来发布了一份技能白皮书,缭绕MTT S5000智算卡提出了一个叫“Prefill-as-a-Service”的方案。焦点逻辑不繁杂:年夜模子推理有两个阶段,Prefill算力密集型,Decode访存密集型,放于统一套硬件上跑一定互相华侈。摩尔线程的做法是把二者拆开,各跑各的资源池,MTT S5000专门卖力Prefill这一端,用高浓厚算力及原生FP8撑持来压榨首字时延。 配景:长上下文时代,“算力错配”成为推理成本的焦点瓶颈 跟着年夜模子输入上下文范围快速迈入数百K到1M 级别,长文本输入带来的算力耗损与首字时延压力连续爬升,正日趋成为制约企业推理办事效率与总拥有成本(TCO)的要害瓶颈。传统同构集群的算力部署模式,已经难以应答差别计较阶段对于硬件资源的差异化需求。 焦点痛点于在布局性错配:于年夜模子于线推理中,输入阶段的Prefill(预填充)属计较密集型使命,受浮点算力约束;输出阶段的Decode(解码)属访存密集型使命,受显存带宽约束。二者于统一物理资源池中混跑,一定致使双向华侈——按Decode带宽选型,则Prefill的年夜容量显存持久低效;按Prefill算力选型,则Decode计较单位年夜面积空转。 破局:Prefill-Decode异构解耦,重构推理资源池 《白皮书》指出,冲破这一瓶颈的要害于在将Prefill与Decode完全解耦,使两者各自运行于最契合自身计较特征的硬件资源池上: Prefill算力池:专攻高算力使用率与极低首字延迟(TTFT); Decode资源池:专攻高并发与不变的每一Token延迟(ITL)。 经由过程硬件分层投入,算力配置从“通用冗余”转向“按需匹配”,于满意办事质量(SLO)约束的条件下,实现单元Token基础举措措施成本年夜幅降落。 底座:MTT S5000修筑高吞吐Prefill专属算力池 作为一款全功效通用AI加快卡,MTT S5000于硬件特征上与Prefill使命高度契合,揭示出精彩的工程适配与范围化落地能力: 高计较密度,压缩首字时延。针对于Prefill的计较密集型特性,MTT S5000提供高浓厚算力,有用压缩首Token天生时延(TTFT);于长上下文场景下,以GLM-5.2为例,单机8卡可实现靠近十万级Prefill吞吐,为Agent、长文档阐发等营业提供确定性的SLO承诺与容量计划能力。 原生FP8撑持,消弭格局转换开消。撑持FP8至FP64全精度计较,自然适配主流年夜模子原生精度,Prefill历程不引入分外精度损耗;原生FP8 KV Cache与Decode池连结高度兼容,消弭跨节点传输前的格局转换成本,显著降低KV Cache传输时延。 生态成熟兼容,降低沉地门坎。依托MUSA软件生态,周全兼容CUDA和PyTorch、SGLang、vLLM等主流推理框架,企业可基在现有代码资产实现光滑迁徙与快速适配。 实考试证:严苛SLO约束下,64K上下文场景单机吞吐可到达5.8 MTokens TPM 《白皮书》基在超年夜参数模子智谱GLM-5.2-FP8,于90%前缀缓存掷中率、首字时延P50 TTFT ≤ 6,000ms的严苛硬性SLO约束下,完成为了64K至400K序列的极限压测。 以智谱官网API订价为基准(输入8元/百万Token、缓存掷中2元/百万Token,综合单价2.6元/百万Token)举行测算,基在实测机能,于抱负状况下的贸易价值体现以下: 于典型Agent混淆上下文负载下,单机更具确定性算力变现能力与清楚的投资收受接管周期。 结语:以“推理效率+贸易回报”重构财产竞争逻辑 年夜模子财产竞争的下半场,素质上是推理效率与贸易回报的较劲。摩尔线程经由过程MTT S5000与Prefill-as-a-Service方案,不仅重塑了长上下文推理的机能与成本界限,更帮忙企业于万亿参数与Agent时代紧紧把握TCO自动权。 完备白皮书请拜见:《MTT S5000 Prefill-as-a-Service技能白皮书》 https://developer-hscdn.mthreads.com/public/MTT-S5000-Prefill-as-a-Service-%E6%8A%80%E6%9C%AF%E7%99%BD%E7%9A%AE%E4%B9%A6.pdf 总结 从技能路径来看,Prefill及Decode解耦不是甚么新观点,业内早有会商,但真正拿出详细硬件方案及实测数据的还有未几。摩尔线程此次把MTT S5000卡于Prefill这个节点上,等在给算力分层提供了一个可落地的参考。实测数听说明于长上下文场景下,这套打法能于SLO约束下跑出不变的吞吐,并且用FP8精度跑起来没有分外的格局转换开消,生态上也兼容了主流框架及CUDA代码。 

