余大嘴在旁边帮腔:
“顾总把心放肚子里!咱们既然要搞,就搞波大的。你那边发来的技术需求我找专家盘过了,全是些极度激进的参数。”
众人走进一间小型会议室。
陆知远打开随身携带的保密电脑,连上投影仪,将一份文档投射到大屏幕上。
“余总,何总。这是九天实验室梳理的《NPU采购要求及联合验收标准清单》。”
陆知远声音沉稳,条理分明,
“作为一份正式的采购方要求,我们按硬指标、模型兼容、软件栈、可靠性、供应链和商务交付,一共分了六个层级。今天咱们逐条对齐。”
大屏幕跳转出第一页。
“第一项,算力硬指标。”
“我们要的是专门为大模型训练优化的张量计算单元。在FP16半精度下,稠密算力实测必须大于等于100 TFLOPS。同时显存必须上HBM,带宽不低于1TB/S,支持单机至少8卡的全互联,互联带宽要突破200GB/S。”
听到这里,何廷波脸色变了。
这几个数值组合在一起,简直是在往当前芯片设计的物理极限红线上踩!
“两位,陆助理刚才圈了个重点——‘稠密算力’。”顾屿靠在椅背上,毫不客气地插话补充,
“我丑话说前头,在这条硬指标上,回响绝不认什么PPT峰值,更别拿2:4结构化那种‘稀疏算力’来糊弄我。”
顾屿清楚这里面的门道。
所谓的“稠密算力”,就是老老实实把矩阵乘法里的每一项都算得清清楚楚,这是没有任何花招的硬实力。
而“稀疏算力”,说白了就是在神经网络计算时,把一些不重要的参数直接当成“0”剪裁掉,跳过不运算。
前世行业里这套“算力数字翻倍”的内卷风气,源头就是英伟达。
老黄搞出的TenSOr COre原生支持2:4结构化稀疏,直接把纸面数据翻了一倍。
后世那些造车新势力,像蔚来、理想、小鹏、极氪甚至沃尔沃,在发布会上动辄吹嘘单颗Orin芯片254TOPS、双颗508TOPS,拿来糊弄外行的全都是这种稀疏峰值算力,而实际的稠密物理算力其实得直接对半砍。
真正在发布会上老老实实标注真实稠密算力、坚决不拿稀疏峰值搞营销的也就是华为的乾坤昇腾系列、比亚迪的自研璇玑架构,以及黑芝麻智能、大疆车载等少数几家硬核厂商。
即便是前世华为的MDC系列硬件本身支持稀疏运算,所有面向车企和消费者的公开参数也一律只用稠密算力,绝不放稀疏翻倍的数字。
这种取巧的加速手段,拿去开发布会当噱头忽悠外行可以,但想要在需要精确微调的“天问”大模型基座训练上玩这种糊弄人的套路,根本行不通。
“硬指标只是第一关。”陆知远按下翻页笔,屏幕跳到第二页。
“第二项,模型兼容性。这是顾董定下的一票否决项。”
顾屿坐直身子:“算力再高,跑不通‘天问’,那就是一堆昂贵的废硅片。这块芯片必须端到端跑通九天实验室全系模型。从15亿参数训到未来的百亿参数,训练收敛不能掉点。最后的验收方式只有一条,把芯片插在雅安算力中心的机架上,用我们的模型实测跑过为准。”
何廷波重重地点了点头:“模型是你们的,没法造假。拿实战当考卷,这很公平。”
“第三项,软件栈。”陆知远继续宣读,