| 首页| 极速前进| | 爱上超模| 我型我秀| 国考| 天眼| 捉迷藏|
您的位置:首页 > 新闻中心 > 社会 > 正文

善良的男人

英伟达向左,寒武纪向右_我的网站

8090

一 |     7月18日下午,由观察者网、WAIC CONNECT主办,半导体行业观察协办的“「重构算力」——AI算力需求与供给的结构性重构产业链接会”在上海张江科学会堂举办。    地缘政治在 AI 算力领域的持续投射,正在中美两个都在努力保持各自技术领先优势的 AI 大国之间,进一步造成无可逃避的市场分化,甚至是割裂。

二 | 作为WAIC 2026同期的一场重要产业活动,这场汇聚了政府、产业方与需求方的闭门研讨,把目光聚焦到AI算力供需两端的深层结构性变化。         在主旨演讲嘉宾中,翼华科技(北京)股份有限公司联合创始人兼高级副总裁贾淑芸的分享格外引人关注。相较于场上被反复讨论的GPU、大模型与推理芯片,她所代表的DPU(数据处理单元)与智能网卡,是产业链条中一个更为“隐性”却越发关键的环节。                   这种割裂,已经让 AI 算力巨头英伟达感受到压力。         算力集群不是“堆卡”,是“组网”          “现代AIDC其实已经是一个巨型机系统。                   就在 10 月 6 日,英伟达 CEO 黄仁勋在纽约出席美国城堡证券主板的活动时,明确强调:英伟达在中国的市场份额已经从 95% 降到了 0%。

三 | ”贾淑芸在接受观察者网专访时着重强调了这一点。他表示:                    目前,我们 100% 退出了中国市场。无法想象任何决策者会认为这是一个好主意,即我们(美国)实施的政策导致美国失去了世界上最大的市场之一,降到了 0。                   但是,对于中国本土的 AI 算力发展来说,英伟达份额降到 0,反而意味着巨大的市场机遇,以及飞速增长的空间。她把大型AI数据中心的问题归纳成三件事——“算、存、运”。         算,就是外界最为熟悉的GPU与推理芯片;存,对应显存、内存和闪存;而运,也就是通信,正是DPU与智能网卡所承担的部分。                             实际上,根据中国本土 AI 芯片企业寒武纪在 10 月 17 日最新发布的 2025 年第三季度财报,该公司在 2025 年 Q3 实现了高达 17.27 亿元的营收,同比暴增 1332.52%;归属于上市公司股东的净利润为 5.67 亿元,而去年同期则为 -1.94 亿元。                   尽管寒武纪与英伟达在实际的营收体量方面完全不可同日而语,但毫无疑问,英伟达在中国 AI 算力市场的被动缺位,让寒武纪成为了最大的受益者之一。         大模型训练与推理从来不是一张卡的独角戏,而是成千上万、甚至数十万张卡的集体作业。每完成一步计算,卡与卡之间就需要一次乃至多次数据交换。交换尚未完成,下一步就无法开工。                   巨头缺位后,本土选手补位                    纵览中美 AI 算力过去十年的发展过程,有一个特别值得书写的时间节点:2016 年 8 月。也就是说,昂贵的算力在集群里有相当一部分时间其实是“在等网络”。         DPU与智能网卡真正做的事,是把网络协议处理、RDMA通信这些原本占用CPU、GPU的活承接过来,为计算核心提供一个稳定、可预测、可靠的通信接口;再把网络里的排队、丢包、重传抹平,不让任何一次尾部延时把整个集群拖入等待;同时把存储、安全等基础设施卸载下来,让大模型的记忆系统可以快速检索,不“失忆”。                   具体来说,2016 年 8 月 9 日,英伟达 CEO 黄仁勋来到 OpenAI 位于旧金山的办公室,并且在马斯克(当时的身份是 OpenAI 的发起人)的见证下,向 OpenAI 团队交付了世界上第一台英伟达 DGX-1 超级计算系统(该超级计算系统在 2016 年的 GTC 大会上正式发布)。         一旦缺了这一层,后果对贾淑芸而言是显而易见的:GPU利用率上不去,万卡集群跑出五六千卡的有效算力,几乎等于把一半的采购成本打了水漂;集群规模越大越不稳定,一次长尾延时、一次网络抖动,就可能让整个训练任务中断回滚;CPU还会被网络和存储协议栈吃掉大量核数,整机成本进一步恶化。

四 | 她给出的结论是,算力集群从来不是“堆卡”,而是“组网”——网络算力这一层,决定了买来的GPU算力最终能兑现多少。         为什么是RISC-V          国内做DPU的公司不少,但大多数选择了ARM内核方案,翼华科技走的是自研RISC-V内核的路线,其首款基于自研RISC-V核的智能网卡已经流片并商用落地。这样一个相对独特的技术路径,背后是怎样的考量?          贾淑芸对观察者网阐述,成本、生态、供应链安全,都在权衡范围之内,但最根本的原因是DPU这个品类与RISC-V的技术特性天然契合。她解释,DPU本质上是一颗领域专用处理器,核心任务是报文处理与存储、计算卸载,追求的是高带宽、低时延与能效比,而不是通用计算意义上的大而全。RISC-V最大的优势就在于指令集可以灵活扩展——针对网络报文处理、KV管理加速去定制指令与微架构,尤其是矢量扩展(Vector Extension)非常适合数据面与检索类工作,这在标准ARM核授权模式下很难做到。         翼华自研的RISC-V核支持RVA23规范,具备多发射、乱序执行、浮点与矢量计算能力;SoC层面则采用了灵活的集群架构,CPU核与自研的网络、安全加速引擎通过高带宽总线紧耦合,能够按客户对性能、功耗、面积的不同要求灵活配置。对于外界关心的生态短板,她也做了分析——相比x86和ARM,RISC-V生态确实还有差距,但对DPU来说“够用了”:GCC、LLVM工具链、Linux操作系统、DPDK等网络开源软件的支持都已经比较成熟,翼华本身也在通过开源方式反哺RISC-V在网络和存储方向的生态。

五 |          这条路径对翼华的竞争力意味着什么?意味着性能优化的天花板从此掌握在自己手里;产品定义摆脱了指令集授权的约束,可以跟随客户需求快速迭代;从指令集到核到SoC的全链路自主可控,在当前的产业环境下,对客户而言更是实实在在的价值。                   某种程度上,这可以看作英伟达 AI 算力参与到新一代 AI 技术大爆发的早期起点。                   同样是在 2016 年 8 月,在大洋彼岸的中国,脱胎于中科院的 AI 芯片创业公司寒武纪在获得了来自中科院的数千万元天使轮融资之后,获得了来自元禾原点、科大讯飞、涌铧投资的 Pre-A 轮融资。首款RISC-V智能网卡的流片与商用,也验证了这条路线走得通。         从“省”到“快”:图南系列的AI适配          DPU最初是云厂商的故事,主要解决虚拟化卸载、多租户隔离这类问题。

六 |                    从此,寒武纪开启了逐步成长为一家中国本土 AI 算力知名供应商的步伐。但当AI大模型训练成为主角,网络吞吐与时延的要求较之传统云计算已经高出好几个量级。这样的需求切换,如何反过来定义DPU的产品设计与商业模式?          贾淑芸的判断是“根本性的”变化。她把云时代DPU的核心命题概括为一个字——“省”,把虚拟化、多租户隔离、存储协议这些开销从CPU上卸下来,帮云厂商省出可以对外销售的CPU核数;而AI时代DPU的核心命题则换成了“快”,训练集群对RDMA吞吐、时延和抖动的要求高出数个量级,网络性能直接决定了GPU利用率,也直接决定了每一次训练任务的成本与成败。

七 |          这种变化传导到产品与商业两个层面。                   值得一提的是,当时的英伟达,已经瞄准了中国 AI 算力市场,并打算成为这一市场最重要的玩家之一。                   实际上,就在寒武纪获得 Pre-A 轮融资后的次月,也就是 2016 年 9 月,英伟达就在中国北京举行了 GTC CHINA 2016 大会——这也是英伟达第一次把 GTC 大会带到中国。

八 | 产品设计上,重心从控制面卸载转向数据面性能:RDMA引擎要自研,拥塞控制算法要深度优化,大规模组网下的低时延低抖动要有保障,还要和调度系统、集合通信库紧密协同。

九 |                    会上,英伟达发布了最新深度学习推理加速器 Tesla P4/P40,并且与阿里巴巴、百度、科大讯飞、京东等中国企业达成了合作。商业模式上,客户也从头部云厂商的定制项目扩展到智算中心、服务器整机厂和行业客户,产品的标准化和兼容性要求随之提高,国产化替代成为一个明确的增量市场。                   站在今天的视角来看,这次 GTC China 大会,实际上也成为英伟达 AI 算力耕耘中国市场的一个重要起点。         翼华科技的“图南”系列智能网卡,正是按照这一逻辑打造的。                   实际上,此后一直到 2021 年,随着英伟达在中国市场的持续深耕,它也在实际意义上逐步成为中国 AI 算力市场的主要供应商。它基于翼华拥有自主知识产权的芯片架构实现高吞吐线速转发,配合自研的RDMA技术面向智算场景大规模组网做优化,同时保留P4可编程能力,让网络、存储、安全、运维等各类负载都可以灵活卸载,既满足AI训练推理对高性能网络的严苛要求,也能覆盖云数据中心与边缘计算的传统场景。RISC-V的通用处理能力则被用来实现流量的管理和调度。                   比如说,来自国际知名数据调研机构 IDC 的数据显示,2021 年,中国 AI 加速卡出货量超过 80 万片,其中英伟达占据超过 80% 市场份额。         在此基础上,翼华还计划推出“培风图南”系列AI-DPU。

十 | 借助RISC-V的通用处理能力与RVV向量处理能力,这条产品线将进一步实现KV Cache管理的卸载与加速,构建大模型的"记忆层",降低推理应用的部署成本,同时提升推理速度。                   而到了 2022 年,中国 AI 加速卡(公开市场)出货量约为 109 万张,其中英伟达市占率为 85%,华为市占率为 10%,百度昆仑芯为 2%——值得一提的是,当时已经在科创板上市的寒武纪,也在 2022 年拿下了 1% 的市场份额。

十一 |                    然而,也就是在 2022 年,情况发生重大变化。

十二 |                    具体来说,2022 年 10 月 7 日,美国政府发布了一系列对华技术出口的制裁措施,并由此斩断了英伟达 A100、H100 等一系列高性能计算芯片进入到中国市场的路径。

十三 |                    面对这一政策,虽然英伟达在产品上做出技术调整后面向中国市场推出 A800 和 H800 等所谓的“特供版”产品,但随着美国政府在 2023 年 10 月进一步加严对人工智能相关芯片、半导体制造设备的对华出口限制,这些专门面向中国市场的英伟达产品也无法进口。         客户到底为什么买单          英伟达BlueField系列早已大规模部署,国内DPU赛道这几年也涌现出不少创业公司。

十四 | 翼华的图南系列既然已经商用,主要落地在哪些客户手中?          贾淑芸介绍,图南系列SuperNIC目前的客户可以分成几类:智算中心的建设方与运营方,用它做GPU集群的高性能参数面与存储面网络;服务器整机厂商,把智能网卡作为整机方案的标准部件;云和边缘计算客户,用于虚拟化卸载和5G边缘业务加速;此外在运营商与部分行业客户侧也有项目在推进。                   于是,为了绕开美国政府的出口限制,英伟达又推出了专为中国市场定制的 H20 算力平台,其性能相比于 H100 大幅减弱,但依旧兼容 CUDA 生态,被称为“阉割版”,一度被认为是鸡肋产品——但从市场反馈上来看,H20 在 2024 年依旧受到追捧。                   不过到了 2025 年,在中美经贸谈判背景下,英伟达 H20 算力平台在中国市场的出货也不可避免地受到波及,在美国政府的出口限制和后续的博弈中,英伟达 H20 在中国市场的出货也基本上停滞。而计划推出的培风图南系列,则将主要面向大模型应用公司和Token工厂运营方,通过构建大模型记忆层降低推理部署成本、同时提升长程任务的推理性能。                   也就是黄仁勋所说的:英伟达的份额,降到了 0。

十五 |                    当然,这背后的一个大背景是,为了避免被“卡脖子”,来自中国本土的 AI 算力芯片商也开始实现对英伟达算力平台的部分国产替代——而寒武纪就是其中的一员。

十六 |          至于客户在选择国产DPU时最看重什么,她的答案与外界的直觉不太一样:稳定性和兼容性排在第一位,价格反而排在最后。原因并不难理解——网卡是7×24小时在线的部件,客户不会为了追求部分性能特性而牺牲可用性,能否平滑接入现有的服务器、交换机与软件栈,是商用的前提;其次才是性能,尤其是RDMA场景下的真实表现。“客户算的是总账,一张卡如果能把GPU利用率提上来几个点,卡本身的价差可以忽略不计。

十七 | ”贾淑芸表示,翼华的策略一直是把稳定性和兼容性做扎实,再谈性能领先。         行业洗牌中的生存法则          2021年、2022年,DPU一度是资本追捧的风口,大量创业公司涌入。此后两年,赛道明显进入收缩与整合期。                   从“独角兽”,到A股“寒王”                    作为中国本土 AI 算力发展的代表性企业,寒武纪的成长,从一开始就获得了巨大的知名度加持。                   比如,2017 年 8 月 18 日,在获得 Pre-A 轮融资一年后,寒武纪科技宣布完成 A 轮 1 亿美元融资;领投方为国投创业,阿里巴巴、联想、国科投资、中科图灵加入,原 Pre-A 轮投资方,元禾原点创投、涌铧投资继续跟投。作为一家2022年成立的公司,翼华科技如何看待这一轮洗牌?          贾淑芸对那段热潮做了深入剖析。                   在 A 轮融资完成之后,寒武纪的估值超过 10 亿美元——在媒体的报道中,寒武纪也由此正式成为“全球 AI 芯片领域的第一家独角兽创业公司”。认为其中确实有泡沫的成分——资本看到了BlueField的故事,团队蜂拥而入,但很多公司低估了两件事:一方面,芯片的产业周期是硬约束,从流片到商用再到规模上量,没有三五年下不来,烧钱速度远超预期;另一方面,DPU并不是一颗芯片的生意,而是一整套软硬件生态的生意,驱动、协议栈以及与客户环境的适配工作,工程量甚至比芯片本身还要大。                   不过,真正在业务层面让寒武纪声名鹊起的,是华为。这两年资本退潮、行业整合,本质上是回归常识。                   事实上,在华为麒麟 970 手机处理器中,就搭载了寒武纪在 2016 年发布的全球首款深度学习专用处理器——寒武纪 1A 处理器,这使得麒麟 970 成为“全球首款 AI 手机芯片”,也大大提升了麒麟 970 在图片识别等场景中的能耗和功耗表现。                   不过,在与华为短暂牵手之后,寒武纪在 AI 算力领域的后续发展,主要是集中在云端——比如在 2018 年 5 月,寒武纪发布了中国首款云端人工智能芯片 MLU100 及其板卡——值得一提的是,在当时的发布会上,寒武纪已经开始在部分指标上对标英伟达的旗舰产品。                   2020 年 7 月,寒武纪迎来了其企业发展生涯的一个重大节点,那就是在科创板上市,其股价当日大涨接近 300%,市值也突破 1000 亿元。                   然而,从业绩发展的角度来看,尽管寒武纪一直在持续推动其 AI 技术和产品的落地,但在其研发投入大、落地周期长的商业模式下,寒武纪在很长一段时间里实际上一直处于亏损状态,这种状态在寒武纪 2020 年 7 月上市时也没有改变,并且在一直持续。                   这种持续亏损的情况,也使得寒武纪的股价在 2022 年底直接跌落到 60 元以下,甚至跌破了发行价。         翼华成立于2022年,恰好赶上热潮的尾巴与寒冬的开头。

十八 |                    不过,2022 年下半年,随着美国芯片禁令的到来、ChatGPT 的横空出世和英伟达的爆发,国产算力和 AI 芯片的需求开始大爆发,而寒武纪虽然在 2023 年依旧亏损 8.36 亿元,但在大趋势的推动之下,寒武纪的股价也在 2023 全年暴涨 535%,在 A 股近 700 只人工智能概念股中排名第一。                   2024 年全年,在整体业务依旧亏损 4.43 亿元的情况下,寒武纪的 A 股股价又实现了 387% 的全年涨幅——在这样股价变动中,寒武纪被冠以“股王”的称号。

十九 | 这样的时点,反而倒逼团队从第一天起就保持克制——不追求大而全的产品定义,聚焦智算这个真实需求场景;控制团队规模与研发节奏,把资金花在流片和客户落地上。她提到,2022年也正好是面向GPU互联的SuperNIC元年,翼华科技从起步阶段就锁定了SuperNIC与AI-DPU这两大潜力市场。                   而资本市场对于寒武纪的定位,就是“中国的英伟达”。                   当然,其中值得一提的是,寒武纪的业绩 2024 年出现明显的升势——其中在 2024 年第四季度,寒武纪营收为 9.887亿元,环比暴增 820.4%;第四季度实现归母净利润 2.815 亿元,这是寒武纪上市以来首次实现季度盈利。                   2025 年上半年,在 AI 芯片业务的持续落地中,寒武纪的业绩出现整体爆发。

|          而在她给出的DPU公司生存清单里,有几点尤为关键:芯片要真正流片、真正商用,而不是停留在PPT和FPGA原型阶段;要有付费客户、有可复制的场景,形成正向的收入循环;还要在英伟达和头部云厂商自研之外,找到自己不可替代的差异化位置——比如翼华科技选择的RISC-V自研路线,以及为大模型构建记忆层的AI-DPU路径。                   根据公司半年报,寒武纪 2025 年上半年实现营业收入 28.81 亿元,同比增长高达 4347.82%;归属于母公司所有者的净利润为 10.38 亿元,上年同期净亏损 5.3 亿元,同比大幅度扭亏为盈。                   这样的业务表现,加上市场对于寒武纪未来发展的高预期,寒武纪的股价在 2025 年的持续上涨中超越茅台,并在 2025 年 8 月 28 日达到 1595.88元 的历史最高点位。                             由此,在资本市场,寒武纪成为了真正意义上的“寒王”。行业洗牌未必是坏事,泡沫出清之后,留下来的公司会拿到更集中的资源和更清晰的市场。

|          国产智算的网络答卷          产业最关切的宏观议题之一是国产智算能否实现真正的全栈自主。今天的智算中心,机内互联主要依赖NVLink,机间互联依赖InfiniBand,本质上仍是英伟达的封闭生态。         在贾淑芸看来,这是最关键也最难攻克的一层。                   令人关注的是,就在寒武纪成为“寒王”的前几天,有多家媒体称,英伟达已指示包括韩国三星电子、美国安靠科技等关键零部件供应商暂停与 H20 芯片相关的生产——这背后的原因也非常简单,中国企业选择不购买 H20 了。                   英伟达向左,寒武纪向右                    中国企业不再选择英伟达 AI 芯片的大背景,除了企业层面无法决定的地缘因素之外,还有一个核心逻辑是:中国本土 AI 算力的持续补位。                   从目前的情况来看,华为无疑是最重磅的补位者。                   实际上,就在 9 月份的华为全连接大会上,华为公布了昇腾算力芯片的三代迭代路线图,并强调这是“基于中国可获得的芯片制造工艺”。                   与此同时,华为还发布了最新的超节点产品 Atlas 950 SuperPoD 和 Atlas 960 SuperPoD,并基于此发布了 Atlas 950 SuperCluster 和 Atlas 960 SuperCluster 超节点集群,并称之为“当之无愧的全世界最强算力集群”。                   很明显,在 AI 算力方面,华为已经打算与英伟达正面掰手腕了。国产GPU单卡性能还在追赶,但如果互联问题不解决,卡越多、集群效率损失越大,“全栈自主”就只能是一句空话。

| 她给出的方向是开放的以太网路线——用增强以太网加RDMA去对标乃至超越InfiniBand。

|                    不过,除了华为之外,类似于寒武纪这样的国产算力头部芯片厂商,也在技术开发、产品落地等方面持续发力,且反馈极为迅速。

| 这也是全球产业的共识方向,超以太网(Ultra Ethernet)等新标准的演进,本质上都是要用开放生态对抗封闭体系。         要走通这条路,必须有三个层面的支撑:高性能的国产网卡与DPU芯片,把RDMA、拥塞控制这些核心能力真正做到自主;国产交换机与国产GPU的端网协同,一张好网卡还不够,整个链路要一起调优;开放的标准和软件生态,让智算中心不被任何单一厂商锁定。

|                    一个最为直接的例子是,就在 9 月 29 日 DeepSeek-V3.2-Exp 模型正式发布并开源当天,寒武纪就宣布,已同步实现对 DeepSeek-V3.2-Exp 的适配;依托 DeepSeek Sparse Attention机制,叠加寒武纪的极致计算效率,可大幅降低长序列场景下的训推成本。         翼华科技的产品与生态布局,也是沿着这三条线在推进。产品上,图南系列将加速向更高带宽演进,持续强化面向智算场景的自研协议处理引擎和拥塞控制能力;生态上,翼华正与国产GPU厂商、服务器厂商、交换机厂商推进深度的端网适配和联合方案;同时通过开源P4处理器和自研的虚拟协议处理器,提供快速适配开放协议的能力,反哺网络标准和协议组织——凭借可编程的方法,翼华SuperNIC可以同时支持RoCE、UEC乃至各家的自定义协议。         “我们的目标很明确:在国产智算的网络算力这一层,做出真正可规模商用的自主选择。

| ”贾淑芸这样总结。         回到WAIC「重构算力」的现场议程——训练推理转型、国产算力生态、HBM/CPO先进硬件、万卡集群调度、智算新基建全链路成本测算,几乎每一个议题都指向同一个命题:算力供需之间的结构性重构。而在这场重构里,DPU与智能网卡所代表的“网络算力”环节,正是决定国产AI基础设施上限的关键变量之一。                   而正是在这种快速的技术突破和反馈机制下,寒武纪的业务也随着本土客户对于国产算力的选择和适配快速增长。                   而这也是寒武纪第三季度营收实现同比暴增 1332.52% 的关键背景。翼华科技所代表的自研RISC-V DPU路线,能否在这一轮洗牌之后跑出属于中国的BlueField,将是产业界接下来数年最值得关注的看点之一。

|                    而对于这一业绩变动,寒武纪方面表示,报告期内公司营业收入较上年同期大幅增长主要因公司持续拓展市场,积极助力人工智能应用落地,报告期内净利润扭亏为盈,主要因营业收入较上年同期大幅增长。

|                    可见,对于寒武纪来说,在经历了多年的投入之后,如今它终于趁着国产 AI 算力补位和崛起的大趋势,迎来了丰厚的回报——无论是财报业务本身的“扭亏为盈”,还是高高在上的公司股价和市值,都足以体现这一点。                   值得一提的是,就在 10 月 20 日,寒武纪还发布公告称,公司已完成向特定对象发行 333.49 万股股票,此次发行价格为 1195.02元 /股,募集资金总额为 39.85 亿元,募集资金净额为 39.53 亿元。         本文系观察者网独家稿件,未经授权,不得转载。                   关于本次定增,寒武纪表示,智能芯片需要加快适应新技术、新应用以及新业态的变化需求,而公司本次募集资金是增强公司面向大模型的芯片技术和产品综合实力,提升公司在智能芯片产业领域的长期竞争力,同时在软件方面进一步提升公司软件生态的开放性和易用性。                   可见,尽管三季度业绩大幅度增长,但寒武纪还在持续推进其软硬件的快速迭代——毕竟,从整体的技术实力和生态建设来说,寒武纪相比于大洋彼岸的英伟达还有较大的差距。                   当然,回过头来看,对于英伟达来说,尽管市场份额已经接近于 0,但是对于充满潜力的中国市场,黄仁勋当然不希望缺席。                   毕竟,黄仁勋曾公开表示,中国是世界第二大计算市场,到 2026 年,中国的人工智能市场规模将达到 500 亿美元,进军这一市场对英伟达来说意味着巨大的机遇。                   也因此,黄仁勋希望能够继续解释和说明,并寄望于政策会有所改变。                   当然,作为一家企业,即使是英伟达这样全球市值排名第一的世界级科技巨头,也无法改变地缘政治下的科技大潮走向。                   因此,当英伟达在其 AI 计算领域的最新之作 Blackwell 已开启它在美国本土的制造计划,这些产品就注定与大洋彼岸的中国市场无缘——而在中国这片应用落地前景更为广阔的土地上,来自本土的 AI 算力之花也正在借助这一片空白,茁壮成长。                   本文来自微信公众号:时间线 Timelines,作者:临泽,编辑:周易。

Current article:http://qli.roubutianquegumaigoubingdian.cyou/news/20260826_230.html

Published on:00:34:55


24小时排行

热点推荐