来源:互联网2025-11-30 00:00:00 热度:

国产GPU,要把算力搬到太空!

AI 中国网 https://www.cnaiplus.com

导读:贝克街探案官该图片属于AI生成作者鲁镇西抢回英伟达扔掉的500亿美元,摩尔线程们还能做什么?2025年11月,长达7年的“国产芯片替代”,终于迎来大众肉眼可见的成果。首先是黄仁勋宣布正式退出中国市场,高端芯片市场份额从95%降至0%,预计将失去500亿美元营收,其次中国GPU企业摩尔线程,于11月24日摩尔线程(sh688795)正式申购,这意味着主要从事GPU及相关产品的研发、设计和 ......

贝克街探案官

该图片属于AI生成国产GPU,要把算力搬到太空!

作者鲁镇西

抢回英伟达扔掉的500亿美元,摩尔线程们还能做什么?

2025年11月,长达7年的“国产芯片替代”,终于迎来大众肉眼可见的成果。

首先是黄仁勋宣布正式退出中国市场,高端芯片市场份额从95%降至0%,预计将失去500亿美元营收,其次中国GPU企业摩尔线程,于11月24日摩尔线程(sh688795)正式申购,这意味着主要从事GPU及相关产品的研发、设计和销售,号称国内唯一实现全功能GPU量产的企业,初步获得市场认可。

国产GPU,要把算力搬到太空!

图源:摩尔线程官网

只是碍于科创板门槛儿,申购者需要开户满2年;申请日前20个交易日中,日均持仓不低于50万元;风险承受能力等级需为C4(积极型)及以上,并签署《科创板股票交易风险揭示书》。

按摩尔线程发行价114.28元每股计算,中一签需要本金57140元,由于近期新股大鹏工业首日暴涨12倍,最高涨幅超1500%,市场对摩尔线程上市当日的涨幅预期极高,纷纷预测中一签摩尔线程最少盈利十万元。

且不论这种预测是否准确,从摩尔线程IPO进程来看,公司从申请受理到过会仅用88天,刷新了科创板审核速度纪录。实际上,二级市场反哺企业融资提速,恰好表明国产GPU研发加速落地。

01

摩尔线程的硬实力

此次上市的摩尔线程,成立时间不过5年,自2020年设立至今,公司以自主研发的全功能GPU为核心,致力于为AI、数字孪生、科学计算等高性能计算领域提供计算加速平台。

短短5年中,摩尔线程已成功推出四代GPU架构,并形成了覆盖AI智算、高性能计算、图形渲染、计算虚拟化、智能媒体和面向个人娱乐与生产力工具等应用领域的多元计算加速产品矩阵,产品线涵盖政务与企业级智能计算、数据中心及消费级终端市场,能够满足政府、企业和个人消费者等在不同市场中的差异化需求。

新一代架构相关产品处于研发阶段,同步推进高性能GPU芯片和智算集群前沿技术预研,以自主创新为核心,持续推动计算产业向通用化与智能化方向发展。

国产GPU,要把算力搬到太空!

图源:摩尔线程招股书

值得一提的是,退出中国高端GPU市场的英伟达,赖以生存的就是“CUDA”,英伟达凭借CUDA构建了极高的软件生态壁垒。为冲破这个壁垒,摩尔线程自主研发MUSA架构。

国产GPU,要把算力搬到太空!

MUSA架构是公司自主研发的融合GPU硬件和软件的全功能GPU计算加速统一系统架构。该架构涵盖统一的芯片架构、指令集、编程模型、软件运行库及驱动程序框架等关键要素,旨在为各类并行计算场景提供高性能计算能力。

开发人员可借助C/C++、Triton等编程语言,在该架构下编写并行计算程序,且同一代码能够在公司不同GPU产品及系统上运行,具有良好的灵活性与可扩展性。

最重要的是,MUSA架构具备与由英伟达主导的国际主流GPU生态的兼容性,使得开发者能够以较低成本充分利用目前国际主流生态下的代码资源。基于MUSA架构开发的应用程序不仅具有广泛的可移植性,还能够同时在云端及边缘的众多计算平台上运行,其应用领域广泛,涵盖AI、图形处理、科学计算等多个重要方向。

全功能GPU是指具备功能完备性与精完整性的GPU。其中,功能完备性体现为在单一GPU芯片中集成了AI计算加速、图形渲染、物理仿真和科学计算、超高清视频编解码等多种能力,满足多样化的计算需求;精度完整性体现为单一芯片支持FP64Vector、FP32Vector、TF32Tensor、FP16/BF16Tensor、FP8Tensor、INT8Tensor等不同计算精度,以满足GPU加速不同场景的计算需求。

全功能GPU在工作效率、生态完整多样性以及兼容性等方面更具有优势,能够更好地适应未来新兴及前沿计算加速应用场景的需求。

基于MUSA统一架构技术,摩尔线程在基础软件层面同时提供了AI计算、图形渲染和科学计算所需的基础软件技术。

在AI计算领域,支持PyTorch、PaddlePaddle等国内外主流AI应用开发框架,以及Megatron、FlagScale等大模型分布式训练框架;在图形渲染领域,支持DirectX、OpenGL、OpenGLES和Vulkan等主流图形应用开发技术,为视频游戏、数字孪生、虚拟现实、工业设计和地理信息系统等行业应用提供坚实基础;在科学计算领域,支持MUSA通用计算编程,可广泛应用于计算物理、信号处理、生物医药等科学计算领域。

在招股书中,摩尔线程特别强调,MUSA架构本身并不作为单独产品对外销售,而是作为公司全功能GPU产品的核心技术支撑。

02

机会留给了有准备的MUSA,国产算力迎来加速时刻

今天的MUSA架构,间接证明摩尔线程设立初期就锚定英伟达替代。

俗话说机会留给有准备的人,如今的英伟达,因为种种原因彻底退出中国高端GPU市场,而摩尔线程MUSA架构恰好可以兼容英伟达CUDA架构,在英伟达高端GPU退出中国市场的今天,摩尔线程MUSA架构似乎可以无缝衔接英伟达市场,国产算力行业有望借此实现加速落地。

基于MSUA架构,摩尔线程已经推出四代GPU架构芯片,分别为“苏堤”“春晓”“曲院”“平湖”,第四代芯片“平湖”增加了FP8精度支持,大幅提升AI算力,公司基于该芯片支撑面向DeepSeek类前沿大模型预训练的万卡集群智算中心解决方案。

国产GPU,要把算力搬到太空!

国产GPU,要把算力搬到太空!

基于MUSA架构,摩尔线程推出智能SoC芯片“长江”,这是集成了“全功能GPU+CPU+NPU+VPU”等异构算力单元的片上系统芯片。

摩尔线程AI算力本是基于“长江”SoC打造的产品,结合AI大模型与传统PC功能,为用户提供智能化的计算终端。该产品在满足传统PC功能的基础上,支持AI应用的运行与开发,用户可进行AI学习和实践操作。同时,AI算力本支持端云联动,用户可通过云端进行模型训练,将训练完成的模型下发至本地进行推理,实现个性化算力定制,满足快速、高效、隐私保护的推理需求。

国产GPU,要把算力搬到太空!

除兼容英伟达CUDA架构的摩尔线程MUSA架构外,国产算力还有一个绕不开的玩家就是华为,2025年6月20日,华为在开发者大会发布CloudMatrix384AI超节点,将384颗腾NPU和192鲲鹏CPU通过全新高速网络MatrixLink对等互连形成了一个整体AI“服务器”。算力已从单台的6.4pFLOPS提升至超节点300pFLOPS,算力提升50倍。单卡的推理吞吐量从每秒600tokens提升至每秒2300tokens,提升近4倍。

国产GPU,要把算力搬到太空!

实际测试中在默认配置下,总体预填吞吐量的测试CloudMatrix-Infer每个NPU每秒处理5655tokens。鉴于每个腾910CNPU的计算能力为1504TFLOPS(INT8),对应的计算效率为3.76tokens/sperTFLOPS。这比SGLang在英伟达H100上的默认配置(3.18tokens/sperTFLOPS)效率要高得多,尽管后者的原始吞吐量略高。

另一个老玩家龙芯中科也推出了新一代CPU及GPGPU,2025年龙芯产品发布会上,龙芯中科发布最新一代3C6000系列处理器。

龙芯3C6000系列处理器具备高性能,高可靠,高安全,高能效的特点。本次产品主要打造了5种服务器主板方案(3C6000/S单路、双路;3C6000/D双路;3C6000/Q双路;3C6000/D四路)主要针对不同应用群体,服务器性能全面对标Intel第三代至强服务器系列,基本达到2023年市场主流产品水平,实测中64核心双路和32核心四路产品整机性能比较Intel的8380有小幅优势。

国产GPU,要把算力搬到太空!

在工控领域本次发布会发布了龙芯2K3000:采用8核SoC芯片,龙芯自主指令系统(龙架构),基于自主研制的LA364E处理器核,SPECCPU2006Base单线程定/浮点峰值性能均超过10分/GHz,与龙芯3A5000处理器使用的LA464核性能相当;集成第二代自研GPGPU核心LG200,图形性能成倍提升,支持通用计算和AI加速;集成丰富的I/O接口,可广泛应用于各种场景。

AI 中国网 https://www.cnaiplus.com

本文网址:

欢迎关注微信公众号:人工智能报;合作及投稿请联系:editor@cnaiplus.com

AI中国号...

关注微信公众号,了解最新精彩内容