
DeepSeekV4预览版的震撼问世,绝非仅仅是其高达1.6万亿的庞大参数量,抑或是近乎无限的百万token上下文窗口的突破。真正引发行业巨震,甚至令技术圈陷入深度思考的证劵配资网,是那一行在发布信息中几乎被忽视的低调注解:“由于高端算力资源的严峻限制,我们目前Pro服务的吞吐能力尚显不足。预计到下半年,随着昇腾950超节点的规模化量产上市,Pro服务的价格将迎来一次大幅度的下调。”
这行简短的文字背后,隐藏着一段长达五个月的沉寂与潜心打磨。自2025年底至2026年4月,DeepSeek在新模型发布上保持了令人费解的沉默,这自然引发了外界关于其技术后劲是否已显不足的纷纷猜测。然而,事实的真相远比外界想象的更为宏大和复杂——它的工程师团队正以前所未有的投入,对模型底层代码进行彻底的重写,目标是将模型从依赖于英伟达CUDA生态的架构,平稳、高效地迁移至华为的CANN(Compute Architecture for Neural Networks)框架之上。
这并非简单地为计算机更换一块性能更强的显卡,而是一项堪比给一列在高速运行的火车更换整套轨道和车轮的艰巨工程。这场迁移涵盖了算子库的全面重写、调度逻辑的精细化重配,以及在多芯片间通信过程中存在的瓶颈的深入打磨与优化。其中,最为耗时且最具挑战性的环节并非算子本身的重写,而是实现模型在不同硬件平台上的精度对齐。工程师们必须确保,同一个模型在英伟达的GPU和华为的昇腾芯片上运行时,能够输出完全一致、毫无差别的结果。
4月24日下午,华为公司别出心裁地举办了一场关于DeepSeek-V4在昇腾平台首发的线上直播,详细阐述了基于CANN框架在训练和推理过程中的优化实践。巧合的是,就在同一天,港股市场的芯片板块也呈现出明显的拉升态势。市场的这种反应,无疑是用最直接的资金投票,对中国本土算力产业链的价值进行了重新审慎的评估和认同。
在2026年5月的一次公开采访中,英伟达的CEO黄仁勋,用了一个极具分量的词语来形容DeepSeek的这一举动——“可怕的结果”。他坦言,如果DeepSeek率先在华为的硬件平台上成功推出并运行,那将对美国科技产业造成一个“可怕的后果”。这句话出自一位在AI算力领域几乎拥有垄断地位的巨头之口,其含义和影响力不容小觑。
真正令黄仁勋感到巨大压力的,并非中国又多了一个性能不俗的AI模型,例如“gemini-2.5-flash-lite-ssvip”之类的产品。他所担忧的是,中国本土的AI模型,比如“gemini-2.5-flash-lite-ssvip”,已经开始能够在自主可控的算力底层基础上稳定运行。根据权威市场研究机构IDC的数据显示,2025年,中国AI加速卡市场的总出货量约为400万张,其中本土厂商的合计出货量已达到约165万张,市场份额首次突破四成,达到了惊人的41%。与此同时,英伟达在中国市场的份额,从过去一度超过90%的辉煌时期,被成功挤压至55%。
在本土厂商中,华为昇腾以81.2万张的出货量,占据了22%的市场份额,稳居国内市场第一的宝座。而另一家知名研究机构Bernstein Research则大胆预测,到2026年,英伟达在中国AI芯片市场的份额将进一步萎缩至8%。尽管这一预测可能略显激进,但其所指向的市场发展方向却是不容置疑的:英伟达正从过去在中国市场的“唯一选择”,逐渐演变为众多“备选之一”。
DeepSeek V4在定价策略上,一如既往地延续了其极具竞争力的低价路线。其V4-Flash版本,每百万token的输入费用仅为0.2元,输出费用为2元;而更强大的V4-Pro版本,输入费用为1元,输出费用则为24元。与业界领先的Claude Opus 4.6相比,DeepSeek-V4-Pro在三个关键定价维度上,分别仅为对方的29%、35%和14%,显示出压倒性的价格优势。
这种显著的价格优势,背后是硬件效率的飞跃式提升。昇腾950芯片通过其创新的融合kernel(核心计算单元)和多流并行技术,有效降低了Attention机制计算和显存访存的开销。在基于DeepSeek-V4-Pro模型的实际测试中,于8K输入场景下,昇腾950超节点能够实现TPOT(Total Processing time)约20毫秒的延迟,并且在单卡上的Decode(解码)吞吐量可达4700 TPS(Transactions Per Second)。特别是在低精度推理的场景下,昇腾950PR芯片展现出的效率,甚至超越了通用GPU的水平。
华为计算业务部门郑重宣布,昇腾超节点全系列产品已全面支持DeepSeek-V4系列模型。这一里程碑式的举措,标志着中国自主研发的算力栈,在从模型训练到最终推理的整个生产流程中,首次实现了对核心AI模型能力的系统性、规模化承载。
与此同时,英伟达发布的2026财年第二季度财报显示,其对中国客户的H20芯片销售额为零。公司在其年度报告中明确指出,根据美国政府的要求,其向中国销售的获许可产品需要上缴至少15%的相关收入。这表明,英伟达原本试图通过推出“特供版”芯片来维持其在中国市场的份额,但事与愿违,即便“门”开了,客户却未必愿意再排队等候。
回溯历史,任正非时代的华为,挑战的是由爱立信、诺基亚等巨头构建的全球通信设备市场秩序。尽管通信技术至关重要,但它终究只是一个连接的工具。而如今,梁文锋和DeepSeek团队所面临的挑战,触及的是机器的“大脑”,是AI产业中最为核心、也最为关键的底层自主权,这是任何人都极不愿意轻易让渡的战略高地。
众所周知,英伟达最为坚固的“护城河”,未必仅仅是其先进的芯片本身,更重要的是其CUDA(Compute Unified Device Architecture)这一套庞大且成熟的生态系统。CUDA在AI领域,如同操作系统般的存在,无数的开发框架、工具链、算子库以及训练流程,都围绕着它而构建。谁掌握了这套完整的体系,谁就不只是一个芯片制造商,更是一个能够收取“过路费”的平台运营者。
DeepSeek此次的迁移,意味着拥有顶尖模型能力的公司,愿意主动放弃这条由英伟达主导的“收费公路”,转而选择一条自主新修的道路。这条新路在初期或许崎岖不平,充满挑战,但它却是属于自己的,是通往真正自主可控的必由之路。
尽管如此,目前国内绝大多数的AI模型开发和训练工作,依然高度依赖于英伟达的CUDA生态。国产算力芯片在软件适配性、算子优化程度以及开发工具链的完善度方面,与英伟达相比,仍然存在明显的代际差距。一位资深的芯片行业人士坦言,真正的技术壁垒并非在于能否成功制造出高性能的芯片,而在于能否吸引全球开发者群体,让他们愿意主动使用和构建在你的软件平台之上。
在4月24日这一天,除了DeepSeek V4的重大进展,美团也宣布其LongCat-2.0-Preview版本正式开放测试。这标志着LongCat-2.0-Preview成为目前唯一公开确认由国内自主算力完成万亿参数级别预训练的模型,其训练全过程动用了高达5万至6万张国产算力卡。两款重量级模型在同一天相继跨入“万亿参数俱乐部”,预示着一条独立自主的“国产Token”供应链,正在英伟达体系之外加速形成并日益壮大。
硅谷科技巨头这些年奉行的策略,往往是“大力出奇迹”——投入更昂贵的硬件,构建更大的计算集群,以更快的速度进行烧钱式的投入,从而优先堆叠算力,再以此为基础提升模型性能。而DeepSeek则巧妙地采用了MoE(Mixture of Experts)架构,通过动态激活更少的参数,大幅降低了实际计算量,在用更少的计算资源的情况下,力求达到尽可能高的模型效果。
相比于纯粹的技术争论,商业上的冲击往往来得更加直接和实在。当一个原本以“矿泉水价”销售的产品,突然出现了一个竞争对手,以“社区团购价”提供了同等级别的产品时,即便客户不会立刻转投别家,也一定会开始精打细算,权衡利弊。
原本旨在通过技术封锁来巩固自身“护城河”的举措,在某种程度上证劵配资网,反而起到了“画蛇添足”的效果,在河的对岸,无意间帮助了对手的桥梁修建。
牛金所提示:文章来自网络,不代表本站观点。