文 | 数字力场,作者 | 佘宗明
25年前,《少林足球》上映。片中有个名场面:半决赛时,少林队遇到了莫文蔚与张柏芝客串的“玉面双飞龙”,二人顶着夸张脏辫、贴着滑稽假胡,说“想入决赛,先问问我们!”
时间来到2026年,星爷新片《功夫女足》让这对传奇组合重生——张小斐饰演的“双双”与迪丽热巴饰演的“钰珑”,名字合璧正好对应“玉面双飞龙”。
作为峨眉队队长的双双是全队攻防大脑,根基扎实,球路沉稳,招牌绝技是太极卸力盘带、太极沉劲远射等,招式守正出奇,强于以柔克刚;身为峨眉队前锋的钰珑是球队尖刀,身法灵动,攻势凌厉,独门绝技是十二路弹腿、旋风削球等,能精准破局,极具爆发力。
现在看,AI赛道的“粤籍双雄”——梁文锋和杨植麟,也挺像这对组合。
DeepSeek擅长以柔克刚,如果说“大力出奇迹”的scaling law路线是刚,那MoE稀疏激活+原生FP8训练框架+纯RL驱动的卸力打法就是柔。
Kimi爆发力十足,犹记得1年前,Kimi还时常是作为DeepSeek的反面镜像被讨论,“Kimi掉队了”的说法蔚为风行,可如今,它直接整出了王者归来的气势。
而Anthropic和OpenAI领衔的硅谷御三家,则成了摆在它们面前的“大河队”。
01
“美国为什么没留下杨植麟”,7月17日,有老外在X上发出了这番灵魂拷问。
这掀起了激烈讨论,连杨植麟在卡内基梅隆大学的博士生导师、AI领域知名学者Russ Salakhutdinov都下了场,说“我本将心向明月,奈何明月照沟渠”……说错了,是杨植麟曾收到来自苹果高管的橄榄枝,但他态度已决——要创立自己的公司。
在遭到MAGA信徒攻击“为对手输送人才”后,Russ还回怼:这不就是你们想要的吗?(Ps:这里针对的是特朗普政府制定的H-1B签证政策。)
咱就是说,要是大洋彼岸的网民还学会了扣“反思怪”跟“带路党”帽子,那就更有内味了。
而引发这场争论的直接由头,就是Kimi K3携2.8万亿超大参数架构强势登场,给了硅谷和华尔街亿点点震撼。
如果Kimi K3只在AI圈博主的嘴里遥遥领先,那被“三天一震撼,五天一炸裂”历练出反诈技能的我们大可呵呵一笑。可硅谷技术圈跟华尔街资本市场的表现,还是有参考价值的。
马斯克在评测帖下留言“Impressive(令人印象深刻)”;OpenAI战略负责人Dean Ball说,大规模开放权重前沿模型是“减速主义力量”,还预判美国监管层面会出手搞保护主义;特朗普政府AI顾问David Sacks说,K3的突破令人担忧,加剧AI地缘竞争压力……秉持“对手肯定>国内同行认可>自嗨式PR”的原则,咱们高低得对K3多看几眼。
《华尔街日报》头版打出大标题——“The Kimi Shock”;高盛研报认为K3标志着中国模型走向定价权的全新节点……也给Kimi走了面儿。
风乍起,吹皱一池夏水并吹掉一堆泡沫:美股AI板块直接来了个“72小时惊魂”,整体市值蒸发约4700亿美元,费城半导体指数单周大跌12.5%,坠入技术性熊市。“DeepSeek时刻”都意思意思了,“DeepSeek2.0时刻”自然也不好意思不意思一番。
顺着“它跌得,我跌不得”的选择性接轨逻辑,A股也成功将这股“跌跌不休,时不我予的哀愁”意绪传递给了本土股民。
而上个让硅谷跟华尔街爬进“惊弓之鸟”成语注释里的,还是DeepSeek。
去年1月,R1出来后,也是惊得硅谷跟华尔街哇声一片。著名投资人、A16Z创始人马克·安德森的那句“斯普特尼克时刻”,成了对其影响的最佳定性。
Meta开启危情模式、成立四个“战情局”,Scale AI创始人亚历山大·王说“DeepSeek的发布可能会改变一切”……都是变相为DeepSeek上分。
英伟达股价单日暴跌16.86%,市值一夜蒸发5888.62亿美元,彼时彼刻,恰如K3出来后的此时此刻。
02
1年半前,DeepSeek携性能比肩OpenAI o1、API调用成本却仅为o1约2%的R1,拍了拍众人,来了一句“惊不惊喜?”
1年半后,在众人以为惊喜是意外后,Kimi又携跻身全球顶尖大模型第一梯队的K3登场,笑着说“意不意外?”
突破一次,也许是运气眷顾;突破一次又一次,那就……因吹斯听了。
在DeepSeek-R1问世后,《自然》杂志将梁文锋评为了“2025十大科学人物”,说DeepSeek“首次让世界意识到美国并非遥遥领先。”
在Kimi K3官宣后,摩根士丹利评价称,K3证明中国大模型在规模、性能、定价层面对美国头部模型实现“全方位追赶”。
个中意味,颇堪寻思。
都知道,自ChatGPT掀起这波AI浪潮以来,全球AI大模型赛道的剧本就是男一OpenAI跟男二男三Anthropic、谷歌的角力游戏,其他的多为群演……
当时的格局就摆在那:国内“六小虎”虽然也在蹦跶,可OpenAI说“我话说完,谁支持谁反对”,它们只有不吭声的份儿,能争的也就是个“中国版OpenAI”的名头。
亦步亦趋、微调借鉴,成了那时国产大模型的路径依赖。
如此效仿三两年,直到DeepSeek说“头部AI,宁有种乎?”
MLA(多头潜在注意力)把显存占用砍到传统架构的5%-13%,DeepSeekMoE稀疏架构通过稀疏激活让计算量大幅下降,Zero无样本自进化开辟了低成本训练强推理模型的新路线……凭着这些,DeepSeek成功将“中国AI落后美国两到三年”的技术代差缩小了些。
DeepSeek给了“力大砖飞”的硅谷信仰重重一击,给国内外科技企业上了一课:AI核心竞争力不只在参数堆积、算力堆叠,还在于算法架构优化、工程落地能力与资源利用效率等。
整体上,DeepSeek为中国大模型树立的心智锚点是:虽然性能稍有差距,但性价比是真香。
而到了Kimi K3这,中国大模型的角色又从“搅局者”变成了“破局者”,因为K3在复杂逻辑推理、长文本处理、代码生成、多场景落地等核心维度的表现让人意识到,原来中国大模型在性能上也可以多方位、深层次地赶上美国顶尖模型。
在此之前,硅谷AI公司能享受高溢价的核心支撑点,其实就在于依靠“闭源付费+高端性能”模式收割全球市场、依靠技术壁垒维持超额利润的想象空间。
这在此前确实成立:虽然有国产大模型先前就在有些方面赶超了GPT、Claude和Gemini等,但在核心维度很难占优,所以对外口径只能是“位列开源大模型第一梯队”……这里为什么要加上“开源”二字,你懂的。
但Kimi K3综合能力在Artificial Analysis综合智能指数评测中排名第三,在代码评测榜单Arena的前端代码榜上则登顶全球编程模型第一(这点含金量很高),在智能体&自动化任务、长文档检索等维度也是Top1……让顶尖开源模型终于能跟顶尖闭源模型坐同一桌了。
犹记得,上个月,有网友在X上问马斯克:“中国大模型何时能追上 Anthropic的Fable水平?”马斯克预测要等到2027年一季度。随后智谱创始人唐杰回应:“用不了那么久”。
现在杨植麟用K3为他的清华老师这番话撑了腰。加州大学伯克利分校教授伊恩·斯托伊卡就感慨:“我们过去常说开源模型落后最前沿6至9个月,现在差距可能只剩2到3个月。”从“性能不及顶尖但价格属实美丽”,到“性能也能到顶尖水平”,这样的迈步会让不少人想起中国制造——早些年,中国制造给人的印象是“能造出质量还行价格实惠的商品”,而如今,中国制造也可以是“高端制造”的代名词。
03
说这些,不是要导向“东升西落”式的赢学叙事,也不是要回避“整体差距依旧不小”的基本事实。
DeepSeek-R1和Kimi K3,都让硅谷跟华尔街的中国AI“巨物恐惧症”发作了。但这不等于,差距已经被抹平了。
抛开模型能力代差不谈,从底层算力看,国内高端算力自主可控率仍大有提升空间,不能因为“寒武纪不是小英伟达,英伟达是小寒武纪”的段子,就真把横亘其间的天堑给无视了。
从生态成熟度看,硅谷AI经过多年积淀,形成了“算力+模型+工具+场景+资本”的完整闭环,上下游产业链高度成熟,中国AI生态则处于快速发展期,商业化体系等仍待完善。看看国内AI创企跟Anthropic、OpenAI的ARR量级差距,就知道了。
从人才储备看,国内工程师红利虽然让黄仁勋们眼红,但顶尖AI算法人才、底层架构人才的总量跟硅谷还有差距。在“Our Chinese”跟“Their Chinese”的PK中,我们还需要想方设法吸引更多的杨植麟、姚顺雨回来。
看到中国AI从单点技术突破到体系化能力成型的提升,跟看到中美AI的差距,不矛盾。
事实上,越是能看到差距,就越能在正视的基础上加速追赶。梁文锋就说过:“我们经常说中国AI和美国有一两年差距,但真实的差距是原创和模仿之差。如果这个不改变,中国永远只能是追随者,所以有些探索也是逃不掉的。”
也正因看到了差距,DeepSeek跟Kimi都实现了许多架构级的原创式创新。
如DeepSeek的原生链式思考(CoT)自主推演+R1-Zero无样本自进化机制+MoE稀疏架构+MLA优化长上下文承载力等;
又如Kimi的超大容量稀疏MoE基座+KDA混合线性注意力体系+原生百万Token上下文建模技术+Agent Swarm+RL Scaling全链路强化学习范式+MuonClip大规模训练优化器等。
得益于此,DeepSeek V4解决了大模型长文本推理卡顿、逻辑断层、算力浪费的行业痛点,在万亿级参数模型的轻量化部署上创下全球最优水平。Kimi K3则突破了超大参数模型的训练瓶颈,在长文本理解、复杂代码生成、多模态融合能力上实现了对海外旗舰模型的反超。
从DeepSeek R1到Kimi K3,都让人看到了将代差持续缩小的可能——尽管差距依旧存在。
而这类接连涌现的突破,使得中国AI正实现从仰视到平视海外标杆的改变,也注定会让硅谷迎来心态的转变。
过去数十年,美国科技产业的核心优势在于技术迭代的持续性与领先性,顶尖技术诞生后,经常能长期保持代际优势。其他国家则照搬其技术框架、遵循其硬件标准、接受其定价体系。
但DeepSeek-R1和Kimi K3们,正撼动着这样的叙事。
一次可以叫偶然,两次——不同企业在不同时间节点、不同技术路径上,都实现了深层突破,这难免让硅谷部分企业失去“反正有追赶窗口期”的心理优势。
对硅谷而言,它未必忌惮成为第二名的追随者——哪怕其紧追不舍,却必定会忌惮跳出既定轨道的创新者——即便其隔得很远。
04
取次硅谷懒回顾,半缘DeepSeek半缘Kimi,这是时下很多人的感受——DeepSeek跟Kimi,都成了AI界“争气机”式的存在。
现在说对硅谷“懒回顾”,终究显得有些膨胀,但DeepSeek与Kimi确实呈现了中国AI最有活力的样子。
说起来,无论是DeepSeek,还是Kimi,都不是一开始就被看好能撼动硅谷的“人”。
DeepSeek起初在“6(六小虎)+2(两家有特色创企)”的行业头部格局中并不靠前,在V4跟R1之前,它充当的不过是大模型界“拼多多”的生态位。
Kimi虽然凭借长文本风光过一阵子,但到了2024年以后就拿到了过山车剧本,特别是在DeepSeek火了后,它更是被置于“既生D何生K”的同框对比中成为被群嘲对象。
但它们却在不怎么被看好的情况下跑了出来。
这跟梁杨二人的朝气锐气有关。
梁文锋说中美AI真实差距是“原创和模仿之差”,决意要做原创式创新。
杨植麟说“很多时候你愿意去做一个你不知道的东西,其实你不知道有很多东西不知道,所以你才有这样的勇气去做。当你做了,你会发现有很多新的问题,也许这个东西就是创新的意义。”“Problems are inevitable, but problems are soluble。”
言语之间,都挺显广东人的务实与锋芒。
他们代表了那股疯狂生长、锐意创新的力量。
这也跟当下相对纯粹的竞争环境有关。
回头看,DeepSeek跟Kimi的“赛马”其实从未停止:
2025年1月,DeepSeek-R1和Kimi K1.5同日上线,相隔仅两小时;2025年2月,两家前后脚发论文改造Transformer注意力机制;2025年4月,Kimi推出数学推理模型没多久,DeepSeek-Prover-V2也发布;今年4月,Kimi发布Kimi K2.6,支持300个子Agent协同,OpenRouter调用量直接冲到全球第一,3天后,DeepSeek发布V4系列……
二者也相互“致敬”:Kimi采用的MLA注意力机制,核心思想源于DeepSeek早期工作;DeepSeek V4中关键的Muon优化器,其有效性由Kimi团队率先验证。
良好的竞争生态之上,才能长出更多的DeepSeek跟Kimi。
因而,要珍惜梁文锋杨植麟们身上的创新动能,要呵护让AI企业可以激烈良性竞争的市场氛围。
在适配创新生长的土壤气候里,DeepSeek和Kimi这样的新锐力量才会有更大的向上拓展空间,才会有更多的机会接着在全球AI角力场中证明——
“我们玉面双飞龙,可不是浪得虚名”。