25年前,《少林足球》里有个名场面:半决赛,少林队撞上莫文蔚和张柏芝客串的“玉面双飞龙”——顶着夸张脏辫,贴着滑稽假胡,甩下一句“想入决赛,先问问我们!”就把气氛拉满。

转眼2026年,星爷新片《功夫女足》让这对传奇组合复活了。张小斐演“双双”,迪丽热巴演“钰珑”,名字一拼,嘿,正好是“玉面双飞龙”。双双是峨眉队队长,攻防大脑,根基扎实,球路沉稳,绝活儿是太极卸力盘带、太极沉劲远射,守正出奇,以柔克刚;钰珑呢,前锋尖刀,身法灵动,攻势凌厉,十二路弹腿、旋风削球,精准破局,爆发力惊人。
你别说,眼下AI赛道里那两位“粤籍双雄”——梁文锋和杨植麟,还真有点像这对组合。DeepSeek擅长以柔克刚:要是“大力出奇迹”的scaling law算刚,那MoE稀疏激活+原生FP8训练框架+纯RL驱动的卸力打法,就是柔。Kimi呢,爆发力十足。记得一年前,Kimi还老被当成DeepSeek的反面镜像来讨论,“Kimi掉队了”的说法满天飞,结果呢?人家直接整出个王者归来。而Anthropic和OpenAI领衔的硅谷御三家,就成了摆在它们面前的“大河队”。
01
“美国为什么没留下杨植麟?”7月17日,有老外在X上抛出这灵魂拷问,瞬间炸了锅。连杨植麟在卡内基梅隆的博导、AI圈大牛Russ Salakhutdinov都亲自下场,说“我本将心向明月,奈何明月照沟渠”——咳,说错了,是杨植麟收到过苹果高管的橄榄枝,但他铁了心:要自己干。被MAGA信徒扣上“给对手输送人才”的帽子后,Russ回怼:这不就是你们想要的吗?(Ps:这里针对的是特朗普政府的H-1B签证政策。)要说大洋彼岸的网民也学会了扣“反思怪”和“带路党”帽子,那内味就更浓了。
这场争论的直接引子,就是Kimi K3带着2.8万亿超大参数架构杀了出来,给硅谷和华尔街来了点“亿点点震撼”。要是K3只在AI圈博主嘴里“遥遥领先”,那咱们被“三天一震撼,五天一炸裂”练出反诈技能的,大可呵呵一笑。可硅谷技术圈和华尔街资本市场的反应,总归有点参考价值。马斯克在评测帖下留言“Impressive”;OpenAI战略负责人Dean Ball说,大规模开放权重前沿模型是“减速主义力量”,还预判美国监管层面会出手搞保护主义;特朗普政府AI顾问David Sacks坦言,K3的突破令人担忧,加剧了AI地缘竞争压力。秉持“对手肯定>国内同行认可>自嗨式PR”的原则,咱们高低得对K3多看几眼。
《华尔街日报》头版直接打出大标题——“The Kimi Shock”;高盛研报认为K3标志着中国模型走向定价权的新节点。这一下,风乍起,吹皱一池夏水,顺便吹掉一堆泡沫:美股AI板块来了个“72小时惊魂”,整体市值蒸发约4700亿美元,费城半导体指数单周大跌12.5%,坠入技术性熊市。DeepSeek时刻都意思意思了,DeepSeek 2.0时刻自然也不好意思不意思一番。顺着“它跌得,我跌不得”的选择性接轨逻辑,A股也成功把那股“跌跌不休,时不我予的哀愁”传递给了本土股民。
说起来,上一个让硅谷和华尔街爬进“惊弓之鸟”成语注释里的,还是DeepSeek。去年1月,R1出来后,也是惊得硅谷和华尔街哇声一片。著名投资人、A16Z创始人马克·安德森那句“斯普特尼克时刻”,成了最佳定性。Meta开启危情模式,成立四个“战情局”;Scale AI创始人亚历山大·王说“DeepSeek的发布可能会改变一切”——都是变相给DeepSeek上分。英伟达股价单日暴跌16.86%,市值一夜蒸发5888.62亿美元,彼时彼刻,恰如K3出来后的此时此刻。
02
一年半前,DeepSeek带着性能比肩OpenAI o1、API调用成本却仅为o1约2%的R1,拍了拍众人,来了一句“惊不惊喜?”一年半后,就在大家以为惊喜纯属意外时,Kimi又携跻身全球顶尖大模型第一梯队的K3登场,笑着说“意不意外?”突破一次,也许是运气眷顾;突破一次又一次,那就……因吹斯听了。
DeepSeek-R1问世后,《自然》杂志把梁文锋评为“2025十大科学人物”,说DeepSeek“首次让世界意识到美国并非遥遥领先”。Kimi K3官宣后,摩根士丹利评价说,K3证明中国大模型在规模、性能、定价层面对美国头部模型实现了“全方位追赶”。个中意味,颇堪寻思。
都知道,自ChatGPT掀起这波AI浪潮以来,全球AI大模型赛道的剧本就是男一OpenAI跟男二男三Anthropic、谷歌的角力游戏,其他的多半是群演。格局就摆在那:国内“六小虎”虽然也在蹦跶,可OpenAI说“我话说完,谁支持谁反对”,它们只有不吭声的份儿,能争的也就是个“中国版OpenAI”的名头。亦步亦趋、微调借鉴,成了那会儿国产大模型的路径依赖。
如此效仿三两年,直到DeepSeek说“头部AI,宁有种乎?”MLA(多头潜在注意力)把显存占用砍到传统架构的5%-13%,DeepSeekMoE稀疏架构通过稀疏激活让计算量大幅下降,Zero无样本自进化开辟了低成本训练强推理模型的新路线。凭着这些,DeepSeek成功把“中国AI落后美国两到三年”的技术代差缩小了些。它给了“力大砖飞”的硅谷信仰重重一击,也给国内外科技企业上了一课:AI核心竞争力不只在参数堆积、算力堆叠,还在于算法架构优化、工程落地能力与资源利用效率。
整体上,DeepSeek为中国大模型树立的心智锚点是:虽然性能稍有差距,但性价比是真香。到了Kimi K3这儿,中国大模型的角色又从“搅局者”变成了“破局者”——K3在复杂逻辑推理、长文本处理、代码生成、多场景落地等核心维度上的表现,让人意识到,原来中国大模型在性能上也可以多方位、深层次地赶上美国顶尖模型。在此之前,硅谷AI公司能享受高溢价的核心支撑点,其实就在于依靠“闭源付费+高端性能”模式收割全球市场、依靠技术壁垒维持超额利润的想象空间。这在此前确实成立:虽然有国产大模型在某些方面赶超了GPT、Claude和Gemini,但在核心维度很难占优,所以对外口径只能是“位列开源大模型第一梯队”。为什么加上“开源”二字?你懂的。
但Kimi K3综合能力在Artificial Analysis综合智能指数评测中排名第三,在代码评测榜单Arena的前端代码榜上登顶全球编程模型第一(这点含金量很高),在智能体&自动化任务、长文档检索等维度也是Top1——让顶尖开源模型终于能跟顶尖闭源模型坐同一桌了。记得上个月,有网友在X上问马斯克:“中国大模型何时能追上Anthropic的Fable水平?”马斯克预测要等到2027年一季度。随后智谱创始人唐杰回应:“用不了那么久。”现在杨植麟用K3为他的清华老师这番话撑了腰。加州大学伯克利分校教授伊恩·斯托伊卡感慨:“我们过去常说开源模型落后最前沿6至9个月,现在差距可能只剩2到3个月。”从“性能不及顶尖但价格属实美丽”到“性能也能到顶尖水平”,这样的迈步,让人想起中国制造——早些年,中国制造给人的印象是“能造出质量还行、价格实惠的商品”,而如今,它也可以是“高端制造”的代名词。
03
说这些,不是要导向“东升西落”式的赢学叙事,也不是要回避“整体差距依旧不小”的基本事实。DeepSeek-R1和Kimi K3,都让硅谷和华尔街的中国AI“巨物恐惧症”发作了。但这不等于差距已经被抹平。抛开模型能力代差不谈,从底层算力看,国内高端算力自主可控率仍大有提升空间。不能因为“寒武纪不是小英伟达,英伟达是小寒武纪”的段子,就真把横亘其间的天堑给无视了。
从生态成熟度看,硅谷AI经过多年积淀,形成了“算力+模型+工具+场景+资本”的完整闭环,上下游产业链高度成熟。中国AI生态则处于快速发展期,商业化体系等仍待完善。看看国内AI创企跟Anthropic、OpenAI的ARR量级差距,就知道了。从人才储备看,国内工程师红利虽然让黄仁勋们眼红,但顶尖AI算法人才、底层架构人才的总量跟硅谷还有差距。在“Our Chinese”跟“Their Chinese”的PK中,我们还需要想方设法吸引更多的杨植麟、姚顺雨回来。
看到中国AI从单点技术突破到体系化能力成型的提升,跟看到中美AI的差距,并不矛盾。事实上,越是能看到差距,就越能在正视的基础上加速追赶。梁文锋就说过:“我们经常说中国AI和美国有一两年差距,但真实的差距是原创和模仿之差。如果这个不改变,中国永远只能是追随者,所以有些探索也是逃不掉的。”也正因看到了差距,DeepSeek跟Kimi都实现了许多架构级的原创式创新。比如DeepSeek的原生链式思考(CoT)自主推演+R1-Zero无样本自进化机制+MoE稀疏架构+MLA优化长上下文承载力;又如Kimi的超大容量稀疏MoE基座+KDA混合线性注意力体系+原生百万Token上下文建模技术+Agent Swarm+RL Scaling全链路强化学习范式+MuonClip大规模训练优化器。
得益于此,DeepSeek V4解决了大模型长文本推理卡顿、逻辑断层、算力浪费的行业痛点,在万亿级参数模型的轻量化部署上创下全球最优水平。Kimi K3则突破了超大参数模型的训练瓶颈,在长文本理解、复杂代码生成、多模态融合能力上实现了对海外旗舰模型的反超。从DeepSeek R1到Kimi K3,都让人看到了将代差持续缩小的可能——尽管差距依旧存在。而这类接连涌现的突破,使得中国AI正实现从仰视到平视海外标杆的改变,也注定会让硅谷迎来心态的转变。
过去数十年,美国科技产业的核心优势在于技术迭代的持续性与领先性,顶尖技术诞生后,经常能长期保持代际优势。其他国家则照搬其技术框架、遵循其硬件标准、接受其定价体系。但DeepSeek-R1和Kimi K3们,正撼动着这样的叙事。一次可以叫偶然,两次——不同企业在不同时间节点、不同技术路径上,都实现了深层突破——这难免让硅谷部分企业失去“反正有追赶窗口期”的心理优势。对硅谷而言,它未必忌惮成为第二名的追随者,哪怕其紧追不舍;却必定会忌惮跳出既定轨道的创新者,即便其隔得很远。
04
取次硅谷懒回顾,半缘DeepSeek半缘Kimi。这大概是时下很多人的感受——DeepSeek跟Kimi,都成了AI界“争气机”式的存在。现在说对硅谷“懒回顾”,终究有点膨胀,但DeepSeek与Kimi确实呈现了中国AI最有活力的样子。说起来,无论是DeepSeek还是Kimi,都不是一开始就被看好能撼动硅谷的“人”。DeepSeek起初在“6(六小虎)+2(两家有特色创企)”的行业头部格局中并不靠前,在V4跟R1之前,它充其量不过是大模型界的“拼多多”。Kimi虽然凭借长文本风光过一阵子,但到了2024年以后就拿到了过山车剧本,特别是在DeepSeek火了后,更是被置于“既生D何生K”的同框对比中,成为群嘲对象。
但它们却在不怎么被看好的情况下跑了出来。这跟梁杨二人的朝气锐气有关。梁文锋说中美AI真实差距是“原创和模仿之差”,决意要做原创式创新。杨植麟说:“很多时候你愿意去做一个你不知道的东西,其实你不知道有很多东西不知道,所以你才有这样的勇气去做。当你做了,你会发现有很多新的问题,也许这个东西就是创新的意义。”“Problems are inevitable, but problems are soluble。”言语之间,都挺显广东人的务实与锋芒。他们代表了那股疯狂生长、锐意创新的力量。
这也跟当下相对纯粹的竞争环境有关。回头看,DeepSeek跟Kimi的“赛马”其实从未停止:2025年1月,DeepSeek-R1和Kimi K1.5同日上线,相隔仅两小时;2025年2月,两家前后脚发论文改造Transformer注意力机制;2025年4月,Kimi推出数学推理模型没多久,DeepSeek-Prover-V2也发布;今年4月,Kimi发布Kimi K2.6,支持300个子Agent协同,OpenRouter调用量直接冲到全球第一,3天后,DeepSeek发布V4系列……二者也相互“致敬”:Kimi采用的MLA注意力机制,核心思想源于DeepSeek早期工作;DeepSeek V4中关键的Muon优化器,其有效性由Kimi团队率先验证。良好的竞争生态之上,才能长出更多的DeepSeek跟Kimi。
因而,要珍惜梁文锋、杨植麟们身上的创新动能,要呵护让AI企业可以激烈良性竞争的市场氛围。在适配创新生长的土壤气候里,DeepSeek和Kimi这样的新锐力量才会有更大的向上拓展空间,才会有更多的机会接着在全球AI角力场中证明——“我们玉面双飞龙,可不是浪得虚名。”
上一篇: 足协杯客场遇上演唱会?国安这趟兰州行,恐怕要改道了
下一篇: 没有了