出品 | 搜狐科技
作者 | 梁昌均
让马斯克高喊Impressive,让华尔街惊呼DeepSeek2.0时刻,90后清华天才干崩美股登上热搜……月之暗面最新发布的大模型Kimi K3,引发全球AI圈震动。
这款参数规模高达2.8万亿的模型,创造了国产模型的新高度,在全球评测榜单上拿到第三名,前端编程更是登顶全球第一,也从智谱手中夺回全球开源模型第一的名头。
不少机构认为,这是中国大模型全面赶超美国大模型的信号,开源和闭源的差距从至少半年已缩短到两三个月,甚至还有海外网友质问为什么这家公司的创始人杨植麟没能留在美国。
新模型发布、疯狂融资、推进上市,月之暗面在历经迷失和静默后,逐渐找回主场节奏。追求AGI是一场没有尽头的雪山攀登,但这家公司找到了自己的路。
国产模型跑出新高度
在史上最热的WAIC开幕前夕(7月16日),月之暗面深夜发布最新模型Kimi K3。
今年第二次参与WAIC的月之暗面,展台位置偏角落,延续蓝色风格。搜狐科技探访时,现场排起打卡领礼品的长队,似乎并无太多人关心K3,但当时其已处于全球AI圈的焦点。
模型发布后,马斯克评价“Impressive”,并透露正在研发2万亿参数模型,即将完成初步训练且可能超过Kimi。月之暗面随后与之互动,称“欢迎加入2万亿+俱乐部”。
摩根士丹利认为,K3是中国大模型在模型规模、性能和定价上全面追赶美国领导者的信号。美国大模型企业也有点慌了,纷纷调整用户使用限制,提高模型额度。
Claude发文宣布,最新Fable 5模型将自7月20起永久纳入Max和Team Premium订阅用户,OpenAI重置Codex和 ChatGPT Work付费用户额度。不少开发者表示:感谢开源的K3。
Kimi K3的发布,意味着中国开源模型的持续崛起。此前DeepSeek、千问、智谱、月之暗面、MiniMax等中国大模型轮流登顶全球开源模型榜单,此次K3则跑出新高度。
K3具备 2.8 万亿参数模型,拥有 100万 token 上下文窗口,是全球首个开源的 3万亿级别模型,主打长程编程、知识工作和推理等场景。
官方评测显示,K3整体表现仅次于目前最强的闭源模型Claude Fable 5和GPT-5.6 Sol,稳定超过其他所有模型。
在第三方评测中,K3同样表现突出。权威机构Artificial Analysis显示,K3综合能力全球第三。这是中国大模型有史以来最靠前的排名,并取代智谱GLM5.2成为全球最强开源模型。
在大模型竞技场Arena发布的Fronted Code盲评榜单中,K3更是超越Claude Fable 5登顶全球第一,这是中国模型第一次在前端编程赛道拿下第一。
“我们过去常说,开源模型尤其是中国的开源模型,比目前最先进的模型落后六到九个月,但现在的差距大概只有两到三个月了。”加州大学伯克利分校计算机科学教授伊翁·斯托伊卡(Ion Stoica)表示。
从不少开发者体验来看,K3实际表现还不错。有实测用户向搜狐科技表示,前端网页和编程能力很强,整体对得上目前排名,但部分细节还需自己动手检查,消耗也明显更快。
月之暗面也毫不避讳K3存在多个局限性,包括对历史思考内容敏感,可能导致内容生成质量不稳定,同时过于主动,可能会做出非预期的决定等。
“Kimi K3总体上是一个非常有竞争力的模型,但与 Claude Fable 5 和 GPT-5.6 Sol 相比,在用户体验上仍有一定差距。”月之暗面表示。
7月27日,K3完整权重将正式发布,全球开发者将持续掀起开源模型的Token风暴。
DeepSeek2.0时刻来了?
Kimi K3的发布,不仅成为AI行业焦点,还蔓延到资本市场,其再次引发投资者对巨额算力投资逻辑的质疑。
Arena榜单运营负责人表示,K3证明了高性能大模型不一定需要天价算力,或将倒逼投资者重新审视整个AI行业。
摩根大通则直言,K3的发布让市场雪上加霜,“对DeepSeek 2.0时刻的担忧令亚洲和美国科技股双双承压”。
2025年初,低成本、高性能的DeepSeek-R1开源发布,引发全球AI圈震动,英伟达股价一夜暴跌17%砸出深坑,“DeepSeek时刻”由此诞生。
K3发布后,全球AI行情加剧震荡。费城半导体指数承压,英伟达市值一度被苹果超越。智谱和MiniMax双双大跌,K3发布后的两个交易日市值合计蒸发超3200亿港元。
最新交易日,费城半导体指数反弹超5%,英伟达止住跌势,重回全球市值第一。A股昨日也在利好刺激下大幅反弹,智谱和MiniMaxAI也迎来大涨,但今天又纷纷走低。
虽然K3所引发的市场震荡幅度不及DeepSeek-R1,但从大模型技术路径看,月之暗面和DeepSeek都走出了“中国特色”——如何在算力限制下通过系统创新持续提升智能水平。
高盛高管明确指出,这并非扩展定律失效,而是表明单纯扩展预训练算力不再是实现领先的唯一路径,算力扩张时代可能已至尽头。
“更值得深思的是,一家无法匹配西方最大规模预训练算力的中国实验室,如何通过架构创新、合成数据、强化学习和后训练技术,迅速缩小了与顶尖美国模型之间的差距。”
这个答案并不模糊。早在2024年底搜狐科技参加的一场媒体沟通会上,杨植麟就表示,AI的关键词是Scaling,但它并不是简单得把模型做得更大就好,核心是找到有效的方法去Scale。
从Kimi K3本身看,其参数达2.8万亿,意味着能装进更多知识,可以懂得更多、想得更深、答得更准,而背后关键在于模型架构层面的系统性创新,这些正是有效的方法。
有技术人士解析到,K3对深度学习沿用十年的三大组件——注意力机制、残差连接、优化器,全部做了替换或重构。“这是一次系统性的架构赌注,也代表了从底层重新思考大模型架构的技术自信。”
具体来看,K3采用了月之暗面提出的KDA混合线性注意力机制(Kimi Delta Attention)、注意力残差(Attention Residuals),从而优化解决了长上下文的计算效率问题,以及训练过程中信息稀释与不稳定的问题等。
同时,K3进一步扩大MoE的稀疏度,让模型可以按需调用,再加上训练方法和数据配方的优化,从而降低训练周期以及算力与显存占用,让K3相比K2的整体扩展效率提升约2.5倍。
这些架构创新获得了行业高度评价。“看来我们还没把Attention is All You Need(Transformer 论文标题)这句话按字面意思理解透。”AI大神安德烈·卡帕蒂(Andrej Karpathy)表示,甚至有人认为这意味着深度学习2.0的到来。
月之暗面并未透露K3的训练成本,但API价格明显上涨,每百万Token输入2元(命中缓存)和20元(未命中缓存),输出则为100元。
这相较上代模型K2.7均有提升,其中输出价格更是增长2.7倍,是国内定价最高的模型,摆脱了开源模型便宜、低价的印象。但相较Claude Fable 5和GPT-5.6 Sol分别高达50美元、30美元的输出价格,K3仍保持明显优势。
高盛认为,中国开源模型的智能水平正达到面向全球扩散的临界点,开始掌握定价权。过去靠性价比入场,现在告别“白菜价”模式,而是凭借前沿能力进入市场。
这也引发了头部模型的不满。OpenAI战略未来负责人Dean W. Ball就发文称,开放模型权重会削弱前沿模型的商业回报,降低企业继续投入数百亿美元训练下一代模型的动力。
他因此称,开源天然是一种减速主义力量,并预测美国可能会提高企业使用中国开源模型的合规门槛。这家转向闭源的大模型企业,彻底公开地站到了开源的对立面。
显然,随着开源模型持续迭代,头部闭源模型正遭受更大威胁。这不仅是技术的逼近,更是对其商业和估值叙事的进一步冲击。从这个层面看,K3可以说是DeepSeek时刻的延续。
暂停订阅背后的算力困局
在Kimi K3再次引发算力过剩论的质疑时,月之暗面则在其发布48后发文宣布暂停C端用户订阅,已有算力全部服务已订阅用户,并进行算力扩容。
原因很简单,K3上线后火爆程度远超预期,用户请求太多,算力不够用了,“面临始料未及的算力挑战,逼近现有集群的承载极限”,月之暗面选择优先保障老用户的体验。
目前,月之暗面主要采购阿里云的算力,而吴泳铭此前表态服务器现有GPU等加速卡几乎处于满负荷运行状态。要想找到足够的可用算力,还需时间。
业内人士认为,K3虽然引发了对大模型预训练算力扩展路径的质疑,但这可能并不意味着最终算力需求将会减少,因为算力市场结构正在发生根本性改变。
花旗银行分析表示,若中国开源模型持续逼近,美国前沿AI实验室更可能增加而非减少算力投入,以维持差异化。
K3发布后,阿里发布2.4万亿参数的Qwen3.8预览版,MiniMax被爆出将发布参数高达2.7万亿的M3 Pro模型,而GPT-6或达到6万亿参数。
可见,头部玩家的参数竞争还在继续,但国产模型则在探索扩展的新路径——借助系统级架构创新,DeepSeek、月之暗面等推进成本和效率革命。
“训练市场已经收敛到头部几家企业,都在朝着两万亿甚至更高参数模型扩展,所需要的算力短期内不会减少,但这种一次性支出总体会放缓,而推理算力会指数级暴增。”
一位国产芯片企业人士告诉搜狐科技,其所在企业的订单排满,推理需求多于训练需求,而H20已很难满足推理需求,但受限于产能等,未来一两年内国内算力紧张局面都难以缓解。
月之暗面提到,由于推理效率需要更大的高带宽通信域,建议在64卡或更多加速器组成的超节点配置上部署K3。而在今年WAIC上,国产芯片产商纷纷推出超节点集群。
可见,这款2.8万亿参数的模型要完整跑通,并能够支撑百万长文本与多智能体并行任务,需要更高的算力运行成本,远高于上代模型 Kimi K2的16卡要求。
这背后是大模型的杰文斯悖论——技术进步可以提效降本,但最终需求的增长,反而会导致资源消耗不降反升。大模型用的越多越亏,算力成本和Token产出将是一场拉锯战。
从最近智谱、MimiMax合计高达400多亿的再融资看,算力依然是投入主力。而这些算力,可能更多还是用于满足推理需求和Token的爆发。
最新消息称,智谱已落地1GW级国产AI算力数据中心,并完成国产AI异构算力软件公司中科加禾的收购,从算力规模和效率两方面加速布局,这带动智谱昨日暴涨37%。
今年以来,月之暗面也在疯狂融资。媒体报道称,其即将完成新一轮估值315亿美元的融资,计划上市前再以投前500亿美元估值开启新一轮融资,并最快在半年内港股上市。
形势催人变,此前曾表态不着急上市的杨植麟,如今看来也不得不加速了。