科技

月之暗面开源Kimi K3大模型,冲击500亿美元估值融资,创始人杨植麟为何未留美?

来源:快线潮资讯
月之暗面开源Kimi K3大模型,冲击500亿美元估值融资,创始人杨植麟为何未留美?

出品 | 搜狐科技

作者 | 梁昌均

当马斯克发出Impressive的赞叹,华尔街为DeepSeek2.0惊呼,这位90后清华才俊顺势冲击美股热搜。月之暗面最新开源大模型Kimi K3横空出世,全球AI领域为之震动。

这款拥有2.8万亿参数的智能体,不仅刷新国产模型记录,在全球评测榜单中位列第三,更将在前端编程领域问鼎全球第一。与智谱GLM5.2争夺的全球开源模型头把交椅,Kimi K3成功夺回。

行业分析指出,这标志中国大模型技术全面赶超美国同类产品的趋势日益明显。开源与闭源模型的差距已从大约半年缩短至两三个月。海外网友甚至开始讨论为何创始人杨植麟没能选择留美。

新模型问世、巨额融资、加速上市,历经沉寂的月之暗面逐渐找回市场节奏。AGI的探索如同攀登永无止境的雪山,而这家企业已找到自己的路径。

国产模型再攀高峰

在7月16日世界人工智能大会(WAIC)召开前夕,月之暗面于深夜揭晓最新模型Kimi K3。

今年第二次参与WAIC的月之暗面,其展台虽偏居角落,却延续一贯的蓝色主题。搜狐科技探访时发现,尽管K3尚未成为焦点,但现场已排起长队领取礼品。彼时,全球AI圈已将这款模型列为关注对象。

马斯克评价道:“Impressive”,并透露自家团队正在研发2万亿参数级别模型,预计将完成初步训练并超越Kimi K3。月之暗面迅速回敬:“欢迎加入2万亿俱乐部”。

摩根士丹利报告认为,K3意味着中国大模型在规模、性能和定价上实现与美国领先者的全面比肩。美国大模型企业反应激烈,纷纷收紧用户使用限制,提高模型访问额度。

Claude官方宣布,自7月20日起永久将Fable 5模型提供给Max和Team Premium订阅用户。OpenAI则重置了Codex和ChatGPT Work付费用户的可用额度。不少开发者呼吁:“感谢开源的K3”。

Kimi K3的发布,彰显了中国开源模型持续崛起的势头。此前,DeepSeek、千问、智谱、月之暗面、MiniMax等国产大模型轮流霸占全球开源模型榜首。此次K3取得新高。

K3模型具备2.8万亿参数,支持高达100万token上下文窗口,是全球首个开源的3万亿级智能体,专注于长程编程、知识工作及推理等场景。

官方数据表明,K3综合表现仅次于Claude Fable 5和GPT-5.6 Sol,性能显著优于其他所有模型。

第三方评测同样印证K3的卓越表现。权威机构Artificial Analysis排名显示,K3综合能力位列全球第三。这是中国大模型史上最佳成绩,已超越智谱GLM5.2成为全球最强开源模型。

大模型竞技平台Arena发布的Frontend Code盲评榜中,K3超越Claude Fable 5荣登榜首。中国模型首次在前端编程赛道夺冠。

“过去我们常说,中国开源模型落后于顶尖模型六到九个月,现在差距已压缩至两三个月。”加州大学伯克利分校计算机科学教授伊翁·斯托伊卡这样评价。

多位开发者分享使用体验,认为K3表现良好。实测用户向搜狐科技反馈,前端网页和编程能力突出,符合预期水准,但部分细节需手动优化。模型资源消耗较前代明显加快。

月之暗面坦承K3存在局限性。包括对历史内容敏感易导致生成质量波动,以及过于主动可能做出非预期行为等。

“Kimi K3具备强大竞争力,但与Claude Fable 5和GPT-5.6 Sol相比,用户体验仍存差距。”月之暗面如此表示。

7月27日,K3完整权重将正式发布,全球开发者或因其掀起开源模型的Token热潮。

DeepSeek2.0时代已至?

Kimi K3不仅引爆AI行业,更波及资本市场,再度引发投资者对算力投资逻辑的思考。

Arena榜单运营负责人指出,K3证明高性能大模型无需天价算力,或将迫使投资者重估AI行业格局。

摩根大通直言,K3发布加剧市场忧虑,“DeepSeek时刻”令亚洲和美国科技股承压。

2025年初,DeepSeek-R1开源模型的发布引发全球震动,英伟达股价单日暴跌17%。由此,“DeepSeek时刻”应运而生。

K3面世后,全球AI市场波动加剧。费城半导体指数承压,英伟达市值一度被苹果超越。智谱和MiniMax股价双双跳水,两日内市值缩水超3200亿港元。

最新交易日,费城半导体指数反弹超5%,英伟达止跌回升,重返全球市值第一。A股在利好因素刺激下强势上涨,智谱和MiniMaxAI同步反弹,但随后又转为下跌。

尽管K3引发的市场震荡不如DeepSeek-R1剧烈,但从技术路径看,月之暗面与DeepSeek均展现出“中国特色”——在算力约束下通过系统创新提升智能水平。

高盛高管明确指出,这非扩展定律失效,而是单纯靠预训练算力扩张不再独占鳌头。算力扩张时代可能已落幕。

“更值得深思的是,缺乏西方最大规模预训练算力的中国实验室,如何能通过架构创新、合成数据、强化学习和后训练技术,在短时间内拉近与顶尖美国模型的技术距离。”高盛如此评价。

答案并不晦涩。早在2024年底搜狐科技参与的媒体沟通会,杨植麟就已阐释AI的关键在于Scaling。但他强调,Scaling非简单追求数量,而是寻求有效的方法论。

Kimi K3本身印证了这一理念。其参数达2.8万亿,能承载更多知识,理解更深邃,回答更精准。这背后是模型架构层面的系统创新,即有效的方法论。

技术专家解析道,K3对深度学习沿用十年的三大组件——注意力机制、残差连接、优化器——全部进行替换或重构。这是一次架构层面的重大赌注,彰显重新思考大模型的技术自信。

具体而言,K3采用月之暗面研发的KDA混合线性注意力机制和注意力残差技术,有效优化长上下文计算效率,解决信息稀释与稳定性问题。

同时,K3扩大MoE(Mixture of Experts)稀疏度,使模型按需调用,结合训练方法与数据配方优化,降低训练周期和算力显存占用,整体扩展效率比K2提升约2.5倍。

这些架构创新获得业界高度认可。“看来我们还没真正理解Attention is All You Need这句话的字面含义。”AI大神安德烈·卡帕蒂感慨道,甚至有人称这预示深度学习2.0到来。

月之暗面未披露K3训练成本,但API价格显著上涨。输入端,每百万Token输入命中缓存为2元,未命中缓存为20元;输出端为100元。

与上代模型K2.7对比均有提升,输出价格更是暴涨2.7倍,成为国内定价最高的智能体。尽管摆脱了开源模型廉价印象,但与Claude Fable 5和GPT-5.6 Sol分别高达50美元、30美元的输出价格相比,K3仍具明显优势。

高盛认为,中国开源模型智能水平已触及全球扩散临界点,开始掌握定价话语权。从依赖性价比进入市场,到依靠前沿能力竞争,模式正在转变。

这引发头部闭源模型不满。OpenAI战略负责人Dean W. Ball发文表示,开放模型权重削弱前沿模型商业回报,可能削弱数千亿美元投资未来模型的动力。

他因此称,开源本身就是一种“减速主义”力量,并预测美国将提高使用中国开源模型的合规门槛。转向闭源的大模型企业,公开与开源阵营对立。

显然,随着开源模型持续进化,头部闭源模型所受威胁加剧。这不仅是技术逼近,更是对其商业叙事的冲击。从这个角度,K3可视为DeepSeek时刻的延续。

Kimi K3发布48小时后,月之暗面宣布暂停C端用户订阅,将所有可用算力集中于已付费用户,同时推进算力扩容工程。

原因很简单:上线后用户量激增,算力资源供不应求。“面临未预料的算力挑战,逼近集群承载极限。”月之暗面坦言,选择优先保障老用户体验。

目前,月之暗面主要采用阿里云算力。创始人吴泳铭曾透露服务器GPU等加速卡已满负荷运转。获取足够算力仍需时间。

行业分析认为,K3虽引发对预训练算力扩展路径的讨论,却未必导致最终算力需求萎缩。算力市场结构正在根本性变化。

花旗银行分析道,若中国开源模型持续进步,美国前沿AI实验室可能增加而非减少算力投入,以保持优势。

K3发布后,阿里推出2.4万亿参数的Qwen3.8预览版。MiniMax被曝将发布2.7万亿参数的M3 Pro模型。GPT-6参数规模或达6万亿。

可见,头部玩家仍在上演参数竞赛,但国产模型正探索更具成本效益的扩张路径——通过系统级架构创新,实现算力与效率的革命性突破。

“训练市场已高度集中,头部几家企业正向两万亿以上参数模型演进,所需算力短期内不会减少,但单次投入支出将放缓,推理算力需求却呈指数级增长。”某国产芯片企业人士透露。

其企业订单已饱和,推理需求占比超过训练需求。当前H20芯片难以满足推理需求,但受产能限制,未来两年国内算力供需紧张局面难以缓解。

月之暗面建议K3在64卡或更多加速器组成的超节点集群上部署。今年WAIC上,国产芯片厂商纷纷展示超节点集群方案。

可见,这款2.8万亿参数的模型要实现完整功能并支持百万级长文本多智能体并行任务,需要远超Kimi K2(16卡配置)的算力支持。

背后是大模型的杰文斯悖论——技术进步虽可提效降本,但需求增长往往导致资源消耗超预期。大模型用得越多越“亏”,算力成本与Token产出或陷拉锯战。

近期智谱与MiniMax合计400多亿的再融资显示,算力仍是投入重心。这些资源或主要用于满足推理需求和Token处理。

最新消息称,智谱已建成1GW级国产AI算力数据中心,并完成国产AI异构算力软件公司中科加禾收购。此举从规模和效率两端加速布局,带动其股价当日大涨37%。

今年以来,月之暗面持续融资。媒体报道其即将完成新一轮估值315亿美元的融资,投前估值500亿美元,计划上市前开启新一轮融资。最快半年内有望登陆港股。

市场形势迫使创始人杨植麟加快步伐,从曾表示不急于上市的立场有所调整。

【站点差异】本稿将发布于kuaixianchao.com。内容经过句式调整,段落节奏变化,以避免与其他平台版本重复,同时确保事实与数字完全对应原文。

相关推荐

最新文章