此前选择关闭自动续费的用户,公司将会陆续恢复续订服务的启用;同时,针对老用户升级套餐等功能的开放也会分阶段进行。新套餐方面,目前因受算力资源所限尚未开放购买,具体的恢复购买时间尚未公布。
从官方的回应来看,这次调整更像是基于现有算力条件,对新增用户和存量用户体验进行一种新的平衡分配,并非针对会员体系进行大规模的改动。
K3面世之后,迅速成为全球范围内AI模型讨论的焦点,国内外开发者社区涌现出大量关于它的体验和评测内容。不少人将它对比Claude、GPT这些国际知名的模型,围绕推理费用、GPU资源、服务稳定性等话题的讨论,逐步盖过了Benchmark测试,变成了AI圈内新的热议对象。
K3究竟有多受宠?刚推出不久,就登上了全球AI模型讨论的中心舞台。
一家独立AI模型评测机构Artificial Analysis所发布的最新“智能指数(Intelligence Index)”显示,Kimi K3的综合得分是57分,在全球范围内位居第三,排在Claude Fable 5(60分)和GPT-5.6 Sol(59分)之后,超过了Claude Opus 4.8(56分)。
与此相伴的,是K3处理单项任务时平均需要花费0.94美元的成本,这个数字与GPT-5.6 Sol基本持平,却差不多只有Claude Opus 4.8的一半。
对于圈内人士来说,更有意义的一点是,这是首个闯入Artificial Analysis综合榜单前三名的开源模型。长久以来,"开源模型总是比闭源模型落后半代"几乎成了行业里的共识,而K3的出现,让这种差距有了明显的收窄。
图源:Monolith励思资本
除了考核成绩外,K3自身的参数规模同样吸引了业界的目光。K3是月之暗面首款万亿参数级别的MoE模型,整体参数规模达到了2.8万亿。
一位国产AI芯片企业的高层向界面新闻透露,今年到目前为止,随着Anthropic等海外厂商不断推出参数更大的模型,国内模型的竞争又回到了“追求大参数、长上下文”的赛道上,万亿参数、百万级上下文正发展成为头部模型竞争的重要方面。
在他眼中,K3之所以能迅速走红,不仅是因为模型自身的表现,更关键的是它标志着国产开源模型第一次达到了这样的量级。“对整个行业而言,2.8T本身就是一种重要的象征。”这位人士说。
行业的关注迅速传递到了开发者群体中。
在X(Twitter)、Reddit、OpenRouter、Linux.do、V2EX等平台上,许许多多开发者第一时间分享了自己的使用体验,部分人还将K3接入到了Cursor、Cline、OpenCode等AI编程工具中去试试效果。无论是代码生成、Agent任务,还是工具的运用,K3几乎成为了过去几天AI圈内讨论度最高的模型之一。
讨论的焦点主要围绕三个问题:第一,它有没有可能取Claude而代之,成为编程的首选?第二,它是否真的已经跻身国际顶尖模型的行列?第三,迁移使用它是否真的划算?
一些开发者认为,K3最大的亮点并不是在聊天方面,而是在于处理长流程的Agent任务和代码生成的场景。一些体验过的人士表示,在应对复杂代码的修改、进行工具调用等任务时,K3已经具备了足以和国际头部模型如Claude、GPT等相匹敌的能力。
不过也有反馈提到,在真实环境中的工程任务里,尽管模型的能力很突出,但有时仍会遗漏一些细节,需要人工来修正;此外,它在处理复杂统计推理等任务时,表现上还存在着一些不稳定的情况。
另一方面的讨论则集中在成本上。有用户指出,K3的单次调用费用虽然看似有竞争力,但由于在复杂任务中Token的消耗量较大,实际使用起来的总成本未必低,特别是在进行长流程的Agent任务时,这一点表现得尤为明显。
K3的热度也迅速延伸到了海外AI圈。
美国一家科技投资机构Atreides Management的创始人Gavin Baker将K3视为AI发展中的一次“拐点”,他认为,高质量的开源模型正在使AI技术的普及速度加快,其影响将不会局限于模型的生产者,还将惠及整个AI应用生态。
但是也有一些研究者持谨慎态度。
宾夕法尼亚大学的沃顿商学院有位长期研究人工智能如何影响工作的教授Ethan Mollick,在X上提到,他曾指示Kimi K3对一个先前完成的学术研究进行复杂的统计审核,但模型在许多方面都做得不够好,包括在统计分析方法的运用上存在错误。
Mollick认为,K3已经非常接近全球顶尖的模型,然而,对于复杂专业任务来说,它的可靠性和稳定性还需要更多真实场景的验证,不能仅仅依据Benchmark测试的成绩来判断。
这一评价也反映了当前AI社群对于新模型的普遍态度:一方面,K3在代码生成、Agent等应用场景的表现获得了开发者的广泛认可;另一方面,模型在完成复杂专业任务时的稳定性和可靠性,仍需要更多真实场景的持续验证,而不能仅从榜单成绩中去断定。
算力不足依旧是个难题
正当开发者们大量涌入、调用量节节攀升之际,月之暗面也很快遇到了另一个困境——算力资源。
过去两年间,大模型行业的普遍话题是“一个模型训练需要多少GPU”、“模型的参数规模达到了多少”,而不是因为用户群过于庞大而不得不暂停新用户的订阅服务。
事实上,模型的训练完成并不代表算力的投入就此终结,特别是在AI Coding、Agent等场景快速发展的情况下,模型需要不断地调用各种工具、读取上下文信息、执行多轮的推理,一个请求占用GPU资源的时间比传统聊天要长得多。模型的能力越强、上下文信息越长、用户使用的频率越高,对其推理算力的需求也就越大。
“现在最大的难题就是算力不够,尤其是高质量推理算力的短缺。”上海国投孚腾资本的投资总监陈雨沁此前在界面新闻的采访中谈到,就是就连那些头部模型的公司,也已经开始取消不限量的使用政策、提高了服务费用,这些行为本质上都揭露了推理资源依然紧张的现实。“如果基础建设方面没有改善的话,很多应用公司实际上是不敢真的进行大规模的产品推广的。”
“从供需两个方面来看,国内的AI算力长期以来都是供不应求的状态,而随着头部模型一个接一个地发布,这种供需紧张的情况有可能会进一步恶化。”上述芯片行业的代表向界面新闻指出。
他介绍说,目前像月之暗面、智谱、MiniMax这类独立的模型公司,获取算力的方式主要是两种:一是租用从公有云厂商那里提供的算力服务,二是自己开发建设算力集群。但是,前者的资源总是有限,而后者的建设则属于重资产投入,需要较长的建设周期,因此模型厂商在算力供给上一直面临压力。
“行业内普遍觉得,要支撑万亿参数模型的训练和推理,万卡级集群已经成为了基础的要求。”他表示,自2024年以来,真正拥有万卡级部署能力的厂商仍然是少数,许多已经宣布要建设的大规模集群项目,实际落地的时间往往是以年为单位来计算的,所以供需之间仍然存在着一个长期性的缺口。
在今年WAIC期间,一个细节给上述国产芯片企业留下了深刻的印象。
这位人士告诉界面新闻记者,当各家国产芯片企业展示自己的超节点产品时,人们最关心的两个问题就是:“这个能不能支持万卡集群?”“能不能支持万亿参数模型的训练?”
相比之下,过去更多的讨论集中在单卡的性能和芯片的参数上,而现在,整个产业链的目光更多地投向了超大规模集群的能力,以及支撑起头部模型持续进行训练和推理的基础设施建设。
这一变化,也显示出了大模型竞争逻辑正在发生转变。
过去,模型公司之间的竞争焦点在于参数规模、训练能力以及Benchmark的成绩;而现在,随着越来越多的模型被应用到实际的生产环境中,推理效率、服务的稳定性、成本的控制,以及基础建设方面的能力,开始逐渐成为竞争的新维度。
















