Kimi因算力不足暂停用户注册 杨植麟寻求技术突破

来源:时代一线 分类:科技
Kimi因算力不足暂停用户注册 杨植麟寻求技术突破

K3声名鹊起,Kimi却遭遇了必须叫停的时刻。

7月19日深夜,月之暗面Kimi团队公布通知,因为Kimi K3在上线仅48小时内,用户咨询量远超预期。由于计算资源不足以支撑,决定暂时中止新用户注册,优先服务现有付费会员。会员制度随之改头换面,分为Kimi主权益和Code权益两部分,目的是更合理地分配资源。根据后续官方说明,Kimi并未调整会员体系,而只是在算力受限的情况下,对用户体验进行了重新调整。

简单来说,K3的火爆带来了算力供应的瓶颈,只能暂时拒绝新用户,全力维护老用户。

Kimi的“缩微之道”

目前,众多AI模型厂商正忙着扩充用户数量,通过免费或降价的方法吸引新用户。相比之下,Kimi的做法显得与众不同。

但模型能力越强、上下文信息越长、用户请求越频繁,对推理算力的需求也越大。当“K3的请求量几乎达到现有算力集群的极限”时,Kimi也面临了像“豆包”模型那样的难题:虽然C端用户数量增多,但收入贡献并不明显,GPU却不堪重负。

作为月之暗面首款拥有3万亿参数的MoE模型,K3的总参数规模是2.8万亿。按常规分析,这个规模的模型每次输出都会消耗巨大的算力。但由于其独特的核心架构,Kimi达到了华为在芯片领域提出的“缩微定理”效果。

这个架构就像一台超级引擎,运用了三项关键技术:KDA(Kimi Delta Attention)混合线性注意力、注意力残差(Attention Residuals)以及高稀疏度MoE,将每份算力都转化为模型性能的极致效率。

长久以来,半导体行业依赖摩尔定律,通过缩小晶体管尺寸来提升性能。但当先进制程接近物理极限、成本急剧上升,单纯依靠硬件堆砌的增长模式已难以为继。

华为今年提出的“缩微定理”,摆脱了传统“空间缩微”的思路,转向“时间缩微”:借助逻辑折叠、三维堆叠、全链路架构优化,缩短信号传输延迟、减少数据搬运损耗,在普通制程上实现媲美先进制程的能效提升。

其核心思路在于:在硬件受限或成本约束下,借助系统级架构创新,实现性能的飞跃。

在我看来,K3采用的KDA混合线性注意力机制,正是AI领域的“缩微定理”体现。

Transformer架构在注意力机制上最为吃算力。常规注意力机制随序列长度呈平方级增长,在百万级上下文任务中,大部分算力耗费在维持长序列的注意力矩阵上。KDA机制将多数注意力层的计算复杂度从平方级降至线性级。

根据月之暗面早前发布的技术文档,实验模型采用KDA与MLA混合比例时,KV缓存最多减少75%,100万上下文长度下的解码吞吐量提高到原先的6倍。再加上注意力残差与高稀疏度MoE技术,训练效率提升约25%,额外成本不到2%。

这是对“模型生产效率”的重大革新。如果说硅谷主流的Transformer路线是“耗费巨大”的燃油车,KDA更像是追求“高效率”的混合动力引擎。

SemiAnalysis的报告显示,KDA使推理速度加快300%,同时在长上下文处理上依然保持接近Transformer的性能。这意味着同等算力投入下,K3能产出更多有效智能。

开发者社区的实际反馈,在长流程Agent任务和代码生成方面,K3表现优异,具备了与国际领先模型竞争的实力。

根本意义上,K3依然遵循Scaling Law(缩放定律),但将目标对准了算法上的浪费。当硅谷AI公司还在不断采购硬件、追求算力规模时,Kimi通过优化算法链路、压缩计算冗余,在有限算力的情况下,实现了性能与效率的平衡,探索出一条“每瓦特智能产出比”最大化的路径。

这让华尔街分析师和投资者感到意外。他们像关注DeepSeek那样,再次质疑硅谷数千亿美元的投资AI能否带来相应回报、美国AI的领先优势是否正在减弱。

与此同时,企业用户和开发者也开始关注AI使用成本。部分开发者已经采用“模型路由”(Model Routing)服务,根据不同任务自动选择成本最低、效率最高的AI模型,这其中当然包含Kimi这样的中国模型。

杨植麟的挑战

回头审视,Kimi算力被耗尽是技术成功的副产品:模型效率的提升压低了单次使用成本,反而刺激了需求总量的激增。

值得一提的是,7月11日,智谱创始人唐杰宣布“登高计划”,直言“不登顶就是失败”,并明确表示未来两年不追求短期盈利,而是集中资源攻克AGI的四大核心方向,并拟筹资,计划投入百亿级资源实现机械可解释性技术突破。

可以说,智谱“登高”是上市后的赌上一切的行动。其希望通过冲击技术极限,来强化“全球大模型第一股”的故事,并缓解现实中的压力。

我在杨植麟的决策中,看到了Kimi在三个维度的“登高”:

一是算力登高,从追求流量转向重视价值。公开资料透露,Kimi的API业务占比已超过70%,与此前主要依赖C端订阅的模式截然不同。保老用户、拒新客,实际上是优先将有限算力分配给高价值场景,避免大量泛C端流量挤占已成为收入支柱的B端业务配额。

其代价也是显而易见的。比如“优先保障存量用户”的标准不透明,哪些请求能优先处理、哪些被降级处理,一旦处置不当,都将损害用户信任。

长远来看,Kimi要完成从技术新星向成熟AI头部企业的蜕变,就必须强化弹性算力池、分级响应机制、动态调度能力等基础能力。

二是定价登高,Kimi在进行从低价自助餐到价值分层的压力测试。公告中提到的“拆分Kimi主权益与Code权益”,既是应对算力短缺的临时分配方案,也可能预示着其定价体系重塑的开始。

过去,无论用户写代码、查资料还是闲聊,都支付相同费用、消耗相同算力。当高算力消耗的Code用户比例上升,这种模式必然产生结构性矛盾。

Kimi借此机会进行会员权利拆分,也是尝试按使用场景重新定价:普通用户享受基础服务,专业用户为高价值能力支付溢价。

这是通过价值用户分层,在努力争夺模型产品的定价主导权。目前,K3收费标准已达每百万Token 2.3美元,虽低于海外顶级模型,但已创下国产模型新纪录。

或许,Kimi也想告别低价模式,对外传递一个信号:高性能模型具备定价能力。接下来,大模型竞争将从“比拼参数”转向“比拼基础设施”、“比拼成本定价”。

这一步,比攀登榜单更难,也更贴近商业本质。

三是地位登高,Kimi从地缘变量转变为定价参考。

K3发布后迅速获得全球瞩目。在独立AI模型评测机构Artificial Analysis发布的最新“智能指数(Intelligence Index)”中,K3的综合得分达到57分,位列全球第三,仅次于Claude Fable 5(60分)和GPT-5.6 Sol(59分),超过Claude Opus 4.8(56分)。

这个成绩也打破了“开源落后闭源半代”的行业传统。

同时,K3的影响力已突破技术圈。美国科技投资机构将其视为AI发展的转折点,认为高质量开源模型正在加速能力扩散;加州大学伯克利分校计算机科学教授声称,K3将中国开源模型与美国先进模型的差距缩小至2到3个月。

资本市场的反应同样激烈,K3发布的首个交易日,英伟达单日市值蒸发约1111亿美元;摩根大通策略师在报告中直接称其为“DeepSeek 2.0”。

这个速度,才是改变定价逻辑的关键。

此外,月之暗面ARR(年化收入)到6月已接近3亿美元,海外增速400%,涨价60%后收入反增,这三组数据叠加,证明Kimi的“开源+效率”模式具备规模化变现潜力。

另有消息透露,月之暗面正计划最快六个月内在香港上市,估值在半年内从43亿美元飙升至315亿美元,涨幅超7倍。

这些都是资本市场给予非硅谷主流路线的“认证”。它们为“能实现单位经济模型的SOTA”投下信任票时,也说明Kimi形成了独立的估值逻辑,不再需要对标OpenAI或Anthropic来证明自身价值。

但K3距离AGI仍需时日。以跑分为例,K3比Fable 5仅低3分,背后仍存在差距。

另外,Kimi在技术报告中承认了两个部署层面的不足:一是K3在训练中保留了完整的思考历史(thinking history),若调用方未能正确传递之前的推理过程,或在不同模型间切换,输出质量会明显下滑;二是K3在任务模糊时会“过于主动”,更倾向于替用户做决策。这种“自作主张”在需要精确执行的工程流程中,容易引发连锁错误。

还有个容易被忽视但极为重要的问题:幻觉。Artificial Analysis在测评中特别指出,K3的幻觉率比上一代K2.6反升。

某种程度上,K3的亮眼与隐忧,是全行业算力供需失衡的缩影,也是中国AI产业在算力卡脖子、商业化未闭环、用户预期过高等压力下的集体挑战。

这些AI厂商的每一次过载、每一次“熔断”,都是中国AI“登高”必须跨越的障碍。可以断定的是,一个新的竞争周期已经启动,大模型将从“拼参数”过渡到“拼算力”。

谁能在算法、算力储备等基础建设上领先一步,谁才能笑到最后,并定义下一代AI公司的生存标准。

参考资料:

字母榜,《K3上线48小时》

锦缎,《都怪Kimi》

我是唐辰同学,关注互联网科技及AI新经济。原创内容,未经许可,谢绝转载。

「唐辰同学」

钛媒体、36氪、老虎财经热榜

澎湃新闻2024年最澎湃创作者

老虎财经2024年度优秀专栏

河南日报·顶端新闻2024年度影响力作者

界面新闻优质榜单

老虎财经2024年度优秀专栏

腾讯新闻年度优质热问答主

2023搜狐新闻年度优质创作者

人人都是产品经理2023年度优秀作者

2023网易新闻年度内容合伙人

界面、36氪、钛媒体、澎湃、21财经、蓝鲸、老虎财经等平台专栏认证作者

【差异化调整】本稿将发布至 shixianpress.com。请改换措辞和句式,避免与其他版本重复;事实与数字仍需与原文一致。

相关推荐