34岁的鼓手,正在改写全球AI价格表
真正的看点不是模型分数,而是杨植麟押上的路线:开放权重 + 长上下文 + Agent集群,一条与OpenAI截然不同的路。
文章作者、来源:0x9999in1,ME News

TL;DR
- 2026年7月16日,月之暗面发布Kimi K3,2.8万亿参数、100万token上下文,Artificial Analysis独立评测综合得分57.1,全球第4,超越Claude Opus 4.8。
- 创始人杨植麟34岁,清华本科、CMU博士,Transformer-XL与XLNet的第一作者,属于"把自己写的论文做成产品"的极少数人。
- 月之暗面2026年5月完成新一轮约20亿美元融资,估值突破200亿美元,三个月内估值翻了约4倍。
- K3发布当天,纳斯达克下跌超1.4%,英伟达同步走弱——一家中国创业公司的发布会,第一次实实在在地推动了美股情绪。
- 但K3不再"极致便宜":$3/$15每百万token,是上一代K2.6的约3倍,标志着"中国AI白菜价"时代的转折。
- K3的幻觉率被独立评测测出高达51%,输出啰嗦、开放权重延后到7月27日,故事并非完美。
- 真正的看点不是模型分数,而是杨植麟押上的路线:开放权重 + 长上下文 + Agent集群,一条与OpenAI截然不同的路。
一位鼓手,为什么能造出全球第四的模型
先说结论。杨植麟不是运气好。
他是极少数"理论到产品闭环"的人。
Transformer-XL、XLNet,两篇论文,第一作者。这两篇不是普通论文。它们是今天所有大模型处理长序列的地基之一。
写论文的人很多。把论文变成公司的很少。把公司做进全球前四的,全世界一只手数得过来。
1992年出生,广东汕头人。清华计算机系本科,一边写代码一边在校园摇滚乐队Splay打鼓、写歌。四年拿下卡内基梅隆大学博士学位。Google Brain、Meta AI 都待过,合作者名单里有Bengio、有LeCun。
24岁联合创办第一家AI公司。2023年3月,创立Moonshot AI。
这个履历放在硅谷,也是稀缺样本。放在中国,几乎独此一家。
为什么强调这个?
因为在大模型这条路上,"我读过所有相关论文"和"这些论文是我写的",是两种完全不同的势能。前者是学习曲线,后者是先发直觉。杨植麟属于后者。
Transformer-XL解决的是"序列太长记不住"的问题。XLNet做的是超越BERT的预训练范式。这两件事的延长线上,是今天Kimi最鲜明的产品标签:长上下文。
从早期Kimi智能助手主打的20万字,到后来的200万字,再到K3上来直接给1M token(约100万token)。
这不是营销选题。这是他学术生涯自然的延伸。
Kimi K3到底强在哪,又弱在哪
先看硬数据。
Kimi K3发布于2026年7月16日。2.8万亿总参数,稀疏MoE架构,896个专家中每个token激活16个。上下文窗口1,048,576 token。原生支持视觉。
独立第三方Artificial Analysis的Intelligence Index v4.1评分:57.1,全球第4。
前面三名分别是Claude Fable 5(59.9)、GPT-5.6 Sol(58.9)、以及Kimi K3自己身后紧追它的Claude Opus 4.8(55.7)。再往下,Grok 4.5是53.8,GLM-5.2是51.1,DeepSeek V4是44.3。
这是中国模型第一次真正意义上挤进全球第一梯队。
再看具体子项。GPQA Diamond:93.5%。Terminal-Bench 2.1:88.3%,几乎与GPT-5.6 Sol的88.8%持平。BrowseComp:91.2%。在Arena.ai的Frontend Code竞技场,K3拿了第一,压过Claude Fable 5。在AutomationBench-AA上也是第一,53%。
在GDPval-AA v2这个衡量"实际经济价值知识工作"的独立评分上,K3的Elo从上一代K2.6的1190直接拉到1668,超过Claude Opus 4.8的1600、GLM-5.2的1514、GPT-5.5的1494。
跳跃幅度是478 Elo。相当粗暴。
那么弱在哪?
幻觉率高。Artificial Analysis测出K3的幻觉率是51%,比上一代还高。准确率提升了,但"胡说的概率"也上去了。
啰嗦。K3在全套AA评测中输出了1.3亿token,行业平均是6300万。翻倍。Simon Willison测了一个简单的"画一只鹅"的SVG任务,烧了大约0.25美元。
开放权重延后。发布当天没有checkpoint、没有license、没有model card、没有技术报告。Moonshot承诺7月27日之前放出——也就是本文写作的六天后。在这之前,K3只能通过API和App用,本质上是个"托管模型"。
没有SWE-bench Pro/Verified分数。Moonshot自己选的DeepSWE、FrontierSWE等评测集还不能被第三方复现。
所以,K3是一款"真正好,但还没完美"的模型。这一点值得说清楚,不能替它吹。
更值得关注的信号:中国AI不再"白菜价"
这是K3最容易被忽略、但可能最重要的事情。
K3的API价格:$3每百万输入token,$15每百万输出token,缓存输入$0.30。
上一代Kimi K2.6是多少?$0.95 / $4.00。
涨了大约3倍。
这个价格是什么概念?基本对齐Claude Sonnet级别。也就是说,Moonshot主动放弃了过去几年中国大模型最鲜明的一张牌——极端低价。
为什么?
因为2.8万亿参数、始终开启的深度思考模式、1M上下文,成本压不下去。也因为,K3的定位已经不是"给你便宜用的助手",而是"跟Claude Opus和GPT-5.6正面竞争的Agent级基座"。
有意思的是,即使涨价3倍,Artificial Analysis算下来K3的单任务成本仍然只有约$0.94,是Claude Opus 4.8($1.80)的一半左右,与GPT-5.6 Sol的$1.04基本持平。
半价对标,同一梯队。
这才是让美股在7月17日抖了一下的原因。
那一天,纳斯达克下跌超过1.4%。英伟达也跟着被卖。一家中国创业公司的发布会,实实在在地牵动了美股情绪。
这在两年前不可想象。两年前,中国模型发布对美股的传导路径几乎不存在。
现在存在了。因为叙事变了。
叙事从"美国造前沿,中国追随",变成"中国也造前沿,而且还开权重、还便宜一半"。这个叙事对Anthropic、OpenAI这些闭源前沿实验室的定价能力,是直接的、长期的、结构性的挤压。
200亿美元估值背后:三个月翻四倍的赌注
融资节奏也在讲同一个故事。
2024年年底,Moonshot估值大约33亿美元。到2026年5月,新一轮约20亿美元融资落地,估值超过200亿美元。
三个月翻四倍。
杨植麟自己在2026年3月的中关村论坛上说过一句话——"未来几年,越来越多的研究工作将由AI主导"。他在2026年GTC上又披露了三条技术路线图:Token效率、长上下文、Agent集群的规模化扩展。
看懂这三条,才能看懂Moonshot的赌注。
Token效率,对应的是K3那两个新机制:Kimi Delta Attention和Attention Residuals,据称让解码速度快了最多6.3倍。
长上下文,对应的是从20万字到1M token的一路狂奔。
Agent集群,对应的是K3被明确定义为"agentic reasoning model"——为长链条任务、代码库导航、工具调用而生,不是为聊天而生。
这三条路线,是杨植麟对"下一代AI形态"的下注。
他赌的是:单一大模型不是终点,动态生成、协作调度的智能体集群才是。
这个判断是否正确,两年内会有答案。
开放科学,才是中国AI真正的护城河
这里必须提一个更大的背景。
这段时间,有一段来自海外AI研究者的观察在圈内流传很广,大意是:中国实验室之所以能持续产出GLM-5.2、Kimi K3这样的模型,不是因为算力更多,而是因为开放——不仅仅是开放权重,还包括开放整个生态。
这段话有一个很扎心的观察:中国顶尖实验室大量的模型训练工作,是由实习生完成的。而且这些本科生和研究生,对训练细节理解深入,分享意愿是美国同行的100倍。
反过来,美国前沿实验室基本不招实习生。斯坦福、伯克利的博士生,要拼命才能抢到一次训练"合适规模"模型的算力机会。大部分秘方被一小群特权研究者锁着。
这不是中美之争。这是开放科学和封闭科学之争。
Kimi K3的存在,本身就是这个论点最好的注脚。
一个34岁的鼓手创业者,拿着自己写的论文当地基,带着一群还在读书或刚毕业的年轻人,做出了全球第4的模型。
这件事在OpenAI内部大概率发生不了。不是人不行,是机制不允许。
当然,K3把开放权重推迟到7月27日,本身也是一个信号——开放派也在犹豫,也在计算,也在被商业化倒逼着后退半步。这个动作值得警惕,但不至于推翻大方向。
DeepSeek V4还在MIT协议下敞开着。GLM-5.2也在。开放权重的中国方阵没有散。
一个鼓手能走多远
回到杨植麟这个人。
摇滚鼓手出身的技术创业者,在中国AI圈里几乎是个异类。他不像那种典型的"清华学霸科学家"人设,也不像典型的"硅谷海归精英"路数。
他的公开发言不多,密度却高。GTC 2026那次演讲,他把技术路线图讲得很硬——重构优化器、重构注意力机制、重构残差连接。这不是PR话术,是技术判断。
他也承认Moonshot的短板。K3自己的发布博客里写得很坦白:与Claude Fable 5和GPT-5.6 Sol相比,UX还有差距;对保留的思考历史敏感;对模糊任务"过度主动"。
一个坦诚的CEO,一个把自己论文做进产品的研究者,一支被清华系连接起来的年轻团队,加上一条清晰的技术路线。这就是Moonshot今天的底盘。
它不完美。它会犯错。它的商业化路径还没完全跑通——涨价3倍能不能维持增长,1M上下文的算力开销能不能压下去,Agent形态什么时候能真正落地——这些都是问号。
但它是真的。它不是PPT公司,不是估值泡沫,不是靠一时炒作。
结语:抖一下的纳斯达克,只是一个开始
2026年7月17日,纳斯达克跌了1.4%。
有人会说,跌1.4%算什么,市场每天都在波动。
但你要看的是因果链:一家中国创业公司发一个模型,能被路透社、CNBC、Simon Willison这样的独立测评人同一天认真评述,能让NVIDIA被同步抛售,能让Artificial Analysis直接把它排进全球前4。
这在过去从未发生。
它意味着一件事:AI的定价权和话语权,正在从旧金山湾区悄悄漂移。不是全部漂移,是开始漂移。
杨植麟不是唯一的推手。DeepSeek团队是,智谱是,阿里通义是。但他确实是这一轮里最锋利、最典型的那个符号——一个懂理论、懂产品、懂开放、懂商业化,还打过鼓的34岁年轻人。
模型会有下一代。K4、K5总会来。分数总会被追平又被反超。
真正留下的东西,是这条开放路线能不能守住。
如果守住了,AI就不会是三家公司的AI。
如果守不住,那我们只是从旧的封闭,走向了新的封闭。
至于杨植麟本人——他大概不会太在意这些宏大叙事。34岁,公司估值200亿美元,手里握着一款全球前四的模型,团队里全是他能对话的年轻人。这个位置,已经足够他继续打鼓、继续写论文、继续做那个"把自己论文变成产品"的少数人。
至于纳斯达克第二次抖的时候是什么时候?
大概不会等太久。
参考资料
- Reuters, "China's Moonshot unveils world's largest open AI model, closing in on US rivals", 2026-07-17
- CNBC, "China's Moonshot AI unveils Kimi K3 that rivals OpenAI, Anthropic", 2026-07-17
- The AI Rankings, "Kimi K3: Benchmarks, Pricing & Review — Moonshot's 2.8T Frontier Model", 2026-07
- The Decoder, "Kimi's open model K3 nears GPT-5.6 Sol and Fable 5 while signaling the end of super-cheap Chinese AI", 2026-07
- Artificial Analysis, "Kimi K3 Model Card & Intelligence Index v4.1", 2026-07
- 华尔街见闻,《Kimi创始人杨植麟:未来AI研发将进入AI主导时代,公司估值已达180亿美元》,2026-03-25
- 智脑时代,《杨植麟GTC 2026演讲:首次完整披露Kimi模型技术路线图》,2026-03-18
- China AI Atlas, "YANG Zhilin (杨植麟) Profile"
免责声明:文章中的所有内容仅代表作者的观点,与本平台无关。用户不应以本文作为投资决策的参考。
你也可能喜欢
伦巴德:GPIF超配日债或引发全球套息平仓,西班牙国际银行:GPIF或抛售620亿美元美债!

伦巴德:GPIF超配日债或引发全球套息平仓,西班牙国际银行:GPIF或抛售620亿美元美债!
伦巴德全球宏观研究指出,GPIF正在或即将加速回流日本国内债券,这一结构性资金回流将推动USD/JPY跌破150,并指向130至140的公允价值区间,而全球套息交易的被动去杠杆风险尚未被市场充分定价。西班牙国际银行指出,由于日本本土资产吸引力的提升,在现行政策框架下,GPIF或减持高达620亿美元美债。
隔夜美股 | 美国8月CPI加速上涨 三大指数本周收跌 美油累涨近10%
截至收盘,道指涨509.19点,涨幅0.98%,报52573.29点;标普500指数涨65.28点,涨幅0.86%,报7656.98点;纳指涨251.32点,涨幅0.96%,报26333.04点


