Appearance
DeepSeek V4发布后的几天,硅谷那边一直在发酵,也带来了几个更尖锐的问题讨论:模型效率、芯片格局、IPO时点、开源对闭源的挤压。
4月29日,来自硅谷101的视频博客,请到芯片架构师肖志斌和前OpenAI研究员Jenny Xiao,两人聊了一个多小时,把整件事彻底聊透了。
被开源超越,你的商业价值归零
对谈里最狠的一句话,是Jenny去年就提出的概念——kill line(死亡线):
"If you're a foundation model company and you get surpassed by open source, the value of your business is essentially zero."
如果你是一家基础模型公司,被开源模型超越了,你的商业价值直接归零。
这不是技术竞争,这是生死线。
顺着这个逻辑,4月24日DeepSeek V4一发布,硅谷所有闭源公司的股价和估值都面临一个灵魂拷问:你的模型,现在还配卖这个价吗?
价格对比:一个贵了两倍,一个便宜了十倍
| 模型 | 输入价格 | 输出价格 |
|---|---|---|
| GPT-5.5 | ~$60/百万token | ~$180/百万token(Pro版) |
| DeepSeek V4 | 1元/百万token | 24元/百万token |
| DeepSeek V4 Flash | 0.2元/百万token | 2元/百万token |
GPT-5.5比GPT-5.4贵了整整2倍。同一天,DeepSeek V4发布,输入价格只有硅谷模型的零头。
基础模型公司的估值是二元的——你的存在理由就是模型最强。一旦不再最强,估值直接归零。哪怕你叫OpenAI。
钱太多,反而不会省钱
Jenny戳破了一个硅谷不敢面对的真相:
硅谷公司钱太多,反而没动力优化效率。中国模型厂商被资源倒逼,更早进入token efficiency创新。
资源约束,反而成了创新加速器。
OpenAI从第一天就信奉"move fast, break things",GPU放开买,infra疯狂建。结果呢?同等收入下,Anthropic的资本效率显著高于OpenAI。
更麻烦的是,OpenAI同时在打硬件部门、自研芯片、购物App几条战线,核心ChatGPT体验反而没做好。
投资人心态彻底变了。以前看AI公司是"曲线还在指数增长,继续投钱"。现在问的是:再投10亿、100亿,边际收益在哪?ROI在哪?
没有效率,AGI只能是个demo
肖志斌读完V4论文认为:"方向意料之内,工程完成度意外。"
V4所有的技术优化,其实都瞄准了同一个靶心——token efficiency(词元效率)。
它用了三把刀:
| 技术 | 作用 |
|---|---|
| CSA + HCA混合注意力 | KV cache大幅压缩,长上下文计算成本从平方级压到线性 |
| mHC流形约束超连接 | 深层信息多条高速公路并行,训练不再发散 |
| Muon优化器 | 部分模块替换传统Adam,收敛速度进一步拉高 |
三件事合在一起:计算成本降到硅谷模型的1/3,内存占用只有1/10。
但V4真正让人细思极恐的地方,远不止"省钱"这么简单。
Jenny提醒:Chatbot时代,token消耗有限,模型贵一点用户也能忍。但Agent时代完全是另一套逻辑——长任务拆解、多工具调用、反复反思和规划,token消耗是chatbot的10到100倍。
如果每个token都价格不菲,模型就没法长时间深度思考,更不可能大规模服务用户。
没有效率,AGI只能是个demo。有了效率,AGI才能成为真正的产品。
到了Agent时代,效率本身就是智能的一部分。
Anthropic凭什么反超到1万亿
这段时间Anthropic估值反超OpenAI,冲上1万亿美元。Jenny把原因列了三条,本质就五个字:专注 > 什么都做。
第一,Claude Code。
为什么Claude Code是Anthropic的"定义时刻"?
一旦模型能写代码,就能做通用任务——更新CRM、转发邮件、搭自动化流程,底层全是代码。
Jenny的判断很锋利:编程是通向AGI最重要的一步。谁拿下编程,谁就可能成为AGI时代的主导玩家。
第二,企业信任。
企业客户反复说同一句话:选Anthropic,因为它有安全承诺。加上Anthropic起诉五角大楼那件事,企业接受了它传递的信号。
第三,不做多余的事。
OpenAI想做"一个所有人的所有东西",结果战线分散,技术领先丢了。Anthropic只打三条线:安全、企业、编程。
硅谷投资人认一个死理:企业收入优先于消费收入。 Anthropic收入高度集中在企业,这恰恰是美国资本市场最爱的故事。
英伟达:短期安全,长期推理市场必然分化
说到芯片,目前都觉得DeepSeek在"去英伟达化"。但实际情况要更细分:
| 阶段 | 英伟达地位 | 原因 |
|---|---|---|
| 训练阶段 | 依然核心 | V4庞大预训练在NVIDIA集群完成,CUDA生态绑定深 |
| 适配阶段 | 后向兼容 | 昇腾/AMD是在"对接"已训练好的模型,非原生替代 |
短期之内,英伟达在训练端的护城河比很多人想的要深。CUDA生态不是一两年能搬走的。
但长期呢?推理市场确实在松动。
V4把长上下文attention成本打下来后,推理不再是"谁卡多谁赢",而是"谁架构匹配谁赢"。
那个让硅谷失眠的"80/20"信号
Jenny投资组合里有个数据:
80%的任务,跑在中小开源模型上。只有20%最复杂的任务,用到闭源模型。
往前推一年,没人会信这个比例。
现在硅谷每天都能刷到这种信息:"我们手里有1000万美元的OpenAI股票,你们基金在买吗?"
最后
Jenny用一句话给整件事定了性:
DeepSeek像一把抵在硅谷模型公司背后的枪。这些公司如果跑得不够快,DeepSeek会追上来,把它们的业务彻底摧毁。
这把枪,已经上膛了。
