Appearance
国内首家百亿估值纯推理GPU独角兽诞生,推理成本要压到一分钱
📰 概要
推理GPU赛道杀出了一匹黑马。2026年4月20日,曦望官宣完成新一轮超10亿元融资,估值突破百亿。它成了国内首家纯推理GPU独角兽。
七轮累计约40亿元,400人团队、研发占比超80%。曦望最刺激的目标是:百万Token成本压到一分钱。
按行业目前约0.3到0.5元的均价,这是一个降幅达97%的目标。英伟达刚在GTC 2026上推出推理专用LPU,证明推理正取代训练。曦望踩的正是这个时间点。
🔍 解读
资本押注的不是曦望技术多超前,而是推理这个结构性机会。AI正从训练转向大规模推理部署,算力需求的重心已经偏移。
英伟达推LPU释放了明确信号:推理专用是下一个主战场。
国产GPU赛道原本是训推一体三巨头的天下——壁仞、燧原、寒武纪。曦望All in推理,相当于切了一块没人专门占的蛋糕。
但挑战在于:客户需要训推一体时,曦望只能跟别人合作。这意味着它做不了大客户的单一供应商。
还有一个风险值得注意。据量子位报道,启望S3已批量出货,但具体出货量和营收数据没有公开。对一家百亿估值公司来说,这个信息缺口迟早要补上。
💎 深挖
曦望的融资节奏在国产芯片圈属于极速档。从2024年底从商汤分拆,到2026年4月估值破百亿,一年七轮的速度超过了当年寒武纪。
背后的逻辑很简单——推理需求正在爆发,资本在抢窗口期。
曦望的三位联席CEO构成了经典铁三角。徐冰(商汤联创)提供AI认知,王勇(前AMD架构师)负责芯片设计。王湛(前百度资深副总裁)主导商业化。
这种组合在国产GPU团队里比较少见——大多数团队只有芯片背景,缺少商业化基因。
技术路线也跟主流不同。当几乎所有国产GPU都在卷训推一体时,曦望的启望S3 100%自研AI Core,只做推理优化。
推理芯片不需要兼顾反向传播,可以在更低功耗下实现更高吞吐。据官方数据,启望S3的推理能效比超过A100的2倍。
但什么情况不建议用?如果你的业务需要训推一体——比如模型微调后直接部署——曦望的纯推理芯片可能不合适。
它缺少训练所需的反向传播能力,需要搭配其他GPU使用。这会增加系统复杂度和集成成本。
另一个不确定因素是生态成熟度。曦望宣称CUDA兼容度99%以上,但那1%的差异在企业大规模部署时可能是致命问题。
Groq的LPU也遇到过类似情况——性能漂亮,但客户迁移时发现算子不兼容。
如果你正在做推理部署的方案选型,可以联系曦望要测试卡试试。尤其适合高吞吐低延迟的场景。但如果是关键生产环境,建议等第三方验证后再All in。
一句话:推理芯片的风口到了,但收割的镰刀还没磨好。
