AI 的调用量正在迎来前所未有的爆发,但资本市场却开始提出一个尖锐问题:热闹的大模型行业,什么时候才能盈利?
近期一款匿名上线的高性能免费大模型 Ox‑Alpha,也就是国内圈内俗称的 “牛来”(智谱 GLM‑5.3‑Flash),短时间内在开发者圈子迅速走红。模型性能已经逼近全球第一梯队,却几乎免费向市场开放。这件事像一面镜子,照出当下 AI 行业一个极具讽刺的现实:面向用户的 词元(Token) 价格正在雪崩,但是支撑 AI 运行的底层硬件成本,却居高不下。AI 的需求如火如荼,盈利兑现却迟迟没有到来。
新技术走向普及,降价本是常态。每一代全新芯片问世,理论上都会压低生成单个 Token 的硬件生产成本。但现实市场里,大模型厂商对外 API 的降价速度,跑的比硬件成本下降还要快。各家为抢夺开发者客户,不断下调调用单价,甚至推出免费版本。调用规模越做越大,单位收入却被持续压缩。
然而下游打得如火如荼价格战的时候,上游半导体供应链并没有同步迎来降价。从晶圆代工到存储芯片,整个行业已经步入结构性供给不足的周期。
以三星为例,其部分先进工艺代工新订单报价上调最高 15%,同时将 70% 的内存产能,通过多年锁价长约,优先供给大型数据中心客户。显存是大模型推理最重要的资源,大量产能被头部企业提前锁定,后发的大模型企业不仅要接受更高的采购价格,甚至有钱也拿不到足够产能。
于是行业就形成一套很难破解的悖论:
用户端需求持续爆发,模型调用量节节走高;但 Token 售价不断内卷,硬件采购成本却被上游牢牢托住。规模扩张带来的增量收入,很大一部分被芯片、存储的硬件成本吞噬。企业越做大,硬件开支同步膨胀,利润很难释放出来。
这一点,在港股上市的智谱 AI 身上体现得淋漓尽致。作为国内第一家上市的大模型原生企业,公司坐拥可观的模型调用体量,股价却持续承压。市场担忧的核心不是没有需求,而是商业模式的困境:国内大模型赛道内卷加剧,API 单价持续下行;GPU 与显存构成公司最大成本项,成本很难随着规模扩大快速摊薄。即便业务规模增长,净利润的兑现依旧遥遥无期。
放眼全球,这也并非国内独有的困境。即便是海外 AI 企业,同样面临上游算力成本的约束。算力需求推高芯片厂商的业绩,但是红利更多流向台积电、三星这类硬件供给方,而不是处在下游的模型公司。
但,最近美股一批 AI 相关公司冲刺 IPO,似乎他们实实在在赚到了钱,如Anthropic 已经秘密提交 IPO 材料,计划 2026 年秋季上市,目标估值 2 万亿美元,有望成为人类历史规模最大 IPO 。他们的真实业绩:二季度营收 115 亿美元,同比暴涨 14 倍,调整后营业利润已经转正,这在头部大模型厂商里面属于里程碑,年化营收运行率已经达到 650 亿美元,企业 API 订阅是收入核心。
他们对外宣讲 TAM 总潜在市场超过 30 万亿美元。这个数字怎么算出来?把未来 AI 可以替代的人类全部工作的经济价值全部相加,前提假设是它拿下全部市场份额,这仅仅是理论天花板,不是公司营收预期。它内部给投资者的真实远期目标,2028 年营收 1900‑2000 亿美元,和 30 万亿相差百倍以上。
虽然调整后营业利润转正,但 GAAP 口径下依旧是大额亏损;每个月巨额算力账单,高度依赖谷歌、亚马逊的算力供给。同样逃不开目前AI行业困境:Token 价格内卷,芯片、存储硬件成本居高不下。就算收入暴涨,很大一部分收入会被上游硬件厂商分走。
AI 需求爆炸不等于企业赚钱,卖铲子的始终比天然比挖金子舒服。
当然,我们不必就此否定 AI 产业的长期前景。技术迭代会持续推进,未来新一代硬件、架构优化,或许可以逐步打破成本枷锁。但就当下而言,投资者需要认清现实:高调用量不等于高利润,Token 便宜不等于 AI 公司好赚钱。在芯片、存储的供给瓶颈得到缓解之前,AI 行业盈利兑现的时间,可能会比市场预想的更加漫长。



