
关于AI模型公司,今年有两条消息看起来是打架的。
一条说,有第三方分析机构估算,Anthropic的推理毛利率可能已经升到60%以上。所谓推理毛利率,就是卖token的收入扣掉直接的推理成本后剩下的比例,还没扣研发、训练和销售费用。单看这个数字,卖token这门生意本身,赚钱了。
另一条说,据The Information报道,OpenAI每收1美元仍然要亏掉1.22美元,此前预计2026年亏损140亿美元。
推理都能赚钱了,模型公司为什么还在巨额亏损?
要回答这个问题,得把一笔钱从头到尾走一遍:从买卡或租卡开始,经过折旧和电费,摊到训练和每一个token上,最后跟API定价见面。走完这条路会发现,"一个token能不能赚钱"和"一家模型公司能不能赚钱",是两本账。
这篇把两本账都算一遍。
买和租,只是决定谁承担折旧与闲置
算力的钱有两种花法。
买,是资本开支。一张H100大约2.5万到3万美元,一个万卡集群光GPU就是3亿美元量级,加上网络、存储、机房和电力设施,总投入还要上浮四五成。这些钱花出去,不是马上变成成本,而是先记成一笔资产,然后每年摊一部分进成本——这就是折旧。一张卡假设用六年,每年摊六分之一;假设用四年,每年摊四分之一,当期成本立刻多一半。
租,是运营开支。按卡时付费,直接记成当月当季的花费,用多少付多少。
两种花法的价差这几年变化很大。H100的云租赁价格,2023年高峰时每卡时8美元以上,如今因供应商和合约形式不同差异仍很大——大客户长约和现货折扣可以低到每卡时2到3美元,按需价格仍在6美元上下。价格带拉宽本身就是一条信息:算力正在从稀缺品变成商品,但还没有完全变成。
这里有个容易被绕晕的地方:买还是租,改变的只是谁承担折旧和闲置,不改变经济成本本身。
自建的公司,卡的折旧、电费、闲置损耗全在自己账上。租云的公司,这些成本没有消失,只是先由云厂商承担,再打包成租金收回来——云厂商不做慈善,租金里含着它的折旧、电费和利润。
对整个产业链来说,一张卡从出厂到报废的经济成本是固定的,变的只是账记在谁头上。
所以看模型公司的报表,第一件事是分清它的算力是什么结构。据报道,Anthropic向微软Azure承诺了至少300亿美元的算力采购,同时又和谷歌、博通谈下一代TPU——典型的租赁为主、多供应商押注。这种结构下,它的"推理成本"主要是采购价,谈判能力直接决定毛利。
而对自建的公司,折旧年限是报表里弹性最大的假设。
过去几年,主要云厂商把服务器折旧年限从4年逐步拉长到6年,每拉长一年,当期利润就好看一截。这个假设的天敌是英伟达的发布节奏:一年一代,B200之后是B300,再往后是Rubin。当新卡的单token成本比旧卡低一半,旧卡的经济寿命就到了——不管账面上还剩几年没折完。账面价值和经济价值的差距,迟早要么在报表上一次性确认损失,要么靠低利用率慢慢亏掉。
这不是推演,已经发生了。亚马逊2025年1月起把部分服务器和网络设备的折旧年限从6年缩回5年,理由写得很明确——AI和机器学习技术发展加快。这一项变化使2025年折旧增加约14亿美元,净利润减少约10亿美元,主要影响AWS。
反例也有。V100发布快十年了,还在跑推理负载。旧卡干不了前沿训练,但跑长尾推理绰绰有余。这里说的前沿,是指训练最新一代模型、跑最大规模的推理——这些任务对芯片性能的要求最高,新一代卡一出来,旧卡就跑不动或者性价比被碾压,经济寿命跟着结束。
所以折旧年限之争,本质是赌未来的负载结构:如果长尾推理的需求够厚,旧卡还有活干,六年站得住;如果负载全集中在前沿,英伟达一年一代,两三年就会出性能翻倍的新卡,四年都嫌长。
亚马逊是第一家往回调的。其他几家目前还在六年上。谁先跟进,谁就是在承认自己的赌法变了。
训练:不是每个token的成本,却是留在牌桌上的门票
训练花多少钱,公开数字几乎全是估算,只有一个精确到个位数的例外。
DeepSeek V3的技术报告写着:2048张H800,全程278.8万GPU小时,按每小时2美元的租价折算,557.6万美元。
这个数字当年震动行业,因为外界对GPT-4级别模型的训练成本估算普遍在1亿美元上下。但557.6万美元需要说明它不包含什么:不含研发人员的工资,不含之前所有失败和探索的投入,也不含数据。它是"最后那一次成功训练"的GPU租用费,是整个研发过程的地板价,不是全价。
拿它跟别家的"全成本估算"直接比,比的是两个口径。
但即便把口径补齐,训练和推理的成本性质还是完全不同的两种东西。
推理成本跟着业务量走,多服务一个用户就多花一份钱。训练不是——它跟你有多少用户没关系,跟你要不要继续参赛有关系。
对一个具体的模型,训练是一次性项目投入,花完就收不回来。对一家模型公司,训练是每隔几个月就要重复一次的持续投入,而且一代比一代贵:前沿模型的训练投入,业内估算已经进入10亿美元量级。
所以训练费的正确理解不是成本,是门票。不训练下一代,就退出牌桌;训练了,也只是买到继续坐着的资格。
这张门票的价格决定了这个行业的入场门槛,但决定一家公司日常赚不赚钱的,是下面这本账。
推理:每百万token到底花多少钱
训练决定能不能上牌桌,推理决定坐下来之后能不能赢。
有测算说,token成本的80%以上来自算力。这句话可以再拆细一点。
算起来其实就是一道除法:把这台机器每天花掉的钱——折旧或租金、电费、运维——除以它每天实际产出了多少token。分子相对固定,分母才是各家真正拉开差距的地方。
先给分母一个直观感受。一台8卡H100服务器,跑一个700亿参数的模型,理论上每天能产出的token数以十亿计。但"理论上"三个字水分很大——真实产出取决于一堆变量,每个变量都能把成本改一个量级。
第一个变量是利用率
推理流量有波峰波谷,为峰值配的容量,在谷底就是闲着烧折旧。同一套集群,利用率四成和八成,单token成本直接差一倍。这就是为什么各家都在拼命做批处理——把几十上百个用户的请求攒在一起,一次权重搬运服务所有人。代价是单个用户变慢,收益是摊到每个token的成本大幅下降。
第二个变量是精度
精度是指每个参数用多少字节来存储。存得越精细,占的空间越大,每次搬运的数据量也越大;反过来,压缩到更低精度,同一块内存里能装更多参数,搬运速度也更快,代价是模型的计算准头会下降一点。从每参数2字节压到1字节再到半字节,同样的卡,每秒能产出的token数接近翻倍地涨。有出海团队实测过,换卡加精度压缩,每百万token综合成本从4.5美元降到1.8美元,精度切换的贡献比换卡本身还大。
第三个变量是任务形态,这个变量现在影响最大
聊天问答,一问一答几千token,上下文短,每个token的生成成本稳定。Agent不一样。
Agent会自己规划、调用工具、检查结果、再来一轮,单次任务的token数量可以放大十倍几十倍。但数量只是第一重。更关键的是第二重:多轮循环让对话上下文越来越长,而模型在生成每一个新字时,都要回看之前所有的上下文记录。这堆记录随上下文长度线性增长——上下文从1000个字拉到10万个字,回看的数据量跟着涨两个数量级。
同一颗芯片,跑短对话每秒能吐几十个字,跑长上下文的Agent任务可能掉到个位数。不是芯片变慢了,是每个字背后的搬运量变大了。
所以Agent的成本放大是双重的:token数量乘上了几十倍,每个token的单位成本也在涨。
两个案例可以感受一下量级。据报道,Uber给数千名工程师开放AI编程工具,四个月烧光了全年预算。米哈游一位技术负责人在今年阿里云峰会上透露,团队内有工程师测试多Agent协作,没设熔断,几十个Agent循环调用,13小时收到200万元的token账单。
所以推理成本没有一个"标准答案"。同样的硬件,利用率高低、精度取舍、任务形态,三个变量拨一拨,每百万token的成本可以从几毛钱人民币到几美元,差出一两个数量级。
各家公布的"我的成本比你低",多数时候比的不是技术,是场景设定。
这本账里还藏着那个流行谜题的谜底。2025到2026年,国内API单价累计降了超过60%,但很多企业的AI总支出反而在涨——因为单价降的同时,Agent把单任务消耗放大得更快。价跌量增,量增得比价跌得快。
定价:降本和降价,谁跑得更快
成本算完了,该跟收入见面了。
API定价现在呈现一种奇怪的分裂。一头,DeepSeek V4 Flash的缓存命中价已经打到每百万token 2分钱,通用token的价格在奔向电费;另一头,Anthropic旗舰模型的输出价仍在每百万token 50美元量级——是通用模型的几百倍。
这不是矛盾,是同一个机制的两端。
机制的名字叫开源。开源模型会把训练好的那张数字表公开发布,任何人都可以下载,用自己的服务器跑。当客户随时可以这么做时,闭源API的定价就有了一个外部参照——客户自建的全部成本。你的能力如果开源模型也有,你的价格上限就是客户自建的成本线,压着这条线打价格战,终点是电费加微薄毛利。你的能力如果开源模型没有,这条参照线对你失效,溢价空间就是你能力独家性的市场价格。
开源压低的不是所有人的价格,是"可替代能力"的价格天花板。
于是模型层的收入端也分成了两条曲线:可替代部分的价格一路向下,独家部分的溢价看能力保持多久。
现在把成本和价格两条曲线放在一起,就是这门生意的胜负手:
模型公司能不能赚钱,不取决于token成本是否在下降——它一定在下降——而取决于自己的成本降得是否比市场价格更快。
成本曲线的下降靠硬件迭代、量化、利用率优化,这些前面都讲过。价格曲线的下降靠开源追赶和同行内卷。两条曲线都在往下走,谁陡谁缓,决定毛利是扩张还是压缩。
Anthropic自己给投资者的预测是,毛利率从2025年的约40%提升到2026年的乐观情形约63%、2027年目标70%。第三方机构SemiAnalysis的估算更激进,认为推理基础设施毛利率已经超过70%。两者的差距一部分来自口径——Anthropic的毛利率包含免费用户的推理成本,SemiAnalysis侧重付费API。
不管哪个口径,方向是一致的:成本降得比价格快,毛利在扩张。反过来,通用token市场上的多数玩家,价格降得比成本快,毛利是负的,卖一单亏一单。
同一个行业,两条赛道,中间地带最危险:能力不够独家,收不了溢价;规模不够大,摊不薄成本。这是大多数模型公司现在站的位置。
从推理毛利到公司利润,还要跨过两道门
推理毛利转正,只是模型公司盈利的起点。把公司层面的账写全:
公司利润= 推理收入 − 推理成本 − 持续训练与研发 − 获客和运营费用`
前两项相减就是推理毛利,上面算过了。后两项是两道门。
第一道门是持续训练。第二节说过,训练是门票,而且票价在涨。推理赚到的毛利,先要喂饱下一代模型的训练——这笔开支不跟业务量走,跟竞争强度走,对手训你就得训。
第二道门是获客和分发。模型本身不会自己找到客户。据SemiAnalysis估算,Anthropic以企业客户为主,用户均价远高于OpenAI——后者有近10亿免费用户,付费转化率仅约6%。企业客户单价高,但销售成本也高;免费用户获客便宜,但变现效率低,而且推理成本照付。
把两道门算进去,能赚钱的模型公司大概只有三类。
第一类,成本领先者。规模最大、成本压到最低,在通用token的红海里靠薄利多销活下来,DeepSeek走的是这条路。
第二类,能力溢价者。保持某项能力的独家性,在开源参照线之上收溢价,Anthropic的编程能力是当前的样本。
第三类,分发占优者。模型未必最便宜也未必最独家,但有现成的客户关系和分发渠道——谷歌把模型塞进搜索和办公套件,微软塞进Windows和Office,腾讯塞进微信。模型对它们不是独立生意,是已有生意的增强项,获客成本近乎为零。
三类之外的位置,都要面对同一道算术题:毛利被价格战压薄,训练门票一年比一年贵,获客费用降不下来。
往后看,这本账上有两个指标值得盯。
一个是头部模型公司的推理毛利率走向——Anthropic自己的预测是逐年抬升到70%,如果实际数字持续兑现,说明这个行业有靠自己赚钱养活自己的基础;如果达不到,说明成本跑不过价格。
另一个信号已经出现了:亚马逊把部分服务器折旧从六年缩回了五年。其他几家云厂商还在六年上。谁先跟进下调,等于承认硬件迭代快于会计假设,那时候不止模型公司,整条算力链的利润都要重算。
晋ICP备17002471号-6