Anthropic与内存需求变化


一、2026年AI资本开支全景

2026年全球四大科技巨头(Alphabet/谷歌、亚马逊、微软、Meta)AI资本开支合计预计达7250亿美元,比2025年的4100亿美元增长77%,仅2026年第一季度,四家企业AI基础设施相关资本开支就达1300亿美元。

数据来源:各公司2026年财报及公开电话会议指引

如果计入甲骨文,五大巨头2026年资本开支约8000亿美元(摩根士丹利预测),那么027年更有望突破1.1万亿美元。高盛预计2026年超大规模云厂商资本开支占经营现金流的比例将升至约100%,同时也意味着这些公司正将几乎全部内部现金流重新投入AI基础设施。

中国字节跳动2026年把资本开支计划上调至超2000亿元人民币;阿里巴巴集团主席蔡崇信确认公司此前承诺未来三年将投入超过3800亿元人民币用于AI及云基础设施建设;美银证券报告将腾讯2026年资本开支预测上调至1850亿元人民币。几家头部企业合计约1000亿美元左右。

现在市场有一个对AI的探讨如此巨额的投入能否被AI商业化回报所覆盖?Anthropic给了市场一个答复:年度经常性收入从2025年底的90亿美元增至超过600亿美元,有望于2026年三季度实现息税前利润转正。

二、Anthropic:增长最快的AI公司

数据来源:Anthropic官方披露及公开融资公告

Anthropic快速发展因素:

1)Claude Code:年化收入超25亿美元,全球约4%的GitHub公共提交由该工具生成。

2)企业客户:年支出超100万美元的企业从2月的500家增至4月的1000家。

3)毛利率改善:推理毛利率从38%升至70%以上,每1美元收入的算力成本从71美分降至56美分。

Anthropic预计2026年第二季度营收将超过109亿美元,并首次实现季度营业利润约5.59亿美元。

Anthropic的token效率:

在人在环路(human-in-the-loop)的反馈循环里,Anthropic的模型比OpenAI更省token。尽管OpenAI在顶尖科学、数学、代码的边缘任务上确实能做Anthropic做不到的事,但往往要花3倍时间、4倍token,人机反馈循环更慢,用户感知反而更差,所以token效率是商业模型的关键。

“你有四个小时做一个任务,是给模型发一次调用让它自己跑四小时好,还是分四次调用来回沟通好?”——SemiAnalysis分析师Dylan Patel

数据来源:各模型官方技术报告及第三方评测

一个反直觉的结论:在助手场景最贵的模型往往是最便宜的选择,因为你买的不是token,是一次做对的准确率。而效率优势是Anthropic企业客户复购率极高、毛利率快速攀升的原因。

三、最硬的赛道还是内存

之前的AI训练靠的是喂更多数据、堆更多算力来提升智商,现在这条路已经快到顶点。现在的AI(比如o1、Claude这类会思考的模型)提升能力的方式变成了多想想、多推几步再回答。

多想几步的过程对内存的消耗是很大的,因为你每多想一步AI就要把前面所有的思考过程都记在缓存里(这个缓存就叫KV cache)。如果让AI读一篇10万字的文档再回答问题,它翻来覆去思考时(现在deepseek等国内大模型也有深度思考选项),需要缓存里要反复读取这10万字,内存占用会暴涨几十倍上百倍,而计算量却没怎么变。

举个比喻:以前是让一个学霸直接写答案;现在是让这个学霸先打10页草稿、反复推理验证再誊写最终答案。草稿纸的消耗量,比脑力消耗增长快得多。

所以内存价格涨价还远没到头,因为每多一个推理模型上线,KV cache就要吃掉海量内存,直到把买不起内存的用户(比如中低端手机厂商)挤出市场为止,这就是内存从普通大宗商品变成AI硬通货的根本原因。

技术原理极简拆解:

推理时每生成一个token,都要把所有权重读入芯片,同时读入KV cache。从权重侧看,上下文长短对内存压力差异不大。但从KV cache侧看,读1000个token和读10万个token,内存需求差出两个数量级,而计算量几乎不变。

现在供给端的内存产能未来三年每年仅增20–30%,需求却在翻倍。终端影响已经显现:中低端中国手机厂商(如小米)出货已下降40%;Dylan判断明年iPhone、MacBook价格将不得不上涨数百美元,直到AI需求不再增长,市场达到新平衡。

产业传导路径如下:

AI Agent token效率→Anthropic胜出→商业化盈利验证→资本持续涌入推理场景→reasoning scaling law引爆KV cache→内存需求失控→存储成为比算力弹性更大的投资主线

四、国内视角:投入与差距

国内企业26年预计的投入约为美国的七分之一,但2026年5月中国AI周调用量(AI大模型被实际使用的次数和总工作量)达美国的4.27倍。国产模型如智谱GLM-5.2、通义Qwen3.7-Max已跻身全球第一梯队,但在多模态深度、前沿科研能力上还有进步的空间。

国产智谱AI在2026年1月登陆港交所的全球大模型第一股,上市不到半年股价累计涨幅超1900%,6月22日盘中市值一度突破万亿港元。商业化层面,智谱2025年全年收入超7.24亿元,同比增长131.9%;瑞银预计2026年底ARR可达15亿美元。

但业务高增的同时存储压力成为推理瓶颈,智谱设计Layer Split分层存储方案是不再让每张GPU记住全部上下文,而是分工存储、通信协同,该方案已被开源推理框架SGLang采纳。

这个实践也能看出随着AI从简单问答走向复杂的深度思考,存储,特别是用于工作记忆的KV Cache存储,是决定性能和成本的瓶颈。

(END)

            预览时标签不可点