石油成为现代工业的血液,用了半个多世纪。它要先被开采、被提炼、被定价,才谈得上驱动一个时代。

Token走完这条路,只用了三年。

国家统计局的数据:截至2026年3月,中国日均Token调用量突破140万亿,比上年末增长超40%。随着调用量和计费体系扩张,Token正从技术计量单位转向可被生产、消耗和计价的标准化资源。

大宗商品的价值,由三件事决定:产量、单位成本、最终产出的生产力。

7月20日的2026世界人工智能大会,无问芯穹发布「前店后厂一中心」Agentic Infra战略布局,把这三件事写成了一个公式:

AI生产力=智能资源规模×Token转化效率×AI生产力转化效率。


这个公式的三个变量,正是资本市场重新给AI基础设施定价的三条线。

过去,市场衡量一家AI基础设施公司,主要看规模。随着推理需求上升,同样的算力能产出多少有效Token、单位成本能降到多低、能支撑多少实际业务,正在成为新的评价维度。

无问芯穹押注的,正是这次迁移。


超级周期已确认,资本在为「规模与效率」集中定价

全球AI基建的「超级周期」正在进行中。

高盛在最近发布的《Tracking Trillions》报告中给出一组数字:2026年超大规模数据中心资本支出,共识口径5270亿美元,基准模型口径高达7650亿美元;到2031年,累计AI基础设施投资将达7.6万亿美元。四大超大规模厂商合计资本支出接近7000亿美元,同比增长77%。

对资本市场来说,「要不要投AI基建」不再是问题,问题已转向「投在哪里,回报最高」。

一级市场先给出了答案。2026年上半年,AI基础设施赛道密集出现标志性融资:Together AI估值83亿美元,Fireworks AI以150亿美元估值洽谈新一轮,Baseten达到130亿美元。

三家成立都不超过四年,都聚焦推理优化,估值都在半年内跳级。

资本正在用真金白银,为「推理效率」这一件事集中定价。过去,训练主导,谁有更多GPU、训更大的模型,谁就拥有定价权;现在,推理主导。

2026年推理工作负载已占AI算力总量约三分之二,推理基础设施资本支出预计达680亿美元,超过训练的450亿美元。

更关键的是成本曲线与需求曲线的背离,斯坦福《AI指数报告》与TokenCost的数据显示,AI推理成本近两年下跌超过99.7%;而同一时期,企业AI云支出在2024到2025年间翻了三倍。成本大幅下降,用量涨得更快,杰文斯悖论正在AI算力上重演。

SemiAnalysis创始人Dylan Patel在红杉资本《Training Data》播客中给出过一个判断:推理将成为比石油更大的市场,占全球GDP的多个百分点。

Token需求仍处于快速扩张期。每一次代表性模型或产品的爆发,都会抬高单次调用量:从最初几百Token的对话,到推理模型的1万量级,再到部分Agent任务50K起步的输入。需求增长快于物理算力供给,推理基础设施因此持续承压。

供需缺口,因此是长期的、结构性的。

海外投行也给出了同一方向的判断,花旗在2026年6月的推理专题报告中指出,算力的稀缺性正在被价格快速货币化,而货币化的速度,快过它被技术解决的速度。一个佐证是,连上一代的A100,租赁价格都在六周内累计上涨了11%。

在这条迁移线上,单纯算力租赁的同质化压力正在上升。Agentic Infra的估值弹性来自软件优化和推理需求,商业确定性仍取决于算力利用率、客户留存和单位经济。


无问芯穹的生意怎么拆

回到那个公式,AI生产力=智能资源规模×Token转化效率×AI生产力转化效率。

无问芯穹「前店后厂一中心」Agentic Infra战略布局,各自对应这个公式的三个变量。

「一中心」,算力集散中心,最大化智能资源规模,把散落的、异构的算力资源统一汇聚、弹性调度、按需利用,为模型与应用层筑牢充足、稳定、可扩展的算力底座。

无问芯穹推出面向大模型的异构集群跨域训练系统,实现调度、通信、框架三位一体的全栈协同优化。目前这套系统已在全国部署触达超 37,000P 算力、覆盖 16 种主流芯片,盘活了广域分散的异质算力。

在中国算力供给高度碎片化的背景下,跨集群、异构芯片的部署触达,决定了名义算力能否转化为有效算力,其技术门槛远高于单纯的资源聚合。


「后厂」,Token工厂,用极致效率服务Token 的规模化、高质量生产。其商业逻辑可以概括为:算力即收入,优化即利润。

在本次WAIC发布会上,公司提出了一项新的核心技术:跨集群异构PD分离,将大模型推理的Prefill和Decode两个阶段解耦,分别部署到跨集群的异构芯片上,以提高异构算力的推理效率。

据公司披露,这项技术带来了明显的成本改善:实测显示,该架构在首 Token 延迟(TTFT)降低 51.5%的同时,单 Token 成本可降低 37.5%。


在Token计费模式下,系统优化降低的单位推理成本可以直接改善毛利率,前提是服务价格和算力利用率保持稳定。

技术驱动的平台生意,和资源驱动的转售生意,赚的是两种钱。这条路径,海外头部也在走。

据The Information报道,OpenAI通过一次系统级优化,把部分模型的推理成本压低了约一半,办法是提高现有服务器利用率,没有增加新硬件。这说明系统优化已经成为AI基础设施单位经济的核心变量。

据公司披露,通过与头部大模型企业的密切合作,无问芯穹在真实业务场景中持续打磨、积累大量经验,截至7月,无问大模型服务平台单日 Token 调用量较去年12月,已实现了40倍增长,而海量业务数据又能反哺技术快速迭代,催动平台性能与可靠性的同步跃升,形成“业务带技术,技术提效率,效率促增长”的正向循环。

夏立雪在发布会上呼应黄仁勋提出的“算力即收入”,提出了下一句 :“优化即利润”这是无问芯穹在“后厂”业务上,如何兼顾规模与效率的答卷。

「前店」,AI生产力商店,Token 高效转化为产业真正认可的高质量AI生产力,持续赋能千行百业降本提效。

它有两个方向。

对外,把智能体解决方案输出给百业,文娱游戏、医疗健康、法律终端、能源电力,各有落地,把技术势能全面转化为各行业能用、好用、可复用的落地价值。

对内,用Agent改造基础设施自身:通过智算集群运维智能体系统“智算集群运维+智能体”,通过多智能体协作,能够端到端地解决实际生产场景中的运维难题,这样一个7×24 小时全天候值守的智能专家,让智算集群的运维从“人找问题”转变为“问题找人”,和“问题自己解决”,公司宣布,该系统可实现运维人效提升 5 倍以上,关键故障处理效率提升 6 倍;此外,通过“高性能算子生成智能体系统 KernelMind”,能够在真实编译试错与知识沉淀中持续自迭代,稳定交付可直接落地的高质量工业级算子——算子是 AI 算力的核心基石,极大影响了芯片与集群的真实算力上限,同时也是拉开基础设施效率差距的关键变量。


通过对于“前店后厂一中心”的拆解,不难发现,Token工厂只是无问芯穹Agentic Infra体系的一环。完整的Agentic Infra技术组合在一起,形成覆盖训练、推理、调度、运维和生产力赋能的能力网络。

其中,模型路由正被机构看作下一个价值高地。花旗判断,能够决定「哪个模型、何种量化、在哪种硬件上处理哪个子任务」的路由层,将成为未来捕获推理价值的关键。模型路由也因此成为无问芯穹继续补齐的关键环节。

而放在全球坐标,无问芯穹与Together.ai、Fireworks等同属第三方推理基础设施平台,商业逻辑都建立在算力供给之上的软件优化与服务能力。

无问芯穹的差异化能力,在于同时适配16种芯片体系,并应对中国市场更复杂的异构算力供给,这是公司基于国内算力生态构建的一道技术“护城河”。


四个维度,看Agentic Infra这门生意的价值

在资本市场的坐标里,无问芯穹Agentic Infra的价值,可以从三个维度观察。

第一,需求更具持续性。

单次训练具有阶段性,推理则会随着用户调用持续发生。Agent每完成一个任务,都在消耗Token。据公司披露,无问芯穹95%以上的Token调用来自Agent化场景,表明平台Token需求结构已经明显向智能体驱动的推理迁移。

Anthropic提供了一个可参照的样本:其在2026年二季度已实现净利润为正的现金流(不含股权激励),Opus 4.8的Token毛利率超过80%。算力供给直接推高了营收上限。

Dylan Patel的判断与此呼应:AI算力的供需差异,在可预见的未来都难以弥补。模型每迭代一次,就会大幅扩展它能完成的有价值任务的范围,而这种扩展的速度,始终快过算力供给的增长。

这呼应了无问芯穹在本次 WAIC 上还发布了一个新的关键洞察:强化学习成为下一代AI进步的重要手段。但相较传统预训练,强化学习有“多角色协同”的独特特性,其算力需求的硬件种类更加复杂,规模量级也更加庞大,基于异构和超大算力规模的双重刚需,跨集群强化学习因此成为智能规模化及持续进化的新锚点,这也是无问芯穹Agentic Infra 自主式基础设施平台重点布局与攻克的核心场景。

针对跨域强化学习场景,无问芯穹利用全栈协同的技术思路,从网络、平台到框架做一体化深度优化,打通分散的异构集群,实现全局资源一盘棋调度,让大规模跨域强化学习不仅可以“跑得通”,还能“跑得快、跑得稳”。

无问芯穹联合创始人兼CEO夏立雪在发布会现场表示,未来,公司还会将跨域计算资源的支撑规模,持续拓展至十万卡级以上,支撑下一代Agentic AI的在线进化。

第二,盈利更具护城河。

推理服务的价格竞争最终会落到单位成本。

公司在WAIC宣布,过去一年,通过一系列原始技术创新,推动了推理成本下降 10 倍,而随着跨集群异构 PD 分离架构的持续成熟落地,可预见的未来,推理成本依然有10倍以上的下降空间。

Together AI也提供了一个参照:其推理优化引擎ATLAS通过自适应推测解码加速Token生成,性能较超大规模云厂商快2至3倍。

技术驱动的效率,决定了推理平台能否在价格竞争中保留利润空间。

第三,市场更具想象力。

黄仁勋把AI基础设施放进「能源、芯片、基础设施、模型、应用」的五层蛋糕里,基础设施与芯片、能源同属万亿量级的市场。

Agentic Infra的天花板,会从算力规模一路延伸到全行业的AI生产力。

更远的空间在物理世界,无问芯穹在本次 WAIC 上发布了首个面向大规模具身任务的云边端一体化管理与调度平台,尝试突破“物理世界中,具身智能的 Scaling Law 同样被基础设施限制”的难题。

针对具身智能的训练与推理部署两大核心环节,公司宣布了两项重磅技术升级:面向具身智能的大规模强化学习训练框架 RLinf V0.3 ,以及面向机器人与端侧 AI 场景的全栈的推理优化体系 Mizar-Robo。

RLinf V0.3 首次完整打通了数据采集、数据管理、监督微调(SFT)、强化学习(RL)、模型评测以及真机部署等关键环节,实现从仿真训练到真实机器人在线学习、再到持续迭代优化的统一开发闭环。不仅为具身智能提供开源开放的基础设施,能够高效训练机器人策略,更能够支撑机器人在真实世界中的长期持续进化。

Mizar-Robo 则依托流水线调度、算子内核、量化压缩、计算图四层协同优化,全方位释放端侧硬件潜力,大幅提升具身模型的部署效率,让具身智能即便在低功耗硬件上,也能实现连贯流畅、低延迟、长续航的高精动作交互。

公司表示,这将是“为未来数字与物理世界的所有AI生产力的运行构筑基础设施。”


结语:Token经济的枢纽底座

Token 调用量的高速增长,正在改变AI基础设施的估值标准。卡量和峰值算力决定供给规模,有效Token产出、单位成本和真实利用率,决定这门生意最终能赚多少钱。

无问芯穹的「前店后厂一中心」提供了一个中国样本:以算力集散中心扩充智能资源规模,以系统优化压低Token成本,再通过行业Agent提高算力利用率。这套架构已经完成初步市场验证,估值空间能否继续打开,仍要看两条曲线:Token调用量能否保持增长,单位推理成本能否继续下降并转化为毛利。

当AI基础设施进入规模与效率双重竞争阶段,无问芯穹已经给出了完整业务架构和技术范式,并将在实践中证明其价值。

*以上内容不构成投资建议,不代表刊登平台之观点,市场有风险,投资需谨慎,请独立判断和决策。