直击2026中国算力大会:算力租赁潮之后 上市公司扎堆“建厂”卖Token

直击2026中国算力大会:算力租赁潮之后 上市公司扎堆“建厂”卖Token

  位于北京亦庄的北京壹号词元工厂内 ,一块大屏幕上显示了TTFT(Time to First Token,首Token响应时间)、TPOT(Time Per Output Token,Token输出耗时) 、TPM(Tokens Per Minute ,分钟级Token吞吐量)等关键指标,直观反映这座由软通动力(301236.SZ)投建,今年6月刚刚投产、日产Token1.4万亿的词元工厂的运行状况 。

直击2026中国算力大会:算力租赁潮之后 上市公司扎堆“建厂	”卖Token-第1张图片

  “我们原来做ITO(信息技术外包)业务 ,2024年公司战略转型 ,AI基础设施服务、Token服务是重点的发力方向。我们有9万名程序员,在Coding场景已经形成商业闭环的背景下,先不说对外提供服务 ,我们内部都急需Token,所以我们做Token工厂有必然性,它是一个重要的技术 、资源储备的过程。”软通动力相关负责人告诉财联社记者 。

  而在中国(河北)自由贸易试验区正定片区 ,由常山北明(000158.SZ)投资兴建的常山云数据中心,大模型API(Token)销售服务也在如火如荼地开展。

  “模型能力在快速普及,但是真正用上AI的门槛还没有降下来。常山云词元工厂就是为了降低这个门槛 ,把AI算力做成一种随取随用、费用 透明的公共基础能力 。词元工厂上线十来天已经有100多个客户,个人用户词元调用量77亿 。”常山云数据中心技术总监李强介绍。

  财联社记者获悉,这座冀南地区建设规模最大、等级比较高 的第三方数据中心 ,已完成从传统机柜托管向智能算力服务的战略转型,建成“北明智擎 ”智能算力创新赋能平台,总算力达2248P。

  这是2026中国算力大会前夕 ,财联社记者透过“算力中国行”(京津冀)调研活动观察到的两个上市公司转型案例 。继此前的算力租赁转型潮后 ,今年Token工厂模式集中规模化落地,数十家A股上市公司入局,云厂商一体化玩家 、第三方独立运营商(如硅基流动) 、硬件资源持有方均盯上Token服务市场的“蛋糕”。

  Token作为大模型处理信息的最小标准化单元 ,解决了AI产业长期缺乏统一算力与服务度量标尺的行业难题,已是AI产业的核心生产要素。在2026中国算力大会,Token受到与会者的高度讨论 。

  中国工程院邬贺铨院士在大会主论坛上谈到 ,智能体显著增加了Token调用量,今年3月国内Token的消费已经达到日均140万亿。“Token的消耗并不是以多为荣,而是以效率为荣。 ”邬贺铨院士还明确指出 。

  从“租卡 ”到“买服务” ,Token工厂改变了什么?

  2026中国算力大会期间,中国信通院云大所算力中心与能源部主任王月介绍,智算产业已形成“基础设施交付-集群组织调度-Token能力输出-行业应用落地”四层供给架构。其中 ,Token服务是一种将异构算力封装为标准化推理产能的新型交付业态,通过屏蔽底层多架构硬件差异,将异构智算资源统一封装为以Token为计量单元的标准化推理产能 ,面向各类AI应用提供可调用、可计量、可交易的专业化推理算力供给。

(财联社记者摄)

  “Token工厂本质是把传统的卖GPU算力 ,转为把算力和推理引擎 、模型、负载调度等服务打包,直接对外交付按Token计量的标准化推理服务 。 ”IDC中国研究副总裁周震刚向财联社记者表示,传统算力供给通常按卡、整机或机柜集群租赁算力 ,而Token工厂交付的是可直接调用的Token产出。

  具体到与传统算力租赁的核心差异上,王月从计费单位 、交付标的、用户负担等细分维度将GPU卡时租赁与Token服务进行了对比。前者采用GPU小时计费,交付标的为硬件实例 ,用户需负担的是部署、调优 、运维;后者按Token个数计费,Token消耗量为交付标的,用户负担仅API调用 。

  在周震刚看来 ,Token工厂的意义最主要在于推动推理算力标准化,通过统一计费标准和SLA,帮助加速AI应用层(智能体Agent等)规模化落地 。一方面 ,统一做模型量化、KV Cache及多模型路由,可以提升算力产出效率;另一方面,提供轻量化接入 ,中小企业无需自建私有集群 ,直接采购Token即可快速上线服务,降低AI创新门槛。

  而对于模型厂商和应用开发者而言,也可以把算力调度、推理工程化外包出去。“让模型厂商专注模型迭代 ,让最终用户/ISV专注于Agent开发 。”周震刚表示,这有助于降低相关主体的基建与运维负担,减少资本开支。

  北京壹号词元工厂相关负责人也谈到 ,“Token工厂更贴近应用层,对外面向大模型厂商 、云厂商、C端客户售卖Token。”软通动力已在北京亦庄、广东韶关 、贵州贵阳投建三座词元工厂,三座工厂规划日产能超3万亿 ,未来计划在全国多个算力节点城市完成词元工厂布局 。

  据财联社记者梳理,近来 已有包括润建股份(002929.SZ) 、弘信电子(300657.SZ)、行云科技(300209.SZ)、超讯科技(603322.SH) 、南威软件(603636.SH)、证通电子(002197.SZ)、紫光股份(000938.SZ) 、网宿科技(300017.SZ)、优刻得-W(688158.SH)、青云科技(688316.SH)在内的不少上市公司加快布局Token服务业务。今年5月,中国电信(601728.SH)百亿级Token工厂集采落地 ,更是引发产业高度讨论。

  从需求场景看,北京壹号词元工厂方面介绍,近来 超过50%的业务量集中在Coding场景 ,其次是AI办公等领域 。

  “量爆发 、价上涨 ”格局下 ,成本约束也在变得具体

  “Token的运转其实是三件事:需求、运营和供应。需求决定了消耗的总量,运营决定了成本,供应决定了天花板。”常山云数据中心技术总监李强介绍 。

  向Token化算力服务转型 ,意味着运营方需要承担更多责任。硬件能否稳定运行、模型能否高效部署,以及不同客户的请求如何调度,都会影响最终交付的服务质量和成本。

  费用 方面 ,据邬贺铨院士在大会上介绍,每百万Token费用 在2024年约为8-15元,2025年约为5-10元 ,2026年普惠模型仅0.02元,高端推理模型则达到10-30元 。

(财联社记者摄)

  王月分享的数据显示,日均Token调用量两年增长超千倍 ,供给端高端芯片供给受限,算力卡与存储芯片成本上行推高边际成本,供需缺口推动头部API输出费用 一年余(2025年Q1-2026年Q2)上涨80% ,当前市场呈现“量爆发 、价上涨”格局 。

  “AI已经走过了‘能不能做’的功能验证期 ,现在进入的是‘能不能用好’的落地效率期,包括看落地效率怎么样,成本控制怎么样。 ”清程极智联合创始人师天麾近期接受财联社等媒体采访时表示 ,如今真正的门槛在于在真实的生产环境中,AI能否以可控的成本、稳定的质量、可接受的延迟,持续地输出价值 ,而Token恰恰是把这三个维度串起来的“公分母”。

  师天麾以公司服务的出海客户举例称,该类单一客户 、单一模型的峰值用量可达1-2亿TPM 。面对这种大规模 、高稳定的业务需求,清程极智采用“资源预留+弹性调度”的组合策略:将90%以上的基础负载通过自产的“赤兔 ”专线保障 ,剩余波动部分(如从1.2亿到1.5亿的弹性峰值)则通过智能路由动态调度。

  而对于个人开发者或中小企业,其用量通常远未达到这一量级,“因此主要依靠智能路由技术 ,在保障高性能、低延迟、高成功率的同时,实现更高的资源利用率,从而降低其使用成本。”师天麾补充道 。

  实际上 ,调用量增长的同时 ,成本约束也在变得具体。

  师天麾在采访中提到,一位动漫导演曾向他坦言:AI辅助作画在技术上可以实现,但存在“抽卡”问题 ,质量时好时坏,为了得到一张可用的成片,往往要生成几十上百次 ,Token成本和后期筛选 、修补的人力加起来,反而远超人工。“未来的AI竞赛,不再是模型参数规模的军备竞赛 ,而是单位Token产出价值的效率竞赛 。 ”师天麾说。

  财联社记者同时采访获悉,Agent架构设计是影响Token效率最关键的因素。传统的软件系统没有Token计费的概念,但在AI原生时代 ,缓存命中、上下文复用、问题分流这些机制成为全新的工程实践,这也说明,Token效率优化已经从可选优化项变成了核心架构能力 。

  算力有了 ,为什么高质量Token供给仍不足?

  王月认为 ,当前国内Token服务市场呈现“高度集中与分工细化并存 、需求爆发与供给短板共生 ”的特征,中期演进将围绕技术效率深化、商业模式多元、产业格局集中 、标准体系完善四方向展开。

  不过,异构算力一致性不足 ,费用 竞争激烈、盈利承压,行业标准体系不完善和合规治理要求趋严,仍是行业面临的挑战。王月认为 ,行业核心竞争正从资源占有转向全栈运营能力 。

  值得关注的是,当前行业一方面强调高质量Token供给不足,另一方面仍存在算力利用不充分的情况 。

  据中商产业研究院发布的《2026年中国Token工厂发展白皮书》 ,我国已成长为全球Token生产与消费双中心,大模型Token调用量两年实现千倍级爆发,智能算力供给规模稳居全球第二 ,但行业普遍存在GPU平均利用率不足30%、重建设轻运营的发展短板。

  周震刚认为,原因之一是此前大量算力建设主要面向训练集群为主,按大模型训练需求采购硬件。但近来 的Token主要消耗在推理 。训练集群硬件架构 、组网、调度逻辑并不适配推理的短任务、高并发特征 ,不匹配推理场景 ,硬件规模大但Token产出能力弱。

  “另外,缺少推理调度 、模型适配和运维运营以及国产芯片生态适配问题,都拉低了Token的有效利用率。”周震刚补充道 。

  而具体到企业级服务层面 ,师天麾则认为,当前企业级服务普遍面临高质量Token供给不足的问题——“缺 Token”的本质是“缺卡 ”,供不应求导致费用 上涨。

  不过师天麾也表示 ,费用 上涨也带来了一个积极信号:行业竞争正在从“卷费用 ”转向“卷服务”。“当 API 费用 不再是唯一的竞争维度,客户会更加关注 Token 的质量 、稳定性和性价比 。 ”

  今年7月的WAIC2026期间,燧原科技董事长赵立东也曾表示 ,“Token正成为AI产业的价值载体与计价单位,客户不再单纯为硬件成本付费,而是以Token生成效率与交付质量为核心评判标准。这要求我们必须从系统级、架构级层面优化算力综合成本。”

  在周震刚看来 ,未来竞争会显著加剧 。前段时间大量厂商涌入,费用 战激烈但缺乏推理优化能力,很多仅靠硬件转租的 Token 工厂会被淘汰;未来头部玩家会形成稳定算力资源 + 推理软件到订单的闭环。国产芯片适配和算电协同可能是Token工厂将获得差异化竞争的重点。

(文章来源:财联社)

©版权声明
THE END