Token经济的蓬勃发展预示着AI产业正经历一场从训练到推理的重心转移。国家数据局公布的数据显示,截至2026年3月,中国日均Token调用量已飙升至140万亿,较2024年初的1000亿增长了超过1000倍,两年内实现了数量级的飞跃。Token已不再是晦涩的技术术语,而是AI时代最基本的交易媒介,其增长速度远超历史上任何基础资源。
市场研究机构IDC预测,全球年度Token消耗量将从2025年的0.0005 Peta Token激增至2030年的15万Peta Token,年复合增长率高达3418%。到2031年,全球活跃智能体数量预计将达到3.5亿。
AI领域的结构性变革是推动这一增长的关键。在2026年之前,AI产业的重点在于训练,即堆叠GPU、优化参数和追求榜单排名。然而,2026年之后,推理正成为算力消耗的主要驱动力。IDC估计,2026年中国AI服务器市场规模将达到3500亿元,其需求结构已从“训练驱动”转变为“训练与推理双轮驱动”,推理服务器的出货量已接近训练机型。
除了不断增长的推理需求,智能体应用的兴起和推理成本的急剧下降也在助推行业爆发。AI正从“回答问题”向“执行任务”转变,智能体在自主规划、工具调用和多步骤执行过程中的每一次操作,都在指数级地消耗Token。
这一转变对算力基础设施带来了颠覆性挑战。PPIO联合创始人兼CEO姚欣指出,传统云计算主要服务于人类用户,虚拟机的使用周期通常以天或月计,而Agent的任务调用则呈现碎片化、高频化的特点。PPIO平台上的Sandbox最小结算单位已达秒级。人类用户使用云服务存在波峰波谷,但Agent的使用则是全天候的。在延迟方面,人类可容忍秒级延迟,但Agent完成复杂任务需要数次甚至上百次调用,每次几百毫秒的延迟累积起来将严重影响任务执行效率。这些差异表明,为人类设计的云计算架构难以直接满足Agent的需求。
在此背景下,Token工厂已成为调节算力运力的关键环节,并获得了市场的广泛关注。根据灼识咨询的数据,按2025年和2026年第一季度的平均日均Token消耗量计算,PPIO在中国独立AI云计算服务提供商中位居首位。2026年4月,平台日均Token消耗量达到1.03万亿次,到6月更是突破1.2万亿次,同比2025年增长超过8倍。此外,PPIO的AI云计算收入从2024年的1038.7万元增长至2025年的1.192亿元,增幅超过10倍。平台全球注册开发者数量也从2024年末的12.5万人增至2026年6月的超过66.6万人。
随着推理成本的逐年下降,单纯提供算力资源的商业模式正迅速失去价格优势。真正有价值的是能够以更高效率、更低成本、更优体验交付Token的服务。PPIO提出的“智能Token工厂”旨在构建一个围绕Token全生命周期进行优化的规模化生产与交付体系。
姚欣表示,尽管Token工厂的概念在2026年3月的GTC大会上才引起广泛关注,但PPIO自2023年起便已涉足推理服务,并在2024年推出了MaaS平台,在该领域积累了超过三年的经验。他认为,当前Token工厂的普遍存在并不稀奇,关键在于如何不断提升其智能化水平。简单地堆砌算力并部署模型,虽然能产生Token,但核心问题在于如何高质量、高效率地生产出更智能的Token。
为此,姚欣提出了Agent时代的核心公式:Agent生产力 = Token智能密度 × Agent Loop时长。其中,Token智能密度决定了Agent每一步决策的质量上限,而Agent Loop时长则决定了Agent能够持续运行多久以及完成任务的复杂程度。
围绕这一公式,PPIO智能Token工厂率先在国内推出了智能模型网关,作为AI Agent的智能调度中心。该网关通过混合模型来把控关键决策,提升质量;将简单任务自动分流至轻量模型,确保Agent以最低的Token成本和最高的智能性能完成任务,从而持续推高Token智能密度。
姚欣透露,PPIO正在测试将两到三款不同模型组合使用,让它们进行相互比对和协作。在内部测试中,这种混合模型模式在某些任务执行上已经超越了GPT-5.6。他指出,虽然单一模型的性能可能仍有微小差距,但通过增加一定的算力和Token消耗,可以获得更强的最终任务执行能力。这表明模型的智能上限不仅限于模型参数本身,还可以通过工程化手段从外部突破。智能模型网关正是通过提供混合推理系统,将每一次模型调用都转化为一场“专家会诊”。
PPIO通过自底向上构建了从GPU集群、推理服务优化到应用场景深度理解的全栈式AI云能力,体现了其极致的效率优势。姚欣以人的对话交流、智能体调用和AI编程为例,说明了不同场景对性能参数的需求差异:人类追求秒级响应,智能体要求毫秒级,而AI编程则对精度要求最高,以减少错误。PPIO基于不同场景进行定制化优化,是其区别于其他平台公司的关键所在。
在具体产品能力方面,PPIO的差异化路线还体现在以下几个方面:
值得注意的是,行业内GPU的平均利用率通常在40%至50%之间,而PPIO的GPU利用率长期维持在75%以上。姚欣解释说,公司利用分布式算力调度能力,整合了全球六大洲超过5000个算力节点,并通过利用东西半球的时区错峰调度,将不同时间、空间和请求频率的负载高效融合,最终在后台呈现出一条接近线性的利用率曲线。在算力成本不断上涨的当下,最大化利用现有算力直接关系到企业的盈利能力,而PPIO在该指标上的表现构成了其重要的竞争壁垒。
“智能Token工厂”解决了“今天如何高效生产Token”的问题,而“Agentic Cloud”则着眼于“明天Token将由谁、以何种方式消耗”这一更宏大的命题。2026年,全球云巨头纷纷发布了Agentic Cloud战略,包括谷歌的Agent Engine与Agentic Data Cloud,阿里云的全栈智能体化升级,亚马逊的AgentCore,以及微软Foundry Agent Service的商用,目标都是让Agent成为云的核心用户。
在WAIC 2026上,PPIO正式发布了“Agentic Cloud”的全新定位。姚欣认为,该战略的核心逻辑在于:云的第一用户正在从人类转向AI Agent。
行业趋势也印证了这一转变。AI智能体的自主推理、工具调用和多步骤工作流具有持续、高频、密集的Token消耗特性,对云基础设施提出了新的要求。姚欣分享的数据显示,在全球80亿人口中,约20%的人使用了AI,付费用户仅占约5%,这表明人类使用AI仍有巨大增长空间。与此同时,智能体的调用正呈指数级增长。以PPIO为例,公司300多名员工,后台已部署近千个Agent,开发、运维、客服等工作均在Agent化。一个人可以拥有10个、100个Agent,每个Agent都在7x24小时消耗Token。
基于这种多元化的需求,PPIO将Agentic Cloud的产品架构划分为三个层级:基础设施层、模型服务层和Agent Harness平台层。其中,Harness作为专门用于约束、指导、验证和纠错Agent执行的工程框架,涵盖了除大模型本身之外的所有环节,包括上下文构建、工具编排、验证循环、成本控制和可观测性。
沙箱是Harness的核心组件之一。去年,PPIO推出了国内首款兼容E2B接口的Agent沙箱,为Agent Harness提供安全隔离的运行环境。姚欣提到,去年发布沙箱时,行业对智能体的理解仍停留在“模型调用的手和脑”层面。到今年年初,随着OpenClaw等开源智能体的普及,大家才意识到长程任务和复杂任务的持续执行才是真正的痛点。
据PPIO官方透露,其Agent沙箱冷启动时延低于200毫秒,采用系统级安全隔离,确保每个Agent任务运行在独立的虚拟机环境中。沙箱支持同时创建上万个实例,并且在任务空闲时可自动暂停计费,综合使用成本较同类产品降低90%以上。PPIO Agent沙箱上线一年,业务规模已增长超过120倍。
目前,Token的定价排序已显示出规律:编程最贵,其次是智能体,而为人类提供对话服务最便宜。这一排序预示了未来Token消耗的方向。姚欣认为,“我们服务的对象正从人转向Agent,甚至未来的机器人。”
这一转变正在重塑云计算的商业模式。过去,云计算比拼的是功能数量和生态封闭程度。而在Agent时代,比拼的是谁能让硅基生命运行得更快、更便宜、更稳定。PPIO的选择是:不构建封闭花园,拥抱开源;不做全栈替代,而是成为AI时代的互补者。
Token经济正在重新定义算力的价值衡量标准,在这场重构中,效率最高者将最终胜出。
| 主队 | 比分 | 客队 | 联赛 | 时间(北京) |
|---|---|---|---|---|
| 近期暂无比赛,请稍后再来查看。 | ||||