全球「AI学术顶会」精华汇聚地
您正在使用IE低版浏览器,为了您的雷峰网账号安全和更好的产品体验,强烈建议使用更快更安全的浏览器
此为临时链接,仅用于文章预览,将在时失效
业界 正文
发私信给二维马晓宁
发送

0

PPIO姚欣:Agent时代的Token工厂,不是规划出来的,是长出来的

本文作者: 二维马晓宁   2026-07-29 09:19
导语:云的第一客户,从人变成了 Agent。

姚欣身上有一种经历过周期的人才有的松弛感。

2026 年 7 月的 WAIC 现场,人潮比上海七月的气温还燥热。各路厂商的展台一个比一个声势浩大,大模型、机器人、AI 手机轮番登场。而在 PPIO 的媒体沟通会现场,姚欣穿着一件深色 POLO 衫坐定,开口第一句话不是谈技术多么颠覆,而是掏出手机亮了亮:"我最近刚换了个 1TB 的,以后硬盘越来越贵,趁早升级。"

这是个只有在行业里摸爬滚打过的人才会开的玩笑。二十年前,他是华中科技大学的计算机系学生,用分布式技术解决了万人同时在线看球赛卡顿的问题,做出了 PPTV;2018 年二次创业做 PPIO,并从2023年起 ALL IN AI,成为中国最早一批"Token 工厂"。

现在,PPIO 日均 Token 调用量 1.2 万亿,较去年同期增长 8 倍。按灼识咨询的统计,它已是国内 Token 消耗量最大的独立 AI 云厂商。这个数字放在任何一家 AI 公司的发布会上都会被反复提及,但姚欣只是把它当作背景板。他在意的不是规模本身,而是规模背后正在发生的结构性位移。

"云的第一客户,从人变成了 Agent。"他在采访中说这句话时语速不快,像在陈述一个早已发生、只是最近才被行业普遍承认的事实。

这句话的意思是,过去十几年云计算服务的对象是人,人打开软件、人点击按钮、人发起请求;而接下来,主要的消耗者将变成自主运行的智能体。这不是一个遥远的预测,而是 PPIO 后台数据正在显示的趋势:尝鲜用户退潮后,企业付费的 Token 消耗依然每月 10%–20% 稳健增长,其中 Agent 的占比越来越高。

姚欣给这个时代列了一个公式:Agent 生产力 = Token 智能密度 × Agent Loop 时长。前者决定每一步决策的质量上限,后者决定 Agent 能持续运行多久。PPIO 在 WAIC 2026 发布的 Agentic Cloud,就是围绕这个公式构建的两层产品体系:智能模型网关推高密度,Agent Harness 层拉长时长。

但这场采访值得记录的,不只是产品本身,AI 行业的供需反转、成本曲线、竞争格局,都将会一一呈现。

以下是AI科技评论与姚欣的对话精简版本:

一、核心判断:Agent 才是第一客户

AI科技评论:怎么看现在这波 AI 需求的热度?是真实的吗?

姚欣:是真实的,而且变了。今年 2、3 月增长曲线非常陡,那是对龙虾类产品大量尝鲜式应用,大家试一试;这一波用户尝鲜一两个月就退了。现在我们进入稳健增长阶段,每个月大约 10%–20% 的持续增长,全年算下来大概三到四倍增幅,已经进了正循环,变成真正生产力的工具。

我们的 Token 曲线和大家看到的不一样。PPIO 是 ToB 公司,平台上所有 Token 都是付费的,不是 C 端免费尝鲜的曲线,是企业付费的真实曲线。经过一波尝鲜降温,增速没那么陡了,但进了稳健的持续增长。

AI科技评论:企业主要拿这些 Token 干什么?

姚欣:我观察,企业内部大量重复性劳动正在被 AI 改造。我们公司里用 OpenClaw 最积极的不是技术岗,是财务、人事、行政、市场这些非技术岗位,我自己也高频用。研发去年底就在用 Claude Code、Codex 这类编程智能体,门槛高,要命令行、懂技术逻辑;OpenClaw 这类优势是使用门槛极低,有飞书或微信就能用,所以大量办公白领都在高频用。

另外我观察到很多 OPC,这说明创业范式变了。以前创业先融一轮资再启动,现在是先买一个 Token 包做出 Demo,跑通了再去融天使轮。这也是张江模力社区楼下 OPC 社区越来越红火的原因。

AI科技评论:所以你对Agent时代的核心判断是什么?

姚欣:Agent 时代最重要的变化,是云的第一客户从人变成了 Agent。过去云计算是为人使用软件设计的,Agentic Cloud 是为 Agent 自主运行而生的。

我给 Agent 时代列了个公式:Agent 生产力 = Token 智能密度 × Agent Loop 时长。

Token 智能密度决定 Agent 每一步决策的质量上限,Agent Loop 时长决定它能持续运行多久、完成多复杂的任务。PPIO 这次发布 Agentic Cloud,就是分两层去推高这两个变量:智能模型网关推高密度,Agent Harness 层拉长 Loop 时长。

二、智能模型网关:混合模型与调度是两回事

AI科技评论:你在前面不断提到智能模型网关,智能模型网关到底解决什么问题?

姚欣:开发者有个真实痛点,太依赖一个"全能型"大模型,但单模型可能推理不深、记忆不足、文采平平。网关要做的是,给 Agent 的每一步动态匹配最合适的"专家模型",同时把成本按住。

它有两个功能,差别很关键:

第一个是混合模型(MoM,Mixture of Models)。在高价值、高风险、结果不确定的关键步骤(比如法律合同审查、医疗初诊),把问题同时分发给多个专家模型,交叉验证、打碎再融合生成最终答案,大幅提升任务成功率。

第二个是模型调度(Router)。也就是简单问答用轻量模型,复杂推理用强模型,压缩冗余上下文、复用计算、设预算护栏和失败回退。

混合模型是 Mix,把多个模型结果打碎再混合出新结果,调度是 Router,也就是原样转发下去,这两个不是一回事。

AI科技评论:效果有量化吗?

姚欣:在 DRACO 深度研究基准上,我们融合 Mimo-V2.5-Pro、Kimi-K2.7 和 GLM-5.2 做混合推理,性能可接近 Claude Fable5 的水平,成本却大幅下降;综合测算,智能水平提升约 20%,成本下降 50%–60%。

AI科技评论:混合模型的工程壁垒在哪?是那个调度模型本身吗?

姚欣:调度和混合是两个业务,都在网关里。调度侧有一个识别任务复杂度、做自动挡决策的路由模型;但更底层是"什么模型适合什么任务"。这不是看各家发的 Benchmark(开卷考试,先拿到答案),而是靠生产环境里每天 1.2 万亿次真实调用喂出来的数据。三个模型开会,和一个模型自己想,质量不一样,道理就跟开会一样。

混合模型这边,第一步基础还是 Benchmark,到底哪些模型擅长什么,要依赖大量经验数据;第二步是多模型思考编排,三个模型怎么用不同提示词驾驭、答案怎么装配,装配形式不同命中率就不同;再上线压缩,最后主模型把三个参考案统一回来。

三、Agent Harness:让 Agent 不只"想",还能"做"

AI科技评论:Agentic Cloud 和 Agent Infra 是什么关系?

姚欣:是升级。去年我们推 Sandbox 时,主题是推出 Agent Infra,给一个沙箱;今天给你的不只是一个沙箱加一个模型 API,还要做一整套 Harness 工程,甚至给一个现成可用的智能体服务,这一层有点像 SaaS。从 Infra 到 Cloud,是从单点变一整套,融合了运行环境和应用服务。

AI科技评论:为什么有时候叫 Agent,有时候叫 Agentic?

姚欣:说实话我英文也不够好(笑)。Agentic 更像形容词,更敏捷一点的感觉;学术文献里一般用 Agent,是名词。我们最后定名 Agentic Cloud,但服务的是 for Agent 的应用。这块真需要各位文字工作者帮我们发明更准确的中文译名,每次都痛苦。

AI科技评论:普通开发者用 的Harness,你们具体解决什么?

姚欣:分两类。去年推的沙箱面向开发者,比如某款知名通用Agent产品底层调我们的基础设施来跑。今年 OpenClaw 这类开源智能体火了,很多非技术背景的普通人也能用,但还有安全、效率问题,所以我们上线了 PPClaw,可以把所有底层环境配好,像 SaaS 一样开箱即用,一键生成、一键启动。沙箱调用被内化进去,普通用户根本不用知道沙箱是什么,只知道自己的数字员工有记忆、执行强。

我们官网三条产品线,第一是 GPU 云服务,现在占比已经很小,第二是模型服务,包括大语言 + 多模态,第三是 Agent 云服务,这方面是去年给开发者的沙箱,加上今年给普通人的托管。托管相当于一个具备通用工作能力的"大学毕业生",你给它灌进企业知识库,它就能在公司干活,调多少 Token、调哪些服务全由我们托管。

四、算力涨价反转与全栈式方案

AI科技评论:今年 WAIC 和去年比,Infra 这块最大变化是什么?

姚欣:最大不同是算力涨价。一年前我们愁卖不掉,桌上摆着一堆 H20 的卡跑 DeepSeek,愁怎么推到企业侧,央国企当时还在买一体机、做验证。今天倒过来了:算力不够、太贵、涨价。

这是供需反转,有背后两件事,一是 AI 真能解决大量生产效率(编程、办公、AI 短剧),二是 Agent 消耗是数量级的。反转后我们也很痛苦,上游算力太贵,我现在买不起硬盘,最近劝大家赶快升级手机,我刚换了个 1TB 的。

AI科技评论:Token 成本往后三年怎么走?

姚欣:过去三年怎么降的?一是 GPU 换代,A100 到 H100 到 B100,每代性能提升 5–10 倍;二是推理加速等软件技术。但硬件侧变化在放缓。今年参加英伟达会议,GPU 已到 3 纳米物理极限,1 纳米基本不可能,2 纳米顶到天,最多提升 1.5 倍,没有再提升 10 倍的能力。现在靠超节点、靠横向扩张补。

但软件提升还在快速走。过去半年最大变化不在 GPU,在内存和硬盘,智能体追求记忆,上下文从几 K 走到 100 万,先放显存、显存不够放内存、再不够放硬盘,把 SSD 炒上天。系统架构变迁能实现指数级飞跃。我坚持判断:每年智能使用成本还会接近 10 倍下降,因为软件空间还极大,没走到头。

五、AI Coding、OPC 与"更新速度"

AI科技评论:今年 AI Coding 特别火,对 PPIO 有什么影响?

姚欣:两端都受影响。收入端:Token 消耗上 Agent 占比高,但收入上 AI Coding 是主力,今年 3、4 月起企业客户因 AI Coding 大量消耗 Token,是收入核心来源。研发端:我们一年上线 100 多款模型,发布节奏比移动互联网时代快 10 倍以上,核心原因是内部实现了"AI for AI"——模型上线、运维、自动化大量由 AI 编程完成,每 3 天就有一次版本发布。

我们"吃自己的狗粮",自己产 Token 自己先消耗,全员用 AI 工具,效率才这么快。

AI科技评论:一季度 AI Coding 爆发后,4、5、6 月体感热度下滑,你有同感吗?

姚欣:变化有,但要区分:AI Coding 是给人用的,模型偏贵;OpenClaw 这类 Agent 用 Agent 模型,相对便宜。今年春节后 Token 消耗突然起来,我们以为是 AI Coding 自然增长;到 3 月增速比 2 月翻了 3 倍,我们才确认是 Agent 爆发。

之后几个月增速放缓,因为尝鲜热度下去了。4 月左右 C 端尝鲜基本退去,OpenClaw 调用下降,5 月 Hermes 调用量超过了 OpenClaw。但企业需求稳步提升,AI Coding 和 Agent 两条曲线都在稳步走。

我估计下半年 Agent 还会冲一波:随着 Harness 工程和 Loop Engineering 成熟,一个任务完成要消耗的 Token 会提升 10–100 倍,即使人数不涨,单任务用量也涨 10 倍以上。

AI科技评论:你提到的 OPC,大量用 Token 是不是也属尝鲜?

姚欣:不是。To B 最多一两周、一两个月尝鲜,之后要付这么多钱,大家都是算过账的。很多 OPC 小公司一个月 Token 使用量能到 100 亿,这在以前以为只有大型企业才到。这类公司我定义为 Agent Native 企业(智能体原生企业),人智比普遍 1:10、1:20(我们公司还是 1:3)。它们更新速度太快,如果二线厂商不转型,很可能被这些异军突起的创业公司替代。

AI科技评论:这波靠 Agent 疯狂更新的公司,也会像当年 PPTV 一样,活下来的根本不是技术吗?

姚欣:对,有的行业老登还是能活下来,已经不是靠技术。PPTV 后来我卖掉,也是因为不是靠技术领先,主要靠版权。今天 AI 行业最领先的企业,大家关心的不是你今天多快多好,而是内部更新速度能不能更快。OpenAI 紧盯 DeepSeek,关注的不是模型,是 DeepSeek 的内部更新速度比它还快。Claude Code 官方 3 月一个月发 17 个版本,两天一版。PPTV 放在这个时代,我大概率活不下来。

 #雷峰网(公众号:雷峰网)

 

雷峰网原创文章,未经授权禁止转载。详情见转载须知

分享:
相关文章
最新文章
请填写申请人资料
姓名
电话
邮箱
微信号
作品链接
个人简介
为了您的账户安全,请验证邮箱
您的邮箱还未验证,完成可获20积分哟!
请验证您的邮箱
立即验证
完善账号信息
您的账号已经绑定,现在您可以设置密码以方便用邮箱登录
立即设置 以后再说