两年前,阶跃星辰第一次在基模圈公开亮相时,凭借 Step 1 炸了场,同年接连发布 Step 1V 和万亿参数基座模型 Step 2,彼时行业仍相信,模型越大、能力越强。谁推进 Scaling Law,谁就更接近牌桌中心。但过去一年,它的曝光似乎更多集中在另一端:多模态模型、手机、汽车、端侧模型和 Agent。相比之下,那个需要和 Qwen、Kimi、GLM 正面比较的旗舰基模,似乎并不是讨论中心。在 Artificial Analysis Intelligence Index 上,它拿到 44 分,位列全球开源前二,进入顶尖旗舰模型比较的区间。这个成绩也证明了一个问题:阶跃在押注终端和 Agent 的同时,前沿基座模型的能力上限并没有掉队。但对 Agent 来说,进入榜单只拿到了入场券。真正困难的是,模型离开 Benchmark 以后,能不能在几十甚至上百步操作里,把一件事情从头做到尾。为此,我们上手进行了实测。《超级马里奥》让一代人第一次相信:一套简单规则,也能组成一个完整世界。小时候按下跳跃键时,总会想到同一个问题:如果有一天,我也能做一款属于自己的游戏呢?那时候,这个念头通常止步于门槛,因为游戏不是一张图、几段剧情或一段代码,而是角色、场景、碰撞、交互、资源导出和工程构建共同成立的结果。往往需要一个庞大的团队或者多个跨国公司共同协作才能把一个类似想法推进成可运行的系统。今天,我们在这次测试里,选择把任务放进专业软件链路里:Claude Code CLI 作为 Agent 工作台,Blender 负责 3D 资产和关卡,Three.js/Vite 负责网页游戏呈现。测试题是让 Step 5 Preview 制作一个可运行的 3D 迷你游戏《星跃岛:能量快递》,具体题目如下:代码块
请使用 Claude Code CLI 调用本机 Blender,完成一个可运行的 3D 迷你网页游戏。
- 游戏名称为《星跃岛:能量快递》,主角是原创蘑菇头角色“菇噜”,不得使用马里奥、奇诺比奥、任天堂 Logo、贴图或音效。
- 请在 Blender 中创建角色、6 个浮空平台、5 个能量球和 1 个终点信标,导出 .blend 与 GLB 文件;
- 随后使用 Three.js / Vite 创建网页游戏,加载 GLB 资产,实现 WASD/方向键移动、空格跳跃、坠落重生、收集计数、计时、重开按钮和通关提示。
- 请同时生成测试脚本并运行 npm test、npm run build,将源码、构建产物、日志和验收报告保存到指定工作目录。
这里考的是模型能不能把一个创意变成可检查、可构建、可继续迭代的工程资产。我们没有替模型写代码或操作 Blender,而是把原本的大任务拆成四个阶段:先完成主角“菇噜”,再搭建浮空岛关卡,随后导出 GLB 资产,最后进入网页游戏工程。每个阶段内部的代码编写、Blender 操作、文件生成和调试仍由 Step 5 Preview 完成。完整游戏设计图:6 个浮空平台、游戏角色“菇噜”和终点信标拆分之后,任务开始稳定向前推进。Step 5 Preview 先完成角色与关卡资产,再把 Blender 生成的模型接入 Three.js/Vite 项目,继续处理移动、碰撞、能量球收集和终点判定。中间仍有修改和调试,但最终没有重新推倒工程,而是在已有结果上继续执行,直到项目可以运行。最终,《星跃岛:能量快递》能够正常运行:玩家可以控制“菇噜”在 6 个浮空平台之间移动,收集 5 个能量球并抵达终点信标。角色、场景、碰撞、基础交互和网页工程都已经接通,虽然部分视觉和操作细节仍然粗糙,但它已经不是一组静态资产,而是一个可以实际游玩的完整 Demo。一起来游戏中体验一下这款名为《星跃岛:能量快递》的 3D 网页游戏:执行结果说明:Step 5 Preview 能理解复杂目标,并通过调用 Blender 这类工程化工具把任务推进到最终构建。因此,这轮测试真正考验的不仅仅只是代码生成,而是在跨越 Blender、文件系统和网页工程的长任务里,模型能否保持目标、使用工具、根据中间结果继续执行,并最终完成交付。如果用一句话总结测试结果,那就是:Step 5 Preview 已经具备从自然语言需求到游戏工程构建的完整执行能力,而且面对复杂项目可以以更清晰的阶段拆分来完成任务。根据阶跃官方披露的消息,Step 5 Preview 的 Coding 能力并不局限于传统代码任务。它可以做复杂软件工程(包括长程规划任务)、前端和视觉开发,也能进入可编程硬件场景;当任务持续数小时、需要不断根据结果调整时,模型也能继续推进。在内部和外部专家参与的评测中,约 70% 的评测者认为 Step 5 Preview 可以自主完成中高复杂度的 Coding 任务。同时,Step 5 Preview 还在专业知识工作、金融分析等任务场景中展现出优越表现:在 Agents' Last Exam 的 CLI 子集 ALE-CLI、金融投资研究评测 FrontierFinance,以及跨领域深度研究评测 DRACO 上仅次于 GPT-6 Astra 或 Claude Opus 5,领先其他参评开源模型。Step 5 Preview 在 4 项金融评测的信息检索、真正进入生产级 Agent 阶段以后,竞争已经不只是模型能不能完成某一步,而是它能不能跨文档、跨工具、跨轮次持续执行,同时把错误率、时间和成本控制在可接受的范围里。Step 5 Preview 的 1M 上下文和面向长程任务的设计,为这类工作提供了基础条件;同时它还能在多种真实业务场景中给出稳定的生产能力。02
为什么 Step 5 Preview 值得被讨论?
根据 Artificial Analysis (AA 榜单)模型页截图,Step 5 Preview 的 Artificial Analysis Intelligence Index 为 44,输出速度为 99.8 tokens/s,单个 Intelligence Index task 成本为 0.71 美元;输入价格为 1.00 美元/百万 token,输出价格为 2.70 美元/百万 token,缓存折扣为 95%。页面还显示,Step 5 Preview 支持文本和图像输入、文本输出,上下文窗口为 1M token,参数规模为 600B。这说明阶跃此次带来的 Step 5 Preview 是一套“智能、速度、成本、上下文窗口”的组合。Step 5 Preview 在 AA 榜单上模型页截图从 AA 的 Intelligence Index 看,Step 5 Preview 已经进入前沿模型队列。该指数覆盖知识工作、Agent 工作流、终端使用、编程、长上下文、文档推理等多类任务,对一个面向 Agentic 任务的模型来说,这比单看某个问答榜单更接近真实使用场景。更关键的是任务成本,Agent 不是一次性回答问题,而是反复读上下文、调用工具、生成代码、运行测试、根据报错继续修改。只要任务变长,token 单价和缓存策略就会直接影响用户是否愿意让模型多试几轮。而这也是决定模型能否被开发者和企业用户选择,真正实现规模化商用的关键。从如下截图来看,Step 5 Preview 凭借 0.71 美元的单任务成本在 654 个模型中位于第 4 位(低成本前列),相当于Kimi K3 的35%。同时,这款模型也将模型能力、效率与成本最优平衡的帕累托前沿向外推进。对于长程 Agent 来说,这个位置意味着它不只是在“能力榜”上有竞争力,也在“多轮尝试是否划算”这个问题上给出了更有吸引力的答案。Step 5 Preview 进入 AA 榜单全球前沿梯队是重新衡量阶跃的标志性节点。阶跃正在把前沿基座模型、全模态模型矩阵和终端量产能力拧成一股绳,塑造自己的竞争壁垒。1.Step 5 Preview 让阶跃进入全球前沿模型竞争区间。尤其对 Agent 任务而言,长上下文和较低调用成本意味着模型可以处理更长链路、更大工程和更多文件,不必把复杂任务拆成太多碎片。2.过去一个季度,阶跃先后发布 Step Edge、StepAudio 3 系列,再到 Step 5 Preview,模型矩阵已经覆盖了从云端旗舰、Flash 高效模型、端侧模型,到语音、视觉、生成、GUI 等专项能力的完整全模态矩阵。根据官方信息,StepAudio 3 Realtime 在 Artificial Analysis Conversational Dynamics 榜单中以 98.9% 位列第一,Speech Reasoning 准确率为 99.7%;StepAudio 3 ASR 在非流式语音识别准确性榜单中词错误率为 1.7%,并列第一。听、说、看、生成和操作,不是分散能力,而是在被组织成一套完整模型体系。3.据官方公开数据,阶跃模型已进入手机、汽车等真实设备场景量产落地;截至 2025 年底,其手机侧模型装机量超过 4200 万台,日均服务近 2000 万人次,并覆盖国内超50% 头部手机品牌。和纯 API 模型公司相比,终端入口的价值在于高频、真实、复杂:低延迟、低算力、噪声环境、隐私约束和用户习惯,都会持续反向检验模型。从行业发展来看,基模公司的竞争,已经不再只是单一模型能力比拼,而是全栈技术能力与商业化落地的系统较量。DeepSeek 的优势在全球开发者影响力,阿里千问背靠云和生态,智谱深耕企业交付,Kimi 更有 C 端产品心智。而阶跃的独特位置则是“AI+终端”:前沿模型负责复杂推理,全模态模型负责感知和表达,端侧模型负责低延迟和高频入口。同时,阶跃选的这条路线也并不轻松。终端生态里有手机厂商、车企、操作系统和应用权限;Agent 真正落地,还要解决安全、隐私、跨应用执行和用户信任。通过 Step 5 Preview,说明阶跃已经重新进入第一梯队前沿模型的竞技场,结合已有的全模态模型矩阵和终端量产能力,直接将阶跃送上国产 AI 牌桌的中心。大模型市场的终局仍未确定,头部厂商之间的领先优势不会一成不变,模型能力、成本结构、终端入口和工作台体验都可能重新洗牌。Step 5 Preview 的意义在于让阶跃重新进入这场牌局;接下来真正要看的,是模型能不能在更多真实工作流里,把任务一次次交到终点。 附在线体验链接:https://studio.stepfun.com
雷峰网(公众号:雷峰网)
雷峰网原创文章,未经授权禁止转载。详情见转载须知。