体验完 Step 5 Preview,我发现阶跃重新坐上国产大模型主桌

模型入海,阶跃走向人群

#欢迎关注爱范儿官方微信公众号:爱范儿(微信号:ifanr),更多精彩内容第一时间为您奉上。

9 月的大模型战场之激烈,没有谁能稳坐钓鱼台。

除了榜单上的排名厮杀,各家还要比拼的,还有「庖丁解牛」般的实战功夫。

模型能否处理越来越复杂的真实任务,响应能否满足真实场景的即时需求,成本能否支撑大规模调用,以及能力能否真正进入手机、汽车等终端设备,正在成为衡量一家基模公司的行业金线。

今天,旗舰模型又杀出一匹黑马。阶跃星辰发布了新一代开源旗舰基础模型 Step 5 Preview。

在全球权威的 Artificial Analysis Intelligence Index 中,Step 5 Preview 取得 44 分,位居全球开源模型前三,同时进入模型智能水平与单任务成本权衡的「帕累托前沿」,即让模型在能力、效率、成本之间实现最佳平衡。

APPSO 一轮实测下来,发现阶跃悄悄杀回了国产大模型牌桌的头部玩家行列。

实测 Step 5 Preview ,阶跃开始兑现更大的野心

Step 5 Preview 重点面向 AI 编程、软件工程、专业知识工作、金融等场景,擅长处理需要长上下文、多轮工具调用与持续执行的真实工作任务。

Step 5 Preview 模型采用稀疏 MoE 架构,总参数量为 600B,实际激活参数仅 27B,原生支持文本与视觉输入,上下文长度达到 1M。

我们直接通过 WorkBuddy 接入模型,覆盖编程、设计、3D 生成、深度调研和数据分析,看看实际表现如何。

编程测试从简单 Three.js 五子棋测试开始,落子、轮次切换和胜负判定,构成小游戏最基本的功能框架。Step 5 Preview 生成的小游戏甚至还有人机对弈环节。

在威尼斯快艇游戏案例中,Step 5 Preview 不仅完成了主要玩法,还把水面、建筑与镜头运动组织在同一个场景里,最终效果已经接近可以直接体验的网页小游戏。

卡帕多奇亚热气球场景进一步提高了复杂度。

数十个气球需要同时飞行,日照、风向和观察视角均可调整,视觉表现与运行效率也要兼顾。面对多个彼此关联的变量,Step 5 Preview 仍然保持了较完整的场景结构和交互逻辑。

我们还让 Step 5 Preview 以 Three.js 尝试还原尼亚加拉瀑布,面对动态水体、水雾、彩虹、游船、多视角和季节切换等高密度要求,它依然兼顾了视觉效果、交互逻辑与运行效率,整体完成度相当亮眼。

网页操作系统也是一个颇有参考价值的横向样本。

此前,我曾用 DeepSeek V4 Pro 和 DeepSeek V4.1 Flash 测试过相同类型的 Mac 操作系统任务,而 Step 5 Preview 此次交出的页面在界面完整度、功能衔接和细节还原上都更进一步,整体完成度明显更高。

网页设计和 3D 资产测试进一步考察视觉理解与空间表达。

太空行星和夜间跑车两个主题都提供了明确的视觉中心。模型需要将构图、文字可读性与移动端适配落实在同一个页面中,最终结果也能看出 Step 5 Preview 对视觉层级和页面氛围的理解。

3D 资产测试我选择了狮身人面像,Step 5 Preview 也能轻松抓住不同对象的结构特征,并将其转化为空间表达。

面对一张我随手拍摄的照片,它也能在数分钟内还原出具备基本结构和空间细节的模型。

▲ 左为原图,右为成品

相比创作任务,深度调研更考验证据组织、专业知识与判断能力,金融则是检验模型综合能力的典型场景。

阶跃围绕公司研究这一高难度的金融工作流构建了三项内部评测,并引入包含 220 道专家问题、11543 项评估标准的 FrontierFinance。官方结果显示,Step 5 Preview 在四项金融基准中的表现均接近 Claude Opus 5,在信息检索、企业估值和金融研究等任务上具备强大的能力。

回到 APPSO 的实测,小折叠手机立项报告同样要求模型串联用户投诉、外屏生态和售后成本,最终给出有依据的产品建议。任务的难点在于,模型既要查找和整理资料,也要从分散信息中提炼出能够影响产品决策的结论。

广州、佛山七日游同时加入预算、体力和严格素食限制,考察模型能否在完整行程中持续遵守多重条件。此类任务看似生活化,却很容易因为行程变长而遗忘限制,Step 5 Preview 不仅持续遵循约束条件,方案也有更高的可行性。

销售明细表分析进一步贴近企业日常。模型需要先清洗混乱数据,再追踪负利润率订单集中的大区与品类,最后生成月度销售趋势图。处理过程是否清晰、结论能否复核,直接决定交付物能否进入真实工作流。

从网页游戏、3D 资产到金融研究和数据分析,这些案例显示,Step 5 Preview 已经能够理解复杂需求、规划执行步骤、调用工具并持续遵守约束,最终交付可以运行、阅读或继续使用的成果。

Agent 浪潮将至,阶跃手里有什么牌

如果说 Step 5 Preview 验证了阶跃研发前沿旗舰模型的能力,那么全模态基座模型矩阵的布局,则让阶跃的模型具备了从感知、理解、生成到交互的完整能力链路,能够处理真实世界中的多元和复杂信息。

这既为复杂 Agent 提供了更完整的技术底座,也拓宽了阶跃面向不同终端、应用场景和产业需求的发展空间。

过去一个季度,阶跃陆续推出 Step Edge 端侧模型和 StepAudio 3 系列语音模型,而端侧模型 Step Edge,通过文本与视觉基础模型结合语音、GUI 和生成能力,支持简单任务在端侧完成、复杂任务交由云端处理,并在评测汇总中取得 29 项第一。

上周,刚发布的 StepAudio 3 Realtime 在 Aritificial Analysis 对话动态和语音推理测试中分别取得 98.9% 和 99.7%,StepAudio 3 ASR 则以 1.7% 的词错误率并列非流式语音识别全球第一。

目前,阶跃的模型布局已经覆盖云端旗舰、Flash 高效模型、端侧模型,以及语音、视觉、生成、GUI 等多模态专项能力的完整矩阵。既能向上攀登模型上限,也能向下进入真实 Agent 和终端场景。而让阶跃更有辨识度的是 AI+终端的落地场景,在国内同时集齐这三种要素的大模型公司屈指可数。

官方数据显示,其模型手机装机量已超过 4200 万台,日均服务近 2000 万人次,合作覆盖国内超过 50% 的头部手机品牌,应用场景包括识屏问答、智能搜索、内容生成和跨应用任务执行。

汽车方面,阶跃与吉利、千里科技共同研发整车智能体超级 Eva,并由极氪 8X 首发搭载。

超级 Eva 接入了 Step 3.5 Flash 基座模型及阶跃的语音和视觉理解模型,将感知、推理与执行能力整合进同一套车载智能体系统。吉利银河 M9 也通过接入阶跃端到端语音大模型,实现业内首次同类模型的量产上车。

如果只把这些合作理解为装机规模,仍然低估了终端对于一家基础模型公司的价值。

数千万台终端既是一场每天进行的开放世界测试,也让模型能够在口音、噪声、模糊指令和网络波动等真实场景中持续获得高价值反馈,并帮助阶跃积累面向高频终端 Agent 的「智能密度」。

终端同样是验证端云协同与全模态 Agent 的天然场所。Step Edge 与 Step 5 Preview 可以覆盖端侧效率和云端能力,语音、视觉、GUI 操作与任务结果则在真实交互中不断磨合。

相比主要依赖开发者调用和线上评测的纯 API 模型公司,阶跃能够把模型能力送入具体设备,再通过系统适配、产品交付和用户使用,缩短技术能力转化为商业价值的路径。

上述积累之所以重要,还在于 Personal Agent 很可能成为 Coding Agent 之后,全球 AI 产业的下一波浪潮。

Personal Agent 需要理解屏幕、声音、环境和个人偏好,还要跨应用完成真实任务,因此会对长期上下文、全模态感知、GUI 操作和端云协同提出更高要求。而它的核心入口载体,就是 AI 原生硬件。

正如苹果 CEO 特努斯(John Ternus)所描绘的,未来的 iPhone 终端设备将成为「智能个人中枢」。

手机和汽车恰好是距离用户最近的入口,当下的阶跃已经围绕这些入口提前布局。不仅如此,今年 7 月,阶跃推出了大模型原生 AI 终端品牌 STEPX,并即将带来大模型原生智能体手机 STEPX Neo。

这意味着阶跃构建起从模型、系统到终端的『模软硬』三位一体技术闭环,提前拿到 Personal Agent 这场战役的入场券。

至此,前沿基座模型抬高能力上限,全模态矩阵覆盖感知、理解与交互,数千万台设备承接规模化应用。三条能力线相互协同,让阶跃重新跻身基础模型公司第一梯队,也获得了更大的行业话语权。
百川终需东去,江河总要入海,大模型最壮阔的归宿,终究是汇入千千万万人的无边人海。

#欢迎关注爱范儿官方微信公众号:爱范儿(微信号:ifanr),更多精彩内容第一时间为您奉上。

莫崇宇
莫崇宇
文章: 172