刚刚,阶跃杀回大模型第一梯队!追平Kimi K3,价格只要1/5

作者:拓荒牛 分类:默认分类 时间:2026-09-27 19:34
中关村国际人才会客厅 - 运营部
作者 | 王馨   编辑 | 汤安迪

9 月 20 日,阶跃星辰发布了新一代旗舰模型 Step 5 Preview,直接进入全球开源模型前三!

上一代 Step 3.7 还是 5 月底发布的,这次名字直接跳过了 Step 4,一步迈到 Step 5。真的是“阶跃”了。

就像一个很久没在群里说话的人,忽然从牌桌底下甩出一张王炸。

配置上,600B 总参数、27B 激活参数、100 万 Token 上下文,原生支持文本和视觉输入,重点面向 AI 编程、软件工程、专业研究和金融等 Agent 任务。

阶跃这次直接把“帕累托前沿”当广告词。“帕累托前沿”简单说就是模型通常越强越贵、越快越难兼顾,而 Step 5 想做的,是在不大幅增加成本的前提下,把能力再往前推一点。

过去一段时间,阶跃忙着造手机、做操作系统和智能体终端,在模型上的确有点“默默无闻”,搞得很多人都以为它要下桌了。

但阶跃显然没退群。年初它刚拿下超 50 亿元 B+ 轮,刷新中国大模型单笔融资纪录;模型底座这边也没闲着,Step 系列已经铺进国内 60% 头部手机品牌,装机量超 4200 万台。所以它是“模型 + 终端”两手都在抓,只是一只手更出风头。

模型今天起开放 API 和 Studio 体验,完整权重将在 10 月 15 日发布。

追平 Kimi K3,输出价不到 1/5

Step 5 Preview 采用稀疏 MoE 架构,总参数达到 600B,但每次推理只激活约 27B。

100 万 Token 的上下文也够狠,理论上能把一部《三体》整个塞进去,配合多轮工具调用,正好对上“长任务 Agent”的定位。

跑分更扎眼。在 Artificial Analysis 的 Intelligence Index 中,Step 5 Preview 得分为 44,和 Kimi K3(Max)打平,进入全球开源模型前三。

但是 Kimi K3 可是 2.8 万亿参数的大模型啊,Step 5 只有 6000 亿:参数不到对方的四分之一,分数却打平了。

几个细分成绩单也亮眼:在考验终端操作和编程 Agent 的 Terminal-Bench 4.0 上,Step 5 拿到约 33%,Kimi K3(max)约为 13%,直接拉开两个身位。

到了更偏纯代码推理的 SciCode,两者又以 59% 打平。

而在 ALE-CLI、金融研究评测 FrontierFinance 和深度研究评测 DRACO 上,官方称其仅次于 GPT-6 Astra 或 Claude Opus 5,领先其他参评开源模型。

价格让这张成绩单更有冲击力。阶跃这次是把“帕累托前沿”当广告词的:

  • 每百万输入 Token 1 美元、输出 2.7 美元;
  • 对比 Kimi K3 的 3 美元 / 15 美元,输出价不到 K3 的五分之一;
  • 单任务成本约 0.71 美元,是 Claude Opus 5 的约八分之一;
  • 输出速度约 100 Token/s(AA 实测 99.8 t/s)。

6000 亿参数、追平 2.8 万亿的跑分、输出价只要人家五分之一、跑得还快。 这就是帕累托前沿被往外推的具体形状。

配套还有个 Token Plan 套餐,49 元起,包含约 400 元额度,官方还特意强调“无 5 小时限额”。显然是冲着长程 Agent 的痛点来的。

实际体验上,有网友在早期实测中让 Step 5 Preview 生成一个“鹈鹕骑自行车”的 H5 SVG 动画,认为“目前的简单体验对不起 Artificial Analysis 的 44 分”。

不过评论区也有人说 Kimi K3 做同一道“鹈鹕题”也没有多好,或许这类模型的强项本来就不在前端动画。

不只会写代码,

也能玩Blender

前阵子 GPT-6 Astra 发布时,3D 建模软件 Blender 一度被网友玩疯了。

Step 5 也来交卷了。它也能调用 Blender 建模、反复修改资产,再把成品接进 Three.js 网页。

官方展示的 Room Planner,只要一张卧室照片,就能还原出可编辑的 3D 房间:家具可以挪,人也可以走进去逛。它还把 1922 年的《广九铁路旅行指南》做成了交互产品,能查路线、算票价,看小火车沿百年前的线路重新开一遍。

不过,真正的软件工程不能只看“成片”。阶跃为此做了 StepCodeBench,把模型扔进 553 个真实代码仓库,覆盖 33 种语言,以及修 Bug、加功能、重构、配环境等 9 类任务。Step 5 最突出的不是某一道题特别高,而是在不同语言和任务里都能把活接住。

最有现场感的案例,是它折腾一块 ESP32-S3 开发板:自己翻文档、写代码、连串口、看摄像头和设备截图,再追着真实报错一路改。连续干了 3 个多小时后,开发板变成了一把支持蓝牙按键和语音输入的 Vibe Coding 键盘。

24 小时长程工作,

还能自己造轮子

Agent 最难的并不是启动任务,而是干到第 20 个小时,还记得第 2 个小时踩过什么坑。

在官方案例里,阶跃给 Step 5 一张 NVIDIA H100 和 24 小时,让它从零优化 MLA GPU 内核。它自己改代码、跑测试、测吞吐;新方案变慢,就退回最佳版本继续试。约 22 小时后,性能被推到 508 TFLOPS,超过官方对比中 Claude Opus 5 的 493 TFLOPS。

阶跃还让它给别的模型做后训练。Step 5 Preview 通过自动化后训练,把一个 Qwen3-30B-A3B 基础模型在 AIME24 上的表现提上去。模型可以自己调用接入生产数据的 API annotator,自己决定该试什么。

结果,AIME24 从 53.3% 拉到 60%,追平 Claude Opus 5,而且标注 token 用得更少。

工程师下班后,Step 5 转头去打道馆了。在没有专门训练的情况下,它玩了 3,082 个回合的《宝可梦红》,累计交互接近 600 万 Token,学会“居合斩”,打败枯叶道馆馆主马志士,拿到第三枚徽章,走完大约三分之一的剧情。

接手专业工作,聚焦金融场景

Step 5 官方展示的交付物跨度很大:双通道急停控制电路、机器人 CNC 工作站布局、热防护筛选报告、舞台 Plot、30 秒审片视频……重点不是“什么都会一点”,而是能把资料、分析和行业格式一起装进最终成品里。

其中一项研究横跨 1000 个地点和 25 年数据。Step 5 在一次任务中发起 950 次网页抓取,整理出包含 11 个变量、30 万条月度记录的数据集,再分析不同地区的太阳辐射季节性,发现欧洲和大洋洲的峰值月份刚好相反。

另一个柴油附加费项目,则交付了 17 个 Sheet、11,057 行数据的工作簿,里面有公式、图表和区域面板。关键不在表有多大,而在每个结论都能顺着计算链一路查回原始数据。它交出的不再是一段“听起来很专业”的回答,而是一份同事可以接着用、主管可以往下查的工作成果。

另外,官方还把金融单拎出来当重点验证场景,考察三件事:有没有扎实的金融专业知识、能不能建立跨行业的因果联系、能不能在信息不完整、数据口径不一致时借工具完成严谨建模。

围绕“公司研究”这条高难度工作流,阶跃自建了三项 FinStepBench:LiveSearch 负责找资料、验来源,CorporateValuation 负责预测和估值,DeepResearch 再把证据、计算和结论装进完整报告。说白了,就是找得对、算得清、查得回。

外部评测 FrontierFinance 则是一张投研“地狱卷”:220 道专家题,拆成 11,543 个评分点,覆盖六类投资场景。Step 5 得到 66.4 分,仅次于 Claude Opus 5 的 69.7 分,高于同场的 GLM-5.3、Kimi K3 和 GPT-6 Astra。

结语

当然,跑分和官方 Demo 只是入场券。Step 5 能不能真成日常主力,还要等权重开放后,看开发者把它扔进真实代码库、真实设备和真实业务里,能不能稳定把活干完。

不过把 Step 5 放回阶跃的整体布局里看,已经能看到一条清晰的路线:

过去一段时间,阶跃陆续推出 Step Edge 端侧模型和 StepAudio 3 系列语音模型;7 月又发布 AI 终端品牌 STEPX,并预告智能体手机 STEPX Neo,汽车端还有与吉利、千里科技打造的超级 Eva。现在,Step 5 Preview 又补上了云端旗舰这一块。

从端侧、语音到手机、汽车,再到云端大模型,阶跃正在同时铺开模型能力和终端入口。

所以 Step 5 不是一次孤立的刷榜,而是这套组合开始发力的信号。

当前用户暂时关闭评论 或尚未登录,请先 登录 或 注册
暂无留言
版权所有:拓荒族 晋ICP备17002471号-6