9 月 21 日,阶跃星辰(StepFun)发布新一代旗舰模型 Step 5 Preview,面向智能体(agentic)工作场景。它是一个稀疏混合专家(MoE)模型:总参数 600B、每个 token 激活 27B,支持 1M token 上下文与视觉输入。官方称其在软件工程与职业知识工作上达到前沿水平,并特别强化了金融领域的能力。
阶跃星辰把这次发布放在「帕累托前沿(Pareto Frontier)」的框架下:前沿曲线刻画的是智能与成本之间的最佳权衡,只有当这条边界向外移动时,进步才算真正发生。Step 5 Preview 的论据是——它在 Artificial Analysis 智能指数上取得 44 分;在智能水平相当的情况下,完成任务的开销明显低于同级模型。
一图看关键信息
| 项目 | 详情 |
|---|---|
| 模型 | Step 5 Preview(稀疏 MoE,新一代旗舰,面向智能体) |
| 规模 | 总参数 600B,每 token 激活 27B |
| 上下文 | 1M token,原生支持视觉输入 |
| 智能指数 | Artificial Analysis Intelligence Index 44 分 |
| 可用性 | 即日起通过阶跃产品与 API 提供 |
| 开源 | 10 月 15 日发布开放权重 |
稀疏 MoE:为什么是 600B / 27B
Step 5 Preview 沿用当下主流的高稀疏度 MoE 路线:600B 总参数提供容量,27B 激活参数控制单 token 的计算量。这种「大容量、小激活」的取舍,正是官方强调成本效率的底层原因——模型规模换来知识上限,而每 token 只调用一小部分专家,让推理开销维持在远低于总参数规模的量级。配合 1M token 上下文与视觉输入,它可以在单次会话里同时容纳超长文档、截图与代码仓库等多模态上下文。
编码:广度与深度
阶跃星辰为这套评测专门构建了 StepCodeBench,用「真实软件工程」的形态组织题目:覆盖 553 个独立仓库、9 类任务、20 个应用领域、33 种编程语言。9 类任务包括功能修改、缺陷修复、重构、文档、性能调优、代码生成、CI/CD 操作、代码转换与环境搭建;领域则从 Web 开发、移动应用、云基础设施,一直到编译器、操作系统、游戏开发与嵌入式。
Step 5 Preview 在该基准上取得 avg@4 49.0%,在缺陷修复、功能修改与重构三类任务上表现尤其突出。按语言与难度拆分的分析显示,它在主流语言上表现较为一致,在低、中难度任务上已接近 Claude Opus 5;但在最艰难的长程任务上,与前沿模型仍有明显差距(StepCodeBench 上为 49.0%,Opus 5 为 63.9%)。
官方的内部与外部专家评测中,约 70% 的参与者认为它能够自主完成中等偏上复杂度的编码任务。编码能力也延伸到了纯软件之外:在提供开发文档与用户授权的前提下,Step 5 Preview 可以直接操作可编程硬件,把摄像头、串口、屏幕截图与模拟鼠标输入纳入开发与调试流程。
长程执行:24 小时的内核优化与后训练闭环
长程任务考验模型「记住已有结果、利用执行反馈、决定下一步」的能力。阶跃星辰用两个带可量化反馈的实验来测:
- 从零优化 MLA GPU Kernel:给定 24 小时,在单张 NVIDIA H100 上从一个 MLA 内核的初始描述出发,head 维度 512、生产形态为 batch size 1、64 个 head、8,192 token。模型自行实现改动、运行内核、测量吞吐;当某个候选能跑通却让吞吐下降时,它会丢弃该候选并从当前最佳版本继续。每个模型有 4 次独立尝试、可自由决定是否提前停止,取最佳一次——Step 5 Preview 在约 22 小时后达到前向+反向 508 TFLOPS 的峰值,Claude Opus 5 为 493 TFLOPS。
- 改进后训练数据闭环:同样 24 小时,让模型通过自动化后训练提升 Qwen3-30B-A3B 基座在 AIME24 上的表现。它需要自行决定如何使用一个可访问生产数据的 API 标注器、如何修订后训练数据,并追踪这些选择对下游性能的影响。最终模型在官方 AIME24 测试上达到 60% 准确率(后训练前为 53.3%),与 Claude Opus 5 持平,但消耗的标注 token 更少。
官方还附了一个「彩蛋」——《宝可梦 红》。这个任务与编程无关,却极考验长程执行:需要在数千次交互中维持一个遥远目标、记住早前发现、管理资源并在计划失败后恢复。人类通关主线约需 26 小时。在没有任何《宝可梦》专门优化的情况下,Step 5 Preview 已持续运行 3000 多轮、交互超过 600 万 token;到第 3082 轮时,它解锁了「居合斩」、拿到三枚徽章并击败了马志士,进度约为主线故事的三分之一。
职业知识与金融专精
职业工作往往不止于「找到一个答案」,还要汇集与核对证据、做领域分析,并交付符合任务要求的成品。Step 5 Preview 的产出覆盖技术工程、创意生产、分析报告与公共沟通,并按领域调整内容与呈现。
在大规模研究上,官方给出一个气候研究案例:覆盖 1000 个地点、25 年跨度,Step 5 Preview 在单次智能体动作中协调了 950 次网页抓取,汇总出跨 11 个变量的 30 万条月度记录,并据此分析出太阳能季节性的区域差异——欧洲与大洋洲样本的旺季出现在一年中的相反时段。结构化分析方面,它在一份柴油附加费复核中产出了含 17 个工作表的分析工作簿,涵盖源数据、跨序列对账、区域面板、公式与趋势模型。它还能产出交互式报告,把书面分析、可视化、数据表、方法说明与支撑细节组织在一起,让读者从主要结论一路追溯到证据。
金融是这次投入最多的领域之一。 金融决策依赖对企业、经济环境与未来风险的细致理解,分析过程要在变动甚至相互冲突的信息中,谨慎地套用会计与估值方法。为此阶跃星辰构建了三个内部基准:
- FinStepBench - LiveSearch:检验模型能否在信息需求变化时,检索并核实及时、可靠的金融信息。
- FinStepBench - CorporateValuation:检验模型能否把财务数据与站得住脚的假设,转化为内部自洽的预测与可复现的估值。
- FinStepBench - DeepResearch:评估从汇集、分析证据到产出有充分支撑的完整报告的端到端研究流程。
整套评测围绕准确性、分析严谨性与可审计性展开——来源是否可追溯、假设是否显式、计算是否可复现。同时,官方也在外部基准 FrontierFinance 上做了评测:它通过 220 道专家编写的题目、11,543 条评分标准覆盖六类投资场景。Step 5 Preview 在信息检索、估值与端到端金融研究上都表现强劲。
基准成绩总览
下表汇总了 Step 5 Preview(High)与主流模型最高档(Max)在推理、编码、智能体、金融与多模态基准上的成绩(单位 %,加粗为该项最佳,下划线为次佳):
| 基准 | Step 5 Preview (High) | GLM-5.3 (Max) | Kimi K3 (Max) | GPT-6 Astra (Max) | Claude Opus 5 (Max) |
|---|---|---|---|---|---|
| 推理与知识 | |||||
| GPQA Diamond | 93.5% | 91.7% | 93.5% | 96.1% | 93.2% |
| HLE | 46.5% | 42.3% | 46.9% | 54.7% | 54.9% |
| AA-LCR v1.1 | 88.3% | 79.7% | 88.7% | 80.7% | 79.3% |
| CritPt | 20.9% | 19.1% | 23.4% | 31.7% | 29.1% |
| 编码 | |||||
| DeepSWE v1.1 | 67.7% | 66.9% | 67.5% | 74.1% | 74.0% |
| Terminal-Bench v2.1 | 85.0% | 83.9% | 85.0% | 88.4% | 89.1% |
| Terminal-Bench v4 | 33.3% | 41.9% | 12.6% | 57.9% | 52.3% |
| CyberGym | 84.7% | 84.5% | 80.0% | — | — |
| SciCode | 58.9% | 59.0% | 59.5% | 56.5% | 56.4% |
| RoadmapBench | 54.3% | 54.1% | 55.4% | — | 68.3% |
| ProgramBench(Pass Rate) | 80.5% | 72.0% | 77.8% | 85.4% | 82.3% |
| SWE-Marathon v1.1(Partial) | 72.7% | 67.4% | 84.4% | 77.3% | 85.6% |
| MLS-Bench-Lite | 40.5% | 37.3% | 48.3% | — | 49.8% |
| SWE-Atlas-QnA | 63.6% | 59.6% | 59.5% | 60.9% | 66.0% |
| SWE-Atlas-Test-writing | 50.8% | 50.4% | 50.4% | 51.1% | 60.3% |
| StepCodeBench† | 49.0% | 40.2% | 43.9% | 61.0% | 63.9% |
| StepCode-Bench-Daily† | 64.9% | 69.1% | 57.7% | — | 77.6% |
| StepCode-Bench-General† | 65.0% | 62.0% | 65.2% | 64.3% | 68.3% |
| 通用智能体 | |||||
| GDPval-AA v2.1 | 1566 | 1645 | 1524 | 1542 | 1708 |
| τ³-Banking | 42.5% | 50.3% | 46.0% | 41.4% | 42.1% |
| AutomationBench-AA | 51.0% | 62.2% | 58.3% | 68.5% | 56.6% |
| AA-Briefcase v1.1 | 1433 | 1526 | 1511 | 1569 | 1673 |
| Toolathlon-Verified | 74.1% | 73.0% | 76.5% | — | 80.6% |
| MCP-Atlas | 85.6% | 86.8% | 85.3% | — | 87.0% |
| PresentBench | 76.8% | 74.5% | 75.6% | — | 77.3% |
| OfficeQA Pro | 60.3% | 59.1% | 62.6% | 67.7% | 64.7% |
| SpeadSheet v2 | 29.4% | 30.5% | 31.9% | 31.4% | 32.8% |
| JobBench | 59.0% | 61.4% | 54.3% | — | 65.7% |
| Apex-Agents | 37.8% | 38.1% | 41.0% | — | 41.8% |
| Draco | 83.3% | 82.3% | 78.5% | 76.8% | 87.6% |
| BrowseComp | 88.7% | — | 91.2% | 91.5% | 90.2% |
| HLE w/ tools‡ | 59.4% | 62.5% | 56.0% | 57.2% | 63.6% |
| FinStepBench-LiveSearch† | 74.5% | 73.3% | 70.9% | 74.5% | 76.2% |
| FinStepBench-CorporateValuation† | 60.6% | 56.1% | 60.6% | 77.3% | 69.7% |
| FinStepBench-FinanceDR† | 55.8% | 53.3% | 48.9% | 45.0% | 59.1% |
| FrontierFinance | 66.4% | 64.1% | 62.6% | 55.0% | 69.7% |
| 计算机操作 | |||||
| Agents’ Last Exam (ALE-CLI) | 29.5% | 28.6% | 27.6% | 33.3% | 28.6% |
| 多模态与文档 | |||||
| MMMU-Pro | 76.0% | —(纯文本) | 81.0% | 87.0% | 85.0% |
| GDP.pdf | 14.8% | 11.2% | 22.0% | 31.0% | 21.6% |
标注说明:标记 † 的基准为阶跃星辰内部构建;GDPval-AA v2.1 分数取自 Artificial Analysis 截至 2026 年 9 月 20 日的最新结果;DeepSWE v1.1 评测使用 SWE-agent harness,temperature=1.0、top_p=0.95;标记 ‡ 的 HLE w/ tools,Step 5 Preview(High)与 GLM-5.3(Max)在纯文本子集上评测,其余模型在全量数据集上评测,两者结果不直接可比。
从数据看,Step 5 Preview 的位置很清楚:在财务金融与多项编码/智能体基准上,它稳定压过 GLM-5.3 与 Kimi K3,逼近 Claude Opus 5;FrontierFinance 66.4% 甚至反超了 GPT-6 Astra 的 55.0%。但在最难的编程长程任务(Terminal-Bench v4 33.3%、SWE-Marathon v1.1 72.7%)和部分通用智能体、多模态基准上,与 Claude Opus 5、GPT-6 Astra 仍存在差距。
上线与开源
Step 5 Preview 即日起通过阶跃星辰的自有产品与 API 开放使用,开发者可查阅官方文档接入。开放权重将于 10 月 15 日发布。
核心总结
- 规格:稀疏 MoE 架构,总参数 600B、每 token 激活 27B,支持 1M token 上下文与视觉输入
- 定位:面向智能体的新一代旗舰,Artificial Analysis 智能指数 44 分,同级智能下成本更低
- 编码:自建 StepCodeBench(553 仓库 / 9 类任务 / 20 领域 / 33 语言)得 49.0%,缺陷修复、功能修改与重构突出;低中难度接近 Opus 5,长程难任务仍有差距
- 长程执行:24 小时内自主优化 MLA GPU Kernel 达 508 TFLOPS(Opus 5 为 493),并把 Qwen3-30B-A3B 的 AIME24 从 53.3% 提升到 60%
- 金融:三项内部 FinStepBench(LiveSearch / CorporateValuation / DeepResearch)与外部 FrontierFinance(220 题 / 11,543 条评分标准)表现强劲,FrontierFinance 66.4% 反超 GPT-6 Astra
- 可用性:即日起通过产品与 API 提供,开放权重 10 月 15 日发布
原文:Step 5 Preview: Advancing the Pareto Frontier(阶跃星辰 StepFun,2026-09-21)



