9 月 21 日,阶跃星辰(StepFun)发布新一代旗舰模型 Step 5 Preview,面向智能体(agentic)工作场景。它是一个稀疏混合专家(MoE)模型:总参数 600B、每个 token 激活 27B,支持 1M token 上下文与视觉输入。官方称其在软件工程与职业知识工作上达到前沿水平,并特别强化了金融领域的能力。

阶跃星辰把这次发布放在「帕累托前沿(Pareto Frontier)」的框架下:前沿曲线刻画的是智能与成本之间的最佳权衡,只有当这条边界向外移动时,进步才算真正发生。Step 5 Preview 的论据是——它在 Artificial Analysis 智能指数上取得 44 分;在智能水平相当的情况下,完成任务的开销明显低于同级模型。

一图看关键信息

项目详情
模型Step 5 Preview(稀疏 MoE,新一代旗舰,面向智能体)
规模总参数 600B,每 token 激活 27B
上下文1M token,原生支持视觉输入
智能指数Artificial Analysis Intelligence Index 44 分
可用性即日起通过阶跃产品与 API 提供
开源10 月 15 日发布开放权重

稀疏 MoE:为什么是 600B / 27B

Step 5 Preview 沿用当下主流的高稀疏度 MoE 路线:600B 总参数提供容量,27B 激活参数控制单 token 的计算量。这种「大容量、小激活」的取舍,正是官方强调成本效率的底层原因——模型规模换来知识上限,而每 token 只调用一小部分专家,让推理开销维持在远低于总参数规模的量级。配合 1M token 上下文与视觉输入,它可以在单次会话里同时容纳超长文档、截图与代码仓库等多模态上下文。

编码:广度与深度

阶跃星辰为这套评测专门构建了 StepCodeBench,用「真实软件工程」的形态组织题目:覆盖 553 个独立仓库、9 类任务、20 个应用领域、33 种编程语言。9 类任务包括功能修改、缺陷修复、重构、文档、性能调优、代码生成、CI/CD 操作、代码转换与环境搭建;领域则从 Web 开发、移动应用、云基础设施,一直到编译器、操作系统、游戏开发与嵌入式。

Step 5 Preview 在该基准上取得 avg@4 49.0%,在缺陷修复、功能修改与重构三类任务上表现尤其突出。按语言与难度拆分的分析显示,它在主流语言上表现较为一致,在低、中难度任务上已接近 Claude Opus 5;但在最艰难的长程任务上,与前沿模型仍有明显差距(StepCodeBench 上为 49.0%,Opus 5 为 63.9%)。

官方的内部与外部专家评测中,约 70% 的参与者认为它能够自主完成中等偏上复杂度的编码任务。编码能力也延伸到了纯软件之外:在提供开发文档与用户授权的前提下,Step 5 Preview 可以直接操作可编程硬件,把摄像头、串口、屏幕截图与模拟鼠标输入纳入开发与调试流程。

长程执行:24 小时的内核优化与后训练闭环

长程任务考验模型「记住已有结果、利用执行反馈、决定下一步」的能力。阶跃星辰用两个带可量化反馈的实验来测:

Step 5 Preview 长程任务实测

  • 从零优化 MLA GPU Kernel:给定 24 小时,在单张 NVIDIA H100 上从一个 MLA 内核的初始描述出发,head 维度 512、生产形态为 batch size 1、64 个 head、8,192 token。模型自行实现改动、运行内核、测量吞吐;当某个候选能跑通却让吞吐下降时,它会丢弃该候选并从当前最佳版本继续。每个模型有 4 次独立尝试、可自由决定是否提前停止,取最佳一次——Step 5 Preview 在约 22 小时后达到前向+反向 508 TFLOPS 的峰值,Claude Opus 5 为 493 TFLOPS。
  • 改进后训练数据闭环:同样 24 小时,让模型通过自动化后训练提升 Qwen3-30B-A3B 基座在 AIME24 上的表现。它需要自行决定如何使用一个可访问生产数据的 API 标注器、如何修订后训练数据,并追踪这些选择对下游性能的影响。最终模型在官方 AIME24 测试上达到 60% 准确率(后训练前为 53.3%),与 Claude Opus 5 持平,但消耗的标注 token 更少。

官方还附了一个「彩蛋」——《宝可梦 红》。这个任务与编程无关,却极考验长程执行:需要在数千次交互中维持一个遥远目标、记住早前发现、管理资源并在计划失败后恢复。人类通关主线约需 26 小时。在没有任何《宝可梦》专门优化的情况下,Step 5 Preview 已持续运行 3000 多轮、交互超过 600 万 token;到第 3082 轮时,它解锁了「居合斩」、拿到三枚徽章并击败了马志士,进度约为主线故事的三分之一。

职业知识与金融专精

职业工作往往不止于「找到一个答案」,还要汇集与核对证据、做领域分析,并交付符合任务要求的成品。Step 5 Preview 的产出覆盖技术工程、创意生产、分析报告与公共沟通,并按领域调整内容与呈现。

在大规模研究上,官方给出一个气候研究案例:覆盖 1000 个地点、25 年跨度,Step 5 Preview 在单次智能体动作中协调了 950 次网页抓取,汇总出跨 11 个变量的 30 万条月度记录,并据此分析出太阳能季节性的区域差异——欧洲与大洋洲样本的旺季出现在一年中的相反时段。结构化分析方面,它在一份柴油附加费复核中产出了含 17 个工作表的分析工作簿,涵盖源数据、跨序列对账、区域面板、公式与趋势模型。它还能产出交互式报告,把书面分析、可视化、数据表、方法说明与支撑细节组织在一起,让读者从主要结论一路追溯到证据。

金融是这次投入最多的领域之一。 金融决策依赖对企业、经济环境与未来风险的细致理解,分析过程要在变动甚至相互冲突的信息中,谨慎地套用会计与估值方法。为此阶跃星辰构建了三个内部基准:

  • FinStepBench - LiveSearch:检验模型能否在信息需求变化时,检索并核实及时、可靠的金融信息。
  • FinStepBench - CorporateValuation:检验模型能否把财务数据与站得住脚的假设,转化为内部自洽的预测与可复现的估值。
  • FinStepBench - DeepResearch:评估从汇集、分析证据到产出有充分支撑的完整报告的端到端研究流程。

整套评测围绕准确性、分析严谨性与可审计性展开——来源是否可追溯、假设是否显式、计算是否可复现。同时,官方也在外部基准 FrontierFinance 上做了评测:它通过 220 道专家编写的题目、11,543 条评分标准覆盖六类投资场景。Step 5 Preview 在信息检索、估值与端到端金融研究上都表现强劲。

基准成绩总览

Step 5 Preview 与主流模型的关键基准对比

下表汇总了 Step 5 Preview(High)与主流模型最高档(Max)在推理、编码、智能体、金融与多模态基准上的成绩(单位 %,加粗为该项最佳,下划线为次佳):

基准Step 5 Preview (High)GLM-5.3 (Max)Kimi K3 (Max)GPT-6 Astra (Max)Claude Opus 5 (Max)
推理与知识
GPQA Diamond93.5%91.7%93.5%96.1%93.2%
HLE46.5%42.3%46.9%54.7%54.9%
AA-LCR v1.188.3%79.7%88.7%80.7%79.3%
CritPt20.9%19.1%23.4%31.7%29.1%
编码
DeepSWE v1.167.7%66.9%67.5%74.1%74.0%
Terminal-Bench v2.185.0%83.9%85.0%88.4%89.1%
Terminal-Bench v433.3%41.9%12.6%57.9%52.3%
CyberGym84.7%84.5%80.0%——
SciCode58.9%59.0%59.5%56.5%56.4%
RoadmapBench54.3%54.1%55.4%—68.3%
ProgramBench(Pass Rate)80.5%72.0%77.8%85.4%82.3%
SWE-Marathon v1.1(Partial)72.7%67.4%84.4%77.3%85.6%
MLS-Bench-Lite40.5%37.3%48.3%—49.8%
SWE-Atlas-QnA63.6%59.6%59.5%60.9%66.0%
SWE-Atlas-Test-writing50.8%50.4%50.4%51.1%60.3%
StepCodeBench†49.0%40.2%43.9%61.0%63.9%
StepCode-Bench-Daily†64.9%69.1%57.7%—77.6%
StepCode-Bench-General†65.0%62.0%65.2%64.3%68.3%
通用智能体
GDPval-AA v2.115661645152415421708
τ³-Banking42.5%50.3%46.0%41.4%42.1%
AutomationBench-AA51.0%62.2%58.3%68.5%56.6%
AA-Briefcase v1.114331526151115691673
Toolathlon-Verified74.1%73.0%76.5%—80.6%
MCP-Atlas85.6%86.8%85.3%—87.0%
PresentBench76.8%74.5%75.6%—77.3%
OfficeQA Pro60.3%59.1%62.6%67.7%64.7%
SpeadSheet v229.4%30.5%31.9%31.4%32.8%
JobBench59.0%61.4%54.3%—65.7%
Apex-Agents37.8%38.1%41.0%—41.8%
Draco83.3%82.3%78.5%76.8%87.6%
BrowseComp88.7%—91.2%91.5%90.2%
HLE w/ tools‡59.4%62.5%56.0%57.2%63.6%
FinStepBench-LiveSearch†74.5%73.3%70.9%74.5%76.2%
FinStepBench-CorporateValuation†60.6%56.1%60.6%77.3%69.7%
FinStepBench-FinanceDR†55.8%53.3%48.9%45.0%59.1%
FrontierFinance66.4%64.1%62.6%55.0%69.7%
计算机操作
Agents’ Last Exam (ALE-CLI)29.5%28.6%27.6%33.3%28.6%
多模态与文档
MMMU-Pro76.0%—(纯文本)81.0%87.0%85.0%
GDP.pdf14.8%11.2%22.0%31.0%21.6%

标注说明:标记 † 的基准为阶跃星辰内部构建;GDPval-AA v2.1 分数取自 Artificial Analysis 截至 2026 年 9 月 20 日的最新结果;DeepSWE v1.1 评测使用 SWE-agent harness,temperature=1.0、top_p=0.95;标记 ‡ 的 HLE w/ tools,Step 5 Preview(High)与 GLM-5.3(Max)在纯文本子集上评测,其余模型在全量数据集上评测,两者结果不直接可比。

从数据看,Step 5 Preview 的位置很清楚:在财务金融与多项编码/智能体基准上,它稳定压过 GLM-5.3 与 Kimi K3,逼近 Claude Opus 5;FrontierFinance 66.4% 甚至反超了 GPT-6 Astra 的 55.0%。但在最难的编程长程任务(Terminal-Bench v4 33.3%、SWE-Marathon v1.1 72.7%)和部分通用智能体、多模态基准上,与 Claude Opus 5、GPT-6 Astra 仍存在差距。

上线与开源

Step 5 Preview 即日起通过阶跃星辰的自有产品与 API 开放使用,开发者可查阅官方文档接入。开放权重将于 10 月 15 日发布。

核心总结

  • 规格:稀疏 MoE 架构,总参数 600B、每 token 激活 27B,支持 1M token 上下文与视觉输入
  • 定位:面向智能体的新一代旗舰,Artificial Analysis 智能指数 44 分,同级智能下成本更低
  • 编码:自建 StepCodeBench(553 仓库 / 9 类任务 / 20 领域 / 33 语言)得 49.0%,缺陷修复、功能修改与重构突出;低中难度接近 Opus 5,长程难任务仍有差距
  • 长程执行:24 小时内自主优化 MLA GPU Kernel 达 508 TFLOPS(Opus 5 为 493),并把 Qwen3-30B-A3B 的 AIME24 从 53.3% 提升到 60%
  • 金融:三项内部 FinStepBench(LiveSearch / CorporateValuation / DeepResearch)与外部 FrontierFinance(220 题 / 11,543 条评分标准)表现强劲,FrontierFinance 66.4% 反超 GPT-6 Astra
  • 可用性:即日起通过产品与 API 提供,开放权重 10 月 15 日发布

原文:Step 5 Preview: Advancing the Pareto Frontier(阶跃星辰 StepFun,2026-09-21)

模型体验与接入:官方页面 · 开发者文档