模型概述
智能方面,排名 25 / 200,得分 44,人工分析智能指数的智能维度得 4 分(满分 4 分);速度上,排名 41 / 200,每秒输出令牌数 99.8,速度维度得 3 分(满分 4 分);成本维度,排名 27 / 200,输入成本每 100 万个令牌 1.00 美元,输出成本每 100 万个令牌 2.70 美元,缓存折扣 95%,每个智能指数任务成本 0.71 美元,得 2 分(满分 4 分);详细程度维度,排名 65 / 200,智能指数输出令牌数 1.6 亿,得 4 分(满分 4 分)。
比较总结
Step 5 预览版在智能方面领先,价格合理,速度高于平均水平,输出内容详细。它支持文本和图像输入,输出文本,上下文窗口为 100 万个令牌。在人工分析智能指数上得 44 分,远高于同类可比模型平均水平(中位数 25 分)。评估时生成 1.6 亿个令牌,比中位数 9000 万个多,输出详细。定价上,每 100 万个输入令牌 1.00 美元(中位数 1.88 美元),每 100 万个输出令牌 2.70 美元(中位数 10.00 美元),评估共花费 918.34 美元。每秒输出 100 个令牌,高于平均水平(中位数 65)。
技术规格
推理版本为是,可能存在非推理版本;输入模态支持文本和图像;输出模态支持文本;上下文窗口 100 万个令牌,约相当于 1500 页 12 号 Arial 字体的 A4 纸内容。
同类 200 个模型对比
各项指标对比规则:非推理模型仅与其他非推理模型对比;推理模型与推理和非推理模型一起对比;开放权重模型按规模类别对比,微型(参数 ≤40 亿)、小型(参数 40 亿 - 400 亿)、中型(参数 400 亿 - 1500 亿)、大型(参数 >1500 亿);专有模型与相同价格区间的专有和开放权重模型对比,采用 3:1 的输入/输出价格混合比例,分每 100 万个令牌 <0.15 美元、每 100 万个令牌 0.15 - 1 美元、每 100 万个令牌 >1 美元三个区间。
智能(更新)
人工分析智能指数 v4.3 包含 AA - Briefcase、GDPval - AA v2 等 10 项评估。在 653 个模型中排名第 27。从特定提供商可添加模型。
能力指数
衡量模型在金融与会计、战略与运营等方面表现。人工分析金融与会计指数包含 7 项评估,在 161 个模型中排名第 26。
基准测试
智能评估有编码代理、工具使用等 26 项评估中的 18 项,在 653 个模型中排名第 27。还介绍了各项具体评估及相关指数,如 AA - Briefcase Elo 综合指标,在 170 个模型中排名第 27;AA - Omniscience 指数衡量知识可靠性和幻觉情况,在 528 个模型中排名第 27 等。
智能指数对比
涉及智能指数与每个任务成本、时间、输出速度、端到端响应时间等对比。在各项对比的 653 个模型中排名第 27。
令牌使用
每个智能指数任务的输出令牌数在 653 个模型中排名第 27。
成本
每个智能指数任务成本按令牌类型细分,数值越低越好,在 653 个模型中排名第 27。运行人工分析智能指数的成本在 653 个模型中排名第 27。定价方面,缓存命中、输入和输出价格在 653 个模型中排名第 27。
上下文窗口
上下文窗口令牌限制数值越高越好,在 653 个模型中排名第 27。
速度
通过输出速度(每秒令牌数)衡量,在 653 个模型中排名第 27。每个智能指数任务的时间在 653 个模型中排名第 27。
延迟
通过首次令牌时间(秒)衡量,首次答案令牌时间在 653 个模型中排名第 27。
端到端响应时间
输出 500 个令牌所需秒数,数值越低越好,在 653 个模型中排名第 27。
常见问题解答
Step 5 预览版 2026 年 9 月 18 日发布,由 StepFun 创建。智能方面,在人工分析智能指数得 44 分,高于平均水平;速度每秒生成 99.8 个输出令牌,高于平均水平;延迟首次令牌时间 2.96 秒,优于平均水平;成本每 100 万个输入令牌 1.00 美元,每 100 万个输出令牌 2.70 美元,有竞争力;API 定价每 100 万个输入令牌 1.00 美元,每 100 万个输出令牌 2.70 美元,混合费率每 100 万个令牌 0.51 美元;输出详细程度生成 1.6 亿个输出令牌,处于较高水平;是推理模型,支持文本和图像输入、文本输出,能处理图像,是多模态模型;上下文窗口 100 万个令牌;是专有模型,有 6000 亿个参数;在基准测试人工分析智能指数得 44 分;可通过 1 个提供商的 API 使用。