阶跃星辰官方开发者交流群直接摊牌了!
群主连发「不装了」「摊牌了」, Step 5 Preview 悄悄上桌了!💥
权威评测机构 Artificial Analysis 榜单刚刚同步更新:
Step 5 Preview 狂揽 44 分,与 Grok 4.6、Kimi K3 并列,一脚踏进国产第一梯队!
看完这份官方实测数据,我只能说:这匹黑马真的不讲武德!👇
🔥 1️⃣ 综合智力:正面硬刚国产与海外当红旗舰
🔹 Step 5 Preview:44 分
🔹 vs GLM-5.3 Max(45):只差 1 分,几乎贴身!
🔹 vs Qwen 3.8 Max(45):同样差 1 分,正式版还没上线就咬住了!
🔹 vs Kimi K3 Max(44):打平,预览版直接对齐!
🔹 vs Gemini 3.8 Flash(41)/ DeepSeek V4.1 Flash(40):直接实现反超!
(行业中位数才 25 分,预览版直接挤进全球第一梯队尾部)
💻 2️⃣ Agent 终端编程:动手能力出奇惊艳!
在评估真实终端与智能体自主行动能力的 Terminal-Bench 4.0 上:
🔹 Step 5 Preview:33%
🔹 DeepSeek V4.1 Flash:27%
🔹 Gemini 3.8 Flash:21%
在多步规划和自主纠错场景下,国产模型不仅更敢动手,成功率也大幅领先!
3️⃣ 成本极具杀伤力,但也有个“小毛病”
定价:输入 $1.00 / 百万 token,输出 $2.70,单任务加权成本约 $0.71(远低于闭源旗舰动辄十美元以上的中位数)。
DeepSeek Flash 确实更便宜(约 $0.27),但在复杂智力和编程上 Step 5 明显高出一档。
代价:回答偏长!单任务约 64k token 输出(含 43k 思维链 Reasoning),属于典型的“极度聪明,但略微话痨”!
总结与看点:
600B 总参、27B 激活、1M 上下文、原生多模态。
光是 Preview 预览版就已经这么能打了,如果正式版能进一步收敛思维冗余、降低 Token 开销,国内大模型格局真要重新洗牌了!
💬 评论区聊聊:
1. 你看好阶跃星辰正式版冲进国产前二吗?
2. 你目前开发或日常主力在用哪款大模型?来聊聊你的真实体验!
#AI反常识howto #howto用好AI #大模型 #AI工具




