一家你可能没听过的英国小公司 Flower Labs,今天甩出一个前沿大模型 Endeavor 1.0,几项硬核跑分直接贴着 GPT-5.6 和 Claude 打。
它不是又一个套壳聊天机器人。Flower Labs 说 Endeavor 是 frontier-class 通用模型,主打长周期 agent 任务。官方晒的分数:GPQA 92.0、HumanEval 98.2、AIME 2026 直接 99.9、IFEval 94.1,其中 HumanEval 比 GPT-5.6 Sol 还高 3 分,跟 Kimi K3、Nemotron 3 Ultra 比更是全面压过。
更关键的是部署方式。你可以让它跑在自家服务器里,不绑架在某一家的 API 上。说白了,别人租模型,它卖的是"能自己盖地基"的能力:agent、评测、数据管线、改进循环都长在你自己的基础设施上,不用永久拴死在单个闭源接口。
我个人挺吃"可自部署"这口的。现在大模型越强越像租房,换一家就得推倒重来,真到敏感场景谁都不放心。Flower 这套思路至少把"能不能自己掌控"这事摆到了台面。当然它刚开预览、还没全面放开,实际好不好用,得等早期用户跑出真实反馈再说。
你觉得"能自己部署的前沿模型"是刚需,还是又一轮营销话术?评论区聊聊。