同一个任务,同一个模型,同一套环境,区别只在给不给智能体一份技能文档。NVIDIA 说这样跑下来,正确性提升 41 点,有效性 39 点,效率 35 点。
这里的技能,就是一份 SKILL.md 加几个脚本,把某类任务的做法写清楚让智能体照着干。
更值得看的是那张流程图。先查格式和安全,再用嵌入重合度查重,然后做带与不带技能的沙盒对照。前两层是静态门禁,第三层才回答有没有用,多数团队只做到静态那层。
提醒两点。技能库和评测出自同一家,基线和任务怎么挑要有数,也没说那个点是什么口径。那是三百多个技能的总体结果,不等于你手上这个能涨同样多。
它开源了 SkillEvaluator,自己跑一遍比看这数字实在。
#人工智能就业 #AI新手村 #大模型面试 #AI工具 #英伟达显卡

