云霞资讯网

AI编程的胜负手,正转移到模型之外 过去两年,AI编程从代码补全走到智能体,又进

AI编程的胜负手,正转移到模型之外
过去两年,AI编程从代码补全走到智能体,又进入到了“harness”竞争:谁能把模型、工具、上下文、任务分解和验证流程组织起来,谁才更接近稳定交付。
除了厂商提供的编程工具,开发者沉淀下来的AGENTS.md、Claude.md也是Harness的一部分。
很多开发者会把复杂功能交给更强的模型规划,再把明确任务交给成本更低的模型执行,最后由独立角色审查。
重点在于,模型逐渐可以替换,工程流程开始成为可积累的资产。
单次对话依赖模型临场发挥,长任务会遇到上下文衰减、目标漂移和过早宣布完成。harness把隐性经验写成可读取的规则、计划、进度记录、测试与工具接口,让下一次调用能够接着做,也让失败可以复现和修正。
OpenAI曾经披露,一个由Codex驱动的项目在五个月内形成约100万行代码、合并约1500个PR,早期只有3名工程师推动。关键投入集中在仓库内文档、可执行计划、日志、测试和审查循环。Anthropic的长任务实验同样发现,只给前沿模型一个高层目标,仍然难以稳定完成复杂应用;拆分任务、保留结构化交接和端到端验证后,结果才明显改善。
这不意味着模型能力已经拉平。模糊需求、大型重构和严格审查依然更依赖推理能力上限。过度复杂harness还会带来额外延迟、Token消耗和维护负担,模型升级后,旧规则甚至会变成阻力。
所以,更合理的策略,就是把任务分层:高价值判断交给强模型,重复执行交给便宜模型,验证交给独立流程。
未来真正拉开差距的,将会是一套可迁移、可审计、能持续迭代的工程系统。