OpenAI 本周发布了面向 Agent 编程场景的新一代模型,主打长任务自主编码能力。官方数据显示,模型可以在无人干预的情况下连续工作数小时,完成从需求拆解、代码编写到测试修复的完整闭环。
关键信息
- SWE-bench Verified 成绩再次刷新纪录,长任务成功率是上一代的近两倍
- 配套开放了新的 Agent API,支持工具调用过程中的中途人工介入
- ChatGPT 订阅用户可在 Codex 中直接使用,API 按用量计费
B哥点评
编程是过去一年大模型落地最快的场景,没有之一。这一代模型的关键词是”长任务”——谁能稳定地把一个需求从下午做到晚上,谁就能真正进入开发者的工作流。对普通用户的启示是:学编程的门槛在消失,但描述需求的能力变得更值钱了。
本文基于公开报道整理,观点仅供参考。