导语:2026年2月5日,OpenAI发布GPT-5.3 Codex,与Anthropic的Claude Opus 4.6在同一天登场,正式拉开2月“模型雪崩”的序幕。新模型将GPT-5.2-Codex的前沿编码能力与GPT-5.2的推理、专业知识和长程执行能力合二为一,定位为以Agent为中心的自主工程模型。OpenAI称,这是第一个在其自身构建过程中扮演了“关键角色”的模型。
事件详情
GPT-5.3 Codex的核心定位不是“会写更多代码”,而是成为一个能够独立承担软件工程任务的Agent。它可以在研究需求、理解代码仓库、使用工具、修改文件、执行测试、处理网页开发和持续迭代之间保持工作状态——真正的输出不仅包括最终代码,还包括计划、工具调用、补丁、测试结果和失败后的恢复过程。
基准测试成绩印证了这一定位:在模拟人类使用电脑的OSWorld-Verified测试中,得分从38.2%飙升至64.7%,非常接近人类平均水平的72%;在针对命令行操作的Terminal-Bench 2.0测试中获得77.3%的成绩,远超前代;在采用真实世界工程问题的SWE-Bench Pro测试中取得了最先进的结果,同时消耗的计算资源更少。核心推理速度据报道比前身快约25%。
OpenAI还用实际演示展示了其端到端能力:让模型在几天内独立构建了一款多赛道竞速游戏和一款深海潜水游戏。更具象征意义的是,OpenAI指出GPT-5.3 Codex在其自身的建立过程中扮演了关键角色,管理了部分训练和部署工作——这被视为AI递归改进AI的重要一步。
2月12日,OpenAI又推出了GPT-5.3-Codex-Spark(研究预览版),主攻实时编码方向。这是一个更小、低延迟的版本,深度绑定Cerebras的超低延迟硬件,公开宣称可超过每秒1000 token,目标是让编码互动接近即时,开发者可以随时打断、纠偏、续行。
背景分析
GPT-5.3 Codex与Claude Opus 4.6的同日发布,在科技社群内点燃了激烈辩论。AI创业者Matt Shumer的一篇病毒式博客文章获得数千万次浏览:他描述了自己的工作流程——用自然语言描述一个软件应用,离开几个小时后回来,就能看到一个完全构建好、自我测试完成的产品。他认为AI已经跨越了关键门槛,从工具变成了自主的“执行者”,广泛的专业自动化可能在一到五年内实现。
支持这一论述的有量化数据:METR的追踪显示,AI模型能在真实世界任务上自主工作的时间,一年内从约10分钟增长到近5小时,约每七个月翻倍一次。
但质疑声同样响亮。批评者指出,软件开发具有独特的自动化适配性:编码有明确的成功指标(能编译吗?通过单元测试吗?),并允许在安全的虚拟化环境中测试;相比之下,评估法律、医学或策略的质量则高度主观。著名AI怀疑论者Gary Marcus批评Shumer忽视了幻觉和推理错误等持续性问题。
影响展望
无论辩论结果如何,GPT-5.3 Codex都标志着一个关键转变:AI正在从“回答问题”转向“完成工作”。对软件行业而言,这意味着开发流程的重构——人类工程师的角色将更多转向需求定义、架构设计和结果验收,而实现细节越来越多地交给Agent。
从竞争格局看,2月的“模型雪崩”仍在继续:Claude Opus 4.6、GPT-5.3 Codex之后,Gemini 3.1 Pro、GLM-5、Qwen3.5、Kimi K2.5等在数周内密集发布。模型的迭代速度本身,正在成为这场竞赛中最令人目眩的变量。
对普通人而言,最值得关注的或许不是某一次基准测试的胜负,而是OpenAI那句意味深长的话:AI已经开始参与构建更强大的AI。当改进的循环开始自我加速,留给人类适应的时间窗口,正在变得越来越窄。