Anthropic发布Claude Opus 4.6: coding能力大幅跃升

导语:2026年2月5日,Anthropic发布Claude Opus 4.6,这是其2026年的首次重大模型更新。新模型在agentic coding、computer use、tool use等多项基准测试中取得领先,并首次在Opus系列中引入100万token上下文窗口(测试版),将竞争焦点从单纯的对话能力转向了专业工作场景。

事件详情

Opus 4.6的核心升级集中在三个方向:更强的编码能力、更严谨的任务规划能力,以及更持久的长程agentic任务执行能力。在编程方面,新模型在代码规划、长时间持续执行复杂任务、处理大型代码库、代码审查与调试上都有明显提升,能够更有效地识别和纠正自身错误。

基准测试成绩相当亮眼:在agentic coding评估Terminal-Bench 2.0中取得最高分;在复杂多学科推理测试Humanity’s Last Exam中领先其他前沿模型;在经济知识工作任务评估GDPval-AA中,比OpenAI的GPT-5.2高出约144个Elo点,比前代Claude Opus 4.5高出190点;在信息检索评估BrowseComp中同样表现优异。

尤为引人注目的是其金融分析能力。Opus 4.6尤其擅长金融研究,能快速审查公司数据、监管文件和市场信息,并生成详尽的金融分析——这些工作传统上需要耗时数天。它在评估AI代理金融分析能力的Finance Agent基准测试中位列第一。

随模型一同发布的还有一系列新功能:在Claude Code中,用户可以组建Agent团队协同工作;API新增了上下文压缩功能,让模型在不超出限制的情况下执行更长时间的任务;新增自适应思考能力与Effort参数,开发者可以控制模型的智能程度、速度和成本。此外,Claude in Excel迎来大幅升级,Claude in PowerPoint发布研究预览版,“办公生产力”正式纳入旗舰模型的能力边界。

定价保持不变,仍为每百万token输入5美元、输出25美元。新模型已在Claude官网、API及所有主要云平台上线。

背景分析

Opus 4.6发布当天,市场给出了最直接的反应:FactSet股价一度下跌10%,S&P Global、穆迪、纳斯达克等金融服务与数据公司的股价也普遍下跌。市场普遍担忧,AI技术的快速发展将对包括金融服务在内的传统行业造成冲击,并可能取代现有软件和人工服务。

这种“发布即砸盘”的现象,恰恰说明了Opus 4.6的定位变化:Anthropic不再满足于做一个更好的聊天机器人,而是要把模型变成能够交付专业工作成果的“数字员工”——制作电子表格、演示文稿、软件开发、金融研究,这些传统上由专业人士完成的工作,正在被纳入旗舰模型的能力范围。

值得注意的是,Opus 4.6与OpenAI的GPT-5.3 Codex在同一天发布,两大AI实验室正面交锋,拉开了2月“模型雪崩”的序幕。数周之内,Gemini 3.1 Pro、GLM-5、Qwen3.5、Kimi K2.5等模型密集登场,2026年开年的模型竞赛烈度空前。

影响展望

从技术趋势看,Opus 4.6代表了旗舰模型演进的新方向:更长的上下文(100万token意味着可以一次性装下整个代码库或法律文件库)、更强的长程任务执行能力、更深入的垂直场景(金融、办公)。Anthropic的策略已从通用能力的单点提升,转向以企业真实工作流稳定交付为核心。

对行业而言,金融数据服务商股价的集体下跌只是一个开始。当AI能够以远低于人工的成本完成金融分析、法律审查、软件开发等知识工作时,传统软件与专业服务的商业模式都将面临重构。正如Anthropic所展示的,AI正在从“工具”变成“执行者”——而这场转变,才刚刚开始。

发表评论