彭博:中美AI性能差距缩小至3%,创历史最低

导语

中美AI竞赛的”性能鸿沟”正在以肉眼可见的速度收窄。彭博行业研究(Bloomberg Intelligence)10月5日发布的一份报告指出,在基准测试得分上,中国顶尖AI模型与美国竞争对手的差距已缩小至仅3%——这是有记录以来的最低水平。今年5月这一差距还约为9%,年初更是高达15%。报告认为,这一趋势预示着中国AI实验室将进一步扩大市场份额,同时也让美国AI技术霸权的长期可持续性受到质疑。

事件详情:3%的差距从何而来

这份报告由彭博行业研究高级分析师罗伯特·利(Robert Lea)撰写。报告指出,转折点出现在今年9月——中国AI公司深度求索(DeepSeek)发布了新一代模型V4.1 Flash。此后,中国顶尖模型与美国模型的基准得分差距从年中的高个位数一路收窄至3%。

报告援引的第三方评测平台LiveBench的数据颇具说服力。LiveBench通过推理、解谜和复杂任务完成能力来评估模型,被业内视为衡量模型”智商”的标尺之一。今年9月,DeepSeek V4.1 Flash在该平台拿下81.1分,位列全球第六——这是自2025年DeepSeek凭借推理模型R1一鸣惊人之后,中国模型取得的最高排名。作为对比,排名第一的Anthropic模型得分为83.4。罗伯特·利评价称,DeepSeek的表现已与Anthropic、OpenAI的领先模型”性能相当”(comparable performance)。不过他也指出,在LiveBench排名前15的模型中,目前只有3个来自中国。

利在报告中分析,中国AI竞争力快速提升的原因有两个:一是本土技术积累的持续加深,二是中国研究人员越来越擅长针对国产硬件对模型进行优化。他写道,中国的进步”让美国在AI领域技术霸权的长期可持续性进一步受到质疑”。

背景分析:出口管制的算盘还打得响吗

这份报告最具冲击力的部分,不在于3%这个数字本身,而在于它对美国对华技术出口管制政策的潜在冲击。长期以来,美国通过限制英伟达等公司向中国出口先进AI芯片,试图延缓中国AI发展的步伐。但报告指出,中国实验室正通过算法优化和国产硬件适配,在受限条件下实现性能追赶,这让出口管制的实际效果受到质疑。与此同时,华为等中国企业也在加速推进自研替代方案。

值得注意的是,这并非DeepSeek第一次让华盛顿和华尔街感到紧张。2025年1月,DeepSeek发布推理模型R1后,投资者开始质疑美国科技巨头每年数千亿美元的芯片投入是否必要,英伟达股价在当年1月27日单日暴跌近17%,市值蒸发5890亿美元,创下美股历史上最大单日市值损失纪录。当时有评论认为这只是一次”虚惊”,但一年多过去,差距从15%收窄到3%,”虚惊”看起来更像一种趋势。彭博观点版块同日发表的评论文章进一步指出,DeepSeek和华为如今瞄准的不再是英伟达的股价,而是英伟达在中国的竞争护城河本身。

从商业角度看,差距收窄的时机也耐人寻味。中国的低成本AI模型正在用户规模上快速追赶美国对手:第三方API聚合平台OpenRouter的数据显示,今年9月中旬,中国模型的token市场份额已达57%至67%,而2月份时这一数字仅为6%至13%。与此同时,OpenAI和Anthropic正以”性能领先”为叙事核心,冲击万亿美元级别的IPO估值。如果3%的性能差距被市场接受,”为美国前沿模型支付溢价”的理由将变得越来越难成立。

影响与展望:数字背后仍有争议

当然,3%这个数字并非没有争议。它是基于公开基准测试的统计口径,不同测试方法得出的结论并不一致:有机构用另一套包含9项预设基准的方法测试后,评估中美差距约为8个月;也有业界人士认为核心技术差距约为3个月。围绕”基准通胀”(benchmark inflation)——即公开基准分数可能存在水分——的争论依然存在。

但即便具体数字存在争议,趋势本身已得到多方承认:中美AI差距正在快速收窄。对中文读者而言,这意味着国产大模型在性能上离世界顶尖水平越来越近,而在价格和本土化服务上本就具备优势。接下来值得观察的是:美国是否会进一步收紧技术出口管制?中国厂商能否把纸面差距转化为真实的产品和生态优势?以及当性能不再是护城河,OpenAI、Anthropic们的万亿美元估值故事该怎么讲下去?

这场竞赛的下半场,才刚刚开始。

发表评论