Reflection发布开源模型Beam:501B参数叫板DeepSeek

2026年10月5日(美国东部时间周一),成立仅两年的美国AI初创公司Reflection AI通过官方博客正式发布首款旗舰级开放权重模型Beam:总参数5010亿、每次推理仅激活230亿的稀疏MoE(混合专家)架构,预训练23.8万亿token,上下文窗口达100万token。公司宣称,Beam在代码与智能体任务上对标智谱的GLM-5.2、逼近千问Qwen3.8-Max,而推理算力仅为前者的三分之一到四分之一。这是硅谷针对中国开源模型主导格局发起的最直接挑战之一——不过需要提醒的是,模型权重尚未真正开放,跑分也全部来自官方自报。

事件详情:501B总参数,只激活23B

Reflection AI在官方博客《Introducing Beam: Reflection’s 501B open-weight model》与X账号@reflection_ai同步宣布了这一消息,TechCrunch与路透社同日跟进报道。此前一个周末,Axios已提前爆料发布在即。公司将Beam定位为“工作马模型”,面向企业、公共部门和开发者,主攻推理、代码与Agent任务。

架构上,Beam走的是典型的“大胃口、细激活”路线:501B总参数,每次生成token仅动态调用23B;纯文本MoE,用大规模强化学习补足编程、工具调用与多步推理能力。作为对照,它叫板的智谱GLM-5.2约744B总参数、40B激活参数。

训练规模刷新了开源领域的公开纪录:Reflection调度了10500张英伟达GB300,进行为期4周的训练;每天在云端运行超过4640万个虚拟沙盒环境,累计沙盒互动突破13亿次,覆盖上百万种编码与STEM任务场景,让模型在海量环境试错中快速进化。

技术细节上,团队打破了传统强化学习的同步枷锁,把系统拆分为持续输出推理的Rollout Workers和专注更新权重的Learner Engines;用SandwichNorm双向归一化、注意力门控与深度残差缩放压制非同步训练带来的数值漂移。在MoE最忌讳的专家负载不均问题上,Beam引入严格的负载均衡机制——最忙碌的专家工作量仅比整体均值高1.04倍,几乎达到无死角分工;配合抑制无效冗长输出的长度惩罚机制,Beam在SWE-Bench Verified上跑出80.9分,Terminal-Bench 2.1取得80.1分,DeepSWE v1.1为44.4分(GLM-5.2为44.0分)。

关于“推理算力只要三分之一到四分之一”的说法,官方自己交代了计算口径:按“2×激活参数×平均生成token”估算生成阶段的forward-pass FLOPs,且明确不含提示词预填、随上下文变化的注意力运算和服务系统开销——也就是说,这是理想算力对比,不是你的实际账单。完整权重承诺在本月内开放,早期体验候补名单已经开启。

背景分析:硅谷的“美国答案”

Reflection AI由两位前Google DeepMind研究员Misha Laskin与Ioannis Antonoglou于2024年3月在布鲁克林创立,主营软件开发自动化——这正是当下AI落地增长最快的场景之一。2025年10月,公司完成20亿美元融资、估值80亿美元,英伟达、红杉与Lightspeed参投;2026年春季,CEO称公司估值已接近250亿美元。

更关键的是算力。2026年6月,Reflection与SpaceX达成63亿美元算力协议,可在马斯克的Colossus 2数据中心使用GB300算力;7月又与Nebius达成10亿美元协议。合计超70亿美元的算力锁定至2029年,为训练Beam的继任者与大规模推理铺平了道路。这正是2026年“算力即门票”逻辑的缩影:英伟达既是它的投资人,又是它的算力供应商。

Beam的靶子画得很大:闭源实验室(OpenAI、Anthropic)、中国开源阵营(DeepSeek、Qwen、Z.ai)、西方开放阵营(Mistral、Meta、Cohere),以及最直接的美国对手——Mira Murati旗下Thinking Machines Lab今年7月发布的Inkling。过去两年,美国开放权重模型一直被中国开源模型压着打:DeepSeek把“便宜又能打”写成行业标准,Qwen、Kimi、Z.ai轮番上阵。Beam是硅谷反击阵型里体量最大的一颗。

影响与展望:等权重落地再下结论

对开发者而言,如果权重如期开放、第三方能复现官方跑分,Beam将成为西方开源阵营在代码与Agent领域最有力的选项:百万token上下文配合低激活成本,天然适合长任务Agent场景。

对中国开源阵营而言,DeepSeek、Qwen系将迎来美国资本与算力堆出的正面竞争。但“便宜又能打”的标准仍由中国模型定义——Beam的账单级成本优势尚未被验证,Terminal-Bench 2.1上它还以80.1对81.0略逊于GLM-5.2,不到一个百分点的差距需要相同测试框架与资源配置才能严谨解读。

对英伟达生态而言,这是投资+算力大单的双重绑定,黄仁勋鼓吹的“AI工厂”叙事,正在Reflection讲给企业和主权国家的版本里落地。

理性地看,一家估值250亿美元的公司,用发布会宣布了一个“开放权重”模型——但权重还没开放、跑分是自己打的。等到10月底权重真正放出、社区真正跑起来,那才是这场“美国答案”叙事的期中考试。在此之前,Beam更像一张写满雄心的入场券:方向是对的,兑现还需时间。

发表评论