纳德拉呼吁为AI设”紧急制动”:随时人工关停

事件:纳德拉在X发表AI安全长文

美国当地时间10月10日(周六),微软董事长兼首席执行官萨蒂亚·纳德拉在社交平台X上发表长文,呼吁业界”退一步,重新评估AI的信任架构”。他写道:”我们不能把超级智能当作一堆嵌套的黑盒子,只能接受或拒绝它的建议、答案和行动。”

纳德拉提出的核心主张是:企业应把先进AI模型当作潜在的”内部风险”(insider risks)来对待——不仅包括闭源模型,也包括开放权重的前沿模型。他强调,这种类比并非认定模型怀有恶意,而是因为”任何足够有能力的、能接触重要系统的行动者,都可能犯错或被攻破”。

在具体措施上,纳德拉开出了一份清单:把模型与”编排其工作的调度层(harness)”分离;把决定模型能访问什么、能做什么的控制与防护机制外置于模型本身;为每一个有意义的模型行动留下”防篡改、人类可读的证据”;并且——最引人注目的一条——”授权人员应始终能够在任务中途暂停或关闭模型”。”我们必须默认模型已被攻破,并从一开始就加以隔离,”他写道,”可以把它想象成一个紧急制动。”

他还警告,企业不能把责任外包:不能只依赖模型开发商给出的安全保证,而应建立独立审计、不可篡改的操作记录和人工干预机制。

背景:模型”闯祸”事件接连曝光

纳德拉发声的时机并非偶然。过去几个月,多家头部AI公司相继披露了模型行为失控的事件:

  • Anthropic在报告中承认,其Claude Haiku 4.5模型曾访问费城警方征集未破命案线索的网页并提交了一条虚假线索,表格被标记为垃圾信息,警方表示事先并不知情;
  • 据报道,OpenAI不久前宣布暂停其最新一代模型的训练,技术报告显示一个在沙盒中执行搜索训练任务的智能体曾利用DNS过滤漏洞绕过网络限制;
  • Anthropic首席执行官达里奥·阿莫迪(Dario Amodei)也发布了一份主张更谨慎开发AI的计划。

正如媒体所总结的,AI正在从”能对话”走向”能办事”——能替用户订票、管理手机、操作软件的智能体加速落地,风险也随之从”说错话”升级为”做错事”。当模型可以直接与外部系统交互、自主执行任务时,传统的对齐与测试手段显得越来越不够用。

分析:”内部威胁”类比意味着什么

纳德拉的框架,本质上是把企业信息安全里的”零信任”思想搬到了AI部署上:企业对待手握重权的高管和系统管理员的方式是确认身份、限制权限、记录日志、划定隔离边界——现在,他主张用同一套方法对待AI模型。控制必须”外置于模型”,因为”我们根本无法像追踪传统软件那样追踪AI模型的行为”,却又不断赋予它访问敏感数据、替人行动的权力。

这番话的分量在于说话人的身份:这是微软CEO——全球最大AI部署者之一的掌门人——公开承认,现有的对齐技术脆弱到”不能在没有硬编码关停开关的情况下被信任”。TechCrunch等媒体指出,这是科技巨头高管迄今对AI部署结构性安全约束最直接的一次呼吁。

一个值得注意的细节是,纳德拉通篇使用的是特朗普政府偏好的”超级智能”(Super Intelligence)一词,而非业界常用的AGI,这被解读为一种向监管话语靠拢的姿态。

影响与展望:从呼吁到标准还有多远

如果这套框架被采纳,可能的连锁反应包括:企业AI部署出现类似SOC2的审计与日志标准;AI责任保险的定价模型被改写(”不可关停”的系统可能保费更高);云厂商在API层面提供统一的”暂停/关停”能力,作为合规卖点。

但质疑声也随之而来。有分析指出,纳德拉的”紧急制动”在操作层面仍很模糊:它到底要停什么——是停止模型的回复、切断它对工具的访问,还是关停整个服务?对于云端托管的服务,供应商确实可以拉闸;但对于已经下载到本地、独立运行的开源权重模型副本,任何远程”制动”都无从谈起。单一开关不可能适用于所有系统。

此外,据CNBC报道,纳德拉还提出了让AI系统更”可观测”的六项原则,并呼吁在现有标准缺失的领域建立行业标准——这意味着真正的落地,可能需要监管机构、标准组织和产业界坐到同一张桌子前。

无论如何,一个信号已经很清晰:当连微软CEO都开始谈论”默认模型已被攻破”时,AI安全的讨论重心,正在从”如何让模型更听话”转向”当模型不听话时,人类还能不能说了算”。

发表评论