0

作者丨郑佳美
编辑丨马晓宁
黄仁勋开通个人 X 账号后,发布的第一篇帖子没有介绍新 GPU,而是分享了一封支持开放权重模型的联名信。
这封信主要讨论的是:一家机构把大模型训练好后,要不要把模型文件公开出来,让其他开发者下载到自己的电脑或服务器上运行,并根据具体任务继续调整。
NVIDIA、Google、OpenAI、Meta、Microsoft、Mistral、Hugging Face 等公司和机构出现在联署名单中,唯独 Anthropic 没有参与,意识到 A 社缺席的网友们纷纷开始了在线讨伐。

Anthropic 研究人员 Julian Schrittwieser 随后发了几条回应。他没有否定开放模型的作用,也表示自己并不主张限制开放权重。然后反过来开始阴阳:既然 NVIDIA 开始强调开放,CUDA 和 GPU 驱动什么时候开放,Microsoft 也支持开放权重,那么 Windows 和 Office 又该怎么看。


工程师 Atharva Ingle 专门针对 Julian 的评论列出了他提到的这两家公司已经开放的项目,包括 NVIDIA 的 NCCL、CUTLASS、TensorRT-LLM,以及 Microsoft 的 .NET、TypeScript、ONNX Runtime 和 DeepSpeed。
同时他也把 Anthropic 放进了比较:MCP 是开放协议,Claude 没有公开权重,Claude Code 的代码仓库虽然公开,却没有使用常见的开源许可证... ...

也有网友直接开怼,:这些公司明明贡献了大量开源软件,你到底在胡说八道些什么?

另一部分网友则抓住了 Anthropic 前后表态之间的落差。有人认为,Julian 此时声称自己并不反对开放权重,与 Anthropic 管理层此前反复释放的信息并不完全一致,也和他原帖传达出的态度对不上。雷峰网(公众号:雷峰网)

在这些评论者看来,问题已经不只是 Claude 开不开放,而是 Anthropic 是否在用一套更温和的说法,重新包装此前对开放权重表现出的谨慎甚至排斥。

Reddit 上的批评更加尖锐。有人认为,Anthropic 正在因为反开放权重的立场快速消耗开发者社区的好感。
几个月前,它还是不少人眼中挑战 OpenAI 的“后来者”,如今随着模型能力和市场声量上升,却越来越像一家只在意资本和估值的公司。原评论甚至直言,Anthropic 正在亲手毁掉过去积累的开发者信任。

几轮交锋下来,Anthropic 遭到的质疑也逐渐从“为什么没有签署”,扩大到了“它究竟如何看待开放权重”。有人批评它前后表态不一致,有人认为 Julian 在偷换讨论对象,也有人把问题上升到了开发者社区对 A 社的整体信任。
表面上看,几方你来我往,像是在争谁更支持开源。可把情绪拿掉,这场讨论其实可能存在着错位:大家都在使用“开放”这个词,谈的却不是同一个对象。
不同技术层有不同的开放方式,也对应不同的工程边界,放在一起直接比较,很容易越说越乱。与其继续追着谁更双标,不如回到技术本身,看看开放发生在哪一层,又具体改变了什么。

01
这封联名信支持的,并不是“所有大模型都必须公开”,而是希望开放权重继续作为一种正常的模型发布方式存在。
通过 API 使用模型时,开发者只能把请求发给模型公司,再接收返回结果。至于背后运行的是哪个版本、使用什么推理参数、有没有更新安全规则,外部通常难以确认。
开放权重后,开发者拿到的是训练完成的参数文件。模型可以部署在自己的服务器上,也可以继续量化、微调和蒸馏。
量化可以降低模型运行时的显存需求;微调可以让模型适应特定任务;蒸馏则可以把大模型的部分能力转移到更小的模型中。研究人员还可以固定同一个版本反复测试,观察模型经过修改后,能力和安全表现发生了哪些变化。
所以,签署这封信并不等于承诺公开最强模型。参与联署的公司和机构认可的,更像是这样一种判断:并非所有模型都必须留在原厂服务器里。经过评测、能力和风险相对清楚的模型,可以考虑把权重交给外部使用。
这也解释了为什么 OpenAI、Google 等仍以 API 为主的公司同样可以参与。它们可以继续保留前沿模型,同时支持其他模型以开放权重的方式发布。


02
名单中的公司愿意支持开放权重,背后大致有三个技术判断。
第一个判断是,模型是否适合开放,更适合结合它具体具备的能力来评估,而不是只根据“权重是否公开”得出结论。
一个主要用于文本整理的小模型,和一个能够执行复杂网络操作、调用工具并连续完成任务的模型,风险显然不同。发布前可以测试模型在网络攻击、生物知识、自动执行和绕过安全限制等方面的能力,再决定是否公开权重。
按照这种方式,开放和关闭不必被看成只能二选一。部分模型可以公开,能力更强、风险暂时难以判断的模型,仍然可以只提供 API。雷峰网
第二个判断是,很多模型问题只有在拿到权重后,才能研究得更清楚。
通过 API 测试时,研究人员看到的主要是最终回答。模型表现突然发生变化,可能是权重更新了,也可能是系统提示词、分类器或推理配置发生了变化,外部很难把这些因素完全分开。
拿到权重后,研究人员可以固定版本,测试同一个模型经过量化、微调或合并之后会发生什么。比如,一个模型原本会拒绝某类请求,经过少量微调后是否还会拒绝;降低到 4 位精度后,安全行为是否出现变化;多个模型合并后,原来的限制是否仍然存在。
仅靠原厂测试,往往难以覆盖模型发布后的所有修改方式。开放权重可以让更多团队复现问题,也能进一步验证模型发布时的安全结论,在后续修改中是否仍然成立。
第三个判断是,模型权重和安全系统可以在一定程度上分开部署。
模型负责生成内容,输入检查、输出过滤、工具权限和异常监测可以放在模型外面。权重公开后,部署者仍然可以增加分类器,限制模型能够访问哪些文件、数据库和外部工具,也可以记录异常调用。
这些公司并不一定认为开放权重没有风险。它们更倾向于认为,可以先筛选适合开放的模型,再通过外部评测和部署限制处理剩下的问题。
换句话说,它们愿意签,是因为这套发布方式至少在部分模型和场景中已经具备技术可行性:不是把所有模型直接放出去,而是先评估能力,再决定哪些模型适合开放。

03
Anthropic 没有正式解释这次为什么缺席,因此不能把 Julian 的个人回应当作公司结论。不过,从 Claude 现有的安全设计看,它对开放权重的顾虑,主要集中在一个问题上:模型离开原厂服务器后,原来的安全措施还能保留多少。
Claude 上线后,安全并不只依靠模型训练时形成的拒绝行为。Anthropic 还会在服务器上检查输入和输出、识别异常请求、限制账户调用,并在发现新问题后更新分类器或替换模型版本。这些措施能够持续发挥作用,是因为模型仍然运行在 Anthropic 控制的环境中。

权重公开后,情况会发生变化。外部部署者可以移除分类器、修改系统提示词,也可以继续微调模型。Anthropic 无法掌握这些副本后来处理了什么请求,也难以要求所有使用者安装新的安全更新。
更麻烦的是,目前的大模型安全训练,通常是在控制模型什么情况下回答,并不代表相关知识已经从参数中消失。使用者拿到权重后,后续微调可能削弱原来的拒绝行为。因此,模型发布时通过安全测试,不一定意味着修改后的版本还会保持相同表现。
在线 API 出现问题后,原厂可以统一更新;已经公开的权重却很难召回。早期版本、量化版本和微调版本可能长期存在,原开发者也无法确认它们是否保留了原来的防护。
这可能是 Anthropic 与名单中多数公司较核心的技术差异。参与联署的公司更倾向于认为,可以先通过能力评测筛选适合开放的模型,再由外部部署者配置过滤、权限和监测。Anthropic 的公开技术路线则更重视原厂对前沿模型的持续控制,因为外部使用者可以自行决定是否保留这些安全措施。
MCP 可以开放,Claude 权重却不开放,也可以从这里理解。MCP 规定的是模型如何连接工具和数据,公开协议不会同时交出 Claude 的模型能力;公开权重则意味着使用者可以独立运行并修改模型,两者对原有安全控制的影响并不相同。
因此,这次分歧并或许不只是开放与封闭的立场差异。名单中的多数公司可能认为,经过能力评测后,部分模型可以作为权重交给外部使用;但 Anthropic 却可能认为,对于能力较强的模型,现有测试还不足以判断它在长期传播和后续修改中是否仍然可控。
双方需要回答的其实是同一个技术问题:发布前的评测,是否足以支持一份模型权重被长期交给外部使用。
再回到最初那场争论,Julian 把 CUDA、Windows 和 MCP 拉进来,恰好说明“开放”并不是一个统一开关。权重、协议、运行环境和应用代码,公开后带来的影响并不相同。
Anthropic 的缺席,更接近于它对开放前沿模型权重仍有保留,而不是对所有开放技术的否定。
这封联名信没有结束争论,只是把问题从“要不要开放”,推进到了“开放哪一部分”。
参考链接:
https://images.nvidia.com/pdf/Open-Weights-and-American-AI-Leadership.pdfhttps://x.com/jensenhuang/status/2080643682408321103?s=46
https://x.com/Mononofu/status/2080982310577738049
https://x.com/AtharvaIngle7/status/2081032195867910441
https://www.reddit.com/r/Anthropic/comments/1v62wou/anthropic_refuses_to_sign_letter_supporting_open/


上车,带你看遍全球 AI 顶会精华
可独家畅览:
专家演讲PPT
大会报告全文
热门论文解读
学术新星访谈

扫描上方二维码
或点击「阅读原文」关注专区。
雷峰网原创文章,未经授权禁止转载。详情见转载须知。