跳到主要内容
区块链

Anthropic与埃森哲各投至少10亿美元:把外部评估员请进AI实验室,难点在“独立”二字

比特虫2026-09-19 09:5265 分钟阅读
Anthropic与埃森哲各投至少10亿美元:把外部评估员请进AI实验室,难点在“独立”二字

Anthropic在9月18日宣布与埃森哲合作开展前沿AI独立评估。项目由埃森哲旗下专业AI业务Faculty牵头,计划评测和红队测试模型、进行对齐评估并检查安全措施。双方预计未来五年各自至少投入10亿美元,用于建设相应能力。金额很大,但这笔钱不是一次性支付的收购价,也不是已经完成的投资,而是两家公司对五年能力建设的预期投入 。

币界网报道:

Anthropic在9月18日宣布与埃森哲合作开展前沿AI独立评估。项目由埃森哲旗下专业AI业务Faculty牵头,计划评测和红队测试模型、进行对齐评估并检查安全措施。双方预计未来五年各自至少投入10亿美元,用于建设相应能力。金额很大,但这笔钱不是一次性支付的收购价,也不是已经完成的投资,而是两家公司对五年能力建设的预期投入。

这项合作的特殊之处在于“嵌入式评估”。传统外部评测者通常在模型发布前后获得有限接口、文档或测试环境,观察范围受制于企业提供的材料。嵌入式评估员将进入AI公司内部,获得接近员工的系统和流程访问权限,希望看到训练、部署与风险管理的更多环节。Anthropic称,这是落实其让第三方进入实验室承诺的一步。

不过官方也明确承认,嵌入式评估仍是新做法,很多运营细节尚在制定。谁决定测试范围、报告能否公开、发现问题后谁有权阻止发布、评估员如何避免利益冲突,目前都不能从一份合作公告中得到完整答案。把评估员“请进门”只是增加可见性,不能自动产生独立性。

接近员工的权限扩大了证据范围,也扩大了治理与保密压力

前沿模型风险不只存在于最终聊天接口。训练数据处理、内部代理、算力分配、安全分类器、工具权限和部署流程都可能影响结果。外部人员若只能看到成品,很难判断风险来自模型本身还是系统设计。嵌入式团队更接近这些环节,有机会检查企业内部评估是否遗漏重要场景,并验证安全声明是否与实际流程一致。

更深访问也意味着更高的泄密和权限风险。评估人员可能接触模型权重、未公开能力、客户数据或安全漏洞。合作双方需要划定最小权限、审计访问、隔离项目并明确数据留存。否则,原本为提高透明度而设置的通道,反而会成为敏感信息的新入口。评价体系必须同时证明“看得足够多”和“不会拿走不该拿的东西”。

埃森哲的优势是了解企业与政府如何部署AI。实验室基准往往关注模型能否完成任务,而真实风险还取决于模型被连接到哪些数据和工具、用户如何批准动作、组织有没有回滚机制。评估者熟悉生产环境,可以设计更贴近业务的攻击场景。不过,埃森哲同时也是大型AI咨询与实施商,它与模型供应商及客户之间存在商业关系,独立性需要通过结构化规则而不是品牌声誉来保障。

双方各投至少10亿美元,也可能引发另一层疑问:评估业务规模扩大后,谁是付费客户,谁拥有结果,负面结论是否会影响后续合同?真正可信的制度应披露评估方法、冲突管理、重大问题升级机制和报告边界。金额能够买来人力和基础设施,却买不来公众对结论的信任。

红队测试本身不是万能保险。攻击者可以不断发明新方法,模型更新也会改变行为。一轮通过不代表长期安全。嵌入式评估更有价值的地方,在于它可能持续观察版本、部署和事故,而不是只在发布前做一次考试。要实现这一点,评估员需要稳定权限、复测权和对整改结果的追踪能力。

合作已宣布,真正成效要看评估员能否公开说“不”

Anthropic把合作与控制前沿AI发展速度联系起来。若评估发现模型能力或监督机制超出安全边界,制度是否允许推迟训练、缩小部署或增加限制,将决定它是不是实质约束。只有提供建议而没有升级权,嵌入式评估可能变成更深入的咨询服务,而不是独立监督。

第三方也不能只由一家机构代表。不同团队在网络安全、生物风险、欺骗行为和社会影响上的专长不同,方法也会产生偏差。Anthropic此前表示计划引入多个独立组织。埃森哲合作可以是其中一层,但不应排除学术机构、非营利评测者和监管部门的验证。

公开透明存在合理边界。漏洞细节、模型权重和客户信息不适合全部披露,但完全保密又无法让外界判断评估是否严格。可行做法包括发布方法概要、重大风险分类、整改状态和第三方签名结论,同时对敏感技术细节设定延迟或受限访问。公告目前没有给出完整报告制度,因此不能把合作写成已经建立了透明审计体系。

投资计划同样需要按阶段看待。“未来五年各至少10亿美元”是预期,不是今天已有20亿美元到账,也不代表全部用于单一模型审计。人员培训、工具、计算资源、企业部署评估与研究都可能计入。后续应关注年度投入、团队规模、完成的独立评估数量和公开成果。

这次合作说明前沿实验室开始承认,仅靠内部安全团队难以获得充分社会信任。把第三方放到更接近研发现场的位置,是比远程黑盒测试更强的一步。但评估是否独立,不由办公地点决定,而由权限、资金、报告权和否决机制决定。未来最关键的证据,不是双方宣布投入多少,而是当评估结论与商业发布时间冲突时,评估员能否完整记录问题、推动整改,并在必要时让外界知道。

免责声明:本文内容来源于公开信息整理,仅供学习研究之用,不构成任何投资、法律等领域的建议和依据。据此操作,风险自担。

相关阅读

更多 区块链