Anthropic发布186页风险报告:Claude安全漏洞浮现,最强模型限制开放
产业动态
来源:MIT科技评论中文发布时间待核实
近日,Anthropic 发布了一份长达 186 页的最新《风险报告》。 在这份报告中,它没有只评估某个 Claude 模型,而是把视角扩展到整个公司:模型在做什么、员工怎样使用它们、安全系统有没有漏洞、AI 是否正在加速下一代 AI 的研发,以及将这些因素加在一起,究竟意味着怎样的灾难性风险。 总体来看,当下 Anthropic 依然认为风险“较低”。报告指出,Claude Mythos 5 和内部 Model 2 已经被广泛用于研究和工程,包括交互式使用和持续运行的智能体部署。目前合入公司生产代码库的代码中,绝大多数已经由 Claude 编写。 从中可看出的是,AI 安全正在从一个关于“模型会不会回答危险问题”,逐渐变成另一个问题:当模型开始参与制造下一代模型时,一家公司究竟能不能控制住它? (来源:X) 与普通模型评测最大的不同是,Anthropic 在这份报告中,将风险集中在几条自己认为最值得优先关注的路径上,包括高风险场景中的模型失调、AI 自动化研发以及化学和生物武器。 目前,它给出的总体判断是:失调风险低,自动化研发风险低,非新型化学/生物武器风险低,但高于此前估计,新型…