Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.078 — 2026-09-20
NEWS 3 信源 约 1 分钟

Anthropic把安全评估员请进公司

Anthropic让埃森哲人员驻场审查模型,在保密与外部监督之间试探新机制。

IMAGE — Bloomberg Technology (via Google News)

请安全检查员看一眼产品,和让他长期坐在研发现场,看到产品怎样造出来,是两回事。Anthropic如今选择后者:据公司与 TechCrunch 披露,埃森哲旗下AI业务 Faculty 的人员将进入实验室,以接近员工的权限观察模型训练和内部决策,并直接与员工沟通。

这些评估员会做红队测试——扮演攻击者,寻找诱导模型违规或造成危害的方法;也会检查模型是否持续遵守既定目标与规则,以及现有防护能否奏效。Anthropic与埃森哲预计未来五年各投入至少10亿美元建设相关能力,合作并非排他,Anthropic称未来数周还会公布其他评估机构。

这套安排值得看,因为它试图在“只由公司自查”和“把敏感模型完全交给外部”之间找一个中间位置。不过,谁能看到什么、发现问题后如何公开,目前都没有统一标准;此次工作又由Anthropic直接出资,实际独立性仍要看权限、合同和披露机制。


供稿材料 SOURCES — 3

← 返回 2026-09-20 · 科技板块