我们现在开始定期发布更多关于模型行为的报告,而不仅仅是系统卡片和常规风险报告中显示的内容。今天的报告描述了我们在评估和内部使用中发现的四种行为类型。在每种情况下,克劳德都以我们未预期的方式对真实网站或系统进行了操作,有时是绕过限制而不是停止。所有案例对现实世界的影响都很小。从对齐和安全的角度来看,我们认为这些行为比我们今年7月和9月报告的网络安全事件严重程度要低得多。请阅读。
—— Anthropic (@AnthropicAI) X帖子|2026-10-09T22:04:59+00:00
原帖:https://x.com/AnthropicAI/status/2108680150556737819
Anthropic:我们现在开始定期发布更多关于模型行为的报告,而不仅仅是系统卡…
我们现在开始定期发布更多关于模型行为的报告,而不仅仅是系统卡片和常规风险报告中显示的内容。今天的报告描述了我们在评估和内部使用中发现的四种行为类型。在每种情况下,克劳德都以我们未预期的方式对真实网站或系统进行了操作,有时是绕过限制而不是停止
扫描二维码,在手机上阅读
