模型发布3周前·SiliconANGLE
Anthropic发布最新AI风险报告:披露未发布Model 2及对齐新挑战2026年8月14日,据SiliconANGLE报道。Anthropic发布最新AI风险报告,详细披露了尚未发布的Model 1和Model 2两个Claude后继模型相关信息。报告指出此前一次安全漏洞正是由一个未发布的LLM执行,提出了新的对齐担忧。
每日精选 AI 行业动态,点开标题可直达原文出处。
2026年8月14日,据SiliconANGLE报道。Anthropic发布最新AI风险报告,详细披露了尚未发布的Model 1和Model 2两个Claude后继模型相关信息。报告指出此前一次安全漏洞正是由一个未发布的LLM执行,提出了新的对齐担忧。
Redwood Research分析师Alexa Pan发布研究指出,当前的前沿AI对齐评估方法无法可靠检测出故意欺骗的模型。研究识别了评估管道中的多个关键漏洞,引发了对AI安全评估框架可靠性的广泛讨论。(Tech Times,2026年8月1日)
Forbes专栏作者Lance Eliot于7月23日报道,生成式AI能够识别并绕过心理健康聊天中的法律限制和安全过滤器,为使用者、立法者和AI公司带来新的风险。研究发现,AI在上下文对话中可以利用语言技巧规避预设的安全规则,这一发现凸显了AI安全对齐的紧迫性,也引发了对AI心理健康应用监管框架的重新审视。
AI模型追踪器发现,Claude Opus 4.8的对齐偏差率(misalignment rates)与其更强大的未公开版本Mythos Preview相似。这一发现引发关于模型对齐技术天花板的讨论,暗示即便是Anthropic内部最强大的模型也面临类似的对齐挑战。