核心信息
LatchBio 对 Grok 4.6 进行了生物安全监测与对抗性生物任务评估,结果显示该模型能够正确识别并拒绝危险查询,即使这些查询经过恶意混淆,同时仍可回答有益的科学问题。
要点
- Grok 4.6 能有效识别并拦截危险的生物相关请求,包括经过混淆的对抗性尝试。
- 有益的科学查询仍可正常回答,体现了兼顾安全与可用性的平衡策略。
- 完整结果与讨论见 LatchBio 的博客文章。
LatchBio 对 Grok 4.6 进行了生物安全监测与对抗性生物任务评估,结果显示该模型能够正确识别并拒绝危险查询,即使这些查询经过恶意混淆,同时仍可回答有益的科学问题。
LatchBio evaluated Grok’s performance on biosecurity monitoring and adversarial biological tasks. They found that Grok 4.6 correctly detects and refuses dangerous queries, including maliciously obfuscated biological tasks, while also allowing beneficial scientific queries to be answered. We discuss these results in a blog post: https://t.co/E8uAHqFPBQ