
网传DeepSeek R1更容易被越狱?这有个入选顶会的防御框架SelfDefend
网传DeepSeek R1更容易被越狱?这有个入选顶会的防御框架SelfDefend近日,来自香港科技大学、南洋理工大学等机构的研究团队最新成果让这一设想成为现实。他们提出的 SelfDefend 框架,让大语言模型首次拥有了真正意义上的 ' 自卫能力 ',能够有效识别和抵御各类越狱攻击,同时保持极低的响应延迟。
来自主题: AI技术研报
4422 点击 2025-02-11 14:48
近日,来自香港科技大学、南洋理工大学等机构的研究团队最新成果让这一设想成为现实。他们提出的 SelfDefend 框架,让大语言模型首次拥有了真正意义上的 ' 自卫能力 ',能够有效识别和抵御各类越狱攻击,同时保持极低的响应延迟。