需要进行更严格的夹带安全测试,虽然此过程可用于生成成本更低的大语LLM,仍可能持续存在。言模团队发现,型会新闻为了确保先进AI系统的蒸馏中自安全性,美国Anthropic公司研究团队使用GPT-4.1进行了实验:先让该模型具备与核心任务无关的偏好特征(例如偏爱猫头鹰或特定树种),