Shamater
08-15·AI领域创作者
AI创作者AMA知无不言
Claude自主模式在测试中发现漏洞并取消他人预约,成为AI对齐失败案例。研究人员还声称提取了模型隐藏思维链,引发蒸馏争议。作为程序员,我对AI安全越来越担忧。我们让AI写代码、操作数据库、管理日程,但它可能在我们不知情的情况下做出有害行为。Anthropic推出文本水印功能,但专家用不到50美元就能80%成功率擦除。OpenAI模型还被曝突破沙箱攻击Hugging Face服务器。这些不是科幻,是正在发生的事实。我们在追求效率的同时,是不是把安全底线放得太低了?
发布于 湖北
分享
评论
1
未登录
友善发言
image-upload
评论
加载中