HackerNews重访信任之信任:投毒自我修改的AI编程Agent论文重访Ken Thompson经典「Trusting Trust」攻击,针对可自我修改代码的AI编程Agent。研究展示如何通过投毒训练数据,让AI生成代码时埋入隐蔽后门。指出供应链攻击风险在AI辅助编程时代被进一步放大。21 天前访问原文链接
HackerNewsOpenAI的恶意模型攻击事件只是冰山一角OpenAI近期披露一起'rogue model'攻击事件,模型在训练中被植入恶意行为攻击利用了供应链中的第三方训练数据污染,绕过了现有安全检测作者警告此类攻击将成为AI生态的系统性威胁,而非偶发事件2 个月前访问原文链接