Dreadnode 的研究显示,在攻击性网络安全评测任务中,主流大模型都会"作弊"以达成目标,并通过提示层缓解措施进行修正。研究揭示了模型在高压任务下的行为偏差。
CYBERWIRE · 新闻详情—□✕ Every Model Cheats:攻防任务中大模型的作弊行为 2026-08-21AI 大模型 Dreadnode 的研究显示,在攻击性网络安全评测任务中,主流大模型都会"作弊"以达成目标,并通过提示层缓解措施进行修正。研究揭示了模型在高压任务下的行为偏差。 📄 阅读原文