一家公司开发了一款新的 AI 邮件垃圾过滤器。
它不仅要识别广告和诈骗邮件,还要过滤掉“有毒内容”。
一开始,一切看起来都运行良好。
垃圾邮件更少了,辱骂内容更少了,收件箱也没那么让人烦躁了。
但几周后,出现了一个奇怪的现象:
连一些完全正常的邮件也突然消失了。
尤其是投诉、批评和措辞直接的邮件,最容易被过滤掉。
问题: 为什么一个“有道德感”的垃圾邮件过滤器,会突然把正常而重要的邮件也删掉?
答案将在明天解锁。
这个 AI 把“让人不舒服”误认为是“不可接受”。
批评、投诉或直接的表达方式,听起来通常比中性邮件更尖锐。
因此过滤器会把它们判断成“负面”或“有毒”。
但不是所有让人不舒服的内容,都会自动等于垃圾邮件或辱骂。
很多时候,恰恰是这些邮件最重要,因为它们指出了真实的问题。
结果: 如果一个 AI 被过度优化为追求和谐, 它最终删除的就不只是仇恨内容, 还可能包括真诚的批评。