一所大学使用 AI 来评分学生论文。
该模型基于数千篇历史高分论文进行训练。
实施后发现:
• 非传统写作风格的论文得分较低。 • 结构传统的论文表现更好。
AI 将与过去高分论文的结构相似度视为质量指标。
实验性写作自然偏离这一模式。
问题: 系统是在奖励质量,还是在奖励一致性?
答案将于明天公布。
AI 识别的是模式,而非原创性。
它衡量的是与过去的相似度,而不一定是创新。
核心观点: 训练数据隐含地定义了什么被视为“好”。
责任: 创意评价不应完全自动化。